InicioHerramientasGenerador de robots.txt
Generador y probador de robots.txt con rastreadores de IA
Crea un robots.txt a partir de una plantilla, bloquea las secciones privadas, decide qué rastreadores de IA pueden acceder a tu sitio y prueba cualquier URL: si está permitida para Googlebot, Bingbot o GPTBot, y qué grupo y qué regla lo deciden.
—
Sin Crawl-delay ni Host. Google no admite Crawl-delay, y Host era una directiva exclusiva de Yandex retirada en 2018. El generador no las añade.
—
Reglas del grupo aplicado
| Línea | Regla | Longitud | Coincidencia |
|---|
Esta URL para distintos rastreadores
| Rastreador | Grupo | Acceso |
|---|
Revisión del archivo
Todo se calcula en tu navegador: nada de lo que escribes se envía a ningún sitio.
Cómo usarla
- Elige una plantilla«SaaS» bloquea la aplicación y la API; «Tienda online», el carrito, los filtros y la ordenación. Añade tus propias rutas y grupos separados para Googlebot o Bingbot.
- Decide sobre los rastreadores de IALos bots se agrupan por finalidad: entrenamiento de modelos, búsqueda con citas y peticiones de usuarios. Puedes bloquear el entrenamiento y mantener la búsqueda.
- Prueba las URL«Probar este archivo» lleva el resultado a la pestaña «Probar URL», que muestra el grupo y la regla que deciden el destino de una URL para cada rastreador.
- Publica el archivoCopia el texto y colócalo en la raíz del dominio: https://example.com/robots.txt. Cada subdominio y cada protocolo tienen su propio archivo.
Sintaxis de robots.txt: grupos, reglas y prioridad
robots.txt es un archivo de texto en la raíz del sitio que indica a los rastreadores de los buscadores qué URL pueden rastrear. Desde 2022 las reglas de lectura están estandarizadas en el RFC 9309; Google y Bing documentan los mismos principios básicos y algunas extensiones propias.
El archivo se compone de grupos. Un grupo empieza con una o varias líneas User-agent seguidas de reglas Disallow y Allow. Las líneas Sitemap no pertenecen a ningún grupo y pueden ir en cualquier parte.
Cómo elige grupo un rastreador
Un rastreador busca el grupo con su token, sin distinguir mayúsculas, y sigue solo ese grupo. Si no existe, usa el grupo *; si tampoco está, todo está permitido. Los grupos con el mismo token se combinan. De ahí un error habitual: crear un grupo User-agent: Googlebot aparte y olvidar repetir en él las reglas de *.
Los buscadores documentan grupos de respaldo: Googlebot-Image y Googlebot-News usan las reglas de Googlebot si no tienen las suyas.
Cómo se elige la regla
El valor de una regla se compara con el principio de la ruta, incluida la query string. * equivale a cualquier secuencia de caracteres, y $ al final marca el final de la URL. Si coinciden varias reglas, gana la más larga; en caso de empate, gana Allow. El orden de las líneas no importa.
Es la tabla de prioridades de la documentación de Google; la herramienta la comprueba en tests automáticos. Un Disallow: vacío no bloquea nada. Las rutas se comparan normalizadas: los caracteres no ASCII se codifican en UTF-8 con porcentajes, así que /categoría/ y /categor%C3%ADa/ son lo mismo. Las rutas distinguen mayúsculas: /Admin/ y /admin/ son reglas distintas.
robots.txt para Google y Bing: qué cambia
En los mercados hispanohablantes Google concentra la gran mayoría de las búsquedas y Bing es el segundo; no hay un buscador local con rastreador propio que deba tenerse en cuenta. El núcleo es común: grupos, Allow y Disallow, los comodines * y $, prioridad de la coincidencia más larga. Las diferencias están en las extensiones.
- Crawl-delay. Google lo ignora. Bing lo respeta, pero el control de rastreo de Bing Webmaster Tools es mejor sitio para regular la frecuencia.
- Grupos de respaldo. Googlebot-Image, -Video y -News recurren al grupo de Googlebot si no tienen uno propio.
- Tamaño. Google procesa los primeros 500 KiB del archivo e ignora el resto.
- Host y Clean-param. Son directivas de Yandex. Google y Bing las ignoran; usa redirecciones 301 para el host principal y
rel="canonical"para los parámetros de URL. - Noindex. Google dejó de respetar
Noindex:en robots.txt en 2019. Usa la metaetiqueta robots o la cabeceraX-Robots-Tag.
Para ver cómo lee un buscador tu archivo publicado, usa el informe de robots.txt de Google Search Console o el probador de robots.txt de Bing Webmaster Tools. Esta herramienta es útil antes de publicar: funciona con cualquier texto, no solo con el archivo de tu sitio.
Cómo bloquear los rastreadores de IA, y si conviene
Las empresas de IA rastrean la web con finalidades distintas, y las grandes usan un token para cada una. Decide por finalidad en lugar de «bloquearlos todos».
| Token | Empresa | Finalidad |
|---|---|---|
| GPTBot | OpenAI | entrenamiento de modelos |
| OAI-SearchBot | OpenAI | búsqueda de ChatGPT |
| ChatGPT-User | OpenAI | petición de un usuario |
| ClaudeBot | Anthropic | entrenamiento de modelos |
| Claude-SearchBot | Anthropic | respuestas de búsqueda |
| Claude-User | Anthropic | petición de un usuario |
| PerplexityBot | Perplexity | búsqueda y citas |
| Perplexity-User | Perplexity | petición de un usuario |
| Google-Extended | token: entrenamiento y fundamentación de Gemini | |
| Applebot-Extended | Apple | token: entrenamiento de modelos de Apple |
| CCBot | Common Crawl | archivo abierto de la web |
| meta-externalagent | Meta | entrenamiento y productos |
| Amazonbot | Amazon | servicios de Amazon e IA |
| Bytespider | ByteDance | recogida de datos |
Tres grupos, tres decisiones
- Entrenamiento de modelos (GPTBot, ClaudeBot, CCBot y otros). Bloquearlos deja las páginas nuevas fuera de futuros conjuntos de entrenamiento. No traen tráfico, así que son los que más se bloquean, sobre todo en contenido de pago y original.
- Búsqueda y respuestas con enlaces (OAI-SearchBot, Claude-SearchBot, PerplexityBot). Estos bots traen visitas: tu sitio se cita con un enlace. Bloquearlos es renunciar a un canal nuevo. Los sitios SaaS y los medios suelen dejarlos abiertos.
- Peticiones de usuarios (ChatGPT-User, Claude-User, Perplexity-User). La página se abre porque una persona lo pidió expresamente. Se parece más a un navegador que a un rastreador; algunas empresas indican que estas peticiones pueden no seguir robots.txt.
Google-Extended y Applebot-Extended no son rastreadores. Las páginas las sigue rastreando el Googlebot o el Applebot habitual; el token solo prohíbe usarlas para entrenar modelos. Bloquear Google-Extended no afecta al posicionamiento en la Búsqueda de Google. Bloquear Googlebot para no aparecer en las respuestas de IA de Google te sacaría también de la búsqueda.
Y sobre todo: robots.txt es un acuerdo, no una protección. Las empresas serias lo respetan, pero no puedes comprobarlo desde fuera, y algunos bots ignoran las reglas. Si un contenido no debe servirse, necesitas autenticación o restricciones en el servidor o la CDN.
Errores habituales en robots.txt
- Bloquear CSS y JavaScript. Reglas como
Disallow: /*.js$oDisallow: /assets/impiden a los buscadores renderizar la página, que puede parecer vacía o no apta para móviles. - Ocultar páginas con robots.txt en lugar de noindex. Bloquear el rastreo no saca una URL del índice: Google puede mostrarla sin descripción si otras páginas enlazan a ella. Para sacar una página de los resultados, permite el rastreo y añade
<meta name="robots" content="noindex">o una cabeceraX-Robots-Tag. - Tratar robots.txt como seguridad. El archivo es público. Una línea como
Disallow: /panel-admin-secreto/anuncia la ruta a cualquiera que lo lea. Protege las zonas privadas con login; un/admin/genérico en robots.txt basta, o nada. - Un grupo propio sin las reglas comunes. Añades
User-agent: Googlebotpara una excepción y Googlebot deja de ver las reglas de*. - Reglas antes de User-agent. Las líneas
Disallowal principio del archivo, antes del primer grupo, se ignoran. - Un Sitemap relativo. Usa una URL completa:
Sitemap: https://example.com/sitemap.xml. - Un
Disallow: /olvidado del entorno de pruebas. El staging estaba bloqueado entero, el archivo pasó a producción y el sitio desaparece de los resultados. Revisa robots.txt después de cada despliegue. - Un archivo para todos los subdominios. robots.txt solo se aplica a su propio host y protocolo:
app.example.comyexample.comtienen archivos distintos.
Una configuración típica de SaaS: el sitio de marketing abierto, la zona /app/ bloqueada al rastreo y protegida con login, y las páginas de registro y acceso abiertas. Si el producto vive en un subdominio, tiene su propio robots.txt.
Fuentes
- RFC 9309. Robots Exclusion Protocol. IETF, 2022 — rfc-editor.org/rfc/rfc9309.
- Google Search Central. Cómo interpreta Google la especificación de robots.txt — developers.google.com/search/docs/crawling-indexing/robots/robots_txt.
- Google Search Central. Rastreadores y buscadores de Google (user agents) — developers.google.com/search/docs/crawling-indexing/overview-google-crawlers.
- Google Search Central Blog. A note on unsupported rules in robots.txt, 2019.
- Bing Webmaster Guidelines y ayuda de Bing Webmaster Tools: robots.txt y control de rastreo — bing.com/webmasters.
- OpenAI. Overview of OpenAI Crawlers — platform.openai.com/docs/bots.
- Anthropic. Does Anthropic crawl data from the web, and how can site owners block the crawler? — support.claude.com.
- Perplexity. Perplexity Crawlers — docs.perplexity.ai.
- Apple. About Applebot — support.apple.com/119829.
- Common Crawl. CCBot — commoncrawl.org/ccbot.
Preguntas frecuentes
¿Cómo creo un archivo robots.txt?
Elige una plantilla en el generador (sitio abierto, secciones privadas, SaaS o tienda online), ajusta las rutas, añade tu sitemap y, si quieres, bloquea los rastreadores de IA. Copia el resultado y guárdalo como robots.txt en la raíz de tu sitio, para que se abra en https://tu-dominio/robots.txt.
¿Cómo compruebo si robots.txt bloquea una página?
Abre la pestaña «Probar URL», pega el contenido del archivo y la URL de la página y elige un rastreador. La herramienta muestra si la URL está permitida, qué grupo se aplicó y qué regla decidió, además del resultado para Googlebot, Bingbot y los rastreadores de IA.
¿Cómo bloqueo los rastreadores de IA?
Añade grupos con sus tokens y Disallow: /, por ejemplo User-agent: GPTBot y User-agent: ClaudeBot. Sepáralos por finalidad: los bots de entrenamiento no traen tráfico, mientras que los de búsqueda, como OAI-SearchBot y PerplexityBot, envían visitas con enlaces en sus respuestas. Recuerda que robots.txt se cumple de forma voluntaria.
¿Bloquear Google-Extended saca mi sitio de Google?
No. Google-Extended es un token de control, no un rastreador: prohíbe usar las páginas para entrenar y fundamentar los modelos Gemini, pero no afecta al rastreo de Googlebot ni a la Búsqueda de Google.
¿Necesito Crawl-delay o Host?
Normalmente no. Google ignora Crawl-delay, y Host es una directiva obsoleta de Yandex. Bing respeta Crawl-delay, pero el control de rastreo de Bing Webmaster Tools es mejor opción.
¿Disallow elimina una página de los resultados de búsqueda?
No de forma fiable. Disallow bloquea el rastreo, pero Google puede indexar la URL sin su contenido si otras páginas enlazan a ella. Para sacar una página de los resultados, deja que se rastree y añade una metaetiqueta robots con noindex.
¿Qué gana: Allow o Disallow?
La regla con el patrón de ruta más largo, sin importar el orden de las líneas. Si las longitudes son iguales, gana Allow. Así funcionan Google y el RFC 9309.
¿Dónde debe ir robots.txt?
En la raíz de cada host: https://example.com/robots.txt. Un archivo en una subcarpeta se ignora, y cada subdominio y cada protocolo necesitan su propio archivo.
Más en SEO
- Vista previa del snippet
¿Cómo se verán el título y la descripción en Google y se cortarán?
- Generador de Open Graph
¿Qué etiquetas Open Graph necesita la página y cómo se verá la vista previa del enlace?
- Analizador de legibilidad
¿Qué tan difícil es leer este texto y qué frases son demasiado largas?
- Generador de hreflang
¿Qué etiquetas hreflang conectan las versiones de idioma de una página?
- Generador de UTM
¿Cómo crear enlaces UTM coherentes para cada campaña y canal?
- Generador de QR con UTM
¿Qué stand, folleto o póster trajo visitas, y cómo etiquetar un código QR para cada uno?