Clew

InicioHerramientasGenerador de robots.txt

Generador y probador de robots.txt con rastreadores de IA

Crea un robots.txt a partir de una plantilla, bloquea las secciones privadas, decide qué rastreadores de IA pueden acceder a tu sitio y prueba cualquier URL: si está permitida para Googlebot, Bingbot o GPTBot, y qué grupo y qué regla lo deciden.

● Gratis, sin registroActualizado:

Plantilla
Una plantilla sustituye los grupos; después edita a mano.

Un rastreador sigue un solo grupo: el suyo o, si no existe, el *. Por eso un grupo de Googlebot o Bingbot tiene que repetir las reglas comunes.

Rastreadores de IA: bloquear acceso

Entrenamiento de modelos

Búsqueda y respuestas con enlaces

Peticiones de usuarios

robots.txt es una petición, no una cerradura. Las empresas serias lo respetan, pero algunos bots lo ignoran. Solo los controles del servidor (autenticación o bloqueo por IP y user agent) restringen el acceso de verdad.

URL completas de los sitemaps, una por línea.

—

 

    Sin Crawl-delay ni Host. Google no admite Crawl-delay, y Host era una directiva exclusiva de Yandex retirada en 2018. El generador no las añade.

    Todo se calcula en tu navegador: nada de lo que escribes se envía a ningún sitio.

    Cómo usarla

    1. Elige una plantilla«SaaS» bloquea la aplicación y la API; «Tienda online», el carrito, los filtros y la ordenación. Añade tus propias rutas y grupos separados para Googlebot o Bingbot.
    2. Decide sobre los rastreadores de IALos bots se agrupan por finalidad: entrenamiento de modelos, búsqueda con citas y peticiones de usuarios. Puedes bloquear el entrenamiento y mantener la búsqueda.
    3. Prueba las URL«Probar este archivo» lleva el resultado a la pestaña «Probar URL», que muestra el grupo y la regla que deciden el destino de una URL para cada rastreador.
    4. Publica el archivoCopia el texto y colócalo en la raíz del dominio: https://example.com/robots.txt. Cada subdominio y cada protocolo tienen su propio archivo.

    Sintaxis de robots.txt: grupos, reglas y prioridad

    robots.txt es un archivo de texto en la raíz del sitio que indica a los rastreadores de los buscadores qué URL pueden rastrear. Desde 2022 las reglas de lectura están estandarizadas en el RFC 9309; Google y Bing documentan los mismos principios básicos y algunas extensiones propias.

    El archivo se compone de grupos. Un grupo empieza con una o varias líneas User-agent seguidas de reglas Disallow y Allow. Las líneas Sitemap no pertenecen a ningún grupo y pueden ir en cualquier parte.

    User-agent: * # grupo para todos los rastreadores Disallow: /app/ # bloquea todo lo que empieza por /app/ Allow: /app/registro # excepto la página de registro User-agent: GPTBot # dos líneas User-agent: User-agent: CCBot # un grupo compartido Disallow: / Sitemap: https://example.com/sitemap.xml

    Cómo elige grupo un rastreador

    Un rastreador busca el grupo con su token, sin distinguir mayúsculas, y sigue solo ese grupo. Si no existe, usa el grupo *; si tampoco está, todo está permitido. Los grupos con el mismo token se combinan. De ahí un error habitual: crear un grupo User-agent: Googlebot aparte y olvidar repetir en él las reglas de *.

    Los buscadores documentan grupos de respaldo: Googlebot-Image y Googlebot-News usan las reglas de Googlebot si no tienen las suyas.

    Cómo se elige la regla

    El valor de una regla se compara con el principio de la ruta, incluida la query string. * equivale a cualquier secuencia de caracteres, y $ al final marca el final de la URL. Si coinciden varias reglas, gana la más larga; en caso de empate, gana Allow. El orden de las líneas no importa.

    Allow: /p + Disallow: / → /page permitido (2 caracteres ganan a 1) Allow: /folder + Disallow: /folder → /folder/page permitido (misma longitud, gana Allow) Allow: /page + Disallow: /*.htm → /page.htm bloqueado (6 caracteres ganan a 5) Allow: /$ + Disallow: / → / permitido; /page.htm bloqueado

    Es la tabla de prioridades de la documentación de Google; la herramienta la comprueba en tests automáticos. Un Disallow: vacío no bloquea nada. Las rutas se comparan normalizadas: los caracteres no ASCII se codifican en UTF-8 con porcentajes, así que /categoría/ y /categor%C3%ADa/ son lo mismo. Las rutas distinguen mayúsculas: /Admin/ y /admin/ son reglas distintas.

    robots.txt para Google y Bing: qué cambia

    En los mercados hispanohablantes Google concentra la gran mayoría de las búsquedas y Bing es el segundo; no hay un buscador local con rastreador propio que deba tenerse en cuenta. El núcleo es común: grupos, Allow y Disallow, los comodines * y $, prioridad de la coincidencia más larga. Las diferencias están en las extensiones.

    • Crawl-delay. Google lo ignora. Bing lo respeta, pero el control de rastreo de Bing Webmaster Tools es mejor sitio para regular la frecuencia.
    • Grupos de respaldo. Googlebot-Image, -Video y -News recurren al grupo de Googlebot si no tienen uno propio.
    • Tamaño. Google procesa los primeros 500 KiB del archivo e ignora el resto.
    • Host y Clean-param. Son directivas de Yandex. Google y Bing las ignoran; usa redirecciones 301 para el host principal y rel="canonical" para los parámetros de URL.
    • Noindex. Google dejó de respetar Noindex: en robots.txt en 2019. Usa la metaetiqueta robots o la cabecera X-Robots-Tag.

    Para ver cómo lee un buscador tu archivo publicado, usa el informe de robots.txt de Google Search Console o el probador de robots.txt de Bing Webmaster Tools. Esta herramienta es útil antes de publicar: funciona con cualquier texto, no solo con el archivo de tu sitio.

    Cómo bloquear los rastreadores de IA, y si conviene

    Las empresas de IA rastrean la web con finalidades distintas, y las grandes usan un token para cada una. Decide por finalidad en lugar de «bloquearlos todos».

    Rastreadores de IA por finalidad
    TokenEmpresaFinalidad
    GPTBotOpenAIentrenamiento de modelos
    OAI-SearchBotOpenAIbúsqueda de ChatGPT
    ChatGPT-UserOpenAIpetición de un usuario
    ClaudeBotAnthropicentrenamiento de modelos
    Claude-SearchBotAnthropicrespuestas de búsqueda
    Claude-UserAnthropicpetición de un usuario
    PerplexityBotPerplexitybúsqueda y citas
    Perplexity-UserPerplexitypetición de un usuario
    Google-ExtendedGoogletoken: entrenamiento y fundamentación de Gemini
    Applebot-ExtendedAppletoken: entrenamiento de modelos de Apple
    CCBotCommon Crawlarchivo abierto de la web
    meta-externalagentMetaentrenamiento y productos
    AmazonbotAmazonservicios de Amazon e IA
    BytespiderByteDancerecogida de datos

    Tres grupos, tres decisiones

    • Entrenamiento de modelos (GPTBot, ClaudeBot, CCBot y otros). Bloquearlos deja las páginas nuevas fuera de futuros conjuntos de entrenamiento. No traen tráfico, así que son los que más se bloquean, sobre todo en contenido de pago y original.
    • Búsqueda y respuestas con enlaces (OAI-SearchBot, Claude-SearchBot, PerplexityBot). Estos bots traen visitas: tu sitio se cita con un enlace. Bloquearlos es renunciar a un canal nuevo. Los sitios SaaS y los medios suelen dejarlos abiertos.
    • Peticiones de usuarios (ChatGPT-User, Claude-User, Perplexity-User). La página se abre porque una persona lo pidió expresamente. Se parece más a un navegador que a un rastreador; algunas empresas indican que estas peticiones pueden no seguir robots.txt.

    Google-Extended y Applebot-Extended no son rastreadores. Las páginas las sigue rastreando el Googlebot o el Applebot habitual; el token solo prohíbe usarlas para entrenar modelos. Bloquear Google-Extended no afecta al posicionamiento en la Búsqueda de Google. Bloquear Googlebot para no aparecer en las respuestas de IA de Google te sacaría también de la búsqueda.

    Y sobre todo: robots.txt es un acuerdo, no una protección. Las empresas serias lo respetan, pero no puedes comprobarlo desde fuera, y algunos bots ignoran las reglas. Si un contenido no debe servirse, necesitas autenticación o restricciones en el servidor o la CDN.

    Errores habituales en robots.txt

    • Bloquear CSS y JavaScript. Reglas como Disallow: /*.js$ o Disallow: /assets/ impiden a los buscadores renderizar la página, que puede parecer vacía o no apta para móviles.
    • Ocultar páginas con robots.txt en lugar de noindex. Bloquear el rastreo no saca una URL del índice: Google puede mostrarla sin descripción si otras páginas enlazan a ella. Para sacar una página de los resultados, permite el rastreo y añade <meta name="robots" content="noindex"> o una cabecera X-Robots-Tag.
    • Tratar robots.txt como seguridad. El archivo es público. Una línea como Disallow: /panel-admin-secreto/ anuncia la ruta a cualquiera que lo lea. Protege las zonas privadas con login; un /admin/ genérico en robots.txt basta, o nada.
    • Un grupo propio sin las reglas comunes. Añades User-agent: Googlebot para una excepción y Googlebot deja de ver las reglas de *.
    • Reglas antes de User-agent. Las líneas Disallow al principio del archivo, antes del primer grupo, se ignoran.
    • Un Sitemap relativo. Usa una URL completa: Sitemap: https://example.com/sitemap.xml.
    • Un Disallow: / olvidado del entorno de pruebas. El staging estaba bloqueado entero, el archivo pasó a producción y el sitio desaparece de los resultados. Revisa robots.txt después de cada despliegue.
    • Un archivo para todos los subdominios. robots.txt solo se aplica a su propio host y protocolo: app.example.com y example.com tienen archivos distintos.

    Una configuración típica de SaaS: el sitio de marketing abierto, la zona /app/ bloqueada al rastreo y protegida con login, y las páginas de registro y acceso abiertas. Si el producto vive en un subdominio, tiene su propio robots.txt.

    Fuentes

    1. RFC 9309. Robots Exclusion Protocol. IETF, 2022 — rfc-editor.org/rfc/rfc9309.
    2. Google Search Central. Cómo interpreta Google la especificación de robots.txt — developers.google.com/search/docs/crawling-indexing/robots/robots_txt.
    3. Google Search Central. Rastreadores y buscadores de Google (user agents) — developers.google.com/search/docs/crawling-indexing/overview-google-crawlers.
    4. Google Search Central Blog. A note on unsupported rules in robots.txt, 2019.
    5. Bing Webmaster Guidelines y ayuda de Bing Webmaster Tools: robots.txt y control de rastreo — bing.com/webmasters.
    6. OpenAI. Overview of OpenAI Crawlers — platform.openai.com/docs/bots.
    7. Anthropic. Does Anthropic crawl data from the web, and how can site owners block the crawler? — support.claude.com.
    8. Perplexity. Perplexity Crawlers — docs.perplexity.ai.
    9. Apple. About Applebot — support.apple.com/119829.
    10. Common Crawl. CCBot — commoncrawl.org/ccbot.

    Preguntas frecuentes

    ¿Cómo creo un archivo robots.txt?

    Elige una plantilla en el generador (sitio abierto, secciones privadas, SaaS o tienda online), ajusta las rutas, añade tu sitemap y, si quieres, bloquea los rastreadores de IA. Copia el resultado y guárdalo como robots.txt en la raíz de tu sitio, para que se abra en https://tu-dominio/robots.txt.

    ¿Cómo compruebo si robots.txt bloquea una página?

    Abre la pestaña «Probar URL», pega el contenido del archivo y la URL de la página y elige un rastreador. La herramienta muestra si la URL está permitida, qué grupo se aplicó y qué regla decidió, además del resultado para Googlebot, Bingbot y los rastreadores de IA.

    ¿Cómo bloqueo los rastreadores de IA?

    Añade grupos con sus tokens y Disallow: /, por ejemplo User-agent: GPTBot y User-agent: ClaudeBot. Sepáralos por finalidad: los bots de entrenamiento no traen tráfico, mientras que los de búsqueda, como OAI-SearchBot y PerplexityBot, envían visitas con enlaces en sus respuestas. Recuerda que robots.txt se cumple de forma voluntaria.

    ¿Bloquear Google-Extended saca mi sitio de Google?

    No. Google-Extended es un token de control, no un rastreador: prohíbe usar las páginas para entrenar y fundamentar los modelos Gemini, pero no afecta al rastreo de Googlebot ni a la Búsqueda de Google.

    ¿Necesito Crawl-delay o Host?

    Normalmente no. Google ignora Crawl-delay, y Host es una directiva obsoleta de Yandex. Bing respeta Crawl-delay, pero el control de rastreo de Bing Webmaster Tools es mejor opción.

    ¿Disallow elimina una página de los resultados de búsqueda?

    No de forma fiable. Disallow bloquea el rastreo, pero Google puede indexar la URL sin su contenido si otras páginas enlazan a ella. Para sacar una página de los resultados, deja que se rastree y añade una metaetiqueta robots con noindex.

    ¿Qué gana: Allow o Disallow?

    La regla con el patrón de ruta más largo, sin importar el orden de las líneas. Si las longitudes son iguales, gana Allow. Así funcionan Google y el RFC 9309.

    ¿Dónde debe ir robots.txt?

    En la raíz de cada host: https://example.com/robots.txt. Un archivo en una subcarpeta se ignora, y cada subdominio y cada protocolo necesitan su propio archivo.

    Más en SEO

    Tours, tooltips y checklists cuyo efecto se ve en las métricas.

    Prueba Clew gratisCómo funcionaPlan gratuito para siempre · sin tarjeta

    Tours de producto, popups y onboarding en la era de la IA

    7 patrones con número de pasos, reglas de texto y métricas, lo que cambia la IA y una lista antes de publicar. PDF, 2 páginas. Qué incluye →

    La guía está en inglés.