Clew

InícioFerramentasGerador de robots.txt

Gerador e testador de robots.txt com robôs de IA

Monte um robots.txt a partir de um modelo, bloqueie seções privadas, decida quais robôs de IA podem acessar o seu site e teste qualquer URL: se ela está liberada para Googlebot, Bingbot ou GPTBot, e qual grupo e qual regra decidiram.

● Grátis, sem cadastroAtualizado:

Modelo
Um modelo substitui os grupos; depois edite à mão.

Um robô segue um único grupo — o dele ou, se não existir, o *. Por isso um grupo para Googlebot ou Bingbot precisa repetir as regras comuns.

Robôs de IA: bloquear acesso

Treinamento de modelos

Busca e respostas com links

Solicitações de usuários

O robots.txt é um pedido, não uma tranca. Empresas sérias respeitam, mas alguns bots ignoram. Só controles no servidor — autenticação ou bloqueio por IP e user agent — restringem o acesso de verdade.

URLs completas dos sitemaps, uma por linha.

—

 

    Sem Crawl-delay e sem Host. O Google não aceita Crawl-delay, e Host era uma diretiva exclusiva do Yandex, abandonada em 2018. O gerador não as adiciona.

    Tudo é calculado no seu navegador — nada do que você digita é enviado para lugar nenhum.

    Como usar

    1. Escolha um modelo“SaaS” bloqueia a área do app e a API; “E-commerce” bloqueia carrinho, filtros e ordenação. Adicione seus caminhos e grupos separados para Googlebot ou Bingbot.
    2. Decida sobre os robôs de IAOs bots são agrupados por finalidade: treinamento de modelos, busca com citações e solicitações de usuários. Dá para bloquear o treinamento e manter a busca.
    3. Teste as URLs“Testar este arquivo” leva o resultado para a aba “Testar URL”, que mostra o grupo e a regra que decidem o destino de uma URL para cada robô.
    4. Publique o arquivoCopie o texto e coloque na raiz do domínio: https://example.com.br/robots.txt. Cada subdomínio e protocolo tem o próprio arquivo.

    Sintaxe do robots.txt: grupos, regras e prioridade

    O robots.txt é um arquivo de texto na raiz do site que diz aos robôs dos buscadores quais URLs eles podem rastrear. Desde 2022 as regras de leitura estão padronizadas na RFC 9309; Google e Bing documentam os mesmos princípios básicos e algumas extensões próprias.

    O arquivo é formado por grupos. Um grupo começa com uma ou mais linhas User-agent, seguidas de regras Disallow e Allow. As linhas Sitemap não pertencem a grupos e podem ficar em qualquer lugar.

    User-agent: * # grupo para todos os robôs Disallow: /app/ # bloqueia tudo que começa com /app/ Allow: /app/cadastro # menos a página de cadastro User-agent: GPTBot # duas linhas User-agent — User-agent: CCBot # um grupo compartilhado Disallow: / Sitemap: https://example.com.br/sitemap.xml

    Como o robô escolhe o grupo

    O robô procura o grupo com o próprio token — sem diferenciar maiúsculas — e segue só esse grupo. Se não houver, usa o grupo *; se esse também faltar, tudo está liberado. Grupos com o mesmo token são somados. Daí um erro comum: criar um grupo User-agent: Googlebot separado e esquecer de repetir nele as regras do *.

    Os buscadores documentam grupos de reserva: Googlebot-Image e Googlebot-News usam as regras do Googlebot quando não têm grupo próprio.

    Como a regra é escolhida

    O valor da regra é comparado com o início do caminho, incluindo a query string. * corresponde a qualquer sequência de caracteres, e $ no fim marca o fim da URL. Se várias regras corresponderem, vence a mais longa; em caso de empate, vence o Allow. A ordem das linhas não importa.

    Allow: /p + Disallow: / → /page liberado (2 caracteres vencem 1) Allow: /folder + Disallow: /folder → /folder/page liberado (mesmo tamanho, vence Allow) Allow: /page + Disallow: /*.htm → /page.htm bloqueado (6 caracteres vencem 5) Allow: /$ + Disallow: / → / liberado; /page.htm bloqueado

    Essa é a tabela de prioridade da documentação do Google; a ferramenta a verifica em testes automáticos. Um Disallow: vazio não bloqueia nada. Os caminhos são comparados na forma normalizada: caracteres fora do ASCII são codificados em UTF-8 com porcentagem, então /promoção/ e /promo%C3%A7%C3%A3o/ são iguais. Os caminhos diferenciam maiúsculas: /Admin/ e /admin/ são regras diferentes.

    robots.txt para Google e Bing: o que muda

    No Brasil o Google responde pela enorme maioria das buscas, e o Bing vem em seguida; não há um buscador local com robô próprio a considerar. O núcleo é comum: grupos, Allow e Disallow, os curingas * e $, prioridade da correspondência mais longa. As diferenças estão nas extensões.

    • Crawl-delay. O Google ignora. O Bing respeita, mas o controle de rastreamento do Bing Webmaster Tools é o lugar melhor para ajustar a frequência.
    • Grupos de reserva. Googlebot-Image, -Video e -News recorrem ao grupo do Googlebot quando não têm um próprio.
    • Tamanho. O Google processa os primeiros 500 KiB do arquivo e ignora o resto.
    • Host e Clean-param. São diretivas do Yandex. Google e Bing as ignoram; use redirecionamentos 301 para o host principal e rel="canonical" para parâmetros de URL.
    • Noindex. O Google deixou de respeitar Noindex: no robots.txt em 2019. Use a meta tag robots ou o cabeçalho X-Robots-Tag.

    Para ver como um buscador lê o arquivo publicado, use o relatório de robots.txt do Google Search Console ou o testador de robots.txt do Bing Webmaster Tools. Esta ferramenta é útil antes de publicar: funciona com qualquer texto, não só com o arquivo do seu site.

    Como bloquear robôs de IA — e se vale a pena

    As empresas de IA rastreiam a web com finalidades diferentes, e as grandes usam um token para cada uma. Decida por finalidade em vez de “bloquear todos”.

    Robôs de IA por finalidade
    TokenEmpresaFinalidade
    GPTBotOpenAItreinamento de modelos
    OAI-SearchBotOpenAIbusca do ChatGPT
    ChatGPT-UserOpenAIsolicitação do usuário
    ClaudeBotAnthropictreinamento de modelos
    Claude-SearchBotAnthropicrespostas de busca
    Claude-UserAnthropicsolicitação do usuário
    PerplexityBotPerplexitybusca e citações
    Perplexity-UserPerplexitysolicitação do usuário
    Google-ExtendedGoogletoken: treinamento e embasamento do Gemini
    Applebot-ExtendedAppletoken: treinamento de modelos da Apple
    CCBotCommon Crawlarquivo aberto da web
    meta-externalagentMetatreinamento e produtos
    AmazonbotAmazonserviços da Amazon e IA
    BytespiderByteDancecoleta de dados

    Três grupos, três decisões

    • Treinamento de modelos (GPTBot, ClaudeBot, CCBot e outros). Bloquear deixa as páginas novas fora de futuros conjuntos de treinamento. Esses bots não trazem tráfego, por isso são os mais bloqueados — principalmente em conteúdo pago e original.
    • Busca e respostas com links (OAI-SearchBot, Claude-SearchBot, PerplexityBot). Esses bots trazem visitas: seu site é citado com link. Bloqueá-los é abrir mão de um canal novo. Sites de SaaS e de mídia costumam deixá-los liberados.
    • Solicitações de usuários (ChatGPT-User, Claude-User, Perplexity-User). A página é aberta porque uma pessoa pediu explicitamente. Isso se parece mais com um navegador do que com um robô; algumas empresas dizem que essas solicitações podem não seguir o robots.txt.

    Google-Extended e Applebot-Extended não são robôs. As páginas continuam sendo rastreadas pelo Googlebot ou Applebot normal; o token só proíbe usá-las para treinar modelos. Bloquear o Google-Extended não afeta o ranqueamento na Pesquisa Google. Bloquear o Googlebot para ficar fora das respostas de IA do Google tiraria você da busca também.

    Acima de tudo, o robots.txt é um acordo, não uma proteção. Empresas sérias respeitam, mas não dá para verificar de fora, e alguns bots ignoram as regras. Se um conteúdo não pode ser servido, você precisa de autenticação ou de restrições no servidor ou na CDN.

    Erros comuns no robots.txt

    • Bloquear CSS e JavaScript. Regras como Disallow: /*.js$ ou Disallow: /assets/ impedem os buscadores de renderizar a página, que pode parecer vazia ou não adaptada a celulares.
    • Esconder páginas com robots.txt em vez de noindex. Bloquear o rastreamento não tira a URL do índice: o Google pode mostrá-la sem descrição se outras páginas apontarem para ela. Para tirar uma página da busca, libere o rastreamento e adicione <meta name="robots" content="noindex"> ou um cabeçalho X-Robots-Tag.
    • Tratar o robots.txt como segurança. O arquivo é público. Uma linha como Disallow: /painel-admin-secreto/ anuncia o caminho para quem ler. Proteja áreas privadas com login; um /admin/ genérico no robots.txt basta — ou nada.
    • Um grupo próprio sem as regras comuns. Você adiciona User-agent: Googlebot para uma exceção, e o Googlebot deixa de ver as regras do *.
    • Regras antes do User-agent. Linhas Disallow no topo do arquivo, antes do primeiro grupo, são ignoradas.
    • Sitemap relativo. Use URL completa: Sitemap: https://example.com.br/sitemap.xml.
    • Um Disallow: / esquecido do ambiente de homologação. O staging estava todo bloqueado, o arquivo foi para produção e o site some da busca. Confira o robots.txt depois de cada deploy.
    • Um arquivo para todos os subdomínios. O robots.txt vale só para o próprio host e protocolo: app.example.com.br e example.com.br têm arquivos separados.

    Uma configuração típica de SaaS: site de marketing liberado, área /app/ bloqueada para rastreamento e protegida por login, páginas de cadastro e login liberadas. Se o produto fica num subdomínio, ele tem o próprio robots.txt.

    Fontes

    1. RFC 9309. Robots Exclusion Protocol. IETF, 2022 — rfc-editor.org/rfc/rfc9309.
    2. Google Search Central. Como o Google interpreta a especificação do robots.txt — developers.google.com/search/docs/crawling-indexing/robots/robots_txt.
    3. Google Search Central. Visão geral dos rastreadores e buscadores do Google (user agents) — developers.google.com/search/docs/crawling-indexing/overview-google-crawlers.
    4. Google Search Central Blog. A note on unsupported rules in robots.txt, 2019.
    5. Bing Webmaster Guidelines e ajuda do Bing Webmaster Tools: robots.txt e controle de rastreamento — bing.com/webmasters.
    6. OpenAI. Overview of OpenAI Crawlers — platform.openai.com/docs/bots.
    7. Anthropic. Does Anthropic crawl data from the web, and how can site owners block the crawler? — support.claude.com.
    8. Perplexity. Perplexity Crawlers — docs.perplexity.ai.
    9. Apple. About Applebot — support.apple.com/119829.
    10. Common Crawl. CCBot — commoncrawl.org/ccbot.

    Perguntas frequentes

    Como criar um arquivo robots.txt?

    Escolha um modelo no gerador (site aberto, seções privadas, SaaS ou e-commerce), ajuste os caminhos, adicione o sitemap e, se quiser, bloqueie robôs de IA. Copie o resultado e salve como robots.txt na raiz do site, para que abra em https://seu-dominio/robots.txt.

    Como saber se o robots.txt bloqueia uma página?

    Abra a aba “Testar URL”, cole o conteúdo do arquivo e a URL da página e escolha um robô. A ferramenta mostra se a URL está liberada, qual grupo foi aplicado e qual regra decidiu — e também o resultado para Googlebot, Bingbot e robôs de IA.

    Como bloquear robôs de IA?

    Adicione grupos com os tokens deles e Disallow: /, por exemplo User-agent: GPTBot e User-agent: ClaudeBot. Separe os bots por finalidade: os de treinamento não trazem tráfego, enquanto os de busca, como OAI-SearchBot e PerplexityBot, mandam visitas por links nas respostas. Lembre que o robots.txt é seguido voluntariamente.

    Bloquear o Google-Extended tira meu site do Google?

    Não. O Google-Extended é um token de controle, não um robô: proíbe usar as páginas para treinar e embasar os modelos Gemini, mas não afeta o rastreamento do Googlebot nem a Pesquisa Google.

    Preciso de Crawl-delay ou Host?

    Em geral, não. O Google ignora Crawl-delay, e Host é uma diretiva obsoleta do Yandex. O Bing respeita Crawl-delay, mas o controle de rastreamento do Bing Webmaster Tools é a melhor opção.

    O Disallow tira uma página dos resultados de busca?

    Não de forma confiável. O Disallow bloqueia o rastreamento, mas o Google pode indexar a URL sem conteúdo se outras páginas apontarem para ela. Para tirar a página dos resultados, deixe-a rastreável e adicione a meta tag robots com noindex.

    Quem vence: Allow ou Disallow?

    A regra com o padrão de caminho mais longo, independentemente da ordem das linhas. Se os tamanhos forem iguais, vence o Allow. É assim que funcionam o Google e a RFC 9309.

    Onde colocar o robots.txt?

    Na raiz de cada host: https://example.com.br/robots.txt. Um arquivo numa subpasta é ignorado, e cada subdomínio e protocolo precisa do próprio arquivo.

    Mais em SEO

    Tours, tooltips e checklists com efeito visível nas métricas.

    Teste o Clew grátisComo funcionaPlano gratuito para sempre · sem cartão de crédito

    Tours de produto, pop-ups e onboarding na era da IA

    7 padrões com número de passos, regras de texto e métricas, o que a IA muda e um checklist antes de publicar. PDF, 2 páginas. O que tem no guia →

    O guia está em inglês.