InícioFerramentasGerador de robots.txt
Gerador e testador de robots.txt com robôs de IA
Monte um robots.txt a partir de um modelo, bloqueie seções privadas, decida quais robôs de IA podem acessar o seu site e teste qualquer URL: se ela está liberada para Googlebot, Bingbot ou GPTBot, e qual grupo e qual regra decidiram.
—
Sem Crawl-delay e sem Host. O Google não aceita Crawl-delay, e Host era uma diretiva exclusiva do Yandex, abandonada em 2018. O gerador não as adiciona.
—
Regras do grupo aplicado
| Linha | Regra | Tamanho | Correspondência |
|---|
Esta URL para diferentes robôs
| Robô | Grupo | Acesso |
|---|
Verificação do arquivo
Tudo é calculado no seu navegador — nada do que você digita é enviado para lugar nenhum.
Como usar
- Escolha um modelo“SaaS” bloqueia a área do app e a API; “E-commerce” bloqueia carrinho, filtros e ordenação. Adicione seus caminhos e grupos separados para Googlebot ou Bingbot.
- Decida sobre os robôs de IAOs bots são agrupados por finalidade: treinamento de modelos, busca com citações e solicitações de usuários. Dá para bloquear o treinamento e manter a busca.
- Teste as URLs“Testar este arquivo” leva o resultado para a aba “Testar URL”, que mostra o grupo e a regra que decidem o destino de uma URL para cada robô.
- Publique o arquivoCopie o texto e coloque na raiz do domínio: https://example.com.br/robots.txt. Cada subdomínio e protocolo tem o próprio arquivo.
Sintaxe do robots.txt: grupos, regras e prioridade
O robots.txt é um arquivo de texto na raiz do site que diz aos robôs dos buscadores quais URLs eles podem rastrear. Desde 2022 as regras de leitura estão padronizadas na RFC 9309; Google e Bing documentam os mesmos princípios básicos e algumas extensões próprias.
O arquivo é formado por grupos. Um grupo começa com uma ou mais linhas User-agent, seguidas de regras Disallow e Allow. As linhas Sitemap não pertencem a grupos e podem ficar em qualquer lugar.
Como o robô escolhe o grupo
O robô procura o grupo com o próprio token — sem diferenciar maiúsculas — e segue só esse grupo. Se não houver, usa o grupo *; se esse também faltar, tudo está liberado. Grupos com o mesmo token são somados. Daí um erro comum: criar um grupo User-agent: Googlebot separado e esquecer de repetir nele as regras do *.
Os buscadores documentam grupos de reserva: Googlebot-Image e Googlebot-News usam as regras do Googlebot quando não têm grupo próprio.
Como a regra é escolhida
O valor da regra é comparado com o início do caminho, incluindo a query string. * corresponde a qualquer sequência de caracteres, e $ no fim marca o fim da URL. Se várias regras corresponderem, vence a mais longa; em caso de empate, vence o Allow. A ordem das linhas não importa.
Essa é a tabela de prioridade da documentação do Google; a ferramenta a verifica em testes automáticos. Um Disallow: vazio não bloqueia nada. Os caminhos são comparados na forma normalizada: caracteres fora do ASCII são codificados em UTF-8 com porcentagem, então /promoção/ e /promo%C3%A7%C3%A3o/ são iguais. Os caminhos diferenciam maiúsculas: /Admin/ e /admin/ são regras diferentes.
robots.txt para Google e Bing: o que muda
No Brasil o Google responde pela enorme maioria das buscas, e o Bing vem em seguida; não há um buscador local com robô próprio a considerar. O núcleo é comum: grupos, Allow e Disallow, os curingas * e $, prioridade da correspondência mais longa. As diferenças estão nas extensões.
- Crawl-delay. O Google ignora. O Bing respeita, mas o controle de rastreamento do Bing Webmaster Tools é o lugar melhor para ajustar a frequência.
- Grupos de reserva. Googlebot-Image, -Video e -News recorrem ao grupo do Googlebot quando não têm um próprio.
- Tamanho. O Google processa os primeiros 500 KiB do arquivo e ignora o resto.
- Host e Clean-param. São diretivas do Yandex. Google e Bing as ignoram; use redirecionamentos 301 para o host principal e
rel="canonical"para parâmetros de URL. - Noindex. O Google deixou de respeitar
Noindex:no robots.txt em 2019. Use a meta tag robots ou o cabeçalhoX-Robots-Tag.
Para ver como um buscador lê o arquivo publicado, use o relatório de robots.txt do Google Search Console ou o testador de robots.txt do Bing Webmaster Tools. Esta ferramenta é útil antes de publicar: funciona com qualquer texto, não só com o arquivo do seu site.
Como bloquear robôs de IA — e se vale a pena
As empresas de IA rastreiam a web com finalidades diferentes, e as grandes usam um token para cada uma. Decida por finalidade em vez de “bloquear todos”.
| Token | Empresa | Finalidade |
|---|---|---|
| GPTBot | OpenAI | treinamento de modelos |
| OAI-SearchBot | OpenAI | busca do ChatGPT |
| ChatGPT-User | OpenAI | solicitação do usuário |
| ClaudeBot | Anthropic | treinamento de modelos |
| Claude-SearchBot | Anthropic | respostas de busca |
| Claude-User | Anthropic | solicitação do usuário |
| PerplexityBot | Perplexity | busca e citações |
| Perplexity-User | Perplexity | solicitação do usuário |
| Google-Extended | token: treinamento e embasamento do Gemini | |
| Applebot-Extended | Apple | token: treinamento de modelos da Apple |
| CCBot | Common Crawl | arquivo aberto da web |
| meta-externalagent | Meta | treinamento e produtos |
| Amazonbot | Amazon | serviços da Amazon e IA |
| Bytespider | ByteDance | coleta de dados |
Três grupos, três decisões
- Treinamento de modelos (GPTBot, ClaudeBot, CCBot e outros). Bloquear deixa as páginas novas fora de futuros conjuntos de treinamento. Esses bots não trazem tráfego, por isso são os mais bloqueados — principalmente em conteúdo pago e original.
- Busca e respostas com links (OAI-SearchBot, Claude-SearchBot, PerplexityBot). Esses bots trazem visitas: seu site é citado com link. Bloqueá-los é abrir mão de um canal novo. Sites de SaaS e de mídia costumam deixá-los liberados.
- Solicitações de usuários (ChatGPT-User, Claude-User, Perplexity-User). A página é aberta porque uma pessoa pediu explicitamente. Isso se parece mais com um navegador do que com um robô; algumas empresas dizem que essas solicitações podem não seguir o robots.txt.
Google-Extended e Applebot-Extended não são robôs. As páginas continuam sendo rastreadas pelo Googlebot ou Applebot normal; o token só proíbe usá-las para treinar modelos. Bloquear o Google-Extended não afeta o ranqueamento na Pesquisa Google. Bloquear o Googlebot para ficar fora das respostas de IA do Google tiraria você da busca também.
Acima de tudo, o robots.txt é um acordo, não uma proteção. Empresas sérias respeitam, mas não dá para verificar de fora, e alguns bots ignoram as regras. Se um conteúdo não pode ser servido, você precisa de autenticação ou de restrições no servidor ou na CDN.
Erros comuns no robots.txt
- Bloquear CSS e JavaScript. Regras como
Disallow: /*.js$ouDisallow: /assets/impedem os buscadores de renderizar a página, que pode parecer vazia ou não adaptada a celulares. - Esconder páginas com robots.txt em vez de noindex. Bloquear o rastreamento não tira a URL do índice: o Google pode mostrá-la sem descrição se outras páginas apontarem para ela. Para tirar uma página da busca, libere o rastreamento e adicione
<meta name="robots" content="noindex">ou um cabeçalhoX-Robots-Tag. - Tratar o robots.txt como segurança. O arquivo é público. Uma linha como
Disallow: /painel-admin-secreto/anuncia o caminho para quem ler. Proteja áreas privadas com login; um/admin/genérico no robots.txt basta — ou nada. - Um grupo próprio sem as regras comuns. Você adiciona
User-agent: Googlebotpara uma exceção, e o Googlebot deixa de ver as regras do*. - Regras antes do User-agent. Linhas
Disallowno topo do arquivo, antes do primeiro grupo, são ignoradas. - Sitemap relativo. Use URL completa:
Sitemap: https://example.com.br/sitemap.xml. - Um
Disallow: /esquecido do ambiente de homologação. O staging estava todo bloqueado, o arquivo foi para produção e o site some da busca. Confira o robots.txt depois de cada deploy. - Um arquivo para todos os subdomínios. O robots.txt vale só para o próprio host e protocolo:
app.example.com.breexample.com.brtêm arquivos separados.
Uma configuração típica de SaaS: site de marketing liberado, área /app/ bloqueada para rastreamento e protegida por login, páginas de cadastro e login liberadas. Se o produto fica num subdomínio, ele tem o próprio robots.txt.
Fontes
- RFC 9309. Robots Exclusion Protocol. IETF, 2022 — rfc-editor.org/rfc/rfc9309.
- Google Search Central. Como o Google interpreta a especificação do robots.txt — developers.google.com/search/docs/crawling-indexing/robots/robots_txt.
- Google Search Central. Visão geral dos rastreadores e buscadores do Google (user agents) — developers.google.com/search/docs/crawling-indexing/overview-google-crawlers.
- Google Search Central Blog. A note on unsupported rules in robots.txt, 2019.
- Bing Webmaster Guidelines e ajuda do Bing Webmaster Tools: robots.txt e controle de rastreamento — bing.com/webmasters.
- OpenAI. Overview of OpenAI Crawlers — platform.openai.com/docs/bots.
- Anthropic. Does Anthropic crawl data from the web, and how can site owners block the crawler? — support.claude.com.
- Perplexity. Perplexity Crawlers — docs.perplexity.ai.
- Apple. About Applebot — support.apple.com/119829.
- Common Crawl. CCBot — commoncrawl.org/ccbot.
Perguntas frequentes
Como criar um arquivo robots.txt?
Escolha um modelo no gerador (site aberto, seções privadas, SaaS ou e-commerce), ajuste os caminhos, adicione o sitemap e, se quiser, bloqueie robôs de IA. Copie o resultado e salve como robots.txt na raiz do site, para que abra em https://seu-dominio/robots.txt.
Como saber se o robots.txt bloqueia uma página?
Abra a aba “Testar URL”, cole o conteúdo do arquivo e a URL da página e escolha um robô. A ferramenta mostra se a URL está liberada, qual grupo foi aplicado e qual regra decidiu — e também o resultado para Googlebot, Bingbot e robôs de IA.
Como bloquear robôs de IA?
Adicione grupos com os tokens deles e Disallow: /, por exemplo User-agent: GPTBot e User-agent: ClaudeBot. Separe os bots por finalidade: os de treinamento não trazem tráfego, enquanto os de busca, como OAI-SearchBot e PerplexityBot, mandam visitas por links nas respostas. Lembre que o robots.txt é seguido voluntariamente.
Bloquear o Google-Extended tira meu site do Google?
Não. O Google-Extended é um token de controle, não um robô: proíbe usar as páginas para treinar e embasar os modelos Gemini, mas não afeta o rastreamento do Googlebot nem a Pesquisa Google.
Preciso de Crawl-delay ou Host?
Em geral, não. O Google ignora Crawl-delay, e Host é uma diretiva obsoleta do Yandex. O Bing respeita Crawl-delay, mas o controle de rastreamento do Bing Webmaster Tools é a melhor opção.
O Disallow tira uma página dos resultados de busca?
Não de forma confiável. O Disallow bloqueia o rastreamento, mas o Google pode indexar a URL sem conteúdo se outras páginas apontarem para ela. Para tirar a página dos resultados, deixe-a rastreável e adicione a meta tag robots com noindex.
Quem vence: Allow ou Disallow?
A regra com o padrão de caminho mais longo, independentemente da ordem das linhas. Se os tamanhos forem iguais, vence o Allow. É assim que funcionam o Google e a RFC 9309.
Onde colocar o robots.txt?
Na raiz de cada host: https://example.com.br/robots.txt. Um arquivo numa subpasta é ignorado, e cada subdomínio e protocolo precisa do próprio arquivo.
Mais em SEO
- Prévia do snippet
Como o título e a descrição vão aparecer no Google, e serão cortados?
- Gerador de Open Graph
Quais tags Open Graph a página precisa e como fica a prévia do link?
- Analisador de legibilidade
Quão difícil é ler este texto e quais frases estão longas demais?
- Gerador de hreflang
Quais tags hreflang ligam as versões de idioma de uma página?
- Gerador de UTM
Como criar links UTM padronizados para cada campanha e canal?
- Gerador de QR code com UTM
Qual estande, panfleto ou pôster trouxe visitantes — e como marcar um QR code para cada um?