InícioFerramentasGerador de robots.txt
Gerador e testador de robots.txt com rastreadores de IA
Crie um robots.txt a partir de um modelo, bloqueie secções privadas, decida que rastreadores de IA podem aceder ao seu site e teste qualquer URL: se está permitido para o Googlebot, o Bingbot ou o GPTBot, e que grupo e que regra o decidiram.
—
Sem Crawl-delay nem Host. O Google não suporta Crawl-delay, e Host era uma diretiva exclusiva do Yandex, abandonada em 2018. O gerador não as acrescenta.
—
Regras do grupo aplicado
| Linha | Regra | Extensão | Correspondência |
|---|
Este URL para diferentes rastreadores
| Rastreador | Grupo | Acesso |
|---|
Verificação do ficheiro
Tudo é calculado no seu navegador — nada do que introduz é enviado para lado nenhum.
Como utilizar
- Escolha um modelo«SaaS» bloqueia a área da aplicação e a API; «Loja online» bloqueia o carrinho, os filtros e a ordenação. Acrescente os seus caminhos e grupos separados para o Googlebot ou o Bingbot.
- Decida sobre os rastreadores de IAOs bots estão agrupados por finalidade: treino de modelos, pesquisa com citações e pedidos de utilizadores. Pode bloquear o treino e manter a pesquisa.
- Teste os URL«Testar este ficheiro» passa o resultado para o separador «Testar URL», que mostra o grupo e a regra que decidem o destino de um URL para cada rastreador.
- Publique o ficheiroCopie o texto e coloque-o na raiz do domínio: https://example.pt/robots.txt. Cada subdomínio e protocolo tem o seu próprio ficheiro.
Sintaxe do robots.txt: grupos, regras e precedência
O robots.txt é um ficheiro de texto na raiz do site que indica aos rastreadores dos motores de pesquisa que URL podem rastrear. Desde 2022 as regras de leitura estão normalizadas na RFC 9309; o Google e o Bing documentam os mesmos princípios base e algumas extensões próprias.
O ficheiro é composto por grupos. Um grupo começa com uma ou mais linhas User-agent, seguidas de regras Disallow e Allow. As linhas Sitemap não pertencem a grupos e podem estar em qualquer sítio.
Como um rastreador escolhe o grupo
O rastreador procura o grupo com o seu token — sem distinguir maiúsculas — e segue apenas esse grupo. Se não existir, usa o grupo *; se também faltar, tudo é permitido. Grupos com o mesmo token são combinados. Daí um erro comum: criar um grupo User-agent: Googlebot separado e esquecer-se de repetir nele as regras do *.
Os motores de pesquisa documentam grupos de recurso: o Googlebot-Image e o Googlebot-News usam as regras do Googlebot quando não têm grupo próprio.
Como se escolhe a regra
O valor da regra é comparado com o início do caminho, incluindo a query string. * corresponde a qualquer sequência de carateres, e $ no fim marca o fim do URL. Se várias regras corresponderem, ganha a mais longa; em caso de empate, ganha Allow. A ordem das linhas não importa.
É a tabela de precedência da documentação do Google; a ferramenta verifica-a em testes automáticos. Um Disallow: vazio não bloqueia nada. Os caminhos são comparados na forma normalizada: carateres fora do ASCII são codificados em UTF-8 com percentagem, pelo que /promoção/ e /promo%C3%A7%C3%A3o/ são iguais. Os caminhos distinguem maiúsculas: /Admin/ e /admin/ são regras diferentes.
robots.txt para o Google e o Bing: o que muda
Em Portugal, o Google responde pela grande maioria das pesquisas e o Bing vem a seguir; não há um motor de pesquisa local com rastreador próprio a ter em conta. O núcleo é comum: grupos, Allow e Disallow, os carateres universais * e $, precedência da correspondência mais longa. As diferenças estão nas extensões.
- Crawl-delay. O Google ignora-o. O Bing respeita-o, mas o controlo de rastreio do Bing Webmaster Tools é o sítio certo para regular a frequência.
- Grupos de recurso. O Googlebot-Image, -Video e -News recorrem ao grupo do Googlebot quando não têm um próprio.
- Tamanho. O Google processa os primeiros 500 KiB do ficheiro e ignora o resto.
- Host e Clean-param. São diretivas do Yandex. O Google e o Bing ignoram-nas; use redirecionamentos 301 para o anfitrião principal e
rel="canonical"para parâmetros de URL. - Noindex. O Google deixou de respeitar
Noindex:no robots.txt em 2019. Use a meta tag robots ou o cabeçalhoX-Robots-Tag.
Para ver como um motor de pesquisa lê o ficheiro publicado, use o relatório de robots.txt do Google Search Console ou o testador de robots.txt do Bing Webmaster Tools. Esta ferramenta é útil antes de publicar: funciona com qualquer texto, não só com o ficheiro do seu site.
Como bloquear rastreadores de IA — e se vale a pena
As empresas de IA rastreiam a web com finalidades diferentes, e as maiores usam um token para cada uma. Decida por finalidade em vez de «bloquear todos».
| Token | Empresa | Finalidade |
|---|---|---|
| GPTBot | OpenAI | treino de modelos |
| OAI-SearchBot | OpenAI | pesquisa do ChatGPT |
| ChatGPT-User | OpenAI | pedido de utilizador |
| ClaudeBot | Anthropic | treino de modelos |
| Claude-SearchBot | Anthropic | respostas de pesquisa |
| Claude-User | Anthropic | pedido de utilizador |
| PerplexityBot | Perplexity | pesquisa e citações |
| Perplexity-User | Perplexity | pedido de utilizador |
| Google-Extended | token: treino e fundamentação do Gemini | |
| Applebot-Extended | Apple | token: treino de modelos da Apple |
| CCBot | Common Crawl | arquivo aberto da web |
| meta-externalagent | Meta | treino e produtos |
| Amazonbot | Amazon | serviços da Amazon e IA |
| Bytespider | ByteDance | recolha de dados |
Três grupos, três decisões
- Treino de modelos (GPTBot, ClaudeBot, CCBot e outros). Bloqueá-los mantém as páginas novas fora de futuros conjuntos de treino. Não trazem tráfego, por isso são os mais bloqueados — sobretudo em conteúdo pago e original.
- Pesquisa e respostas com ligações (OAI-SearchBot, Claude-SearchBot, PerplexityBot). Estes bots trazem visitas: o seu site é citado com uma ligação. Bloqueá-los é abdicar de um canal novo. Sites SaaS e de media costumam deixá-los abertos.
- Pedidos de utilizadores (ChatGPT-User, Claude-User, Perplexity-User). A página é aberta porque uma pessoa o pediu explicitamente. É mais parecido com um navegador do que com um rastreador; algumas empresas indicam que estes pedidos podem não seguir o robots.txt.
O Google-Extended e o Applebot-Extended não são rastreadores. As páginas continuam a ser rastreadas pelo Googlebot ou pelo Applebot habituais; o token apenas proíbe que sejam usadas para treinar modelos. Bloquear o Google-Extended não afeta o posicionamento na Pesquisa Google. Bloquear o Googlebot para ficar fora das respostas de IA do Google retirá-lo-ia também da pesquisa.
Acima de tudo, o robots.txt é um acordo, não uma proteção. As empresas sérias respeitam-no, mas não é possível verificá-lo de fora, e alguns bots ignoram as regras. Se um conteúdo não pode ser servido, precisa de autenticação ou de restrições no servidor ou na CDN.
Erros comuns no robots.txt
- Bloquear CSS e JavaScript. Regras como
Disallow: /*.js$ouDisallow: /assets/impedem os motores de pesquisa de renderizar a página, que pode parecer vazia ou não adaptada a telemóveis. - Esconder páginas com robots.txt em vez de noindex. Bloquear o rastreio não retira o URL do índice: o Google pode mostrá-lo sem descrição se outras páginas tiverem ligações para ele. Para retirar uma página da pesquisa, permita o rastreio e acrescente
<meta name="robots" content="noindex">ou um cabeçalhoX-Robots-Tag. - Tratar o robots.txt como segurança. O ficheiro é público. Uma linha como
Disallow: /painel-admin-secreto/anuncia o caminho a quem o ler. Proteja as áreas privadas com autenticação; um/admin/genérico no robots.txt basta — ou nada. - Um grupo próprio sem as regras comuns. Acrescenta
User-agent: Googlebotpara uma exceção, e o Googlebot deixa de ver as regras do*. - Regras antes do User-agent. As linhas
Disallowno topo do ficheiro, antes do primeiro grupo, são ignoradas. - Sitemap relativo. Use um URL completo:
Sitemap: https://example.pt/sitemap.xml. - Um
Disallow: /esquecido do ambiente de testes. O staging estava todo bloqueado, o ficheiro passou para produção e o site desaparece da pesquisa. Verifique o robots.txt depois de cada lançamento. - Um ficheiro para todos os subdomínios. O robots.txt aplica-se só ao seu anfitrião e protocolo:
app.example.pteexample.pttêm ficheiros separados.
Uma configuração típica de SaaS: site de marketing aberto, área /app/ bloqueada ao rastreio e protegida por autenticação, páginas de registo e de início de sessão abertas. Se o produto está num subdomínio, tem o seu próprio robots.txt.
Fontes
- RFC 9309. Robots Exclusion Protocol. IETF, 2022 — rfc-editor.org/rfc/rfc9309.
- Google Search Central. Como o Google interpreta a especificação do robots.txt — developers.google.com/search/docs/crawling-indexing/robots/robots_txt.
- Google Search Central. Vista geral dos rastreadores e obtentores do Google (user agents) — developers.google.com/search/docs/crawling-indexing/overview-google-crawlers.
- Google Search Central Blog. A note on unsupported rules in robots.txt, 2019.
- Bing Webmaster Guidelines e ajuda do Bing Webmaster Tools: robots.txt e controlo de rastreio — bing.com/webmasters.
- OpenAI. Overview of OpenAI Crawlers — platform.openai.com/docs/bots.
- Anthropic. Does Anthropic crawl data from the web, and how can site owners block the crawler? — support.claude.com.
- Perplexity. Perplexity Crawlers — docs.perplexity.ai.
- Apple. About Applebot — support.apple.com/119829.
- Common Crawl. CCBot — commoncrawl.org/ccbot.
Perguntas frequentes
Como criar um ficheiro robots.txt?
Escolha um modelo no gerador (site aberto, secções privadas, SaaS ou loja online), ajuste os caminhos, acrescente o sitemap e, se quiser, bloqueie rastreadores de IA. Copie o resultado e guarde-o como robots.txt na raiz do site, para abrir em https://o-seu-dominio/robots.txt.
Como verificar se o robots.txt bloqueia uma página?
Abra o separador «Testar URL», cole o conteúdo do ficheiro e o URL da página e escolha um rastreador. A ferramenta mostra se o URL está permitido, que grupo foi aplicado e que regra decidiu — e ainda o resultado para o Googlebot, o Bingbot e os rastreadores de IA.
Como bloquear rastreadores de IA?
Acrescente grupos com os respetivos tokens e Disallow: /, por exemplo User-agent: GPTBot e User-agent: ClaudeBot. Separe os bots por finalidade: os de treino não trazem tráfego, enquanto os de pesquisa, como o OAI-SearchBot e o PerplexityBot, enviam visitas através de ligações nas respostas. Lembre-se de que o robots.txt é cumprido voluntariamente.
Bloquear o Google-Extended retira o meu site do Google?
Não. O Google-Extended é um token de controlo, não um rastreador: proíbe o uso das páginas para treinar e fundamentar os modelos Gemini, mas não afeta o rastreio do Googlebot nem a Pesquisa Google.
Preciso de Crawl-delay ou Host?
Em geral, não. O Google ignora Crawl-delay, e Host é uma diretiva obsoleta do Yandex. O Bing respeita Crawl-delay, mas o controlo de rastreio do Bing Webmaster Tools é a melhor opção.
O Disallow retira uma página dos resultados de pesquisa?
Não de forma fiável. O Disallow bloqueia o rastreio, mas o Google pode indexar o URL sem conteúdo se outras páginas tiverem ligações para ele. Para retirar a página dos resultados, mantenha-a rastreável e acrescente a meta tag robots com noindex.
O que ganha: Allow ou Disallow?
A regra com o padrão de caminho mais longo, independentemente da ordem das linhas. Se as extensões forem iguais, ganha Allow. É assim que funcionam o Google e a RFC 9309.
Onde deve ficar o robots.txt?
Na raiz de cada anfitrião: https://example.pt/robots.txt. Um ficheiro numa subpasta é ignorado, e cada subdomínio e protocolo precisa do seu próprio ficheiro.
Mais em SEO
- Pré-visualização do snippet
Como vão aparecer o título e a descrição no Google, e serão cortados?
- Gerador de Open Graph
Que tags Open Graph precisa a página e como fica a pré-visualização do link?
- Analisador de legibilidade
Quão difícil é ler este texto e que frases são demasiado longas?
- Gerador de hreflang
Que tags hreflang ligam as versões de idioma de uma página?
- Gerador de UTM
Como criar links UTM coerentes para cada campanha e canal?
- Gerador de código QR com UTM
Que stand, folheto ou cartaz trouxe visitantes — e como marcar um código QR para cada um?