Clew

InícioFerramentasGerador de robots.txt

Gerador e testador de robots.txt com rastreadores de IA

Crie um robots.txt a partir de um modelo, bloqueie secções privadas, decida que rastreadores de IA podem aceder ao seu site e teste qualquer URL: se está permitido para o Googlebot, o Bingbot ou o GPTBot, e que grupo e que regra o decidiram.

● Grátis, sem registoAtualizado:

Modelo
Um modelo substitui os grupos; depois edite à mão.

Um rastreador segue um único grupo — o seu ou, se não existir, o *. Por isso um grupo para o Googlebot ou o Bingbot tem de repetir as regras comuns.

Rastreadores de IA: bloquear acesso

Treino de modelos

Pesquisa e respostas com ligações

Pedidos de utilizadores

O robots.txt é um pedido, não uma fechadura. As empresas sérias respeitam-no, mas alguns bots ignoram-no. Só controlos no servidor — autenticação ou bloqueio por IP e user agent — restringem realmente o acesso.

URL completos dos sitemaps, um por linha.

—

 

    Sem Crawl-delay nem Host. O Google não suporta Crawl-delay, e Host era uma diretiva exclusiva do Yandex, abandonada em 2018. O gerador não as acrescenta.

    Tudo é calculado no seu navegador — nada do que introduz é enviado para lado nenhum.

    Como utilizar

    1. Escolha um modelo«SaaS» bloqueia a área da aplicação e a API; «Loja online» bloqueia o carrinho, os filtros e a ordenação. Acrescente os seus caminhos e grupos separados para o Googlebot ou o Bingbot.
    2. Decida sobre os rastreadores de IAOs bots estão agrupados por finalidade: treino de modelos, pesquisa com citações e pedidos de utilizadores. Pode bloquear o treino e manter a pesquisa.
    3. Teste os URL«Testar este ficheiro» passa o resultado para o separador «Testar URL», que mostra o grupo e a regra que decidem o destino de um URL para cada rastreador.
    4. Publique o ficheiroCopie o texto e coloque-o na raiz do domínio: https://example.pt/robots.txt. Cada subdomínio e protocolo tem o seu próprio ficheiro.

    Sintaxe do robots.txt: grupos, regras e precedência

    O robots.txt é um ficheiro de texto na raiz do site que indica aos rastreadores dos motores de pesquisa que URL podem rastrear. Desde 2022 as regras de leitura estão normalizadas na RFC 9309; o Google e o Bing documentam os mesmos princípios base e algumas extensões próprias.

    O ficheiro é composto por grupos. Um grupo começa com uma ou mais linhas User-agent, seguidas de regras Disallow e Allow. As linhas Sitemap não pertencem a grupos e podem estar em qualquer sítio.

    User-agent: * # grupo para todos os rastreadores Disallow: /app/ # bloqueia tudo o que começa por /app/ Allow: /app/registo # exceto a página de registo User-agent: GPTBot # duas linhas User-agent — User-agent: CCBot # um grupo partilhado Disallow: / Sitemap: https://example.pt/sitemap.xml

    Como um rastreador escolhe o grupo

    O rastreador procura o grupo com o seu token — sem distinguir maiúsculas — e segue apenas esse grupo. Se não existir, usa o grupo *; se também faltar, tudo é permitido. Grupos com o mesmo token são combinados. Daí um erro comum: criar um grupo User-agent: Googlebot separado e esquecer-se de repetir nele as regras do *.

    Os motores de pesquisa documentam grupos de recurso: o Googlebot-Image e o Googlebot-News usam as regras do Googlebot quando não têm grupo próprio.

    Como se escolhe a regra

    O valor da regra é comparado com o início do caminho, incluindo a query string. * corresponde a qualquer sequência de carateres, e $ no fim marca o fim do URL. Se várias regras corresponderem, ganha a mais longa; em caso de empate, ganha Allow. A ordem das linhas não importa.

    Allow: /p + Disallow: / → /page permitido (2 carateres ganham a 1) Allow: /folder + Disallow: /folder → /folder/page permitido (mesma extensão, ganha Allow) Allow: /page + Disallow: /*.htm → /page.htm bloqueado (6 carateres ganham a 5) Allow: /$ + Disallow: / → / permitido; /page.htm bloqueado

    É a tabela de precedência da documentação do Google; a ferramenta verifica-a em testes automáticos. Um Disallow: vazio não bloqueia nada. Os caminhos são comparados na forma normalizada: carateres fora do ASCII são codificados em UTF-8 com percentagem, pelo que /promoção/ e /promo%C3%A7%C3%A3o/ são iguais. Os caminhos distinguem maiúsculas: /Admin/ e /admin/ são regras diferentes.

    robots.txt para o Google e o Bing: o que muda

    Em Portugal, o Google responde pela grande maioria das pesquisas e o Bing vem a seguir; não há um motor de pesquisa local com rastreador próprio a ter em conta. O núcleo é comum: grupos, Allow e Disallow, os carateres universais * e $, precedência da correspondência mais longa. As diferenças estão nas extensões.

    • Crawl-delay. O Google ignora-o. O Bing respeita-o, mas o controlo de rastreio do Bing Webmaster Tools é o sítio certo para regular a frequência.
    • Grupos de recurso. O Googlebot-Image, -Video e -News recorrem ao grupo do Googlebot quando não têm um próprio.
    • Tamanho. O Google processa os primeiros 500 KiB do ficheiro e ignora o resto.
    • Host e Clean-param. São diretivas do Yandex. O Google e o Bing ignoram-nas; use redirecionamentos 301 para o anfitrião principal e rel="canonical" para parâmetros de URL.
    • Noindex. O Google deixou de respeitar Noindex: no robots.txt em 2019. Use a meta tag robots ou o cabeçalho X-Robots-Tag.

    Para ver como um motor de pesquisa lê o ficheiro publicado, use o relatório de robots.txt do Google Search Console ou o testador de robots.txt do Bing Webmaster Tools. Esta ferramenta é útil antes de publicar: funciona com qualquer texto, não só com o ficheiro do seu site.

    Como bloquear rastreadores de IA — e se vale a pena

    As empresas de IA rastreiam a web com finalidades diferentes, e as maiores usam um token para cada uma. Decida por finalidade em vez de «bloquear todos».

    Rastreadores de IA por finalidade
    TokenEmpresaFinalidade
    GPTBotOpenAItreino de modelos
    OAI-SearchBotOpenAIpesquisa do ChatGPT
    ChatGPT-UserOpenAIpedido de utilizador
    ClaudeBotAnthropictreino de modelos
    Claude-SearchBotAnthropicrespostas de pesquisa
    Claude-UserAnthropicpedido de utilizador
    PerplexityBotPerplexitypesquisa e citações
    Perplexity-UserPerplexitypedido de utilizador
    Google-ExtendedGoogletoken: treino e fundamentação do Gemini
    Applebot-ExtendedAppletoken: treino de modelos da Apple
    CCBotCommon Crawlarquivo aberto da web
    meta-externalagentMetatreino e produtos
    AmazonbotAmazonserviços da Amazon e IA
    BytespiderByteDancerecolha de dados

    Três grupos, três decisões

    • Treino de modelos (GPTBot, ClaudeBot, CCBot e outros). Bloqueá-los mantém as páginas novas fora de futuros conjuntos de treino. Não trazem tráfego, por isso são os mais bloqueados — sobretudo em conteúdo pago e original.
    • Pesquisa e respostas com ligações (OAI-SearchBot, Claude-SearchBot, PerplexityBot). Estes bots trazem visitas: o seu site é citado com uma ligação. Bloqueá-los é abdicar de um canal novo. Sites SaaS e de media costumam deixá-los abertos.
    • Pedidos de utilizadores (ChatGPT-User, Claude-User, Perplexity-User). A página é aberta porque uma pessoa o pediu explicitamente. É mais parecido com um navegador do que com um rastreador; algumas empresas indicam que estes pedidos podem não seguir o robots.txt.

    O Google-Extended e o Applebot-Extended não são rastreadores. As páginas continuam a ser rastreadas pelo Googlebot ou pelo Applebot habituais; o token apenas proíbe que sejam usadas para treinar modelos. Bloquear o Google-Extended não afeta o posicionamento na Pesquisa Google. Bloquear o Googlebot para ficar fora das respostas de IA do Google retirá-lo-ia também da pesquisa.

    Acima de tudo, o robots.txt é um acordo, não uma proteção. As empresas sérias respeitam-no, mas não é possível verificá-lo de fora, e alguns bots ignoram as regras. Se um conteúdo não pode ser servido, precisa de autenticação ou de restrições no servidor ou na CDN.

    Erros comuns no robots.txt

    • Bloquear CSS e JavaScript. Regras como Disallow: /*.js$ ou Disallow: /assets/ impedem os motores de pesquisa de renderizar a página, que pode parecer vazia ou não adaptada a telemóveis.
    • Esconder páginas com robots.txt em vez de noindex. Bloquear o rastreio não retira o URL do índice: o Google pode mostrá-lo sem descrição se outras páginas tiverem ligações para ele. Para retirar uma página da pesquisa, permita o rastreio e acrescente <meta name="robots" content="noindex"> ou um cabeçalho X-Robots-Tag.
    • Tratar o robots.txt como segurança. O ficheiro é público. Uma linha como Disallow: /painel-admin-secreto/ anuncia o caminho a quem o ler. Proteja as áreas privadas com autenticação; um /admin/ genérico no robots.txt basta — ou nada.
    • Um grupo próprio sem as regras comuns. Acrescenta User-agent: Googlebot para uma exceção, e o Googlebot deixa de ver as regras do *.
    • Regras antes do User-agent. As linhas Disallow no topo do ficheiro, antes do primeiro grupo, são ignoradas.
    • Sitemap relativo. Use um URL completo: Sitemap: https://example.pt/sitemap.xml.
    • Um Disallow: / esquecido do ambiente de testes. O staging estava todo bloqueado, o ficheiro passou para produção e o site desaparece da pesquisa. Verifique o robots.txt depois de cada lançamento.
    • Um ficheiro para todos os subdomínios. O robots.txt aplica-se só ao seu anfitrião e protocolo: app.example.pt e example.pt têm ficheiros separados.

    Uma configuração típica de SaaS: site de marketing aberto, área /app/ bloqueada ao rastreio e protegida por autenticação, páginas de registo e de início de sessão abertas. Se o produto está num subdomínio, tem o seu próprio robots.txt.

    Fontes

    1. RFC 9309. Robots Exclusion Protocol. IETF, 2022 — rfc-editor.org/rfc/rfc9309.
    2. Google Search Central. Como o Google interpreta a especificação do robots.txt — developers.google.com/search/docs/crawling-indexing/robots/robots_txt.
    3. Google Search Central. Vista geral dos rastreadores e obtentores do Google (user agents) — developers.google.com/search/docs/crawling-indexing/overview-google-crawlers.
    4. Google Search Central Blog. A note on unsupported rules in robots.txt, 2019.
    5. Bing Webmaster Guidelines e ajuda do Bing Webmaster Tools: robots.txt e controlo de rastreio — bing.com/webmasters.
    6. OpenAI. Overview of OpenAI Crawlers — platform.openai.com/docs/bots.
    7. Anthropic. Does Anthropic crawl data from the web, and how can site owners block the crawler? — support.claude.com.
    8. Perplexity. Perplexity Crawlers — docs.perplexity.ai.
    9. Apple. About Applebot — support.apple.com/119829.
    10. Common Crawl. CCBot — commoncrawl.org/ccbot.

    Perguntas frequentes

    Como criar um ficheiro robots.txt?

    Escolha um modelo no gerador (site aberto, secções privadas, SaaS ou loja online), ajuste os caminhos, acrescente o sitemap e, se quiser, bloqueie rastreadores de IA. Copie o resultado e guarde-o como robots.txt na raiz do site, para abrir em https://o-seu-dominio/robots.txt.

    Como verificar se o robots.txt bloqueia uma página?

    Abra o separador «Testar URL», cole o conteúdo do ficheiro e o URL da página e escolha um rastreador. A ferramenta mostra se o URL está permitido, que grupo foi aplicado e que regra decidiu — e ainda o resultado para o Googlebot, o Bingbot e os rastreadores de IA.

    Como bloquear rastreadores de IA?

    Acrescente grupos com os respetivos tokens e Disallow: /, por exemplo User-agent: GPTBot e User-agent: ClaudeBot. Separe os bots por finalidade: os de treino não trazem tráfego, enquanto os de pesquisa, como o OAI-SearchBot e o PerplexityBot, enviam visitas através de ligações nas respostas. Lembre-se de que o robots.txt é cumprido voluntariamente.

    Bloquear o Google-Extended retira o meu site do Google?

    Não. O Google-Extended é um token de controlo, não um rastreador: proíbe o uso das páginas para treinar e fundamentar os modelos Gemini, mas não afeta o rastreio do Googlebot nem a Pesquisa Google.

    Preciso de Crawl-delay ou Host?

    Em geral, não. O Google ignora Crawl-delay, e Host é uma diretiva obsoleta do Yandex. O Bing respeita Crawl-delay, mas o controlo de rastreio do Bing Webmaster Tools é a melhor opção.

    O Disallow retira uma página dos resultados de pesquisa?

    Não de forma fiável. O Disallow bloqueia o rastreio, mas o Google pode indexar o URL sem conteúdo se outras páginas tiverem ligações para ele. Para retirar a página dos resultados, mantenha-a rastreável e acrescente a meta tag robots com noindex.

    O que ganha: Allow ou Disallow?

    A regra com o padrão de caminho mais longo, independentemente da ordem das linhas. Se as extensões forem iguais, ganha Allow. É assim que funcionam o Google e a RFC 9309.

    Onde deve ficar o robots.txt?

    Na raiz de cada anfitrião: https://example.pt/robots.txt. Um ficheiro numa subpasta é ignorado, e cada subdomínio e protocolo precisa do seu próprio ficheiro.

    Mais em SEO

    Tours, tooltips e checklists cujo efeito se vê nas métricas.

    Experimentar o Clew grátisComo funcionaPlano gratuito para sempre · sem cartão de crédito

    Tours de produto, pop-ups e onboarding na era da IA

    7 padrões com número de passos, regras de texto e métricas, o que a IA muda e uma lista antes de publicar. PDF, 2 páginas. O que inclui →

    O guia está em inglês.