Scanverra

Como Corrigir o robots.txt a Bloquear Crawlers de IA

O robots.txt é um ficheiro de texto simples na raiz do seu domínio que indica aos crawlers a quais caminhos têm permissão para aceder. Uma única regra Disallow demasiado abrangente - frequentemente copiada de um ambiente de staging ou escrita para travar um bot problemático - pode bloquear silenciosamente todos os crawlers de IA de todo o seu site, excluindo-o dos resultados de pesquisa e assistentes com IA sem qualquer aviso.

Porque é que Isto Acontece

  • Um Disallow: / de staging chega à produção - um bloqueio genérico destinado a manter um site pré-lançamento fora dos motores de busca nunca é removido após o lançamento.
  • Uma regra destinada a um scraper agressivo é aplicada a tudo. Uma equipa bloqueia todos os crawlers para travar um mau ator, apanhando também todos os agentes de IA legítimos.
  • Listas de bloqueio antigas antecedem os crawlers de IA de hoje. Um robots.txt escrito há anos contra uma lista fixa de "maus bots" agora inclui sem querer user-agents de IA mais recentes para os quais ninguém pensou em adicionar exceções.
  • Caminhos sensíveis são listados no robots.txt como se fosse controlo de acesso. Uma equipa adiciona Disallow: /admin-backup/ com a intenção de esconder o diretório, sem perceber que o próprio ficheiro é público e agora anuncia exatamente onde procurar.

Como Identificar o Problema

O Scanverra verifica o seu robots.txt de três formas, desde a sintaxe geral até dois modos de falha específicos da era da IA:

  • Sintaxe e acessibilidade. A pontuação de SEO do Website Audit inclui a verificação padrão de robots.txt do Lighthouse - confirma que o ficheiro é realmente acessível (não uma resposta 4xx/5xx) e que todas as diretivas que contém são reconhecidas pelos crawlers, assinalando regras malformadas como um problema de SEO.
  • Bloqueio genérico de crawlers de IA. Uma verificação separada, específica do Scanverra, deteta um Disallow: / ou Disallow: /* genérico dirigido a crawlers de IA conhecidos - GPTBot, ClaudeBot, CCBot, Google-Extended, PerplexityBot e semelhantes - e assinala-o como um problema na pontuação de Agent Readiness do seu Website Audit.
  • howToRobotsTxt.identifyItem3

Uma lacuna real: nenhuma das três verificações confirma que a sua diretiva Sitemap: aponta realmente para um sitemap ativo e funcional - apenas que a própria linha é sintaticamente reconhecida.

Como Corrigir

1. Substitua um bloqueio genérico de IA por regras direcionadas, se é que bloqueia de todo

Decida deliberadamente quais crawlers de IA, se algum, realmente quer manter afastados - e restrinja apenas os caminhos específicos que importam, não o seu site inteiro:

Antes: bloqueia todos os crawlers de IA de tudotypescript
1User-agent: GPTBot
2Disallow: /
3
4User-agent: ClaudeBot
5Disallow: /
6
7User-agent: CCBot
8Disallow: /
Depois: permite crawlers de IA, mantém-nos fora de um caminho internotypescript
1User-agent: *
2Allow: /
3Disallow: /internal-search/
4
5Sitemap: https://example.com/sitemap.xml

2. Nunca use o robots.txt para esconder caminhos sensíveis

Se um caminho genuinamente precisa de se manter privado, proteja-o com autenticação ou uma meta tag noindex na própria página - não uma regra pública no robots.txt que apenas anuncia onde ele vive. Remova quaisquer entradas Disallow que apontem para diretórios de administração, backup ou staging.

3. Confirme que a correção surtiu efeito

Execute novamente um Website Audit depois de editar o robots.txt - a verificação "crawlers de IA não bloqueados" da pontuação de Agent Readiness refletirá a alteração imediatamente, já que lê o ficheiro em produção em cada verificação.

Como o Scanverra Deteta Isto

A pontuação de SEO do Website Audit executa uma verificação padrão de sintaxe e acessibilidade do robots.txt em cada verificação. Além disso, uma verificação dedicada de crawlers de IA lê o mesmo ficheiro em produção e procura especificamente um Disallow genérico dirigido a user-agents de IA conhecidos, apresentando-o como parte da pontuação de Agent Readiness; uma verificação separada na verificação de segurança assinala caminhos de aspeto sensível nomeados em regras Disallow. Três verificações, cada uma à procura de um modo de falha diferente.

FAQ

Frequently asked questions

O Scanverra valida todo o meu ficheiro robots.txt?

Sim, em duas camadas. A pontuação de SEO do Website Audit inclui uma verificação real de sintaxe do robots.txt - diretivas não reconhecidas, um mau estado HTTP ao obter o ficheiro, e problemas de formação semelhantes. Além disso, executam-se mais duas verificações direcionadas: se bloqueia genericamente crawlers de IA conhecidos, e se alguma regra Disallow expõe caminhos de aspeto sensível (como um diretório de administração ou backup) a quem ler o ficheiro. O que não faz é verificar se a sua diretiva Sitemap: aponta para um sitemap real e funcional.

Que crawlers de IA a verificação de crawlers bloqueados procura?

Agentes de IA conhecidos, incluindo o GPTBot, o ClaudeBot, o CCBot, o Google-Extended e o PerplexityBot, entre outros. A verificação procura especificamente um Disallow: / ou Disallow: /* genérico dirigido a estes user-agents, não restrições mais específicas e deliberadas em caminhos concretos.

Porque é que bloquear crawlers de IA prejudicaria o meu site?

À medida que mais pesquisa e descoberta passa por assistentes de IA que navegam ou citam a web em nome de um utilizador, um site que bloqueia genericamente esses crawlers torna-se invisível para todo esse canal - mesmo que se posicione bem na pesquisa tradicional. É um custo de visibilidade que a maioria das equipas não percebe que assumiu até lhe ser apontado.

Listar caminhos sensíveis no robots.txt não devia escondê-los?

Não - este é um equívoco comum. O robots.txt é um ficheiro público que qualquer pessoa pode pedir em oseusite.com/robots.txt. Uma regra Disallow não restringe o acesso, apenas pede aos crawlers bem-comportados que não indexem o caminho - pelo que listar /admin-backup/ ali entrega a qualquer pessoa que leia o ficheiro um mapa de exatamente onde procurar.

Como mantenho realmente os crawlers de IA fora de caminhos específicos sem os bloquear por completo?

Direcione o user-agent e o caminho específicos em vez de uma regra genérica - veja o exemplo de código abaixo. Assim pode, por exemplo, manter o GPTBot fora de um caminho interno de resultados de pesquisa sem o bloquear do resto do seu site.

Free - no sign-up required

Verifique se está a bloquear crawlers de IA

Execute um Website Audit gratuito e veja a sua pontuação de Agent Readiness, incluindo se o robots.txt está a bloquear agentes de IA.

Run free audit