Porque é que Isto Acontece
- Um
Disallow: /de staging chega à produção - um bloqueio genérico destinado a manter um site pré-lançamento fora dos motores de busca nunca é removido após o lançamento. - Uma regra destinada a um scraper agressivo é aplicada a tudo. Uma equipa bloqueia todos os crawlers para travar um mau ator, apanhando também todos os agentes de IA legítimos.
- Listas de bloqueio antigas antecedem os crawlers de IA de hoje. Um robots.txt escrito há anos contra uma lista fixa de "maus bots" agora inclui sem querer user-agents de IA mais recentes para os quais ninguém pensou em adicionar exceções.
- Caminhos sensíveis são listados no robots.txt como se fosse controlo de acesso. Uma equipa adiciona
Disallow: /admin-backup/com a intenção de esconder o diretório, sem perceber que o próprio ficheiro é público e agora anuncia exatamente onde procurar.
Como Identificar o Problema
O Scanverra verifica o seu robots.txt de três formas, desde a sintaxe geral até dois modos de falha específicos da era da IA:
- Sintaxe e acessibilidade. A pontuação de SEO do Website Audit inclui a verificação padrão de robots.txt do Lighthouse - confirma que o ficheiro é realmente acessível (não uma resposta 4xx/5xx) e que todas as diretivas que contém são reconhecidas pelos crawlers, assinalando regras malformadas como um problema de SEO.
- Bloqueio genérico de crawlers de IA. Uma verificação separada, específica do Scanverra, deteta um
Disallow: /ouDisallow: /*genérico dirigido a crawlers de IA conhecidos - GPTBot, ClaudeBot, CCBot, Google-Extended, PerplexityBot e semelhantes - e assinala-o como um problema na pontuação de Agent Readiness do seu Website Audit. - howToRobotsTxt.identifyItem3
Uma lacuna real: nenhuma das três verificações confirma que a sua diretiva Sitemap: aponta realmente para um sitemap ativo e funcional - apenas que a própria linha é sintaticamente reconhecida.
Como Corrigir
1. Substitua um bloqueio genérico de IA por regras direcionadas, se é que bloqueia de todo
Decida deliberadamente quais crawlers de IA, se algum, realmente quer manter afastados - e restrinja apenas os caminhos específicos que importam, não o seu site inteiro:
1User-agent: GPTBot
2Disallow: /
3
4User-agent: ClaudeBot
5Disallow: /
6
7User-agent: CCBot
8Disallow: /1User-agent: *
2Allow: /
3Disallow: /internal-search/
4
5Sitemap: https://example.com/sitemap.xml2. Nunca use o robots.txt para esconder caminhos sensíveis
Se um caminho genuinamente precisa de se manter privado, proteja-o com autenticação ou uma meta tag noindex na própria página - não uma regra pública no robots.txt que apenas anuncia onde ele vive. Remova quaisquer entradas Disallow que apontem para diretórios de administração, backup ou staging.
3. Confirme que a correção surtiu efeito
Execute novamente um Website Audit depois de editar o robots.txt - a verificação "crawlers de IA não bloqueados" da pontuação de Agent Readiness refletirá a alteração imediatamente, já que lê o ficheiro em produção em cada verificação.
Como o Scanverra Deteta Isto
A pontuação de SEO do Website Audit executa uma verificação padrão de sintaxe e acessibilidade do robots.txt em cada verificação. Além disso, uma verificação dedicada de crawlers de IA lê o mesmo ficheiro em produção e procura especificamente um Disallow genérico dirigido a user-agents de IA conhecidos, apresentando-o como parte da pontuação de Agent Readiness; uma verificação separada na verificação de segurança assinala caminhos de aspeto sensível nomeados em regras Disallow. Três verificações, cada uma à procura de um modo de falha diferente.