Pourquoi cela se produit
- Un
Disallow: /de préproduction se retrouve en production - un blocage général destiné à tenir un site pré-lancement hors des moteurs de recherche n'est jamais retiré après le lancement. - Une règle destinée à un scraper agressif s'applique à tout. Une équipe bloque tous les crawlers pour arrêter un acteur malveillant, entraînant avec lui chaque agent IA légitime.
- D'anciennes listes de blocage datent d'avant les crawlers IA actuels. Un robots.txt écrit il y a des années contre une liste fixe de « mauvais bots » inclut désormais involontairement de nouveaux user-agents IA auxquels personne n'a pensé à ajouter d'exceptions.
- Des chemins sensibles sont listés dans robots.txt comme s'il s'agissait d'un contrôle d'accès. Une équipe ajoute
Disallow: /admin-backup/avec l'intention de cacher le répertoire, sans réaliser que le fichier lui-même est public et annonce désormais exactement où chercher.
Comment identifier le problème
Scanverra vérifie votre robots.txt de trois façons, de la syntaxe générale jusqu'à deux modes d'échec spécifiques à l'ère de l'IA :
- Syntaxe et accessibilité. Le score SEO du Website Audit inclut le contrôle robots.txt standard de Lighthouse - il confirme que le fichier est réellement accessible (pas de réponse 4xx/5xx) et que chaque directive qu'il contient est reconnue par les crawlers, signalant les règles malformées comme un problème SEO.
- Blocage général des crawlers IA. Un contrôle distinct, spécifique à Scanverra, détecte un
Disallow: /ouDisallow: /*général visant des crawlers IA connus - GPTBot, ClaudeBot, CCBot, Google-Extended, PerplexityBot, et similaires - et le signale comme un problème dans le score Agent Readiness de votre Website Audit. - howToRobotsTxt.identifyItem3
Une vraie lacune : aucun des trois ne confirme que votre directive Sitemap: pointe réellement vers un sitemap en direct et fonctionnel - seulement que la ligne elle-même est syntaxiquement reconnue.
Comment le corriger
1. Remplacez un blocage IA général par des règles ciblées, si vous bloquez ne serait-ce qu'un peu
Décidez délibérément quels crawlers IA, le cas échéant, vous souhaitez réellement exclure - et ne restreignez que les chemins spécifiques qui comptent, pas l'ensemble de votre site :
1User-agent: GPTBot
2Disallow: /
3
4User-agent: ClaudeBot
5Disallow: /
6
7User-agent: CCBot
8Disallow: /1User-agent: *
2Allow: /
3Disallow: /internal-search/
4
5Sitemap: https://example.com/sitemap.xml2. N'utilisez jamais robots.txt pour cacher des chemins sensibles
Si un chemin doit réellement rester privé, protégez-le avec une authentification ou une balise meta noindex sur la page elle-même - pas une règle robots.txt publique qui annonce simplement où il se trouve. Supprimez toute entrée Disallow pointant vers des répertoires d'administration, de sauvegarde ou de préproduction.
3. Confirmez que la correction a pris effet
Relancez un Website Audit après avoir modifié robots.txt - le contrôle « Crawlers IA non bloqués » du score Agent Readiness reflétera immédiatement le changement puisqu'il lit le fichier en direct à chaque scan.
Comment Scanverra détecte cela
Le score SEO du Website Audit exécute un contrôle standard de syntaxe et d'accessibilité de robots.txt à chaque scan. En plus de cela, un contrôle dédié aux crawlers IA lit le même fichier en direct et recherche spécifiquement un Disallow de type général visant des user-agents IA connus, le faisant apparaître dans le score Agent Readiness ; un contrôle distinct dans le scan de sécurité signale les chemins d'apparence sensible nommés dans les règles Disallow. Trois contrôles, chacun recherchant un mode d'échec différent.