Scanverra

Comment corriger un robots.txt qui bloque les crawlers IA

robots.txt est un fichier texte brut à la racine de votre domaine qui indique aux crawlers quels chemins ils sont autorisés à demander. Une seule règle Disallow trop large - souvent copiée depuis un environnement de préproduction ou écrite pour arrêter un bot malveillant - peut silencieusement bloquer tous les crawlers IA de l'ensemble de votre site, vous excluant des résultats de recherche et d'assistants alimentés par l'IA sans aucun avertissement.

Pourquoi cela se produit

  • Un Disallow: / de préproduction se retrouve en production - un blocage général destiné à tenir un site pré-lancement hors des moteurs de recherche n'est jamais retiré après le lancement.
  • Une règle destinée à un scraper agressif s'applique à tout. Une équipe bloque tous les crawlers pour arrêter un acteur malveillant, entraînant avec lui chaque agent IA légitime.
  • D'anciennes listes de blocage datent d'avant les crawlers IA actuels. Un robots.txt écrit il y a des années contre une liste fixe de « mauvais bots » inclut désormais involontairement de nouveaux user-agents IA auxquels personne n'a pensé à ajouter d'exceptions.
  • Des chemins sensibles sont listés dans robots.txt comme s'il s'agissait d'un contrôle d'accès. Une équipe ajoute Disallow: /admin-backup/ avec l'intention de cacher le répertoire, sans réaliser que le fichier lui-même est public et annonce désormais exactement où chercher.

Comment identifier le problème

Scanverra vérifie votre robots.txt de trois façons, de la syntaxe générale jusqu'à deux modes d'échec spécifiques à l'ère de l'IA :

  • Syntaxe et accessibilité. Le score SEO du Website Audit inclut le contrôle robots.txt standard de Lighthouse - il confirme que le fichier est réellement accessible (pas de réponse 4xx/5xx) et que chaque directive qu'il contient est reconnue par les crawlers, signalant les règles malformées comme un problème SEO.
  • Blocage général des crawlers IA. Un contrôle distinct, spécifique à Scanverra, détecte un Disallow: / ou Disallow: /* général visant des crawlers IA connus - GPTBot, ClaudeBot, CCBot, Google-Extended, PerplexityBot, et similaires - et le signale comme un problème dans le score Agent Readiness de votre Website Audit.
  • howToRobotsTxt.identifyItem3

Une vraie lacune : aucun des trois ne confirme que votre directive Sitemap: pointe réellement vers un sitemap en direct et fonctionnel - seulement que la ligne elle-même est syntaxiquement reconnue.

Comment le corriger

1. Remplacez un blocage IA général par des règles ciblées, si vous bloquez ne serait-ce qu'un peu

Décidez délibérément quels crawlers IA, le cas échéant, vous souhaitez réellement exclure - et ne restreignez que les chemins spécifiques qui comptent, pas l'ensemble de votre site :

Avant : bloque tous les crawlers IA de touttypescript
1User-agent: GPTBot
2Disallow: /
3
4User-agent: ClaudeBot
5Disallow: /
6
7User-agent: CCBot
8Disallow: /
Après : autorise les crawlers IA, les tient à l'écart d'un seul chemin internetypescript
1User-agent: *
2Allow: /
3Disallow: /internal-search/
4
5Sitemap: https://example.com/sitemap.xml

2. N'utilisez jamais robots.txt pour cacher des chemins sensibles

Si un chemin doit réellement rester privé, protégez-le avec une authentification ou une balise meta noindex sur la page elle-même - pas une règle robots.txt publique qui annonce simplement où il se trouve. Supprimez toute entrée Disallow pointant vers des répertoires d'administration, de sauvegarde ou de préproduction.

3. Confirmez que la correction a pris effet

Relancez un Website Audit après avoir modifié robots.txt - le contrôle « Crawlers IA non bloqués » du score Agent Readiness reflétera immédiatement le changement puisqu'il lit le fichier en direct à chaque scan.

Comment Scanverra détecte cela

Le score SEO du Website Audit exécute un contrôle standard de syntaxe et d'accessibilité de robots.txt à chaque scan. En plus de cela, un contrôle dédié aux crawlers IA lit le même fichier en direct et recherche spécifiquement un Disallow de type général visant des user-agents IA connus, le faisant apparaître dans le score Agent Readiness ; un contrôle distinct dans le scan de sécurité signale les chemins d'apparence sensible nommés dans les règles Disallow. Trois contrôles, chacun recherchant un mode d'échec différent.

FAQ

Frequently asked questions

Scanverra valide-t-il l'ensemble de mon fichier robots.txt ?

Oui, sur deux niveaux. Le score SEO du Website Audit inclut un véritable contrôle de syntaxe robots.txt - directives non reconnues, mauvais statut HTTP lors de la récupération du fichier, et problèmes de malformation similaires. En plus de cela, deux contrôles plus ciblés s'exécutent : si le fichier bloque de façon générale les crawlers IA connus, et si une règle Disallow expose des chemins d'apparence sensible (comme un répertoire d'administration ou de sauvegarde) à quiconque lit le fichier. Ce qu'il ne fait pas : vérifier si votre directive Sitemap: pointe vers un sitemap réel et fonctionnel.

Quels crawlers IA le contrôle des crawlers bloqués recherche-t-il ?

Des agents IA connus incluant GPTBot, ClaudeBot, CCBot, Google-Extended et PerplexityBot, entre autres. Le contrôle recherche spécifiquement un Disallow: / ou Disallow: /* général visant ces user-agents, pas des restrictions plus étroites et délibérées sur des chemins spécifiques.

Pourquoi bloquer les crawlers IA nuirait-il à mon site ?

À mesure qu'une part croissante de la recherche et de la découverte passe par des assistants IA qui parcourent ou citent le web pour le compte d'un utilisateur, un site qui bloque ces crawlers de façon générale devient invisible pour tout ce canal - même s'il se classe bien dans la recherche traditionnelle. C'est un coût de visibilité que la plupart des équipes ne réalisent pas avoir pris jusqu'à ce qu'on le leur signale.

Lister des chemins sensibles dans robots.txt n'est-il pas censé les cacher ?

Non - c'est une idée reçue courante. robots.txt est un fichier public que quiconque peut demander sur monsite.com/robots.txt. Une règle Disallow ne restreint pas l'accès, elle demande simplement aux crawlers bien élevés de ne pas indexer le chemin - lister /admin-backup/ dedans donne donc à quiconque lit le fichier une carte de l'endroit exact où chercher.

Comment puis-je réellement tenir les crawlers IA à l'écart de chemins spécifiques sans les bloquer entièrement ?

Ciblez le user-agent et le chemin spécifiques plutôt qu'une règle générale - voir l'exemple de code ci-dessous. Vous pouvez ainsi, par exemple, tenir GPTBot à l'écart d'un chemin de résultats de recherche interne sans le bloquer du reste de votre site.

Free - no sign-up required

Vérifiez si vous bloquez les crawlers IA

Lancez un Website Audit gratuit et découvrez votre score Agent Readiness, y compris si robots.txt bloque les agents IA.

Run free audit