Por qué ocurre esto
- Un
Disallow: /de staging llega a producción: un bloqueo total pensado para mantener un sitio previo al lanzamiento fuera de los motores de búsqueda nunca se elimina después del lanzamiento. - Una regla pensada para un scraper agresivo se aplica a todo. Un equipo bloquea a todos los rastreadores para detener a un mal actor, arrastrando con ello a cada agente de IA legítimo.
- Las listas de bloqueo antiguas son anteriores a los rastreadores de IA actuales. Un robots.txt escrito hace años contra una lista fija de "bots malos" ahora incluye sin querer agentes de usuario de IA más nuevos para los que nadie pensó en añadir excepciones.
- Se listan rutas sensibles en robots.txt como si fuera control de acceso. Un equipo añade
Disallow: /admin-backup/con la intención de ocultar el directorio, sin darse cuenta de que el archivo en sí es público y ahora anuncia exactamente dónde buscar.
Cómo identificar el problema
Scanverra verifica su robots.txt de tres maneras, desde la sintaxis general hasta dos modos de fallo específicos de la era de la IA:
- Sintaxis y accesibilidad. La puntuación SEO de la Auditoría de sitio web incluye la verificación estándar de robots.txt de Lighthouse: confirma que el archivo realmente es accesible (no una respuesta 4xx/5xx) y que cada directiva que contiene es una que los rastreadores reconocen, señalando las reglas malformadas como un problema de SEO.
- Bloqueo total de rastreadores de IA. Una verificación separada, específica de Scanverra, detecta un
Disallow: /oDisallow: /*total dirigido a rastreadores de IA conocidos (GPTBot, ClaudeBot, CCBot, Google-Extended, PerplexityBot y similares) y lo señala como un problema en la puntuación de Preparación para agentes de su Auditoría de sitio web. - howToRobotsTxt.identifyItem3
Un vacío real: ninguna de las tres confirma que su directiva Sitemap: realmente apunte a un mapa del sitio activo y funcional; solo que la línea en sí se reconoce sintácticamente.
Cómo solucionarlo
1. Reemplace un bloqueo total de IA por reglas específicas, si es que va a bloquear
Decida deliberadamente qué rastreadores de IA, si acaso alguno, realmente quiere mantener fuera, y restrinja solo las rutas específicas que importan, no todo su sitio:
1User-agent: GPTBot
2Disallow: /
3
4User-agent: ClaudeBot
5Disallow: /
6
7User-agent: CCBot
8Disallow: /1User-agent: *
2Allow: /
3Disallow: /internal-search/
4
5Sitemap: https://example.com/sitemap.xml2. Nunca use robots.txt para ocultar rutas sensibles
Si una ruta genuinamente necesita permanecer privada, protéjala con autenticación o con una meta etiqueta noindex en la propia página, no con una regla pública de robots.txt que simplemente anuncie dónde vive. Elimine cualquier entrada Disallow que apunte a directorios de administración, de copia de seguridad o de staging.
3. Confirme que la corrección surtió efecto
Vuelva a ejecutar una Auditoría de sitio web después de editar robots.txt: la verificación de "rastreadores de IA no bloqueados" de la puntuación de Preparación para agentes reflejará el cambio de inmediato, ya que lee el archivo en vivo en cada escaneo.
Cómo detecta Scanverra este problema
La puntuación SEO de la Auditoría de sitio web ejecuta una verificación estándar de sintaxis y accesibilidad de robots.txt en cada escaneo. Además, una verificación dedicada de rastreadores de IA lee el mismo archivo en vivo y busca específicamente un Disallow de estilo total dirigido a agentes de usuario de IA conocidos, mostrándolo como parte de la puntuación de Preparación para agentes; una verificación separada en el escaneo de seguridad señala las rutas de apariencia sensible nombradas en reglas Disallow. Tres verificaciones, cada una buscando un modo de fallo diferente.