Scanverra

Cómo solucionar que robots.txt bloquee a los rastreadores de IA

robots.txt es un archivo de texto plano en la raíz de su dominio que indica a los rastreadores qué rutas tienen permitido solicitar. Una única regla Disallow demasiado amplia, a menudo copiada de un entorno de staging o escrita para detener a un bot problemático, puede bloquear silenciosamente a todos los rastreadores de IA de todo su sitio, dejándolo fuera de la búsqueda impulsada por IA y de los resultados de asistentes sin ninguna advertencia.

Por qué ocurre esto

  • Un Disallow: / de staging llega a producción: un bloqueo total pensado para mantener un sitio previo al lanzamiento fuera de los motores de búsqueda nunca se elimina después del lanzamiento.
  • Una regla pensada para un scraper agresivo se aplica a todo. Un equipo bloquea a todos los rastreadores para detener a un mal actor, arrastrando con ello a cada agente de IA legítimo.
  • Las listas de bloqueo antiguas son anteriores a los rastreadores de IA actuales. Un robots.txt escrito hace años contra una lista fija de "bots malos" ahora incluye sin querer agentes de usuario de IA más nuevos para los que nadie pensó en añadir excepciones.
  • Se listan rutas sensibles en robots.txt como si fuera control de acceso. Un equipo añade Disallow: /admin-backup/ con la intención de ocultar el directorio, sin darse cuenta de que el archivo en sí es público y ahora anuncia exactamente dónde buscar.

Cómo identificar el problema

Scanverra verifica su robots.txt de tres maneras, desde la sintaxis general hasta dos modos de fallo específicos de la era de la IA:

  • Sintaxis y accesibilidad. La puntuación SEO de la Auditoría de sitio web incluye la verificación estándar de robots.txt de Lighthouse: confirma que el archivo realmente es accesible (no una respuesta 4xx/5xx) y que cada directiva que contiene es una que los rastreadores reconocen, señalando las reglas malformadas como un problema de SEO.
  • Bloqueo total de rastreadores de IA. Una verificación separada, específica de Scanverra, detecta un Disallow: / o Disallow: /* total dirigido a rastreadores de IA conocidos (GPTBot, ClaudeBot, CCBot, Google-Extended, PerplexityBot y similares) y lo señala como un problema en la puntuación de Preparación para agentes de su Auditoría de sitio web.
  • howToRobotsTxt.identifyItem3

Un vacío real: ninguna de las tres confirma que su directiva Sitemap: realmente apunte a un mapa del sitio activo y funcional; solo que la línea en sí se reconoce sintácticamente.

Cómo solucionarlo

1. Reemplace un bloqueo total de IA por reglas específicas, si es que va a bloquear

Decida deliberadamente qué rastreadores de IA, si acaso alguno, realmente quiere mantener fuera, y restrinja solo las rutas específicas que importan, no todo su sitio:

Antes: bloquea a todos los rastreadores de IA de todotypescript
1User-agent: GPTBot
2Disallow: /
3
4User-agent: ClaudeBot
5Disallow: /
6
7User-agent: CCBot
8Disallow: /
Después: permite a los rastreadores de IA, los mantiene fuera de una ruta internatypescript
1User-agent: *
2Allow: /
3Disallow: /internal-search/
4
5Sitemap: https://example.com/sitemap.xml

2. Nunca use robots.txt para ocultar rutas sensibles

Si una ruta genuinamente necesita permanecer privada, protéjala con autenticación o con una meta etiqueta noindex en la propia página, no con una regla pública de robots.txt que simplemente anuncie dónde vive. Elimine cualquier entrada Disallow que apunte a directorios de administración, de copia de seguridad o de staging.

3. Confirme que la corrección surtió efecto

Vuelva a ejecutar una Auditoría de sitio web después de editar robots.txt: la verificación de "rastreadores de IA no bloqueados" de la puntuación de Preparación para agentes reflejará el cambio de inmediato, ya que lee el archivo en vivo en cada escaneo.

Cómo detecta Scanverra este problema

La puntuación SEO de la Auditoría de sitio web ejecuta una verificación estándar de sintaxis y accesibilidad de robots.txt en cada escaneo. Además, una verificación dedicada de rastreadores de IA lee el mismo archivo en vivo y busca específicamente un Disallow de estilo total dirigido a agentes de usuario de IA conocidos, mostrándolo como parte de la puntuación de Preparación para agentes; una verificación separada en el escaneo de seguridad señala las rutas de apariencia sensible nombradas en reglas Disallow. Tres verificaciones, cada una buscando un modo de fallo diferente.

FAQ

Frequently asked questions

¿Valida Scanverra todo mi archivo robots.txt?

Sí, en dos capas. La puntuación SEO de la Auditoría de sitio web incluye una verificación real de sintaxis de robots.txt: directivas no reconocidas, un estado HTTP incorrecto al obtener el archivo y problemas de malformación similares. Además de eso, se ejecutan dos verificaciones más específicas: si bloquea de forma total a rastreadores de IA conocidos, y si alguna regla Disallow expone rutas de apariencia sensible (como un directorio de administración o de copia de seguridad) a cualquiera que lea el archivo. Lo que no hace es verificar si su directiva Sitemap: apunta a un mapa del sitio real y funcional.

¿Qué rastreadores de IA busca la verificación de rastreadores bloqueados?

Agentes de IA conocidos incluyendo GPTBot, ClaudeBot, CCBot, Google-Extended y PerplexityBot, entre otros. La verificación busca específicamente un Disallow: / o Disallow: /* total dirigido a estos agentes de usuario, no restricciones más específicas y deliberadas sobre rutas concretas.

¿Por qué perjudicaría a mi sitio bloquear a los rastreadores de IA?

A medida que más búsqueda y descubrimiento pasa a través de asistentes de IA que navegan o citan la web en nombre de un usuario, un sitio que bloquea totalmente a esos rastreadores se vuelve invisible para todo ese canal, incluso si posiciona bien en la búsqueda tradicional. Es un costo de visibilidad que la mayoría de los equipos no se dan cuenta de que han asumido hasta que se lo señalan.

¿No se supone que listar rutas sensibles en robots.txt sirve para ocultarlas?

No, este es un malentendido común. robots.txt es un archivo público que cualquiera puede solicitar en susitio.com/robots.txt. Una regla Disallow no restringe el acceso, solo pide a los rastreadores bien portados que no indexen la ruta, así que listar /admin-backup/ ahí le entrega a cualquiera que lea el archivo un mapa de exactamente dónde buscar.

¿Cómo mantengo realmente a los rastreadores de IA fuera de rutas específicas sin bloquearlos por completo?

Apunte al agente de usuario y la ruta específicos en lugar de a una regla total: vea el ejemplo de código más abajo. De esa manera puede, por ejemplo, mantener a GPTBot fuera de una ruta interna de resultados de búsqueda sin bloquearlo del resto de su sitio.

Free - no sign-up required

Verifique si está bloqueando a los rastreadores de IA

Ejecute una Auditoría de sitio web gratuita y vea su puntuación de Preparación para agentes, incluyendo si robots.txt está bloqueando a agentes de IA.

Run free audit