Skip to content
Rankora
Cuenta gratuita · 3 análisis en vivo/día

Verificador de acceso de rastreadores IA

Introduce un sitio: la herramienta lee su robots.txt y muestra, para cada rastreador de IA conocido, si puede rastrear, qué línea decide y para qué sirve: entrenamiento, búsqueda o acción de un usuario.

Privacidad y coste

Esta herramienta hace un análisis en vivo en nuestros servidores. Una cuenta gratuita incluye 3 análisis en vivo al día en total entre todas estas herramientas. Tu informe se guarda en tu cuenta y puedes borrarlo cuando quieras.

Cómo funciona

  1. Una sola petición obtiene el archivo /robots.txt del sitio.
  2. Cada rastreador se evalúa según la RFC 9309 (grupo más específico, regla más larga, Allow gana en empate).
  3. La tabla muestra el operador, la finalidad, el estado permitido o bloqueado y la regla responsable, con un resumen por finalidad.

Ejemplo

Con «User-agent: GPTBot / Disallow: /», GPTBot (entrenamiento) aparece bloqueado mientras OAI-SearchBot (búsqueda) sigue permitido si ninguna regla lo menciona.

Qué significa el resultado

Bloquear un rastreador de entrenamiento impide la recopilación para entrenar modelos; bloquear uno de búsqueda puede reducir la presencia en respuestas de IA. Robots.txt sigue siendo una petición: algunos agentes que actúan a petición de un usuario (por ejemplo ChatGPT-User, Perplexity-User) pueden no seguirlo, según sus operadores.

Problemas habituales que ayuda a resolver

  • Un Disallow: / para todos los robots que bloquea también los rastreadores de búsqueda con IA.
  • Bloquear GPTBot creyendo que también bloquea la búsqueda de ChatGPT (OAI-SearchBot es distinto).
  • Tokens obsoletos como anthropic-ai aún presentes.
  • Un robots.txt inaccesible tratado como bloqueo total.

Preguntas frecuentes

¿Qué diferencia hay entre GPTBot y OAI-SearchBot?

GPTBot recopila datos para entrenar los modelos de OpenAI; OAI-SearchBot alimenta la búsqueda. Se configuran por separado en robots.txt.

¿Google-Extended es un rastreador aparte?

Es un token de control: no tiene user-agent HTTP propio y regula el uso de tu contenido por ciertos productos de IA de Google. No afecta a la indexación en Búsqueda.

¿La lista es completa?

No. Recoge los rastreadores documentados por sus operadores a la fecha indicada en el resultado y cambia con regularidad.