Skip to content
Rankora
Cuenta gratuita · 3 análisis en vivo/día

Auditoría de bloqueo robots

Introduce una URL: la herramienta lee el robots.txt del sitio, aplica la RFC 9309 a cada rastreador y revisa también las directivas noindex de la página.

Privacidad y coste

Esta herramienta hace un análisis en vivo en nuestros servidores. Una cuenta gratuita incluye 3 análisis en vivo al día en total entre todas estas herramientas. Tu informe se guarda en tu cuenta y puedes borrarlo cuando quieras.

Cómo funciona

  1. Obtenemos /robots.txt y la página (dos peticiones).
  2. El archivo se interpreta según la RFC 9309: grupo más específico, regla más larga, Allow gana en empate y comodines * y $.
  3. El resultado indica, por rastreador, si se permite el rastreo y qué línea decide, y después si la página lleva noindex (meta o X-Robots-Tag).

Ejemplo

Un robots.txt con «Disallow: /privado/» bloquea /privado/pagina para todos los rastreadores: la herramienta muestra la línea responsable. Si la página también tiene noindex, avisa de que Google no puede leerlo.

Qué significa el resultado

Bloqueado por robots.txt significa que el rastreador no visita la URL, no que salga del índice: una URL bloqueada pero enlazada puede indexarse sin contenido. Para retirar una página, déjala rastreable y usa noindex. Un robots.txt que responde 5xx se trata como bloqueo total.

Problemas habituales que ayuda a resolver

  • Una sección estratégica bloqueada por un Disallow demasiado amplio.
  • Un noindex en una página también bloqueada por robots.txt: Google nunca lo ve.
  • Un robots.txt inaccesible (5xx) que bloquea todo el sitio.
  • Rastreadores de IA bloqueados o permitidos por error.

Preguntas frecuentes

¿Qué estándar se aplica?

La RFC 9309 (Robots Exclusion Protocol): coincidencia más larga, Allow gana en empate y las rutas distinguen mayúsculas.

¿robots.txt impide la indexación?

No, impide el rastreo. Para impedir la indexación usa noindex en una página rastreable.

¿Puede un rastreador ignorar robots.txt?

Sí, es una petición de buena conducta, no un control de acceso. No protejas contenido sensible con robots.txt.