Skip to content
Rankora
Gratis · sin cuenta

Verificador de robots.txt

Pega tu archivo o escribe un dominio. La herramienta aplica las reglas de la RFC 9309, señala errores e indica si un rastreador concreto puede acceder a una URL.

Privacidad y coste

Esta herramienta solicita desde nuestros servidores la URL pública que introduces. Es gratuita, con límite de frecuencia contra abusos, y no guardamos la URL ni el contenido de la página.

Cómo funciona

  1. Escribe un dominio para descargar su robots.txt o pega el contenido del archivo.
  2. Lee los errores y avisos de sintaxis con su número de línea y los grupos analizados.
  3. Prueba URL para un rastreador (Googlebot, Bingbot, GPTBot…): la herramienta muestra la regla decisiva, ya que gana la coincidencia más larga.

Ejemplo

Con un archivo de ejemplo de dos grupos, la herramienta señala «Noindex» (línea 6, no admitido por Google) y un Crawl-delay (línea 5, ignorado por Google). Para Googlebot, /private/report.html queda bloqueada por «Disallow: /private/» (línea 2), /private/press-kit.pdf se permite con «Allow: /private/press-kit.pdf» (línea 3) y /shoes?sort=price se bloquea con «Disallow: /*?sort=» (línea 4).

Qué significa el resultado

Una URL está permitida salvo que una regla Disallow la afecte. Si coinciden varias reglas, gana la más específica (la más larga) y Allow vence a Disallow en caso de empate. Los rastreadores usan el grupo del user-agent más específico y, si no hay, el de «*». Todo lo que pase de los primeros 500 KiB se ignora.

Problemas habituales que ayuda a resolver

  • Una regla Disallow demasiado amplia que bloquea páginas importantes sin que nadie lo note.
  • Directivas ignoradas (Noindex, erratas, Crawl-delay para Google) que se creen activas.
  • Un grupo de Googlebot que no repite las reglas del grupo «*»: los rastreadores aplican un solo grupo.
  • Un robots.txt inaccesible (5xx) o demasiado pesado cuyo comportamiento se malinterpreta.

Preguntas frecuentes

¿Por qué una URL bloqueada sigue apareciendo en Google?

robots.txt bloquea el rastreo, no la indexación. Google puede indexar la URL sin contenido si otras páginas la enlazan. Para excluirla, déjala rastreable y usa noindex.

¿La herramienta descarga mi archivo desde mi navegador?

No: la descarga pasa por nuestro servidor, que contacta con el sitio mediante una petición protegida, porque un navegador no puede leer el robots.txt de otro dominio. El análisis del contenido se hace después en tu navegador.

¿Qué tamaño máximo puede tener un robots.txt?

Google lee los primeros 500 KiB (mínimo de la RFC 9309). Las reglas posteriores se ignoran y la herramienta te avisa.