Verificador de robots.txt
Pega tu archivo o escribe un dominio. La herramienta aplica las reglas de la RFC 9309, señala errores e indica si un rastreador concreto puede acceder a una URL.
Privacidad y coste
Esta herramienta solicita desde nuestros servidores la URL pública que introduces. Es gratuita, con límite de frecuencia contra abusos, y no guardamos la URL ni el contenido de la página.
Cómo funciona
- Escribe un dominio para descargar su robots.txt o pega el contenido del archivo.
- Lee los errores y avisos de sintaxis con su número de línea y los grupos analizados.
- Prueba URL para un rastreador (Googlebot, Bingbot, GPTBot…): la herramienta muestra la regla decisiva, ya que gana la coincidencia más larga.
Ejemplo
Con un archivo de ejemplo de dos grupos, la herramienta señala «Noindex» (línea 6, no admitido por Google) y un Crawl-delay (línea 5, ignorado por Google). Para Googlebot, /private/report.html queda bloqueada por «Disallow: /private/» (línea 2), /private/press-kit.pdf se permite con «Allow: /private/press-kit.pdf» (línea 3) y /shoes?sort=price se bloquea con «Disallow: /*?sort=» (línea 4).
Qué significa el resultado
Una URL está permitida salvo que una regla Disallow la afecte. Si coinciden varias reglas, gana la más específica (la más larga) y Allow vence a Disallow en caso de empate. Los rastreadores usan el grupo del user-agent más específico y, si no hay, el de «*». Todo lo que pase de los primeros 500 KiB se ignora.
Problemas habituales que ayuda a resolver
- Una regla Disallow demasiado amplia que bloquea páginas importantes sin que nadie lo note.
- Directivas ignoradas (Noindex, erratas, Crawl-delay para Google) que se creen activas.
- Un grupo de Googlebot que no repite las reglas del grupo «*»: los rastreadores aplican un solo grupo.
- Un robots.txt inaccesible (5xx) o demasiado pesado cuyo comportamiento se malinterpreta.
Preguntas frecuentes
¿Por qué una URL bloqueada sigue apareciendo en Google?
robots.txt bloquea el rastreo, no la indexación. Google puede indexar la URL sin contenido si otras páginas la enlazan. Para excluirla, déjala rastreable y usa noindex.
¿La herramienta descarga mi archivo desde mi navegador?
No: la descarga pasa por nuestro servidor, que contacta con el sitio mediante una petición protegida, porque un navegador no puede leer el robots.txt de otro dominio. El análisis del contenido se hace después en tu navegador.
¿Qué tamaño máximo puede tener un robots.txt?
Google lee los primeros 500 KiB (mínimo de la RFC 9309). Las reglas posteriores se ignoran y la herramienta te avisa.
Herramientas relacionadas
- Generador de robots.txtElige una plantilla, añade tu sitemap y reglas para rastreadores concretos. El robots.txt se genera y un analizador RFC 9309 lo revisa antes de descargarlo.Gratis · en tu navegador
- Verificador de meta robots y X-Robots-TagEscribe una URL o pega el HTML y las cabeceras: la herramienta lee todas las directivas robots, detecta contradicciones y explica qué hace cada una.Gratis · sin cuenta
- Validador de sitemap XMLEscribe la dirección del sitemap o pega su XML: la herramienta revisa la estructura, los límites y cada valor, y calcula cuántos archivos necesitas.Gratis · sin cuenta
- Generador de sitemap XMLPega tus URL, una por línea: la herramienta genera un sitemap.xml válido, con el escapado correcto, y lo divide con un índice si superas los límites.Gratis · en tu navegador
- Auditoría de bloqueo robotsIntroduce una URL: la herramienta lee el robots.txt del sitio, aplica la RFC 9309 a cada rastreador y revisa también las directivas noindex de la página.Cuenta gratuita · 3 análisis en vivo/día
- Verificador de acceso de rastreadores IAIntroduce un sitio: la herramienta lee su robots.txt y muestra, para cada rastreador de IA conocido, si puede rastrear, qué línea decide y para qué sirve: entrenamiento, búsqueda o acción de un usuario.Cuenta gratuita · 3 análisis en vivo/día