Probador de robots.txt: ¿pueden los buscadores rastrear esta página?
Escribe la dirección de una página y elige un rastreador. La herramienta lee el robots.txt del sitio, encuentra la regla que decide y te dice si la página se puede rastrear.
Esta herramienta comprueba una sola cosa. El Verificador SEO de sitios web con IA analiza todo tu sitio web: 23 comprobaciones, todas las páginas públicas, tres páginas leídas en profundidad y las palabras clave con las que puedes posicionarte.
Analiza el SEO de tu sitio web con IA →Para qué sirve robots.txt
Robots.txt es un archivo de texto plano que está en la raíz de un sitio web (tuempresa.com/robots.txt). Los rastreadores lo leen antes que nada para saber qué partes del sitio pueden visitar. Es una petición, no un candado: los rastreadores que se portan bien, como Googlebot y Bingbot, lo respetan, mientras que los bots maliciosos lo ignoran, así que nunca confíes en él para ocultar páginas privadas.
Cómo decide este probador
- Encuentra el grupo correcto. Robots.txt se divide en grupos, y cada uno empieza con una o más líneas User-agent. Un rastreador sigue el grupo cuyo nombre coincide más con el suyo (Googlebot-Image sigue un grupo Googlebot-Image; en su defecto, un grupo Googlebot; y, si tampoco lo hay, el grupo para todos los rastreadores, *).
- Encuentra las reglas que coinciden con la dirección. Una regla coincide cuando la dirección empieza por su ruta. Un asterisco (*) representa cualquier texto y el signo de dólar ($) marca el final de la dirección.
- Gana la regla más específica. De todas las reglas que coinciden, decide la que tiene la ruta más larga. Cuando un Allow y un Disallow tienen la misma longitud, gana Allow. Si ninguna regla coincide, la página se puede rastrear.
Estas son las reglas que Google publica y sigue, así que la respuesta que ves aquí es la que obtiene Googlebot.
Errores comunes
- Un Disallow: / que quedó del sitio de desarrollo, que deja todo el sitio web fuera de las búsquedas.
- Bloquear las carpetas de CSS y JavaScript, de modo que Google no puede renderizar la página tal como la ven los visitantes.
- Usar robots.txt para quitar una página de Google. Una página bloqueada puede seguir apareciendo, sin descripción, si otros sitios enlazan a ella. Usa en su lugar una etiqueta noindex y deja que la página se rastree para que Google la vea.
- Un robots.txt que responde con un error del servidor. En ese caso, Google pausa el rastreo de todo el sitio.
Robots.txt también es el mejor lugar para indicar tu sitemap con una línea Sitemap. Revísalo con el verificador de sitemap y mira cómo lee Google todo tu sitio con el Verificador SEO de sitios web con IA.
Probador de robots.txt: preguntas y respuestas
¿Para qué sirve robots.txt?
Indica a los rastreadores qué partes de un sitio pueden visitar. No elimina páginas de Google: una página bloqueada puede aparecer igualmente si otros sitios la enlazan. Para mantener una página fuera de los resultados, usa una etiqueta noindex y deja que se pueda rastrear.
¿Qué regla gana cuando coinciden dos reglas?
Google usa la regla más específica, la de la ruta más larga. Cuando una regla Allow y una Disallow tienen la misma longitud, gana Allow. Este probador sigue las mismas reglas.
¿Qué pasa si un sitio no tiene robots.txt?
Si robots.txt devuelve "no encontrado", los rastreadores pueden rastrearlo todo. Si el servidor responde con un error (un código 5xx), Google deja de rastrear el sitio durante un tiempo, así que un robots.txt roto es peor que no tener ninguno.
¿Debo bloquear los rastreadores de IA como GPTBot?
Es una decisión de negocio. Bloquearlos mantiene tu contenido fuera de algunos entrenamientos y respuestas de IA, pero también puede dejar a tu negocio fuera de las respuestas que la gente lee en los asistentes de IA.
AI Web Maker