Probador de Robots.txt
Valida tus directivas de rastreo al instante
Control de Rastreadores
Gestiona cómo los bots de los motores de búsqueda perciben y navegan por la estructura de tu sitio web.
Privacidad de Datos
Identifica y bloquea directorios sensibles (como /admin o /privado) para que no aparezcan en los resultados de búsqueda.
Regex y Comodines
Nuestro probador admite patrones de coincidencia avanzados, incluyendo * (comodín) y $ (anclaje final).
Resultados Instantáneos
Validación en tiempo real de tus reglas sin necesidad de subir el archivo a tu servidor primero.
Entendiendo las Reglas de Robots.txt
El archivo `robots.txt` es lo primero que un bot busca al visitar tu sitio. Contiene un conjunto de "directivas" que indican a rastreadores específicos qué partes de tu sitio web no deben visitar. Aunque la mayoría de los bots siguen estas reglas, no son una medida de seguridad, sino más bien una señal de "Prohibido el paso".
Usando nuestro Probador de Robots.txt, puedes depurar conjuntos de reglas complejos y asegurarte de que páginas importantes no estén bloqueadas accidentalmente de ser indexadas por Google o Bing.
Directivas Comunes
- User-agent: Especifica a qué rastreador se aplican las siguientes reglas (ej., `*` para todos, `Googlebot`).
- Disallow: Especifica una ruta que NO debe ser rastreada.
- Allow: Sobrescribe específicamente una regla de Disallow para una subruta.
- Sitemap: Proporciona la URL completa de tu mapa del sitio XML.
Frequently Asked Questions
- Pega el contenido completo de tu archivo robots.txt en el cuadro de texto, o usa las reglas de ejemplo ya cargadas.
- Escribe el rastreador que quieres comprobar, como Googlebot, o un asterisco para probar todos los bots.
- Escribe la ruta de URL que quieres verificar, por ejemplo /blog/mi-post.
- Haz clic en Probar Directiva para ver si esa ruta está permitida o bloqueada para ese user-agent.
- Revisa el campo Regla Coincidente para ver exactamente qué línea de tu archivo produjo el resultado.
Un archivo robots.txt es una lista de directivas en texto plano agrupadas bajo encabezados User-agent. Cuando un rastreador visita tu sitio, primero solicita /robots.txt y lee el grupo de reglas que coincide con su propio nombre de user-agent, o el grupo con asterisco si no hay coincidencia específica. Dentro de ese grupo, el validador compara la ruta solicitada con cada regla Allow y Disallow y aplica la coincidencia más específica, es decir, el patrón de ruta más largo. Los comodines como el asterisco y los anclajes de final como el símbolo de dólar permiten que una sola directiva coincida con muchas URL a la vez, por eso es más seguro probar una regla que interpretarla a simple vista.
Disallow indica a un rastreador que no debe solicitar una ruta coincidente, mientras que Allow se usa para crear una excepción dentro de una regla Disallow más amplia, por ejemplo para permitir un archivo dentro de una carpeta bloqueada. Si una ruta coincide con una regla Allow y con una Disallow al mismo tiempo, la mayoría de los rastreadores aplican la regla con el patrón de ruta más específico (más largo), sin importar el orden en que aparezcan las líneas en el archivo.
No. Robots.txt es una instrucción voluntaria para rastreadores que se comportan correctamente, no un mecanismo de control de acceso. No puede proteger una página con contraseña, y los bots maliciosos suelen ignorarlo por completo. Cualquiera puede ver tu archivo robots.txt directamente, así que listar rutas sensibles ahí puede en realidad revelar su existencia. Usa autenticación, una etiqueta meta noindex o reglas de acceso a nivel de servidor para proteger u ocultar contenido de verdad.
Una regla amplia como Disallow: /assets/ o Disallow: /*.js, escrita para bloquear scripts antiguos de administración, puede atrapar sin querer los archivos CSS y JavaScript que tus páginas necesitan para renderizarse. Si Google no puede acceder a esos recursos, puede indexar una versión de tu página que se ve rota y evaluar mal la usabilidad móvil. Prueba siempre las rutas de recursos clave, como /static/style.css, después de editar tus reglas.
El archivo robots.txt debe estar en la raíz de tu dominio, como https://ejemplo.com/robots.txt, y solo se aplica a ese host, protocolo y puerto exactos. Un archivo en /blog/robots.txt o en un subdominio distinto no tiene ningún efecto sobre el resto de tu sitio. Cada subdominio que necesite reglas de rastreo requiere su propio archivo robots.txt en su propia raíz.