Probador de robots.txt
Se ejecuta por completo en tu navegador: nada de lo que pegues se sube ni se almacena. The server is only used to fetch a site's robots.txt or sitemap (browsers can't — no CORS). Los contadores anónimos de resultados por ejecución pueden utilizarse para investigación agregada; nunca incluyen URL, dominios, IP ni identificadores, y no se publica ninguna estadística con menos de 100 ejecuciones.
+ guarda el sitio o la página actuales. Usa ☆ junto a cualquier sitio, página o lista guardados para añadirlos a favoritos. El historial de comprobaciones recientes aparece debajo.
Crear una lista con nombre
Destino rellenado desde tus selecciones locales.
Pasaporte del sitio Contexto local de este sitio guardado
Datos locales
Los destinos guardados, las listas con nombre y los resúmenes de comprobaciones recientes permanecen solo en este navegador.
Identical rows are grouped — click a row's count to expand. Click any cell to see the exact rule that decided it. On mobile, scroll the table sideways.
Why this verdict and how to verify it
Valorar esta herramienta
Acerca de esta herramienta
Audita con un clic el acceso de los principales rastreadores de IA, LLM y buscadores.
Consulta un dominio, pega una lista de URL o carga URL desde un sitemap, incluido un robots.txt activo e independiente para cada subdominio proporcionado, con un máximo de 10 orígenes por ejecución.
Funciones
- Coincidencia compatible con Google: prevalece la regla más específica, con comodines, herencia del subagente y reglas según el código de estado.
- Añade un grupo de user-agent para cada bot de IA —como GPTBot, Google-Extended, ClaudeBot, CCBot y PerplexityBot— con Disallow: /. Usa el botón de auditoría de rastreadores de IA para cargarlos y confirmar qué regla coincide. Respetar robots.txt es voluntario; los bots fiables lo hacen, pero no es un mecanismo de control de acceso.
- Google renderiza las páginas para entenderlas. Si no puede obtener el CSS y JavaScript necesarios, puede interpretar mal el diseño, el contenido o la compatibilidad móvil. Permite los recursos necesarios para el renderizado y bloquea únicamente rutas prescindibles.
- robots.txt no avisa cuando un Disallow mal colocado oculta media web a Google. Prueba las URL con un comparador basado en el parser de Google.
Cómo funciona
El comparador utiliza el parser de robots.txt de código abierto de Google: prevalece la regla más específica, con comodines, herencia del subagente y reglas por código de estado. Compara cada URL con cada grupo de user-agent y muestra la regla ganadora, los conflictos y las advertencias de lint.
Limitaciones
- La comparación se ejecuta por completo en el navegador: los archivos pegados nunca salen de tu dispositivo.
- Aquí no se infiere el comportamiento de rastreadores ajenos a Google; consulta la documentación del rastreador antes de interpretar el resultado.
Preguntas frecuentes
¿robots.txt impide que una página se indexe?
No. Una regla de bloqueo impide el rastreo, no la indexación. Para excluir una página, permite rastrearla y añade noindex mediante meta robots o X-Robots-Tag; si también la bloqueas, Google no podrá ver noindex.
¿Importa el orden de las reglas en robots.txt?
No para Google. Aplica la regla más específica, es decir, la ruta coincidente más larga. Otros robots pueden usar la primera coincidencia, así que mantén reglas inequívocas.
¿Cuál es la diferencia entre bloquear y usar noindex?
Una regla de robots.txt evita que el robot obtenga una URL. noindex en una etiqueta meta o cabecera HTTP evita que permanezca en el índice. Combinarlos falla porque una página bloqueada no se obtiene y no se ve noindex.
¿Bloquear CSS o JavaScript en robots.txt perjudica al SEO?
Puede hacerlo. Google renderiza páginas; si no obtiene el CSS y JS necesarios, puede interpretar mal el diseño, contenido o adaptación móvil. Permite los recursos necesarios y bloquea solo rutas realmente prescindibles.
¿Cómo bloqueo robots de IA con robots.txt?
Añade un grupo específico para cada robot de IA con una regla que bloquee la raíz. El cumplimiento de robots.txt es voluntario y no constituye una medida de seguridad ni de restricción de acceso.
Problemas habituales y cómo solucionarlos
- Advertencia La directiva está mal escrita Solución: Corrige la ortografía de la directiva para que coincida con un nombre compatible y los rastreadores no la ignoren.
- Advertencia Se usa una directiva noindex no compatible Solución: Elimina noindex de robots.txt y usa en su lugar una metaetiqueta para robots o X-Robots-Tag en URL que se puedan rastrear.
- Información Google no admite la directiva Crawl-delay Solución: Elimina Crawl-delay para Google y administra la frecuencia de rastreo de Googlebot mediante Search Console o controles de capacidad del servidor.
- Error La regla aparece antes de cualquier grupo de user-agent Solución: Mueve la regla debajo de la línea User-agent del grupo de rastreadores al que deba aplicarse.
- Advertencia La línea no tiene separador de dos puntos Solución: Añade los dos puntos que faltan entre el nombre y el valor de la directiva para que los analizadores puedan leer la línea.
- Información La directiva desconocida se ignora Solución: Elimina la directiva no estándar o sustitúyela por una directiva de robots.txt compatible que exprese la regla de rastreo prevista.
- Información El grupo de rastreadores no contiene reglas Solución: Añade a este grupo las reglas Allow o Disallow previstas, o elimina el grupo para que el rastreador use el grupo comodín.
- Error El patrón de la regla nunca puede coincidir Solución: Inicia el patrón de ruta con / o * para que la coincidencia pueda comenzar al principio de la ruta de la URL.
- Advertencia El ancla de dólar aparece dentro de un patrón Solución: Mueve $ al final del patrón si debe anclar la ruta o elimínalo si no se pretendía usar el signo de dólar de forma textual.
- Información El User-agent está dividido entre varios grupos Solución: Combina en un grupo las reglas del mismo user-agent para que la política efectiva sea clara y fácil de mantener.
- Error La URL del sitemap no es absoluta Solución: Sustituye la ubicación relativa del sitemap por una URL completa que incluya https:// y el nombre de host.
- Error El archivo de robots supera 500 KiB Solución: Deja robots.txt por debajo de 500 KiB consolidando patrones y eliminando reglas redundantes antes del punto donde Google lo trunca.
- Información El archivo de robots está vacío Solución: Deja el archivo vacío si se permite intencionadamente todo el rastreo; de lo contrario, añade grupos de user-agent explícitos y las reglas mínimas necesarias.
- Error La URL de prueba está bloqueada para el rastreador seleccionado Solución: Elimina o limita la regla Disallow dominante, o añade una regla Allow más específica, cuando la URL probada deba poder rastrearse.