Comprobador de acceso de rastreadores de IA

Free, no signup. “Am I letting ChatGPT, Claude, Perplexity, and Google’s AI read this page — and did I mean to?” Enter a URL and get the answer for every major AI crawler, with the exact robots.txt rule that decided it.

Five separate tests · registry 2026-07-29

Crawler access is only the first layer

Permission

Is the crawler allowed?

Extractability

Are useful facts present in raw HTML?

Renderability

Does JavaScript successfully expose them?

Operability

Can an agent identify and use semantic controls?

Commerce readiness

Do page, schema, feed and checkout facts agree?

HTML remains primary. llms.txt, UCP, and other protocol files are optional distribution layers and cannot compensate for inaccessible or unextractable HTML.

Validate a protocol response

Upload verified-bot log evidence

Expected columns: crawler, timestamp, url, status, verification. A user-agent string alone is never treated as verified identity.

No log evidence uploaded.

robots.txt is advisory, not a lock. It tells cooperating crawlers what you prefer — it does not enforce anything. Some crawlers below are reported to ignore it (flagged ⚠). To actually stop a crawler, block it at your CDN/WAF and verify it's genuine by IP.

Las comprobaciones se ejecutan desde nuestro servidor; consultamos la URL que introduces y no conservamos los resultados. Los contadores anónimos de resultados por ejecución pueden utilizarse para investigación agregada; nunca incluyen URL, dominios, IP ni identificadores, y no se publica ninguna estadística con menos de 100 ejecuciones.

Comentarios
Informar de un error

¿Algo no funciona en Comprobador de acceso de rastreadores de IA? Cuéntanos qué ha ocurrido. El informe va directamente a una cola privada de revisión, no a una lista pública.

Datos que se enviarán
 No se adjuntan automáticamente entradas de la herramienta, archivos subidos, fuentes pegadas, resultados completos, parámetros de consulta ni fragmentos de URL. Puedes editar o eliminar arriba el pasaje seleccionado. Los metadatos del navegador y de protección contra abusos se procesan para prevenir spam. 
Set your posture → robots.txt block

Pick what to block; copy the generated rules into your robots.txt.

  

Blocking here means “documented posture,” not enforcement — a cooperating crawler will honor it; a hostile one may not.

Crawler roster last reviewed . Data is hand-maintained and editable (src/data/ai-crawlers.json).

Acerca de esta herramienta

Gratis y sin registro. «¿Permito que ChatGPT, Claude, Perplexity y la IA de Google lean esta página, y era esa mi intención?» Introduce una URL y obtén una respuesta para cada rastreador importante de IA, junto con la regla exacta de robots.txt que decidió el resultado.

Distingue entre rastreadores usados para recuperar y citar contenido y rastreadores destinados al entrenamiento de modelos.

Funciones

  • Veredicto Permitido o Bloqueado para cada rastreador, con la regla ganadora y el número de línea exactos; la precedencia sigue el parser de robots.txt de código abierto de Google.
  • Separa recuperación activa y citas de respuestas del entrenamiento de modelos, para que puedas decidir de forma deliberada la postura aplicable a cada uso.
  • Explica que Google no usa un rastreador independiente para AI Overviews. Google-Extended controla entrenamiento y grounding de Gemini/Vertex, no la Búsqueda ni Overviews; los controles de snippets también afectan a los snippets normales.
  • Informa de llms.txt sin cambiar ningún veredicto y etiqueta cada operador como verificable o no verificable por IP según los datos del Bot Verifier. Anthropic publica una lista oficial de IP, aunque una coincidencia de rango no equivale a FCrDNS.

Cómo funciona

El servidor solo recupera robots.txt y comprueba si existe llms.txt, porque CORS impide que el navegador solicite esos archivos a otro dominio. La coincidencia se ejecuta localmente con un comparador adaptado del parser de Google: prevalece la ruta más específica y los errores 5xx se mantienen como no evaluados. La posibilidad de verificar la identidad procede del registro independiente de rangos publicados y métodos FCrDNS.

Limitaciones

  • robots.txt es una indicación, no un bloqueo. Algunos rastreadores pueden ignorarlo; para impedir realmente una solicitud debes aplicar controles en la CDN o WAF y verificar la identidad por IP en lugar de confiar en el user-agent.
  • llms.txt es una convención propuesta y ningún rastreador importante documenta que la utilice, por lo que su presencia no afecta al acceso. Un operador nuevo puede no aparecer hasta que se incorpore al registro.

Preguntas frecuentes

¿Bloquear el rastreador de entrenamiento impide que un asistente cite mi sitio?

No por sí solo. Bloquearlo excluye el contenido del entrenamiento futuro, pero no detiene los robots de recuperación en directo que obtienen páginas para responder preguntas y citar fuentes. Esos robots de búsqueda y acceso del usuario se controlan por separado. Para no aparecer en respuestas también tendrías que bloquearlos, tal como muestra la sección de recuperación en directo y citas.

¿Puedo excluirme de los resúmenes con IA de Google mediante robots.txt?

No existe un rastreador separado para esos resúmenes ni una exclusión exclusiva que deje la página sin cambios en la Búsqueda. Bloquear el robot principal impide el rastreo, pero no garantiza por sí solo que una URL conocida desaparezca. Los controles de fragmentos también afectan los resultados normales. El control ampliado de Google regula por separado el entrenamiento y la fundamentación de sus modelos, no la Búsqueda ni sus resúmenes.

¿robots.txt realmente detiene un rastreador de IA?

robots.txt es orientativo, no un candado. Comunica preferencias a los rastreadores colaboradores, pero no las impone. Los operadores responsables lo respetan; otros pueden ignorarlo y la herramienta los identifica. Para detenerlos de verdad, bloquéalos en la red de distribución o cortafuegos de aplicaciones y verifica la solicitud mediante su IP en vez de confiar en la cadena declarada.

¿Por qué un rastreador aparece como no verificable?

La etiqueta refleja si el operador publica una forma de validar la declaración: intervalos de IP actuales o resolución inversa seguida de confirmación directa. Un agente de usuario por sí solo siempre puede falsificarse. Algunos operadores publican listas oficiales de IP, lo que permite comprobar la coincidencia con un intervalo, pero no equivale a una confirmación mediante resolución inversa.

¿Un archivo de orientación para modelos cambia estos veredictos?

No. Ese archivo es una propuesta comunitaria y no consta que los principales rastreadores de IA lo lean. Su presencia o ausencia no determina si un robot está permitido o bloqueado. La herramienta solo informa si existe en el dominio; cada veredicto de acceso se decide mediante robots.txt.

Siguiente pasoGenerador de robots.txt — generate the corrected version. La orientación está disponible en inglés.