Rastreadores de IA
Los tres tipos de rastreadores de IA —bots de entrenamiento, indexadores de búsqueda con IA y obtenedores activados por el usuario—, los principales bots identificados y cómo controlar cada uno sin perjudicar el SEO.
Idiomas
2 señales de evidencia en esta página
- Datos de origen enlazadoslista de IP publicada
- Herramienta activa relacionadaLog File Analyzer
Los rastreadores de IA se dividen en bots de entrenamiento, indexadores de búsqueda con IA y obtenedores activados por el usuario. Sus controles dependen del proveedor y del agente: bloquear GPTBot no bloquea OAI-SearchBot. Google-Extended y Applebot-Extended son tokens de control, no crawlers independientes, y llms.txt sigue siendo una propuesta.
OpenAI publica controles separados para sus bots de entrenamiento, búsqueda y acciones del usuario. Evidence for this claim OpenAI publishes separate controls for GPTBot, OAI-SearchBot, and ChatGPT-User, and says each setting is independent. Scope: OpenAI-declared crawlers and user agents; their purposes and robots behavior are platform-specific. Confidence: high · Verified: OpenAI: Crawlers Anthropic también documenta agentes distintos para entrenamiento, búsqueda y solicitudes de usuarios. Evidence for this claim Anthropic documents ClaudeBot, Claude-SearchBot, and Claude-User separately and says its bots honor robots.txt directives. Scope: Anthropic-declared bots; user-initiated retrieval has additional product-specific conditions. Confidence: high · Verified: Anthropic: Bot information
Evidence for this claim Cloudflare Radar reports worldwide Cloudflare-observed HTTP request trends for the five most active AI bots during the 28 days ending 2026-07-30. Scope: A dated Cloudflare Radar context chart; it is not site-specific traffic and is not a census of all web requests. Confidence: high · Verified: Cloudflare Radar: HTTP traffic by AI botThe chart compares request trends for the five most active AI bots observed by Cloudflare during the selected four-week period, including Googlebot, ClaudeBot, Meta-ExternalAgent, GPTBot, and Bingbot.
TL;DR — «Rastreadores de IA» no es una sola cosa: son tres. Algunos bots rastrean tu sitio para entrenar modelos de IA (como GPTBot y ClaudeBot). Otros crean un índice para que la búsqueda con IA pueda citarte (como OAI-SearchBot y PerplexityBot). Y otros obtienen una página en directo porque una persona acaba de hacer una pregunta (como ChatGPT-User). Cada uno tiene su propio nombre en tu
robots.txt, así que puedes permitirlo o bloquearlo por separado. Bloquear los bots de entrenamiento no perjudica tus rankings de Google; bloquear los bots de búsqueda con IA puede ocultarte de las respuestas de IA.
Qué son los rastreadores de IA
Ya conoces los rastreadores de búsqueda: un rastreador como Googlebot o Bingbot visita tus páginas para que puedan aparecer en los resultados de búsqueda. Los rastreadores de IA son la nueva generación: bots operados por empresas de IA (OpenAI, Anthropic, Google, Apple, Perplexity y otras) que obtienen tus páginas para sus propios fines.
Lo fundamental que debes entender antes de bloquear nada es esto: no todos hacen el mismo trabajo. Hay tres tipos.
- Bots de entrenamiento: leen tus páginas para ayudar a crear y mejorar modelos de IA. GPTBot (OpenAI) y ClaudeBot (Anthropic) son los más conocidos.
- Bots de búsqueda con IA: leen tus páginas para crear un índice consultable, de modo que cuando alguien hace una pregunta a ChatGPT o Perplexity, pueda responder y enlazarte. OAI-SearchBot y PerplexityBot hacen esto.
- Obtenedores activados por el usuario: capturan una página concreta en tiempo real porque una persona ha preguntado algo. ChatGPT-User es un ejemplo: no recorre la web por su cuenta, sino que hace un encargo para un usuario.
Por qué importa la diferencia
Cada bot tiene su propio nombre (su agente de usuario) y tu archivo robots.txt puede permitirlo o bloquearlo por nombre. Así que puedes decidirlo por separado:
- ¿Me preocupa que las empresas de IA entrenen con mi contenido? → esos son los bots de entrenamiento.
- ¿Quiero aparecer en las respuestas de ChatGPT y Perplexity? → esos son los bots de búsqueda con IA. La mayoría de la gente quiere mantenerlos.
Este es el gran mito que hay que desmontar: bloquear los bots de IA no perjudica tus rankings de Google. Google lo ha afirmado directamente y los editores que bloquean los bots de entrenamiento de IA siguen posicionándose bien. Pero si bloqueas los bots de búsqueda con IA, puedes desaparecer de las respuestas de IA; no bloquees accidentalmente la categoría equivocada.
Los nombres que verás en tus registros
- GPTBot — OpenAI, entrenamiento.
- OAI-SearchBot — OpenAI, el que impulsa la búsqueda de ChatGPT.
- ChatGPT-User — OpenAI, obtención en directo cuando un usuario pregunta.
- ClaudeBot — Anthropic, entrenamiento.
- PerplexityBot — Perplexity, búsqueda/citas.
- CCBot — Common Crawl, una organización sin ánimo de lucro cuyos datos entrenan muchos modelos de IA.
- Bytespider — ByteDance (la empresa matriz de TikTok), entrenamiento.
- Applebot — Apple, impulsa Siri/Spotlight y Apple Intelligence.
Verás otros dos: Google-Extended y Applebot-Extended. No son rastreadores reales. Solo son interruptores en robots.txt que indican “don’t use my
content to train your AI.” (traducción) «no uses mi contenido para entrenar tu IA; es una decisión explícita». No obtienen nada.
¿Quieres la tabla completa bot por bot, las recetas de robots.txt, el debate sobre si realmente obedecen robots.txt y si deberías bloquearlos? Cambia a la pestaña Avanzado.
OpenAI dice que los ajustes de GPTBot, OAI-SearchBot y ChatGPT-User son independientes. Evidence for this claim OpenAI publishes separate controls for GPTBot, OAI-SearchBot, and ChatGPT-User, and says each setting is independent. Scope: OpenAI-declared crawlers and user agents; their purposes and robots behavior are platform-specific. Confidence: high · Verified: OpenAI: Crawlers Anthropic identifica por separado ClaudeBot, Claude-SearchBot y Claude-User y documenta el tratamiento de robots.txt. Evidence for this claim Anthropic documents ClaudeBot, Claude-SearchBot, and Claude-User separately and says its bots honor robots.txt directives. Scope: Anthropic-declared bots; user-initiated retrieval has additional product-specific conditions. Confidence: high · Verified: Anthropic: Bot information
TL;DR — Los rastreadores de IA se dividen en tres categorías, y confundirlas es el error que comete casi todo el mundo. Los bots de entrenamiento (GPTBot, ClaudeBot, CCBot, Bytespider, Amazonbot, Meta-ExternalAgent) rastrean para crear corpus de modelos. Los bots de búsqueda con IA (OAI-SearchBot, PerplexityBot, Applebot, Amzn-SearchBot) crean un índice con citas. Los obtenedores activados por el usuario (ChatGPT-User, Perplexity-User, Claude-User) capturan una página en directo cuando una persona pregunta. Cada uno tiene su propio agente de usuario y su propia regla de
robots.txt, así que bloquear GPTBot no afecta a OAI-SearchBot. Google-Extended y Applebot-Extended son tokens, no bots: no rastrean; solo te excluyen del entrenamiento/fundamentación. Bloquear los bots de entrenamiento no afecta a los rankings de Google (Google lo dice y los datos empíricos coinciden); bloquear los bots de búsqueda con IA sí reduce tu visibilidad en las respuestas de IA. El debate sobre robots.txt es real para los obtenedores de usuarios (los operadores dicen que “may not apply” (traducción) «puede no aplicarse») y para Perplexity (se ha informado de rastreo encubierto). llms.txt es una propuesta, apenas leída y no adoptada por los grandes proveedores.
Las tres categorías: la columna vertebral de todo este tema
Training crawlers such as GPTBot, ClaudeBot, and CCBot collect data for model corpora. AI-search crawlers such as OAI-SearchBot and PerplexityBot build indexes used for answers and citations. User-triggered agents such as ChatGPT-User and Claude-User fetch a page for a live request. Blocking one category does not automatically block the others.
© Patrick Stox LLC · CC BY 4.0 ·
Cada bot de IA identificado por su nombre pertenece a uno de tres grupos. Acertar con el grupo permite deducir todas las decisiones posteriores (¿lo bloqueo?, ¿lo permito?, ¿qué ocurre con mi SEO?).
1. Rastreadores de entrenamiento/recopilación de datos. Rastrean a escala para crear corpus destinados al entrenamiento y ajuste fino de LLM. Son los bots que más editores quieren bloquear, y no permitirlos no afecta a los rankings de búsqueda. Miembros: GPTBot (OpenAI), ClaudeBot (Anthropic), CCBot (Common Crawl), Bytespider (ByteDance), Amazonbot (Amazon), Meta-ExternalAgent (Meta), AI2Bot (Allen Institute), cohere-training-data-crawler (Cohere), Diffbot, Timpibot (Timpi), webzio-extended (Webz.io). Además, hay dos tokens de control que NO son rastreadores independientes: Google-Extended y Applebot-Extended, que se explican más abajo.
2. Rastreadores de búsqueda con IA/indexación. Crean un índice en directo que se usa para responder consultas con citas y enlaces hacia tu sitio. Bloquearlos puede eliminarte de los resultados de búsqueda con IA. Miembros: OAI-SearchBot (OpenAI, distinto de GPTBot), PerplexityBot (Perplexity), Applebot (Apple, impulsa las sugerencias de Spotlight/Siri/Safari) y Amzn-SearchBot (Amazon).
3. Obtenedores activados por el usuario o bajo demanda. Obtienen una página concreta en directo porque un usuario ha hecho una pregunta, no porque un bot esté recorriendo la web. Los operadores suelen afirmar que robots.txt no vincula a una obtención iniciada por el usuario; es un terreno controvertido. Miembros: ChatGPT-User (OpenAI), Perplexity-User (Perplexity), Claude-User y Claude-SearchBot (Anthropic), Amzn-User (Amazon, para Alexa) y Meta-ExternalFetcher (Meta).
La tabla completa con tokens de agentes de usuario y cumplimiento de robots.txt está en la pestaña Guías rápidas; esa tabla es la pieza central de este artículo.
La trampa de «token, no bot» (Google-Extended y Applebot-Extended)
Este es el hecho más incomprendido del tema, así que seré preciso. Google-Extended y Applebot-Extended no rastrean nada. No tienen un agente de usuario independiente ni generan tráfico de rastreo. Son tokens de control de robots.txt que cambian lo que los rastreos existentes pueden hacer con tu contenido.
- Google-Extended controla el uso para mejorar las aplicaciones Gemini y los modelos generativos de Vertex AI, incluida la fundamentación fuera de Google Search. No controla AI Overviews ni AI Mode de Google Search; esas funciones usan el acceso de Googlebot. Google lo dice explícitamente: “Google-Extended does not impact a site’s inclusion in Google Search nor is it used as a ranking signal in Google Search.” (traducción) «Google-Extended no afecta a la inclusión de un sitio en Google Search ni se utiliza como señal de ranking en Google Search» No permitirlo no afecta a Googlebot ni a tus rankings.
- Applebot-Extended sigue la misma idea para Apple. Apple afirma: “Applebot-Extended does not crawl webpages. Webpages that disallow Applebot-Extended can still be included in search results.” (traducción) «Applebot-Extended no rastrea páginas web. Las páginas web que bloquean Applebot-Extended aún pueden aparecer en los resultados de búsqueda» Te excluye del entrenamiento de los modelos fundacionales de Apple (Apple Intelligence), pero tus páginas siguen apareciendo en Spotlight/Siri mediante el rastreador real, Applebot.
Por tanto, Disallow: Google-Extended y Disallow: Applebot-Extended son controles de uso del producto, no bloqueos de rastreo independientes. Sus ámbitos publicados no eliminan páginas del índice de búsqueda correspondiente, pero no son intercambiables y no deberían reducirse ambos a «bot de entrenamiento».
Los principales operadores, bot por bot
OpenAI opera cuatro bots declarados, cada uno independiente: GPTBot (entrenamiento: “used to make our generative AI foundation models more useful and safe” (traducción) «se utiliza para que nuestros modelos fundacionales de IA generativa sean más útiles y seguros»), OAI-SearchBot (búsqueda: “used to surface websites in search results in ChatGPT’s search features” (traducción) «se utiliza para mostrar sitios web en los resultados de búsqueda de las funciones de búsqueda de ChatGPT»), ChatGPT-User (obtenedor de usuario: “used for certain user actions in ChatGPT” (traducción) «se utiliza para determinadas acciones de los usuarios en ChatGPT») y OAI-AdsBot (un ámbito independiente de anuncios, no de entrenamiento ni del rastreador del índice de búsqueda). La frase de la política de OpenAI es el modelo para todo este espacio: “Each bot setting is independent, allowing webmasters granular control over how their content interacts with different OpenAI systems.” (traducción) «cada configuración de bot es independiente, lo que permite a los webmasters un control granular sobre cómo interactúa su contenido con los distintos sistemas de OpenAI» No permitir GPTBot “signals that future data from these materials should be excluded from model training datasets” (traducción) «indica que los datos futuros de estos materiales deben excluirse de los conjuntos de datos de entrenamiento de modelos»; no permitir OAI-SearchBot significa que tu sitio “won’t appear in ChatGPT search results.” (traducción) «no aparecerá en los resultados de búsqueda de ChatGPT»
Anthropic opera tres: ClaudeBot (entrenamiento), Claude-SearchBot (indexación de búsqueda) y Claude-User (obtención de usuario). Anthropic afirma que sus bots “respect ‘do not crawl’ signals by honoring industry standard directives in robots.txt” (traducción) «respetan las señales de “no rastrear” al cumplir las directivas estándar del sector en robots.txt». Su página de soporte actual también enlaza a una lista de IP publicada compartida para la verificación específica de Anthropic. Esa lista del proveedor es una prueba de identidad, no una regla universal de verificación por IP o DNS inverso para todos los bots.
Google: el dato clave es el anterior: Google-Extended es un token, no un bot. Google también opera Google-CloudVertexBot (rastrea para agentes de Vertex AI solicitados por el propietario del sitio; no afecta al ranking) y agentes activados por el usuario como Gemini-Deep-Research y Google-NotebookLM.
Apple opera Applebot (el rastreador real que impulsa las sugerencias de Spotlight/Siri/Safari y que “may also be used to help train Apple foundation models” (traducción) «también puede utilizarse para ayudar a entrenar los modelos fundacionales de Apple») y el token Applebot-Extended. Bloquear Applebot te elimina de la búsqueda de Apple; bloquear Applebot-Extended solo te excluye del entrenamiento.
Perplexity declara dos bots: PerplexityBot (búsqueda/citas: explícitamente “not used to crawl content for AI foundation models” (traducción) «no se utiliza para rastrear contenido destinado a modelos fundacionales de IA», por lo que Perplexity no tiene un rastreador de entrenamiento declarado) y Perplexity-User (obtención de usuario). Su documentación afirma que Perplexity-User “generally ignores robots.txt rules” (traducción) «por lo general, ignora las reglas de robots.txt» porque la obtención la inicia el usuario. Perplexity también es objeto de informes sobre rastreo encubierto; consulta la controversia más abajo.
Amazon opera tres bots, y esta es una excepción útil: Amazonbot (mejora productos y “may be used to train Amazon AI models” (traducción) «puede utilizarse para entrenar modelos de IA de Amazon»), Amzn-SearchBot (búsqueda) y Amzn-User (obtenciones de usuarios de Alexa). Según la documentación de Amazon, Amzn-SearchBot y Amzn-User no rastrean explícitamente para entrenar modelos de IA generativa; por tanto, «todas las empresas de IA rastrean para entrenar» es un mito. Amazon también respeta una etiqueta meta noarchive con un significado especial: no uses la página para entrenar modelos, una rara exclusión del entrenamiento por página.
El tratamiento de robots.txt de Amazon tiene dos peculiaridades operativas: sus rastreadores pueden usar una copia de robots.txt almacenada en caché durante los 30 días anteriores, y Amazon dice que, si no se puede obtener el archivo, sus rastreadores se comportan como si no existiera. Eso no significa que una obtención de auditoría fallida demuestre que Amazon vio un estado de permitir todo; la auditoría y Amazon pueden estar llegando al host en momentos distintos o por rutas de red diferentes. Evidence for this claim Amazon says its crawlers may use a robots.txt copy cached within the previous 30 days. Scope: Amazon crawler behavior only; a current audit fetch cannot identify which cached copy Amazon used. Confidence: high · Verified: Amazon: Amazonbot Evidence for this claim Amazon says its crawlers behave as if robots.txt does not exist when they cannot fetch it. Scope: Amazon crawler behavior only; a tool-side fetch failure is not proof that Amazon observed the same failure. Confidence: high · Verified: Amazon: Amazonbot
Meta opera Meta-ExternalAgent (entrenamiento/indexación para Llama y Meta AI), Meta-ExternalFetcher (obtención de usuario) y, por separado, Facebookbot (previsualizaciones de enlaces, no un rastreador de IA). Bloquear Meta-ExternalAgent no afecta a las previsualizaciones de enlaces de Facebook.
Common Crawl (CCBot) lo opera una fundación sin ánimo de lucro que mantiene un archivo web abierto. Es la capa oculta: el conjunto de datos de Common Crawl se ha usado para entrenar ChatGPT, Claude, LLaMA y muchos otros modelos, así que bloquear CCBot tiene efectos posteriores en modelos que nunca te rastrean directamente. Common Crawl también advierte de suplantadores que se hacen pasar por CCBot.
ByteDance (Bytespider) es el más agresivo: se declara respetuoso con robots.txt, pero se ha informado ampliamente de que lo infringe, con volúmenes de solicitudes muy altos. Otros que conviene conocer son AI2Bot (Allen Institute, modelos abiertos y el conjunto de datos Dolma), Cohere, Diffbot (extracción de datos estructurados cuyo resultado alimenta muchas canalizaciones de IA posteriores) y Timpibot / webzio-extended.
¿Los bots de IA obedecen realmente robots.txt?
En el caso de los rastreadores de entrenamiento y búsqueda, los principales operadores (OpenAI, Anthropic, Google, Apple y Amazon) afirman en su documentación que respetan robots.txt. La zona controvertida son los obtenedores activados por el usuario, donde varios operadores dicen explícitamente que robots.txt puede no aplicarse porque una persona inició la solicitud: OpenAI afirma “these actions are initiated by a user, robots.txt rules may not apply” (traducción) «estas acciones las inicia un usuario; es posible que no se apliquen las reglas de robots.txt»; Perplexity dice que Perplexity-User “generally ignores robots.txt rules.” (traducción) «por lo general, ignora las reglas de robots.txt» Esa es una política declarada, no una infracción.
La controversia de Perplexity es la disputa principal, y la presentaré como informada, no resuelta. En junio de 2024, Wired y el desarrollador Robb Knight informaron de que Perplexity accedió a contenido de sitios que lo habían bloqueado, aparentemente mediante IP no publicadas. En agosto de 2025, Cloudflare informó de que Perplexity usó un agente de usuario encubierto que suplantaba a Chrome en macOS, rotó IP y ASN para eludir bloqueos y obtuvo contenido de dominios de prueba recién creados que incluían un Disallow: / completo; posteriormente Cloudflare retiró a Perplexity de su lista de bots verificados. Preséntalo como información documentada por esas fuentes; la propia documentación de Perplexity sostiene que PerplexityBot respeta robots.txt.
Como algunos bots ignoran robots.txt en cierta medida, Cloudflare se ha convertido en la capa práctica de aplicación: bloqueo a nivel de red, un interruptor de «AI Scrapers and Crawlers» con un clic, robots.txt gestionado, seguimiento de infracciones de robots.txt y una beta de pago por rastreo. Desde julio de 2025, los nuevos dominios de Cloudflare bloquean por defecto los rastreadores de IA conocidos.
Cómo controlar los rastreadores de IA
- robots.txt por agente de usuario es el control principal y es granular: bloquear
GPTBotno bloqueaOAI-SearchBotniChatGPT-User. Las recetas de robots.txt (bloquear todos los bots de entrenamiento o los bots de búsqueda con IA) están en la pestaña Scripts. - Los tokens de entrenamiento,
Google-ExtendedyApplebot-Extended, te excluyen del entrenamiento de Gemini/Apple Intelligence sin coste para la búsqueda. - La etiqueta meta
noarchivede Amazon es una exclusión del entrenamiento de Amazon por página. - Cloudflare AI Crawl Control: bloquear, permitir o cobrar a nivel de red, además de robots.txt gestionado y directivas Content Signals (
search,ai-input,ai-train); el valor predeterminado essearch=yes, ai-train=no. - llms.txt es una propuesta (Jeremy Howard / Answer.AI, septiembre de 2024), no un estándar adoptado, y los principales rastreadores no lo respetan. Es un mapa Markdown seleccionado para leerse durante la inferencia, pero un estudio de Ahrefs sobre 137K sitios descubrió que el 97 % de los archivos llms.txt publicados reciben cero solicitudes y ningún proveedor importante de LLM lo ha adoptado formalmente. Trátalo como una herramienta de documentación, no como una herramienta de búsqueda con IA.
- El proyecto comunitario ai.robots.txt mantiene un archivo completo
Disallow: /con más de 150 agentes de usuario de bots de IA: una referencia útil para bloquearlos en masa.
Una política de rastreadores centrada en la visibilidad
Para un sitio educativo o comercial público que quiera visibilidad en búsquedas con IA, mi política predeterminada es:
- Permitir los rastreadores de búsqueda convencionales que alimentan las superficies de búsqueda que te interesan, incluidos Googlebot y Bingbot.
- Permitir los rastreadores documentados de búsqueda/indexación con IA, como
OAI-SearchBot,Claude-SearchBotyPerplexityBot, en el contenido público. - Permitir los obtenedores dirigidos por el usuario que quieras, como
ChatGPT-User,Claude-UseryPerplexity-User, reconociendo que el comportamiento de robots.txt varía según el proveedor. Evidence for this claim OpenAI publishes separate controls for GPTBot, OAI-SearchBot, and ChatGPT-User, and says each setting is independent. Scope: OpenAI-declared crawlers and user agents; their purposes and robots behavior are platform-specific. Confidence: high · Verified: OpenAI: Crawlers Evidence for this claim Anthropic documents ClaudeBot, Claude-SearchBot, and Claude-User separately and says its bots honor robots.txt directives. Scope: Anthropic-declared bots; user-initiated retrieval has additional product-specific conditions. Confidence: high · Verified: Anthropic: Bot information Evidence for this claim Perplexity documents PerplexityBot for search indexing separately from Perplexity-User for user-requested fetches, with different robots behavior. Scope: Perplexity-declared crawlers and published IP ranges; a user-agent string alone does not verify identity. Confidence: high · Verified: Perplexity: Crawlers - Tomar una decisión de derechos separada para el acceso de entrenamiento/desarrollo de modelos.
GPTBot,ClaudeBot,Google-Extendedy otros controles de entrenamiento no tienen que compartir la política de búsqueda. Permítelos solo si ese uso coincide con tu política editorial. - Proteger las rutas privadas y operativas con autenticación. Mantén
/admin/, las previsualizaciones, los datos de cuenta y las API no públicas detrás de autorización en el servidor; unDisallowsolo es una preferencia para rastreadores. - Verificar la identidad antes de saltarse los controles del WAF. Combina el agente de usuario documentado con los rangos de IP actuales del proveedor, la verificación de DNS inverso o la autenticación de bots compatible. Nunca crees una regla WAF amplia de permiso basándote únicamente en un agente de usuario suplantable.
No añadas un grupo específico de agentes de usuario solo para indicar Allow: / a menos que repitas todas las restricciones que aún deben aplicarse a ese rastreador. Según las reglas de coincidencia de robots, un grupo específico puede sustituir al grupo comodín en lugar de heredar sus exclusiones de rutas privadas con el análisis de robots específico de cada proveedor. El archivo seguro más sencillo suele ser un grupo comodín seguro por sí mismo, junto con exclusiones de entrenamiento de alcance limitado.
En este sitio concreto, la política pública actual es una postura explícita de permitir la búsqueda, la entrada de IA y el entrenamiento de IA, a la vez que se excluyen las rutas de administración, previsualización, API, trampas y pasarelas. Mantendría permitidas la búsqueda y la recuperación dirigida por el usuario. Cambiaría ai-train=yes únicamente como decisión sobre derechos editoriales, no como táctica de visibilidad en IA, porque no hay un beneficio demostrado de las citas por permitir el entrenamiento.
El acceso de los rastreadores de IA no equivale a estar preparado para la IA
Una regla de permiso demuestra, como mucho, que la política de robots declarada permite a un agente identificado solicitar una URL. No demuestra que el operador haya obedecido la política, obtenido la página, la haya renderizado, extraído la información importante, la haya colocado en el contexto del modelo, la haya citado ni haya completado una acción.
Mantén separadas cinco capas:
| Capa | Pregunta | Evidencia |
|---|---|---|
| Permiso | ¿Puede este agente identificado solicitar la URL según la política declarada? | Prueba efectiva de robots y acceso de red |
| Extraibilidad | ¿Está el contenido importante presente en texto, enlaces, metadatos o datos estructurados estables? | Captura sin renderizar y renderizada con extracción de campos |
| Renderizado | ¿Sobrevive el contenido a las capacidades reales de navegador/JavaScript del agente? | Evidencia de obtención específica del proveedor cuando existe; de lo contrario, una limitación de prueba declarada |
| Operabilidad | ¿Puede un agente identificar y ejecutar de forma segura la acción prevista? | Contrato documentado de herramienta/interfaz y prueba controlada de extremo a extremo |
| Preparación comercial | ¿Coinciden la identidad, el precio, la disponibilidad, la política, el cumplimiento, el carrito y el pago? | Conciliación de feed/página/backend/pedido |
Por tanto, un comprobador de acceso de rastreadores debería informar permitido, bloqueado o indeterminado para la política, no «preparado para IA». Una solicitud correcta en los registros demuestra que esa solicitud ocurrió; no demuestra que la página se usara en una respuesta. Del mismo modo, un feed o una declaración de herramienta válidos no demuestran que una página pública se renderice correctamente ni que el pago pueda cumplir la oferta representada.
Usa Cómo funciona la búsqueda con IA para las capas de recuperación y citas, y Optimización del comercio con IA para la preparación del catálogo y las transacciones. Mantener separadas las capas hace que el remedio sea específico: corrige la política de acceso si hay un bloqueo, la salida de la página si falla la extracción, el renderizado si falta un estado, el contrato de interfaz si falla la operabilidad o los datos comerciales si falla una compra.
En las páginas de comercio electrónico, la prueba de extraibilidad debería comprobar que la identidad básica del producto y la oferta seleccionada (SKU, ID de grupo, precio, moneda y disponibilidad) existen en la respuesta inicial y siguen coincidiendo después del renderizado. El estándar de páginas de producto sin renderizar frente a renderizadas define qué debería ser visible para el servidor; el permiso del rastreador, por sí solo, no dice nada sobre ese contrato.
El mito que te cuesta tráfico: entrenamiento ≠ búsqueda con IA
Esto es lo que hay que entender bien. Bloquear los bots de entrenamiento no equivale a bloquear los bots de búsqueda con IA. Son reglas de robots.txt separadas con consecuencias opuestas:
- Bloquear los bots de entrenamiento (GPTBot, ClaudeBot, CCBot, Bytespider y los tokens Google-Extended/Applebot-Extended) → no afecta a los rankings de Google, como confirman Google y los datos empíricos de editores. Te excluyes del entrenamiento de modelos, punto.
- Bloquear los bots de búsqueda con IA (OAI-SearchBot, PerplexityBot) → pierdes visibilidad en las respuestas de ChatGPT y Perplexity. Es una compensación real, no una ventaja gratuita.
Si bloqueas de forma demasiado amplia, por ejemplo con un bloqueo general que atrape OAI-SearchBot cuando solo pretendías detener el entrenamiento, puedes eliminarte silenciosamente de la búsqueda con IA. Sé preciso sobre la categoría a la que afecta cada regla.
Por qué bloquean los editores: el contrato social
La razón de que esto sea siquiera un debate se reduce al tráfico. Como lo expresé en mi análisis de bots de IA, “there’s a cost to bots crawling your websites and there’s a social contract between search engines and website owners, where search engines add value by sending referral traffic to websites. Google sends traffic (for now), so they don’t get blocked.” (traducción) «los bots que rastrean tus sitios web tienen un coste y existe un contrato social entre los motores de búsqueda y los propietarios de sitios web: los motores de búsqueda aportan valor al enviar tráfico de referencia a los sitios web. Google envía tráfico (por ahora), así que no se bloquean» Hasta ahora, los rastreadores de IA en su mayoría no devuelven tráfico, y los datos respaldan la inquietud. En mi análisis de Cloudflare Radar, los bots de IA ya son claramente el rastreador número 2, por detrás de los motores de búsqueda, y van camino de adelantarlos. Hay más información en la pestaña Estadísticas.
Divulgación: fui empleado de Ahrefs y recibo acceso gratuito a Ahrefs. El análisis de rastreadores enlazado es un trabajo mío publicado durante ese periodo; Ahrefs no revisa ni aprueba las conclusiones editoriales actuales de este sitio.Para consultar el proceso más amplio en el que encaja esto —descubrimiento, el programador de rastreo, renderizado y la diferencia entre rastrear e indexar—, consulta el centro de rastreo y los temas relacionados sobre los rastreadores en general, el agente de usuario, Googlebot, Bingbot y robots.txt.
Resumen de IA
Una síntesis de la versión Avanzado:
- Los rastreadores de IA son tres categorías, no una, y confundirlas es el error central.
- Entrenamiento: GPTBot, ClaudeBot, CCBot, Bytespider, Amazonbot, Meta-ExternalAgent, AI2Bot, Cohere y Diffbot: rastrean para crear corpus de modelos.
- Búsqueda con IA/indexación: OAI-SearchBot, PerplexityBot, Applebot y Amzn-SearchBot: crean un índice con citas.
- Obtenedores activados por el usuario: ChatGPT-User, Perplexity-User y Claude-User: obtienen una página en directo cuando una persona pregunta.
- Cada bot tiene su propio agente de usuario y su propia regla de robots.txt. Bloquear GPTBot no bloquea OAI-SearchBot ni ChatGPT-User.
- Google-Extended y Applebot-Extended son tokens, no bots: no rastrean; solo te excluyen del entrenamiento/fundamentación. No permitirlos no tiene coste para la búsqueda.
- Bloquear los bots de entrenamiento ≠ perjudicar el SEO. Google: “does not impact a site’s inclusion in Google Search.” (traducción) «Google-Extended no afecta a la inclusión de un sitio en Google Search» Los datos empíricos de editores coinciden.
- Bloquear los bots de búsqueda con IA SÍ reduce la visibilidad en IA en ChatGPT/Perplexity: es una compensación real.
- Amzn-SearchBot y Amzn-User de Amazon NO entrenan con el contenido rastreado (según Amazon). “All AI bots train” (traducción) «Todos los bots de IA entrenan» es un mito.
- Debate sobre robots.txt: los obtenedores activados por el usuario se excluyen (“may not apply” (traducción) «puede no aplicarse»); se ha informado de que Perplexity (Wired/Robb Knight 2024; Cloudflare 2025) usa rastreadores encubiertos: preséntalo como información publicada, no como asunto resuelto.
- llms.txt es una propuesta, no está adoptado: el 97 % de los archivos no recibe lecturas; ningún LLM importante lo admite. Cloudflare es la capa práctica de aplicación.
Documentación oficial
Documentación de fuentes primarias de los operadores de IA y de las propuestas pertinentes.
OpenAI
- Bots/rastreadores de OpenAI: GPTBot, OAI-SearchBot, ChatGPT-User, OAI-AdsBot y la política de que “each bot setting is independent” (traducción) «cada ajuste de bot es independiente».
Anthropic
- ¿Anthropic rastrea datos de la web?: ClaudeBot, Claude-SearchBot, Claude-User, controles de robots y verificación actual mediante lista de IP.
- Lista de IP de rastreadores de Anthropic: datos de verificación específicos del proveedor.
- Rastreadores comunes de Google (incluido Google-Extended): tokens de producto y agentes de usuario.
- Funciones de IA y tu sitio web: Googlebot, no Google-Extended, controla la inclusión en AI Overviews y AI Mode.
Apple
- Acerca de Applebot: Applebot frente a Applebot-Extended y la distinción “Applebot-Extended does not crawl webpages” (traducción) «Applebot-Extended no rastrea páginas web».
Amazon
- Amazonbot: Amazonbot, Amzn-SearchBot, Amzn-User, la exclusión de entrenamiento por página mediante
noarchivey qué bots no entrenan.
Perplexity
- Rastreadores de Perplexity: PerplexityBot y Perplexity-User, incluida la afirmación de que “generally ignores robots.txt rules” (traducción) «por lo general, ignora las reglas de robots.txt».
Common Crawl
- CCBot: el rastreador sin ánimo de lucro que está detrás de gran parte de los datos de entrenamiento de LLM, además de la advertencia sobre suplantaciones.
Allen Institute for AI
- Aviso del rastreador AI2: AI2Bot y cómo filtrarlo.
Cloudflare (controles de rastreadores de IA)
- AI Crawl Control: bloqueo/permiso/cobro, monitorización y seguimiento de infracciones de robots.txt.
- robots.txt gestionado: directivas de rastreadores de IA mantenidas automáticamente.
- Controlar el uso del contenido para el entrenamiento de IA: robots.txt gestionado, directivas Content Signals y beta de pago por rastreo.
La propuesta
- Especificación de llms.txt: propuesta de mapa para el momento de inferencia (una propuesta, no un estándar adoptado).
- Proyecto ai.robots.txt: lista mantenida por la comunidad de agentes de usuario de bots de IA.
Citas de la fuente
Declaraciones registradas de los operadores y las propuestas. Cada enlace salta directamente al pasaje citado cuya verificación está documentada.
OpenAI: bots independientes, propósitos independientes
- “Each bot setting is independent, allowing webmasters granular control over how their content interacts with different OpenAI systems.” (traducción) «cada configuración de bot es independiente, lo que permite a los webmasters un control granular sobre cómo interactúa su contenido con los distintos sistemas de OpenAI» — documentación de bots de OpenAI. Saltar a la cita
- GPTBot se “used to make our generative AI foundation models more useful and safe.” (traducción) «se utiliza para que nuestros modelos fundacionales de IA generativa sean más útiles y seguros» OAI-SearchBot se “used to surface websites in search results in ChatGPT’s search features.” (traducción) «se utiliza para mostrar sitios web en los resultados de búsqueda de las funciones de búsqueda de ChatGPT» ChatGPT-User: porque “these actions are initiated by a user, robots.txt rules may not apply.” (traducción) «estas acciones las inicia un usuario; es posible que no se apliquen las reglas de robots.txt» Saltar a la cita
Anthropic: controles de robots y ámbito de verificación
- Anthropic documenta ClaudeBot, Claude-SearchBot y Claude-User, sus controles de robots y un método compartido de verificación mediante lista de IP. Fuente
Google: el token, no el bot
- “Google-Extended does not impact a site’s inclusion in Google Search nor is it used as a ranking signal in Google Search.” (traducción) «Google-Extended no afecta a la inclusión de un sitio en Google Search ni se utiliza como señal de ranking en Google Search» Saltar a la cita
Apple: Applebot-Extended no rastrea
- “Applebot-Extended does not crawl webpages. Webpages that disallow Applebot-Extended can still be included in search results.” (traducción) «Applebot-Extended no rastrea páginas web; las páginas que lo bloquean aún pueden incluirse en los resultados de búsqueda» Saltar a la cita
Perplexity: la excepción del obtenedor de usuarios
- PerplexityBot está “designed to surface and link websites in search results on Perplexity. It is not used to crawl content for AI foundation models.” (traducción) «está diseñado para mostrar y enlazar sitios web en los resultados de búsqueda de Perplexity. No se utiliza para rastrear contenido destinado a modelos fundacionales de IA» Perplexity-User: “Since a user requested the fetch, this fetcher generally ignores robots.txt rules.” (traducción) «Como un usuario solicitó la obtención, este obtenedor por lo general ignora las reglas de robots.txt» Saltar a la cita
Common Crawl: la capa oculta de entrenamiento
- CCBot existe para “democratizing access to web information by producing and maintaining an open repository of web crawl data.” (traducción) «democratizar el acceso a la información web mediante la producción y el mantenimiento de un repositorio abierto de datos de rastreo web» Nota: “we are aware of crawlers falsely identifying themselves as CCBot.” (traducción) «sabemos que existen rastreadores que se identifican falsamente como CCBot» Saltar a la cita
llms.txt: una propuesta, según su propia descripción
- “A proposal to standardise on using an
/llms.txtfile to provide information to help LLMs use a website at inference time.” (traducción) «una propuesta para estandarizar el uso de un archivo/llms.txtque ayude a los LLM a utilizar un sitio web durante la inferencia» — especificación de llms.txt. Saltar a la cita
Yo: el contrato social
- “There’s a cost to bots crawling your websites and there’s a social contract between search engines and website owners, where search engines add value by sending referral traffic to websites. Google sends traffic (for now), so they don’t get blocked.” (traducción) «rastrear sitios web tiene un coste y existe un contrato social: los motores de búsqueda aportan valor cuando envían tráfico de referencia. Google envía tráfico por ahora, así que no se bloquea» — Patrick Stox, Ahrefs. Leer el artículo
La tabla maestra de rastreadores de IA
La pieza central. Cada bot de IA importante, su token de agente de usuario, operador, categoría y cumplimiento declarado de robots.txt. Copia los tokens exactamente: la ortografía y las mayúsculas importan en robots.txt.
| Bot | Token UA | Operador | Categoría | ¿Obedece robots.txt? |
|---|---|---|---|---|
| GPTBot | GPTBot | OpenAI | Entrenamiento | Sí (declarado) |
| OAI-SearchBot | OAI-SearchBot | OpenAI | Búsqueda con IA | Sí (declarado) |
| ChatGPT-User | ChatGPT-User | OpenAI | Obtención de usuario | «Puede no aplicarse» (iniciada por el usuario) |
| OAI-AdsBot | OAI-AdsBot | OpenAI | Anuncios (no entrenamiento) | Sí (declarado) |
| ClaudeBot | ClaudeBot | Anthropic | Entrenamiento | Sí (declarado) |
| Claude-SearchBot | Claude-SearchBot | Anthropic | Búsqueda con IA | Sí para indexación |
| Claude-User | Claude-User | Anthropic | Obtención de usuario | Sí (Anthropic afirma que todos sus bots respetan robots.txt) |
| Google-Extended | Google-Extended (solo token: no hay UA separado) | Control de entrenamiento/fundamentación | Sí (token de exclusión) | |
| Google-CloudVertexBot | Google-CloudVertexBot | Vertex AI solicitado por el propietario | Sí | |
| PerplexityBot | PerplexityBot | Perplexity | Búsqueda con IA | Sí para indexación (pero consulta las disputas) |
| Perplexity-User | Perplexity-User | Perplexity | Obtención de usuario | «Generalmente ignora» (declarado) |
| Applebot | Applebot | Apple | Búsqueda con IA (+ entrenamiento) | Sí |
| Applebot-Extended | Applebot-Extended (solo token: no rastrea) | Apple | Control de entrenamiento | Sí (token de exclusión) |
| Amazonbot | Amazonbot | Amazon | Entrenamiento | Sí (declarado) |
| Amzn-SearchBot | Amzn-SearchBot | Amazon | Búsqueda con IA (sin entrenamiento) | Sí (declarado) |
| Amzn-User | Amzn-User | Amazon | Obtención de usuario (Alexa; sin entrenamiento) | Sí (declarado) |
| Meta-ExternalAgent | meta-externalagent | Meta | Entrenamiento/indexación | Sí (declarado) |
| Meta-ExternalFetcher | meta-externalfetcher | Meta | Obtención de usuario | Declarado |
| CCBot | CCBot | Common Crawl | Entrenamiento (datos abiertos) | Sí; existen suplantadores |
| Bytespider | Bytespider | ByteDance | Entrenamiento | Discutido: consulta las disputas |
| AI2Bot | AI2Bot | Allen Institute | Entrenamiento | Sí (declarado) |
| cohere-training-data-crawler | cohere-training-data-crawler | Cohere | Entrenamiento | Sí (declarado) |
| Diffbot | Diffbot | Diffbot | Entrenamiento/extracción | Sí por defecto |
| Timpibot | Timpibot | Timpi | Entrenamiento | Sí (declarado) |
| webzio-extended | webzio-extended | Webz.io | Entrenamiento | Declarado |
Las tres reglas que se desprenden de la tabla
- Bloquear un bot de entrenamiento (GPTBot, ClaudeBot, CCBot…) → ningún efecto en el ranking.
- Bloquear un bot de búsqueda con IA (OAI-SearchBot, PerplexityBot) → pierdes visibilidad en las respuestas de IA.
- Google-Extended y Applebot-Extended son tokens, no rastreadores: exclusiones puras del entrenamiento sin coste para la búsqueda.
Datos rápidos
- GPTBot ≠ OAI-SearchBot ≠ ChatGPT-User: tres reglas independientes de OpenAI.
- Los
Amzn-SearchBotyAmzn-Userde Amazon no entrenan con el contenido rastreado. - Amazon respeta la meta
noarchivecomo señal por página de no entrenamiento. - llms.txt es una propuesta, no un estándar adoptado; los principales rastreadores no lo respetan.
- Bloquea por agente de usuario en robots.txt, no por IP (los bloqueos de IP pueden impedir que un bot lea tu robots.txt).
Cómo auditar y decidir qué permitir
Una revisión práctica para decidir qué rastreadores de IA permitir, bloquear o simplemente vigilar.
- Extrae tus registros del servidor y enumera qué agentes de usuario de IA te están visitando realmente (GPTBot, ClaudeBot, CCBot, Bytespider, OAI-SearchBot, PerplexityBot, Applebot, etc.) y con qué frecuencia. Los registros son la fuente de verdad.
- Clasifica cada uno en su categoría: entrenamiento, búsqueda con IA u obtención de usuario. Las decisiones se derivan de la categoría, no de la marca.
- Decide tu postura ante el entrenamiento. ¿Te parece bien que entrenen con tu contenido? Permite los bots de entrenamiento. ¿No te parece bien? Bloquea GPTBot, ClaudeBot, CCBot, Bytespider, Amazonbot y Meta-ExternalAgent, y añade los tokens
Google-ExtendedyApplebot-Extended. Nada de esto afecta a los rankings de Google. - Decide con cuidado tu postura ante la búsqueda con IA. Si quieres aparecer en las respuestas de ChatGPT y Perplexity, mantén permitidos OAI-SearchBot y PerplexityBot. Bloquéalos solo si realmente quieres salir de la búsqueda con IA.
- No atrapes al bot equivocado. Confirma que una regla de «bloquear el entrenamiento» no está alcanzando también a un bot de búsqueda con IA. GPTBot ≠ OAI-SearchBot.
- Bloquea por agente de usuario, no por IP: los bloqueos de IP pueden impedir que un bot lea tu robots.txt (advertencia explícita de Anthropic).
- Verifica los bots sospechosos. CCBot y otros son suplantados; comprueba los rangos de IP publicados / DNS inverso antes de confiar en una cadena de agente de usuario.
- Considera la aplicación a nivel de red (Cloudflare AI Crawl Control) para los bots que no respeten robots.txt de forma fiable.
- No uses llms.txt como estrategia SEO: es una propuesta, apenas se lee y los principales rastreadores no la respetan. No esperes visibilidad en búsquedas con IA gracias a ella.
- Vuelve a comprobarlo cada trimestre. Aparecen bots nuevos constantemente (la lista de ai.robots.txt es una buena referencia) y los operadores cambian de comportamiento.
El error que te cuesta tráfico de búsqueda con IA
Confundir los bots de entrenamiento con los bots de búsqueda con IA es el error más caro de este ámbito, y es el mito que señalé arriba que había que desmontar. Una regla para detener el entrenamiento de modelos y una regla para detener las citas de búsqueda con IA no son la misma regla; mezclarlas tiene consecuencias opuestas.
- Incorrecto: bloquear los «bots de IA» como un bloque (una sola regla
Disallowque casualmente atrape GPTBot y OAI-SearchBot). Por qué está mal: te elimina silenciosamente de las respuestas de ChatGPT y Perplexity cuando creías que solo estabas excluyéndote del entrenamiento. Haz esto: escribe reglas separadas y con nombre para cada bot: bloquea GPTBot/ClaudeBot/CCBot/Bytespider para el entrenamiento y deja permitidos OAI-SearchBot/PerplexityBot, salvo que deliberadamente quieras salir de la búsqueda con IA.
No confundas la verificación de identidad con la política de acceso
Una lista de IP publicada por un proveedor puede ayudar a verificar quién envió una solicitud. No te dice cuál debería ser tu política y no convierte un bloqueo de red en una regla de robots.
- Incorrecto: tratar un rango verificado como una decisión automática de permitir/bloquear.
Por qué está mal: la identidad, la preferencia de rastreo declarada y el acceso de red aplicado son hechos separados.
Haz esto: expresa la política de rastreo con el token
User-agentdocumentado; añade aplicación a nivel de red (Cloudflare AI Crawl Control) para los bots que no respeten el archivo de forma fiable.
Tratar llms.txt como un control de búsqueda con IA
llms.txt se presenta constantemente como “the robots.txt for AI search,” (traducción) «el robots.txt para la búsqueda con IA», y ese encuadre es incorrecto según las propias fuentes del artículo.
- Incorrecto: publicar un archivo
llms.txtesperando que aumente la visibilidad o las citas en la búsqueda con IA. Por qué está mal: es una propuesta, no un estándar adoptado; un estudio de Ahrefs sobre 137K sitios descubrió que el 97 % de los archivos llms.txt publicados recibe cero solicitudes y ningún proveedor importante de LLM lo ha adoptado formalmente. Haz esto: trata llms.txt como una herramienta de documentación, como mucho, y dedica el esfuerzo a las reglas derobots.txty a los bots de búsqueda con IA que realmente controlan la visibilidad.
Confiar en una cadena de agente de usuario sin verificarla
CCBot, en particular, es suplantado, según reconoce el propio Common Crawl, y se ha informado ampliamente de que Bytespider ignora las reglas que afirma respetar.
- Incorrecto: asumir que la cadena
User-agentde tus registros es quien afirma ser. Por qué está mal: un bot suplantado o que no cumple puede visitarte a todo volumen mientras una regla derobots.txtpermanece sin aplicar. Haz esto: confirma las visitas de alto volumen o sospechosas con los rangos de IP publicados por el operador o mediante DNS inverso antes de confiar en la cadena; la pestaña Herramientas tiene una herramienta creada exactamente para esta comprobación.
La decisión: permitir, bloquear o monitorizar
1. Categoriza primero: eso lo decide todo. Entrenamiento frente a búsqueda con IA frente a obtención de usuario. Acertar con la categoría hace evidente la consecuencia: los bloqueos de entrenamiento son seguros para el SEO; los bloqueos de búsqueda con IA cuestan visibilidad en IA; la obtención de usuario es controvertida.
2. La regla de permitir/bloquear/monitorizar.
- Permite los bots de búsqueda con IA (OAI-SearchBot, PerplexityBot, Applebot) si quieres visibilidad de referencias de IA; la mayoría de los sitios debería hacerlo.
- Bloquea los bots de entrenamiento (GPTBot, ClaudeBot, CCBot, Bytespider) si no quieres que entrenen con tu contenido; coste de ranking cero. Añade los tokens Google-Extended/Applebot-Extended para el entrenamiento de Gemini/Apple.
- Monitoriza los obtenedores activados por el usuario y los actores conocidos (Bytespider, tráfico de Perplexity no declarado). robots.txt puede no detenerlos; los registros y las reglas a nivel de red son la forma de verlos y controlarlos realmente.
3. La comprobación “token, not bot” (traducción) «token, no bot». Antes de razonar sobre el tráfico de rastreo, pregunta: ¿es un rastreador real o un token de control? Google-Extended y Applebot-Extended no generan ningún tráfico; solo cambian un permiso en tráfico que ya ocurrió.
4. Entrenamiento ≠ búsqueda con IA (el error caro). Dos reglas de robots.txt separadas, con consecuencias opuestas. Nunca bloquees los «bots de IA» como un bloque: o no conseguirás detener el entrenamiento o te borrarás accidentalmente de las respuestas de IA.
5. robots.txt es una solicitud; la aplicación es independiente. El protocolo funciona con bots que cumplen. Para los que se excluyen (obtenedores de usuarios) o de los que se ha informado que lo ignoran (rastreadores encubiertos de Perplexity, Bytespider), la aplicación real es a nivel de red (Cloudflare); robots.txt por sí solo no lo hará.
¿Debería bloquear este bot de IA?
Este árbol de decisión recorre paso a paso la regla de permitir/bloquear/monitorizar de la pestaña Frameworks. Empieza identificando a cuál de las tres categorías pertenece el bot y responde después a la única pregunta que decide su destino.
Should I block this AI bot?
Auditoría trimestral de robots.txt para bots de IA
Una comprobación periódica mantiene tus reglas de robots.txt alineadas con la realidad mientras aparecen nuevos bots de IA y los operadores cambian de comportamiento; la pestaña Listas de comprobación ya marca «volver a comprobar cada trimestre», y esta es la versión paso a paso de esa indicación.
- Extrae las visitas de bots de IA del trimestre. Pasa tus registros del servidor por el Analizador de archivos de registro del sitio o busca la lista conocida de agentes de usuario (la pestaña Scripts contiene el comando exacto) para ver qué bots de IA te visitaron realmente y con qué frecuencia.
- Vuelve a comprobar la categoría de cada bot. Contrasta cada agente de usuario con la tabla maestra de la pestaña Guías rápidas para confirmar que sigue siendo de entrenamiento, búsqueda con IA u obtención de usuario, y marca cualquier bot nuevo o no reconocido frente a la lista del proyecto ai.robots.txt.
- Prueba tus reglas actuales. Ejecuta el
robots.txtactivo mediante el Tester de robots.txt contra el agente de usuario de cada bot para confirmar que las reglas de entrenamiento no están atrapando accidentalmente a un bot de búsqueda con IA. - Verifica las visitas sospechosas o de alto volumen. Confirma bots como CCBot o Bytespider frente a los rangos de IP publicados por el operador o mediante DNS inverso con el Verificador de Googlebot antes de confiar en la cadena de agente de usuario; las suplantaciones ocurren.
- Registra la cuota de rastreo de bots de IA del trimestre. Anota el reparto del tráfico entre entrenamiento, búsqueda con IA y obtención de usuario (consulta la pestaña Cómo medir) para que la próxima comprobación trimestral tenga una tendencia con la que comparar, no solo una instantánea.
Confirma que tu edición de robots.txt hizo lo que querías
Después de editar robots.txt para bloquear los bots de entrenamiento, ejecuta estas comprobaciones antes de considerar terminado el cambio: el objetivo es demostrar que los bots de búsqueda con IA siguen llegando a tus páginas y que los bots de entrenamiento están realmente bloqueados.
Prueba 1: los bots de búsqueda con IA siguen permitidos
- Prueba que debes ejecutar: comprueba la URL con los agentes de usuario
OAI-SearchBotyPerplexityBotmediante el Tester de robots.txt o confirma visitas reales con el Verificador de Googlebot. - Resultado esperado: «Permitido» para ambos en cualquier página que quieras que se cite en respuestas de IA.
- Interpretación de un fallo: un resultado «No permitido» significa que tu regla de bloqueo de entrenamiento es demasiado amplia y ha atrapado al agente de usuario equivocado.
- Ventana de monitorización: inmediata para el tester; deja pasar unos días para que se actualice la copia de robots.txt almacenada en caché por el propio bot.
- Disparador de reversión: un bot de búsqueda con IA que querías permitir aparece como No permitido, o las citas/referencias de ese motor disminuyen después del cambio.
Prueba 2: los bots de entrenamiento están realmente bloqueados
- Prueba que debes ejecutar: comprueba la misma URL con
GPTBot,ClaudeBot,CCBotyBytespidermediante el Tester de robots.txt. - Resultado esperado: «No permitido» para cada uno.
- Interpretación de un fallo: «Permitido» suele significar que hay un error tipográfico en el token; la ortografía y las mayúsculas importan en robots.txt.
- Ventana de monitorización: inmediata.
- Disparador de reversión: no se necesita ninguno; un bloqueo de entrenamiento no requiere una vía de reversión salvo que decidas que, después de todo, aceptas el entrenamiento.
Prueba 3: los rankings de Google no se ven afectados
- Prueba que debes ejecutar: comprueba el rendimiento/la cobertura de indexación en Search Console para las URL afectadas unas semanas después de bloquear los bots de entrenamiento o el token
Google-Extended. - Resultado esperado: ningún cambio material en impresiones o ranking; Google afirma que
Google-Extended“does not impact a site’s inclusion in Google Search.” (traducción) «no afecta a la inclusión de un sitio en Google Search». - Interpretación de un fallo: una caída amplia de impresiones que coincida con el cambio suele significar que Googlebot quedó atrapado por una regla demasiado amplia.
- Ventana de monitorización: 2–4 semanas (retraso de los informes de Search Console).
- Disparador de reversión: caen las impresiones o los rankings y Googlebot aparece como No permitido en una URL que debería ser rastreable.
Los KPI permanentes del tráfico de bots de IA
Seguir estos datos trimestre tras trimestre te indica si tu postura ante los bots de IA hace realmente lo que pretendes, independientemente de una edición concreta de robots.txt.
| Métrica | Qué indica | Cómo obtenerla | Referencia/rango realista | Frecuencia |
|---|---|---|---|---|
| Cuota de bots de IA del tráfico total de rastreo, por categoría (entrenamiento/búsqueda con IA/obtención de usuario) | Si los bots de IA están aumentando su cuota de la carga total de rastreo y qué categoría la impulsa | Registros del servidor mediante el Analizador de archivos de registro o Cloudflare AI Crawl Control si usas Cloudflare | No hay un objetivo universal: Cloudflare Radar situó los bots de IA en aproximadamente el 18,9 % de todas las solicitudes de bots del sector (2025), pero lo importante es la mezcla de tu propio sitio; establece tu propia línea de referencia el primer trimestre y sigue la tendencia | Trimestral |
| Ratio de rastreo a referencias por bot de búsqueda con IA | Cuánto «alquiler» de rastreo pagas por cada unidad de tráfico de referencias de búsqueda con IA | Contrasta los recuentos de rastreo de los registros del servidor para ese agente de usuario con las visitas reales de referencia en analítica | No hay un objetivo fijo: la pestaña Estadísticas del propio artículo cita aproximadamente 14 rastreos de Google por referencia frente a ratios mucho mayores para los rastreadores de IA; espera que tu ratio sea peor que el de Google y observa la tendencia, no el número absoluto | Trimestral |
| Precisión del bloqueo de entrenamiento | Si alguna regla Disallow de bots de entrenamiento también está atrapando sin querer a un bot de búsqueda con IA o de obtención de usuario | Audita robots.txt frente a la tabla maestra de la pestaña Guías rápidas; confirma con el Tester de robots.txt | Debería ser cero: ningún bot de búsqueda con IA debería aparecer bloqueado por una regla destinada a bots de entrenamiento | Cada cambio de robots.txt, además de una auditoría trimestral |
robots.txt: bloquea los bots principales
Bloquea los rastreadores de entrenamiento y mantén la búsqueda con IA. Esto te excluye del entrenamiento de modelos mientras sigues visible en las respuestas de ChatGPT/Perplexity. Copia los tokens exactamente.
# --- AI training crawlers ---
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Bytespider
Disallow: /
User-agent: meta-externalagent
Disallow: /
User-agent: Amazonbot
Disallow: /
# --- Training control tokens (not crawlers) ---
# Opt out of Gemini/Vertex training; search unaffected
User-agent: Google-Extended
Disallow: /
# Opt out of Apple Intelligence training; Applebot search unaffected
User-agent: Applebot-Extended
Disallow: /Bloquea los indexadores de búsqueda con IA (esto REDUCE la visibilidad en respuestas de IA). Hazlo solo si realmente quieres salir de las respuestas de ChatGPT/Perplexity.
User-agent: OAI-SearchBot
Disallow: /
User-agent: PerplexityBot
Disallow: /El principio clave: bloquear GPTBot no bloquea OAI-SearchBot ni ChatGPT-User; cada uno es una regla independiente.
Detecta bots de IA en tus registros de acceso
Descubre qué agentes de usuario de IA te están visitando y con qué frecuencia.
macOS / Linux
# Count hits per known AI bot in an Apache/Nginx access log
grep -iE 'GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|Claude-User|Claude-SearchBot|PerplexityBot|Perplexity-User|CCBot|Bytespider|Amazonbot|Amzn-SearchBot|meta-externalagent|Applebot|AI2Bot|Diffbot' access.log \
| grep -oiE 'GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|Claude-User|Claude-SearchBot|PerplexityBot|Perplexity-User|CCBot|Bytespider|Amazonbot|Amzn-SearchBot|meta-externalagent|Applebot|AI2Bot|Diffbot' \
| sort | uniq -c | sort -rnWindows (PowerShell)
# Count hits per known AI bot in an access log
$bots = 'GPTBot','OAI-SearchBot','ChatGPT-User','ClaudeBot','Claude-User','Claude-SearchBot','PerplexityBot','Perplexity-User','CCBot','Bytespider','Amazonbot','Amzn-SearchBot','meta-externalagent','Applebot','AI2Bot','Diffbot'
Select-String -Path .\access.log -Pattern ($bots -join '|') |
ForEach-Object { ($_ -split '"')[5] } |
ForEach-Object { foreach ($b in $bots) { if ($_ -match $b) { $b } } } |
Group-Object | Sort-Object Count -Descending | Select-Object Count, NameUna cadena de agente de usuario puede suplantarse (especialmente CCBot); confirma los bots importantes frente a los rangos de IP publicados por el operador o mediante DNS inverso y directo antes de actuar sobre ellos.
Clasifica las visitas de tus registros por categoría de bot de IA
Pega líneas sin procesar del registro del servidor o una lista de cadenas de agentes de usuario y haz que una IA clasifique cada una usando la tabla maestra de la pestaña Guías rápidas; resulta útil cuando miras un archivo de registro lleno de nombres de bots desconocidos.
I have a list of user-agent strings from my server logs. Using this
classification (paste the Cheat Sheets table from this article, or the list
below), classify each user-agent as one of: Training, AI-search, User fetch,
or Control token (not a crawler). Flag any user-agent you don't recognize as
"unknown — verify."
Categories:
- Training: GPTBot, ClaudeBot, CCBot, Bytespider, Amazonbot, Meta-ExternalAgent,
AI2Bot, cohere-training-data-crawler, Diffbot, Timpibot, webzio-extended
- AI-search: OAI-SearchBot, PerplexityBot, Applebot, Amzn-SearchBot
- User fetch: ChatGPT-User, Perplexity-User, Claude-User, Claude-SearchBot,
Amzn-User, Meta-ExternalFetcher
- Control token (no crawl traffic): Google-Extended, Applebot-Extended
My user-agent list:
<paste your list here>Redacta una lista de bloqueo de robots.txt según tu postura
Describe en lenguaje sencillo tu postura ante el entrenamiento y la búsqueda con IA y haz que la IA redacte las reglas de robots.txt correspondientes; después verifica el resultado con el Tester de robots.txt antes de publicarlo.
Draft a robots.txt block that does the following, using exact, correctly-cased
user-agent tokens for each rule (one User-agent/Disallow pair per bot, don't
combine bots under one User-agent line):
1. Block all training bots: GPTBot, ClaudeBot, CCBot, Bytespider,
Meta-ExternalAgent, Amazonbot.
2. Also disallow the Google-Extended and Applebot-Extended control tokens
(training/grounding opt-out only — not real crawlers).
3. Leave OAI-SearchBot and PerplexityBot allowed so AI-search visibility is
unaffected.
Output only the robots.txt block, no explanation. Herramientas para verificar y controlar bots de IA
-
Verificador de Googlebot: pega visitas de los registros del servidor y confirma si una solicitud de «GPTBot» o «ClaudeBot» procede realmente del rango de IP publicado por ese operador o de un suplantador. Es la solución directa para el error de «confiar en una cadena de agente de usuario» de la pestaña Qué no hacer.
-
Tester de robots.txt: comprueba si una URL concreta está permitida o bloqueada para el agente de usuario de un bot específico, para confirmar que una regla de bloqueo de entrenamiento no está atrapando también a un bot de búsqueda con IA.
-
Generador de robots.txt: crea las reglas de bloqueo de entrenamiento/permiso de búsqueda con IA de la pestaña Scripts sin escribir a mano los tokens de agentes de usuario (un error tipográfico rompe la regla silenciosamente).
-
Generador + validador de llms.txt: si aún quieres un archivo llms.txt con fines de documentación, genéralo y valídalo aquí, pero no esperes que aumente la visibilidad en la búsqueda con IA (consulta Qué no hacer).
Recursos que merecen tu tiempo
Mis artículos relacionados
- Conoce a los nuevos rastreadores web: los bots de IA se acercan a los bots de los motores de búsqueda: mi análisis de Cloudflare Radar; los bots de IA como rastreador número 2 y el marco del contrato social.
- Los bots de IA que más bloquean ~140 millones de sitios web: datos de tasas de bloqueo de robots.txt en la web abierta y correlación entre volumen de solicitudes y tasa de bloqueo.
- ChatGPT tiene el 12 % del volumen de búsqueda de Google, pero Google envía 190x más tráfico: la brecha de referencias entre IA y búsqueda que impulsa el debate sobre los bloqueos.
- Lo que realmente sabemos sobre optimizar para la búsqueda de LLM: el contexto GEO más amplio.
De otros autores
- Cloudflare: Perplexity usa rastreadores encubiertos y no declarados: la investigación de agosto de 2025 (hallazgos informados).
- Robb Knight: Perplexity AI miente sobre su agente de usuario: la investigación original de junio de 2024.
- Proyecto ai.robots.txt: lista mantenida por la comunidad con más de 150 agentes de usuario de bots de IA.
- Known Agents (antes Dark Visitors): directorio completo de bots de IA.
- Cloudflare: Declara tu independencia de la IA (bloqueo de bots de IA con un clic): anuncio del interruptor de Cloudflare «AI Scrapers and Crawlers» con un clic.
- Cloudflare: Controlar el uso del contenido para el entrenamiento de IA: robots.txt gestionado, directivas Content Signals y explicación de la beta de pago por rastreo.
- Heise Online: Rastreadores sin límites: Perplexity ignora robots.txt: información de junio de 2024 sobre la evasión de robots.txt por Perplexity.
- Gizmodo: Perplexity AI ignoró las reglas de internet: cobertura adicional de la controversia sobre el cumplimiento de robots.txt.
Estadísticas que merece la pena citar
- Los bots de IA son claramente el rastreador número 2. Según mi análisis de Cloudflare Radar, los bots de motores de búsqueda siguen rastreando más, pero los bots de IA ocupan firmemente el segundo lugar y van camino de adelantarlos: los bots de IA ya representan aproximadamente el 18,9 % de todas las solicitudes de bots. Fuente
- La brecha de referencias que impulsa los bloqueos. Google envía ~190x más tráfico a los sitios web que ChatGPT, aunque ChatGPT tiene una cuota significativa del volumen de búsqueda de Google: el desequilibrio que subyace al argumento del «contrato social». Fuente
- Ratios de rastreo a referencias (Cloudflare, 2025). Aproximadamente 14 rastreos de Google por visita de referencia, frente a ratios mucho mayores para los rastreadores de IA: del orden de miles de rastreos de OpenAI y decenas de miles de rastreos de Anthropic por referencia. Las cifras explican por qué los editores cuestionan el intercambio.
- Comprobación de la realidad de llms.txt. En un estudio de Ahrefs sobre 137K sitios, aproximadamente el 28 % publicó un archivo llms.txt, pero el 97 % de esos archivos recibió cero solicitudes y ningún proveedor importante de LLM lo ha adoptado formalmente. Fuente
- Tasas de bloqueo en la web abierta. Según mi estudio de ~140M sitios, los bots de IA más bloqueados se agrupan en torno a GPTBot, CCBot, ClaudeBot, Amazonbot y Bytespider; las tasas de bloqueo siguen el volumen de solicitudes. Fuente
- Alcance y aplicación de Bytespider. Bytespider accedió al 40,40 % de todos los sitios protegidos por Cloudflare antes de que Cloudflare empezara a bloquearlo en julio de 2024; el tráfico cayó un 71,45 % después. Meta-ExternalAgent accedió al 22,16 % de los sitios protegidos, solo por detrás de GPTBot (28,97 %). Fuente
- Crecimiento del tráfico de bots de IA. Los datos de Cloudflare Radar muestran que el tráfico de bots de IA creció un 65 % en seis meses (2025), y que las solicitudes de GPTBot aumentaron un 305 % entre mayo de 2024 y mayo de 2025. En julio de 2025, los nuevos dominios de Cloudflare bloquean por defecto los rastreadores de IA conocidos y más de 1 millón de clientes de Cloudflare han activado la función de bloqueo de bots de IA. Fuente
Ponte a prueba: rastreadores de IA
Cinco preguntas rápidas sobre las tres categorías de rastreadores de IA y las trampas relacionadas. Elige una respuesta para cada una y después compruébala.
Registro de cambios
Actualizado el 6 ago 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.
Actualizado el 6 ago 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.
Actualizado el 6 ago 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.
Actualizado el 6 ago 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.
Actualizado el 6 ago 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.
Actualizado el 6 ago 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.
Actualizado el 6 ago 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.
Actualizado el 6 ago 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.
Actualizado el 6 ago 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.
Actualizado el 6 ago 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.
Actualizado el 30 jul 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.
Actualizado el 29 jul 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.
Actualizado el 29 jul 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.
Actualizado el 28 jul 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.
Actualizado el 19 jul 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.
Actualizado el 16 jul 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
- Avanzado
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.