Archivo llms.txt

llms.txt es un archivo Markdown propuesto en /llms.txt para guiar a los sistemas de IA. Google lo ignora, el 97% de los archivos no reciben solicitudes, y Claude Code es el lector real.

Publicado por primera vez: 24 jun 2026 · Última actualización: 11 ago 2026 · Avanzado
Idiomas
1 señal de evidencia en esta página

llms.txt es una propuesta de Jeremy Howard (Answer.AI) para ayudar a los agentes de IA a navegar por los sitios: el 97% de los archivos publicados no reciben solicitudes, Google lo ignora, y Claude Code es el consumidor principal, no los bots de búsqueda.

La especificación describe un resumen voluntario del sitio amigable para LLM; no establece cumplimiento de rastreo ni comportamiento de indexación. Evidence for this claim llms.txt is a community proposal for a Markdown file at /llms.txt that offers LLM-friendly site information; it is not a web standard. Scope: The proposal's own specification and stated purpose. Confidence: high · Verified: llms.txt proposal OpenAI actualmente documenta bots nombrados y configuraciones independientes de robots.txt en su lugar. Evidence for this claim OpenAI documents robots.txt controls for its declared crawlers and does not list llms.txt as a crawler control. Scope: OpenAI's published crawler controls; absence is not proof that no internal system ever fetches the file. Confidence: high · Verified: OpenAI: Crawlers

TL;DR — llms.txt es una propuesta (Jeremy Howard, Answer.AI, 3 de septiembre de 2024), no un estándar adoptado. Es un índice Markdown curado en /llms.txt, con un /llms-full.txt opcional de contenido completo. Los bots que la gente espera que lo lean para la búsqueda con IA — OAI-SearchBot, PerplexityBot — apenas registran; el consumidor dominante es Claude Code y otros agentes de codificación. Google lo ignora (Illyes lo confirmó; Mueller lo comparó con la metaetiqueta de palabras clave). En el estudio de Ahrefs de 137 000 sitios, el 97 % de los archivos recibió cero solicitudes, y SE Ranking descubrió que eliminar llms.txt de un modelo de citación mejoraba su precisión. Vale la pena añadirlo para documentación de desarrolladores consumida por agentes de codificación; para GEO/AEO en un sitio normal, los datos no lo respaldan. También existe un riesgo real de inyección de prompts.

Qué es realmente llms.txt

llms.txt es una propuesta — quiero empezar con esa palabra porque es toda la historia. No hay RFC, ni bendición del W3C, ni proceso IETF. Es una sugerencia bien razonada de Jeremy Howard (cofundador de Answer.AI y fast.ai), publicada el 3 de septiembre de 2024, que caló hondo en el mundo de la documentación para desarrolladores y se injertó en el SEO por una comunidad ávida de un atajo hacia la visibilidad en IA.

El problema de diseño que aborda es legítimo. Como dice la especificación, “Large language models increasingly rely on website information, but face a critical limitation: context windows are too small to handle most websites in their entirety.” (traducción) «Los modelos de lenguaje grandes dependen cada vez más de la información de los sitios web, pero se enfrentan a una limitación crítica: las ventanas de contexto son demasiado pequeñas para manejar la mayoría de los sitios web en su totalidad.» Y convertir HTML en texto limpio y apto para LLM es, en palabras de la especificación, “difficult and imprecise.” (traducción) «difícil e impreciso». La solución de Howard es permitir que el autor del sitio aplane previamente el contenido que quiere que los modelos vean en Markdown curado.

El formato

/llms.txt es un documento Markdown ordenado:

  1. H1 (obligatorio) — nombre del proyecto o sitio.
  2. Blockquote — un resumen breve con la información clave.
  3. Prosa/listas opcionales — párrafos o viñetas, pero sin encabezados aquí.
  4. Listas de enlaces delimitadas por H2- [name](url): optional notes.
  5. Una sección ## Optional — enlaces secundarios que un modelo puede omitir cuando el contexto es limitado.

Un ejemplo mínimo, de la especificación:

# FastHTML

> FastHTML is a python library which brings together Starlette, Uvicorn, HTMX,
> and fastcore's FT...

## Docs

- [FastHTML quick start](url): A brief overview of many features

## Optional

- [Starlette documentation](url): A subset useful for FastHTML development.

Existen dos convenciones complementarias:

  • /llms-full.txt — todo el contenido del sitio aplanado en un solo archivo Markdown. Anthropic, Perplexity y Stripe publican tanto esta forma como la corta.
  • La convención de URL .md — ofrecer versiones page.md de páginas individuales para que estén listas para LLM sin el volcado completo.

Una variante más reciente omite por completo los archivos estáticos: Markdown servido en el edge mediante negociación de contenido. El Markdown for Agents de Cloudflare convierte cualquier página HTML en Markdown limpio sobre la marcha cuando un cliente envía Accept: text/markdown — sin archivos .md por página, sin /llms-full.txt que regenerar, sin cambios de plantilla, porque la CDN hace la conversión en el edge (Cloudflare cita ~80 % menos tokens para el agente). Es una función de pago — plan Pro y superiores, no el nivel gratuito — así que en este sitio está a una actualización de Cloudflare de activarse en lugar de algo que haya construido a mano. Si vale la pena activarlo es la misma pregunta abierta que pesa sobre el propio llms.txt: servir a los rastreadores una copia Markdown paralela de cada página es conveniente, pero es otra representación que mantener sincronizada, y Fabrice Canel de Bing ha señalado la duplicación de la carga de rastreo y el riesgo similar al cloaking del contenido alternativo servido en el edge. Revisa tus registros para ver la demanda real de agentes antes de activarlo.

llms.txt vs robots.txt — no son lo mismo

El error más común es pensar que llms.txt es “robots.txt para IA”. No lo es, y confundirlos lleva a malas decisiones.

robots.txtllms.txt
PropósitoControl de acceso: qué pueden obtener los rastreadoresGuía de contenido: qué es útil leer
FormatoDirectivas (User-agent:, Disallow:)Enlaces Markdown + descripciones
¿Se aplica?Sí, por rastreadores compatiblesNo: solo es orientativo
MomentoMomento del rastreo, antes de obtenerMomento de la inferencia, al ensamblar el contexto
¿Es un estándar?Sí, de décadas, universalNo: es una propuesta
¿Puede bloquear?No

robots.txt es un estándar real y aplicado. llms.txt es una caja de sugerencias que la mayoría de los sistemas aún no leen. Si quieres controlar el acceso de los rastreadores de IA —que es un objetivo legítimo y aparte—, eso se trata en robots.txt y rastreadores de IA, no aquí.

Quién lo lee realmente

Esta es la sección que importa, porque es donde los datos se alejan más del bombo publicitario. En el estudio de Ahrefs sobre 137 210 dominios (tráfico de mayo de 2026):

  • El 97 % de los archivos llms.txt publicados no recibió ninguna solicitud. Solo alrededor del 3 % (unos 1 100 dominios) registró algo de tráfico.
  • De los archivos que se solicitaron: el 96 % de las solicitudes provino de bots, el 4 % de humanos.
  • De las solicitudes de bots, el 77 % provino de herramientas que no son de IA —auditores de SEO (el propio Ahrefs entre ellos), rastreadores anónimos, bots de perfilado técnico—. La ironía del SEO se escribe sola.
  • Solo alrededor del 19,5 % provino de herramientas de IA, y al desglosarlo empeora para la teoría del GEO:
    • Agentes e infraestructura de IA (agentes de codificación): ~10,5 %
    • Rastreadores de entrenamiento (GPTBot lideró con el 4,51 %): ~5,3 %
    • Asistentes de IA: ~2,5 %
    • Bots de recuperación de IA —los que construyen índices de citas—: 1,1 %.

Lee esa última línea dos veces. Los bots para los que la mayoría añade llms.txt —OAI-SearchBot, PerplexityBot— “apenas se registraron”. El consumidor de IA dominante es Claude Code, el agente de codificación de Anthropic, que según el estudio “superó en captura a todos los bots de recuperación de IA, asistentes y rastreadores de entrenamiento excepto GPTBot”. Y GPTBot es un rastreador de entrenamiento que rastrea todo sin distinción; su presencia no es evidencia de un análisis intencional de llms.txt.

Otras mediciones independientes llegan al mismo punto. OtterlyAI observó un sitio durante 90 días: de más de 62 100 visitas de bots de IA, exactamente 84 llegaron a /llms.txt —alrededor del 0,1 %—, con un rendimiento “3 veces peor que el de las páginas promedio”. Un análisis aparte de más de 515 millones de eventos de bots de LLM en 90 días encontró 408 solicitudes en total dirigidas a /llms.txt —“estadísticamente insignificante”—.

La conclusión es la división entre documentación para desarrolladores y GEO: llms.txt funciona para lo que Howard lo creó (agentes de codificación que navegan por la documentación de API) y, en gran medida, los bots de citas de búsqueda que la comunidad SEO quiere alcanzar no lo tocan.

Lo que han dicho los proveedores

Google: no, y sin planes. Gary Illyes confirmó en Search Central Live (julio de 2025) que Google no admite llms.txt ni planea hacerlo. John Mueller, la voz más citada aquí, lo comparó con la metaetiqueta de palabras clave (abril de 2025) y lo llamó “muleta temporal, quizá para ahorrar algunos tokens” para las herramientas de codificación de IA —explícitamente no un mecanismo de visibilidad en la búsqueda—. La guía de Google de mayo de 2026 afirmó que los archivos legibles por máquina como llms.txt no son necesarios para AI Overviews ni para AI Mode, que “siguen dependiendo de las señales tradicionales de SEO”. (Google sí publicó brevemente un llms.txt en su documentación para desarrolladores el 3 de diciembre de 2025, y lo retiró el mismo día; luego se atribuyó a una actualización del CMS, no a un cambio de estrategia).

OpenAI: nada. No hay ningún anuncio de que ChatGPT, GPTBot u OAI-SearchBot lo analicen. Los registros del servidor contradicen un uso significativo; OAI-SearchBot “apenas se registró”. OpenAI remite a la gente a robots.txt para el control de rastreadores.

Anthropic — el interesante. Anthropic publica tanto llms.txt como llms-full.txt en docs.anthropic.com/llms.txt, y Claude Code demuestra que obtiene los archivos llms.txt de otros sitios — es el mayor consumidor de IA en los datos. Pero esa es una historia de herramienta de codificación. No hay confirmación de que la capa de búsqueda o citación de Claude.ai respete llms.txt. “El agente de codificación de Anthropic lo lee” y “el índice de búsqueda de Anthropic confía en él” son afirmaciones diferentes, y solo la primera está respaldada.

Perplexity — dice que sí, los datos dicen que rara vez. Perplexity ha declarado que recupera llms.txt y lo usa para “priorizar la selección de páginas.” Pero la obtención proactiva es el problema: PerplexityBot “apenas se registró” en los datos de solicitudes, y hay “casi cero actividad de PerplexityBot solicitando archivos llms.txt de forma proactiva.” Pega una URL de llms.txt en Perplexity y lo lee sin problemas; el uso autónomo y proactivo es la brecha entre la política y la práctica.

Bing/Microsoft, Apple, Meta — sin posición pública. Trátalos como no confirmados.

¿Influye en las citas de IA?

Sin beneficio demostrado. SE Ranking modeló 300 000 dominios con una regresión XGBoost + análisis SHAP y descubrió que eliminar llms.txt del modelo mejoraba su precisión — su conclusión: “LLMs.txt no parece impactar directamente la frecuencia de citas de IA. Al menos no todavía.” Un estudio de Search Engine Land con 10 sitios y 180 días vio que 8 de 10 sitios no mostraron cambios medibles, y los dos “ganadores” tenían cambios de confusión (cobertura de relaciones públicas, nuevas páginas de preguntas frecuentes, correcciones técnicas) que no puedes separar del propio llms.txt.

La comparación con meta keywords — ¿justa o no?

La analogía de Mueller con la metaetiqueta de keywords se sostiene en los puntos que importan: ambas son autodescripciones del propietario del sitio, ninguna está verificada, y ambas están abiertas a la manipulación/encubrimiento — podrías mostrar una cosa en llms.txt y otra en la página. Esa manipulabilidad es exactamente por qué un producto serio de búsqueda con IA no confiará en una autodescripción por encima de las páginas reales. El contraargumento (Carolyn Shelby) es que llms.txt al menos apunta a URLs reales que deben cumplir — es “un reflector, no una lista de deseos.” Ambos tienen razón, y el resultado práctico es el mismo: los sistemas de búsqueda con IA no dependen de él.

Cuándo vale la pena añadirlo — y cuándo omitirlo

Añádelo si gestionas documentación para desarrolladores o una referencia de API cuya audiencia principal son agentes de codificación con IA (Claude Code, Cursor, Copilot, Codeium). Ese es el caso de uso para el que se creó, y funciona.

Omítelo — o al menos no esperes retornos de visibilidad en IA — para sitios de contenido, medios, comercio electrónico y sitios empresariales comunes. El costo es de ~20 minutos; el beneficio de GEO hoy es casi nulo; y esos 20 minutos se emplean mejor en la estructura del contenido, la cobertura de preguntas frecuentes y los fundamentos de optimización de búsqueda con IA que realmente mueven la visibilidad en IA. Los titulares de alta adopción (la cifra de 844K+ de BuiltWith) están inflados por la implementación automática de plataformas — Mintlify implementó llms.txt en todos sus sitios de documentación alojados a la vez. La adopción no es uso; el 97 % de los archivos reciben cero solicitudes.

El ángulo de seguridad

Esto está poco reportado y es real: como los agentes de IA están diseñados para confiar en lo que hay en llms.txt, el archivo es una superficie de ataque natural. El estudio de Ahrefs señaló a actores malintencionados que sondean archivos llms.txt en busca de vulnerabilidades de inyección de prompts. Si publicas uno, trátalo como sensible a la seguridad: mantenlo en control de versiones, alerta sobre cambios no autorizados y nunca pongas nada en él que no mostrarías públicamente.

Implementarlo (si decides hacerlo)

  • Ubicación: /llms.txt en la raíz del dominio, servido como text/plain o text/markdown, HTTP 200.
  • Selecciona, no vuelques: 20–50 de tus enlaces más importantes. Si enumeras todo, un modelo podría rastrear directamente — la selección es el punto completo.
  • Opcionalmente sirve /llms-full.txt para contextos que quieran todo tu contenido.
  • Valida: carga el archivo en Claude, ChatGPT o Perplexity y pídele que resuma tu sitio; luego revisa los registros del servidor después de unas semanas para ver solicitudes reales.
  • Existen generadores para VitePress (vitepress-plugin-llms), Docusaurus (docusaurus-plugin-llms), WordPress (“Website LLMs.txt”), Drupal, además de una CLI de Python (llms_txt2ctx).

La conclusión: bajo costo, beneficio GEO actualmente casi nulo, genuinamente útil para el caso de uso de agentes de codificación para el que nació. Revisa tus propios registros del servidor antes de decidir — si ves tráfico de Claude-Code/Cursor, llms.txt puede ayudarles; si buscas a OAI-SearchBot y PerplexityBot, no es la palanca.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.