SEO com llms.txt

llms.txt é um arquivo Markdown proposto em /llms.txt para orientar sistemas de IA. O Google o ignora, 97% dos arquivos recebem zero solicitações, e o Claude Code é o leitor real.

Publicado pela primeira vez: 24 de jun. de 2026 · Última atualização: 11 de ago. de 2026 · Avançado
Idiomas
1 sinal de evidência nesta página

llms.txt é uma proposta de Jeremy Howard (Answer.AI) para ajudar agentes de IA a navegar em sites — 97% dos arquivos publicados recebem zero solicitações, o Google o ignora, e o Claude Code é o principal consumidor, não os bots de busca.

A especificação descreve um resumo voluntário do site amigável para LLMs; ela não estabelece conformidade de crawler ou comportamento de indexação. Evidence for this claim llms.txt is a community proposal for a Markdown file at /llms.txt that offers LLM-friendly site information; it is not a web standard. Scope: The proposal's own specification and stated purpose. Confidence: high · Verified: llms.txt proposal A OpenAI atualmente documenta bots nomeados e configurações independentes de robots.txt em vez disso. Evidence for this claim OpenAI documents robots.txt controls for its declared crawlers and does not list llms.txt as a crawler control. Scope: OpenAI's published crawler controls; absence is not proof that no internal system ever fetches the file. Confidence: high · Verified: OpenAI: Crawlers

TL;DR — llms.txt é uma proposta (Jeremy Howard, Answer.AI, 3 de setembro de 2024), não um padrão adotado. É um índice Markdown curado em /llms.txt, com um opcional /llms-full.txt de conteúdo completo. Os bots que as pessoas esperam que o leiam para busca por IA — OAI-SearchBot, PerplexityBot — mal aparecem; o consumidor dominante é o Claude Code e outros agentes de codificação. O Google ignora (Illyes confirmou; Mueller comparou à meta tag de palavras-chave). No estudo da Ahrefs com 137 mil sites, 97% dos arquivos não receberam nenhuma solicitação, e o SE Ranking descobriu que remover o llms.txt de um modelo de citação melhorou sua precisão. Vale a pena adicionar para documentação de desenvolvedores consumida por agentes de codificação; para GEO/AEO em um site normal, os dados não suportam isso. Há também um risco real de injeção de prompt.

O que llms.txt realmente é

llms.txt é uma proposta — quero começar com essa palavra porque é toda a história. Não há RFC, nenhuma bênção do W3C, nenhum processo IETF. É uma sugestão bem fundamentada de Jeremy Howard (cofundador da Answer.AI e fast.ai), publicada em 3 de setembro de 2024, que pegou forte no mundo da documentação para desenvolvedores e foi enxertada no SEO por uma comunidade faminta por um atalho de visibilidade em IA.

O problema de design que ela aborda é legítimo. Como a especificação diz, “Large language models increasingly rely on website information, but face a critical limitation: context windows are too small to handle most websites in their entirety.” (tradução) «Modelos de linguagem grandes dependem cada vez mais de informações de sites, mas enfrentam uma limitação crítica: as janelas de contexto são pequenas demais para lidar com a maioria dos sites em sua totalidade». E converter HTML em texto limpo e amigável para LLM é, nas palavras da especificação, “difficult and imprecise.” (tradução) «difícil e impreciso». A correção de Howard é deixar o autor do site pré-achatar o conteúdo que eles querem que os modelos vejam em Markdown curado.

O formato

/llms.txt é um documento Markdown ordenado:

  1. H1 (obrigatório) — nome do projeto ou site.
  2. Blockquote — um resumo curto com as informações principais.
  3. Prosa/listas opcionais — parágrafos ou marcadores, mas sem cabeçalhos aqui.
  4. Listas de links delimitadas por H2- [name](url): optional notes.
  5. Uma seção ## Optional — links secundários que um modelo pode pular quando o contexto está apertado.

Um exemplo mínimo, da especificação:

# FastHTML

> FastHTML is a python library which brings together Starlette, Uvicorn, HTMX,
> and fastcore's FT...

## Docs

- [FastHTML quick start](url): A brief overview of many features

## Optional

- [Starlette documentation](url): A subset useful for FastHTML development.

Existem duas convenções complementares:

  • /llms-full.txt — todo o conteúdo do site achatado em um único arquivo Markdown. Anthropic, Perplexity e Stripe publicam tanto este quanto a forma curta.
  • A convenção de URL .md — oferecer versões page.md de páginas individuais para que fiquem prontas para LLM sem o dump completo.

Uma variante mais nova dispensa completamente os arquivos estáticos: Markdown servido na borda via negociação de conteúdo. O Markdown for Agents da Cloudflare converte qualquer página HTML em Markdown limpo em tempo real quando um cliente envia Accept: text/markdown — sem arquivos .md por página, sem /llms-full.txt para regenerar, sem mudanças de template, porque o CDN faz a conversão na borda (a Cloudflare cita ~80% menos tokens para o agente). É um recurso pago — plano Pro ou superior, não o nível gratuito — então neste site é uma atualização da Cloudflare de distância de ser ativado em vez de algo que eu construí manualmente. Se vale a pena ativar é a mesma pergunta em aberto que paira sobre o próprio llms.txt: servir aos rastreadores uma cópia Markdown paralela de cada página é conveniente, mas é outra representação para manter em sincronia, e Fabrice Canel, da Bing, sinalizou a carga de rastreamento duplicada e o risco adjacente a cloaking de conteúdo alternativo servido na borda. Verifique seus logs para demanda real de agentes antes de ativar.

llms.txt vs robots.txt — eles não são a mesma coisa

O equívoco mais comum é que llms.txt é “robots.txt para IA.” Não é, e confundi-los leva a decisões ruins.

robots.txtllms.txt
FinalidadeControle de acesso — o que os rastreadores podem buscarOrientação de conteúdo — o que é útil de ler
FormatoDiretivas (User-agent:, Disallow:)Links Markdown + descrições
Aplicado?Sim, por rastreadores compatíveisNão — apenas consultivo
MomentoNa hora do rastreamento, antes da buscaNa hora da inferência, ao montar o contexto
É um padrão?Sim, décadas de existência, universalNão — uma proposta
Pode bloquear?SimNão

robots.txt é um padrão real e aplicado. llms.txt é uma caixa de sugestões que a maioria dos sistemas ainda não está lendo. Se você quer controlar o acesso de rastreadores de IA — que é um objetivo separado e legítimo — isso vive em robots.txt e rastreadores de IA, não aqui.

Quem realmente lê

Esta é a seção que importa, porque é onde os dados divergem mais fortemente do hype. No estudo da Ahrefs com 137 210 domínios (tráfego de maio de 2026):

  • 97% dos arquivos llms.txt publicados receberam zero solicitações. Apenas ~3% (cerca de 1 100 domínios) tiveram qualquer tráfego.
  • Dos arquivos que foram solicitados: 96% das solicitações vieram de bots, 4% de humanos.
  • Das solicitações de bots, 77% vieram de ferramentas não relacionadas a IA — auditores de SEO (a própria Ahrefs entre eles), rastreadores anônimos, bots de perfil técnico. A ironia do SEO se escreve sozinha.
  • Apenas ~19,5% vieram de ferramentas de IA, e quando você detalha isso, fica pior para a teoria do GEO:
    • Agentes e infraestrutura de IA (agentes de codificação): ~10,5%
    • Rastreadores de treinamento (GPTBot liderou com 4,51%): ~5,3%
    • Assistentes de IA: ~2,5%
    • Bots de recuperação de IA — os que constroem índices de citação: 1,1%.

Leia essa última linha duas vezes. Os bots para os quais a maioria das pessoas adiciona llms.txt — OAI-SearchBot, PerplexityBot — “mal foram registrados.” O principal consumidor de IA é Claude Code, o agente de codificação da Anthropic, que o estudo descobriu que “superou todos os bots de recuperação de IA, assistentes e rastreadores de treinamento, exceto o GPTBot.” E o GPTBot é um rastreador de treinamento que rastreia tudo independentemente — sua presença não é evidência de parsing intencional de llms.txt.

Outras medições independentes chegam ao mesmo lugar. A OtterlyAI observou um site por 90 dias: de mais de 62 100 visitas de bots de IA, exatamente 84 acessaram /llms.txt — cerca de 0,1%, apresentando “desempenho 3x pior que o de páginas médias.” Uma análise separada de mais de 515 milhões de eventos de bots de LLM em 90 dias encontrou 408 solicitações no total direcionadas a /llms.txt — “estatisticamente insignificante.”

A conclusão é a divisão entre documentação para desenvolvedores e GEO: llms.txt funciona para o que Howard o criou (agentes de codificação navegando em documentações de API), e em grande parte não é acessado pelos bots de citação de busca que a comunidade de SEO quer que ele alcance.

O que os provedores disseram

Google — não, e sem planos. Gary Illyes confirmou no Search Central Live (julho de 2025) que o Google não suporta llms.txt e não planeja suportar. John Mueller, a voz mais citada aqui, comparou-o à meta tag de palavras-chave (abril de 2025) e o chamou de “muleta temporária, talvez para economizar alguns tokens” para ferramentas de codificação de IA — explicitamente não um mecanismo de visibilidade em buscas. A orientação do Google de maio de 2026 afirmou que arquivos legíveis por máquina como llms.txt não são necessários para AI Overviews ou AI Mode, que “continuam a depender de sinais tradicionais de SEO.” (O Google publicou brevemente um llms.txt em sua documentação de desenvolvedores em 3 de dezembro de 2025 e o removeu no mesmo dia — depois atribuído a uma atualização do CMS, não a uma mudança de estratégia.)

OpenAI — nada. Nenhum anúncio de que ChatGPT, GPTBot ou OAI-SearchBot o interpretam. Os logs do servidor contradizem um uso significativo; OAI-SearchBot “mal foi registrado.” A OpenAI aponta as pessoas para robots.txt para controle de rastreadores.

Anthropic — o interessante. A Anthropic publica tanto llms.txt quanto llms-full.txt em docs.anthropic.com/llms.txt, e o Claude Code comprovadamente busca arquivos llms.txt de outros sites — é o maior consumidor de IA nos dados. Mas isso é uma história de ferramenta de codificação. Não há confirmação de que a camada de busca ou citação do Claude.ai honre o llms.txt. “O agente de codificação da Anthropic lê” e “o índice de busca da Anthropic confia nele” são afirmações diferentes, e apenas a primeira é suportada.

Perplexity — afirma que sim, os dados dizem raramente. A Perplexity declarou que recupera llms.txt e o usa para “priorizar a seleção de páginas.” Mas a busca proativa é o problema: o PerplexityBot “mal apareceu” nos dados de requisições, e há “quase zero atividade do PerplexityBot solicitando arquivos llms.txt proativamente.” Cole uma URL de llms.txt no Perplexity e ele lê normalmente; o uso autônomo e proativo é a lacuna entre política e prática.

Bing/Microsoft, Apple, Meta — nenhuma posição pública. Trate como não confirmado.

Isso move as citações de IA?

Nenhum benefício demonstrado. A SE Ranking modelou 300 000 domínios com uma regressão XGBoost + análise SHAP e descobriu que remover o llms.txt do modelo melhorou sua precisão — a conclusão deles: “LLMs.txt doesn’t seem to directly impact AI citation frequency. At least not yet.” (tradução) «O llms.txt não parece impactar diretamente a frequência de citações de IA. Pelo menos ainda não». Um estudo do Search Engine Land com 10 sites e 180 dias viu 8 de 10 sites sem mudança mensurável, e os dois “vencedores” tiveram mudanças confusas (cobertura de PR, novas páginas de FAQ, correções técnicas) que você não pode separar do próprio llms.txt.

A comparação com meta-keywords — justa ou não?

A analogia de Mueller com a meta tag de keywords se sustenta nos pontos que importam: ambos são autodescrições do proprietário do site, nenhum é verificado, e ambos estão abertos a manipulação/cloaking — você poderia mostrar uma coisa no llms.txt e outra na página. Essa manipulabilidade é exatamente por que um produto sério de busca por IA não confiará em uma autodescrição em vez das páginas reais. O contra-argumento (Carolyn Shelby) é que o llms.txt pelo menos aponta para URLs reais que precisam entregar — é “um holofote, não uma lista de desejos.” Ambos estão certos, e o resultado prático é o mesmo: sistemas de busca por IA não dependem dele.

Quando vale a pena adicionar — e quando pular

Adicione se você mantém documentação para desenvolvedores ou uma referência de API cujo público principal são agentes de codificação de IA (Claude Code, Cursor, Copilot, Codeium). Esse é o caso de uso para o qual foi criado, e funciona.

Pule — ou pelo menos não espere retornos de visibilidade em IA — para sites de conteúdo, mídia, ecommerce e sites de negócios comuns. O custo é de ~20 minutos; o benefício de GEO hoje é quase zero; e esses 20 minutos são melhor gastos em estrutura de conteúdo, cobertura de FAQ e nos fundamentos de otimização para busca por IA que realmente movem a visibilidade em IA. As manchetes de alta adoção (o número de 844 mil+ da BuiltWith) são infladas pela implantação automática de plataformas — a Mintlify lançou o llms.txt para todos os seus sites de documentação hospedados de uma vez. Adoção não é uso; 97% dos arquivos recebem zero requisições.

O ângulo de segurança

Isso é subnotificado e real: como os agentes de IA são projetados para confiar no que está no llms.txt, o arquivo é uma superfície de ataque natural. O estudo da Ahrefs sinalizou atores maliciosos procurando vulnerabilidades de injeção de prompt em arquivos llms.txt. Se você publicar um, trate-o como sensível à segurança: mantenha-o em controle de versão, alerte sobre mudanças não autorizadas e nunca coloque nada nele que você não mostraria publicamente.

Implementando (se você decidir fazer)

  • Colocação: /llms.txt na raiz do domínio, servido como text/plain ou text/markdown, HTTP 200.
  • Selecione, não despeje: 20–50 dos seus links mais importantes. Se você listar tudo, um modelo pode simplesmente rastrear diretamente — a curadoria é o ponto principal.
  • Opcionalmente, sirva /llms-full.txt para contextos que queiram todo o seu conteúdo.
  • Valide: carregue o arquivo no Claude, ChatGPT ou Perplexity e peça para resumir seu site; depois verifique os logs do servidor após algumas semanas para solicitações reais.
  • Existem geradores para VitePress (vitepress-plugin-llms), Docusaurus (docusaurus-plugin-llms), WordPress (“Website LLMs.txt”), Drupal, além de um CLI Python (llms_txt2ctx).

O resultado final: baixo custo, benefício GEO atualmente quase nulo, genuinamente útil para os casos de uso de agentes de codificação para os quais foi criado. Verifique seus próprios logs de servidor antes de decidir — se você está vendo tráfego de Claude-Code/Cursor, o llms.txt pode ajudá-los; se você está buscando OAI-SearchBot e PerplexityBot, não é a alavanca.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.