File llms.txt
llms.txt è un file Markdown proposto in /llms.txt per guidare i sistemi AI. Google lo ignora, il 97% dei file non riceve alcuna richiesta, e Claude Code è il vero lettore.
Lingue
1 segnale di evidenza in questa pagina
- Strumento live correlatollms.txt Generator + Validator
llms.txt è una proposta di Jeremy Howard (Answer.AI) per aiutare gli agenti AI a navigare i siti — il 97% dei file pubblicati non riceve alcuna richiesta, Google lo ignora, e Claude Code è il consumatore principale, non i bot di ricerca.
llms.txt è una proposta della community per un file Markdown in /llms.txt, non uno standard web adottato. Evidence for this claim llms.txt is a community proposal for a Markdown file at /llms.txt that offers LLM-friendly site information; it is not a web standard. Scope: The proposal's own specification and stated purpose. Confidence: high · Verified: llms.txt proposal I controlli pubblicati da OpenAI per i crawler usano robots.txt e non documentano llms.txt come controllo. Evidence for this claim OpenAI documents robots.txt controls for its declared crawlers and does not list llms.txt as a crawler control. Scope: OpenAI's published crawler controls; absence is not proof that no internal system ever fetches the file. Confidence: high · Verified: OpenAI: Crawlers
TL;DR — llms.txt è un file Markdown che metti in
/llms.txte che fornisce ai sistemi AI un elenco breve e curato delle tue pagine più importanti. Uno sviluppatore di nome Jeremy Howard lo ha proposto nel 2024. È una buona idea, ma in pratica quasi nessuno lo legge — Google lo ignora del tutto, e la cosa principale che lo legge sono gli assistenti di codifica AI, non i bot di ricerca che la maggior parte delle persone spera di raggiungere. Costa poco aggiungerlo e probabilmente non sposterà la tua visibilità AI.
Cos’è llms.txt
llms.txt è un semplice file Markdown che metti nella radice del tuo sito —
yoursite.com/llms.txt. Dentro, scrivi il nome del tuo sito, una descrizione di una riga,
e poi un breve elenco di link alle tue pagine più importanti, ciascuno con
una breve nota su cosa tratta. L’idea è che un sistema AI possa leggere quel
singolo file e capire immediatamente cos’è il tuo sito e dove si trova la roba buona,
invece di dover scansionare e analizzare ogni pagina.
È stato proposto da Jeremy Howard — la persona dietro fast.ai (un popolare corso di deep learning) e Answer.AI — nel settembre 2024.
Cosa dovrebbe fare vs. cosa fa realmente
La proposta: gli strumenti AI hanno “finestre di contesto” limitate (possono leggere solo una certa quantità alla volta), e trasformare HTML disordinato in testo pulito è difficile. Quindi perché non lasciare che il proprietario del sito consegni al modello una mappa ordinata e pre-scritta?
La realtà è più sobria. I principali fornitori di ricerca AI non l’hanno adottato. Google ha detto chiaramente che non lo usa. E quando Ahrefs ha studiato 137 000 siti, il 97% dei file llms.txt pubblicati ha ricevuto zero richieste in un mese — nel senso che nessuno li ha recuperati affatto.
L’unico posto dove viene realmente usato sono gli assistenti di codifica AI — strumenti come Claude Code che gli sviluppatori usano per scrivere software. Questi leggono llms.txt per orientarsi rapidamente nella documentazione tecnica. Questo è il caso d’uso originale, e funziona. È solo molto diverso da “this will get my business cited in ChatGPT.” (traduzione) «questo farà citare la mia attività in ChatGPT».
È come robots.txt?
Molte persone pensano che llms.txt sia “robots.txt per l’AI.” Non lo è.
- robots.txt controlla l’accesso — dice ai crawler cosa possono recuperare, e i bot ben educati lo rispettano.
- llms.txt offre indicazioni — suggerisce cosa vale la pena leggere, e nessuno è obbligato ad ascoltare. Non può bloccare nulla.
Se il tuo obiettivo è tenere fuori i bot AI, llms.txt non fa nulla — quello è un compito per robots.txt e il tuo CDN.
Dovresti preoccupartene?
Se gestisci documentazione per sviluppatori che gli agenti di codifica leggono, certo — è economico e li aiuta. Se sei un’azienda normale che spera che llms.txt aumenti la tua visibilità nelle risposte AI, la risposta onesta oggi è: non aspettarti risultati. Investi quel tempo in contenuti chiari e struttura invece.
Vuoi la specifica, la suddivisione fornitore per fornitore, i dati di adozione e l’angolo della sicurezza? Passa alla scheda Avanzate.
La specifica descrive un riepilogo volontario del sito adatto ai LLM; non stabilisce la conformità dei crawler o il comportamento di indicizzazione. Evidence for this claim llms.txt is a community proposal for a Markdown file at /llms.txt that offers LLM-friendly site information; it is not a web standard. Scope: The proposal's own specification and stated purpose. Confidence: high · Verified: llms.txt proposal OpenAI attualmente documenta bot nominati e impostazioni robots.txt indipendenti. Evidence for this claim OpenAI documents robots.txt controls for its declared crawlers and does not list llms.txt as a crawler control. Scope: OpenAI's published crawler controls; absence is not proof that no internal system ever fetches the file. Confidence: high · Verified: OpenAI: Crawlers
TL;DR — llms.txt è una proposta (Jeremy Howard, Answer.AI, 3 settembre 2024), non uno standard adottato. È un indice Markdown curato in
/llms.txt, con un facoltativo/llms-full.txtper il contenuto completo. I bot che la gente spera che lo leggano per la ricerca AI — OAI-SearchBot, PerplexityBot — registrano a malapena; il consumatore dominante è Claude Code e altri agenti di codifica. Google lo ignora (Illyes lo ha confermato; Mueller lo ha paragonato al meta tag delle parole chiave). Nello studio di Ahrefs su 137K siti, il 97% dei file ha ricevuto zero richieste, e SE Ranking ha scoperto che rimuovere llms.txt da un modello di citazione migliorava la sua accuratezza. Vale la pena aggiungerlo per la documentazione per sviluppatori consumata da agenti di codifica; per GEO/AEO su un sito normale, i dati non lo supportano. C’è anche un rischio reale di prompt injection.
Cosa è realmente llms.txt
llms.txt è una proposta — voglio iniziare con quella parola perché è tutta la storia. Non c’è RFC, nessuna benedizione W3C, nessun processo IETF. È un suggerimento ben ragionato di Jeremy Howard (co-fondatore di Answer.AI e fast.ai), pubblicato il 3 settembre 2024, che ha preso piede nel mondo della documentazione per sviluppatori ed è stato innestato nella SEO da una community affamata di una scorciatoia per la visibilità AI.
Il problema di design che affronta è legittimo. Come dice la specifica, “Large language models increasingly rely on website information, but face a critical limitation: context windows are too small to handle most websites in their entirety.” (traduzione) «I modelli linguistici di grandi dimensioni si affidano sempre più alle informazioni dei siti web, ma affrontano una limitazione critica: le finestre di contesto sono troppo piccole per gestire la maggior parte dei siti web nella loro interezza». E convertire HTML in testo pulito e adatto agli LLM è, secondo le parole della specifica, “difficult and imprecise.” (traduzione) «difficile e impreciso». La soluzione di Howard è lasciare che l’autore del sito appiattisca preventivamente il contenuto che vuole che i modelli vedano in Markdown curato.
Il formato
/llms.txt è un documento Markdown ordinato:
- H1 (obbligatorio) — nome del progetto o del sito.
- Blockquote — un breve riepilogo con le informazioni chiave.
- Prosa/elenchi facoltativi — paragrafi o elenchi puntati, ma nessuna intestazione qui.
- Elenchi di link delimitati da H2 —
- [name](url): optional notes. - Una sezione
## Optional— link secondari che un modello può saltare quando il contesto è limitato.
Un esempio minimale, dalla specifica:
# FastHTML
> FastHTML is a python library which brings together Starlette, Uvicorn, HTMX,
> and fastcore's FT...
## Docs
- [FastHTML quick start](url): A brief overview of many features
## Optional
- [Starlette documentation](url): A subset useful for FastHTML development.Esistono due convenzioni complementari:
/llms-full.txt— l’intero contenuto del sito appiattito in un unico file Markdown. Anthropic, Perplexity e Stripe pubblicano sia questo che la forma breve.- La convenzione URL
.md— offrire versionipage.mddelle singole pagine così che siano pronte per gli LLM senza il dump completo.
Una variante più recente salta completamente i file statici: Markdown servito al edge tramite content negotiation. Il Markdown for Agents di Cloudflare converte qualsiasi pagina HTML in Markdown pulito al volo quando un client invia Accept: text/markdown — nessun file .md per pagina, nessun /llms-full.txt da rigenerare, nessuna modifica ai template, perché il CDN fa la conversione al edge (Cloudflare cita ~80% di token in meno per l’agente). È una funzionalità a pagamento — piano Pro e superiori, non il livello gratuito — quindi su questo sito è a un aggiornamento Cloudflare dall’essere attivato piuttosto che qualcosa che ho costruito a mano. Se valga la pena attivarlo è la stessa domanda aperta che incombe su llms.txt stesso: servire ai crawler una copia Markdown parallela di ogni pagina è conveniente, ma è un’altra rappresentazione da tenere sincronizzata, e Fabrice Canel di Bing ha segnalato il doppio carico di crawling e il rischio simile al cloaking del contenuto alternativo servito al edge. Controlla i tuoi log per una reale domanda degli agenti prima di attivarlo.
llms.txt vs robots.txt — non sono la stessa cosa
L’equivoco più comune è che llms.txt sia “robots.txt per l’AI”. Non lo è, e confonderli porta a decisioni sbagliate.
| robots.txt | llms.txt | |
|---|---|---|
| Scopo | Controllo degli accessi — cosa possono scaricare i crawler | Guida ai contenuti — cosa è utile leggere |
| Formato | Direttive (User-agent:, Disallow:) | Collegamenti Markdown + descrizioni |
| Applicato? | Sì, dai crawler conformi | No — solo consultivo |
| Tempistica | Al momento della scansione, prima del recupero | Al momento dell’inferenza, assemblando il contesto |
| Uno standard? | Sì, decenni di storia, universale | No — una proposta |
| Può bloccare? | Sì | No |
robots.txt è uno standard reale e applicato. llms.txt è una scatola di suggerimenti che la maggior parte dei sistemi non sta ancora leggendo. Se vuoi controllare l’accesso dei crawler AI — che è un obiettivo separato e legittimo — questo vive in robots.txt e crawler AI, non qui.
Chi lo legge davvero
Questa è la sezione che conta, perché è dove i dati divergono più duramente dall’hype. Nello studio di Ahrefs su 137 210 domini (traffico di maggio 2026):
- Il 97% dei file llms.txt pubblicati non ha ricevuto alcuna richiesta. Solo circa il 3% (circa 1 100 domini) ha visto qualsiasi traffico.
- Dei file che sono stati richiesti: il 96% delle richieste proveniva da bot, il 4% da esseri umani.
- Delle richieste dei bot, il 77% proveniva da strumenti non AI — auditor SEO (Ahrefs stesso tra questi), crawler anonimi, bot di profilazione tecnologica. L’ironia SEO si scrive da sola.
- Solo circa il 19,5% proveniva da strumenti AI, e una volta scomposto, peggiora per la teoria GEO:
- Agenti AI e infrastruttura (agenti di codifica): circa il 10,5%
- Crawler di addestramento (GPTBot in testa con il 4,51%): circa il 5,3%
- Assistenti AI: circa il 2,5%
- Bot di recupero AI — quelli che costruiscono indici di citazione: 1,1%.
Leggi quell’ultima riga due volte. I bot per cui la maggior parte delle persone aggiunge llms.txt — OAI-SearchBot, PerplexityBot — “barely registered.” (traduzione) «si sono registrati a malapena». Il consumatore AI dominante è Claude Code, l’agente di codifica di Anthropic, che secondo lo studio “outfetched every AI retrieval bot, assistant, and training crawler except GPTBot.” (traduzione) «ha effettuato più richieste di ogni bot di recupero AI, assistente e crawler di addestramento tranne GPTBot». E GPTBot è un crawler di addestramento che scansiona tutto indipendentemente — la sua presenza non è prova di un’analisi intenzionale di llms.txt.
Altre misurazioni indipendenti arrivano allo stesso punto. OtterlyAI ha osservato un sito per 90 giorni: di oltre 62 100 visite di bot AI, esattamente 84 hanno raggiunto /llms.txt — circa lo 0,1%, con risultati “3x worse than average pages.” (traduzione) «tre volte peggiori delle pagine medie». Un’analisi separata di oltre 515 milioni di eventi di bot LLM in 90 giorni ha trovato 408 richieste totali mirate a /llms.txt — “statistically negligible.” (traduzione) «statisticamente trascurabili».
Il messaggio è la divisione tra documentazione per sviluppatori e GEO: llms.txt funziona per ciò per cui Howard l’ha costruito (agenti di codifica che navigano nella documentazione API), e in gran parte non viene toccato dai bot di citazione di ricerca che la comunità SEO vuole raggiungere.
Cosa hanno detto i fornitori
Google — no, e nessun piano. Gary Illyes ha confermato al Search Central Live (luglio 2025) che Google non supporta llms.txt e non ha intenzione di farlo. John Mueller, la voce più citata qui, lo ha paragonato al meta tag delle parole chiave (aprile 2025) e lo ha definito una “temporary crutch, perhaps to save some tokens” (traduzione) «stampella temporanea, forse per risparmiare qualche token» per gli strumenti di codifica AI — esplicitamente non un meccanismo di visibilità di ricerca. La guida di Google di maggio 2026 ha dichiarato che file leggibili da macchina come llms.txt non sono necessari per AI Overviews o AI Mode, che “continue to rely on traditional SEO signals.” (traduzione) «continuano a basarsi sui segnali SEO tradizionali». (Google ha brevemente pubblicato un llms.txt sui suoi documenti di sviluppo il 3 dicembre 2025, poi lo ha rimosso lo stesso giorno — successivamente attribuito a un aggiornamento del CMS, non a un cambiamento di strategia.)
OpenAI — niente. Nessun annuncio che ChatGPT, GPTBot o OAI-SearchBot lo analizzino. I log del server contraddicono un uso significativo; OAI-SearchBot “barely registered.” (traduzione) «si è registrato a malapena». OpenAI indirizza le persone a robots.txt per il controllo dei crawler.
Anthropic — il caso interessante. Anthropic pubblica sia llms.txt che
llms-full.txt su docs.anthropic.com/llms.txt, e Claude Code dimostrabilmente
recupera i file llms.txt di altri siti — è il più grande consumatore di IA nei dati. Ma
questa è una storia di strumenti di codifica. Non c’è conferma che la ricerca o il
livello di citazione di Claude.ai onori llms.txt. L’agente di codifica di Anthropic che legge il file e l’indice di ricerca di Anthropic che si fida del file sono affermazioni diverse, e solo la prima è supportata.
Perplexity — afferma di sì, i dati dicono raramente. Perplexity ha dichiarato di recuperare llms.txt e di usarlo per “prioritize page selection.” (traduzione) «dare priorità alla selezione delle pagine». Ma il recupero proattivo è il punto critico: PerplexityBot “barely registered” (traduzione) «si è registrato a malapena» nei dati delle richieste, e c’è “almost zero activity from PerplexityBot requesting llms.txt files proactively.” (traduzione) «quasi zero attività da PerplexityBot che richiede file llms.txt in modo proattivo». Incolla un URL llms.txt in Perplexity e lo legge bene; l’uso autonomo e proattivo è il divario tra politica e pratica.
Bing/Microsoft, Apple, Meta — nessuna posizione pubblica. Trattare come non confermato.
Muove le citazioni IA?
Nessun beneficio dimostrato. SE Ranking ha modellato 300 000 domini con una regressione XGBoost
- analisi SHAP e ha scoperto che rimuovere llms.txt dal modello migliorava la sua accuratezza — la loro conclusione: “LLMs.txt doesn’t seem to directly impact AI citation frequency. At least not yet.” (traduzione) «LLMs.txt non sembra avere un impatto diretto sulla frequenza delle citazioni AI. Almeno non ancora». Uno studio di Search Engine Land su 10 siti e 180 giorni ha visto 8 siti su 10 non mostrare cambiamenti misurabili, e i due “vincitori” avevano cambiamenti confondenti (copertura PR, nuove pagine FAQ, correzioni tecniche) che non puoi separare dall’llms.txt stesso.
Il confronto con meta-keywords — giusto o no?
L’analogia di Mueller con il meta tag keywords regge sui punti che contano: entrambi sono autodescrizioni del proprietario del sito, nessuno dei due è verificato, ed entrambi sono aperti a manipolazione/cloaking — potresti mostrare una cosa in llms.txt e un’altra sulla pagina. Quella manipolabilità è esattamente il motivo per cui un serio prodotto di ricerca IA non si fiderà di un’autodescrizione rispetto alle pagine reali. Il contro-argomento (Carolyn Shelby) è che llms.txt almeno punta a URL reali che devono rispondere — è “a spotlight, not a wish list.” (traduzione) «un riflettore, non una lista dei desideri». Entrambi hanno ragione, e il risultato pratico è lo stesso: i sistemi di ricerca IA non ci fanno affidamento.
Quando vale la pena aggiungerlo — e quando saltarlo
Aggiungilo se gestisci documentazione per sviluppatori o un riferimento API il cui pubblico principale sono gli agenti di codifica IA (Claude Code, Cursor, Copilot, Codeium). Questo è il caso d’uso per cui è stato creato, e funziona.
Saltalo — o almeno non aspettarti ritorni di visibilità IA — per siti di contenuti, media, ecommerce e siti aziendali ordinari. Il costo è di circa 20 minuti; il beneficio GEO oggi è quasi zero; e quei 20 minuti sono meglio spesi sulla struttura dei contenuti, sulla copertura delle FAQ e sui fondamenti dell’ottimizzazione per la ricerca IA che muovono davvero la visibilità IA. I titoli di alta adozione (la cifra di 844K+ di BuiltWith) sono gonfiati dalla distribuzione automatica della piattaforma — Mintlify ha distribuito llms.txt a tutti i suoi siti di documentazione ospitati in una volta. L’adozione non è utilizzo; il 97% dei file riceve zero richieste.
L’angolo della sicurezza
Questo è poco segnalato e reale: poiché gli agenti IA sono progettati per fidarsi di ciò che c’è in llms.txt, il file è una superficie di attacco naturale. Lo studio Ahrefs ha segnalato attori malintenzionati che sondano i file llms.txt per vulnerabilità di prompt-injection. Se pubblichi uno, trattalo come sensibile alla sicurezza: tienilo sotto controllo di versione, avvisa su modifiche non autorizzate e non metterci mai nulla che non mostreresti pubblicamente.
Implementarlo (se decidi di farlo)
- Posizionamento:
/llms.txtalla radice del dominio, servito cometext/plainotext/markdown, HTTP 200. - Cura, non scaricare: 20–50 dei tuoi link più importanti. Se elenchi tutto, un modello potrebbe anche fare crawling direttamente — la cura è l’intero punto.
- Opzionalmente servi
/llms-full.txtper contesti che vogliono tutti i tuoi contenuti. - Valida: carica il file in Claude, ChatGPT o Perplexity e chiedi di riassumere il tuo sito; poi controlla i log del server dopo alcune settimane per richieste reali.
- Esistono generatori per VitePress (
vitepress-plugin-llms), Docusaurus (docusaurus-plugin-llms), WordPress (“Website LLMs.txt”), Drupal, più un CLI Python (llms_txt2ctx).
In conclusione: costo basso, attualmente beneficio GEO quasi nullo, genuinamente utile per il caso d’uso degli agenti di codifica per cui è nato. Controlla i tuoi log del server prima di decidere — se vedi traffico Claude-Code/Cursor, llms.txt potrebbe aiutarli; se stai inseguendo OAI-SearchBot e PerplexityBot, non è la leva giusta.
Riepilogo AI
Una sintesi della versione Advanced:
- llms.txt è una proposta, non uno standard — Jeremy Howard (Answer.AI/fast.ai),
3 settembre 2024. Un indice Markdown curato in
/llms.txt; opzionale contenuto completo/llms-full.txt. - Non è robots.txt per l’AI. robots.txt controlla l’accesso ed è applicato; llms.txt è consultivo e non può bloccare nulla.
- Quasi nessuno lo legge. Ahrefs (137K siti): il 97% dei file ha ricevuto zero richieste. Dei file richiesti, il 77% dei colpi bot erano strumenti non-AI (auditor SEO), e i bot AI di recupero — i costruttori di citazioni — erano solo l’1,1%.
- Claude Code è il consumatore AI dominante, non i bot di ricerca. OAI-SearchBot e PerplexityBot “registravano a malapena.”
- Google lo ignora. Illyes ha confermato nessun supporto/piani; Mueller lo ha paragonato al meta tag keywords. OpenAI: nulla. Perplexity: afferma supporto, ma il recupero proattivo è minimo. Anthropic pubblica il proprio + Claude Code lo legge, ma l’uso a livello di ricerca non è confermato.
- Nessun beneficio di citazione mostrato. SE Ranking (300K domini): rimuovere llms.txt dal modello migliorava l’accuratezza.
- Vale la pena per la documentazione per sviluppatori consumata da agenti di codifica; saltalo come strategia GEO per siti normali. Rischio di injection di prompt — trattalo come sensibile alla sicurezza.
Documentazione ufficiale
Materiale di fonte primaria — la specifica, la proposta e i file e le dichiarazioni dei provider.
La specifica e la proposta
- llmstxt.org — la specifica: formato file,
/llms.txtvs/llms-full.txt, e la logica a tempo di inferenza. - La proposta originale (Jeremy Howard, 3 settembre 2024) — il post di annuncio di Answer.AI.
- AnswerDotAI/llms-txt su GitHub — il
repository, gli strumenti e il CLI
llms_txt2ctx.
File dei provider
- llms.txt di Anthropic — un esempio dal vivo
(Anthropic pubblica anche
llms-full.txt). - llms.txt di Perplexity — un altro esempio dal vivo.
Posizione ufficiale di Google
- Google ha dichiarato che file leggibili da macchina come llms.txt non sono necessari per AI Overviews o AI Mode, che si basano su segnali SEO tradizionali (linee guida maggio 2026); Gary Illyes ha confermato nessun supporto e nessun piano a Search Central Live (luglio 2025). Vedi la copertura di Search Engine Journal della dichiarazione di John Mueller per l’articolazione più citata.
Citazioni dalla fonte
Dichiarazioni pubbliche su llms.txt — da Google, dal creatore della specifica e dai ricercatori che lo hanno misurato.
John Mueller, Google Search Advocate (17 aprile 2025)
- “AFAIK none of the AI services have said they’re using LLMs.TXT (and you can tell when you look at your server logs that they don’t even check for it). To me, it’s comparable to the keywords meta tag – this is what a site-owner claims their site is about … (Is the site really like that? well, you can check it. At that point, why not just check the site directly?)” (traduzione) «AFAIK nessuno dei servizi AI ha detto che stanno usando LLMs.TXT (e puoi capirlo guardando i log del tuo server: non lo controllano nemmeno). Per me, è paragonabile al meta tag keywords – è ciò che il proprietario di un sito afferma che il suo sito riguarda … (Il sito è davvero così? beh, puoi verificarlo. A quel punto, perché non controllare direttamente il sito?)» Coverage
Gary Illyes, Google Search Central (Search Central Live, luglio 2025)
- Confermato che Google non supporta llms.txt e non ha piani per farlo. (Riportato dall’evento; nessun URL di trascrizione primaria identificato — confermare prima di considerarlo definitivo.)
Jeremy Howard, creatore (Answer.AI)
- “A proposal to standardise on using an
/llms.txtfile to provide information to help LLMs use a website at inference time.” (traduzione) «Una proposta per standardizzare l’uso di un file/llms.txtper fornire informazioni per aiutare gli LLM a usare un sito web al momento dell’inferenza.» llmstxt.org - Dalla specifica, sul problema centrale: “Large language models increasingly rely on website information, but face a critical limitation: context windows are too small to handle most websites in their entirety.” (traduzione) «I modelli linguistici di grandi dimensioni si affidano sempre più alle informazioni dei siti web, ma affrontano una limitazione critica: le finestre di contesto sono troppo piccole per gestire la maggior parte dei siti web nella loro interezza.» llmstxt.org
Brett Tabke, Pubcon / WebmasterWorld (marzo 2025)
- “we just don’t need people thinking they are different from any other spider.” (traduzione) «semplicemente non abbiamo bisogno che la gente pensi che siano diversi da qualsiasi altro spider.» Search Engine Land
Carolyn Shelby, Search Engine Land (9 luglio 2025 — la visione dissenziente)
- “Llms.txt curates a list of real URLs, and the content has to exist – and deliver – when the model gets there.” (traduzione) «Llms.txt cura una lista di URL reali, e il contenuto deve esistere – e rispondere – quando il modello arriva lì». E “Think of llms.txt like a treasure map for AI systems – one you draw yourself. It’s not a wish list. It’s a spotlight.” (traduzione) «Pensa a llms.txt come a una mappa del tesoro per i sistemi AI – una che disegni tu stesso. Non è una lista dei desideri. È un riflettore». Search Engine Land
Dovresti implementare llms.txt? — una checklist decisionale
Procedi dall’alto verso il basso. Il primo “sì” che si adatta di solito risolve.
- Il tuo pubblico principale sono agenti di codifica AI (Claude Code, Cursor, Copilot, Codeium) che leggono documentazione per sviluppatori / un riferimento API? → Sì, aggiungilo. Questo è il caso d’uso per cui è stato creato e funziona.
- Lo stai aggiungendo solo per migliorare le citazioni di ricerca AI per un sito di contenuti, media, ecommerce o business generale? → Non aspettarti risultati. I dati mostrano nessun beneficio di citazione; investi il tempo sulla struttura dei contenuti invece.
- Hai prima controllato i log del tuo server? Cerca traffico
Claude-Code/Cursor(llms.txt può aiutarli) vsOAI-SearchBot/PerplexityBot(non sposterà quell’ago). - Lo stai trattando come robots.txt per l’AI? → Fermati. Non blocca nulla. Usa robots.txt + il tuo CDN per il controllo degli accessi.
Se ne pubblichi uno:
- Posizionalo in
/llms.txt(root), servitext/plain/text/markdown, HTTP 200. - Cura 20–50 dei tuoi URL più importanti — non scaricare la sitemap.
- Tienilo sotto controllo di versione e avvisa su modifiche non autorizzate (rischio di prompt injection — gli agenti sono costruiti per fidarsene).
- Non metterci nulla che non mostreresti pubblicamente.
- Opzionalmente servi
/llms-full.txtper contesti di contenuto completo. - Valida: carica l’URL in Claude/ChatGPT/Perplexity, chiedi un riepilogo del sito; ricontrolla i log del server dopo alcune settimane per richieste reali.
Supporto dei provider — cheat sheet
Chi supporta davvero llms.txt (a metà 2026)
| Provider | Supporto ricerca/citazioni? | Realtà |
|---|---|---|
| Google (Gemini / AI Overviews) | No | Illyes ha confermato nessun supporto/piani; Mueller lo ha paragonato al meta tag keywords; AI Overviews si affidano a segnali tradizionali |
| OpenAI (ChatGPT / OAI-SearchBot) | Nessun supporto significativo | Nessun annuncio; OAI-SearchBot “barely registered” nei dati delle richieste |
| Anthropic (Claude Code) | Sì — per l’agente di codifica | Claude Code è il principale consumatore AI di llms.txt; l’uso nel layer di ricerca di Claude.ai non confermato |
| Perplexity | Afferma sì, debole nella pratica | Dichiara di dare priorità alla selezione delle pagine, ma il fetching proattivo di PerplexityBot è quasi nullo |
| Apple (Applebot) | Nessuna dichiarazione | Nessuna posizione pubblica, nessuna evidenza di crawling |
| Bing / Microsoft | Nessuna dichiarazione | Nessuna posizione pubblica trovata |
Fatti rapidi
- Proposto: Jeremy Howard (Answer.AI/fast.ai), 3 settembre 2024. Una proposta, non uno standard adottato.
- File:
/llms.txt(breve, curato) e opzionale/llms-full.txt(contenuto completo appiattito in Markdown). - Formato: nome H1 → riepilogo in blockquote → elenchi di link H2 (
- [name](url): note) → sezione## Optional. - vs robots.txt: robots.txt = controllo accessi, applicato. llms.txt = guida, consultiva, non blocca nulla.
- Il numero: il 97% dei file pubblicati riceve zero richieste (Ahrefs, 137K siti).
- Lettore AI dominante: Claude Code, non i bot di ricerca.
- Beneficio di citazione: nessuno dimostrato (SE Ranking: rimuoverlo migliorava l’accuratezza del modello).
- Sicurezza: rischio di prompt injection — versionalo, avvisa sulle modifiche.
Errori da evitare con llms.txt
Trattare il file come uno standard di controllo accessi
llms.txt non consente né blocca il crawling. Usa robots.txt, autenticazione e
altri controlli di accesso reali per quel compito.
Promettere un aumento della visibilità AI
Il supporto dei provider e il fetching osservato sono limitati. Descrivi il file come un ausilio opzionale alla navigazione, non come una leva per ranking o citazioni.
Pubblicare URL sensibili o privati
Il file è pubblico e facile da scoprire. Includi solo risorse destinate al consumo pubblico; non usare mai l’oscurità come protezione.
Generare una sitemap non curata in Markdown
La proposta è più utile come breve guida leggibile alle risorse importanti. Un dump enorme aggiunge costi di manutenzione senza chiarire quali pagine contano.
Problemi comuni con llms.txt
Il file restituisce HTML invece di Markdown
Sintomo: /llms.txt mostra una shell applicativa, un 404 brandizzato o la destinazione di un redirect.
Causa probabile: Una rotta catch-all o una regola CDN intercetta il percorso di testo. Correzione: Servi
il file direttamente alla root con una risposta di successo e contenuto in testo semplice o Markdown,
poi richiedilo senza cookie.
I link nel file falliscono o reindirizzano ripetutamente
Sintomo: Un lettore non riesce a recuperare le risorse elencate ai loro URL canonici. Causa probabile: Il file è stato generato da navigazione obsoleta o percorsi relativi. Correzione: valida ogni URL, sostituisci le posizioni ritirate e preferisci URL canonici HTTPS stabili.
Nessun bot richiede il file
Sintomo: I log non mostrano traffico verso /llms.txt. Causa probabile: I sistemi che ti interessano
non supportano o non scoprono la proposta. Correzione: Conferma la copertura dei log e lascia
il file come esperimento a basso costo; non aggiungere trucchi specifici per crawler né dedurre un problema
del sito da zero richieste.
Prompt per curare llms.txt
Build a proposed llms.txt outline from this public URL inventory. Keep only canonical,
durable resources that help an agent understand the site or complete a task. Group them
under short Markdown headings, write one factual description per link, and flag URLs
that redirect, duplicate another page, require authentication, or may expose sensitive
information. Do not claim the file affects rankings or citations.
[paste inventory]Review this llms.txt file against the supplied crawl results. Report broken or
redirecting URLs, non-canonical links, descriptions unsupported by the destination,
missing high-value documentation, and sections that are too broad to be useful. Return
a corrected draft using only public URLs from the inputs.
[paste file and crawl results] Framework per decidere se usare llms.txt
Il test costo–consumatore–contenuto
- Costo: Il team può generare e mantenere il file con poco lavoro continuo?
- Consumatore: Esiste un agente o flusso di lavoro identificato che lo legge davvero?
- Contenuto: Il sito ha documentazione pubblica stabile degna di essere curata?
Implementa quando tutti e tre sono credibili. Se il consumatore è ipotetico, tratta il file come un esperimento e limita il budget di manutenzione.
Mantieni i ruoli separati
robots.txt: indicazioni sull’accesso per i crawler.- Sitemap XML: scoperta degli URL per i motori di ricerca.
llms.txt: guida di lettura curata proposta per i sistemi di intelligenza artificiale.- MCP: protocollo runtime attraverso il quale un agente può scoprire e invocare risorse o strumenti.
Un file non dovrebbe essere valutato come se svolgesse il compito di un altro sistema.
Strumenti per llms.txt
- Generatore + Validatore llms.txt: Redigi un file curato e controlla la sua struttura e le risorse collegate prima di pubblicarlo.
- Controllo accesso AI-Crawler: Verifica separatamente i controlli di accesso effettivi dei crawler;
llms.txtnon sostituisce questo controllo. curl: Verifica stato, reindirizzamenti, tipo di contenuto e corpo del percorso root esatto.- Log del server o CDN: Determina se gli user agent nominati richiedono il file; l’assenza è un’osservazione, non una prova di un problema di ranking.
- Un controllo dei link: Rivalida ogni destinazione curata secondo una pianificazione affinché la guida non si deteriori.
Valida una release di llms.txt
Testa la risposta root
Test da eseguire: Richiedi /llms.txt direttamente senza cookie e senza seguire reindirizzamenti.
Risultato atteso: Una risposta riuscita contiene il Markdown previsto nel percorso root.
Interpretazione del fallimento: Il routing o la distribuzione non espongono il file.
Finestra di monitoraggio: Immediata. Trigger di rollback: Il percorso serve una shell HTML, un documento di errore o un reindirizzamento non correlato.
Testa ogni risorsa elencata
Test da eseguire: Esegui la scansione degli URL nel file e confronta ogni destinazione con la sua descrizione. Risultato atteso: Le risorse canoniche pubbliche si risolvono correttamente e corrispondono allo scopo dichiarato. Interpretazione del fallimento: La guida è obsoleta o fuorviante. Finestra di monitoraggio: Immediata, poi secondo la cadenza di aggiornamento della documentazione. Trigger di rollback: Un URL elencato espone materiale privato o fallisce costantemente.
Testa onestamente l’esito dichiarato dell’esperimento
Test da eseguire: Interroga i log del server per /llms.txt per user agent dopo la pubblicazione.
Risultato atteso: Le richieste, se presenti, sono registrate e attribuibili; zero è anche un risultato valido. Interpretazione del fallimento: La registrazione potrebbe essere incompleta o i consumatori potrebbero non supportare la proposta. Finestra di monitoraggio: Diversi cicli normali di scansione.
Trigger di rollback: Nessuno per il solo traffico zero; rimuovi solo quando il rischio di manutenzione o esposizione supera il valore del file.
Mettiti alla prova: llms.txt
Risorse che meritano il tuo tempo
La fonte originale
- llmstxt.org — la specifica.
- Il post della proposta di Jeremy Howard (3 settembre 2024) — la logica, direttamente dal creatore.
- AnswerDotAI/llms-txt — il repository e gli strumenti.
I dati (leggili prima di implementare qualsiasi cosa)
- Cos’è llms.txt e dovresti preoccupartene? — Ahrefs — la panoramica di Ryan Law; la struttura 28%-pubblica / 97%-zero richieste.
- Lo studio sull’adozione di llms.txt — Ahrefs — Louise Linehan e Xibeijia Guan, 137 210 domini: chi richiede effettivamente i file (Claude Code domina l’IA; i bot di recupero registrano a malapena) e il risultato sull’iniezione di prompt.
- llms.txt conta? Abbiamo monitorato 10 siti — Search Engine Land — studio di 180 giorni; 8/10 siti non hanno mostrato cambiamenti misurabili.
- L’esperimento llms.txt — OtterlyAI —
90 giorni, un sito: 84 visite su 62 100+ di bot IA hanno raggiunto
/llms.txt.
Il dibattito
- No, llms.txt non è la “nuova meta keywords” — Carolyn Shelby, Search Engine Land — la difesa più forte di llms.txt.
- Incontra llms.txt, uno standard proposto — Search Engine Land — il riepilogo pro/contro e la critica di Brett Tabke.
I miei scritti correlati su questo sito
- AI crawlers — controllare i bot (che è ciò per cui llms.txt non serve), e dove la storia del controllo degli accessi vive realmente.
Dal settore
- SE Ranking: lo stato di llms.txt — studio XGBoost/SHAP su 300 000 domini che ha rilevato che rimuovere llms.txt dal modello di citazione migliorava l’accuratezza; include anche una ripartizione del tasso di adozione per fascia di traffico.
- Wix AI Search Lab — llms.txt myths (Crystal Carter, giugno 2026) — lettura più ottimistica; oltre 1 400 file esaminati, sostiene che i file llms.txt stessi emergono nei risultati AI anche se l’adozione è disomogenea.
- Google Says LLMs.Txt Comparable To Keywords Meta Tag — Search Engine Journal — citazione completa di John Mueller e contesto dell’aprile 2025.
- presenc.ai: State of llms.txt 2026 — matrice di supporto provider per provider; trattare con cautela le affermazioni “confermate” di Anthropic/Perplexity (le fonti primarie non sono sempre citate).
- The llms.txt is dead. More precisely: a dud. — Kai Spriestersbach (Medium) — aggrega i dati di OtterlyAI su 90 giorni, la conferma di Gary Illyes e l’incidente di 24 ore di Google in un riepilogo scettico.
Statistiche da citare
- Il 97% dei file llms.txt pubblicati ha ricevuto zero richieste in un mese (studio Ahrefs, 137 210 domini, maggio 2026). Solo circa il 3% ha visto qualsiasi traffico. Fonte
- Claude Code è il consumatore AI dominante di llms.txt — “outfetched every AI retrieval bot, assistant, and training crawler except GPTBot” (traduzione) «ha effettuato più richieste di ogni bot di recupero AI, assistente e crawler di addestramento tranne GPTBot» (il bot di addestramento). I bot di recupero che costruiscono indici di citazione rappresentavano solo 1,1 % delle richieste. Fonte
- Il 77% delle richieste bot ai file llms.txt proveniva da strumenti non-AI — auditor SEO, crawler anonimi, bot di profilazione tecnologica — non AI affatto. Fonte
- 84 delle 62 100+ visite di bot AI hanno raggiunto
/llms.txtin 90 giorni su un sito monitorato (~0,1 %), con risultati “3x worse than average pages.” (traduzione) «tre volte peggiori delle pagine medie». Fonte - Rimuovere llms.txt da un modello di citazione migliorava la sua accuratezza — SE Ranking, 300 000 domini, analisi XGBoost + SHAP. Nessun beneficio di citazione dimostrato “at least not yet.” (traduzione) «almeno non ancora». Fonte
- Adozione ≠ utilizzo. BuiltWith ha contato oltre 844 000 siti con llms.txt (ottobre 2025), ma gran parte di ciò è auto-distribuzione della piattaforma (Mintlify lo ha implementato su tutti i siti di documentazione ospitati in una volta), non decisioni individuali informate.
- Solo 408 richieste hanno avuto come target
/llms.txtsu oltre 515 milioni di eventi di traffico di bot AI analizzati in 90 giorni (analisi limy.ai) — descritto come “statistically negligible.” (traduzione) «statisticamente trascurabile». - Il 10,13 % dei siti ha adottato llms.txt su un campione di 300 000 domini (studio SE Ranking, 2026) — circa 1 su 10, senza differenze significative per fascia di traffico (basso traffico 9,88 %, alto traffico 8,27 %). Fonte
Cronologia modifiche
Aggiornato il 13 ago 2026.
Riepilogo editoriale e dettagli registrati delle modifiche.Dettagli delle modifiche
-
Le note dettagliate sulle modifiche sono attualmente disponibili in inglese.
Confronto completo non disponibile — non è stata archiviata alcuna istantanea precedente per questa revisione.
Aggiornato il 3 ago 2026.
Riepilogo editoriale e dettagli registrati delle modifiche.Dettagli delle modifiche
-
Le note dettagliate sulle modifiche sono attualmente disponibili in inglese.
Confronto completo non disponibile — non è stata archiviata alcuna istantanea precedente per questa revisione.