Data di taglio delle conoscenze
Cos'è una data di taglio delle conoscenze (limite dei dati di addestramento), perché non è la data di rilascio del modello, quali strumenti di intelligenza artificiale la aggirano con il recupero delle informazioni e cosa significa per la SEO.
Lingue
Una data di taglio delle conoscenze è la data dopo la quale un LLM ha smesso di essere addestrato su nuovi dati, non la data in cui è stato rilasciato (queste differiscono di mesi, spesso 6-12+). Limita solo la conoscenza parametrica incorporata nel modello. Gli strumenti che utilizzano il recupero delle informazioni (Google AI Overviews, Bing Copilot, Perplexity, ChatGPT con ricerca) basano le risposte su un indice aggiornato e aggirano efficacemente il limite, mentre i modelli base senza ricerca rimangono congelati alla loro data di taglio. Per la SEO ciò significa due lavori separati: essere inclusi nei dati di addestramento per il lungo termine e rimanere indicizzati e aggiornati per essere recuperati al momento della query.
TL;DR — Un knowledge cutoff è la data in cui un modello di IA ha smesso di apprendere. Se chiedi al modello base di ChatGPT qualcosa accaduto dopo il suo cutoff, semplicemente non lo saprà — non è mai stato addestrato su quei dati. Ma molti strumenti di IA (Google AI Overviews, Perplexity, Copilot, ChatGPT con ricerca attiva) possono cercare informazioni in tempo reale, aggirando così il cutoff per la maggior parte delle domande.
Cos’è un knowledge cutoff
Un knowledge cutoff di un modello descrive il confine della conoscenza di addestramento dichiarato per una versione del modello; non è necessariamente il confine di un prodotto che può navigare o recuperare informazioni. Evidence for this claim Model documentation can specify a knowledge-cutoff date for a particular model or snapshot. Scope: OpenAI model metadata; the date is model- and version-specific and may change with releases. Confidence: high · Verified: OpenAI: Models Gli strumenti di prodotto possono accedere a informazioni più recenti al momento della risposta, in base alla disponibilità e alla qualità delle fonti. Evidence for this claim A product can supplement model knowledge with current web search and cited web sources. Scope: ChatGPT search product behavior; browsing or retrieval is separate from the model's training cutoff and is not guaranteed for every answer. Confidence: high · Verified: OpenAI: ChatGPT search
I grandi modelli linguistici — la tecnologia dietro ChatGPT, Claude, Gemini — imparano leggendo un’enorme quantità di testo. A un certo punto quella lettura si ferma così che il modello possa essere costruito e testato. La data in cui la lettura si è fermata è il knowledge cutoff (lo troverai anche chiamato training cutoff o training data cutoff — stessa cosa).
Dopo quella data, il modello non sa nulla. Non perché nasconda qualcosa — semplicemente non l’ha mai visto. Una delle migliori spiegazioni che ho trovato lo paragona a uno stagista: il knowledge cutoff è la data in cui il tuo stagista IA è andato a scuola per l’ultima volta. Tutto fino a quel giorno lo ha imparato bene; qualsiasi cosa dopo, non ne sa nulla.
Perché ChatGPT a volte dà risposte obsolete
Supponiamo che un’azienda abbia cambiato marchio il mese scorso, o che il tuo prodotto abbia modificato i prezzi. Se chiedi a un modello di IA che si basa solo sul suo addestramento, ti darà con sicurezza la risposta vecchia — e sembrerà completamente sicuro di sé. È il cutoff all’opera.
La soluzione che le aziende di IA usano è lasciare che il modello cerchi sul web. Invece di rispondere dalla memoria, lo strumento esegue una ricerca in tempo reale, legge i risultati e scrive una risposta basata su quelli. Quando la ricerca è attiva, il cutoff smette di contare per quella domanda.
Quali strumenti cercano informazioni e quali no
- Cercano informazioni (il cutoff per lo più non conta): Google AI Overviews, Perplexity, Microsoft Copilot e ChatGPT quando la ricerca web è attiva. Questi attingono da un indice di ricerca in tempo reale.
- Rispondono dalla memoria (il cutoff conta molto): il modello gratuito/base di ChatGPT con navigazione disattivata, o qualsiasi modello usato senza accesso al web. Questi conoscono solo fino al loro cutoff.
Perché questo è importante se gestisci un sito web
Ci sono davvero due modi in cui la tua attività appare nelle risposte IA:
- Nella memoria del modello. I tuoi contenuti devono essere pubblicati prima del training cutoff di un modello per essere incorporati — e la prossima sessione di addestramento potrebbe essere tra un anno o più.
- Tramite ricerca in tempo reale. Se lo strumento IA cerca informazioni, puoi apparire lo stesso giorno in cui pubblichi — a condizione che tu sia indicizzato in Google e Bing.
Quindi vuoi entrambe le cose: essere il tipo di marchio abbastanza noto da essere nei dati di addestramento, e rimanere facile da trovare e abbastanza aggiornato per essere recuperato in tempo reale. La scheda Avanzate approfondisce le date, i bordi sfumati e il vero playbook SEO.
TL;DR — Un knowledge cutoff è la data in cui la raccolta dei dati di addestramento si è fermata — non la data di rilascio (il divario è di solito 6–12+ mesi). Limita solo la conoscenza parametrica (addestrata) di un modello. I sistemi con retrieval-augmented — Google AI Overviews, Bing Copilot, Perplexity, ChatGPT con ricerca — basano le risposte su un indice in tempo reale e lo aggirano efficacemente; i modelli base senza ricerca restano congelati. Il confine è sfumato, non un muro: i cutoff effettivi spesso differiscono da quelli dichiarati e l’accuratezza degrada man mano che ci si avvicina alla data. Per la SEO questo si divide in due lavori separati — essere incorporati nei dati di addestramento (gioco a lungo termine) e rimanere indicizzati + aggiornati per essere recuperati al momento della query (a breve termine).
Cos’è realmente un knowledge cutoff
I cutoff sono specifici per modello e versione e possono cambiare quando i fornitori aggiornano i modelli. Evidence for this claim Model documentation can specify a knowledge-cutoff date for a particular model or snapshot. Scope: OpenAI model metadata; the date is model- and version-specific and may change with releases. Confidence: high · Verified: OpenAI: Models Non dedurre mai l’attualità del prodotto solo da una data di cutoff ricordata. Evidence for this claim A product can supplement model knowledge with current web search and cited web sources. Scope: ChatGPT search product behavior; browsing or retrieval is separate from the model's training cutoff and is not guaranteed for every answer. Confidence: high · Verified: OpenAI: ChatGPT search
Un knowledge cutoff è la data dopo la quale un modello non è più stato addestrato su nuovi dati. Il modello non ha alcuna consapevolezza di ciò che è accaduto dopo — non perché lo nasconda, ma perché non vi è mai stato esposto. La sua conoscenza rimane congelata nei suoi pesi a quel punto, a meno che il sistema non aggiunga un recupero in tempo reale.
Il termine preciso è training data cutoff — la data in cui la raccolta dei dati si è fermata. “Knowledge cutoff” è l’abbreviazione comune, e i due termini sono usati in modo intercambiabile. Il modello mentale che preferisco: è un libro di testo che è andato in stampa. Una volta che il libro è pubblicato, la stampante non può aggiungere un nuovo capitolo — dovresti stampare un’edizione completamente nuova. Un modello è lo stesso. Nuovi fatti entrano solo con la successiva sessione di addestramento.
Questo è puramente un limite alla conoscenza parametrica — la roba incorporata nei pesi. Non significa affatto che il modello non possa gestire eventi successivi al cutoff. Fornisci le informazioni nel contesto — tramite una pipeline RAG o un prompt di sistema — e un LLM può ragionare perfettamente su eventi su cui non è mai stato addestrato. Il cutoff limita ciò che il modello sa da solo, non ciò con cui può lavorare quando gli fornisci fonti.
A current question can follow two paths. On the weights-only path, the model relies on knowledge frozen at the training cutoff. On the grounded path, the system retrieves current sources and places them in the model's context. Retrieval supplies evidence at query time; it does not update or retrain the model weights.
© Patrick Stox LLC · CC BY 4.0 ·
La distinzione a due livelli di Anthropic: cutoff affidabile vs. cutoff di addestramento
Anthropic è il più esplicito dei principali laboratori su questo punto, e la distinzione vale la pena di essere adottata. Separano due date: un reliable knowledge cutoff (“indica la data fino alla quale la conoscenza di un modello è più estesa e affidabile”) e un più ampio training data cutoff (“l’intervallo di date più ampio dei dati di addestramento utilizzati”). La data affidabile è tipicamente alcuni mesi prima della data di addestramento.
Perché il divario? Il contenuto più recente nel corpus è scarso — internet non ha ancora finito di scrivere sugli eventi molto recenti. Quindi la conoscenza pratica di un modello delle settimane immediatamente precedenti al suo cutoff di addestramento è sottile, anche se quei dati sono tecnicamente “lì dentro”. Il cutoff affidabile è il punto in cui il modello è realmente informativo. Tienilo a mente ogni volta che vedi una singola data di cutoff sicura: il confine utile è di solito precedente a quello dichiarato.
Il knowledge cutoff non è la data di rilascio del modello
Questo è l’equivoco più comune, ed è facile da capire. Il cutoff è quando è terminata la raccolta dei dati. La data di rilascio è quando il modello viene pubblicato. Tra i due ci sono pulizia dei dati, test di sicurezza, valutazione e lavoro di allineamento — quindi il divario è tipicamente 6–12+ mesi:
| Modello | Knowledge cutoff | Ritardo rispetto al rilascio |
|---|---|---|
| GPT-5 (originale, deprecato) | 30 set 2024 | ~10 mesi |
| Claude Opus 4,1 (deprecato) | mar 2025 | ~4 mesi |
| Gemini 2,5 Pro | — | ~3 mesi |
(Le cifre del ritardo provengono da un thread di Hacker News ampiamente citato — verifica incrociata con le schede tecniche ufficiali dei modelli, poiché queste cifre vengono ripetute in modo approssimativo. Al momento di questo aggiornamento, la pagina ufficiale di OpenAI segna GPT-5 Chat come “Deprecated” e punta alla sua attuale lineup di modelli, e Anthropic ha ritirato Claude Opus 4,1 a favore delle versioni più recenti Opus/Sonnet — mantenuti qui come storia poiché entrambi sono ancora degni di riconoscimento se li vedi citati altrove, non come scelte attuali.)
La conseguenza pratica: un modello che “è appena uscito” non è aggiornato. Un modello nuovo di zecca può essere ancora indietro di un anno rispetto al mondo. Gli utenti assumono che appena rilasciato significhi appena informato; non è così. E la tabella sopra dimostra il punto meglio di qualsiasi spiegazione: entrambi i suoi modelli di esempio “attuali” sono stati superati nei pochi mesi da quando questo articolo è stato inizialmente redatto. Quel continuo cambiamento è il motivo per cui questa pagina si basa su come funzionano i cutoff piuttosto che su una singola data — tratta ogni tabella datata che leggi qui (e ovunque altro) come un’istantanea, non come un fatto permanente.
Il confine è sfumato, non un muro
Le persone immaginano il cutoff come una linea netta — conoscenza perfetta fino alla data X, totale vuoto dopo. La ricerca dice il contrario.
Il documento “Dated Data: Tracing Knowledge Cutoffs in Large Language Models” ha rilevato che i cutoff effettivi spesso differiscono da quelli dichiarati, a volte in modo drammatico. I modelli addestrati su CommonCrawl portano versioni di Wikipedia dal 2016–2019 anche quando il dump è datato 2023; un corpus aveva “oltre l’80% dei documenti di Wikipedia da versioni precedenti (pre-2023)” nonostante includesse un dump del 2023. Per alcune famiglie di modelli, il cutoff effettivo era di 3–4 anni prima rispetto alla data riportata, a causa di fallimenti nella deduplicazione che hanno permesso ai vecchi contenuti di propagarsi.
Il confine è sfumato anche nell’altra direzione: l’accuratezza diminuisce gradualmente man mano che le domande si avvicinano alla data limite, anziché interrompersi di colpo, perché sugli eventi molto recenti esiste meno segnale di addestramento. Un filone di ricerca distinto, descritto nello studio «I prompt possono riportare indietro nel tempo gli LLM?», mostra inoltre che non si può indurre in modo affidabile un modello a dimenticare le conoscenze successive al limite: i fatti richiesti direttamente vengono rimossi circa nell’82% dei casi, ma le conoscenze collegate da relazioni causali riaffiorano circa nell’81% dei casi. In sintesi, considera la data limite una zona sfumata, non una linea netta, in entrambe le direzioni.
Quali strumenti sono vincolati vs. quali bypassano il cutoff
Questa è la parte che cambia davvero la tua strategia SEO. Se il cutoff conta o meno dipende dal fatto che lo strumento recuperi contenuti live.
Vincolati dal cutoff (solo parametrico)
- ChatGPT gratuito / navigazione disabilitata — risponde esclusivamente dai dati di addestramento. OpenAI è esplicita: “When Web search is disabled, ChatGPT and GPTs created in the workspace cannot use web search, even if a user asks ChatGPT to search.” (traduzione) «Quando la ricerca web è disabilitata, ChatGPT e i GPT creati nello spazio di lavoro non possono usare la ricerca web, anche se un utente chiede a ChatGPT di cercare.»
- Qualsiasi modello base usato senza strumenti — Claude, Gemini, GPT usati tramite una chiamata API grezza senza recupero.
Bypassano effettivamente il cutoff (recupero / grounding)
- Google AI Overviews e AI Mode — usano RAG, che Google chiama grounding, per attingere dall’indice di ricerca live. Il modello Gemini sottostante ha ancora un cutoff parametrico (Gemini 3 era gennaio 2025; Gemini 3 è ora legacy dietro Gemini 3,5, verificato il 19-07-2026 — controlla la scheda del modello attuale per la cifra odierna), ma il grounding recupera pagine correnti al momento della query, quindi gli utenti lo bypassano per la maggior parte delle query. Google dice letteralmente agli sviluppatori di usare lo strumento Search Grounding “for more recent information” oltre quel cutoff. (traduzione) «per informazioni più recenti»
- Perplexity — search-first by design; esegue una ricerca web in tempo reale per quasi ogni query, quindi tratta i cutoff come in gran parte irrilevanti.
- Microsoft Copilot — basato su Bing per impostazione predefinita. La cornice di Microsoft: Copilot “can ground its answers with current information from the web, closing knowledge gaps that every large language model (LLM) inevitably has based on its training data cutoff.” (traduzione) «può basare le sue risposte su informazioni attuali dal web, colmando le lacune di conoscenza che ogni grande modello linguistico (LLM) ha inevitabilmente in base al cutoff dei suoi dati di addestramento.»
- ChatGPT con ricerca attiva (Plus/Team/Enterprise) — trasforma la richiesta in query di ricerca, recupera tramite Bing e risponde da quei risultati con link.
La conoscenza parametrica vs. quella recuperata si comportano in modo diverso
Anche quando il recupero è attivo, le due fonti di conoscenza non si sentono uguali — e la cornice “dual-memory” di Duane Forrester la cattura bene. Il contenuto incorporato nei pesi esce fluente, veloce e dichiarato senza qualifiche — il modello sintetizza dalla conoscenza interiorizzata. Il contenuto post-cutoff recuperato dal web arriva con esitazioni come “according to reports” o “sources indicate”, segnalando un diverso peso epistemico. Il recupero inoltre non elimina magicamente gli errori — quando le fonti sono in conflitto, le risposte basate su grounding possono ancora allucinare. Quindi il recupero mitiga il cutoff; non cancella la differenza tra conoscenza addestrata e recuperata.
Quali contenuti sono più (e meno) colpiti
Il cutoff colpisce più duramente tutto ciò che cambia rapidamente e tocca appena ciò che è stabile.
Fortemente influenzato (volatile): prezzi correnti, specifiche di prodotto, numeri di versione; nomi di aziende, acquisizioni, rebranding; modifiche normative e legali; eventi correnti, sport, elezioni; cambiamenti esecutivi/personali; ricerche e benchmark recenti; dati di mercato e statistiche.
Minimamente influenzato (stabile): concetti e definizioni fondamentali; fatti storici; principi matematici e scientifici; fondamenti di programmazione; geografia.
La parte pericolosa per i brand: un modello di IA ti darà una risposta sbagliata, sicura e fluente su un fatto sensibile al tempo. Non esita quando lavora con dati di addestramento — afferma semplicemente la versione obsoleta come un fatto. Se i tuoi prezzi, la tua leadership o la tua linea di prodotti sono cambiati dopo il cutoff di un modello, quel modello è là fuori che ti rappresenta male con totale certezza.
Cosa significa per SEO e GEO
Penso a questo come a due lavori separati — e confonderli è dove le persone sbagliano.
Traccia 1 — entrare nei dati di addestramento (il gioco lungo)
Per essere incorporato nella memoria parametrica di un modello, i tuoi contenuti devono esistere prima del cutoff di addestramento, ed essere menzionati abbastanza da lasciare un’impressione. Il meccanismo è banale: gli LLM sono predittori della parola successiva. Come ho detto in la nostra ricerca Ahrefs sugli AI Overviews, “if you’re mentioned more in the training data such as web pages, you’re going to be mentioned more in the outputs of LLMs.” (traduzione) «se sei menzionato di più nei dati di addestramento come le pagine web, sarai menzionato di più nelle uscite degli LLM.» Quindi questa traccia riguarda la presenza del brand e l’autorità tematica costruita nel tempo — e il lasciare entrare i crawler di addestramento (GPTBot, ClaudeBot). Le esecuzioni di addestramento avvengono raramente e in modo imprevedibile, quindi i contenuti pubblicati dopo un cutoff sono invisibili a quel modello fino alla prossima esecuzione, che potrebbe essere tra più di un anno.
Traccia 2 — rimanere reperibili e aggiornati (il gioco a breve termine)
Per ogni strumento basato sul recupero, il cutoff è irrilevante se sei nell’indice. È qui che la freschezza e l’indicizzazione fanno il lavoro:
- Fatti indicizzare su Google e Bing. La ricerca ChatGPT e Copilot recuperano entrambi da Bing — se non sei nell’indice di Bing, sei invisibile al recupero di OpenAI e Microsoft. Gli AI Overviews attingono dall’indice di Google. L’indicizzazione è il prerequisito, punto e basta.
- Fai attenzione ai crawler giusti. I bot di addestramento (GPTBot, ClaudeBot) e i bot di recupero per la ricerca IA (OAI-SearchBot, PerplexityBot) sono separati. Bloccare GPTBot ti tiene solo fuori dall’addestramento — OAI-SearchBot gestisce ancora il recupero in tempo reale. Puoi permettere uno e bloccare l’altro. (Analisi completa in AI crawlers.)
- Segnala la freschezza in modo onesto. Uno schema accurato
dateModified/datePublishede un<lastmod>veritiero nelle sitemap aiutano i contenuti sensibili al tempo a essere recuperati di nuovo.
La sfumatura della freschezza vale la pena di essere tenuta a mente. Il nostro studio su 17 milioni di citazioni presso Ahrefs ha scoperto che i contenuti citati dall’IA sono 25,7 % più freschi di quelli citati organicamente — ma l’età media dei contenuti citati è ancora di 2,9 anni. Come hanno detto i miei colleghi, “like traditional search, AI assistants still prefer citing long-lived content.” (traduzione) «come la ricerca tradizionale, gli assistenti IA preferiscono ancora citare contenuti di lunga durata.» Quindi cerca la freschezza per le pagine volatili, ma non confonderla con un sostituto di contenuti durevoli e autorevoli. ChatGPT è la piattaforma con il maggiore pregiudizio verso la recency (ordina le citazioni nel testo dalla più recente alla più vecchia); gli AI Overviews di Google citano i contenuti più vecchi, più o meno come la ricerca organica.
I miti che vale la pena sfatare
- “Il cutoff è un muro invalicabile.” È una zona sfumata: la precisione diminuisce avvicinandosi ad esso e i cutoff effettivi differiscono da quelli dichiarati.
- “Il cutoff dichiarato = ciò che il modello sa davvero.” I cutoff effettivi spesso sono precedenti; i contenuti recenti ma precedenti al cutoff sono sottorappresentati.
- “Le AI Overview sono limitate dallo stesso cutoff del modello base di ChatGPT.” No: si basano sull’indice live di Google e possono mostrare pagine pubblicate oggi.
- “Una volta che ChatGPT può navigare, il cutoff è irrilevante.” La navigazione si attiva solo per alcune query; molte risposte provengono ancora dai dati di addestramento, e la conoscenza recuperata si comporta diversamente da quella addestrata.
- “I miei nuovi contenuti raggiungono subito l’addestramento di ChatGPT.” No: solo al successivo ciclo di addestramento, che può essere a più di un anno di distanza. Il recupero è la tua strada a breve termine.
- “Bloccare GPTBot mi nasconde dalla ricerca AI.” Influisce solo sull’inclusione nell’addestramento; OAI-SearchBot ti recupera comunque in tempo reale.
- “Il cutoff della conoscenza = data di rilascio.” In genere è 6–12+ mesi prima.
Questa pagina fa parte del cluster come funziona la ricerca — vedi LLM, RAG, grounding e allucinazioni dell’AI per gli argomenti correlati.
Riepilogo AI
Una sintesi della versione Advanced:
- Il cutoff della conoscenza = la data in cui la raccolta dei dati di addestramento si è fermata. “Cutoff dei dati di addestramento” è il termine preciso; “cutoff della conoscenza” è un’abbreviazione. Limita solo la conoscenza parametrica (appresa) del modello.
- Non è la data di rilascio. Il divario è di solito 6–12+ mesi (GPT-5: ~10 mesi). Un modello nuovo di zecca può essere indietro di un anno sul mondo. Sia GPT-5 che Claude Opus 4,1 — gli esempi ricorrenti per quel ritardo — sono ora a loro volta deprecati, che è proprio il punto: qualsiasi abbinamento specifico modello/data qui è un’istantanea, non un dato permanente.
- Anthropic lo divide in due: un cutoff della conoscenza affidabile (dove la conoscenza è più densa) vs. un cutoff dei dati di addestramento più ampio — la data affidabile è di qualche mese prima.
- Il confine è sfumato, non un muro. I cutoff effettivi spesso differiscono da quelli dichiarati (CommonCrawl contiene Wikipedia vecchia di anni); la precisione degrada gradualmente verso la data.
- Il recupero lo bypassa. Le AI Overview di Google (grounding), Perplexity, Copilot e ChatGPT con ricerca basano le risposte su un indice live. I modelli base senza ricerca restano congelati al cutoff.
- Conoscenza parametrica ≠ conoscenza recuperata. I fatti appresi emergono fluidi e senza qualifiche; i fatti recuperati arrivano con cautele e possono comunque allucinare quando le fonti sono in conflitto.
- Più colpiti: prezzi, prodotti, personale, eventi, normative, statistiche. Meno: definizioni, storia, matematica, geografia. I modelli affermano fatti obsoleti con piena sicurezza.
- SEO = due lavori: essere inclusi nei dati di addestramento prima del cutoff (gioco lungo) e rimanere indicizzati in Google e Bing oltre che aggiornati per essere recuperati in tempo reale (a breve termine). GPTBot (addestramento) e OAI-SearchBot (recupero) sono separati.
Documentazione ufficiale
Documentazione di fonti primarie dei fornitori di modelli e dei motori di ricerca.
OpenAI
- Ricerca ChatGPT per Enterprise ed EDU — come ChatGPT trasforma una richiesta in query di ricerca e recupera risultati.
- Impostazioni di navigazione web in ChatGPT — cosa succede quando la ricerca web è disabilitata (solo dati di addestramento).
- Documentazione API del modello chat GPT-5 — la pagina ufficiale del modello con il limite delle conoscenze. Ora è contrassegnata come “Deprecated” da OpenAI (verifica del 19 luglio 2026) e rimanda alla gamma attuale: qui resta come fonte della data storica usata negli esempi, non come raccomandazione di un modello corrente.
Anthropic
- Panoramica dei modelli — la distinzione tra cutoff affidabile e cutoff di addestramento (Nota 2) e la tabella dei cutoff per modello. Verificato il 19/07/2026; la tabella ora inizia con Claude Opus 4,8 e Claude Sonnet 5, con Claude Opus 4,1 spostato nella sezione legacy come deprecato.
- Transparency Hub — composizione dei dati di addestramento.
- Guida all’ottimizzazione AI — grounding definito; come le funzionalità AI recuperano pagine aggiornate e pertinenti.
- Funzionalità AI e il tuo sito web — requisiti di indicizzazione e fan-out delle query.
- Grounding con Google Search (API Gemini) — grounding “oltre il suo cutoff di conoscenza”.
- Guida per sviluppatori di Gemini 3 — il cutoff di gennaio 2025 e lo strumento Search Grounding. Ancora attiva ma ora include un avviso di deprecazione che rimanda a Gemini 3,5 (verificato il 19/07/2026).
Microsoft
- Ricerca web di Microsoft 365 Copilot — grounding per colmare le lacune di conoscenza dovute al cutoff di addestramento.
- Comprendere la ricerca web in Copilot — l’esempio della squadra di hockey e il fallback con ricerca web disattivata.
Riferimento
- Knowledge cutoff (Wikipedia) — panoramica definitoria e tabella dei cutoff dei modelli.
Citazioni dalla fonte
Dichiarazioni ufficiali dei fornitori di modelli e dei motori di ricerca. Ogni collegamento è un collegamento profondo alla pagina di origine.
Anthropic — la distinzione a due livelli
- “Reliable knowledge cutoff indicates the date through which a model’s knowledge is most extensive and reliable. Training data cutoff is the broader date range of training data used.” (traduzione) «Il cutoff di conoscenza affidabile indica la data fino alla quale la conoscenza di un modello è più estesa e affidabile. Il cutoff dei dati di addestramento è l’intervallo di date più ampio dei dati di addestramento utilizzati.» — Anthropic Platform Docs, Models Overview (Nota 2). Fonte
Google — il grounding bypassa il cutoff
“[Grounding] allows Gemini to provide more accurate answers and cite verifiable sources beyond its knowledge cutoff.” (traduzione) «Il grounding consente a Gemini di fornire risposte più accurate e citare fonti verificabili oltre il suo limite delle conoscenze.» — Google AI per sviluppatori, grounding con Ricerca Google. Vai alla citazione
- “Gemini 3 models have a knowledge cutoff of January 2025… For more recent information, use the Search Grounding tool.” (traduzione) «I modelli Gemini 3 hanno un limite delle conoscenze fissato a gennaio 2025… Per informazioni più recenti, usa lo strumento Search Grounding.» — Google AI for Developers, Guida a Gemini 3. Vai alla citazione
- “A technique (also known as grounding) used to improve the quality, accuracy, and freshness of AI responses by relying on our core Search ranking systems to retrieve relevant, up-to-date web pages.” (traduzione) «Una tecnica, nota anche come grounding, che migliora qualità, accuratezza e freschezza delle risposte IA usando i sistemi principali di ranking di Google Search per recuperare pagine web pertinenti e aggiornate.» — Google Search Central, Guida all’ottimizzazione AI. Fonte
OpenAI — ricerca attiva o disattivata
- “When Web search is disabled, ChatGPT and GPTs created in the workspace cannot use web search, even if a user asks ChatGPT to search or manually selects search.” (traduzione) «Quando la ricerca web è disattivata, ChatGPT e i GPT creati nell’area di lavoro non possono utilizzare la ricerca web, anche se un utente chiede a ChatGPT di cercare o seleziona manualmente la ricerca.» — OpenAI Help Center. Fonte
Microsoft — colmare il divario del cutoff
- “Copilot can ground its answers with current information from the web, closing knowledge gaps that every large language model (LLM) inevitably has based on its training data cutoff.” (traduzione) «Copilot può basare le sue risposte su informazioni attuali dal web, colmando le lacune di conoscenza che ogni grande modello linguistico (LLM) inevitabilmente ha a causa del cutoff dei dati di addestramento.» — Microsoft 365 Copilot Blog. Fonte
Perplexity — ricerca-first by design
- “ChatGPT is an LLM-first platform that uses Bing’s search API to gather web results, whereas Perplexity is a search-first platform powered by [a] proprietary real-time web index.” (traduzione) «ChatGPT è una piattaforma incentrata prima di tutto sugli LLM che usa l’API di ricerca di Bing per raccogliere risultati web, mentre Perplexity è una piattaforma incentrata sulla ricerca e alimentata da un indice web proprietario in tempo reale.» — Perplexity, Enterprise vs. ChatGPT. Fonte
#:~:text= potrebbero non atterrare sempre sul passaggio evidenziato. La formulazione citata è stata catturata durante la ricerca e dovrebbe essere confermata sulle pagine live prima di essere considerata definitiva; in particolare, le date di cutoff dei modelli cambiano spesso — controlla sempre la scheda ufficiale del modello per la cifra attuale. Cutoff della conoscenza — cheat sheet
Cutoff vs. rilascio (non sono la stessa cosa)
| Modello | Cutoff della conoscenza | Ritardo al rilascio |
|---|---|---|
| GPT-5 (originale, ora deprecato) | 30 set 2024 | ~10 mesi |
| Claude Opus 4,1 (ora deprecato) | mar 2025 | ~4 mesi |
| Gemini 2,5 Pro | — | ~3 mesi |
| Gemini 3 (ora legacy dietro Gemini 3,5) | gen 2025 | — |
Cutoff affidabile vs. cutoff dei dati di addestramento di Anthropic — lineup attuale (secondo la pagina ufficiale dei modelli, verificata il 19-07-2026)
| Modello | Cutoff affidabile | Cutoff dei dati di addestramento |
|---|---|---|
| Claude Opus 4,8 | gen 2026 | gen 2026 |
| Claude Sonnet 5 | gen 2026 | gen 2026 |
| Claude Haiku 4,5 | feb 2025 | lug 2025 |
Modelli Claude legacy ancora nei documenti (deprecati o sostituiti dalla riga sopra)
| Modello | Cutoff affidabile | Cutoff dei dati di addestramento |
|---|---|---|
| Claude Opus 4,5 | mag 2025 | ago 2025 |
| Claude Sonnet 4,5 | gen 2025 | lug 2025 |
| Claude Opus 4,1 (deprecato, in ritiro il 5 ago 2026) | gen 2025 | mar 2025 |
Queste tabelle sono un’istantanea verificata sulla scheda ufficiale del modello il 19-07-2026 — non un dato permanente. Questo corpus ha l’emivita più breve del sito: ogni modello nominato sopra sarà prima o poi superato, alcuni entro mesi. Conferma sempre sulla scheda del modello corrente prima di citare una data specifica.
Lo strumento bypassa il cutoff?
| Strumento | Modalità | Il cutoff conta? |
|---|---|---|
| ChatGPT (gratuito / navigazione disattivata) | Solo addestramento | Sì |
| ChatGPT (ricerca attiva) | Recupero Bing | Per lo più no |
| Google AI Overviews / AI Mode | Grounding su indice live | Per lo più no |
| Microsoft Copilot | Grounding su Bing | Per lo più no |
| Perplexity | Search-first | In gran parte no |
| Qualsiasi modello base tramite API grezza | Solo addestramento | Sì |
Fatti rapidi
- “Cutoff dei dati di addestramento” = termine preciso; “cutoff della conoscenza” = abbreviazione. Stessa cosa.
- Il cutoff ≠ data di rilascio — il divario è tipicamente 6–12+ mesi.
- Il confine è sfumato: i cutoff effettivi differiscono da quelli dichiarati; l’accuratezza diminuisce verso la data.
- GPTBot (addestramento) ≠ OAI-SearchBot (recupero) — blocca uno senza l’altro.
- Il recupero richiede che tu sia indicizzato in Google e Bing.
I modelli mentali
1. Il libro di testo è andato in stampa. La conoscenza parametrica di un modello è un libro stampato. Una volta pubblicato, la stampante non può aggiungere un capitolo — i nuovi fatti aspettano la prossima edizione (run di addestramento). Il recupero è il foglio di errata corrige che consegni al lettore al momento della query.
2. Due memorie — parametrica vs. recuperata. La conoscenza parametrica (incorporata nei pesi) emerge fluente e senza qualifiche. La conoscenza recuperata (recuperata dal vivo) emerge con esitazione (“secondo i rapporti”) e può comunque essere sbagliata quando le fonti sono in conflitto. Non trattarle come intercambiabili — si comportano diversamente e falliscono diversamente.
3. Cutoff ≠ data di rilascio. La raccolta dei dati termina → pulizia, test, allineamento → rilascio. Il divario è di 6–12+ mesi, quindi “nuovo modello” non significa mai “conoscenza attuale”.
4. Il confine è un gradiente, non un muro. La conoscenza si assottiglia man mano che ci si avvicina al cutoff e i cutoff effettivi differiscono da quelli dichiarati. Tratta gli ultimi mesi prima di qualsiasi cutoff come territorio a bassa confidenza.
5. Visibilità su due binari (la regola decisionale SEO).
- Binario training (gioco lungo): pubblica contenuti autorevoli e ottieni menzioni del brand prima dell’addestramento; consenti GPTBot/ClaudeBot. Ricompensa: sei nei pesi.
- Binario retrieval (breve termine): resta indicizzato in Google + Bing e segnala freschezza; consenti OAI-SearchBot/PerplexityBot. Ricompensa: vieni recuperato al momento della query, con cutoff o senza.
Questi sono lavori diversi. Chiediti per ogni contenuto: sta cercando di entrare nei pesi, o di essere recuperato? Ottimizza di conseguenza.
Errori sul knowledge cutoff
Trattare la data di rilascio del modello come il suo cutoff
Un prodotto può essere lanciato molto dopo la fine dei dati usati per il suo addestramento di base. Registra il cutoff documentato dal provider, la versione del modello e se la risposta ha usato la ricerca invece di dedurre la freschezza da un annuncio di lancio.
Presumere che la ricerca aggiorni permanentemente il modello
Il retrieval può fornire contesto attuale per una singola risposta, ma non riscrive i pesi del modello. Descrivi l’output come basato su materiale recuperato, non come prova che il modello di base ha appreso il nuovo fatto.
Ottimizzare solo per i dati di training
L’esposizione al training è lenta e opaca. Mantieni le pagine utili indicizzabili, indicizzate, aggiornate e facili da recuperare, così l’AI search live può usarle subito.
Verifica le affermazioni di freschezza in una risposta AI
Incolla la risposta, il nome/versione del modello, la data della query e le citazioni visibili:
Separate statements that could come from the model's parametric knowledge from
statements that appear grounded in retrieved sources. Flag every time-sensitive
claim, the citation that supports it, and any claim that cannot be verified from the
supplied sources. Do not infer the model's knowledge cutoff; mark it unknown unless I
provide provider documentation.Pianifica i contenuti per entrambi i percorsi di scoperta
Incolla un argomento, l’inventario delle pagine esistenti e i requisiti di freschezza noti:
Create a two-track content plan. Track 1 should improve current retrieval through
crawlability, indexability, clear passages, and explicit update ownership. Track 2
should build durable brand/entity evidence that may enter future training corpora.
Use only the supplied pages and facts, identify gaps, and label assumptions. Valuta una risposta AI presumibilmente aggiornata
- Registra il modello esatto e la superficie del prodotto.
- Registra la data e la formulazione della query.
- Controlla se erano abilitati browsing, ricerca, connettori o file caricati.
- Cattura ogni citazione e la data di pubblicazione/aggiornamento che mostra.
- Separa le prove recuperate dalle affermazioni del modello non citate.
- Verifica le affermazioni attuali rispetto alle fonti primarie.
- Non sostituire una data di rilascio con un cutoff documentato.
- Esegui di nuovo senza retrieval solo quando devi confrontare la conoscenza parametrica.
Mantieni i contenuti disponibili oltre il cutoff
- Mantieni pagine canoniche indicizzabili e indicizzate.
- Aggiorna i fatti la cui accuratezza cambia nel tempo.
- Scrivi passaggi autonomi che rendano chiaro il contesto del retrieval.
- Preserva una denominazione stabile di brand, autore, prodotto ed entità.
Mettiti alla prova: Knowledge cutoff
Risorse che meritano il tuo tempo
I miei scritti e ricerche correlati (Ahrefs)
- Dati ricavati da 55,8 milioni di AI Overview in 590 milioni di ricerche — da qui deriva l’osservazione secondo cui una maggiore presenza nei dati di addestramento tende a produrre più menzioni nelle risposte.
- ChatGPT ha il 12% del volume di ricerca di Google, ma Google invia 190 volte più traffico — la ricerca IA come modello distinto dalla ricerca tradizionale.
- Che cosa sappiamo davvero sull’ottimizzazione per la ricerca tramite LLM — freschezza, tassi di blocco di GPTBot e modalità con cui gli LLM leggono le pagine.
- Nuovo studio: gli assistenti IA preferiscono citare contenuti più recenti (17 milioni di citazioni) — i dati sulla freschezza citati sopra.
I miei interventi
- GEO? AEO? LLMO? — Ahrefs Evolve 2025 — la mia panoramica sugli input degli LLM: dati di training, pagine recuperate (RAG), temperatura, probabilità.
Da altri
- Duane Forrester, Quando il limite dei dati di addestramento diventa un fattore di ranking — il modello della doppia memoria e la pianificazione editoriale consapevole del limite.
- Dati datati: ricostruire i limiti delle conoscenze negli LLM — perché i limiti effettivi differiscono da quelli dichiarati.
- I prompt possono riportare indietro nel tempo gli LLM? — perché non puoi far dimenticare in modo affidabile a un modello i fatti successivi al limite tramite prompt.
- Conductor, Limite delle conoscenze dell’IA: che cos’è e perché conta? — citazioni di professionisti sull’obsolescenza del modello base rispetto alla RAG.
- Studio sulla robustezza temporale degli LLM — benchmark che mostrano come l’accuratezza diminuisca gradualmente avvicinandosi al limite, non all’improvviso.
- iPullRank, Come la generazione aumentata dal recupero sta ridefinendo la SEO — la RAG come ponte tra i limiti di addestramento e le risposte in tempo reale.
- Limite delle conoscenze (Wikipedia) — panoramica della definizione e tabella delle date dei modelli mantenuta dalla comunità.
- Otterly.ai, Date limite delle conoscenze degli LLM — tabella comparativa dei principali modelli, dei rispettivi limiti e dell’eventuale accesso al web in tempo reale.
Statistiche da citare
- I contenuti citati dall’IA sono più freschi del 25,7% rispetto a quelli citati organicamente — ma la loro età media è ancora 2,9 anni (1 064 giorni), contro i 3,9 anni per quelli organici. La freschezza conta per l’IA, ma la longevità vince ancora. (Studio Ahrefs su 17 milioni di citazioni.) Fonte
- Il knowledge cutoff di GPT-5 (30 settembre 2024) era di ~10 mesi prima del rilascio — l’illustrazione più chiara che il cutoff ≠ data di rilascio. Claude Opus 4,1 aveva ~4 mesi, Gemini 2,5 Pro ~3 mesi. (Sia GPT-5 Chat che Claude Opus 4,1 sono ora contrassegnati come deprecati sulle pagine dei modelli dei rispettivi fornitori — verificato il 19/07/2026 — che è di per sé un’illustrazione di quanto velocemente questa lista si aggiorni.) Fonte
- I cutoff effettivi possono essere di 3–4 anni precedenti rispetto a quelli dichiarati per alcune famiglie di modelli — un corpus aveva >80% di documenti Wikipedia da versioni precedenti al 2023 nonostante un dump del 2023. Il cutoff è sfumato, non un muro. (Articolo Dated Data.) Fonte
- L’oblio basato su prompt fallisce ~81% delle volte per conoscenze causalmente correlate (contro ~82% di successo per fatti interrogati direttamente) — non puoi far “riavvolgere” in modo affidabile un modello oltre il suo cutoff. (Articolo Can Prompts Rewind Time.) Fonte
- Il cutoff parametrico di Gemini 3 è gennaio 2025, eppure AI Overviews mostra pagine dello stesso giorno — perché il grounding attinge dall’indice live, non dai pesi. Gemini 3 stesso è ora legacy dietro Gemini 3,5 (verificato il 19/07/2026); le pagine dei modelli di Google non pubblicano una data di cutoff per 3,5 al momento di questo controllo, il che è la norma, non l’eccezione — i fornitori non sempre ristabiliscono un cutoff a ogni rilascio. Fonte
Cronologia modifiche
Aggiornato il 13 ago 2026.
Riepilogo editoriale e dettagli registrati delle modifiche.Dettagli delle modifiche
-
Le note dettagliate sulle modifiche sono attualmente disponibili in inglese.
-
Le note dettagliate sulle modifiche sono attualmente disponibili in inglese.
-
Le note dettagliate sulle modifiche sono attualmente disponibili in inglese.
Confronto completo non disponibile — non è stata archiviata alcuna istantanea precedente per questa revisione.
Aggiornato il 13 ago 2026.
Riepilogo editoriale e dettagli registrati delle modifiche.Dettagli delle modifiche
-
Le note dettagliate sulle modifiche sono attualmente disponibili in inglese.
-
Le note dettagliate sulle modifiche sono attualmente disponibili in inglese.
-
Le note dettagliate sulle modifiche sono attualmente disponibili in inglese.
Confronto completo non disponibile — non è stata archiviata alcuna istantanea precedente per questa revisione.
Aggiornato il 11 ago 2026.
Riepilogo editoriale e dettagli registrati delle modifiche.Dettagli delle modifiche
-
Le note dettagliate sulle modifiche sono attualmente disponibili in inglese.
Confronto completo non disponibile — non è stata archiviata alcuna istantanea precedente per questa revisione.
Aggiornato il 19 lug 2026.
Riepilogo editoriale e dettagli registrati delle modifiche.Dettagli delle modifiche
-
Le note dettagliate sulle modifiche sono attualmente disponibili in inglese.
-
Le note dettagliate sulle modifiche sono attualmente disponibili in inglese.
-
Le note dettagliate sulle modifiche sono attualmente disponibili in inglese.
Confronto completo non disponibile — non è stata archiviata alcuna istantanea precedente per questa revisione.