Data di taglio delle conoscenze

Cos'è una data di taglio delle conoscenze (limite dei dati di addestramento), perché non è la data di rilascio del modello, quali strumenti di intelligenza artificiale la aggirano con il recupero delle informazioni e cosa significa per la SEO.

Prima pubblicazione: 24 giu 2026 · Ultimo aggiornamento: 13 ago 2026 · Advanced
Lingue

Una data di taglio delle conoscenze è la data dopo la quale un LLM ha smesso di essere addestrato su nuovi dati, non la data in cui è stato rilasciato (queste differiscono di mesi, spesso 6-12+). Limita solo la conoscenza parametrica incorporata nel modello. Gli strumenti che utilizzano il recupero delle informazioni (Google AI Overviews, Bing Copilot, Perplexity, ChatGPT con ricerca) basano le risposte su un indice aggiornato e aggirano efficacemente il limite, mentre i modelli base senza ricerca rimangono congelati alla loro data di taglio. Per la SEO ciò significa due lavori separati: essere inclusi nei dati di addestramento per il lungo termine e rimanere indicizzati e aggiornati per essere recuperati al momento della query.

TL;DR — Un knowledge cutoff è la data in cui la raccolta dei dati di addestramento si è fermata — non la data di rilascio (il divario è di solito 6–12+ mesi). Limita solo la conoscenza parametrica (addestrata) di un modello. I sistemi con retrieval-augmented — Google AI Overviews, Bing Copilot, Perplexity, ChatGPT con ricerca — basano le risposte su un indice in tempo reale e lo aggirano efficacemente; i modelli base senza ricerca restano congelati. Il confine è sfumato, non un muro: i cutoff effettivi spesso differiscono da quelli dichiarati e l’accuratezza degrada man mano che ci si avvicina alla data. Per la SEO questo si divide in due lavori separati — essere incorporati nei dati di addestramento (gioco a lungo termine) e rimanere indicizzati + aggiornati per essere recuperati al momento della query (a breve termine).

Cos’è realmente un knowledge cutoff

I cutoff sono specifici per modello e versione e possono cambiare quando i fornitori aggiornano i modelli. Evidence for this claim Model documentation can specify a knowledge-cutoff date for a particular model or snapshot. Scope: OpenAI model metadata; the date is model- and version-specific and may change with releases. Confidence: high · Verified: OpenAI: Models Non dedurre mai l’attualità del prodotto solo da una data di cutoff ricordata. Evidence for this claim A product can supplement model knowledge with current web search and cited web sources. Scope: ChatGPT search product behavior; browsing or retrieval is separate from the model's training cutoff and is not guaranteed for every answer. Confidence: high · Verified: OpenAI: ChatGPT search

Un knowledge cutoff è la data dopo la quale un modello non è più stato addestrato su nuovi dati. Il modello non ha alcuna consapevolezza di ciò che è accaduto dopo — non perché lo nasconda, ma perché non vi è mai stato esposto. La sua conoscenza rimane congelata nei suoi pesi a quel punto, a meno che il sistema non aggiunga un recupero in tempo reale.

Il termine preciso è training data cutoff — la data in cui la raccolta dei dati si è fermata. “Knowledge cutoff” è l’abbreviazione comune, e i due termini sono usati in modo intercambiabile. Il modello mentale che preferisco: è un libro di testo che è andato in stampa. Una volta che il libro è pubblicato, la stampante non può aggiungere un nuovo capitolo — dovresti stampare un’edizione completamente nuova. Un modello è lo stesso. Nuovi fatti entrano solo con la successiva sessione di addestramento.

Questo è puramente un limite alla conoscenza parametrica — la roba incorporata nei pesi. Non significa affatto che il modello non possa gestire eventi successivi al cutoff. Fornisci le informazioni nel contesto — tramite una pipeline RAG o un prompt di sistema — e un LLM può ragionare perfettamente su eventi su cui non è mai stato addestrato. Il cutoff limita ciò che il modello sa da solo, non ciò con cui può lavorare quando gli fornisci fonti.

The cutoff freezes parametric knowledge; retrieval can add current evidence without changing the model's weights. Fonte: /ai-search/how-search-works/knowledge-cutoff/

A current question can follow two paths. On the weights-only path, the model relies on knowledge frozen at the training cutoff. On the grounded path, the system retrieves current sources and places them in the model's context. Retrieval supplies evidence at query time; it does not update or retrain the model weights.

© Patrick Stox LLC · CC BY 4.0 ·

La distinzione a due livelli di Anthropic: cutoff affidabile vs. cutoff di addestramento

Anthropic è il più esplicito dei principali laboratori su questo punto, e la distinzione vale la pena di essere adottata. Separano due date: un reliable knowledge cutoff (“indica la data fino alla quale la conoscenza di un modello è più estesa e affidabile”) e un più ampio training data cutoff (“l’intervallo di date più ampio dei dati di addestramento utilizzati”). La data affidabile è tipicamente alcuni mesi prima della data di addestramento.

Perché il divario? Il contenuto più recente nel corpus è scarso — internet non ha ancora finito di scrivere sugli eventi molto recenti. Quindi la conoscenza pratica di un modello delle settimane immediatamente precedenti al suo cutoff di addestramento è sottile, anche se quei dati sono tecnicamente “lì dentro”. Il cutoff affidabile è il punto in cui il modello è realmente informativo. Tienilo a mente ogni volta che vedi una singola data di cutoff sicura: il confine utile è di solito precedente a quello dichiarato.

Il knowledge cutoff non è la data di rilascio del modello

Questo è l’equivoco più comune, ed è facile da capire. Il cutoff è quando è terminata la raccolta dei dati. La data di rilascio è quando il modello viene pubblicato. Tra i due ci sono pulizia dei dati, test di sicurezza, valutazione e lavoro di allineamento — quindi il divario è tipicamente 6–12+ mesi:

ModelloKnowledge cutoffRitardo rispetto al rilascio
GPT-5 (originale, deprecato)30 set 2024~10 mesi
Claude Opus 4,1 (deprecato)mar 2025~4 mesi
Gemini 2,5 Pro~3 mesi

(Le cifre del ritardo provengono da un thread di Hacker News ampiamente citato — verifica incrociata con le schede tecniche ufficiali dei modelli, poiché queste cifre vengono ripetute in modo approssimativo. Al momento di questo aggiornamento, la pagina ufficiale di OpenAI segna GPT-5 Chat come “Deprecated” e punta alla sua attuale lineup di modelli, e Anthropic ha ritirato Claude Opus 4,1 a favore delle versioni più recenti Opus/Sonnet — mantenuti qui come storia poiché entrambi sono ancora degni di riconoscimento se li vedi citati altrove, non come scelte attuali.)

La conseguenza pratica: un modello che “è appena uscito” non è aggiornato. Un modello nuovo di zecca può essere ancora indietro di un anno rispetto al mondo. Gli utenti assumono che appena rilasciato significhi appena informato; non è così. E la tabella sopra dimostra il punto meglio di qualsiasi spiegazione: entrambi i suoi modelli di esempio “attuali” sono stati superati nei pochi mesi da quando questo articolo è stato inizialmente redatto. Quel continuo cambiamento è il motivo per cui questa pagina si basa su come funzionano i cutoff piuttosto che su una singola data — tratta ogni tabella datata che leggi qui (e ovunque altro) come un’istantanea, non come un fatto permanente.

Il confine è sfumato, non un muro

Le persone immaginano il cutoff come una linea netta — conoscenza perfetta fino alla data X, totale vuoto dopo. La ricerca dice il contrario.

Il documento “Dated Data: Tracing Knowledge Cutoffs in Large Language Models” ha rilevato che i cutoff effettivi spesso differiscono da quelli dichiarati, a volte in modo drammatico. I modelli addestrati su CommonCrawl portano versioni di Wikipedia dal 2016–2019 anche quando il dump è datato 2023; un corpus aveva “oltre l’80% dei documenti di Wikipedia da versioni precedenti (pre-2023)” nonostante includesse un dump del 2023. Per alcune famiglie di modelli, il cutoff effettivo era di 3–4 anni prima rispetto alla data riportata, a causa di fallimenti nella deduplicazione che hanno permesso ai vecchi contenuti di propagarsi.

Il confine è sfumato anche nell’altra direzione: l’accuratezza diminuisce gradualmente man mano che le domande si avvicinano alla data limite, anziché interrompersi di colpo, perché sugli eventi molto recenti esiste meno segnale di addestramento. Un filone di ricerca distinto, descritto nello studio «I prompt possono riportare indietro nel tempo gli LLM?», mostra inoltre che non si può indurre in modo affidabile un modello a dimenticare le conoscenze successive al limite: i fatti richiesti direttamente vengono rimossi circa nell’82% dei casi, ma le conoscenze collegate da relazioni causali riaffiorano circa nell’81% dei casi. In sintesi, considera la data limite una zona sfumata, non una linea netta, in entrambe le direzioni.

Quali strumenti sono vincolati vs. quali bypassano il cutoff

Questa è la parte che cambia davvero la tua strategia SEO. Se il cutoff conta o meno dipende dal fatto che lo strumento recuperi contenuti live.

Vincolati dal cutoff (solo parametrico)

  • ChatGPT gratuito / navigazione disabilitata — risponde esclusivamente dai dati di addestramento. OpenAI è esplicita: “When Web search is disabled, ChatGPT and GPTs created in the workspace cannot use web search, even if a user asks ChatGPT to search.” (traduzione) «Quando la ricerca web è disabilitata, ChatGPT e i GPT creati nello spazio di lavoro non possono usare la ricerca web, anche se un utente chiede a ChatGPT di cercare.»
  • Qualsiasi modello base usato senza strumenti — Claude, Gemini, GPT usati tramite una chiamata API grezza senza recupero.

Bypassano effettivamente il cutoff (recupero / grounding)

  • Google AI Overviews e AI Mode — usano RAG, che Google chiama grounding, per attingere dall’indice di ricerca live. Il modello Gemini sottostante ha ancora un cutoff parametrico (Gemini 3 era gennaio 2025; Gemini 3 è ora legacy dietro Gemini 3,5, verificato il 19-07-2026 — controlla la scheda del modello attuale per la cifra odierna), ma il grounding recupera pagine correnti al momento della query, quindi gli utenti lo bypassano per la maggior parte delle query. Google dice letteralmente agli sviluppatori di usare lo strumento Search Grounding “for more recent information” oltre quel cutoff. (traduzione) «per informazioni più recenti»
  • Perplexity — search-first by design; esegue una ricerca web in tempo reale per quasi ogni query, quindi tratta i cutoff come in gran parte irrilevanti.
  • Microsoft Copilot — basato su Bing per impostazione predefinita. La cornice di Microsoft: Copilot “can ground its answers with current information from the web, closing knowledge gaps that every large language model (LLM) inevitably has based on its training data cutoff.” (traduzione) «può basare le sue risposte su informazioni attuali dal web, colmando le lacune di conoscenza che ogni grande modello linguistico (LLM) ha inevitabilmente in base al cutoff dei suoi dati di addestramento.»
  • ChatGPT con ricerca attiva (Plus/Team/Enterprise) — trasforma la richiesta in query di ricerca, recupera tramite Bing e risponde da quei risultati con link.

La conoscenza parametrica vs. quella recuperata si comportano in modo diverso

Anche quando il recupero è attivo, le due fonti di conoscenza non si sentono uguali — e la cornice “dual-memory” di Duane Forrester la cattura bene. Il contenuto incorporato nei pesi esce fluente, veloce e dichiarato senza qualifiche — il modello sintetizza dalla conoscenza interiorizzata. Il contenuto post-cutoff recuperato dal web arriva con esitazioni come “according to reports” o “sources indicate”, segnalando un diverso peso epistemico. Il recupero inoltre non elimina magicamente gli errori — quando le fonti sono in conflitto, le risposte basate su grounding possono ancora allucinare. Quindi il recupero mitiga il cutoff; non cancella la differenza tra conoscenza addestrata e recuperata.

Quali contenuti sono più (e meno) colpiti

Il cutoff colpisce più duramente tutto ciò che cambia rapidamente e tocca appena ciò che è stabile.

Fortemente influenzato (volatile): prezzi correnti, specifiche di prodotto, numeri di versione; nomi di aziende, acquisizioni, rebranding; modifiche normative e legali; eventi correnti, sport, elezioni; cambiamenti esecutivi/personali; ricerche e benchmark recenti; dati di mercato e statistiche.

Minimamente influenzato (stabile): concetti e definizioni fondamentali; fatti storici; principi matematici e scientifici; fondamenti di programmazione; geografia.

La parte pericolosa per i brand: un modello di IA ti darà una risposta sbagliata, sicura e fluente su un fatto sensibile al tempo. Non esita quando lavora con dati di addestramento — afferma semplicemente la versione obsoleta come un fatto. Se i tuoi prezzi, la tua leadership o la tua linea di prodotti sono cambiati dopo il cutoff di un modello, quel modello è là fuori che ti rappresenta male con totale certezza.

Cosa significa per SEO e GEO

Penso a questo come a due lavori separati — e confonderli è dove le persone sbagliano.

Traccia 1 — entrare nei dati di addestramento (il gioco lungo)

Per essere incorporato nella memoria parametrica di un modello, i tuoi contenuti devono esistere prima del cutoff di addestramento, ed essere menzionati abbastanza da lasciare un’impressione. Il meccanismo è banale: gli LLM sono predittori della parola successiva. Come ho detto in la nostra ricerca Ahrefs sugli AI Overviews, “if you’re mentioned more in the training data such as web pages, you’re going to be mentioned more in the outputs of LLMs.” (traduzione) «se sei menzionato di più nei dati di addestramento come le pagine web, sarai menzionato di più nelle uscite degli LLM.» Quindi questa traccia riguarda la presenza del brand e l’autorità tematica costruita nel tempo — e il lasciare entrare i crawler di addestramento (GPTBot, ClaudeBot). Le esecuzioni di addestramento avvengono raramente e in modo imprevedibile, quindi i contenuti pubblicati dopo un cutoff sono invisibili a quel modello fino alla prossima esecuzione, che potrebbe essere tra più di un anno.

Traccia 2 — rimanere reperibili e aggiornati (il gioco a breve termine)

Per ogni strumento basato sul recupero, il cutoff è irrilevante se sei nell’indice. È qui che la freschezza e l’indicizzazione fanno il lavoro:

  • Fatti indicizzare su Google e Bing. La ricerca ChatGPT e Copilot recuperano entrambi da Bing — se non sei nell’indice di Bing, sei invisibile al recupero di OpenAI e Microsoft. Gli AI Overviews attingono dall’indice di Google. L’indicizzazione è il prerequisito, punto e basta.
  • Fai attenzione ai crawler giusti. I bot di addestramento (GPTBot, ClaudeBot) e i bot di recupero per la ricerca IA (OAI-SearchBot, PerplexityBot) sono separati. Bloccare GPTBot ti tiene solo fuori dall’addestramento — OAI-SearchBot gestisce ancora il recupero in tempo reale. Puoi permettere uno e bloccare l’altro. (Analisi completa in AI crawlers.)
  • Segnala la freschezza in modo onesto. Uno schema accurato dateModified/datePublished e un <lastmod> veritiero nelle sitemap aiutano i contenuti sensibili al tempo a essere recuperati di nuovo.

La sfumatura della freschezza vale la pena di essere tenuta a mente. Il nostro studio su 17 milioni di citazioni presso Ahrefs ha scoperto che i contenuti citati dall’IA sono 25,7 % più freschi di quelli citati organicamente — ma l’età media dei contenuti citati è ancora di 2,9 anni. Come hanno detto i miei colleghi, “like traditional search, AI assistants still prefer citing long-lived content.” (traduzione) «come la ricerca tradizionale, gli assistenti IA preferiscono ancora citare contenuti di lunga durata.» Quindi cerca la freschezza per le pagine volatili, ma non confonderla con un sostituto di contenuti durevoli e autorevoli. ChatGPT è la piattaforma con il maggiore pregiudizio verso la recency (ordina le citazioni nel testo dalla più recente alla più vecchia); gli AI Overviews di Google citano i contenuti più vecchi, più o meno come la ricerca organica.

I miti che vale la pena sfatare

  • “Il cutoff è un muro invalicabile.” È una zona sfumata: la precisione diminuisce avvicinandosi ad esso e i cutoff effettivi differiscono da quelli dichiarati.
  • “Il cutoff dichiarato = ciò che il modello sa davvero.” I cutoff effettivi spesso sono precedenti; i contenuti recenti ma precedenti al cutoff sono sottorappresentati.
  • “Le AI Overview sono limitate dallo stesso cutoff del modello base di ChatGPT.” No: si basano sull’indice live di Google e possono mostrare pagine pubblicate oggi.
  • “Una volta che ChatGPT può navigare, il cutoff è irrilevante.” La navigazione si attiva solo per alcune query; molte risposte provengono ancora dai dati di addestramento, e la conoscenza recuperata si comporta diversamente da quella addestrata.
  • “I miei nuovi contenuti raggiungono subito l’addestramento di ChatGPT.” No: solo al successivo ciclo di addestramento, che può essere a più di un anno di distanza. Il recupero è la tua strada a breve termine.
  • “Bloccare GPTBot mi nasconde dalla ricerca AI.” Influisce solo sull’inclusione nell’addestramento; OAI-SearchBot ti recupera comunque in tempo reale.
  • “Il cutoff della conoscenza = data di rilascio.” In genere è 6–12+ mesi prima.

Questa pagina fa parte del cluster come funziona la ricerca — vedi LLM, RAG, grounding e allucinazioni dell’AI per gli argomenti correlati.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.