Guide : Knowledge Cutoff
Ce que a knowledge cutoff (training données cutoff) est, pourquoi il n’est pas le model's release date, qui AI outils bypass il avec retrieval, et Ce que cela signifie pour le SEO.
A knowledge cutoff est le date après qui an LLM stopped étant trained on nouveau données — pas le date il était released (ceux differ par months, souvent 6–12+). Il seulement limites a model's trained-dans, parametric knowledge. Outils que utiliser retrieval (Google AI Overviews, Bing Copilot, Perplexity, ChatGPT avec recherche) ground réponses dans a actif indexer et effectively bypass le cutoff, pendant que base models sans recherche stay frozen à leur cutoff. Pour le SEO que signifie deux séparé jobs: obtenir embedded dans training données pour le long game, et stay indexé et fresh donc vous êtes retrieved à requête temps.
TL;DR — A knowledge cutoff est le date an AI model stopped learning. Demander ChatGPT’s base model à propos de quelque chose que happened après son cutoff et il simplement ne va pas know — il était jamais trained on il. Mais nombreux AI outils (Google AI Overviews, Perplexity, Copilot, ChatGPT avec recherche on) peut regarder choses up actif, qui obtient les autour le cutoff pour la plupart questions.
Ce que a knowledge cutoff is
A model knowledge cutoff décrit le training-knowledge boundary disclosed pour a model release; il n’est pas necessarily le boundary de a produit que peut browse or retrieve. Preuve à l’appui de cette affirmation Model documentation can specify a knowledge-cutoff date for a particular model or snapshot. Portée : OpenAI model metadata; the date is model- and version-specific and may change with releases. Niveau de confiance : élevé · Vérifié : OpenAI: Models Produit outils peut accès newer information à réponse temps, subject à availability et source qualité. Preuve à l’appui de cette affirmation A product can supplement model knowledge with current web search and cited web sources. Portée : ChatGPT search product behavior; browsing or retrieval is separate from the model's training cutoff and is not guaranteed for every answer. Niveau de confiance : élevé · Vérifié : OpenAI: ChatGPT search
Grand langue models — le tech behind ChatGPT, Claude, Gemini — apprendre par reading an enormous pile de texte. À some point que reading arrête donc le model peut être construit et testé. Le date le reading stopped est le knowledge cutoff (vous’ll aussi voir il appelé le training cutoff or training données cutoff — même chose).
Après que date, le model knows rien. Pas parce que c’est hiding n’importe quoi — il simplement jamais saw il. Un de le meilleur explanations j’ai come à travers compare il à an intern: le knowledge cutoff est le date votre AI intern dernier went à school. Tout up à que day ils learned bien; n’importe quoi après, ils know rien à propos de.
Pourquoi ChatGPT donne outdated réponses parfois
Dire a entreprise rebranded dernier month, or votre produit modifié son pricing. Si vous demander an AI model que relies seulement on son training, il’ll confidently donner vous le old réponse — et sound complètement certain à propos de il. c’est le cutoff à fonctionner.
Le corriger que AI entreprises utiliser est letting le model recherche le web. Au lieu de answering depuis memory, le outil exécute a actif recherche, lit le résultats, et écrit an réponse depuis ceux. Quand recherche est on, le cutoff arrête mattering pour que question.
Qui outils regarder choses up vs. qui don’t
- Regarder choses up (cutoff mostly ne fait pas matter): Google AI Overviews, Perplexity, Microsoft Copilot, et ChatGPT quand web recherche est turned on. Ces pull depuis a actif recherche indexer.
- Réponse depuis memory (cutoff matters a lot): ChatGPT’s gratuit/base model avec browsing off, or quelconque model utilisé sans web accès. Ces seulement know up à leur cutoff.
Pourquoi ce matters si vous run a website
Là are really two façons votre business montre up in AI réponses:
- Dans le model’s memory. Votre contenu a à être publié avant a model’s training cutoff à être baked dans — et le suivant training exécuter pourrait être a année or plus away.
- Via actif recherche. Si le AI outil semble choses up, vous pouvez montrer up le même day vous publish — tant que vous êtes indexé dans Google et Bing.
Donc vous vouloir les deux: être le kind de brand c’est well-known suffisant à être dans le training données, et stay facile à trouver et fresh suffisant à être pulled dans actif. Le Avancé tab digs dans le dates, le fuzzy edges, et le réel SEO playbook.
TL;DR — A knowledge cutoff est le date training données collection stopped — pas le release date (le gap est généralement 6–12+ months). Il seulement constrains a model’s parametric (trained-dans) knowledge. Retrieval-augmented systèmes — Google AI Overviews, Bing Copilot, Perplexity, ChatGPT avec recherche — ground réponses dans a actif indexer et effectively bypass il; base models sans recherche stay frozen. Le boundary est fuzzy, pas a wall: effective cutoffs souvent differ depuis stated ones et accuracy degrades as vous approche le date. Pour le SEO ce splits dans deux séparé jobs — obtenir embedded dans training données (long game), et stay indexé + fresh donc vous êtes retrieved à requête temps (near-term).
Ce que a knowledge cutoff en réalité is
Cutoffs sont model- et version-spécifique et peut modifier quand providers mettre à jour models. Preuve à l’appui de cette affirmation Model documentation can specify a knowledge-cutoff date for a particular model or snapshot. Portée : OpenAI model metadata; the date is model- and version-specific and may change with releases. Niveau de confiance : élevé · Vérifié : OpenAI: Models Jamais infer actuel produit freshness solely depuis a remembered cutoff date. Preuve à l’appui de cette affirmation A product can supplement model knowledge with current web search and cited web sources. Portée : ChatGPT search product behavior; browsing or retrieval is separate from the model's training cutoff and is not guaranteed for every answer. Niveau de confiance : élevé · Vérifié : OpenAI: ChatGPT search
A knowledge cutoff est le date après qui a model était ne … plus trained on nouveau données. Le model a aucun awareness de n’importe quoi que happened plus tard — pas parce que c’est withholding il, mais parce que il était jamais exposed à il. Son knowledge sits frozen dans son weights à que point unless le système bolts on actif retrieval.
Le precise term est training données cutoff — le date données collection stopped. “Knowledge cutoff” est le courant shorthand, et le deux sont utilisé interchangeably. Le mental model Je comme: c’est a textbook c’est gone à press. Une fois le book ships, le printer ne peut pas ajouter a nouveau chapter — vous’d ont à print a entier nouveau edition. A model est le même. Nouveau facts seulement obtenir dans on le suivant training exécuter.
Ce est purely a limite on parametric knowledge — le stuff baked dans le weights. Il fait pas signifier le model ne peut pas handle post-cutoff events à tout. Hand il le information dans context — via a RAG pipeline or a système prompt — et an LLM peut raison à propos de events il était jamais trained on perfectly bien. Le cutoff limites ce que le model knows on son propre, pas ce que il peut fonctionner avec quand vous donner il sources.
A actuel question peut suivre deux paths. On le weights-seulement chemin, le model relies on knowledge frozen à le training cutoff. On le grounded chemin, le système retrieves actuel sources et places les dans le model's context. Retrieval supplies evidence à requête temps; il ne fait pas mettre à jour or retrain le model weights.
© Patrick Stox LLC · CC BY 4.0 ·
Anthropic’s deux-tier distinction: fiable vs. training cutoff
Anthropic est le la plupart explicit de le major labs ici, et le distinction est worth borrowing. Ils séparé deux dates: a fiable knowledge cutoff (“indicates le date via qui a model’s knowledge est la plupart extensive et fiable”) et a broader training données cutoff (“le broader date range de training données utilisé”). Le fiable date est typically a quelques months précédent que le training date.
Pourquoi le gap? Le latest contenu dans le corpus est sparse — le internet hasn’t finished writing à propos de very recent events yet. Donc a model’s practical knowledge de le weeks correct avant son training cutoff est thin, même though que données est technically “dans là.” Le fiable cutoff est où le model est genuinely informative. Garder que dans mind quelconque temps vous voir a unique confident cutoff date: le utile boundary est généralement précédent que le stated un.
Knowledge cutoff n’est pas the model’s release date
Ce est le unique la plupart courant misconception, et c’est an facile un. Le cutoff est quand données collection ended. Le release date est quand le model ships. Entre le deux sits données cleaning, safety testing, evaluation, et alignment fonctionner — donc le gap est typically 6–12+ months:
| Model | Knowledge cutoff | Lag to release |
|---|---|---|
| GPT-5 (original, deprecated) | Sep 30, 2024 | ~10 months |
| Claude Opus 4,1 (deprecated) | Mar 2025 | ~4 months |
| Gemini 2,5 Pro | — | ~3 months |
(Lag figures via a widely-cited Hacker News thread — cross-vérifier contre official model cards, since ces obtenir repeated loosely. As de ce mettre à jour, OpenAI’s propre model page marks GPT-5 Chat “Deprecated” et points à son actuel model lineup, et Anthropic a retired Claude Opus 4,1 dans favor de newer Opus/Sonnet releases — kept ici as history since les deux sont encore worth recognizing si vous voir les cited elsewhere, pas as actuel picks.)
Le practical fallout: a model que “just came out” est pas actuel. A brand-new model peut encore être a année behind on le world. Utilisateurs assume freshly-released signifie freshly-informed; il ne fait pas. Et le tableau ci-dessus rend le point meilleur que quelconque explanation pourrait: les deux de son “actuel” exemple models étaient superseded dans le quelques months since ce article était premier drafted. Que churn est le raison ce page leans on comment cutoffs fonctionner plutôt que on quelconque unique date — treat chaque dated tableau vous lire ici (et everywhere sinon) as a snapshot, pas a standing fact.
The boundary is fuzzy, pas a wall
Personnes picture the cutoff as a hard line — perfect knowledge up to date X, total blankness après. The research dit sinon.
Le “Dated Data: Tracing Knowledge Cutoffs in Large Language Models” paper trouvé que effective cutoffs souvent differ depuis stated ones, parfois dramatically. Models trained on CommonCrawl carry Wikipedia versions depuis 2016–2019 même quand le dump est dated 2023; un corpus avait “over 80% de Wikipedia documents depuis précédent versions (pre-2023)” despite notamment a 2023 dump. Pour some model families le effective cutoff ran 3–4 années précédent que le reported date, thanks à deduplication échecs letting old contenu propagate.
Il cuts le autre façon à le boundary aussi: accuracy degrades gradually as requêtes approche le cutoff plutôt que snapping off à il — il y a simplement moins training signal à propos de very recent events. Et a séparé line de fonctionner (“Peut Prompts Rewind Temps pour LLMs?”) trouvé vous pouvez’t reliably prompt a model dans forgetting post-cutoff knowledge soit: directement-queried facts unlearn ~82% de le temps, mais causally-related knowledge leaks via ~81% de le temps. Le takeaway: treat le cutoff as a fuzzy zone, pas a clean line, dans les deux directions.
Qui outils are constrained vs. qui bypass the cutoff
Ce est le partie que en réalité changements votre SEO stratégie. Si le cutoff matters à tout dépend on si le outil retrieves actif contenu.
Constrained by the cutoff (parametric seulement)
- ChatGPT gratuit / browsing disabled — réponses solely depuis training données. OpenAI est explicit: “Quand Web recherche est disabled, ChatGPT et GPTs créé dans le workspace ne peut pas utiliser web recherche, même si a utilisateur demande ChatGPT à recherche.”
- Quelconque base model utilisé sans outils — Claude, Gemini, GPT utilisé via a raw API appel avec aucun retrieval.
Effectively bypass le cutoff (retrieval / grounding)
«- Google AI Overviews & AI Mode — these use RAG, which Google calls grounding, to pull from the live search index. The underlying Gemini model still has a parametric cutoff (Gemini 3 was January 2025; Gemini 3 is now legacy behind Gemini 3.5, verified 2026-07-19 — check the current model card for today’s figure), but grounding fetches current pages at query time, so users bypass it for most queries. Google literally tells developers to use the Search Grounding tool “for more recent information” beyond that cutoff. » (Traduction) (Résumé en français de la section quarante-trois, sous-partie un : le texte source est conservé pour vérification lors de la relecture francophone.) «- Perplexity — search-first by design; runs a real-time web search for nearly every query, so it treats cutoffs as largely irrelevant. » (Traduction) (Résumé en français de la section quarante-trois, sous-partie deux : le texte source est conservé pour vérification lors de la relecture francophone.) «- Microsoft Copilot — Bing-grounded by default. Microsoft’s framing: Copilot “can ground its answers with current information from the web, closing knowledge gaps that every large language model (LLM) inevitably has based on its training data cutoff.” » (Traduction) (Résumé en français de la section quarante-trois, sous-partie trois : le texte source est conservé pour vérification lors de la relecture francophone.) «- ChatGPT with search on (Plus/Team/Enterprise) — turns the request into search queries, retrieves via Bing, and answers from those results with links. » (Traduction) (Résumé en français de la section quarante-trois, sous-partie quatre : le texte source est conservé pour vérification lors de la relecture francophone.)
«### Parametric vs. retrieved knowledge behave differently » (Traduction) (Résumé en français de la section quarante-quatre, sous-partie un : le texte source est conservé pour vérification lors de la relecture francophone.)
Même quand retrieval est on, le deux knowledge sources ne pas feel le même — et Duane Forrester’s “dual-memory” framing captures il bien. Contenu baked dans le weights comes out fluent, rapide, et stated sans qualification — le model synthesizes depuis internalized knowledge. Post-cutoff contenu pulled depuis le web arrives avec hedging comme “selon rapports” or “sources indicate,” signaling différent epistemic weight. Retrieval aussi ne fait pas magically eliminate erreurs — quand sources conflict, grounded réponses peut encore hallucinate. Donc retrieval mitigates le cutoff; il ne fait pas erase le difference entre trained-dans et récupéré knowledge.
Ce que content is la plupart (and least) affected
Le cutoff bites hardest on n’importe quoi que changements rapide, et barely touches qu’est-ce que stable.
Highly affected (volatile): actuel pricing, produit specs, version numbers; entreprise noms, acquisitions, rebrands; regulatory et legal changements; actuel events, sports, elections; executive/personnel changements; fresh research et benchmarks; market données et statistics.
Minimally affected (stable): foundational concepts et definitions; historical facts; mathematical et scientific principles; programming fundamentals; geography.
Le dangerous partie pour brands: an AI model va donner vous a confident, fluent incorrect réponse à propos de a time-sensitive fact. Il ne fait pas hedge quand c’est fonctionnement depuis training données — il simplement states le stale version as fact. Si votre pricing, votre leadership, or votre produit lineup modifié après a model’s cutoff, que model est out là misrepresenting vous avec total certainty.
Ce que cela signifie pour le SEO and GEO
Je think à propos de ce as deux séparé jobs — et conflating les est où personnes go incorrect.
Track 1 — obtenir dans le training données (le long game)
À être embedded dans a model’s parametric memory, votre contenu a à exist avant le training cutoff, et être mentioned suffisant à laisser an impression. Le mechanism est mundane: LLMs sont suivant-word predictors. As j’ai put il dans notre Ahrefs research on AI Overviews, “si vous êtes mentioned plus dans le training données tel as pages web, vous êtes going à être mentioned plus dans le outputs de LLMs.” Donc ce track est à propos de brand presence et topical autorité construit up over temps — et à propos de letting le training robots d’exploration (GPTBot, ClaudeBot) dans. Training exécute se produire infrequently et unpredictably, donc contenu publié après a cutoff est invisible à que model jusqu’à le suivant exécuter, qui pourrait être a year-plus away.
Track 2 — stay retrievable et fresh (le near-term game)
Pour chaque retrieval-based outil, le cutoff est moot si vous êtes dans l’indexer. Ce est où freshness et indexation faire le fonctionner:
- Obtenir indexé dans Google et Bing. ChatGPT recherche et Copilot les deux retrieve depuis Bing — si vous êtes pas dans Bing’s indexer, vous êtes invisible à OpenAI’s et Microsoft’s retrieval. AI Overviews pull depuis Google’s indexer. Indexation est le prerequisite, complet arrêter.
- Mind le correct robots d’exploration. Training bots (GPTBot, ClaudeBot) et AI-recherche retrieval bots (OAI-SearchBot, PerplexityBot) sont séparé. Blocking GPTBot seulement garde vous out de training — OAI-SearchBot encore handles en temps réel retrieval. Vous pouvez autoriser un et bloquer le autre. (Complet breakdown dans AI robots d’exploration.)
- Signal freshness honestly. Précis
dateModified/datePublishedschema et truthful<lastmod>dans sitemaps aider time-sensitive contenu obtenir re-récupéré.
Le freshness nuance est worth holding sur. Notre 17-million-citation study à Ahrefs trouvé AI-cited contenu est 25,7% fresher que organique-cited contenu — mais le average age de cited contenu est encore 2,9 années. As mon colleagues put il, “comme traditional recherche, AI assistants encore préférer citing long-lived contenu.” Donc chase freshness pour volatile pages, mais ne pas mistake il pour a substitute pour durable, authoritative contenu. ChatGPT est le la plupart recency-biased plateforme (orders dans-texte citations newest-à-oldest); Google AI Overviews cite le oldest contenu, roughly matching organique.
The myths worth killing
«- “The cutoff is a hard wall.” It’s a fuzzy zone — accuracy fades toward it and effective cutoffs differ from stated ones. » (Traduction) (Résumé en français de la section soixante, sous-partie un : le texte source est conservé pour vérification lors de la relecture francophone.) «- “Stated cutoff = what the model actually knows.” Effective cutoffs often run earlier; recent-but-pre-cutoff content is underrepresented. » (Traduction) (Résumé en français de la section soixante, sous-partie deux : le texte source est conservé pour vérification lors de la relecture francophone.) «- “AI Overviews are limited by the same cutoff as ChatGPT’s base model.” No — they ground in Google’s live index and can surface pages published today. » (Traduction) (Résumé en français de la section soixante, sous-partie trois : le texte source est conservé pour vérification lors de la relecture francophone.) «- “Once ChatGPT can browse, the cutoff is irrelevant.” Browsing only fires for some queries; many answers still come from training data, and retrieved knowledge behaves differently from trained knowledge. » (Traduction) (Résumé en français de la section soixante, sous-partie quatre : le texte source est conservé pour vérification lors de la relecture francophone.) «- “My new content reaches ChatGPT’s training immediately.” No — only on the next training run, which may be a year-plus out. Retrieval is your near-term path. » (Traduction) (Résumé en français de la section soixante, sous-partie cinq : le texte source est conservé pour vérification lors de la relecture francophone.) «- “Blocking GPTBot hides me from AI search.” It only affects training inclusion; OAI-SearchBot still retrieves you in real time. » (Traduction) (Résumé en français de la section soixante, sous-partie six : le texte source est conservé pour vérification lors de la relecture francophone.) «- “Knowledge cutoff = release date.” It’s typically 6–12+ months earlier. » (Traduction) (Résumé en français de la section soixante, sous-partie sept : le texte source est conservé pour vérification lors de la relecture francophone.)
Ce page sits dans le comment recherche fonctionne cluster — voir LLM, RAG, grounding, et AI hallucinations pour le neighboring pieces.
AI summary
A condensed prendre on the Avancé version:
- Knowledge cutoff = le date training données collection stopped. “Training données cutoff” est le precise term; “knowledge cutoff” est shorthand. Il seulement limites a model’s parametric (trained-dans) knowledge.
- c’est pas le release date. Le gap est généralement 6–12+ months (GPT-5: ~10 months). A brand-new model peut être a année behind on le world. Les deux GPT-5 et Claude Opus 4,1 — le running exemples pour que lag — sont themselves maintenant deprecated, qui est le entier point: quelconque spécifique model/date pairing ici est a snapshot, pas a standing fact.
- Anthropic splits il dans deux: a fiable knowledge cutoff (où knowledge est densest) vs. a broader training données cutoff — le fiable date est a quelques months précédent.
- Le boundary est fuzzy, pas a wall. Effective cutoffs souvent differ depuis stated ones (CommonCrawl carries years-old Wikipedia); accuracy degrades gradually toward le date.
- Retrieval bypasses il. Google AI Overviews (grounding), Perplexity, Copilot, et ChatGPT-avec-recherche ground réponses dans a actif indexer. Base models sans recherche stay frozen à le cutoff.
- Parametric ≠ retrieved knowledge. Trained-dans facts come out fluent et unqualified; retrieved facts arrive hedged et peut encore hallucinate quand sources conflict.
- La plupart affected: prices, produits, personnel, events, regulations, stats. Le moins: definitions, history, math, geography. Models state stale facts avec complet confidence.
- SEO = deux jobs: obtenir embedded dans training données avant le cutoff (long game), et stay indexé dans Google et Bing plus fresh donc vous êtes retrieved actif (near-term). GPTBot (training) et OAI-SearchBot (retrieval) sont séparé.
Documentation officielle
Primary-source documentation depuis le model providers et moteur de recherches.
OpenAI
- ChatGPT Recherche pour Enterprise & EDU — comment ChatGPT turns une requête dans recherche requêtes et retrieves résultats.
- Web browsing paramètres on ChatGPT — ce que se produit quand web recherche est disabled (training données seulement).
- GPT-5 chat model API docs — le official model page avec le knowledge cutoff. Maintenant marked “Deprecated” par OpenAI (verified 2026-07-19), pointing à son actuel model lineup — kept as le source pour le historical cutoff date utilisé dans ce article’s exemples, pas a actuel-model recommendation.
Anthropic
- Models overview — le fiable-vs-training cutoff distinction (Footnote 2) et le per-model cutoff tableau. Verified actuel 2026-07-19; le tableau maintenant leads avec Claude Opus 4,8 et Claude Sonnet 5, avec Claude Opus 4,1 déplacé à le legacy section as deprecated.
- Transparency Hub — training données composition.
- AI Optimization Guide — grounding défini; comment AI fonctionnalités pull fresh, up-à-date pages.
- AI fonctionnalités et votre site web — indexation requirements et requête fan-out.
- Grounding avec Recherche Google (Gemini API) — grounding “beyond its knowledge cutoff.”
- Gemini 3 developer guide — le January 2025 cutoff et le Recherche Grounding outil. Encore actif mais maintenant carries a deprecation notice pointing à Gemini 3,5 (verified 2026-07-19).
Microsoft
- Microsoft 365 Copilot web recherche — grounding à fermer training-cutoff knowledge gaps.
- Understanding web recherche dans Copilot — le hockey-team exemple et le web-recherche-off fallback.
Référence
- Knowledge cutoff (Wikipedia) — definitional overview et a model cutoff tableau.
Quotes from the source
On-le-record statements depuis le model providers et moteur de recherches. Chaque lien est a deep lien à le page source.
Anthropic — the two-tier distinction
«- “Reliable knowledge cutoff indicates the date through which a model’s knowledge is most extensive and reliable. Training data cutoff is the broader date range of training data used.” — Anthropic Platform Docs, Models Overview (Footnote 2). Source » (Traduction) (Résumé en français de la section quatre-vingt-un, sous-partie un : le texte source est conservé pour vérification lors de la relecture francophone.)
Google — grounding bypasses le cutoff
- “[Grounding] permet Gemini à provide plus précis réponses et cite verifiable sources beyond son knowledge cutoff.” — Google AI pour Developers, Grounding avec Recherche Google. Jump à citation
- “Gemini 3 models ont a knowledge cutoff de January 2025… Pour plus recent information, utiliser le Recherche Grounding outil.” — Google AI pour Developers, Gemini 3 guide. Jump à citation
- “A technique (aussi known as grounding) utilisé à améliorer le qualité, accuracy, et freshness de AI réponses par relying on notre core Recherche classement systèmes à retrieve pertinent, up-à-date pages web.” — Recherche Google Central, AI Optimization Guide. Source
OpenAI — recherche on vs. off
- “Quand Web recherche est disabled, ChatGPT et GPTs created dans le workspace cannot utiliser web recherche, même si a utilisateur asks ChatGPT à recherche or manuellement selects recherche.” — OpenAI Aider Center. Source
Microsoft — closing le cutoff gap
«- “Copilot can ground its answers with current information from the web, closing knowledge gaps that every large language model (LLM) inevitably has based on its training data cutoff.” — Microsoft 365 Copilot Blog. Source » (Traduction) (Résumé en français de la section quatre-vingt-sept, sous-partie un : le texte source est conservé pour vérification lors de la relecture francophone.)
Perplexity — search-first by design
- “ChatGPT est an LLM-premier plateforme ce utilise Bing’s recherche API à gather web résultats, whereas Perplexity est a recherche-premier plateforme powered par [a] proprietary en temps réel web indexer.” — Perplexity, Enterprise vs. ChatGPT. Source
#:~:text= anchors peut pas toujours land on le highlighted passage. Le quoted wording était captured during research et devrait être confirmed contre le actif pages avant étant treated as final; model cutoff dates dans particulier modifier souvent — toujours vérifier le official model card pour le actuel figure. Knowledge cutoff — cheat sheet
Cutoff vs. release (they’re pas the même)
| Model | Knowledge cutoff | Lag to release |
|---|---|---|
| GPT-5 (original, now deprecated) | Sep 30, 2024 | ~10 months |
| Claude Opus 4,1 (now deprecated) | Mar 2025 | ~4 months |
| Gemini 2,5 Pro | — | ~3 months |
| Gemini 3 (now legacy behind Gemini 3,5) | Jan 2025 | — |
Anthropic’s fiable vs. training cutoff — actuel lineup (per le official models page, verified 2026-07-19)
| Model | Reliable cutoff | Training données cutoff |
|---|---|---|
| Claude Opus 4,8 | Jan 2026 | Jan 2026 |
| Claude Sonnet 5 | Jan 2026 | Jan 2026 |
| Claude Haiku 4,5 | Feb 2025 | Jul 2025 |
Legacy Claude models encore in the docs (deprecated or superseded by the row ci-dessus)
| Model | Reliable cutoff | Training données cutoff |
|---|---|---|
| Claude Opus 4,5 | May 2025 | Aug 2025 |
| Claude Sonnet 4,5 | Jan 2025 | Jul 2025 |
| Claude Opus 4,1 (deprecated, retiring Aug 5, 2026) | Jan 2025 | Mar 2025 |
Ces tables sont a snapshot verified contre le official model card on 2026-07-19 — pas a standing fact. Ce corpus a le shortest half-life on le site: chaque named model ci-dessus va eventually être superseded, some dans months. Toujours confirmer contre le actuel model card avant citing a spécifique date.
Fait the outil bypass the cutoff?
| Outil | Mode | Cutoff matters? |
|---|---|---|
| ChatGPT (free / browsing off) | Training seulement | Yes |
| ChatGPT (search on) | Bing retrieval | Mostly aucun |
| Google AI Overviews / AI Mode | Live-index grounding | Mostly aucun |
| Microsoft Copilot | Bing-grounded | Mostly aucun |
| Perplexity | Search-first | Largely aucun |
| Quelconque base model via raw API | Training seulement | Yes |
Rapide facts
- “Training data cutoff” = precise term; “knowledge cutoff” = shorthand. Même chose.
- Cutoff ≠ release date — gap est typically 6–12+ months.
- Le boundary est fuzzy: effective cutoffs differ depuis stated; accuracy fades toward le date.
- GPTBot (training) ≠ OAI-SearchBot (retrieval) — bloquer un sans le autre.
- Retrieval nécessite vous indexé dans Google et Bing.
The mental models
1. Textbook gone à press. A model’s parametric knowledge est a printed book. Une fois il ships, le printer ne peut pas ajouter a chapter — nouveau facts wait pour le suivant edition (training exécuter). Retrieval est le errata slip vous hand le lecteur à requête temps.
2. Deux memories — parametric vs. retrieved. Parametric knowledge (baked dans weights) comes out fluent et unqualified. Retrieved knowledge (récupéré actif) comes out hedged (“according to reports”) et peut encore être incorrect quand sources conflict. ne pas treat les as interchangeable — ils behave differently et échouer differently.
3. Cutoff ≠ release date. Données collection ends → cleaning, testing, alignment → ship. Le gap est 6–12+ months, donc “new model” jamais signifie “actuel knowledge.”
4. Le boundary est a gradient, pas a wall. Knowledge thins as vous approche le cutoff et effective cutoffs differ depuis stated ones. Treat le dernier quelques months avant quelconque cutoff as faible-confidence territory.
5. Deux-track visibility (le SEO décision règle).
- Training track (long game): publish authoritative contenu et earn brand mentions avant training exécute; autoriser GPTBot/ClaudeBot. Payoff: vous êtes dans le weights.
- Retrieval track (near-term): stay indexé dans Google + Bing et signal freshness; autoriser OAI-SearchBot/PerplexityBot. Payoff: vous êtes retrieved à requête temps, cutoff or pas.
Ces sont différent jobs. Demander de quelconque piece de contenu: est ce trying à obtenir dans le weights, or à obtenir retrieved? Optimize accordingly.
Knowledge-cutoff mistakes
Treating le model’s release date as son cutoff
A produit peut launch bien après le données utilisé pour son base training ends. Record le cutoff le provider documents, le model version, et si le réponse utilisé recherche au lieu de inferring freshness depuis a launch announcement.
Assuming recherche permanently mises à jour le model
Retrieval peut supply actuel context pour un réponse, mais il ne fait pas rewrite le model’s weights. Décrire le sortie as grounded dans retrieved material, pas as proof que le base model learned le nouveau fact.
Optimizing seulement pour training données
Training exposure est lent et opaque. Garder utile pages crawlable, indexé, actuel, et facile à retrieve donc actif AI recherche peut utiliser les maintenant.
Audit freshness claims in an AI réponse
Paste the réponse, model nom/version, requête date, and quelconque visible citations:
Separate statements that could come from the model's parametric knowledge from
statements that appear grounded in retrieved sources. Flag every time-sensitive
claim, the citation that supports it, and any claim that cannot be verified from the
supplied sources. Do not infer the model's knowledge cutoff; mark it unknown unless I
provide provider documentation.Plan content pour les deux discovery paths
Paste a topic, le existing page inventory, et connu freshness requirements:
Create a two-track content plan. Track 1 should improve current retrieval through
crawlability, indexability, clear passages, and explicit update ownership. Track 2
should build durable brand/entity evidence that may enter future training corpora.
Use only the supplied pages and facts, identify gaps, and label assumptions. Evaluate a supposedly current AI réponse
«- Record the exact model and product surface. » (Traduction) (Résumé en français de la section cent trente-trois, sous-partie un : le texte source est conservé pour vérification lors de la relecture francophone.) «- Record the query date and wording. » (Traduction) (Résumé en français de la section cent trente-trois, sous-partie deux : le texte source est conservé pour vérification lors de la relecture francophone.) «- Check whether browsing, search, connectors, or uploaded files were enabled. » (Traduction) (Résumé en français de la section cent trente-trois, sous-partie trois : le texte source est conservé pour vérification lors de la relecture francophone.) «- Capture every citation and the publication/update date it shows. » (Traduction) (Résumé en français de la section cent trente-trois, sous-partie quatre : le texte source est conservé pour vérification lors de la relecture francophone.) «- Separate retrieved evidence from uncited model claims. » (Traduction) (Résumé en français de la section cent trente-trois, sous-partie cinq : le texte source est conservé pour vérification lors de la relecture francophone.) «- Verify current claims against primary sources. » (Traduction) (Résumé en français de la section cent trente-trois, sous-partie six : le texte source est conservé pour vérification lors de la relecture francophone.) «- Do not substitute a release date for a documented cutoff. » (Traduction) (Résumé en français de la section cent trente-trois, sous-partie sept : le texte source est conservé pour vérification lors de la relecture francophone.) «- Re-run without retrieval only when you need to compare parametric knowledge. » (Traduction) (Résumé en français de la section cent trente-trois, sous-partie huit : le texte source est conservé pour vérification lors de la relecture francophone.)
«## Keep content available beyond the cutoff » (Traduction) (Résumé en français de la section cent trente-quatre, sous-partie un : le texte source est conservé pour vérification lors de la relecture francophone.)
«- Maintain crawlable, indexable canonical pages. » (Traduction) (Résumé en français de la section cent trente-cinq, sous-partie un : le texte source est conservé pour vérification lors de la relecture francophone.) «- Update facts whose accuracy changes over time. » (Traduction) (Résumé en français de la section cent trente-cinq, sous-partie deux : le texte source est conservé pour vérification lors de la relecture francophone.) «- Write self-contained passages that make retrieval context clear. » (Traduction) (Résumé en français de la section cent trente-cinq, sous-partie trois : le texte source est conservé pour vérification lors de la relecture francophone.) «- Preserve stable brand, author, product, and entity naming. » (Traduction) (Résumé en français de la section cent trente-cinq, sous-partie quatre : le texte source est conservé pour vérification lors de la relecture francophone.)
Testez vos connaissances: Knowledge cutoffs
Ressources utiles
Mon connexe writing & research (Ahrefs)
- Insights Depuis 55,8M AI Overviews À travers 590M Searches — où le “mentioned more in training data → mentioned more in outputs” point comes depuis.
- ChatGPT A 12% de Google’s Recherche Volume mais Google Sends 190x Plus Trafic — AI recherche as a distinct model depuis traditional recherche.
- Ce que Nous En réalité Know À propos de Optimizing pour LLM Recherche — freshness, GPTBot bloquer rates, et comment LLMs lire pages.
- Nouveau Study: AI Assistants Préférer à Cite ‘Fresher’ Contenu (17M Citations) — le freshness données cited ci-dessus.
My speaking
- GEO? AEO? LLMO? — Ahrefs Evolve 2025 — my walkthrough of LLM inputs: training données, retrieved pages (RAG), temperature, probabilities.
Depuis others
- Duane Forrester, Quand le Training Données Cutoff Becomes a Facteur de classement — le dual-memory framework et “cutoff-aware content calendaring.”
- Dated Données: Tracing Knowledge Cutoffs dans LLMs — pourquoi effective cutoffs differ depuis stated ones.
- Peut Prompts Rewind Temps pour LLMs? — pourquoi vous pouvez’t reliably prompt a model dans forgetting post-cutoff facts.
- Conductor, AI knowledge cutoff: Ce que est il et pourquoi fait il matter? — practitioner citations on base-model staleness vs. RAG.
- A Study dans Investigating Temporal Robustness de LLMs — benchmarks showing comment knowledge accuracy degrades gradually as requêtes approche le cutoff, pas suddenly.
- iPullRank, Comment Retrieval-Augmented Generation est Redefining SEO — RAG as le bridge entre training cutoffs et actif requête réponses.
- Knowledge cutoff (Wikipedia) — definitional overview et a community-maintained model cutoff date tableau.
- Otterly.ai, LLM Knowledge Cutoff Dates — comparaison tableau de major models, leur cutoffs, et si chaque a en temps réel web accès.
Stats worth citing
- AI-cited contenu est 25,7% fresher que organique-cited contenu — mais son average age est encore 2,9 années (1 064 days), vs. 3,9 années pour organique. Freshness matters pour AI, mais longevity encore wins. (Ahrefs, 17M-citation study.) Source
- GPT-5’s knowledge cutoff (Sep 30, 2024) était ~10 months avant release — le clearest illustration que cutoff ≠ release date. Claude Opus 4,1 ran ~4 months, Gemini 2,5 Pro ~3 months. (Les deux GPT-5 Chat et Claude Opus 4,1 sont themselves maintenant marked deprecated on leur providers’ propre model pages — verified 2026-07-19 — qui est son propre illustration de comment rapide ce liste turns over.) Source
- Effective cutoffs peut exécuter 3–4 années précédent que stated pour some model families — un corpus avait >80% de Wikipedia docs depuis pre-2023 versions despite a 2023 dump. Le cutoff est fuzzy, pas a wall. (Dated Données paper.) Source
- Prompt-based forgetting fails ~81% de le temps pour causally-related knowledge (vs. ~82% success pour directement-queried facts) — vous pouvez’t reliably faire a model “rewind” past son cutoff. (Peut Prompts Rewind Temps paper.) Source
- Gemini 3’s parametric cutoff est January 2025, yet AI Overviews surface même-day pages — parce que grounding pulls depuis le actif indexer, pas le weights. Gemini 3 itself est maintenant legacy behind Gemini 3,5 (verified 2026-07-19); Google’s propre model pages ne pas publish a cutoff date pour 3,5 as de ce vérifier, qui est le norm, pas le exception — providers ne pas toujours restate a cutoff on chaque release. Source
Journal des modifications
Mis à jour le 19 juil. 2026.
Résumé éditorial et détails enregistrés des changements.Détails des changements
-
Les notes détaillées des changements sont actuellement disponibles en anglais.
-
Les notes détaillées des changements sont actuellement disponibles en anglais.
-
Les notes détaillées des changements sont actuellement disponibles en anglais.
Comparaison complète indisponible — aucun instantané antérieur n’a été archivé pour cette révision.