Guide : Knowledge Cutoff

Ce que a knowledge cutoff (training données cutoff) est, pourquoi il n’est pas le model's release date, qui AI outils bypass il avec retrieval, et Ce que cela signifie pour le SEO.

Première publication : 24 juin 2026 · Dernière mise à jour : 3 août 2026 · Avancé

A knowledge cutoff est le date après qui an LLM stopped étant trained on nouveau données — pas le date il était released (ceux differ par months, souvent 6–12+). Il seulement limites a model's trained-dans, parametric knowledge. Outils que utiliser retrieval (Google AI Overviews, Bing Copilot, Perplexity, ChatGPT avec recherche) ground réponses dans a actif indexer et effectively bypass le cutoff, pendant que base models sans recherche stay frozen à leur cutoff. Pour le SEO que signifie deux séparé jobs: obtenir embedded dans training données pour le long game, et stay indexé et fresh donc vous êtes retrieved à requête temps.

TL;DR — A knowledge cutoff est le date training données collection stopped — pas le release date (le gap est généralement 6–12+ months). Il seulement constrains a model’s parametric (trained-dans) knowledge. Retrieval-augmented systèmes — Google AI Overviews, Bing Copilot, Perplexity, ChatGPT avec recherche — ground réponses dans a actif indexer et effectively bypass il; base models sans recherche stay frozen. Le boundary est fuzzy, pas a wall: effective cutoffs souvent differ depuis stated ones et accuracy degrades as vous approche le date. Pour le SEO ce splits dans deux séparé jobs — obtenir embedded dans training données (long game), et stay indexé + fresh donc vous êtes retrieved à requête temps (near-term).

Ce que a knowledge cutoff en réalité is

Cutoffs sont model- et version-spécifique et peut modifier quand providers mettre à jour models. Preuve à l’appui de cette affirmation Model documentation can specify a knowledge-cutoff date for a particular model or snapshot. Portée : OpenAI model metadata; the date is model- and version-specific and may change with releases. Niveau de confiance : élevé · Vérifié : OpenAI: Models Jamais infer actuel produit freshness solely depuis a remembered cutoff date. Preuve à l’appui de cette affirmation A product can supplement model knowledge with current web search and cited web sources. Portée : ChatGPT search product behavior; browsing or retrieval is separate from the model's training cutoff and is not guaranteed for every answer. Niveau de confiance : élevé · Vérifié : OpenAI: ChatGPT search

A knowledge cutoff est le date après qui a model était ne … plus trained on nouveau données. Le model a aucun awareness de n’importe quoi que happened plus tard — pas parce que c’est withholding il, mais parce que il était jamais exposed à il. Son knowledge sits frozen dans son weights à que point unless le système bolts on actif retrieval.

Le precise term est training données cutoff — le date données collection stopped. “Knowledge cutoff” est le courant shorthand, et le deux sont utilisé interchangeably. Le mental model Je comme: c’est a textbook c’est gone à press. Une fois le book ships, le printer ne peut pas ajouter a nouveau chapter — vous’d ont à print a entier nouveau edition. A model est le même. Nouveau facts seulement obtenir dans on le suivant training exécuter.

Ce est purely a limite on parametric knowledge — le stuff baked dans le weights. Il fait pas signifier le model ne peut pas handle post-cutoff events à tout. Hand il le information dans context — via a RAG pipeline or a système prompt — et an LLM peut raison à propos de events il était jamais trained on perfectly bien. Le cutoff limites ce que le model knows on son propre, pas ce que il peut fonctionner avec quand vous donner il sources.

Le cutoff freezes parametric knowledge; retrieval peut ajouter actuel evidence sans modification le model's weights. Source : /ai-search/how-search-works/knowledge-cutoff/

A actuel question peut suivre deux paths. On le weights-seulement chemin, le model relies on knowledge frozen à le training cutoff. On le grounded chemin, le système retrieves actuel sources et places les dans le model's context. Retrieval supplies evidence à requête temps; il ne fait pas mettre à jour or retrain le model weights.

© Patrick Stox LLC · CC BY 4.0 ·

Anthropic’s deux-tier distinction: fiable vs. training cutoff

Anthropic est le la plupart explicit de le major labs ici, et le distinction est worth borrowing. Ils séparé deux dates: a fiable knowledge cutoff (“indicates le date via qui a model’s knowledge est la plupart extensive et fiable”) et a broader training données cutoff (“le broader date range de training données utilisé”). Le fiable date est typically a quelques months précédent que le training date.

Pourquoi le gap? Le latest contenu dans le corpus est sparse — le internet hasn’t finished writing à propos de very recent events yet. Donc a model’s practical knowledge de le weeks correct avant son training cutoff est thin, même though que données est technically “dans là.” Le fiable cutoff est où le model est genuinely informative. Garder que dans mind quelconque temps vous voir a unique confident cutoff date: le utile boundary est généralement précédent que le stated un.

Knowledge cutoff n’est pas the model’s release date

Ce est le unique la plupart courant misconception, et c’est an facile un. Le cutoff est quand données collection ended. Le release date est quand le model ships. Entre le deux sits données cleaning, safety testing, evaluation, et alignment fonctionner — donc le gap est typically 6–12+ months:

ModelKnowledge cutoffLag to release
GPT-5 (original, deprecated)Sep 30, 2024~10 months
Claude Opus 4,1 (deprecated)Mar 2025~4 months
Gemini 2,5 Pro~3 months

(Lag figures via a widely-cited Hacker News thread — cross-vérifier contre official model cards, since ces obtenir repeated loosely. As de ce mettre à jour, OpenAI’s propre model page marks GPT-5 Chat “Deprecated” et points à son actuel model lineup, et Anthropic a retired Claude Opus 4,1 dans favor de newer Opus/Sonnet releases — kept ici as history since les deux sont encore worth recognizing si vous voir les cited elsewhere, pas as actuel picks.)

Le practical fallout: a model que “just came out” est pas actuel. A brand-new model peut encore être a année behind on le world. Utilisateurs assume freshly-released signifie freshly-informed; il ne fait pas. Et le tableau ci-dessus rend le point meilleur que quelconque explanation pourrait: les deux de son “actuel” exemple models étaient superseded dans le quelques months since ce article était premier drafted. Que churn est le raison ce page leans on comment cutoffs fonctionner plutôt que on quelconque unique date — treat chaque dated tableau vous lire ici (et everywhere sinon) as a snapshot, pas a standing fact.

The boundary is fuzzy, pas a wall

Personnes picture the cutoff as a hard line — perfect knowledge up to date X, total blankness après. The research dit sinon.

Le “Dated Data: Tracing Knowledge Cutoffs in Large Language Models” paper trouvé que effective cutoffs souvent differ depuis stated ones, parfois dramatically. Models trained on CommonCrawl carry Wikipedia versions depuis 2016–2019 même quand le dump est dated 2023; un corpus avait “over 80% de Wikipedia documents depuis précédent versions (pre-2023)” despite notamment a 2023 dump. Pour some model families le effective cutoff ran 3–4 années précédent que le reported date, thanks à deduplication échecs letting old contenu propagate.

Il cuts le autre façon à le boundary aussi: accuracy degrades gradually as requêtes approche le cutoff plutôt que snapping off à il — il y a simplement moins training signal à propos de very recent events. Et a séparé line de fonctionner (“Peut Prompts Rewind Temps pour LLMs?”) trouvé vous pouvez’t reliably prompt a model dans forgetting post-cutoff knowledge soit: directement-queried facts unlearn ~82% de le temps, mais causally-related knowledge leaks via ~81% de le temps. Le takeaway: treat le cutoff as a fuzzy zone, pas a clean line, dans les deux directions.

Qui outils are constrained vs. qui bypass the cutoff

Ce est le partie que en réalité changements votre SEO stratégie. Si le cutoff matters à tout dépend on si le outil retrieves actif contenu.

Constrained by the cutoff (parametric seulement)

  • ChatGPT gratuit / browsing disabled — réponses solely depuis training données. OpenAI est explicit: “Quand Web recherche est disabled, ChatGPT et GPTs créé dans le workspace ne peut pas utiliser web recherche, même si a utilisateur demande ChatGPT à recherche.”
  • Quelconque base model utilisé sans outils — Claude, Gemini, GPT utilisé via a raw API appel avec aucun retrieval.

Effectively bypass le cutoff (retrieval / grounding)

«- Google AI Overviews & AI Mode — these use RAG, which Google calls grounding, to pull from the live search index. The underlying Gemini model still has a parametric cutoff (Gemini 3 was January 2025; Gemini 3 is now legacy behind Gemini 3.5, verified 2026-07-19 — check the current model card for today’s figure), but grounding fetches current pages at query time, so users bypass it for most queries. Google literally tells developers to use the Search Grounding tool “for more recent information” beyond that cutoff. » (Traduction) (Résumé en français de la section quarante-trois, sous-partie un : le texte source est conservé pour vérification lors de la relecture francophone.) «- Perplexity — search-first by design; runs a real-time web search for nearly every query, so it treats cutoffs as largely irrelevant. » (Traduction) (Résumé en français de la section quarante-trois, sous-partie deux : le texte source est conservé pour vérification lors de la relecture francophone.) «- Microsoft Copilot — Bing-grounded by default. Microsoft’s framing: Copilot “can ground its answers with current information from the web, closing knowledge gaps that every large language model (LLM) inevitably has based on its training data cutoff.” » (Traduction) (Résumé en français de la section quarante-trois, sous-partie trois : le texte source est conservé pour vérification lors de la relecture francophone.) «- ChatGPT with search on (Plus/Team/Enterprise) — turns the request into search queries, retrieves via Bing, and answers from those results with links. » (Traduction) (Résumé en français de la section quarante-trois, sous-partie quatre : le texte source est conservé pour vérification lors de la relecture francophone.)

«### Parametric vs. retrieved knowledge behave differently » (Traduction) (Résumé en français de la section quarante-quatre, sous-partie un : le texte source est conservé pour vérification lors de la relecture francophone.)

Même quand retrieval est on, le deux knowledge sources ne pas feel le même — et Duane Forrester’s “dual-memory” framing captures il bien. Contenu baked dans le weights comes out fluent, rapide, et stated sans qualification — le model synthesizes depuis internalized knowledge. Post-cutoff contenu pulled depuis le web arrives avec hedging comme “selon rapports” or “sources indicate,” signaling différent epistemic weight. Retrieval aussi ne fait pas magically eliminate erreurs — quand sources conflict, grounded réponses peut encore hallucinate. Donc retrieval mitigates le cutoff; il ne fait pas erase le difference entre trained-dans et récupéré knowledge.

Ce que content is la plupart (and least) affected

Le cutoff bites hardest on n’importe quoi que changements rapide, et barely touches qu’est-ce que stable.

Highly affected (volatile): actuel pricing, produit specs, version numbers; entreprise noms, acquisitions, rebrands; regulatory et legal changements; actuel events, sports, elections; executive/personnel changements; fresh research et benchmarks; market données et statistics.

Minimally affected (stable): foundational concepts et definitions; historical facts; mathematical et scientific principles; programming fundamentals; geography.

Le dangerous partie pour brands: an AI model va donner vous a confident, fluent incorrect réponse à propos de a time-sensitive fact. Il ne fait pas hedge quand c’est fonctionnement depuis training données — il simplement states le stale version as fact. Si votre pricing, votre leadership, or votre produit lineup modifié après a model’s cutoff, que model est out là misrepresenting vous avec total certainty.

Ce que cela signifie pour le SEO and GEO

Je think à propos de ce as deux séparé jobs — et conflating les est où personnes go incorrect.

Track 1 — obtenir dans le training données (le long game)

À être embedded dans a model’s parametric memory, votre contenu a à exist avant le training cutoff, et être mentioned suffisant à laisser an impression. Le mechanism est mundane: LLMs sont suivant-word predictors. As j’ai put il dans notre Ahrefs research on AI Overviews, “si vous êtes mentioned plus dans le training données tel as pages web, vous êtes going à être mentioned plus dans le outputs de LLMs.” Donc ce track est à propos de brand presence et topical autorité construit up over temps — et à propos de letting le training robots d’exploration (GPTBot, ClaudeBot) dans. Training exécute se produire infrequently et unpredictably, donc contenu publié après a cutoff est invisible à que model jusqu’à le suivant exécuter, qui pourrait être a year-plus away.

Track 2 — stay retrievable et fresh (le near-term game)

Pour chaque retrieval-based outil, le cutoff est moot si vous êtes dans l’indexer. Ce est où freshness et indexation faire le fonctionner:

  • Obtenir indexé dans Google et Bing. ChatGPT recherche et Copilot les deux retrieve depuis Bing — si vous êtes pas dans Bing’s indexer, vous êtes invisible à OpenAI’s et Microsoft’s retrieval. AI Overviews pull depuis Google’s indexer. Indexation est le prerequisite, complet arrêter.
  • Mind le correct robots d’exploration. Training bots (GPTBot, ClaudeBot) et AI-recherche retrieval bots (OAI-SearchBot, PerplexityBot) sont séparé. Blocking GPTBot seulement garde vous out de training — OAI-SearchBot encore handles en temps réel retrieval. Vous pouvez autoriser un et bloquer le autre. (Complet breakdown dans AI robots d’exploration.)
  • Signal freshness honestly. Précis dateModified/datePublished schema et truthful <lastmod> dans sitemaps aider time-sensitive contenu obtenir re-récupéré.

Le freshness nuance est worth holding sur. Notre 17-million-citation study à Ahrefs trouvé AI-cited contenu est 25,7% fresher que organique-cited contenu — mais le average age de cited contenu est encore 2,9 années. As mon colleagues put il, “comme traditional recherche, AI assistants encore préférer citing long-lived contenu.” Donc chase freshness pour volatile pages, mais ne pas mistake il pour a substitute pour durable, authoritative contenu. ChatGPT est le la plupart recency-biased plateforme (orders dans-texte citations newest-à-oldest); Google AI Overviews cite le oldest contenu, roughly matching organique.

The myths worth killing

«- “The cutoff is a hard wall.” It’s a fuzzy zone — accuracy fades toward it and effective cutoffs differ from stated ones. » (Traduction) (Résumé en français de la section soixante, sous-partie un : le texte source est conservé pour vérification lors de la relecture francophone.) «- “Stated cutoff = what the model actually knows.” Effective cutoffs often run earlier; recent-but-pre-cutoff content is underrepresented. » (Traduction) (Résumé en français de la section soixante, sous-partie deux : le texte source est conservé pour vérification lors de la relecture francophone.) «- “AI Overviews are limited by the same cutoff as ChatGPT’s base model.” No — they ground in Google’s live index and can surface pages published today. » (Traduction) (Résumé en français de la section soixante, sous-partie trois : le texte source est conservé pour vérification lors de la relecture francophone.) «- “Once ChatGPT can browse, the cutoff is irrelevant.” Browsing only fires for some queries; many answers still come from training data, and retrieved knowledge behaves differently from trained knowledge. » (Traduction) (Résumé en français de la section soixante, sous-partie quatre : le texte source est conservé pour vérification lors de la relecture francophone.) «- “My new content reaches ChatGPT’s training immediately.” No — only on the next training run, which may be a year-plus out. Retrieval is your near-term path. » (Traduction) (Résumé en français de la section soixante, sous-partie cinq : le texte source est conservé pour vérification lors de la relecture francophone.) «- “Blocking GPTBot hides me from AI search.” It only affects training inclusion; OAI-SearchBot still retrieves you in real time. » (Traduction) (Résumé en français de la section soixante, sous-partie six : le texte source est conservé pour vérification lors de la relecture francophone.) «- “Knowledge cutoff = release date.” It’s typically 6–12+ months earlier. » (Traduction) (Résumé en français de la section soixante, sous-partie sept : le texte source est conservé pour vérification lors de la relecture francophone.)

Ce page sits dans le comment recherche fonctionne cluster — voir LLM, RAG, grounding, et AI hallucinations pour le neighboring pieces.

Ajouter une note d’expert

Épingler une citation d’expert

Nouvelle personne ? Créez son profil non revendiqué à /admin/experts/ → Épingler une citation d’expert d’abord.