Wissensstand (Knowledge Cutoff)
Was ein Knowledge Cutoff (Trainingsdaten-Cutoff) ist, warum er nicht das Veröffentlichungsdatum des Modells ist, welche KI-Tools ihn durch Retrieval umgehen und was das für SEO bedeutet.
Sprachen
Ein Knowledge Cutoff ist das Datum, nach dem ein LLM nicht mehr mit neuen Daten trainiert wurde – nicht das Datum seiner Veröffentlichung (diese unterscheiden sich um Monate, oft 6–12+). Er begrenzt nur das trainierte, parametrische Wissen des Modells. Tools, die Retrieval nutzen (Google AI Overviews, Bing Copilot, Perplexity, ChatGPT mit Suche), stützen Antworten auf einen Live-Index und umgehen den Cutoff effektiv, während Basismodelle ohne Suche bei ihrem Cutoff eingefroren bleiben. Für SEO bedeutet das zwei getrennte Aufgaben: in Trainingsdaten eingebettet werden für das langfristige Spiel, und indexiert und aktuell bleiben, damit man zur Abfragezeit abgerufen wird.
TL;DR — Ein Wissens-Cutoff ist das Datum, an dem ein KI-Modell aufgehört hat zu lernen. Fragen Sie das Basismodell von ChatGPT nach etwas, das nach seinem Cutoff passiert ist, und es wird es einfach nicht wissen – es wurde nie darauf trainiert. Aber viele KI-Tools (Google AI Overviews, Perplexity, Copilot, ChatGPT mit aktivierter Suche) können Dinge live nachschlagen, was sie für die meisten Fragen um den Cutoff herumführt.
Was ein Wissens-Cutoff ist
Ein Modell-Wissens-Cutoff beschreibt die Grenze des Trainingswissens, die für eine Modellversion offengelegt wird; es ist nicht unbedingt die Grenze eines Produkts, das browsen oder abrufen kann. Evidence for this claim Model documentation can specify a knowledge-cutoff date for a particular model or snapshot. Scope: OpenAI model metadata; the date is model- and version-specific and may change with releases. Confidence: high · Verified: OpenAI: Models Produkttools können zur Antwortzeit auf neuere Informationen zugreifen, abhängig von Verfügbarkeit und Quellenqualität. Evidence for this claim A product can supplement model knowledge with current web search and cited web sources. Scope: ChatGPT search product behavior; browsing or retrieval is separate from the model's training cutoff and is not guaranteed for every answer. Confidence: high · Verified: OpenAI: ChatGPT search
Große Sprachmodelle – die Technologie hinter ChatGPT, Claude, Gemini – lernen, indem sie einen enormen Haufen Text lesen. Irgendwann hört dieses Lesen auf, damit das Modell gebaut und getestet werden kann. Das Datum, an dem das Lesen aufhörte, ist der Wissens-Cutoff (Sie sehen auch die Begriffe Trainings-Cutoff oder Trainingsdaten-Cutoff – dasselbe).
Nach diesem Datum weiß das Modell nichts. Nicht, weil es etwas versteckt – es hat es einfach nie gesehen. Eine der besseren Erklärungen, die ich gefunden habe, vergleicht es mit einem Praktikanten: Der Wissens-Cutoff ist das Datum, an dem Ihr KI-Praktikant zuletzt zur Schule ging. Alles bis zu diesem Tag hat er gut gelernt; alles danach weiß er nicht.
Warum ChatGPT manchmal veraltete Antworten gibt
Angenommen, ein Unternehmen hat letzten Monat umbenannt oder Ihr Produkt hat seine Preise geändert. Wenn Sie ein KI-Modell fragen, das nur auf seinem Training basiert, wird es Ihnen selbstbewusst die alte Antwort geben – und dabei völlig sicher klingen. Das ist der Cutoff bei der Arbeit.
Die Lösung, die KI-Unternehmen verwenden, ist das Modell das Web durchsuchen zu lassen. Statt aus dem Gedächtnis zu antworten, führt das Tool eine Live-Suche durch, liest die Ergebnisse und schreibt eine Antwort daraus. Wenn die Suche aktiviert ist, hört der Cutoff auf, für diese Frage eine Rolle zu spielen.
Welche Tools Dinge nachschlagen vs. welche nicht
- Dinge nachschlagen (Cutoff spielt meist keine Rolle): Google AI Overviews, Perplexity, Microsoft Copilot und ChatGPT, wenn die Websuche aktiviert ist. Diese greifen auf einen Live-Suchindex zu.
- Aus dem Gedächtnis antworten (Cutoff spielt eine große Rolle): Das kostenlose/Basismodell von ChatGPT ohne Browsen oder jedes Modell ohne Webzugriff. Diese kennen nur bis zu ihrem Cutoff.
Warum das wichtig ist, wenn Sie eine Website betreiben
Es gibt wirklich zwei Möglichkeiten, wie Ihr Unternehmen in KI-Antworten auftaucht:
- Im Gedächtnis des Modells. Ihr Inhalt muss vor dem Trainings-Cutoff eines Modells veröffentlicht worden sein, um eingebacken zu werden – und der nächste Trainingslauf könnte ein Jahr oder mehr entfernt sein.
- Durch Live-Suche. Wenn das KI-Tool Dinge nachschlägt, können Sie am selben Tag auftauchen, an dem Sie veröffentlichen – solange Sie in Google und Bing indexiert sind.
Sie wollen also beides: eine Marke sein, die bekannt genug ist, um in den Trainingsdaten zu sein, und leicht zu finden und frisch genug bleiben, um live hereingezogen zu werden. Der Advanced-Tab geht auf die Daten, die unscharfen Ränder und den eigentlichen SEO-Playbook ein.
TL;DR — Ein Wissens-Cutoff ist das Datum, an dem die Sammlung von Trainingsdaten aufhörte – nicht das Veröffentlichungsdatum (die Lücke beträgt normalerweise 6–12+ Monate). Es beschränkt nur das parametrische (trainierte) Wissen eines Modells. Retrieval-augmentierte Systeme – Google AI Overviews, Bing Copilot, Perplexity, ChatGPT mit Suche – verankern Antworten in einem Live-Index und umgehen ihn effektiv; Basismodelle ohne Suche bleiben eingefroren. Die Grenze ist unscharf, keine Wand: Effektive Cutoffs weichen oft von den angegebenen ab und die Genauigkeit nimmt ab, je näher man dem Datum kommt. Für SEO teilt sich das in zwei separate Aufgaben – in Trainingsdaten eingebettet werden (langfristiges Spiel) und indexiert + frisch bleiben, damit Sie zur Abfragezeit abgerufen werden (kurzfristig).
Was ein Wissens-Cutoff tatsächlich ist
Cutoffs sind modell- und versionsspezifisch und können sich ändern, wenn Anbieter Modelle aktualisieren. Evidence for this claim Model documentation can specify a knowledge-cutoff date for a particular model or snapshot. Scope: OpenAI model metadata; the date is model- and version-specific and may change with releases. Confidence: high · Verified: OpenAI: Models Leiten Sie die aktuelle Produktfrische niemals nur aus einem erinnerten Cutoff-Datum ab. Evidence for this claim A product can supplement model knowledge with current web search and cited web sources. Scope: ChatGPT search product behavior; browsing or retrieval is separate from the model's training cutoff and is not guaranteed for every answer. Confidence: high · Verified: OpenAI: ChatGPT search
Ein Wissens-Cutoff ist das Datum, nach dem ein Modell nicht mehr mit neuen Daten trainiert wurde. Das Modell hat keinerlei Kenntnis von Ereignissen, die später stattgefunden haben – nicht weil es sie zurückhält, sondern weil es ihnen nie ausgesetzt war. Sein Wissen bleibt zu diesem Zeitpunkt in seinen Gewichten eingefroren, es sei denn, das System ergänzt eine Live-Abfrage.
Der präzise Begriff ist Trainingsdaten-Cutoff – das Datum, an dem die Datenerfassung endete. „Knowledge cutoff“ ist die gängige Kurzform, und beide werden synonym verwendet. Das mentale Modell, das ich mag: Es ist wie ein Lehrbuch, das in den Druck gegangen ist. Sobald das Buch veröffentlicht ist, kann der Drucker kein neues Kapitel hinzufügen – man müsste eine komplett neue Ausgabe drucken. Ein Modell ist genauso. Neue Fakten kommen erst beim nächsten Trainingslauf hinein.
Dies ist rein eine Grenze des parametrischen Wissens – der Dinge, die in den Gewichten verankert sind. Es bedeutet nicht, dass das Modell Ereignisse nach dem Cutoff überhaupt nicht verarbeiten kann. Wenn man ihm die Informationen im Kontext gibt – über eine RAG-Pipeline oder einen System-Prompt – kann ein LLM auch über Ereignisse, mit denen es nie trainiert wurde, problemlos reasoning betreiben. Der Cutoff begrenzt, was das Modell von sich aus weiß, nicht, womit es arbeiten kann, wenn man ihm Quellen gibt.
A current question can follow two paths. On the weights-only path, the model relies on knowledge frozen at the training cutoff. On the grounded path, the system retrieves current sources and places them in the model's context. Retrieval supplies evidence at query time; it does not update or retrain the model weights.
© Patrick Stox LLC · CC BY 4.0 ·
Anthropics zweistufige Unterscheidung: zuverlässiger vs. Trainings-Cutoff
Anthropic ist hier das expliziteste der großen Labore, und die Unterscheidung ist es wert, übernommen zu werden. Sie trennen zwei Daten: einen zuverlässigen Wissens-Cutoff („gibt das Datum an, bis zu dem das Wissen eines Modells am umfangreichsten und zuverlässigsten ist“) und einen breiteren Trainingsdaten-Cutoff („den breiteren Datumsbereich der verwendeten Trainingsdaten“). Das zuverlässige Datum liegt in der Regel einige Monate vor dem Trainingsdatum.
Warum die Lücke? Der neueste Inhalt im Korpus ist spärlich – das Internet hat noch nicht fertig über sehr aktuelle Ereignisse geschrieben. Daher ist das praktische Wissen eines Modells über die Wochen direkt vor seinem Trainings-Cutoff dünn, auch wenn diese Daten technisch „drin“ sind. Der zuverlässige Cutoff ist der Punkt, an dem das Modell wirklich informativ ist. Behalten Sie das im Hinterkopf, wenn Sie ein einzelnes, selbstbewusst angegebenes Cutoff-Datum sehen: Die nützliche Grenze liegt normalerweise früher als das angegebene Datum.
Knowledge Cutoff ist nicht das Veröffentlichungsdatum des Modells
Das ist das häufigste Missverständnis überhaupt, und es ist ein leichtes. Der Cutoff ist, wann die Datenerfassung endete. Das Veröffentlichungsdatum ist, wann das Modell ausgeliefert wird. Dazwischen liegen Datenbereinigung, Sicherheitstests, Evaluierung und Alignment-Arbeit – daher beträgt die Lücke typischerweise 6–12+ Monate:
| Modell | Knowledge Cutoff | Verzögerung bis zur Veröffentlichung |
|---|---|---|
| GPT-5 (Original, veraltet) | 30. September 2024 | ~10 Monate |
| Claude Opus 4,1 (veraltet) | März 2025 | ~4 Monate |
| Gemini 2,5 Pro | — | ~3 Monate |
(Verzögerungszahlen laut einem vielzitierten Hacker-News-Thread – bitte mit offiziellen Modellkarten gegenprüfen, da diese locker wiederholt werden. Zum Zeitpunkt dieses Updates markiert OpenAIs eigene Modellseite GPT-5 Chat als „Deprecated“ und verweist auf die aktuelle Modellreihe, und Anthropic hat Claude Opus 4,1 zugunsten neuerer Opus/Sonnet-Versionen zurückgezogen – hier als Geschichte behalten, damit beide Angaben erkennbar bleiben, wenn sie Ihnen anderswo begegnen, nicht als aktuelle Empfehlungen.)
Die praktische Konsequenz: Ein Modell, das „gerade erst herausgekommen“ ist, ist nicht aktuell. Ein brandneues Modell kann immer noch ein Jahr hinter der Welt zurück sein. Nutzer nehmen an, dass frisch veröffentlicht auch frisch informiert bedeutet; das tut es nicht. Und die obige Tabelle macht den Punkt besser als jede Erklärung: Beide „aktuellen“ Beispielmodelle wurden in den wenigen Monaten seit der ersten Erstellung dieses Artikels bereits überholt. Diese Fluktuation ist der Grund, warum diese Seite sich darauf stützt, wie Cutoffs funktionieren, statt auf ein einzelnes Datum – behandeln Sie jede datierte Tabelle, die Sie hier (und anderswo) lesen, als Momentaufnahme, nicht als dauerhafte Tatsache.
Die Grenze ist unscharf, keine Wand
Menschen stellen sich den Cutoff als harte Linie vor – perfektes Wissen bis Datum X, völlige Leere danach. Die Forschung sagt etwas anderes.
Die Studie „Datierte Daten: Wissensgrenzen in großen Sprachmodellen nachverfolgen“ fand heraus, dass effektive Cutoffs oft von den angegebenen abweichen, manchmal drastisch. Modelle, die auf CommonCrawl trainiert wurden, tragen Wikipedia-Versionen aus 2016–2019, selbst wenn der Dump auf 2023 datiert ist; ein Korpus hatte “über 80 % der Wikipedia-Dokumente aus früheren Versionen (vor 2023)”, obwohl ein 2023er-Dump enthalten war. Bei einigen Modellfamilien lag der effektive Cutoff 3–4 Jahre früher als das angegebene Datum, aufgrund von Deduplizierungsfehlern, die alte Inhalte propagieren ließen.
Es wirkt auch an der Grenze in die andere Richtung: Die Genauigkeit verschlechtert sich allmählich, wenn Anfragen sich dem Cutoff nähern, statt an ihm abrupt abzubrechen – es gibt einfach weniger Trainingssignale über sehr aktuelle Ereignisse. Und eine separate Forschungslinie („Können Prompts die Zeit für LLMs zurückdrehen?“) fand heraus, dass man ein Modell auch nicht zuverlässig per Prompt dazu bringen kann, Wissen nach dem Cutoff zu vergessen: Direkt abgefragte Fakten verlernen zu ~82 %, aber kausal zusammenhängendes Wissen leckt in ~81 % der Fälle durch. Die Erkenntnis: Behandeln Sie den Cutoff als unscharfe Zone, nicht als klare Linie – in beide Richtungen.
Welche Tools eingeschränkt sind vs. welche den Cutoff umgehen
Dies ist der Teil, der Ihre SEO-Strategie tatsächlich verändert. Ob der Cutoff überhaupt eine Rolle spielt, hängt davon ab, ob das Tool Live-Inhalte abruft.
Durch den Cutoff eingeschränkt (nur parametrisch)
- ChatGPT kostenlos / Browsing deaktiviert – Antworten ausschließlich aus Trainingsdaten. OpenAI ist explizit: “When Web search is disabled, ChatGPT and GPTs created in the workspace cannot use web search, even if a user asks ChatGPT to search.” (Übersetzung) „Wenn die Websuche deaktiviert ist, können ChatGPT und im Arbeitsbereich erstellte GPTs die Websuche nicht nutzen, selbst wenn ein Benutzer ChatGPT zur Suche auffordert.“
- Jedes Basismodell ohne Tools – Claude, Gemini, GPT, verwendet über einen rohen API-Aufruf ohne Retrieval.
Den Cutoff effektiv umgehen (Retrieval / Grounding)
- Google AI Overviews & AI Mode – diese verwenden RAG, das Google als Grounding bezeichnet, um aus dem *Live-*Suchindex zu ziehen. Das zugrunde liegende Gemini-Modell hat weiterhin einen parametrischen Cutoff (Gemini 3 war Januar 2025; Gemini 3 ist jetzt Legacy hinter Gemini 3,5, verifiziert 2026-07-19 – prüfen Sie die aktuelle Modellkarte für die heutige Zahl), aber Grounding ruft aktuelle Seiten zur Abfragezeit ab, sodass Benutzer es für die meisten Abfragen umgehen. Google sagt Entwicklern wörtlich, sie sollen das Search Grounding Tool “for more recent information” (Übersetzung) „für aktuellere Informationen“ jenseits dieses Cutoffs verwenden.
- Perplexity – von Natur aus suchorientiert; führt für fast jede Abfrage eine Echtzeit-Websuche durch, sodass es Cutoffs als weitgehend irrelevant behandelt.
- Microsoft Copilot – standardmäßig Bing-gestützt. Microsofts Rahmung: Copilot “can ground its answers with current information from the web, closing knowledge gaps that every large language model (LLM) inevitably has based on its training data cutoff.” (Übersetzung) „kann seine Antworten mit aktuellen Informationen aus dem Web untermauern und so Wissenslücken schließen, die jedes große Sprachmodell (LLM) unvermeidlich aufgrund seines Trainingsdaten-Cutoffs hat.“
- ChatGPT mit aktivierter Suche (Plus/Team/Enterprise) – wandelt die Anfrage in Suchabfragen um, ruft über Bing ab und antwortet aus diesen Ergebnissen mit Links.
Parametrisches vs. abgerufenes Wissen verhält sich unterschiedlich
Selbst wenn Retrieval aktiviert ist, fühlen sich die beiden Wissensquellen nicht gleich an – und Duane Forresters Rahmung des „doppelten Gedächtnisses“ erfasst das gut. In den Gewichten verankerte Inhalte kommen flüssig, schnell und ohne Einschränkung daher – das Modell synthetisiert aus internalisiertem Wissen. Inhalte nach dem Cutoff, die aus dem Web gezogen werden, kommen mit Absicherungen wie „laut Berichten“ oder „Quellen zufolge“ daher, was ein unterschiedliches epistemisches Gewicht signalisiert. Retrieval beseitigt auch nicht magisch Fehler – wenn Quellen in Konflikt geraten, können gestützte Antworten weiterhin halluzinieren. Retrieval mildert also den Cutoff; es löscht nicht den Unterschied zwischen trainiertem und abgerufenem Wissen aus.
Welche Inhalte am stärksten (und am wenigsten) betroffen sind
Der Cutoff trifft am härtesten alles, was sich schnell ändert, und berührt kaum, was stabil ist.
Stark betroffen (volatil): aktuelle Preise, Produktspezifikationen, Versionsnummern; Firmennamen, Übernahmen, Umbenennungen; regulatorische und rechtliche Änderungen; aktuelle Ereignisse, Sport, Wahlen; Führungs-/Personaländerungen; frische Forschung und Benchmarks; Marktdaten und Statistiken.
Minimal betroffen (stabil): grundlegende Konzepte und Definitionen; historische Fakten; mathematische und wissenschaftliche Prinzipien; Programmiergrundlagen; Geografie.
Der gefährliche Teil für Marken: Ein KI-Modell wird Ihnen eine selbstbewusste, flüssige falsche Antwort zu einer zeitkritischen Tatsache geben. Es zögert nicht, wenn es mit Trainingsdaten arbeitet – es stellt einfach die veraltete Version als Tatsache dar. Wenn sich Ihre Preise, Ihre Führung oder Ihre Produktpalette nach dem Cutoff eines Modells geändert haben, ist dieses Modell da draußen und stellt Sie mit absoluter Sicherheit falsch dar.
Was das für SEO und GEO bedeutet
Ich betrachte das als zwei getrennte Aufgaben – und sie zu vermischen ist der Punkt, an dem Leute falsch liegen.
Track 1 – in die Trainingsdaten gelangen (das langfristige Spiel)
Um im parametrischen Gedächtnis eines Modells verankert zu sein, muss Ihr Inhalt vor dem Trainings-Cutoff existieren und oft genug erwähnt werden, um einen Eindruck zu hinterlassen. Der Mechanismus ist banal: LLMs sind Next-Word-Prädiktoren. Wie ich es in unserer Ahrefs-Forschung zu AI Overviews formuliert habe, “if you’re mentioned more in the training data such as web pages, you’re going to be mentioned more in the outputs of LLMs.” (Übersetzung) „Wenn Sie in den Trainingsdaten wie Webseiten häufiger erwähnt werden, werden Sie auch in den Ausgaben von LLMs häufiger erwähnt.“ Dieser Track dreht sich also um Markenpräsenz und thematische Autorität, die über die Zeit aufgebaut werden – und darum, die Trainings-Crawler (GPTBot, ClaudeBot) hereinzulassen. Trainingsläufe finden selten und unvorhersehbar statt, sodass Inhalte, die nach einem Cutoff veröffentlicht werden, für dieses Modell unsichtbar sind, bis zum nächsten Lauf, der über ein Jahr entfernt sein kann.
Track 2 – auffindbar und aktuell bleiben (das kurzfristige Spiel)
Für jedes retrieval-basierte Tool ist der Cutoff irrelevant, wenn Sie im Index sind. Hier leisten Aktualität und Indexierung die Arbeit:
- Werden Sie in Google und Bing indexiert. ChatGPT-Suche und Copilot rufen beide von Bing ab – wenn Sie nicht im Bing-Index sind, sind Sie für die Retrieval-Systeme von OpenAI und Microsoft unsichtbar. AI Overviews beziehen aus dem Google-Index. Indexierung ist die Grundvoraussetzung, Punkt.
- Achten Sie auf die richtigen Crawler. Trainings-Bots (GPTBot, ClaudeBot) und KI-Such- Retrieval-Bots (OAI-SearchBot, PerplexityBot) sind getrennt. Das Blockieren von GPTBot hält Sie nur aus dem Training heraus – OAI-SearchBot übernimmt weiterhin die Echtzeit-Retrieval. Sie können den einen erlauben und den anderen blockieren. (Vollständige Aufschlüsselung in AI-Crawler.)
- Signalisieren Sie Aktualität ehrlich. Akkurates
dateModified/datePublished-Schema und wahrheitsgemäßes<lastmod>in Sitemaps helfen zeitkritischen Inhalten, erneut abgerufen zu werden.
Die Nuance der Aktualität ist es wert, festgehalten zu werden. Unsere 17-Millionen-Zitations-Studie bei Ahrefs fand heraus, dass KI-zitierte Inhalte 25,7 % frischer sind als organisch zitierte Inhalte – aber das durchschnittliche Alter zitierter Inhalte liegt immer noch bei 2,9 Jahren. Wie meine Kollegen es formulierten: „like traditional search, AI assistants still prefer citing long-lived content.“ (Übersetzung) „Wie die traditionelle Suche bevorzugen KI-Assistenten weiterhin die Zitierung langlebiger Inhalte.“ Also jagen Sie Aktualität für volatile Seiten, aber verwechseln Sie Aktualität nicht mit einem Ersatz für dauerhafte, autoritative Inhalte. ChatGPT ist die am stärksten auf Aktualität ausgerichtete Plattform (ordnet In-Text-Zitate vom neuesten zum ältesten); Google AI Overviews zitieren die ältesten Inhalte, ungefähr passend zu organischen.
Die Mythen, die es wert sind, gekillt zu werden
- „Das Abschneidedatum ist eine harte Grenze.“ Es ist eine unscharfe Zone – die Genauigkeit nimmt dorthin ab und effektive Abschneidedaten weichen von den angegebenen ab.
- „Angegebenes Abschneidedatum = was das Modell tatsächlich weiß.“ Effektive Abschneidedaten liegen oft früher; kürzlich veröffentlichte, aber vor dem Abschneidedatum liegende Inhalte sind unterrepräsentiert.
- „KI-Übersichten sind durch dasselbe Abschneidedatum begrenzt wie das Basismodell von ChatGPT.“ Nein – sie stützen sich auf den Live-Index von Google und können heute veröffentlichte Seiten anzeigen.
- „Sobald ChatGPT browsen kann, ist das Abschneidedatum irrelevant.“ Das Browsen wird nur bei einigen Anfragen ausgelöst; viele Antworten stammen weiterhin aus Trainingsdaten, und abgerufenes Wissen verhält sich anders als trainiertes Wissen.
- „Meine neuen Inhalte erreichen das Training von ChatGPT sofort.“ Nein – erst beim nächsten Trainingslauf, der ein Jahr oder mehr entfernt sein kann. Abruf ist Ihr kurzfristiger Weg.
- „Das Blockieren von GPTBot verbirgt mich vor der KI-Suche.“ Es betrifft nur die Trainings-Aufnahme; OAI-SearchBot ruft Sie weiterhin in Echtzeit ab.
- „Wissensstand = Veröffentlichungsdatum.“ Er liegt typischerweise 6–12+ Monate früher.
Diese Seite befindet sich im Cluster So funktioniert die Suche – siehe LLM, RAG, Grounding und KI-Halluzinationen für die angrenzenden Beiträge.
KI-Zusammenfassung
Eine komprimierte Darstellung der erweiterten Version:
- Wissensstand = das Datum, an dem die Erfassung der Trainingsdaten endete. „Abschneidedatum der Trainingsdaten“ ist der präzise Begriff; „Wissensstand“ ist eine Kurzform. Er begrenzt nur das parametrische (trainierte) Wissen eines Modells.
- Es ist nicht das Veröffentlichungsdatum. Die Lücke beträgt normalerweise 6–12+ Monate (GPT-5: ~10 Monate). Ein brandneues Modell kann ein Jahr hinter der Welt zurückliegen. Sowohl GPT-5 als auch Claude Opus 4,1 – die laufenden Beispiele für diese Verzögerung – sind inzwischen selbst veraltet, was genau der Punkt ist: Jede spezifische Modell-/Datums-Kombination hier ist eine Momentaufnahme, keine dauerhafte Tatsache.
- Anthropic teilt es in zwei Teile: ein zuverlässiges Wissensstand (wo das Wissen am dichtesten ist) gegenüber einem breiteren Trainingsdaten-Abschneidedatum – das zuverlässige Datum liegt einige Monate früher.
- Die Grenze ist unscharf, keine Mauer. Effektive Abschneidedaten weichen oft von den angegebenen ab (CommonCrawl enthält jahrelanges Wikipedia); die Genauigkeit nimmt allmählich in Richtung des Datums ab.
- Abruf umgeht es. Google-KI-Übersichten (Grounding), Perplexity, Copilot und ChatGPT-mit-Suche stützen Antworten auf einen Live-Index. Basismodelle ohne Suche bleiben beim Abschneidedatum eingefroren.
- Parametrisch ≠ abgerufenes Wissen. Trainierte Fakten kommen flüssig und ohne Einschränkung; abgerufene Fakten kommen abgesichert und können bei widersprüchlichen Quellen weiterhin halluzinieren.
- Am stärksten betroffen: Preise, Produkte, Personal, Ereignisse, Vorschriften, Statistiken. Am wenigsten: Definitionen, Geschichte, Mathematik, Geografie. Modelle geben veraltete Fakten mit voller Zuversicht an.
- SEO = zwei Aufgaben: vor dem Abschneidedatum in die Trainingsdaten eingebettet werden (langfristiges Spiel) und in Google und Bing indexiert sowie aktuell bleiben, damit Sie live abgerufen werden (kurzfristig). GPTBot (Training) und OAI-SearchBot (Abruf) sind getrennt.
Offizielle Dokumentation
Primärquellen-Dokumentation der Modellanbieter und Suchmaschinen.
OpenAI
- ChatGPT Search für Unternehmen & Bildung – wie ChatGPT eine Anfrage in Suchanfragen umwandelt und Ergebnisse abruft.
- Webbrowser-Einstellungen bei ChatGPT – was passiert, wenn die Websuche deaktiviert ist (nur Trainingsdaten).
- GPT-5-Chatmodell-API-Dokumentation – die offizielle Modellseite mit dem Wissensstand. Von OpenAI inzwischen als „Deprecated“ markiert (verifiziert am 19.07.2026), verweist auf die aktuelle Modellpalette – als Quelle für das historische Abschneidedatum, das in den Beispielen dieses Artikels verwendet wird, beibehalten, nicht als Empfehlung für ein aktuelles Modell.
Anthropic
- Modellübersicht — die Unterscheidung zwischen zuverlässigem und Trainings-Cutoff (Fußnote 2) und die Tabelle mit den Cutoffs pro Modell. Verifiziert am 19.07.2026; die Tabelle führt jetzt mit Claude Opus 4,8 und Claude Sonnet 5, während Claude Opus 4,1 in den Legacy-Bereich als veraltet verschoben wurde.
- Transparenzportal — Zusammensetzung der Trainingsdaten.
- Leitfaden zur KI-Optimierung — Grounding definiert; wie KI-Funktionen frische, aktuelle Seiten abrufen.
- KI-Funktionen und Ihre Website — Indexierungsanforderungen und Query-Fan-out.
- Grounding mit Google Search (Gemini API) — Grounding „über seinen Wissens-Cutoff hinaus“.
- Entwicklerleitfaden zu Gemini 3 — der Januar-2025-Cutoff und das Search-Grounding-Tool. Weiterhin live, trägt aber inzwischen einen Deprecation-Hinweis, der auf Gemini 3,5 verweist (verifiziert am 19.07.2026).
Microsoft
- Websuche in Microsoft 365 Copilot — Grounding, um Wissenslücken durch Trainings-Cutoffs zu schließen.
- Websuche in Copilot verstehen — das Hockey-Team-Beispiel und der Fallback ohne Websuche.
Referenz
- Wissens-Cutoff (Wikipedia) — definitorischer Überblick und eine Tabelle mit Modell-Cutoffs.
Zitate aus der Quelle
Öffentliche Aussagen der Modellanbieter und Suchmaschinen. Jeder Link ist ein Deep Link zur Quellseite.
Anthropic — die zweistufige Unterscheidung
- “Reliable knowledge cutoff indicates the date through which a model’s knowledge is most extensive and reliable. Training data cutoff is the broader date range of training data used.” (Übersetzung) „Ein zuverlässiger Wissens-Cutoff gibt das Datum an, bis zu dem das Wissen eines Modells am umfangreichsten und zuverlässigsten ist. Der Trainingsdaten-Cutoff ist der breitere Datumsbereich der verwendeten Trainingsdaten.“ — Anthropic-Plattformdokumentation, Modellübersicht (Fußnote 2). Quelle
Google — Grounding umgeht den Cutoff
- “[Grounding] allows Gemini to provide more accurate answers and cite verifiable sources beyond its knowledge cutoff.” (Übersetzung) „[Grounding] ermöglicht es Gemini, genauere Antworten zu liefern und überprüfbare Quellen über seinen Wissens-Cutoff hinaus zu zitieren.“ — Google AI für Entwickler, Grounding mit Google Search. Zum Zitat springen
- “Gemini 3 models have a knowledge cutoff of January 2025… For more recent information, use the Search Grounding tool.” (Übersetzung) „Gemini-3-Modelle haben einen Wissens-Cutoff von Januar 2025 … Für aktuellere Informationen verwenden Sie das Search-Grounding-Tool.“ — Google AI für Entwickler, Leitfaden zu Gemini 3. Zum Zitat springen
- “A technique (also known as grounding) used to improve the quality, accuracy, and freshness of AI responses by relying on our core Search ranking systems to retrieve relevant, up-to-date web pages.” (Übersetzung) „Eine Technik (auch als Grounding bekannt), die verwendet wird, um die Qualität, Genauigkeit und Aktualität von KI-Antworten zu verbessern, indem sie sich auf unsere zentralen Such-Ranking-Systeme verlässt, um relevante, aktuelle Webseiten abzurufen.“ — Google Search Central, Leitfaden zur KI-Optimierung. Quelle
OpenAI — Suche an vs. aus
- “When Web search is disabled, ChatGPT and GPTs created in the workspace cannot use web search, even if a user asks ChatGPT to search or manually selects search.” (Übersetzung) „Wenn die Websuche deaktiviert ist, können ChatGPT und im Workspace erstellte GPTs die Websuche nicht nutzen, selbst wenn ein Benutzer ChatGPT zur Suche auffordert oder die Suche manuell auswählt.“ — OpenAI Help Center. Quelle
Microsoft — die Cutoff-Lücke schließen
- “Copilot can ground its answers with current information from the web, closing knowledge gaps that every large language model (LLM) inevitably has based on its training data cutoff.” (Übersetzung) „Copilot kann seine Antworten mit aktuellen Informationen aus dem Web untermauern und so Wissenslücken schließen, die jedes große Sprachmodell (LLM) unvermeidlich aufgrund seines Trainingsdaten-Cutoffs hat.“ — Microsoft 365 Copilot Blog. Quelle
Perplexity — suchorientiert von Natur aus
- “ChatGPT is an LLM-first platform that uses Bing’s search API to gather web results, while Perplexity is a search-first platform powered by [a] proprietary real-time web index.” (Übersetzung) „ChatGPT ist eine LLM-orientierte Plattform, die Bings Such-API zum Sammeln von Webergebnissen nutzt, während Perplexity eine suchorientierte Plattform mit einem proprietären Echtzeit-Webindex ist.“ — Perplexity, Enterprise im Vergleich zu ChatGPT. Quelle
#:~:text=-Anker möglicherweise nicht immer auf der hervorgehobenen Passage landen. Der zitierte Wortlaut wurde während der Recherche erfasst und sollte vor der endgültigen Verwendung gegen die Live-Seiten bestätigt werden; insbesondere die Modell-Cutoff-Daten ändern sich häufig – überprüfen Sie immer die offizielle Modellkarte für die aktuelle Zahl. Wissens-Cutoff – Spickzettel
Cutoff vs. Veröffentlichung (das ist nicht dasselbe)
| Modell | Wissens-Cutoff | Verzögerung bis zur Veröffentlichung |
|---|---|---|
| GPT-5 (Original, jetzt veraltet) | 30. September 2024 | ~10 Monate |
| Claude Opus 4,1 (jetzt veraltet) | März 2025 | ~4 Monate |
| Gemini 2,5 Pro | — | ~3 Monate |
| Gemini 3 (jetzt Legacy hinter Gemini 3,5) | Januar 2025 | — |
Anthropics zuverlässiger vs. Trainings-Cutoff – aktuelle Aufstellung (laut offizieller Modellseite, verifiziert am 19.07.2026)
| Modell | Zuverlässiger Cutoff | Trainingsdaten-Cutoff |
|---|---|---|
| Claude Opus 4,8 | Januar 2026 | Januar 2026 |
| Claude Sonnet 5 | Januar 2026 | Januar 2026 |
| Claude Haiku 4,5 | Februar 2025 | Juli 2025 |
Legacy-Claude-Modelle, die noch in der Dokumentation stehen (veraltet oder durch die obige Zeile ersetzt)
| Modell | Zuverlässiger Cutoff | Trainingsdaten-Cutoff |
|---|---|---|
| Claude Opus 4,5 | Mai 2025 | August 2025 |
| Claude Sonnet 4,5 | Januar 2025 | Juli 2025 |
| Claude Opus 4,1 (veraltet, wird am 5. August 2026 eingestellt) | Januar 2025 | März 2025 |
Diese Tabellen sind eine Momentaufnahme, die am 19.07.2026 gegen die offizielle Modellkarte verifiziert wurde – keine dauerhafte Tatsache. Dieser Korpus hat die kürzeste Halbwertszeit auf der Website: Jedes genannte Modell wird irgendwann überholt sein, einige innerhalb von Monaten. Bestätigen Sie immer die aktuelle Modellkarte, bevor Sie ein bestimmtes Datum angeben.
Umgeht das Tool den Cutoff?
| Tool | Modus | Ist der Cutoff relevant? |
|---|---|---|
| ChatGPT (kostenlos / Browsing aus) | Nur Training | Ja |
| ChatGPT (Suche an) | Bing-Retrieval | Meistens nein |
| Google AI Overviews / AI-Modus | Live-Index-Grounding | Meistens nein |
| Microsoft Copilot | Bing-gestützt | Meistens nein |
| Perplexity | Suchfirst | Weitgehend nein |
| Jedes Basismodell über die rohe API | Nur Training | Ja |
Schnelle Fakten
- „Trainingsdaten-Cutoff“ = präziser Begriff; „Wissens-Cutoff“ = Kurzform. Dasselbe.
- Cutoff ≠ Veröffentlichungsdatum – die Lücke beträgt typischerweise 6–12+ Monate.
- Die Grenze ist unscharf: Effektive Cutoffs unterscheiden sich von den angegebenen; die Genauigkeit nimmt zum Datum hin ab.
- GPTBot (Training) ≠ OAI-SearchBot (Retrieval) – blockieren Sie das eine nicht ohne das andere.
- Retrieval erfordert, dass Sie in Google und Bing indexiert sind.
Die mentalen Modelle
1. Lehrbuch in Druck gegangen. Das parametrische Wissen eines Modells ist ein gedrucktes Buch. Sobald es erscheint, kann der Drucker kein Kapitel mehr hinzufügen – neue Fakten warten auf die nächste Ausgabe (Trainingslauf). Retrieval ist der Korrekturzettel, den Sie dem Leser zur Abfragezeit in die Hand geben.
2. Zwei Gedächtnisse – parametrisch vs. abgerufen. Parametrisches Wissen (in den Gewichten verankert) kommt fließend und ohne Einschränkungen heraus. Abgerufenes Wissen (live abgerufen) kommt abgeschwächt heraus („laut Berichten“) und kann dennoch falsch sein, wenn Quellen widersprüchlich sind. Behandeln Sie beide Wissensarten nicht als austauschbar – sie verhalten sich unterschiedlich und scheitern unterschiedlich.
3. Cutoff ≠ Veröffentlichungsdatum. Datenerfassung endet → Bereinigung, Tests, Alignment → Veröffentlichung. Die Lücke beträgt 6–12+ Monate, daher bedeutet „neues Modell“ nie „aktuelles Wissen“.
4. Die Grenze ist ein Gradient, keine Wand. Das Wissen wird dünner, je näher man dem Cutoff kommt, und effektive Cutoffs unterscheiden sich von den angegebenen. Behandeln Sie die letzten Monate vor jedem Cutoff als Gebiet mit geringer Vertrauenswürdigkeit.
5. Zweigleisige Sichtbarkeit (die SEO-Entscheidungsregel).
- Trainingspfad (langfristiges Spiel): veröffentlichen Sie autoritative Inhalte und sammeln Sie Markenerwähnungen vor den Trainingsläufen; erlauben Sie GPTBot/ClaudeBot. Auszahlung: Sie sind in den Gewichten.
- Abrufpfad (kurzfristig): bleiben Sie in Google + Bing indexiert und signalisieren Sie Aktualität; erlauben Sie OAI-SearchBot/PerplexityBot. Auszahlung: Sie werden zur Abfragezeit abgerufen, unabhängig vom Cutoff.
Das sind unterschiedliche Aufgaben. Fragen Sie bei jedem Inhalt: Versucht dieser, in die Gewichte zu gelangen oder abgerufen zu werden? Optimieren Sie entsprechend.
Fehler beim Wissens-Cutoff
Das Veröffentlichungsdatum des Modells als dessen Cutoff behandeln
Ein Produkt kann lange nach dem Ende der Daten, die für sein Basistraining verwendet wurden, auf den Markt kommen. Notieren Sie den vom Anbieter dokumentierten Cutoff, die Modellversion und ob die Antwort Suche verwendet hat, anstatt Aktualität aus einer Veröffentlichungsankündigung abzuleiten.
Annehmen, dass Suche das Modell dauerhaft aktualisiert
Abruf kann aktuellen Kontext für eine Antwort liefern, aber er schreibt die Gewichte des Modells nicht neu. Beschreiben Sie die Ausgabe als auf abgerufenem Material basierend, nicht als Beweis dafür, dass das Basismodell die neue Tatsache gelernt hat.
Nur für Trainingsdaten optimieren
Trainingsexposition ist langsam und undurchsichtig. Halten Sie nützliche Seiten crawlbar, indexiert, aktuell und leicht abrufbar, damit Live-KI-Suche sie jetzt nutzen kann.
Aktualitätsansprüche in einer KI-Antwort prüfen
Fügen Sie die Antwort, Modellname/-version, Abfragedatum und alle sichtbaren Zitate ein:
Separate statements that could come from the model's parametric knowledge from
statements that appear grounded in retrieved sources. Flag every time-sensitive
claim, the citation that supports it, and any claim that cannot be verified from the
supplied sources. Do not infer the model's knowledge cutoff; mark it unknown unless I
provide provider documentation.Inhalte für beide Entdeckungspfade planen
Fügen Sie ein Thema, das vorhandene Seiteninventar und bekannte Aktualitätsanforderungen ein:
Create a two-track content plan. Track 1 should improve current retrieval through
crawlability, indexability, clear passages, and explicit update ownership. Track 2
should build durable brand/entity evidence that may enter future training corpora.
Use only the supplied pages and facts, identify gaps, and label assumptions. Eine vermeintlich aktuelle KI-Antwort bewerten
- Notieren Sie das genaue Modell und die Produktoberfläche.
- Notieren Sie Abfragedatum und -formulierung.
- Prüfen Sie, ob Browsen, Suche, Konnektoren oder hochgeladene Dateien aktiviert waren.
- Erfassen Sie jedes Zitat und das darin angezeigte Veröffentlichungs-/Aktualisierungsdatum.
- Trennen Sie abgerufene Belege von nicht zitierten Modellaussagen.
- Verifizieren Sie aktuelle Behauptungen anhand von Primärquellen.
- Ersetzen Sie kein Veröffentlichungsdatum durch einen dokumentierten Cutoff.
- Führen Sie erneut ohne Abruf aus, nur wenn Sie parametrisches Wissen vergleichen müssen.
Inhalte über den Cutoff hinaus verfügbar halten
- Pflegen Sie crawlbare, indexierbare kanonische Seiten.
- Aktualisieren Sie Fakten, deren Genauigkeit sich im Laufe der Zeit ändert.
- Schreiben Sie in sich geschlossene Passagen, die den Abrufkontext klar machen.
- Bewahren Sie stabile Marken-, Autoren-, Produkt- und Entitätsnamen.
Testen Sie sich selbst: Wissens-Cutoffs
Ressourcen, die Ihre Zeit wert sind
Meine verwandten Artikel & Forschung (Ahrefs)
- Erkenntnisse aus 55,8 Millionen AI Overviews bei 590 Millionen Suchanfragen — woher der Punkt „mehr in Trainingsdaten erwähnt → mehr in Ausgaben erwähnt“ stammt.
- ChatGPT erreicht 12 % von Googles Suchvolumen, doch Google liefert 190-mal mehr Traffic — KI-Suche als eigenständiges Modell gegenüber traditioneller Suche.
- Was wir über die Optimierung für die LLM-Suche tatsächlich wissen — Aktualität, GPTBot-Blockraten und wie LLMs Seiten lesen.
- Neue Studie: KI-Assistenten zitieren bevorzugt aktuellere Inhalte (17 Millionen Zitate) — die oben zitierten Aktualitätsdaten.
Meine Vorträge
- GEO? AEO? LLMO? — Ahrefs Evolve 2025 — mein Durchgang durch LLM-Eingaben: Trainingsdaten, abgerufene Seiten (RAG), Temperatur, Wahrscheinlichkeiten.
Von anderen
- Duane Forrester, Wenn das Trainingsdaten-Cutoff zum Ranking-Faktor wird – das Dual-Memory-Framework und eine auf Cutoffs abgestimmte Inhaltsplanung.
- Datierte Daten: Wissensgrenzen in LLMs nachverfolgen – warum effektive Cutoffs von den angegebenen abweichen.
- Können Prompts die Zeit für LLMs zurückdrehen? – warum man ein Modell nicht zuverlässig dazu bringen kann, Fakten nach dem Cutoff zu vergessen.
- Conductor, AI knowledge cutoff: Was ist das und warum ist es wichtig? – Praktiker-Zitate zur Staleness von Basismodellen vs. RAG.
- Studie zur zeitlichen Robustheit von LLMs – Benchmarks, die zeigen, wie die Wissensgenauigkeit allmählich abnimmt, wenn sich Abfragen dem Cutoff nähern, nicht plötzlich.
- iPullRank, Wie Retrieval-Augmented Generation SEO neu definiert – RAG als Brücke zwischen Trainings-Cutoffs und Live-Antworten auf Abfragen.
- Wissens-Cutoff (Wikipedia) – definitorischer Überblick und eine von der Community gepflegte Tabelle mit Modell-Cutoff-Daten.
- Otterly.ai, Wissens-Cutoff-Daten von LLMs – Vergleichstabelle der wichtigsten Modelle, ihrer Cutoffs und ob jedes einen Echtzeit-Webzugriff hat.
Statistiken, die sich zu zitieren lohnen
- KI-zitierte Inhalte sind 25,7 % frischer als organisch zitierte Inhalte – aber ihr Durchschnittsalter liegt immer noch bei 2,9 Jahren (1 064 Tagen), gegenüber 3,9 Jahren bei organischen. Frische ist für KI wichtig, aber Langlebigkeit gewinnt weiterhin. (Ahrefs, 17-Millionen-Zitate-Studie.) Quelle
- GPT-5s Wissens-Cutoff (30. September 2024) lag etwa 10 Monate vor der Veröffentlichung – das deutlichste Beispiel dafür, dass Cutoff ≠ Veröffentlichungsdatum ist. Claude Opus 4,1 lag etwa 4 Monate, Gemini 2,5 Pro etwa 3 Monate. (Sowohl GPT-5 Chat als auch Claude Opus 4,1 sind inzwischen selbst auf den Modellseiten ihrer Anbieter als veraltet markiert – verifiziert am 19.07.2026 –, was für sich genommen zeigt, wie schnell sich diese Liste ändert.) Quelle
- Effektive Cutoffs können bei einigen Modellfamilien 3–4 Jahre früher liegen als angegeben – ein Korpus hatte >80 % der Wikipedia-Dokumente aus Versionen vor 2023, trotz eines Dumps von 2023. Der Cutoff ist unscharf, keine Mauer. (Dated-Data-Paper.) Quelle
- Prompt-basiertes Vergessen schlägt bei etwa 81 % der Fälle fehl bei kausal zusammenhängendem Wissen (vs. etwa 82 % Erfolg bei direkt abgefragten Fakten) – man kann ein Modell nicht zuverlässig dazu bringen, seinen Cutoff „zurückzuspulen”. (Can-Prompts-Rewind-Time-Paper.) Quelle
- Geminis 3 parametrischer Cutoff ist Januar 2025, doch AI Overviews zeigen Seiten vom gleichen Tag – weil Grounding aus dem Live-Index stammt, nicht aus den Gewichten. Gemini 3 selbst ist inzwischen Legacy hinter Gemini 3,5 (verifiziert am 19.07.2026); Googles eigene Modellseiten veröffentlichen zum Zeitpunkt dieser Prüfung kein Cutoff-Datum für 3,5, was die Norm ist, nicht die Ausnahme – Anbieter geben nicht bei jeder Veröffentlichung einen Cutoff an. Quelle
Änderungsprotokoll
Aktualisiert am 22. Aug. 2026.
Redaktionelle Zusammenfassung und aufgezeichnete Änderungsdetails.Änderungsdetails
-
Detaillierte Änderungsangaben sind derzeit auf Englisch verfügbar.
-
Detaillierte Änderungsangaben sind derzeit auf Englisch verfügbar.
-
Detaillierte Änderungsangaben sind derzeit auf Englisch verfügbar.
Vollständiger Vergleich nicht verfügbar — für diese Version wurde kein früherer Schnappschuss archiviert.
Aktualisiert am 19. Juli 2026.
Redaktionelle Zusammenfassung und aufgezeichnete Änderungsdetails.Änderungsdetails
-
Detaillierte Änderungsangaben sind derzeit auf Englisch verfügbar.
-
Detaillierte Änderungsangaben sind derzeit auf Englisch verfügbar.
-
Detaillierte Änderungsangaben sind derzeit auf Englisch verfügbar.
Vollständiger Vergleich nicht verfügbar — für diese Version wurde kein früherer Schnappschuss archiviert.