LLM-Sichtbarkeit / KI-Sichtbarkeit

Was LLM-Sichtbarkeit (KI-Sichtbarkeit) ist, warum sie nicht dasselbe ist wie organische Sichtbarkeit, und wie man sie über KI-Übersichten, ChatGPT, Perplexity, Copilot und Gemini hinweg misst.

Erstveröffentlicht: 24. Juni 2026 · Zuletzt aktualisiert: 22. Aug. 2026 · Fortgeschritten
Sprachen

LLM-Sichtbarkeit beschreibt, wie oft und wie prominent Ihre Marke in KI-generierten Antworten erscheint. Sie ist nicht dasselbe wie organische Sichtbarkeit – nur etwa 38 % der Zitate in KI-Übersichten stammen aus den traditionellen Top 10, und der stärkste Korrelationsfaktor sind Markenerwähnungen im Web (0,664), nicht der Domain Rating (0,326). Sie unterteilt sich in drei Zustände (abgerufen → erwähnt → zitiert), die unterschiedliche Tools erfordern, verhält sich je nach Plattform völlig unterschiedlich und ist so volatil, dass einzelne Prompt-Ausführungen keine Daten darstellen. Verfolgen Sie diese Sichtbarkeit mit einem definierten Prompt-Pool, der über die Zeit als Share of Model Voice ausgewertet wird – und behandeln Sie Tools wie Brand Radar als richtungsweisend, nicht als exakte Traffic-Zahlen.

TL;DR — LLM-Sichtbarkeit ist das Aggregat davon, wie oft und wie prominent eine Marke in KI-generierten Antworten erscheint (AI Overviews, AI Mode, ChatGPT, Perplexity, Copilot, Gemini, Grok). Sie ist nicht organische Sichtbarkeit – nur etwa 38 % der AI-Overview-Zitate stammen aus den traditionellen Top 10 (früher 76 %), und der stärkste Korrelat ist Marken-Web-Erwähnungen (0,664), nicht Domain Rating (0,326). Sie unterteilt sich in drei Zustände – abgerufen → erwähnt → zitiert – die unterschiedliche Tools benötigen; reine Zitatmessung unterschätzt das Bild erheblich. Sie verhält sich radikal unterschiedlich je nach Plattform, ist so volatil, dass einzelne Prompt-Läufe keine Datenpunkte sind, und die richtige Maßeinheit ist ein definierter Prompt-Pool, der als Share of Model Voice über die Zeit verfolgt wird. Tools wie Brand Radar liefern richtungsweisende Indikatoren, keine exakten Traffic-Zahlen.

Was LLM-Sichtbarkeit ist (und was nicht)

Messungen hängen von Prompts, Modellversionen, Zeit, Gebietsschema und Stichproben ab. Evidence for this claim ChatGPT search can answer with information from the web and provide linked sources. Scope: ChatGPT search; appearance in a sampled answer is product-, query-, locale-, and time-dependent. Confidence: high · Verified: OpenAI: ChatGPT search Provider-Crawler-Steuerungen beschreiben Zugriffsrichtlinien, keine garantierte Aufnahme in Antworten. Evidence for this claim OpenAI distinguishes crawler controls for search inclusion from controls for model training. Scope: OpenAI's documented crawlers and controls; allowing a crawler does not guarantee retrieval, citation, or answer inclusion. Confidence: high · Verified: OpenAI: Crawlers

LLM-Sichtbarkeit – KI-Sichtbarkeit, dasselbe – ist das zusammengefasste Maß dafür, wie oft und wie prominent eine Marke, Domain oder Seite in den Antworten erscheint, die KI-Suchsysteme generieren. Es ist eine Kategorie, keine einzelne Zahl, genauso wie organische Sichtbarkeit. Der Unterschied ist die Oberfläche, die sie misst: eine synthetisierte, geschriebene Antwort statt einer Rangliste von Links.

Das Erste, was ich Ihnen einprägen möchte: LLM-Sichtbarkeit ist nicht dasselbe wie organische Sichtbarkeit. Mitte 2025 stammten etwa 76 % der AI-Overview-Zitate von Seiten, die in den organischen Top 10 rangierten. Anfang 2026 ist das in unseren Daten auf etwa 38 % gesunken (andere Studien setzen es sogar noch niedriger an). Organischer Rang war früher ein brauchbarer Proxy für KI-Präsenz. Das ist er nicht mehr. Dies sind zwei verschiedene Signale, und Sie benötigen zwei verschiedene Messprogramme.

Warum die Abweichung? Weil die Signale, die KI-Sichtbarkeit antreiben, nicht dieselben sind, die Rankings antreiben. In Ahrefs’ Studie über 75 000 Marken von Louise Linehan und Xibeijia Guan – Erkenntnisse, die ich später bei Ahrefs Evolve 2025 diskutierte – ergab sich folgende Reihenfolge für die Sichtbarkeit in Google AI Overviews:

SignalKorrelation mit KI-Sichtbarkeit
Marken-Web-Erwähnungen0,664
Marken-Ankertext0,527
Marken-Suchvolumen0,392
Domain Rating0,326

Das Signal Nr. 1 ist Markenpräsenz außerhalb Ihrer eigenen Website. Das ist die strukturelle Umkehrung: unverlinkte Erwähnungen – die kein PageRank weitergeben und in der traditionellen SEO kaum registriert werden – sind der stärkste Korrelat für KI-Sichtbarkeit. Genau deshalb sage ich immer wieder, dass sich die Aufgabe von “optimieren Sie Ihre Website” zu “optimieren Sie, wie das Internet über Sie spricht” verschoben hat. Es deckt sich auch mit den Earned-Media-Daten: 82–89 % der KI-Zitate stammen aus Drittquellen (Forbes/TechCrunch/WSJ-artige Medien), nicht von markeneigenen Seiten. Ein konkretes Beispiel aus dem Vortrag – Zapier hatte 16 Seiten, die Ahrefs erwähnten, und diese 16 Seiten wurden in 1 431 Ahrefs-KI-Antworten zitiert. Inhalte anderer über Sie leisten den Großteil der Arbeit.

Drei Zustände: abgerufen → erwähnt → zitiert → geklickt

“KI-Sichtbarkeit” verbirgt drei wirklich verschiedene Zustände. Sie zu vermischen ist, wo die meisten Messungen falsch laufen:

ZustandWas es bedeutetWie Sie es sehen
AbgerufenDas Abrufsystem der KI hat Ihre Seite als Quellenmaterial abgerufenServer-Logs (ChatGPT-User, Perplexity-User, Googlebot-Extended)
ErwähntIhr Markenname erscheint im generierten AntworttextMarkenüberwachung / String-Abgleich (Brand Radar); manuelles Prompt-Testen
ZitiertIhre URL ist explizit als Quelle verlinktBrand Radar Cited Pages/Domains; Bing WMT AI Performance; GSC AI-Funktionen

Und dann eine vierte, nachgelagert zu allen dreien: geklickt – der seltene Fall, dass jemand Ihre Website tatsächlich über die Antwort besucht (GA4 / Web-Analyse).

Die meisten Tools sehen nur den Zustand zitiert. Die Zustände abgerufen und erwähnt sind für reine Zitations-Tools weitgehend unsichtbar – OtterlyAIs Auswertung von Bing-Daten brachte es unverblümt auf den Punkt: “99.6% of your AI influence is invisible.” (Übersetzung) „99,6 % Ihres KI-Einflusses sind unsichtbar.“ Wenn Ihr Dashboard also Zitate zählt und das als Ihre KI-Sichtbarkeit bezeichnet, unterschätzen Sie diese erheblich. Und es gibt auch den umgekehrten Fehler – Superlines fand heraus, dass etwa 73 % der KI-Präsenz Zitate ohne Markenerwähnung waren („Geisterzitate“). Führen Sie Erwähnungs-Tracking und Zitations-Tracking gemeinsam durch, sonst erhalten Sie in beiden Fällen ein falsches Bild.

Eine Frage hinter allen dreien: Ist dies überhaupt eine abrufgesteuerte Antwort?

Abgerufen, erwähnt und zitiert setzen alle voraus, dass die KI für diese spezifische Anfrage etwas abgerufen hat. Ein erheblicher Teil der KI-Antworten tut das nicht – das Modell antwortet aus dem, was es bereits während des Trainings gelernt hat (sein parametrisches Gedächtnis), ohne jeglichen Live-Abrufschritt. Siehe RAG für die Mechanik: Produktionssysteme führen einen Abfrage-Klassifikator aus, der pro Abfrage entscheidet, ob gesucht wird – es ist kein Schritt, der bei jeder Anfrage stattfindet.

Für die Messung ist das wichtig, weil sich dadurch die möglichen Maßnahmen ändern. Eine abrufgesteuerte Antwort kann prinzipiell durch On-Page- und Off-Page-Arbeit beeinflusst werden – bessere Inhalte werden abgerufen, bessere Erwähnungen werden einbezogen. Eine gedächtnisgesteuerte Antwort kann auf diese Weise nicht beeinflusst werden: Das Modell hat bereits „gelernt“, was es über Ihre Marke zum Trainingszeitpunkt weiß, und keine Seitenbearbeitung ändert das, bis das Modell neu trainiert wird – was nach dem Zeitplan des Anbieters geschieht, nicht nach Ihrem. Wenn Sie über viele Prompt-Läufe hinweg eine stabile Markenbeschreibung ohne Zitate und ohne Anzeichen von Abruf sehen, könnte es sich um eine gedächtnisgesteuerte Antwort handeln. Beobachten Sie diesen Zustand, aber investieren Sie keine Bearbeitungsmühe in der Erwartung, dass sie sich ändert.

Allein durch das Lesen der Ausgabe lässt sich nicht völlig zuverlässig unterscheiden, welcher Fall vorliegt – es erfordert gezieltes Testen: Vergleichen Sie das Such-ein- vs. Such-aus-Verhalten einer Plattform, wo das offengelegt ist, beobachten Sie, ob überhaupt Zitate erscheinen, oder prüfen Sie, ob sich die Antwort ändert, wenn sich die zugrunde liegende Quellseite ändert. Behandeln Sie „überhaupt keine Zitate“ und „Zitate vorhanden“ als unterschiedliche Messregime mit unterschiedlichen Abhilfemaßnahmen, nicht als zwei Werte auf derselben Skala.

Plattform für Plattform – warum die Sichtbarkeit so stark variiert

Es gibt keine einzige „KI-Sichtbarkeitszahl“, weil sich die Plattformen völlig unterschiedlich verhalten. Sie greifen auf unterschiedliche Quellen zurück und zitieren mit stark unterschiedlichen Raten:

PlattformVerhalten
PerplexityStarker Zitierer – etwa 21,87 Zitate pro Antwort; zitiert in etwa 13 % der Fälle
Google AI OverviewsRiesiges Volumen; RAG + Query-Fan-out über den Standardindex
Bing CopilotEtwa 6,89 Zitate pro Antwort
ChatGPTSelektiv – zitiert in deutlich unter 1 % der Antworten (~0,59 %); etwa 87 % seiner Zitate stimmen mit Bings Top-Organischen-Ergebnissen überein
GrokZitiert häufig – in etwa 27 % der Fälle
Claude / andereAntworten oft aus Trainingsdaten ohne jeglichen Abruf

Die auffälligste Lücke: Perplexity zitiert etwa 21,87 Quellen pro Antwort, während ChatGPT in 0,59 % der Antworten zitiert. Derselbe Inhalt kann auf einer Plattform hoch sichtbar und auf einer anderen praktisch unsichtbar sein. Und die plattformübergreifende Überschneidung ist gering – nur 7 der Top 50 am häufigsten zitierten Domains erscheinen auf allen drei großen Plattformen (AI Overviews, ChatGPT, Perplexity). LLM-Sichtbarkeit ist wirklich drei (oder sieben) separate Profile der Sichtbarkeit. Erfassen Sie jede Plattform; mitteln Sie die Ergebnisse nicht zu einer Zahl und tun Sie so, als würde das etwas bedeuten.

Es ist volatil – einzelne Läufe sind keine Daten

KI-Antworten ändern sich ständig. Ungefähr 40–60 % der zitierten Quellen ändern sich von Monat zu Monat, und bei derselben Abfrage ändert sich ein großer Teil der KI-Übersichtsinhalte zwischen den Durchläufen. SparkToro fand eine Wahrscheinlichkeit von weniger als 1 zu 100, bei 100 Durchläufen desselben ChatGPT-Prompts identische Markenlisten zu erhalten. Die methodische Konsequenz ist einfach und unverhandelbar: Ein einmaliges Ausführen eines Prompts ist kein Datenpunkt. Sie benötigen einen definierten Prompt-Pool, viele Durchläufe und Trendfenster – keine Momentaufnahmen.

Repeated runs expose the distribution hidden by a snapshot: the same prompt can cite, merely mention, or omit a brand.

Across eight synthetic runs, the prompt 'best audit tools' is cited three times, mentioned three times, and absent twice. 'crawl budget help' is cited twice, mentioned three times, and absent three times. 'schema checker' is cited four times, mentioned twice, and absent twice. The fixture contains no live provider output or customer data.

So messen Sie es – der Stack, auf die Zustände abgebildet

Kein einzelnes Tool deckt alle vier Zustände ab. Bauen Sie einen Stack auf, bei dem jede Ebene einem Zustand zugeordnet ist:

  • Ebene 1 – Server-Logs → Abgerufen. Die -User-Bots (ChatGPT-User, Perplexity-User, Googlebot-Extended) sind Live-Inferenz-Abrufe – jemand hat eine Frage gestellt und die KI hat Ihre Seite sofort abgerufen. Das unterscheidet sich von Trainings-/Indexierungs-Bots (GPTBot, ClaudeBot). Jeder Fehler, den Sie einem -User-Bot ausliefern, ist eine verpasste Zitierung.
  • Ebene 2 – Markenüberwachung → Erwähnt. Ahrefs Brand Radar führt String-Match-Erwähnungen auf den wichtigsten Plattformen durch und verfügt über einen Filter für „gefunden, aber nicht zitiert“, um Einfluss ohne Zuordnung zu isolieren. Fügen Sie manuelle Prompt-Tests zur Qualitätssicherung hinzu.
  • Ebene 3 – Zitier-Tracking → Zitiert. Brand Radars Berichte zu zitierten Seiten / zitierten Domains; Bing Webmaster Tools‘ KI-Leistungsbericht (die erste offizielle Plattformquelle für Zitierdaten – Zitierungen, Grounding-Abfragen, durchschnittliche zitierte Seiten); und Google Search Consoles KI-Features-Filter / Gen-KI-Leistungsberichte (nur Impressionen – keine Klicks).
  • Ebene 4 – Web-Analyse → Geklickt. GA4s KI-Assistent-Kanal plus eine benutzerdefinierte Kanalgruppe. Rechnen Sie mit einem Dark-Traffic-Problem: Ein großer Teil der KI-basierten Besuche kommt ohne Referrer an und landet in Direct, und KI-Übersichts-/KI-Modus-Klicks verschmelzen mit google/organic – daher ist die geklickte Ebene am wenigsten sauber.

Eine Einschränkung, bei der ich ehrlich sein möchte: Brand Radar (und ähnliche Tools) melden Richtungsindikatoren, keine exakten Traffic-Zahlen. Nehmen Sie den Trend und den relativen Anteil ernst; behandeln Sie keine einzelne Zahl als präzise Zählung.

Die Prompt-Pool-Methode und Share of Model Voice

Gemessen wird anhand eines Prompt-Pools: Definieren Sie etwa 250–500 High-Intent-Abfragen, führen Sie diese wöchentlich oder monatlich über die LLM-Endpunkte aus, erfassen Sie, wo Ihre Marke erscheint, und verfolgen Sie Share of Model Voice (SOMV) – Markenauftritte ÷ insgesamt verfolgte Prompts × 100. Ziehen Sie Prompts aus echter Nachfrage: Vertriebsprotokolle, Support-Tickets, Reddit, G2-Bewertungen, PAA, Autovervollständigung. Benchmarks zur Kalibrierung: Die durchschnittliche Erwähnungsrate liegt bei etwa 17,2 % über relevante Prompts (AthenaHQ), und 40–70 % gelten als stark.

Zu den Plattformmechaniken: Brand Radar läuft auf einem 400M+ suchgestützten Prompt-Korpus (gegenüber 350M+ früher in diesem Jahr – es ist ein wachsender, live aktualisierter Index, behandeln Sie die genaue Zahl also als Richtwert), aktualisiert monatlich für ChatGPT/Perplexity/Gemini/Copilot und kontinuierlich für KI-Übersichten/KI-Modus und unterscheidet „zitiert“ (verlinkte URLs) von „gefunden, aber nicht zitiert“ (String-Matches ohne Links).

Ein Mess-Randfall, den es zu kennen lohnt

KI erwähnt Sie nicht nur zu selten – manchmal erfindet die KI Ihre Marke. Wir verzeichneten Tausende von Besuchen auf Seiten bei Ahrefs, die tatsächlich nicht existierten, weil eine KI plausibel aussehende URLs synthetisiert hatte. Halluzinierte Zitierungen sind eine reale Dimension der KI-Sichtbarkeitsmessung, und die meisten Tools filtern sie nicht für Sie heraus – überprüfen Sie also die URLs, auf denen Sie „zitiert“ werden.

Was das wert ist und was nicht

Seien Sie sich über den Wert im Klaren. Selbst eine Nennung führt selten zu einem Klick – Nutzer klickten in der Pew-Studie zum US-Suchverhalten vom März 2025 nur in 1 % der Google-Besuche mit einer KI-Zusammenfassung auf eine zitierte Quelle, und die überwiegende Mehrheit der Google-AI-Mode-Sitzungen endet ohne Seitenbesuch. LLM-Sichtbarkeit ist in erster Linie eine Markenbekanntheits- und Autoritätskennzahl, keine Kennzahl für direkten Traffic. Sie ist dennoch wichtig: Ein großer Teil der AI-Mode-Nutzer akzeptiert die kuratierte Shortlist, ohne weitere Recherchen durchzuführen. Daher hat es Gewicht, in der Antwort zu stehen, auch ohne den Klick.

Wo dies einzuordnen ist

Dies ist der Definitions- und Mess-Hub für das Cluster. Für den tiefen Einblick in die drei Zustände siehe Retrieved, Mentioned, Cited. Für die GA4-/Analytics-Ebene im Speziellen – das Durcheinander von Dark Traffic und Attribution – siehe AI-Traffic-Attribution. Für das Off-Site-Signal, das dies tatsächlich antreibt (Entitäten und Erwähnungen), siehe Entity-SEO und den breiteren KI-Such-Hub.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.