Indexierung
So speichern und organisieren Suchmaschinen Seiten für Rankings: Inhaltsanalyse, Kanonisierung, warum gecrawlt nicht indexiert bedeutet und wie der GSC-Bericht zur Seitenindexierung gelesen wird.
Sprachen
1 Evidenzsignal auf dieser Seite
- Verknüpftes Live-WerkzeugGoogle Index Checker
Indexierung ist die zweite Suchphase – Crawling, Indexierung, Auslieferung. Nach dem Crawling versteht die Suchmaschine eine Seite, erkennt Duplikate, wählt eine kanonische Fassung und speichert sie bei ausreichender Qualität im Suchindex. Gecrawlt bedeutet nicht indexiert; Google wählt aus, und Indexierung ist nicht garantiert. Sie ist kein Rankingfaktor, aber eine Seite muss indexiert sein, bevor sie ranken kann. Um eine Seite auszuschließen, verwenden Sie noindex; die Seite bleibt crawlbar und wird nicht in robots.txt blockiert.
TL;DR — Bei der Indexierung speichert eine Suchmaschine Ihre Seite, damit sie in Ergebnissen erscheinen kann. Nach dem Crawling versteht die Suchmaschine den Inhalt und entscheidet, ob sie ihn behält. Gecrawlt bedeutet nicht automatisch indexiert; Google wählt indexwürdige Inhalte aus. Indexiert bedeutet zudem nicht, gut zu ranken, sondern lediglich dafür zugelassen zu sein.
Was Indexierung ist
Suche funktioniert in drei aufeinanderfolgenden Schritten:
- Crawling – ein Bot wie Googlebot entdeckt eine URL und lädt die Seite herunter.
- Indexierung – die Suchmaschine liest die Seite, versteht ihren Inhalt und legt sie in einer großen Datenbank möglicher Suchergebnisse ab.
- Auslieferung und Ranking – bei einer Suche wählt die Suchmaschine passende Einträge aus dieser Datenbank und ordnet sie.
Indexierung ist Schritt zwei. Eine nicht indexierte Seite kann nicht ranken, weil sie in der Ergebnisdatenbank fehlt. Indexierung allein verbessert aber keine Position; sie ermöglicht lediglich die Teilnahme am Ranking.
Gecrawlt bedeutet nicht indexiert
Google indexiert nicht jede gecrawlte Seite, sondern wählt indexwürdige Inhalte aus. In
Googles Worten: “Indexing isn’t guaranteed; not every page that Google processes will
be indexed.” (Übersetzung) „Indexierung ist nicht garantiert; nicht jede von Google
verarbeitete Seite wird indexiert.“ Evidence for this claim Google does not guarantee that every processed page will be indexed. Scope: Google Search indexing; the source gives examples of possible causes rather than an exhaustive decision formula. Confidence: high · Verified: Google Search Central: In-depth guide to how Google Search works Häufige Gründe sind dünne oder
wenig wertvolle Inhalte, eine noindex-Anweisung oder technische Verarbeitungsprobleme.
Fehlt eine Seite in der Suche, sind „Google hat sie nicht gecrawlt“ und „Google hat sie gecrawlt, aber nicht behalten“ daher zwei unterschiedliche Probleme.
So prüfen Sie die Indexierung
- Google Search Console liefert die verlässlichste Antwort. Die URL-Prüfung zeigt, ob eine konkrete Seite indexiert ist; der Bericht zur Seitenindexierung erklärt websiteweite Muster für indexierte und ausgeschlossene Seiten.
- Für eine konkrete URL nutzen Sie die URL-Prüfung. Der Seitenindexierungsbericht ist nicht nach URL filterbar. Auch ein sauberer Live-Test prüft nicht alle Berichtsbedingungen, insbesondere keine Duplikat- und Kanonisierungssituationen.
- Der Operator
site:wiesite:example.com/pageist nur eine grobe Abkürzung; maßgeblich bleibt die Search Console.
So halten Sie eine Seite aus dem Index
Wenn eine Seite aus der Suche entfernt werden soll:
- Setzen Sie
noindexüber Meta Robots oder den HeaderX-Robots-Tag, und - die Seite muss crawlbar bleiben und darf nicht in
robots.txtblockiert werden.
Google muss die Seite crawlen können, um noindex zu erkennen. Eine Blockierung in
robots.txt verhindert das Lesen der Anweisung, während die URL über Links dennoch
indexiert bleiben kann. Evidence for this claim Google must be able to crawl a page to see and apply its noindex rule. Scope: Google-supported robots meta and X-Robots-Tag directives; a robots.txt block can prevent Google from seeing the rule. Confidence: high · Verified: Google Search Central: Block Search indexing with noindex
Für Sonderfälle – schnelle Entfernung, versehentlich indexierte private Seiten oder die
Wahl zwischen 404/410 und noindex – lesen Sie den Leitfaden
Seite deindexieren.
Was während der Indexierung geschieht, wie Kanonisierung funktioniert und was jeder Status des Search-Console-Berichts bedeutet, erklärt der Tab Fortgeschritten.
Evidence for this claim Google must be able to crawl a page to see and apply its noindex rule. Scope: Google-supported robots meta and X-Robots-Tag directives; a robots.txt block can prevent Google from seeing the rule. Confidence: high · Verified: Google Search Central: Block Search indexing with noindexTL;DR — Indexierung ist die zweite von drei Suchphasen: Crawling, Indexierung, Auslieferung. Google versteht eine gecrawlte Seite einschließlich Text, wichtiger Tags, Bilder, Videos und gerendertem JavaScript, erkennt Duplikate, gruppiert ähnliche Seiten, wählt die repräsentativste kanonische URL und speichert Signale im Index.
rel=canonicalist ein Hinweis, keine Regel. Gecrawlt bedeutet nicht indexiert; Qualität und Wert entscheiden wesentlich mit. Der Search-Console-Bericht zur Seitenindexierung ist das Diagnosezentrum. Zum Deindexierennoindexsetzen und die Seite crawlbar lassen;robots.txtentfernt keine Seite und kann eine Indexierung ohne Snippet nicht verhindern.
Indexierung ist die zweite von drei Phasen
Three stages run left to right. Crawl discovers and downloads a URL. Index processes the page and stores eligible information. Serve or rank orders the best indexed matches for a query. The Index stage is highlighted, and a note says not every page advances through every stage.
© Patrick Stox LLC · CC BY 4.0 ·
Google beschreibt die Pipeline klar: “Google Search works in three stages, and not all pages make it through each stage” (Übersetzung) „Google Search arbeitet in drei Phasen, und nicht jede Seite durchläuft jede Phase“ – Crawling, Indexierung und Auslieferung. Die mittlere Phase lautet: “Indexing: Google analyzes the text, images, and video files on the page, and stores the information in the Google index, which is a large database.” (Übersetzung) „Bei der Indexierung analysiert Google Text-, Bild- und Videodateien der Seite und speichert die Informationen im großen Google-Index.“
Evidence for this claim Google Search describes crawling, indexing, and serving as three distinct stages; indexing analyzes page content and stores eligible information in Google's index. Scope: web search Confidence: high · Verified: In-depth guide to how Google Search worksEine Seite muss gecrawlt werden, bevor sie indexiert werden kann, und indexiert sein, bevor sie ranken kann. Keine Phase ist garantiert; jede wirkt als Filter. Fragen Sie deshalb vor jeder Änderung, in welcher Phase eine Seite scheitert. Die vorherige Phase behandelt der Überblick zum Crawling.
Was während der Indexierung geschieht
Step one analyzes a crawled page for text, title, alt text, images, and video. Step two groups duplicate URLs into a cluster and chooses the most representative page as canonical. Step three stores the canonical page and its cluster information in the Google index.
© Patrick Stox LLC · CC BY 4.0 ·
Indexierung ist kein einzelner Vorgang, sondern eine Abfolge:
- Inhalt verstehen. Google erklärt: “After a page is crawled, Google tries to
understand what the page is about. This stage is called indexing.” (Übersetzung)
„Nach dem Crawling versucht Google, das Thema der Seite zu verstehen. Diese Phase heißt
Indexierung.“ Dazu analysiert Google “the textual content and key content tags and
attributes, such as
<title>elements and alt attributes, images, videos, and more” (Übersetzung) „Text, wichtige Inhaltstags und Attribute wie<title>, Alternativattribute, Bilder, Videos und mehr“. JavaScript muss dafür zunächst gerendert werden. - Duplikate erkennen und kanonisieren. Google bestimmt, ob eine Seite ein Duplikat oder kanonisch ist. Ähnliche Inhalte werden zunächst gruppiert, anschließend wird die repräsentativste URL gewählt. “The canonical is the page that may be shown in search results.” (Übersetzung) „Die kanonische Seite kann in Suchergebnissen erscheinen.“
- Signale berechnen und speichern. “The collected information about the canonical page and its cluster may be stored in the Google index, a large database hosted on thousands of computers.” (Übersetzung) „Die Informationen zur kanonischen Seite und ihrem Cluster können im Google-Index gespeichert werden, einer großen Datenbank auf Tausenden Computern.“ Das benannte Indexierungssystem dahinter heißt Caffeine.
Kanonisierung: ein Hinweis, kein Befehl
Kanonisierung geschieht während der Indexierung. Wie ich in meinem Leitfaden zur Kanonisierung erläutere, geschieht die Auswahl anhand zahlreicher Signale. Google definiert sie so: “Canonicalization is the process of selecting the representative –canonical– URL of a piece of content” (Übersetzung) „Kanonisierung ist die Auswahl der repräsentativen kanonischen URL eines Inhalts“. Sie hilft Google, nur eine Fassung ansonsten doppelter Inhalte in Suchergebnissen zu zeigen.
Entscheidend ist: rel=canonical ist ein Vorschlag. Google sagt: “indicating a canonical
preference is a hint, not a rule.” (Übersetzung) „Die Angabe einer kanonischen Präferenz
ist ein Hinweis, keine Regel.“ Google berücksichtigt viele Signale; laut Allan Scott sind
es ungefähr 40. Daher kann Google eine andere URL wählen als die markierte. Genau darauf
weist der Search-Console-Status “Duplicate, Google chose different canonical than user”
(Übersetzung) „Duplikat – Google hat eine andere kanonische URL als der Nutzer gewählt“ hin.
Gecrawlt ist nicht indexiert: Gründe für Ausschlüsse
Die Dokumentation stellt klar: “Indexing isn’t guaranteed; not every page that Google
processes will be indexed.” (Übersetzung) „Indexierung ist nicht garantiert; nicht jede
von Google verarbeitete Seite wird indexiert.“ Evidence for this claim Google does not guarantee that every processed page will be indexed. Scope: Google Search indexing; the source gives examples of possible causes rather than an exhaustive decision formula. Confidence: high · Verified: Google Search Central: In-depth guide to how Google Search works Genannte Gründe sind geringe
Inhaltsqualität, “Robots meta rules disallow indexing,” (Übersetzung) „Robots-meta-Regeln untersagen die Indexierung“ und ein indexierungsfeindliches Webdesign.
Google-Vertreter beschreiben dies als wertbasierte Auswahlentscheidung, nicht als Quote:
- John Mueller sagt zu dauerhaft „Entdeckt/Gecrawlt – zurzeit nicht indexiert“: “That can be forever. It’s something where we just don’t crawl and index all pages.” (Übersetzung) „Das kann für immer so bleiben; wir crawlen und indexieren nicht alle Seiten.“ Statt erneut einzureichen, sollte die Website erkennbaren Wert schaffen.
- Mueller ergänzt: “it’s important to keep in mind that Google just doesn’t index every page on the web, even if it’s submitted directly.” (Übersetzung) „Google indexiert nicht jede Seite im Web, selbst wenn sie direkt eingereicht wurde.“
- Gary Illyes erklärt: “we don’t have infinite space” (Übersetzung) „Wir haben keinen unbegrenzten Speicher“ und Algorithmen wählen vermutlich gesuchte Inhalte aus.
- Martin Splitt beschreibt die Balance zwischen dem Schutz der Website vor Überlastung und dem Einsatz von Ressourcen an relevanten Stellen.
Eine Sitemap oder „Indexierung beantragen“ unterstützt die Entdeckung, erzwingt aber keine Auswahl. Entscheidend sind Qualität und Wert der Website.
Den Bericht zur Seitenindexierung in der Google Search Console lesen
Im Seitenindexierungsbericht werden Indexierungsprobleme konkret sichtbar. Jeder Status ist eine Diagnose. Dies sind Googles wörtliche Beschreibungen:
- Gecrawlt – zurzeit nicht indexiert: “The page was crawled by Google but not indexed. It may or may not be indexed in the future; no need to resubmit this URL for crawling.” (Übersetzung) „Die Seite wurde von Google gecrawlt, aber nicht indexiert. Sie kann künftig indexiert werden oder auch nicht; die URL muss nicht erneut zum Crawlen eingereicht werden.“ Meist ist das ein Qualitäts- oder Werturteil: Verbessere die Seite, statt sie wiederholt einzureichen.
- Entdeckt – zurzeit nicht indexiert: “The page was found by Google, but not crawled yet. Typically, Google wanted to crawl the URL but this was expected to overload the site; therefore Google rescheduled the crawl.” (Übersetzung) „Google hat die Seite gefunden, aber noch nicht gecrawlt. Meist wollte Google die URL crawlen, erwartete dabei jedoch eine Überlastung der Website und verschob den Crawl.“ Technisch ist das ein kapazitätsbedingter Status vor dem Crawl. Bleibt er lange bestehen, bringen Google-Vertreter ihn ebenfalls mit dem Wert der Seite in Verbindung.
- Duplikat ohne vom Nutzer ausgewählte kanonische URL: “This page is a duplicate of another page, although it doesn’t indicate a preferred canonical page. Google has chosen the other page as the canonical for this page, and so will not serve this page in Search.” (Übersetzung) „Diese Seite ist ein Duplikat einer anderen Seite, nennt aber keine bevorzugte kanonische Seite. Google hat die andere Seite als kanonische Version gewählt und zeigt diese Seite daher nicht in der Suche an.“
- Duplikat – Google wählte eine andere kanonische URL: “This page is marked as canonical for a set of pages, but Google thinks another URL makes a better canonical.” (Übersetzung) „Diese Seite ist für eine Gruppe von Seiten als kanonisch markiert, Google hält jedoch eine andere URL für die bessere kanonische Version.“ Das ist die praktische Folge davon, dass die Angabe nur ein Hinweis und keine Regel ist.
- Alternative Seite mit korrektem Canonical-Tag: “This page is marked as an alternate of another page… This page correctly points to the canonical page, which is indexed, so there is nothing you need to do.” (Übersetzung) „Diese Seite ist als Alternative zu einer anderen Seite markiert. Sie verweist korrekt auf die indexierte kanonische Seite; es besteht kein Handlungsbedarf.“
- Indexiert, obwohl durch robots.txt blockiert: “The page was indexed despite being blocked by your website’s robots.txt file. Google always respects robots.txt, but this doesn’t necessarily prevent indexing if someone else links to your page.” (Übersetzung) „Die Seite wurde indexiert, obwohl die robots.txt deiner Website sie blockiert. Google beachtet robots.txt, doch Links anderer Websites können eine Indexierung trotzdem ermöglichen.“ Das belegt: Das Blockieren des Crawlings verhindert die Indexierung nicht.
- URL durch robots.txt blockiert: “This page was blocked by your site’s robots.txt file.” (Übersetzung) „Diese Seite wurde durch die robots.txt deiner Website blockiert.“
- URL mit
noindexmarkiert: “When Google tried to index the page it encountered a ‘noindex’ directive and therefore did not index it.” (Übersetzung) „Beim Versuch, die Seite zu indexieren, erkannte Google einenoindex-Anweisung und indexierte sie deshalb nicht.“ Hier funktioniert die Entfernung aus dem Index wie vorgesehen. - Seite mit Weiterleitung: “This is a non-canonical URL that redirects to another page. As such, this URL will not be indexed.” (Übersetzung) „Dies ist eine nicht kanonische URL, die auf eine andere Seite weiterleitet. Daher wird diese URL nicht indexiert.“
- Soft 404: “The page request returns what we think is a soft 404 response. This means that it returns a user-friendly ‘not found’ message but not a 404 HTTP response code.” (Übersetzung) „Die Seitenanfrage liefert nach Googles Einschätzung eine Soft-404-Antwort: eine nutzerfreundliche Nicht-gefunden-Meldung, aber keinen HTTP-Statuscode 404.“
Indexierung richtig steuern
Damit eine Seite indexiert wird: Mache sie crawlbar, verlinke sie intern, nimm sie in die Sitemap auf und sorge vor allem dafür, dass sie die Indexierung verdient. Hilfen zur Entdeckung setzen die Wertentscheidung nicht außer Kraft.
Damit eine Seite draußen bleibt — eine der häufigsten Fehlkonfigurationen in der SEO:
Verwende noindex, “a rule set with either a <meta> tag or HTTP response header,”
(Übersetzung) „eine Regel, die entweder mit einem <meta>-Tag oder einem
HTTP-Antwortheader gesetzt wird“ und halte die Seite crawlbar. Googles zentrale
Warnung lautet: “For the noindex rule to be effective, the page or resource must not be blocked by a robots.txt file, and it has to be otherwise accessible to the crawler.” (Übersetzung) „Damit die noindex-Regel wirksam ist, darf die Seite oder Ressource nicht durch eine robots.txt-Datei blockiert sein und muss für den Crawler anderweitig erreichbar bleiben.“
Ein häufiger Fehler ist, noindex zu setzen und die Seite zugleich in robots.txt
zu sperren. Das ist kontraproduktiv. In
URLs aus der Google-Suche entfernen
formuliere ich es so: “For these tags to be seen, a search engine needs to be able to crawl the pages—so make sure they aren’t blocked in robots.txt,” (Übersetzung) „Damit diese Tags erkannt werden, muss eine Suchmaschine die Seiten crawlen können; sie dürfen also nicht in robots.txt blockiert sein.“ Außerdem gilt: “Crawling is not the same thing as indexing. Even if Google is blocked from crawling pages, if there are any internal or external links to a page they can still index it.” (Übersetzung) „Crawling und Indexierung sind nicht dasselbe. Selbst wenn Google eine Seite nicht crawlen darf, kann sie über interne oder externe Links indexiert werden.“ Im Beitrag
Indexiert, obwohl durch robots.txt blockiert
steht noch deutlicher: “Unless Google can crawl a page, they won’t see the noindex meta tag and may still index it because it has links.” (Übersetzung) „Wenn Google eine Seite nicht crawlen kann, sieht Google das noindex-Meta-Tag nicht und kann sie wegen vorhandener Links weiterhin indexieren.“ Die Lösung: “Just add a noindex meta robots tag and make sure to allow crawling—assuming it’s canonical.” (Übersetzung) „Füge einfach ein noindex-Meta-Robots-Tag hinzu und erlaube das Crawling, sofern die Seite kanonisch ist.“
Den vollständigen Entscheidungsbaum zur Entfernung — 404/410 gegenüber noindex,
die ungefähr sechsmonatige Ausblendung durch das Entfernungstool und Passwortschutz
— findest du unter Eine Seite aus dem Index entfernen.
Indexierung in Bing
Bing verwendet dieselbe Pipeline. Microsoft beschreibt sie so: “As Bingbot crawls the web, it sends information to Bing about what it finds. These pages are then added to the Bing index.” (Übersetzung) „Während Bingbot das Web crawlt, übermittelt er Bing Informationen über seine Funde. Diese Seiten werden anschließend dem Bing-Index hinzugefügt.“ Es gelten dieselben Steuerungsmittel: noindex hält eine Seite aus dem Index heraus, während eine zu restriktive robots.txt verhindern kann, dass Bingbot sie überhaupt crawlt. Außerdem benötigt Bing mindestens einen Link auf deine Website, um sie zunächst zu entdecken.
Nicht jede Seite gehört in den Index
Eine einfache Prüffrage, keine allgemeingültige Regel: Eine Seite ist die Indexierung
wert, wenn sie für eine Suche ein eigenständiges, nützliches Ergebnis liefern kann.
Daran solltest du Duplikate, Parametervarianten, private oder Staging-URLs sowie dünne
oder repetitive Bestandsseiten messen. Es ist kein Grund, standardmäßig einen ganzen
Seitentyp auf noindex zu setzen. Prüfe anschließend die Seiten, die das Thema
wirklich abdecken sollen, vollständig.
Nächste Schritte im Indexierungs-Cluster
Dieser Hub liefert den Überblick. Im großen Maßstab treten vor allem zwei Probleme auf, die jeweils eine eigene Vertiefung verdienen:
- Index-Bloat — Zu viele minderwertige, doppelte oder dünne URLs gelangen in den Index, verwässern die Website und verschwenden Crawl- und Indexierungsressourcen. Lerne, das Problem zu diagnostizieren und sicher zu bereinigen.
- Mobile-First-Indexierung — Google indexiert die mobile Version deiner Seiten. Inhalte, Links und strukturierte Daten müssen daher auf Mobilgeräten und Desktop übereinstimmen. Prüfe, was abweicht und wodurch es zu Fehlern kommt.
Beide Themen sind diesem Hub untergeordnet, erscheinen auch in der Seitenleiste und verlinken hierher zurück.
Die vorherige Phase — wie Bots deine Seiten entdecken und herunterladen — wird im Hub Crawling behandelt. Crawl → Index ist die Reihenfolge, und eine Seite muss den Crawl durchlaufen, bevor die hier beschriebenen Schritte greifen. Den Gesamtüberblick liefert So funktioniert die Suche.
KI-Zusammenfassung
Eine kompakte Zusammenfassung der fortgeschrittenen Fassung:
- Indexierung ist die zweite Suchphase (Crawl → Index → Auslieferung). Der Crawl geht der Aufnahme in den Index voraus; nur aus diesem Index kann eine Seite später ins Ranking gelangen. Keine dieser Stufen ist garantiert. Indexierung ist kein Rankingfaktor, sondern die Zugangsvoraussetzung.
- Während der Indexierung versteht Google den Inhalt (Text, wichtige Tags, Bilder, Videos und gerendertes JavaScript), erkennt Duplikate, gruppiert ähnliche Seiten und wählt die repräsentativste kanonische Version, berechnet Signale und speichert sie im Google-Index. Das zugrunde liegende System heißt Caffeine.
- Die Kanonisierung geschieht bei der Indexierung.
rel=canonicalist ein Hinweis, keine Regel; Google kann anhand von ungefähr 40 Signalen eine andere URL wählen. - Gecrawlt ≠ indexiert. Die Aufnahme ist eine Qualitäts- und Wertentscheidung. Erneutes Einreichen erzwingt nichts; bessere Inhalte und eine bessere Website sind die wirksamen Hebel.
- Der GSC-Seitenindexierungsbericht ist das Cockpit. Prüfe insbesondere die Statusangaben „Gecrawlt/Entdeckt – zurzeit nicht indexiert“, Duplikate und kanonische URLs, „Indexiert, obwohl durch robots.txt blockiert“ sowie „Durch noindex ausgeschlossen“.
- Zum Entfernen aus dem Index setzt du
noindexals Meta-Tag oder X-Robots-Tag und hältst die Seite crawlbar. Verwenderobots.txtnie zur Entfernung: Eine blockierte Seite kann über Links weiterhin indexiert werden, wenn auch ohne Snippet. - Bing folgt derselben Pipeline. Es gelten dieselben
noindex-Regeln. - Im großen Maßstab gibt es zwei typische Fehlerbilder: Index-Bloat durch zu viele minderwertige URLs und Abweichungen bei der Mobile-First-Indexierung.
Offizielle Dokumentation
Primärquellen der Suchmaschinen.
- Ausführliche Anleitung zur Funktionsweise der Google-Suche — Überblick über Crawl, Indexierung und Auslieferung sowie die Gründe, warum eine Indexierung nicht garantiert ist.
- Kanonisierung und doppelte URLs — wie Google Duplikate gruppiert und eine kanonische URL auswählt.
- Suchindexierung mit noindex blockieren — das richtige Mittel zur Entfernung und der Grund, warum die Seite crawlbar bleiben muss.
- Bericht zur Seitenindexierung — Hilfe der Search Console zu den einzelnen Indexierungsstatus.
- Crawling und Indexierung — der Hub zu robots.txt, Sitemaps, Kanonisierung und Indexierungssteuerung.
Bing / Microsoft
- Wie Bing Suchergebnisse bereitstellt — Bings Pipeline vom Crawling bis zur Indexierung in Microsofts eigenen Worten.
- Warum ist meine Website nicht im Index? — Hilfe der Bing Webmaster Tools zu Indexierungshindernissen.
Zitate aus den Quellen
Offizielle Aussagen von Google und Bing. Jeder Link führt direkt zur zitierten Passage auf der Quellseite.
Google — was Indexierung bedeutet
- “Google Search works in three stages, and not all pages make it through each stage.” (Übersetzung) „Die Google-Suche arbeitet in drei Phasen, und nicht alle Seiten durchlaufen jede Phase.“ — Dokumentation von Google Search Central. Zum Zitat
- “After a page is crawled, Google tries to understand what the page is about. This stage is called indexing.” (Übersetzung) „Nachdem eine Seite gecrawlt wurde, versucht Google, ihr Thema zu verstehen. Diese Phase heißt Indexierung.“ Zum Zitat
- “Google analyzes the textual content and key content tags and attributes, such as
<title>elements and alt attributes, images, videos, and more.” (Übersetzung) „Google analysiert Textinhalte und wichtige Inhalts-Tags und -Attribute wie<title>-Elemente und Alt-Attribute sowie Bilder, Videos und mehr.“ Zum Zitat - “The canonical is the page that may be shown in search results… we first group together (also known as clustering) the pages that we found on the internet that have similar content, and then we select the one that’s most representative of the group.” (Übersetzung) „Die kanonische Seite kann in den Suchergebnissen erscheinen. Google gruppiert zunächst gefundene Seiten mit ähnlichen Inhalten und wählt dann die repräsentativste Seite der Gruppe aus.“ Zum Zitat
- “The collected information about the canonical page and its cluster may be stored in the Google index, a large database hosted on thousands of computers.” (Übersetzung) „Die gesammelten Informationen über die kanonische Seite und ihren Cluster können im Google-Index gespeichert werden, einer großen Datenbank auf Tausenden Computern.“ Zum Zitat
- “Indexing isn’t guaranteed; not every page that Google processes will be indexed.” (Übersetzung) „Indexierung ist nicht garantiert; nicht jede von Google verarbeitete Seite wird indexiert.“ Zum Zitat
Google — Kanonisierung und noindex
- “Canonicalization is the process of selecting the representative –canonical– URL of a piece of content.” (Übersetzung) „Kanonisierung ist der Prozess, für einen Inhalt die repräsentative, also kanonische URL auszuwählen.“ — Dokumentation von Google Search Central. Zum Zitat
- “That is, indicating a canonical preference is a hint, not a rule.” (Übersetzung) „Die Angabe einer kanonischen Präferenz ist also ein Hinweis, keine Regel.“ Zum Zitat
- “For the
noindexrule to be effective, the page or resource must not be blocked by a robots.txt file, and it has to be otherwise accessible to the crawler.” (Übersetzung) „Damit dienoindex-Regel wirksam ist, darf die Seite oder Ressource nicht durch eine robots.txt-Datei blockiert sein und muss für den Crawler anderweitig erreichbar bleiben.“ — Dokumentation von Google Search Central. Zum Zitat
John Mueller, Google (via Search Engine Journal)
- “That can be forever. It’s something where we just don’t crawl and index all pages.” (Übersetzung) „Das kann für immer so bleiben. Wir crawlen und indexieren schlicht nicht alle Seiten.“ Zum Beitrag
- “it’s important to keep in mind that Google just doesn’t index every page on the web, even if it’s submitted directly.” (Übersetzung) „Man sollte bedenken, dass Google nicht jede Seite im Web indexiert, selbst wenn sie direkt eingereicht wird.“ Zum Beitrag
Gary Illyes und Martin Splitt, Google (via Search Engine Journal)
- Illyes: “we don’t have infinite space, so we want to index stuff that we think– well, not we– but our algorithms determine that it might be searched for…” (Übersetzung) „Wir haben keinen unbegrenzten Speicher und möchten deshalb Inhalte indexieren, bei denen unsere Algorithmen davon ausgehen, dass danach gesucht werden könnte.“ Zum Beitrag
- Splitt: “I usually describe it as a challenge with the balance between not overwhelming the website and also spending our resources where it matters.” (Übersetzung) „Ich beschreibe es meist als die Herausforderung, eine Website nicht zu überlasten und unsere Ressourcen zugleich dort einzusetzen, wo sie zählen.“ Zum Beitrag
Bing / Microsoft
- “As Bingbot crawls the web, it sends information to Bing about what it finds. These pages are then added to the Bing index.” (Übersetzung) „Bingbot meldet seine Funde während des Web-Crawlings an Bing; die gefundenen Seiten gelangen danach in den Bing-Index.“ — Microsoft Support. Zur Quelle
Checkliste für die Indexierungsgesundheit
Ein kurzer Prüfdurchlauf, ob die richtigen Seiten indexiert sind und die falschen nicht:
- Seiten, die du indexieren möchtest, sind crawlbar, nicht in
robots.txtblockiert und über interne Links erreichbar; es gibt keine verwaisten Seiten. - Wichtige Seiten liefern
200, tragen nicht versehentlichnoindexund verweisen mitrel=canonicalauf sich selbst oder die richtige kanonische URL. - Im Seitenindexierungsbericht der Search Console erscheinen wichtige Templates als indexiert; „Gecrawlt/Entdeckt – zurzeit nicht indexiert“ ist geprüft.
- Die Status zu Duplikaten und kanonischen URLs sind geprüft; Googles Auswahl entspricht deiner Absicht.
- Seiten, die nicht in den Index gehören, verwenden
noindexals Meta-Tag oderX-Robots-Tagund bleiben crawlbar, damit Google die Anweisung erkennt. - Du verwendest
robots.txtnicht, um Inhalte aus dem Index zu entfernen. - Im Bericht gibt es keine unerwarteten Fälle von „Indexiert, obwohl durch robots.txt blockiert“.
- Von JavaScript abhängige Inhalte werden als indexierbares HTML gerendert.
- Die Sitemap enthält nur kanonische, indexierbare URLs; sie unterstützt die Entdeckung, nicht die Auswahl.
Mentale Modelle
1. Die Pipeline — Crawl → Index → Auslieferung. Jede Phase ist ein Filter; nicht alle Seiten durchlaufen jede Phase. Bevor du etwas änderst, ermittle die Stelle des Fehlers: Wurde die Seite gecrawlt, indexiert und für die Suchanfrage ausgeliefert?
2. Gecrawlt ≠ indexiert ≠ Ranking. Gecrawlt bedeutet heruntergeladen. Indexiert bedeutet gespeichert und teilnahmeberechtigt. Das Ranking ist ein eigener Wettbewerb zwischen indexierten Seiten. Indexierung ist kein Rankingfaktor, aber ohne sie kann eine Seite nicht ranken.
3. Indexierung ist eine Auswahlentscheidung. Google entscheidet, was gespeichert wird; eine Indexierung ist nicht garantiert. Bei einer ausgeschlossenen Seite lautet die entscheidende Frage selten „Habe ich sie eingereicht?“, sondern fast immer „Ist sie das Speichern wert?“. Verbessere den Wert, statt sie erneut einzureichen.
4. Kanonisierung ist Teil der Indexierung.
Duplikate werden gruppiert und eine repräsentative URL wird gespeichert.
rel=canonical ist ein Hinweis, den Google überstimmen kann. Wird die falsche URL
indexiert, prüfe alle Signale wie interne Links, Sitemaps und Weiterleitungen, nicht
nur das Tag.
5. Die Entscheidungsregel für einen Ausschluss.
Soll die Seite aus dem Index verschwinden? Crawling erlauben und noindex setzen.
Sollen Bots einen URL-Bereich vollständig auslassen, ohne dass eine mögliche
Indexierung über Links relevant ist? In robots.txt sperren. Verwende eine solche
Sperre nie zum Entfernen aus dem Index.
Indexierungssteuerung und Status — Spickzettel
Was die einzelnen Steuerungsmittel tatsächlich bewirken
| Steuerung | Stoppt Crawling? | Stoppt Indexierung? | Geeignet für |
|---|---|---|---|
noindex (Meta/HTTP-Header) | Nein, muss crawlbar bleiben | Ja | Eine Seite aus dem Index entfernen |
Sperre in robots.txt | Ja | Nein | Bots von minderwertigen URL-Bereichen fernhalten |
rel=canonical | Nein | Konsolidiert als Hinweis | Auf das bevorzugte Duplikat verweisen |
| URL-Entfernungstool (GSC) | Nein | Vorübergehend (etwa sechs Monate) | Schnelles Ausblenden, während noindex ergänzt wird |
Wichtige Statusangaben im Seitenindexierungsbericht
| Status | Bedeutung | Maßnahme |
|---|---|---|
| Gecrawlt – zurzeit nicht indexiert | Gecrawlt, aber als nicht speicherwürdig bewertet | Qualität und Wert verbessern; nicht erneut einreichen |
| Entdeckt – zurzeit nicht indexiert | Gefunden, Crawl verschoben; lange Dauer kann ein Wertsignal sein | Wert verbessern; interne Links prüfen |
| Duplikat, Google wählte eine andere kanonische URL | Die angegebene kanonische URL wurde überstimmt | Signale für die bevorzugte URL stärken |
| Indexiert, obwohl durch robots.txt blockiert | Blockiert, aber über Links indexiert | Entsperren und zum Entfernen noindex setzen |
URL mit noindex markiert | noindex erkannt und beachtet | Nichts; die Regel funktioniert |
| Seite mit Weiterleitung / Soft 404 | Nicht kanonische Weiterleitung oder unechte 404 | Weiterleitung korrigieren oder echten 404/410 liefern |
Kurzfakten
- Die Indexierung ist nicht garantiert; Google wählt aus, was gespeichert wird.
noindexfunktioniert nur, wenn die Seite crawlbar ist.robots.txtblockiert das Crawling, nicht die Indexierung; eine gesperrte Seite kann weiterhin indexiert werden.rel=canonicalist ein Hinweis, keine Anweisung; Google nutzt ungefähr 40 Auswahlsignale.- Indexierung ist kein Rankingfaktor, sondern die Voraussetzung für die Teilnahme am Ranking.
Tools zum Prüfen und Steuern der Indexierung
Prüfe mit dem Google Index Checker, ob eine bestimmte Seite indexiert ist:
- Füge die genaue öffentliche URL in das Tool ein.
- Starte Signale prüfen, um die Live-Antwort abzurufen.
- Lies den gemeldeten Status sowie Weiterleitungs-,
noindex- und Canonical-Signale. - Nutze URL-Prüfung öffnen für Googles tatsächliche Indexentscheidung. Das Tool selbst meldet nur öffentlich beobachtbare Signale.
- Google Search Console — Seitenindexierungsbericht — Googles eigene Sicht darauf, welche Seiten indexiert sind und warum andere ausgeschlossen wurden.
- URL-Prüfung (GSC) — zeigt für eine einzelne URL den Indexstatus, Googles gewählte kanonische URL und das gerenderte HTML.
- Bing Webmaster Tools — Indexabdeckung, URL-Prüfung und Einreichung für Bing.
- Der Operator
site:— eine schnelle, grobe Prüfung indexierter Inhalte, aber kein Ersatz für die Search Console. - Crawler und Website-Audits — Ahrefs Site Audit und Screaming Frog SEO Spider
finden
noindex-Tags, Canonical-Konflikte, Duplikat-Cluster und Probleme mit der Indexierbarkeit im großen Maßstab. - Ahrefs Webmaster Tools — kostenloser Crawl und Audit für verifizierte Websites, einschließlich Hinweisen auf Indexierbarkeitsprobleme.
Empfehlenswerte Ressourcen
Meine weiterführenden Beiträge
- Einsteigerleitfaden zur technischen SEO — wie die Indexierung ins Gesamtbild passt.
- URLs aus der Google-Suche entfernen: fünf Methoden — richtige und falsche Wege zur Entfernung.
- Indexiert, obwohl durch robots.txt blockiert — warum blockierte Seiten indexiert werden und wie du das behebst.
- Kanonisierung: Ein Einsteigerleitfaden — wie Google die zu indexierende URL auswählt.
- Was „Gecrawlt – zurzeit nicht indexiert“ bedeutet — Diagnose des häufigsten Ausschlussstatus.
Von anderen Autorinnen und Autoren
- Robots-Meta-Tag und X-Robots-Tag: der vollständige Leitfaden (Michal Pecánek, Ahrefs) — eine umfassende Referenz zu
noindex, einschließlich: “Never disallow crawling of content that you’re trying to get deindexed in robots.txt.” (Übersetzung) „Sperre in robots.txt niemals das Crawling von Inhalten, die du aus dem Index entfernen möchtest.“ - r/TechSEO — die Community zur Fehlersuche bei Crawling und Indexierung.
Aus der Branche
- Google: Der Status „Entdeckt – zurzeit nicht indexiert“ kann dauerhaft bleiben (Search Engine Journal) — Muellers Aussage im Zusammenhang und praktische Folgerungen für betroffene Websites.
- Google erläutert Indexierung und Crawl-Budget (Search Engine Journal) — Mueller, Illyes und Splitt erklären, warum Google nicht alles indexiert und wie die Wertentscheidung funktioniert.
- Gary Illyes über Information Retrieval in der Google-Suche (Search Engine Roundtable) — begrenzter Indexspeicher und Googles selektive Speicherung.
- Einblicke in Caffeine, Googles Indexierungssystem (Google-Podcast) — das Search-Relations-Team erklärt, wie Caffeine Crawl-Daten aufnimmt, Seiten rendert, Signale extrahiert und den Index erstellt.
Mein Vortrag
- So funktioniert die Suche (SlideShare) — mein Überblick über Crawling, Rendering, Indexierung und Ranking. Es gilt mein üblicher Hinweis: Dies ist mein Verständnis der Systeme und nicht zu 100% vollständig oder exakt.
Podcasts
- Googles Such-Podcast — Einblicke in Caffeine, Googles Indexierungssystem, und mehr. Das Google-Team erklärt, wie das System Crawl-Daten aufnimmt, Seiten rendert, Informationen extrahiert, Signale berechnet und den Index aufbaut. Anhören
Videos
- Google Search Central (YouTube) — die Reihe So funktioniert die Google-Suche und Martin Splitts Erklärvideos zu Indexierung und Rendering, einschließlich Kanonisierung und JavaScript-SEO. Zum Kanal
Teste dein Wissen: Indexierung
Fünf kurze Fragen dazu, wie Seiten indexiert werden und warum das ausbleiben kann. Wähle jeweils eine Antwort und prüfe anschließend das Ergebnis.
Änderungsprotokoll
Aktualisiert am 13. Aug. 2026.
Redaktionelle Zusammenfassung und aufgezeichnete Änderungsdetails.Änderungsdetails
-
Detaillierte Änderungsangaben sind derzeit auf Englisch verfügbar.
Vollständiger Vergleich nicht verfügbar — für diese Version wurde kein früherer Schnappschuss archiviert.
Aktualisiert am 13. Aug. 2026.
Redaktionelle Zusammenfassung und aufgezeichnete Änderungsdetails.Änderungsdetails
-
Detaillierte Änderungsangaben sind derzeit auf Englisch verfügbar.
Vollständiger Vergleich nicht verfügbar — für diese Version wurde kein früherer Schnappschuss archiviert.
Aktualisiert am 18. Juli 2026.
Redaktionelle Zusammenfassung und aufgezeichnete Änderungsdetails.Änderungsdetails
- Anfänger
Detaillierte Änderungsangaben sind derzeit auf Englisch verfügbar.
- Anfänger
Detaillierte Änderungsangaben sind derzeit auf Englisch verfügbar.
- Fortgeschritten
Detaillierte Änderungsangaben sind derzeit auf Englisch verfügbar.
Vollständiger Vergleich nicht verfügbar — für diese Version wurde kein früherer Schnappschuss archiviert.