Indexierung

So speichern und organisieren Suchmaschinen Seiten für Rankings: Inhaltsanalyse, Kanonisierung, warum gecrawlt nicht indexiert bedeutet und wie der GSC-Bericht zur Seitenindexierung gelesen wird.

Erstveröffentlicht: 23. Juni 2026 · Zuletzt aktualisiert: 13. Aug. 2026 · Fortgeschritten
Sprachen
1 Evidenzsignal auf dieser Seite

Indexierung ist die zweite Suchphase – Crawling, Indexierung, Auslieferung. Nach dem Crawling versteht die Suchmaschine eine Seite, erkennt Duplikate, wählt eine kanonische Fassung und speichert sie bei ausreichender Qualität im Suchindex. Gecrawlt bedeutet nicht indexiert; Google wählt aus, und Indexierung ist nicht garantiert. Sie ist kein Rankingfaktor, aber eine Seite muss indexiert sein, bevor sie ranken kann. Um eine Seite auszuschließen, verwenden Sie noindex; die Seite bleibt crawlbar und wird nicht in robots.txt blockiert.

TL;DR — Indexierung ist die zweite von drei Suchphasen: Crawling, Indexierung, Auslieferung. Google versteht eine gecrawlte Seite einschließlich Text, wichtiger Tags, Bilder, Videos und gerendertem JavaScript, erkennt Duplikate, gruppiert ähnliche Seiten, wählt die repräsentativste kanonische URL und speichert Signale im Index. rel=canonical ist ein Hinweis, keine Regel. Gecrawlt bedeutet nicht indexiert; Qualität und Wert entscheiden wesentlich mit. Der Search-Console-Bericht zur Seitenindexierung ist das Diagnosezentrum. Zum Deindexieren noindex setzen und die Seite crawlbar lassen; robots.txt entfernt keine Seite und kann eine Indexierung ohne Snippet nicht verhindern.

Evidence for this claim Google must be able to crawl a page to see and apply its noindex rule. Scope: Google-supported robots meta and X-Robots-Tag directives; a robots.txt block can prevent Google from seeing the rule. Confidence: high · Verified: Google Search Central: Block Search indexing with noindex

Indexierung ist die zweite von drei Phasen

Indexing is stage two of three — the middle filter between crawling and ranking. Quelle: /technical-seo/how-search-works/indexing/

Three stages run left to right. Crawl discovers and downloads a URL. Index processes the page and stores eligible information. Serve or rank orders the best indexed matches for a query. The Index stage is highlighted, and a note says not every page advances through every stage.

© Patrick Stox LLC · CC BY 4.0 ·

Google beschreibt die Pipeline klar: “Google Search works in three stages, and not all pages make it through each stage” (Übersetzung) „Google Search arbeitet in drei Phasen, und nicht jede Seite durchläuft jede Phase“ – Crawling, Indexierung und Auslieferung. Die mittlere Phase lautet: “Indexing: Google analyzes the text, images, and video files on the page, and stores the information in the Google index, which is a large database.” (Übersetzung) „Bei der Indexierung analysiert Google Text-, Bild- und Videodateien der Seite und speichert die Informationen im großen Google-Index.“

Evidence for this claim Google Search describes crawling, indexing, and serving as three distinct stages; indexing analyzes page content and stores eligible information in Google's index. Scope: web search Confidence: high · Verified: In-depth guide to how Google Search works

Eine Seite muss gecrawlt werden, bevor sie indexiert werden kann, und indexiert sein, bevor sie ranken kann. Keine Phase ist garantiert; jede wirkt als Filter. Fragen Sie deshalb vor jeder Änderung, in welcher Phase eine Seite scheitert. Die vorherige Phase behandelt der Überblick zum Crawling.

Was während der Indexierung geschieht

Indexing is a sequence: understand, cluster and select a canonical, then store. Quelle: /technical-seo/how-search-works/indexing/

Step one analyzes a crawled page for text, title, alt text, images, and video. Step two groups duplicate URLs into a cluster and chooses the most representative page as canonical. Step three stores the canonical page and its cluster information in the Google index.

© Patrick Stox LLC · CC BY 4.0 ·

Indexierung ist kein einzelner Vorgang, sondern eine Abfolge:

  • Inhalt verstehen. Google erklärt: “After a page is crawled, Google tries to understand what the page is about. This stage is called indexing.” (Übersetzung) „Nach dem Crawling versucht Google, das Thema der Seite zu verstehen. Diese Phase heißt Indexierung.“ Dazu analysiert Google “the textual content and key content tags and attributes, such as <title> elements and alt attributes, images, videos, and more” (Übersetzung) „Text, wichtige Inhaltstags und Attribute wie <title>, Alternativattribute, Bilder, Videos und mehr“. JavaScript muss dafür zunächst gerendert werden.
  • Duplikate erkennen und kanonisieren. Google bestimmt, ob eine Seite ein Duplikat oder kanonisch ist. Ähnliche Inhalte werden zunächst gruppiert, anschließend wird die repräsentativste URL gewählt. “The canonical is the page that may be shown in search results.” (Übersetzung) „Die kanonische Seite kann in Suchergebnissen erscheinen.“
  • Signale berechnen und speichern. “The collected information about the canonical page and its cluster may be stored in the Google index, a large database hosted on thousands of computers.” (Übersetzung) „Die Informationen zur kanonischen Seite und ihrem Cluster können im Google-Index gespeichert werden, einer großen Datenbank auf Tausenden Computern.“ Das benannte Indexierungssystem dahinter heißt Caffeine.

Kanonisierung: ein Hinweis, kein Befehl

Kanonisierung geschieht während der Indexierung. Wie ich in meinem Leitfaden zur Kanonisierung erläutere, geschieht die Auswahl anhand zahlreicher Signale. Google definiert sie so: “Canonicalization is the process of selecting the representative –canonical– URL of a piece of content” (Übersetzung) „Kanonisierung ist die Auswahl der repräsentativen kanonischen URL eines Inhalts“. Sie hilft Google, nur eine Fassung ansonsten doppelter Inhalte in Suchergebnissen zu zeigen.

Entscheidend ist: rel=canonical ist ein Vorschlag. Google sagt: “indicating a canonical preference is a hint, not a rule.” (Übersetzung) „Die Angabe einer kanonischen Präferenz ist ein Hinweis, keine Regel.“ Google berücksichtigt viele Signale; laut Allan Scott sind es ungefähr 40. Daher kann Google eine andere URL wählen als die markierte. Genau darauf weist der Search-Console-Status “Duplicate, Google chose different canonical than user” (Übersetzung) „Duplikat – Google hat eine andere kanonische URL als der Nutzer gewählt“ hin.

Gecrawlt ist nicht indexiert: Gründe für Ausschlüsse

Die Dokumentation stellt klar: “Indexing isn’t guaranteed; not every page that Google processes will be indexed.” (Übersetzung) „Indexierung ist nicht garantiert; nicht jede von Google verarbeitete Seite wird indexiert.“ Evidence for this claim Google does not guarantee that every processed page will be indexed. Scope: Google Search indexing; the source gives examples of possible causes rather than an exhaustive decision formula. Confidence: high · Verified: Google Search Central: In-depth guide to how Google Search works Genannte Gründe sind geringe Inhaltsqualität, “Robots meta rules disallow indexing,” (Übersetzung) „Robots-meta-Regeln untersagen die Indexierung“ und ein indexierungsfeindliches Webdesign.

Google-Vertreter beschreiben dies als wertbasierte Auswahlentscheidung, nicht als Quote:

  • John Mueller sagt zu dauerhaft „Entdeckt/Gecrawlt – zurzeit nicht indexiert“: “That can be forever. It’s something where we just don’t crawl and index all pages.” (Übersetzung) „Das kann für immer so bleiben; wir crawlen und indexieren nicht alle Seiten.“ Statt erneut einzureichen, sollte die Website erkennbaren Wert schaffen.
  • Mueller ergänzt: “it’s important to keep in mind that Google just doesn’t index every page on the web, even if it’s submitted directly.” (Übersetzung) „Google indexiert nicht jede Seite im Web, selbst wenn sie direkt eingereicht wurde.“
  • Gary Illyes erklärt: “we don’t have infinite space” (Übersetzung) „Wir haben keinen unbegrenzten Speicher“ und Algorithmen wählen vermutlich gesuchte Inhalte aus.
  • Martin Splitt beschreibt die Balance zwischen dem Schutz der Website vor Überlastung und dem Einsatz von Ressourcen an relevanten Stellen.

Eine Sitemap oder „Indexierung beantragen“ unterstützt die Entdeckung, erzwingt aber keine Auswahl. Entscheidend sind Qualität und Wert der Website.

Den Bericht zur Seitenindexierung in der Google Search Console lesen

Im Seitenindexierungsbericht werden Indexierungsprobleme konkret sichtbar. Jeder Status ist eine Diagnose. Dies sind Googles wörtliche Beschreibungen:

  • Gecrawlt – zurzeit nicht indexiert: “The page was crawled by Google but not indexed. It may or may not be indexed in the future; no need to resubmit this URL for crawling.” (Übersetzung) „Die Seite wurde von Google gecrawlt, aber nicht indexiert. Sie kann künftig indexiert werden oder auch nicht; die URL muss nicht erneut zum Crawlen eingereicht werden.“ Meist ist das ein Qualitäts- oder Werturteil: Verbessere die Seite, statt sie wiederholt einzureichen.
  • Entdeckt – zurzeit nicht indexiert: “The page was found by Google, but not crawled yet. Typically, Google wanted to crawl the URL but this was expected to overload the site; therefore Google rescheduled the crawl.” (Übersetzung) „Google hat die Seite gefunden, aber noch nicht gecrawlt. Meist wollte Google die URL crawlen, erwartete dabei jedoch eine Überlastung der Website und verschob den Crawl.“ Technisch ist das ein kapazitätsbedingter Status vor dem Crawl. Bleibt er lange bestehen, bringen Google-Vertreter ihn ebenfalls mit dem Wert der Seite in Verbindung.
  • Duplikat ohne vom Nutzer ausgewählte kanonische URL: “This page is a duplicate of another page, although it doesn’t indicate a preferred canonical page. Google has chosen the other page as the canonical for this page, and so will not serve this page in Search.” (Übersetzung) „Diese Seite ist ein Duplikat einer anderen Seite, nennt aber keine bevorzugte kanonische Seite. Google hat die andere Seite als kanonische Version gewählt und zeigt diese Seite daher nicht in der Suche an.“
  • Duplikat – Google wählte eine andere kanonische URL: “This page is marked as canonical for a set of pages, but Google thinks another URL makes a better canonical.” (Übersetzung) „Diese Seite ist für eine Gruppe von Seiten als kanonisch markiert, Google hält jedoch eine andere URL für die bessere kanonische Version.“ Das ist die praktische Folge davon, dass die Angabe nur ein Hinweis und keine Regel ist.
  • Alternative Seite mit korrektem Canonical-Tag: “This page is marked as an alternate of another page… This page correctly points to the canonical page, which is indexed, so there is nothing you need to do.” (Übersetzung) „Diese Seite ist als Alternative zu einer anderen Seite markiert. Sie verweist korrekt auf die indexierte kanonische Seite; es besteht kein Handlungsbedarf.“
  • Indexiert, obwohl durch robots.txt blockiert: “The page was indexed despite being blocked by your website’s robots.txt file. Google always respects robots.txt, but this doesn’t necessarily prevent indexing if someone else links to your page.” (Übersetzung) „Die Seite wurde indexiert, obwohl die robots.txt deiner Website sie blockiert. Google beachtet robots.txt, doch Links anderer Websites können eine Indexierung trotzdem ermöglichen.“ Das belegt: Das Blockieren des Crawlings verhindert die Indexierung nicht.
  • URL durch robots.txt blockiert: “This page was blocked by your site’s robots.txt file.” (Übersetzung) „Diese Seite wurde durch die robots.txt deiner Website blockiert.“
  • URL mit noindex markiert: “When Google tried to index the page it encountered a ‘noindex’ directive and therefore did not index it.” (Übersetzung) „Beim Versuch, die Seite zu indexieren, erkannte Google eine noindex-Anweisung und indexierte sie deshalb nicht.“ Hier funktioniert die Entfernung aus dem Index wie vorgesehen.
  • Seite mit Weiterleitung: “This is a non-canonical URL that redirects to another page. As such, this URL will not be indexed.” (Übersetzung) „Dies ist eine nicht kanonische URL, die auf eine andere Seite weiterleitet. Daher wird diese URL nicht indexiert.“
  • Soft 404: “The page request returns what we think is a soft 404 response. This means that it returns a user-friendly ‘not found’ message but not a 404 HTTP response code.” (Übersetzung) „Die Seitenanfrage liefert nach Googles Einschätzung eine Soft-404-Antwort: eine nutzerfreundliche Nicht-gefunden-Meldung, aber keinen HTTP-Statuscode 404.“

Indexierung richtig steuern

Damit eine Seite indexiert wird: Mache sie crawlbar, verlinke sie intern, nimm sie in die Sitemap auf und sorge vor allem dafür, dass sie die Indexierung verdient. Hilfen zur Entdeckung setzen die Wertentscheidung nicht außer Kraft.

Damit eine Seite draußen bleibt — eine der häufigsten Fehlkonfigurationen in der SEO: Verwende noindex, “a rule set with either a <meta> tag or HTTP response header,” (Übersetzung) „eine Regel, die entweder mit einem <meta>-Tag oder einem HTTP-Antwortheader gesetzt wird“ und halte die Seite crawlbar. Googles zentrale Warnung lautet: “For the noindex rule to be effective, the page or resource must not be blocked by a robots.txt file, and it has to be otherwise accessible to the crawler.” (Übersetzung) „Damit die noindex-Regel wirksam ist, darf die Seite oder Ressource nicht durch eine robots.txt-Datei blockiert sein und muss für den Crawler anderweitig erreichbar bleiben.“

Evidence for this claim For Google to apply noindex, the crawler must be allowed to access the page or resource; a robots.txt block can prevent Google from seeing the rule. Scope: HTML and HTTP resources Confidence: high · Verified: Block Search indexing with noindex

Ein häufiger Fehler ist, noindex zu setzen und die Seite zugleich in robots.txt zu sperren. Das ist kontraproduktiv. In URLs aus der Google-Suche entfernen formuliere ich es so: “For these tags to be seen, a search engine needs to be able to crawl the pages—so make sure they aren’t blocked in robots.txt,” (Übersetzung) „Damit diese Tags erkannt werden, muss eine Suchmaschine die Seiten crawlen können; sie dürfen also nicht in robots.txt blockiert sein.“ Außerdem gilt: “Crawling is not the same thing as indexing. Even if Google is blocked from crawling pages, if there are any internal or external links to a page they can still index it.” (Übersetzung) „Crawling und Indexierung sind nicht dasselbe. Selbst wenn Google eine Seite nicht crawlen darf, kann sie über interne oder externe Links indexiert werden.“ Im Beitrag Indexiert, obwohl durch robots.txt blockiert steht noch deutlicher: “Unless Google can crawl a page, they won’t see the noindex meta tag and may still index it because it has links.” (Übersetzung) „Wenn Google eine Seite nicht crawlen kann, sieht Google das noindex-Meta-Tag nicht und kann sie wegen vorhandener Links weiterhin indexieren.“ Die Lösung: “Just add a noindex meta robots tag and make sure to allow crawling—assuming it’s canonical.” (Übersetzung) „Füge einfach ein noindex-Meta-Robots-Tag hinzu und erlaube das Crawling, sofern die Seite kanonisch ist.“

Den vollständigen Entscheidungsbaum zur Entfernung — 404/410 gegenüber noindex, die ungefähr sechsmonatige Ausblendung durch das Entfernungstool und Passwortschutz — findest du unter Eine Seite aus dem Index entfernen.

Indexierung in Bing

Bing verwendet dieselbe Pipeline. Microsoft beschreibt sie so: “As Bingbot crawls the web, it sends information to Bing about what it finds. These pages are then added to the Bing index.” (Übersetzung) „Während Bingbot das Web crawlt, übermittelt er Bing Informationen über seine Funde. Diese Seiten werden anschließend dem Bing-Index hinzugefügt.“ Es gelten dieselben Steuerungsmittel: noindex hält eine Seite aus dem Index heraus, während eine zu restriktive robots.txt verhindern kann, dass Bingbot sie überhaupt crawlt. Außerdem benötigt Bing mindestens einen Link auf deine Website, um sie zunächst zu entdecken.

Nicht jede Seite gehört in den Index

Eine einfache Prüffrage, keine allgemeingültige Regel: Eine Seite ist die Indexierung wert, wenn sie für eine Suche ein eigenständiges, nützliches Ergebnis liefern kann. Daran solltest du Duplikate, Parametervarianten, private oder Staging-URLs sowie dünne oder repetitive Bestandsseiten messen. Es ist kein Grund, standardmäßig einen ganzen Seitentyp auf noindex zu setzen. Prüfe anschließend die Seiten, die das Thema wirklich abdecken sollen, vollständig.

Nächste Schritte im Indexierungs-Cluster

Dieser Hub liefert den Überblick. Im großen Maßstab treten vor allem zwei Probleme auf, die jeweils eine eigene Vertiefung verdienen:

  • Index-Bloat — Zu viele minderwertige, doppelte oder dünne URLs gelangen in den Index, verwässern die Website und verschwenden Crawl- und Indexierungsressourcen. Lerne, das Problem zu diagnostizieren und sicher zu bereinigen.
  • Mobile-First-Indexierung — Google indexiert die mobile Version deiner Seiten. Inhalte, Links und strukturierte Daten müssen daher auf Mobilgeräten und Desktop übereinstimmen. Prüfe, was abweicht und wodurch es zu Fehlern kommt.

Beide Themen sind diesem Hub untergeordnet, erscheinen auch in der Seitenleiste und verlinken hierher zurück.

Die vorherige Phase — wie Bots deine Seiten entdecken und herunterladen — wird im Hub Crawling behandelt. Crawl → Index ist die Reihenfolge, und eine Seite muss den Crawl durchlaufen, bevor die hier beschriebenen Schritte greifen. Den Gesamtüberblick liefert So funktioniert die Suche.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.