Crawling
Wie Suchmaschinen das Web entdecken und herunterladen — Googlebot und Bingbot, URL discovery, der Crawl-Scheduler, Rendering und der Unterschied zwischen Crawling, Indexing und Ranking. Der Hub für alles rund um das Crawling.
Sprachen
1 Evidenzsignal auf dieser Seite
- Verknüpfte Quelldatengooglebot.json
Crawling ist Stufe eins der Suche (Crawl → Index → Serve): Bots wie Googlebot und Bingbot entdecken URLs und laden Seiten herunter, damit diese gerendert, indexiert und gerankt werden können. Crawling ist notwendig, um in der Suche zu erscheinen, aber es ist kein Ranking-Faktor — und es ist sowohl vom Indexing als auch vom Rendering zu unterscheiden. Die meisten Websites müssen ihr Crawl Budget nie verwalten; wenn das Crawling doch einmal klemmt, sind Server-Logs die Grundwahrheit. Dieser Hub erklärt die gesamte Pipeline und verweist auf die Vertiefungen.
TL;DR — Crawling ist die Art und Weise, wie Suchmaschinen Ihre Seiten finden und herunterladen. Ein Bot (Googlebot bei Google, Bingbot bei Bing) folgt Links und liest Sitemaps, um URLs zu entdecken, und ruft sie anschließend ab. Eine Seite muss gecrawlt werden, bevor sie in der Suche auftauchen kann — häufiges Crawling führt aber nicht zu besseren Rankings.
Was Crawling ist
Suchmaschinen surfen nicht so durch das Web wie Sie. Sie schicken automatisierte Programme aus — Crawler, Bots oder Spider genannt —, die Seiten besuchen, deren Inhalte herunterladen und den Links folgen, um weitere Seiten zu finden. Googles Crawler heißt Googlebot, der von Bing Bingbot.
Stellen Sie es sich als drei Schritte in fester Reihenfolge vor:
- Crawl — der Bot entdeckt eine URL und lädt die Seite herunter.
- Index — die Suchmaschine verarbeitet diese Seite und legt sie in einer riesigen Datenbank all dessen ab, was sie in den Ergebnissen zeigen könnte.
- Serve (Ranking) — sucht jemand, holt die Suchmaschine die besten Treffer aus dem Index und bringt sie in eine Reihenfolge.
Crawling ist Schritt eins. Wird eine Seite nie gecrawlt, kann sie nicht indexiert werden, und ohne Indexing kann sie nicht ranken. Crawling ist also wichtig — aber es ist eine Schranke, keine Punktetafel.
Wie Crawler Ihre Seiten finden
Im Wesentlichen auf zwei Wegen:
- Links folgen. Crawlt ein Bot eine Seite, sammelt er die dort enthaltenen Links ein und nimmt diese URLs in seine Liste der als Nächstes zu crawlenden Adressen auf. Gute interne Verlinkung ist der Weg, auf dem neue Seiten gefunden werden.
- Sitemaps. Eine XML sitemap ist eine Liste Ihrer URLs, die Sie den Suchmaschinen direkt übergeben, damit sie nicht alles über Links entdecken müssen.
Daneben gibt es „Push“-Optionen, mit denen Sie einer Suchmaschine aktiv mitteilen, dass sich eine Seite geändert hat — dazu unten mehr —, doch Links und Sitemaps erledigen den größten Teil der Arbeit.
So unterstützen Sie Suchmaschinen beim Crawling Ihrer Website
- Verlinken Sie Ihre wichtigen Seiten von anderen Seiten aus (insbesondere von der Startseite und der Hauptnavigation).
- Reichen Sie eine XML sitemap in der Google Search Console und in den Bing Webmaster Tools ein.
- Blockieren Sie nicht versehentlich Seiten, die gefunden werden sollen (prüfen Sie Ihre
robots.txt). - Halten Sie Ihren Server schnell und stabil — ist er langsam oder liefert er Fehler, halten sich Bots zurück und crawlen weniger.
Der häufigste Denkfehler
Crawling ist kein Ranking. Häufiger gecrawlt zu werden bringt Sie in den Ergebnissen
nicht nach oben. Und eine Seite in der robots.txt zu blockieren entfernt sie nicht aus
Google — es hindert Google lediglich daran, sie zu lesen. Evidence for this claim robots.txt controls crawler access and is not a reliable way to keep a URL out of Google. Scope: Google Search behavior for URLs blocked by robots.txt; blocked URLs may still be indexed when discovered elsewhere. Confidence: high · Verified: Google Search Central: Introduction to robots.txt Wenn Sie eine Seite wirklich
loswerden wollen, lassen Sie das Crawling zu und ergänzen ein noindex-Tag. (Die Blockade-Seite
davon habe ich selbst getestet — siehe die Advanced-Fassung.)
Sie möchten die tiefere Fassung, mit der Funktionsweise des Crawl-Schedulers, den Byte-Limits und der Unterscheidung zwischen Crawling, Indexing und Ranking? Wechseln Sie zum Tab Fortgeschritten.
TL;DR — Crawling ist die erste der drei Stufen der Suche (Crawl → Index → Serve). Bots entdecken URLs per Pull (Links + Sitemaps) und Push (IndexNow, Indexing API) und rufen sie dann nach einem algorithmischen Zeitplan ab, der sich am Zustand Ihres Servers drosselt. Das Rendering von JavaScript ist ein eigener Schritt. Crawling ist Voraussetzung für ein Ranking, aber selbst kein Ranking-Signal, und es ist vom Indexing zu unterscheiden — eine per robots blockierte Seite kann trotzdem indexiert werden. Die meisten Websites müssen ihr Crawl Budget nicht verwalten; in den Logs sehen Sie, was tatsächlich passiert ist.
Crawling ist Stufe eins von dreien
Three stages run left to right. Crawl: a bot discovers a URL and downloads the page. Index: the engine processes the page and stores eligible information. Serve or rank: the best indexed matches are ordered for a query. The Crawl stage is highlighted, and a note says not every page advances through every stage.
© Patrick Stox LLC · CC BY 4.0 ·
Google ist bei der Pipeline unmissverständlich: “Google Search works in three stages, and not all pages make it through each stage” (Übersetzung) „Die Google Suche arbeitet in drei Stufen, und nicht alle Seiten kommen durch jede Stufe“ — Crawling, Indexing und Serving. Evidence for this claim Google describes Search as three stages: crawling, indexing, and serving results. Scope: Google Search's documented processing model; it does not guarantee that a page reaches every stage. Confidence: high · Verified: Google Search Central: In-depth guide to how Google Search works Der Teil „nicht alle Seiten kommen durch“ ist in der Technical SEO das ganze Spiel. Eine Seite kann gecrawlt, aber nicht indexiert sein, oder indexiert, aber nie für eine Suchanfrage ausgeliefert werden. Diese Stufen gedanklich getrennt zu halten ist hier das mit Abstand nützlichste mentale Modell.
Wer tatsächlich crawlt
„Googlebot“ klingt nach einem einzigen Programm. Ist er aber nicht. In meinem Deck How Search Works beschreibe ich ihn als 1 000+ Systeme, die eine Familie spezialisierter Crawler betreiben — Desktop, Mobile, Bilder, News, Video, Ads —, wobei die Anfragen überwiegend aus Mountain View stammen. Sie alle schöpfen aus demselben Crawl-Budget-Pool, weshalb ein aus dem Ruder gelaufenes Bilder- oder Parameter-Crawling das Crawling Ihrer eigentlichen Inhalte aushungern kann.
Und es sind längst nicht mehr nur Suchmaschinen. In meiner Auswertung von Cloudflare-Radar-Daten (Die neuen Web-Crawler) crawlen Suchmaschinen-Bots weiterhin am meisten — aber AI-Bots liegen klar auf Platz zwei und sind auf dem Weg, sie in den nächsten Jahren zu überholen. Wer seine Logs liest, merkt: Die Besetzung hat sich geändert.
Wie Crawler URLs entdecken
Two discovery routes feed one crawl queue. Pull discovery includes following links and sitemaps. Push discovery includes IndexNow for Bing, Yandex, and other participating engines but not Google for general pages; the Google Indexing API for JobPosting and BroadcastEvent pages; and change notifications through sitemap lastmod, RSS, and WebSub.
© Patrick Stox LLC · CC BY 4.0 ·
Discovery funktioniert sowohl per Pull als auch per Push:
- Pull — Links. Google: “Other pages are discovered when Google extracts a link from a known page to a new page.” (Übersetzung) „Andere Seiten werden entdeckt, wenn Google einen Link von einer bekannten Seite zu einer neuen Seite extrahiert.“ Deshalb tun sich verwaiste Seiten (auf die nichts verlinkt) schwer, gefunden zu werden.
- Pull — Sitemaps. “Still other pages are discovered when you submit a list of pages (a sitemap) for Google to crawl.” (Übersetzung) „Wieder andere Seiten werden entdeckt, wenn Sie eine Liste von Seiten (eine Sitemap) zum Crawlen an Google übermitteln.“
- Push — Änderungsmeldungen. Statt auf ein erneutes Crawling zu warten, teilen Sie der
Suchmaschine mit, dass sich etwas geändert hat: IndexNow (Bing, Yandex und andere —
Google nutzt es nicht für allgemeine Seiten) und Googles Indexing API (offiziell
nur für
JobPosting- undBroadcastEvent-Seiten).lastmodin Sitemaps, RSS und WebSub vervollständigen die Push-Optionen.
Google nennt das Ganze “URL discovery.”
Wie Crawler Seiten abrufen
- Der Zeitplan ist algorithmisch. “Googlebot uses an algorithmic process to determine which sites to crawl, how often, and how many pages to fetch from each site.” (Übersetzung) „Googlebot verwendet einen algorithmischen Prozess, um zu bestimmen, welche Websites gecrawlt werden, wie oft und wie viele Seiten von jeder Website abgerufen werden.“ Sie beeinflussen ihn, Sie legen ihn nicht fest.
- Crawling ist rücksichtsvoll. Bots drosseln sich selbst, um Ihre Website nicht
lahmzulegen: “they try not to crawl the site too fast to avoid overloading it… HTTP
500 errors mean ‘slow down.’”
(Übersetzung) „Sie versuchen, die Website nicht zu schnell zu crawlen, um sie nicht zu
überlasten … HTTP-500-Fehler bedeuten ‘langsamer’.“
Das ist der Hebel dahinter, ein Crawling vorübergehend zu verlangsamen — geben Sie
503/429zurück, und Googlebot nimmt sich zurück (für ein bis zwei Tage, nicht für immer). - Es gibt ein Byte-Limit. Seit Googles Update Inside Googlebot vom März 2026 ruft Googlebot bis zu rund 2 MB pro URL ab (herunter von der früheren Angabe von 15 MB), wobei für PDFs bis zu 64 MB erlaubt sind. Wird das überschritten, wird der Abruf abgeschnitten, nicht abgelehnt — nur der heruntergeladene Teil geht in das Indexing. Wenn Ihre kritischen Inhalte unterhalb von 2 MB Ballast liegen, ist das relevant.
- Caching senkt die Kosten des erneuten Crawlings. Googles Crawler nutzen Conditional Requests und Caching, damit unveränderte Ressourcen nicht jedes Mal erneut abgerufen werden. Google veröffentlicht keine genaue Cache-Dauer für Rendering-Ressourcen; gehen Sie deshalb bei einer Code-Änderung nicht von einem festen Aktualisierungsfenster aus — rechnen Sie mit etwas Verzögerung, nicht mit sofortiger Übernahme.
Rendering ist kein Crawling
Daran scheitern ständig Leute. “During the crawl, Google renders the page and
runs any JavaScript it finds using a recent version of Chrome.”
(Übersetzung) „Während des Crawls rendert Google die Seite und führt sämtliches
vorgefundene JavaScript mit einer aktuellen Chrome-Version aus.“
Rendering ist ein vom Abruf des HTML getrennter Schritt. Der Renderer (der Web Rendering
Service) ist zustandslos — Storage und Cookies werden zwischen den Ladevorgängen
geleert, er lehnt Berechtigungsabfragen ab und weist Service Worker zurück. Erscheinen
Ihre Inhalte erst nach einem Klick oder über eine JS-gesteuerte Navigation, die kein
echter <a href>-Link ist, müssen Sie mit Problemen bei Discovery und Rendering rechnen.
(Ausführlich in JavaScript SEO.)
Crawling vs. Indexing vs. Ranking
Die wichtigsten Unterscheidungen auf dieser Seite:
- Crawling ≠ Ranking. Crawling ist notwendig, um in den Ergebnissen zu erscheinen, ist aber kein Ranking-Signal. Häufigeres Crawling hebt Ihre Positionen nicht an. Crawl Budget ist eine Frage der Effizienz, mehr nicht.
- Crawling ≠ Indexing. Eine Seite, die Sie in der
robots.txtblockieren, kann trotzdem indexiert werden, wenn andere Seiten auf sie verlinken — Google sieht dann weder den Inhalt noch ein dort hinterlegtesnoindex-Tag. Wie ich es in Indexed, though blocked by robots.txt formuliert habe: “crawling and indexing are two different things.” (Übersetzung) „Crawling und Indexing sind zwei verschiedene Dinge.“ Um eine Seite tatsächlich zu entfernen, erlauben Sie das Crawling und ergänzennoindex— blockieren Sie die Seite nicht.
Die Blockade-Seite habe ich direkt getestet. In Was geschah, als ich zwei hoch rankende Seiten per Robots.txt blockierte habe ich zwei unserer rankenden Seiten blockiert. Das Ergebnis: “We lost a position here or there and all of the featured snippets for the pages… I expected a lot more impact, but the world didn’t end.” (Übersetzung) „Wir haben hier und da eine Position und sämtliche Featured Snippets für die Seiten verloren … Ich hatte deutlich mehr Auswirkung erwartet, aber die Welt ging nicht unter.“ Mein Fazit gilt weiterhin: “Don’t block pages you want indexed. It hurts. Not as bad as you might think it does — but it still hurts.” (Übersetzung) „Blockieren Sie keine Seiten, die indexiert werden sollen. Es tut weh. Nicht so schlimm, wie Sie vielleicht denken — aber es tut trotzdem weh.“
Wie Sie Crawling steuern
robots.txtsteuert das Crawling, nicht das Indexing. “A robots.txt file tells search engine crawlers which URLs the crawler can access on your site.” (Übersetzung) „Eine robots.txt-Datei teilt Suchmaschinen-Crawlern mit, auf welche URLs der Crawler auf Ihrer Website zugreifen kann.“ Evidence for this claim robots.txt controls crawler access and is not a reliable way to keep a URL out of Google. Scope: Google Search behavior for URLs blocked by robots.txt; blocked URLs may still be indexed when discovered elsewhere. Confidence: high · Verified: Google Search Central: Introduction to robots.txt Verwenden Sie die Datei, um Bots aus Bereichen mit geringem Wert herauszuhalten — nicht als Werkzeug zur Deindexierung.- Site Architecture und Internal Links bestimmen, wie tief Seiten liegen und ob sie überhaupt entdeckt werden (siehe Crawl depth).
- Steuerung der Crawl rate. Google hat seinen manuellen Regler für die Crawl rate in der Search Console abgeschafft (Anfang 2024) — es stützt sich nun auf die Antworten Ihres Servers und ein niedrigeres automatisches Minimum. Bing bietet weiterhin ein manuelles Crawl Control-Raster in den Bing Webmaster Tools (siehe Crawl rate).
Crawl-Effizienz und Crawl Budget
Beide Suchmaschinen denken beim Crawling in Effizienz. Gary Illyes beschreibt Googles Seite als crawl rate limit + crawl demand (Popularität und Aktualität). Bings Fabrice Canel nennt es ihren “crawl efficiency north star … to crawl a URL only when the content has been added … updated.” (Übersetzung) „Nordstern der Crawl-Effizienz … eine URL nur dann zu crawlen, wenn der Inhalt hinzugefügt … aktualisiert wurde.“
Das Beruhigende daran: Die meisten Websites müssen sich darum nicht kümmern. Google sagt es unmissverständlich — wenn Ihre Website keine große Zahl sich schnell ändernder Seiten hat oder Ihre Seiten am selben Tag gecrawlt werden, an dem sie veröffentlicht werden, “you don’t need to read this guide.” (Übersetzung) „brauchen Sie diesen Leitfaden nicht zu lesen.“ Relevant wird es etwa ab 1 Mio.+ Seiten, die sich wöchentlich ändern, oder 10 000+ Seiten, die sich täglich ändern (siehe Crawl Budget und Crawl frequency).
Evidence for this claim Sites without many rapidly changing pages, or whose new pages are crawled the day they are published, generally do not need crawl-budget management. Scope: large websites Confidence: high · Verified: Optimize your crawl budgetWenn Crawling schiefgeht — wie Sie es erkennen
Bevor Sie zu einer Lösung greifen, klären Sie, welche Stufe tatsächlich hakt — die Symptome und die Gegenmittel unterscheiden sich je Stufe:
-
Gar nicht entdeckt? Nichts verlinkt auf die Seite, und sie fehlt in Ihrer Sitemap. Bringen Sie interne Verlinkung und Sitemap-Abdeckung in Ordnung — siehe Crawl depth und Crawl frequency.
-
Entdeckt, aber nie abgerufen? Serverfehler, Timeouts oder eine Blockade in der
robots.txtweisen Bots ab. Prüfen Sie den GSC-Bericht Crawl Stats und Ihre Logs — siehe Crawl Budget und Crawl rate. -
Abgerufen, aber falsch gerendert? Der Inhalt hängt an einem Klick oder an einer reinen JS-Navigation, die Googlebot nicht ausführt, oder der WRS läuft in einen Timeout. Siehe JavaScript SEO für die renderspezifischen Fehlerbilder.
-
Abgerufen und gerendert, aber trotzdem nicht indexiert? Das ist eine eigene Entscheidung des Index — sehen Sie sich den Hub Indexing an, statt es als Crawling-Problem zu behandeln.
-
Log file analysis ist die Grundwahrheit. Ihre Server-Logs zeigen genau, welche URLs Bots tatsächlich aufgerufen haben, wie oft und welche Statuscodes sie erhalten haben — der beste Weg, verschwendetes Crawling zu erkennen und Seiten zu finden, die Bots nie erreichen (siehe Log file analysis).
-
Spider traps — unendliche URL-Räume durch Kalender, Faceted Navigation, Session-IDs oder explodierende relative Links — verbrennen unbemerkt Ihr Crawl Budget für Müll-URLs (siehe Spider traps).
Wie es weitergeht: der Crawling-Cluster
Dieser Hub ist die Landkarte. Jedes Thema unten ist eine eigene Vertiefung:
Crawl-Effizienz — wie viel und wie oft
- Crawl Budget — was es ist (Kapazität + Nachfrage), was es verschwendet und wer sich wirklich darum kümmern muss.
- Crawl rate — wie schnell Bots abrufen, warum der Regler in der GSC verschwunden ist und wie Sie ein Crawling heute beschleunigen oder verlangsamen.
- Crawl frequency — was Google dazu bringt, eine Seite früher erneut zu crawlen
(Popularität, Aktualität, korrekte
lastmod) und was nicht. - Crawl depth — Klicktiefe vs. Traversierungstiefe beim Crawling, und warum wichtige Seiten nah an der Startseite liegen sollten.
Die Crawler im Überblick — wer Ihre Seiten tatsächlich abruft
- Crawler — was ein Web-Crawler (Bot, Spider) ist und die Schleife aus Abrufen → Parsen → Folgen, die sie alle durchlaufen.
- User Agent — der User-Agent-String und das robots.txt-Token, mit dem sich ein Bot ausweist, und warum Sie dem String allein nicht trauen können.
- Googlebot — Googles Crawler: Smartphone vs. Desktop, Rendering und wie Sie ihn verifizieren.
- Bingbot — Microsofts Crawler, worin er sich unterscheidet und welche Oberflächen jenseits von Bing er beliefert.
- AI Crawlers — die Bots der KI-Unternehmen (Training vs. AI Search vs. nutzerausgelöste Fetcher) und deren Steuerung.
Crawling-Probleme diagnostizieren
- Log file analysis — echte Bots verifizieren und lesen, was sie gecrawlt haben.
- Spider traps (Crawler-Fallen) — die Muster, die unendliche URLs erzeugen, und wie Sie diese beheben.
Jedes Thema oben ist eine eigene Vertiefung unterhalb dieses Hubs — sie stehen auch in der Seitenleiste.
Ihre ausgehenden Links zu qualifizieren ist eine verwandte Onpage-Steuerung mit Überschneidungen zum Crawling — sie sagen Google, wie ein Link zu behandeln ist, nicht ob er gecrawlt werden soll: nofollow (das ursprüngliche Allzweckmittel, heute ein Hinweis), dazu rel=sponsored und rel=ugc für bezahlte/werbliche und nutzergenerierte Links. Alle drei liegen im Cluster Onpage-Meta-Tags.
Überhaupt erst gefunden zu werden ist eine verwandte, aber eigene Stufe. Wie Suchmaschinen Ihre URLs entdecken — Internal Links, Sitemaps (XML, Sitemap-Index, Bild- und Video-Sitemaps) sowie die Push-Protokolle IndexNow und die Google Indexing API (wofür sie jeweils gedacht sind und warum Google IndexNow nicht nutzt) — liegt inzwischen in einem eigenen Hub Discovery. Zum breiteren Thema siehe How Search Works.
AI-Zusammenfassung
Eine verdichtete Fassung der Advanced-Version:
- Crawling = Stufe eins der Suche (Crawl → Index → Serve). Es ist Voraussetzung für ein Ranking, aber kein Ranking-Signal, und es ist vom Indexing und vom Rendering zu unterscheiden.
- Discovery ist Pull + Push: Links und Sitemaps (Pull); IndexNow und die Indexing API (Push). Google nennt es “URL discovery.”
- Der Abruf ist algorithmisch und rücksichtsvoll: Google entscheidet was/wie oft/wie
viele und drosselt bei
5xx/429(“slow down”). Googlebot ruft ~2 MB pro URL ab (PDFs bis 64 MB), Stand 2026, und schneidet darüber hinaus ab. - Rendering ist getrennt: JS läuft in einem zustandslosen Headless-Chrome; Google cacht Ressourcen, um die Kosten erneuten Crawlings zu senken, veröffentlicht aber keine genaue Dauer, sodass Änderungen verzögert ankommen können.
- Crawl ≠ Index: eine per robots blockierte Seite kann über Links trotzdem indexiert
werden; nutzen Sie
noindex(bei erlaubtem Crawling), um eine Seite zu entfernen. Patricks Blockade-Experiment zeigte, dass blockierte Seiten weitgehend weiter rankten — “but it still hurts.” (Übersetzung) „aber es tut trotzdem weh.“ - Crawl Budget = Kapazität + Nachfrage (Popularität + Aktualität). Die meisten Websites müssen es nicht verwalten.
- Diagnostizieren Sie mit Logs; achten Sie auf Spider traps, die Budget verschwenden. AI-Bots sind inzwischen ein großer und wachsender Anteil des Crawl-Traffics.
Offizielle Dokumentation
Dokumentation der Suchmaschinen als Primärquelle.
- Ausführlicher Leitfaden zur Funktionsweise der Google Suche — der Überblick über Crawl → Index → Serve, URL-Discovery und den Crawl-Scheduler.
- Crawling und Indexierung — der Hub für Robots-Regeln, Sitemaps, Kanonisierung und Crawling-Steuerung.
- Einführung in robots.txt — was robots.txt tut und was nicht.
- Crawl-Budget optimieren — Crawl-Kapazität plus Nachfrage und die Frage, wer sie braucht.
- Übersicht über Google-Crawler und -Fetcher — jeder Google-User-Agent und die veröffentlichten IP-Bereiche.
- Einblicke in Googlebot (März 2026) — die aktuellen Byte-Limits und die Crawling-Architektur.
- Googlebot und die 15-MB-Grenze (2022) — das ältere Limit, nützlich, um die Änderung zu zeigen.
- Crawling-Reihe vom Dezember (2024) — Googlebot, HTTP-Caching, facettierte Navigation und CDNs.
Bing / Microsoft
- Bingbot-Reihe: Crawl-Effizienz maximieren — Bings Definition von Crawling und sein Leitbild für Crawl-Effizienz.
- Bing Webmaster Tools — Crawl Control — Geschwindigkeit und Zeitfenster für Bingbot festlegen.
- IndexNow / indexnow.org — das Push-Protokoll, um geänderte URLs sofort zu melden.
Zitate aus der Quelle
Offizielle Aussagen von Google und Bing. Jeder Link ist ein Deep Link, der direkt zur zitierten Passage auf der Quellseite springt.
Google — wie Crawling funktioniert
- “Google Search works in three stages, and not all pages make it through each stage.” (Übersetzung) „Die Google Suche arbeitet in drei Stufen, und nicht alle Seiten kommen durch jede Stufe.“ — Dokumentation von Google Search Central. Zum Zitat springen
- “Other pages are discovered when Google extracts a link from a known page to a new page… Still other pages are discovered when you submit a list of pages (a sitemap) for Google to crawl. This process is called ‘URL discovery’.” (Übersetzung) „Andere Seiten werden entdeckt, wenn Google einen Link von einer bekannten Seite zu einer neuen Seite extrahiert … Wieder andere Seiten werden entdeckt, wenn Sie eine Liste von Seiten (eine Sitemap) zum Crawlen an Google übermitteln. Dieser Vorgang heißt ‘URL discovery’.“ Zum Zitat springen
- “Googlebot uses an algorithmic process to determine which sites to crawl, how often, and how many pages to fetch from each site.” (Übersetzung) „Googlebot verwendet einen algorithmischen Prozess, um zu bestimmen, welche Websites gecrawlt werden, wie oft und wie viele Seiten von jeder Website abgerufen werden.“ Zum Zitat springen
- “They try not to crawl the site too fast to avoid overloading it. This mechanism is based on the responses of the site (for example, HTTP 500 errors mean ‘slow down’).” (Übersetzung) „Sie versuchen, die Website nicht zu schnell zu crawlen, um sie nicht zu überlasten. Dieser Mechanismus beruht auf den Antworten der Website (zum Beispiel bedeuten HTTP-500-Fehler ‘langsamer’).“ Zum Zitat springen
- “During the crawl, Google renders the page and runs any JavaScript it finds using a recent version of Chrome.” (Übersetzung) „Während des Crawls rendert Google die Seite und führt sämtliches vorgefundene JavaScript mit einer aktuellen Chrome-Version aus.“ Zum Zitat springen
Google — robots.txt, Crawl Budget
- “A robots.txt file tells search engine crawlers which URLs the crawler can access on your site.” (Übersetzung) „Eine robots.txt-Datei teilt Suchmaschinen-Crawlern mit, auf welche URLs der Crawler auf Ihrer Website zugreifen kann.“ — Dokumentation von Google Search Central. Zum Zitat springen
- “Taking crawl capacity and crawl demand together, Google defines a site’s crawl budget as the set of URLs that Google can and wants to crawl.” (Übersetzung) „Nimmt man Crawl-Kapazität und Crawl-Nachfrage zusammen, definiert Google das Crawl Budget einer Website als die Menge der URLs, die Google crawlen kann und will.“ Zum Zitat springen
- “If your site doesn’t have a large number of pages that change rapidly, or if your pages seem to be crawled the same day that they are published, you don’t need to read this guide.” (Übersetzung) „Wenn Ihre Website keine große Zahl sich schnell ändernder Seiten hat oder Ihre Seiten offenbar am selben Tag gecrawlt werden, an dem sie veröffentlicht werden, brauchen Sie diesen Leitfaden nicht zu lesen.“ Zum Zitat springen
Gary Illyes, Google (über die wortgetreue Wiedergabe von Googles Crawl-Budget-Beitrag von 2017 bei Search Engine Land)
- Das crawl rate limit ist “the number of simultaneous parallel connections Googlebot may use to crawl the site, as well as the time it has to wait between the fetches.” (Übersetzung) „die Anzahl gleichzeitiger paralleler Verbindungen, die Googlebot zum Crawlen der Website nutzen darf, sowie die Wartezeit zwischen den Abrufen.“ Die crawl demand wird von Popularität und Aktualität bestimmt. Zur Berichterstattung
Fabrice Canel, Microsoft Bing
- “Crawling is the process by which bingbot discovers new and updated documents or content to be added to Bing’s searchable index.” (Übersetzung) „Crawling ist der Prozess, mit dem bingbot neue und aktualisierte Dokumente oder Inhalte entdeckt, die dem durchsuchbaren Index von Bing hinzugefügt werden sollen.“ Zum Zitat springen
- “Our crawl efficiency north star is to crawl a URL only when the content has been added (URL not crawled before), updated (fresh on-page context or useful outbound links).” (Übersetzung) „Unser Nordstern der Crawl-Effizienz ist es, eine URL nur dann zu crawlen, wenn der Inhalt hinzugefügt wurde (URL zuvor nicht gecrawlt) oder aktualisiert wurde (neuer Onpage-Kontext oder nützliche ausgehende Links).“ Zum Zitat springen
Checkliste zur Crawl-Gesundheit
Ein kurzer Durchgang, um zu bestätigen, dass Suchmaschinen das Wichtige finden und abrufen können:
- Wichtige Seiten sind von einer crawlbaren Stelle aus verlinkt (keine verwaisten Seiten).
- Die
robots.txtblockiert nichts, was indexiert werden soll (und blockiert sehr wohl Bereiche mit geringem Wert wie interne Suchergebnisse). - Die XML sitemap ist in der Google Search Console und in den Bing Webmaster
Tools eingereicht, listet nur kanonische, indexierbare URLs und hat ein korrektes
lastmod. - Der Server antwortet schnell und stabil — minimale
5xx/Timeouts (Bots werden langsamer, wenn Ihr Server kämpft). - Sie nutzen die
robots.txtnicht, um zu deindexieren — das ist die Aufgabe vonnoindex(bei erlaubtem Crawling). - Keine Spider traps, die unendliche URLs erzeugen (Kalender, Facetten, Session-IDs).
- Der GSC-Bericht Crawl Stats ist auf Ausschläge bei Antwortcodes und die durchschnittliche Antwortzeit geprüft.
- Die Server-Logs sind auf verschwendetes Crawling und auf wichtige, nicht gecrawlte URLs geprüft.
- JS-abhängige Inhalte sind über echte
<a href>-Links erreichbar, nicht nur über eine reine Klick-Navigation.
Die mentalen Modelle
1. Die Pipeline — Crawl → Render → Index → Serve. Jede Stufe ist ein Filter, und “not all pages make it through each stage.” (Übersetzung) „nicht alle Seiten kommen durch jede Stufe.“ Wenn eine Seite nicht performt, klären Sie zuerst, an welcher Stufe sie scheitert, bevor Sie irgendetwas ändern: Wurde sie gecrawlt? Gerendert? Indexiert? Für die Anfrage ausgeliefert?
2. Die drei „ungleich“. Halten Sie diese auseinander, und die meiste Verwirrung rund um Crawling löst sich auf:
- Crawling ≠ Indexing (blockierte Seiten können über Links trotzdem indexiert werden)
- Crawling ≠ Ranking (die Crawl rate ist kein Ranking-Signal)
- Crawling ≠ Rendering (JS läuft in einem eigenen, cachebaren Schritt)
3. Discovery = Pull + Push.
Pull: Links + Sitemaps. Push: IndexNow / Indexing API / lastmod. Wird eine Seite nicht
gefunden, fragen Sie, welcher Kanal sie tragen sollte — und ob überhaupt etwas auf sie
verlinkt.
4. Crawl Budget = Kapazität + Nachfrage. Kapazität ist das, was Ihr Server verträgt; die Nachfrage ergibt sich aus Popularität + Aktualität. Sie erhöhen das effektive Budget weit eher durch das Beseitigen von Verschwendung (Traps, Duplikate, Müllparameter) als durch den Versuch, Google zu „mehr“ Crawling zu bewegen.
5. Die Entscheidungsregel zum Entfernen einer Seite.
Soll sie aus der Suche verschwinden? Crawling erlauben + noindex. Sollen Bots einen
Bereich komplett auslassen (und das Indexing spielt keine Rolle)? robots.txt-Disallow.
Nutzen Sie Disallow niemals zum Deindexieren.
Crawling steuern — Spickzettel
Was die einzelnen Steuerungen tatsächlich bewirken
| Steuerung | Stoppt Crawling? | Stoppt Indexing? | Wofür einsetzen |
|---|---|---|---|
robots.txt-Disallow | Ja | Nein | Bots aus URL-Räumen mit geringem Wert heraushalten |
noindex (Meta/Header) | Nein (muss crawlbar sein) | Ja | Eine Seite aus dem Index entfernen |
rel=canonical | Nein | Konsolidiert, erzwingt nichts | Auf das bevorzugte Duplikat zeigen |
nofollow an Links | Hält vom Folgen ab | Nein | Für einen Link nicht bürgen / ihn nicht crawlen |
rel="sponsored" / rel="ugc" | Hinweis (wie nofollow) | Nein | Bezahlte/werbliche und nutzergenerierte Links kennzeichnen |
5xx / 503 / 429 | Verlangsamt vorübergehend | Nein | Kurzfristiges „Langsamer“-Signal an Googlebot |
Statuscodes, die Bots interessieren
200— sauber abgerufen.301/308— permanente Weiterleitung (konsolidiert).404/410— weg; fällt mit der Zeit aus dem Index (410eine Spur schneller).429/500/503— „langsamer“ / später erneut versuchen; dauerhaft = das Crawling geht zurück.
Kurzfakten
- Abruflimit von Googlebot: ~2 MB pro URL (PDFs 64 MB), darüber hinaus abgeschnitten.
- Manueller Regler für die Crawl rate in der GSC: entfernt (Jan. 2024) — jetzt über Serversignale.
- Pendant bei Bing: Crawl Control-Raster in den Bing Webmaster Tools.
- IndexNow: Bing/Yandex/andere — nicht Google. Indexing API: Google, **nur JobPosting
- BroadcastEvent**.
Prüfen, ob ein Bot wirklich Googlebot ist
Viel Traffic gibt vor, Googlebot zu sein. Bestätigen Sie das mit einer Reverse- und Forward-DNS-Prüfung (Google veröffentlicht keine Abkürzung — gefälschte User Agents sind verbreitet).
Oder führen Sie dieselbe Prüfung von Hand durch:
macOS / Linux
# 1) Reverse DNS the IP from your logs — it should end in googlebot.com or google.com
host 66.249.66.1
# → 1.66.249.66.in-addr.arpa domain name pointer crawl-66-249-66-1.googlebot.com
# 2) Forward DNS that hostname back — it must resolve to the same IP
host crawl-66-249-66-1.googlebot.com
# → crawl-66-249-66-1.googlebot.com has address 66.249.66.1Windows
nslookup 66.249.66.1
nslookup crawl-66-249-66-1.googlebot.comEndet der Reverse-Lookup nicht auf einer Google-Domain oder stimmt der Forward-Lookup nicht mit der ursprünglichen IP überein, ist es nicht Googlebot. Sie können auch gegen Googles veröffentlichte IP-Bereiche abgleichen (googlebot.json).
Ein sicherer Ausgangspunkt für die robots.txt
User-agent: *
Disallow: /search # internal search result pages
Disallow: /*?*sort= # sort-order parameter spaces
Allow: /
Sitemap: https://example.com/sitemap.xmlDenken Sie daran: Disallow blockiert das Crawling, nicht das Indexing — nutzen Sie es
nicht, um eine Seite aus den Ergebnissen zu entfernen.
Tools, um Crawling sichtbar zu machen und zu steuern
- Google Search Console — Bericht Crawl Stats — Googles eigene Sicht darauf, wie es Sie crawlt: Anfragen im Zeitverlauf, Antwortcodes, durchschnittliche Antwortzeit, nach Dateityp und Googlebot-Typ.
- Bing Webmaster Tools — Crawling-Informationen, Crawl Control und Site Scan.
- Analyse von Server-Logdateien — die Grundwahrheit. Tools: Screaming Frog Log File Analyser, oder Logs nach BigQuery / in eine Log-Plattform leiten. (Siehe Log file analysis.)
- Crawler / Site-Audits — Ahrefs Site Audit und Screaming Frog SEO Spider simulieren ein Crawling und legen Tiefe, Redirect-Ketten, blockierte URLs und trap-artige Muster offen.
- Ahrefs Webmaster Tools — kostenloses Crawling + Audit für Websites, die Sie verifizieren.
- URL Inspection (GSC) — prüfen, wie eine einzelne URL gecrawlt, gerendert und indexiert wurde.
Ressourcen, die Ihre Zeit wert sind
Meine verwandten Beiträge
- Einsteigerleitfaden für technisches SEO — wo Crawling im größeren Bild steht.
- Was geschah, als ich zwei hoch rankende Seiten per Robots.txt blockierte — mein eigenes Experiment zu Crawling vs. Ranking.
- Indexed, though blocked by robots.txt — warum blockierte Seiten trotzdem indexiert werden.
- Robots.txt und SEO: Alles, was Sie wissen müssen.
- JavaScript SEO Issues & Best Practices — die Rendering-Seite.
- Die neuen Web-Crawler: KI-Bots holen gegenüber Suchmaschinen-Bots auf.
Meine Vorträge
- How Search Works (SlideShare) — mein Durchgang durch Crawling, Rendering, Indexing und Ranking. (Mein üblicher Disclaimer gilt: “This is my understanding of systems… not going to be 100% complete or accurate.” (Übersetzung) „Das ist mein Verständnis der Systeme … es wird nicht zu 100 % vollständig oder korrekt sein.“)
Von anderen
- r/TechSEO — die Community für das Debugging von Crawling und Indexing.
- Googles Reihe Crawling im Dezember ist die beste kompakte Sammlung offizieller Crawling-Erklärungen.
- Google erklärt das Crawl-Budget für Webmaster (Search Engine Land) — wortgetreue Wiedergabe von Gary Illyes’ ursprünglichem Crawl-Budget-Beitrag mit den Definitionen von Crawl-Rate-Limit und Crawl-Nachfrage.
- Googlebots Crawl-Budget erklärt (Search Engine Journal) — verständliche Aufschlüsselung des Modells aus Crawl-Kapazität und Nachfrage.
- Google erklärt Googlebots Byte-Limits und Crawling-Architektur (Search Engine Journal) — Berichterstattung zum Update „Einblicke in Googlebot“ vom März 2026; 2 MB pro URL, 64 MB für PDFs und das Verhalten beim Abschneiden.
- So arbeitet Bingbot: Entdecken, Crawlen, Extrahieren und Indexieren (Search Engine Journal) — Bings Seite der Crawling-Pipeline, mit Kontext von Fabrice Canel.
- Googlebots Dateigrößenlimit (DebugBear) — erklärt, was passiert, wenn eine Seite Googlebots Abruflimit überschreitet: Abschneiden statt Ablehnen.
Podcasts
- Googles Podcast zur Suche — Wie Googlebot das Web crawlt. Gary Illyes und Martin Splitt über Vergangenheit, Gegenwart und Zukunft von Googlebot: vereinheitlichte Crawling-Infrastruktur, HTTP/1.1 vs. HTTP/2, Conditional Requests und Byte-Limits. Anhören
Videos
- Google Search Central (YouTube) — die Serie How Google Search Works und Martin Splitts Erklärvideos zu Crawling und Rendering, einschließlich der Videos zu JavaScript SEO. Kanal
Zahlen, die sich zitieren lassen
- AI-Bots holen gegenüber Suchmaschinen-Bots auf. Aus meiner Cloudflare-Radar-Auswertung: Suchmaschinen-Crawler crawlen weiterhin am meisten, aber AI-Bots sind klar die Nummer 2 und auf Kurs, sie innerhalb weniger Jahre zu überholen. Quelle
- Zig Milliarden normalisierter, zuvor nie gesehener URLs entdeckt Bing jeden Tag — die Größenordnung des Discovery-Problems, das die Suchmaschinen aggressiv filtern (Fabrice Canel, Microsoft Bing, 2022). Berichterstattung
- Welche Crawler von ~140 Mio. Websites am häufigsten blockiert werden — Daten zu robots.txt-Blockraten aus meiner Studie mit Xibeijia Guan; nützlich, um zu verstehen, wie das offene Web Bots reguliert. Quelle
- Byte-Limit: ~2 MB pro URL (PDFs 64 MB) — Googles dokumentiertes Abruflimit für Googlebot, Stand März 2026 (herunter von 15 MB). Quelle
Testen Sie sich: Crawling
Fünf kurze Fragen dazu, wie Suchmaschinen Seiten entdecken und abrufen. Wählen Sie jeweils eine Antwort und prüfen Sie dann.
Änderungsprotokoll
Aktualisiert am 9. Aug. 2026.
Redaktionelle Zusammenfassung und aufgezeichnete Änderungsdetails.Änderungsdetails
-
Detaillierte Änderungsangaben sind derzeit auf Englisch verfügbar.
-
Detaillierte Änderungsangaben sind derzeit auf Englisch verfügbar.
-
Detaillierte Änderungsangaben sind derzeit auf Englisch verfügbar.
Vollständiger Vergleich nicht verfügbar — für diese Version wurde kein früherer Schnappschuss archiviert.
Aktualisiert am 17. Juli 2026.
Redaktionelle Zusammenfassung und aufgezeichnete Änderungsdetails.Änderungsdetails
-
Detaillierte Änderungsangaben sind derzeit auf Englisch verfügbar.
-
Detaillierte Änderungsangaben sind derzeit auf Englisch verfügbar.
-
Detaillierte Änderungsangaben sind derzeit auf Englisch verfügbar.
Vollständiger Vergleich nicht verfügbar — für diese Version wurde kein früherer Schnappschuss archiviert.