Baiduspider-Crawler

Was Baiduspider ist — Baidus Crawler-Varianten und User-Agents, robots.txt-Compliance (einschließlich der cpro/ads-Ausnahme), Reverse-DNS-Verifizierung, schwaches JavaScript-Rendering und Crawl-Steuerung in Ziyuan.

Erstveröffentlicht: 3. Juli 2026 · Zuletzt aktualisiert: 14. Aug. 2026 · Fortgeschritten
Sprachen
1 Evidenzsignal auf dieser Seite

Baiduspider ist Baidus Webcrawler — das Gegenstück zu Googlebot für den chinesischen Markt und der Bot, der Seiten für die Baidu-Suche in Festlandchina entdeckt, abruft und indexiert. Benannte Varianten teilen eine Baiduspider-Tokenfamilie (Bild, Video, News, favo, cpro, ads) sowie eine Baiduspider-render-JavaScript-Variante, die Baidu nur auf Chinesisch dokumentiert. Verifizieren Sie ihn per bidirektionalem DNS zu *.baidu.com oder *.baidu.jp, weil der User-Agent fälschbar ist und Baidus FAQ vor Nachahmern warnt. Baidus FAQ behauptet strikte robots.txt-Compliance — mit einer benannten Ausnahme: Baiduspider-cpro und Baiduspider-ads laufen unter kommerziellen Vereinbarungen und ignorieren sie. Die wichtigste praktische Einschränkung gegenüber Googlebot ist schwaches JavaScript-Rendering; serverseitig gerendertes HTML ist daher der sichere Standard. Die Crawl-Rate steuern Sie über die Baidu Search Resource Platform (Ziyuan).

TL;DR — Baiduspider ist Baidus Crawler — der Googlebot des chinesischen Marktes. Die benannten Varianten teilen die Token-Familie Baiduspider (allgemeiner PC/Mobile-Crawler sowie -image, -video, -news, -favo, -cpro und -ads) und es gibt eine JavaScript-Variante Baiduspider-render, die Baidu nur auf Chinesisch dokumentiert. Verifizieren Sie den Bot per bidirektionalem DNS zu *.baidu.com/*.baidu.jp — Baidus eigene FAQ warnt vor Nachahmern. Baidu behauptet, die robots.txt strikt einzuhalten; es gibt eine benannte Ausnahme: Baiduspider-cpro und Baiduspider-ads arbeiten unter kommerziellen Vereinbarungen und ignorieren robots.txt absichtlich. Außerdem dokumentiert Baidu die nicht standardisierte Direktive crawl-delay nicht als verlässliche Steuerung. Da sich das Rendering ändern kann, ist serverseitig gerendertes HTML der konservative Standard für wichtige Inhalte. Prüfen Sie die aktuellen Steuerungen in der Baidu Search Resource Platform (Ziyuan).

Evidence for this claim Baiduspider is Baidu Search's crawler and Baidu's Search Resource Platform is the authoritative place to verify current crawler guidance. Scope: Current official Baidu webmaster platform; user-agent text alone is not authentication. Confidence: medium · Verified: Baidu Search Resource Platform Evidence for this claim Crawler access directives use the standardized robots.txt protocol, but engine-specific support and verification should be checked against Baidu's current documentation. Scope: Robots Exclusion Protocol baseline, distinct from undocumented Baidu-specific behavior. Confidence: high · Verified: IETF RFC 9309: Robots Exclusion Protocol

Was Baiduspider tatsächlich ist

Baiduspider (百度蜘蛛) ist der von Baidu betriebene Crawler — der Suchmaschine, die innerhalb Festlandchinas dominiert, wo Google hinter der Großen Firewall weitgehend unzugänglich ist. Seine Aufgabe ist die übliche Kette Crawlen → Indexieren → Ausliefern: URLs entdecken, Seiten abrufen und den Index aufbauen, aus dem die Baidu-Suche schöpft. Baidus offizielle englische FAQ „FAQs of Baiduspider“ auf help.baidu.com ist hier eine seltene primäre Dokumentation auf Englisch und Quelle für die meisten direkten Zitate weiter unten.

Die Asymmetrie, die alles einordnet: Baidu ist im Inland wichtig, nicht weltweit. StatCounters Snapshot für China im Juni 2026 setzte Baidu auf 47,44 %, Bing auf 23,24 %, Haosou auf 14,02 %, Sogou auf 2,62 % und Google nur auf 2,28 % (StatCounter, Search Engine Market Share China). Behandeln Sie das als Snapshot, nicht als Konstante — StatCounters China-Zahlen schwanken je nach Geräte-Mix und Methode von Monat zu Monat deutlich (für Baidu wurden in verschiedenen Snapshots 2025–2026 etwa 40–65 % berichtet). Prüfen Sie die Live-Zahl erneut, statt einen Monat für immer zu zitieren. Die Schlussfolgerung bleibt: Baidu führt innerhalb Chinas, Google den Rest der Welt. Deshalb ist Baiduspider-Optimierung eine eigene Spezialität des internationalen SEO und kein Nachgedanke an Googlebot. Der Hub zu marktbezogenem SEO ordnet Baidu neben Yandex, Naver und anderen regionalen Suchmaschinen ein.

User-Agent-Strings und Crawler-Varianten

Baidus englische FAQ nennt die Crawler-Varianten direkt. Hier wörtlich wiedergegeben (und ja: Baidus eigener Text verwendet für PC und Mobile denselben Namen „Baiduspider“, statt getrennte Strings zu vergeben):

Produktname | User-Agent (wörtliche FAQ-Tabelle) PC search | Baiduspider Mobile search | Baiduspider Image search | Baiduspider-image Video search | Baiduspider-video News search | Baiduspider-news Baidu bookmark | Baiduspider-favo Union baidu | Baiduspider-cpro Business search | Baiduspider-ads other search | Baiduspider

Die offiziell benannten Varianten der englischen FAQ sind also Baiduspider-image, -video, -news, -favo (Lesezeichen), -cpro (Crawler für „Union“/Werbenetzwerk) und -ads (Geschäftssuche) — alle teilen den Familientoken Baiduspider. Der wörtliche allgemeine PC-User-Agent auf Baidus eigener Website lautet:

Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.baidu.com/search/spider.html)

Der mobile UA enthält Baiduspider/2.0 in einem Android-WebKit-String. Jede deklarierte Variante verweist auf dieselbe Referenz-URL http://www.baidu.com/search/spider.html — das Baidu-Gegenstück zu Googles google.com/bot.html.

Baiduspider-render — die JS-Variante, die Baidu nur auf Chinesisch dokumentiert

Hier muss man genau sein, weil viele Texte den Punkt falsch darstellen: Die englische FAQ-Tabelle oben führt keine Variante „Baiduspider-render“ auf, weshalb manche Leitfäden sie als bloße Folklore von Drittanbietern bezeichnen. Das stimmt nicht. Baidu dokumentiert Baiduspider-render offiziell, nur auf der chinesischsprachigen Ziyuan-Academy-Seite „【官方说法】只需两步,正确识别百度蜘蛛(User-Agent)“ („Offizielle Aussage: Baiduspider in zwei Schritten richtig identifizieren“). Die Seite teilt UAs in drei Kanäle — 移动 (Mobile), PC und 小程序 (Mini-Programm) — und listet neben dem normalen UA einen alternativen Render-UA auf:

Mozilla/5.0 (compatible; Baiduspider-render/2.0; +http://www.baidu.com/search/spider.html)

mit einem passenden mobilen String und einer Mini-Programm-Variante (Baiduspider-render/2.0;Smartapp). Baiduspider-render ist also offiziell dokumentiert, aber nur auf Chinesisch und nicht in der englischen FAQ. Was Baidu nicht veröffentlicht, ist eine Spezifikation, was “-render” tatsächlich anders macht; anders als Google dokumentiert Baidu seine JavaScript-Rendering-Fähigkeiten nicht. Daher stammt der JS-Hinweis weiter unten.

Baiduspider verifizieren (und keinen gefälschten Bot)

Der User-Agent-String lässt sich trivial fälschen — jeder kann eine Anfrage senden, die Baiduspider behauptet. Baidus eigene FAQ warnt genau davor und beschreibt „spammers or other trouble makers who pretend to be Baiduspider“; empfohlen wird DNS statt des Strings. Wörtlich aus der FAQ:

We recommend using reverse DNS lookup to verify Baiduspider. Verification methods are different under linux/windows/os environments. (Übersetzung) „Wir empfehlen, Baiduspider per Reverse-DNS-Suche zu verifizieren. Die Prüfmethoden unterscheiden sich je nach Linux-, Windows- oder OS-Umgebung.“

Dazu gehören Befehle für jedes Betriebssystem — host unter Linux, nslookup unter Windows und dig -x unter macOS — mit Beispielen und der entscheidenden Regel:

The hostname of Baiduspider is *.baidu.com or *.baidu.jp. Others are fake hostnames. (Übersetzung) „Der Hostname von Baiduspider ist *.baidu.com oder *.baidu.jp. Andere Hostnamen sind gefälscht.“

Die beiden Domains *.baidu.com und *.baidu.jp sind die Besonderheit: Baidu crawlt aus beiden Reverse-DNS-Namespaces, daher kann ein legitimer Baiduspider-Hostname auf .com oder .jp enden. Eines von Baidus eigenen Beispielen löst sogar zu BaiduMobaider-119-63-195-254.crawl.baidu.jp auf — beachten Sie „BaiduMobaider“, nicht „Baiduspider“; das ist eine echte Eigenheit in Baidus Dokumentation, kein Tippfehler, den man still korrigieren sollte.

Baidus englische FAQ beschreibt im Fließtext nur die Rückwärtssuche, aber die chinesische Ziyuan-Academy-Seite ist genauer: Sie nennt den gesamten Prozess „双向DNS解析认证“ (bidirektionale DNS-Auflösungsauthentifizierung) und teilt ihn in „第一步:DNS反查IP“ (Schritt 1: IP rückwärts auflösen) und „第二步:对域名运行正向DNS查找“ (Schritt 2: Vorwärts-DNS-Suche des Hostnamens) auf. Das ist die vollständige, korrekte Methode — IP rückwärts auflösen, um einen Hostnamen unter *.baidu.com/*.baidu.jp zu bestätigen, dann den Hostnamen vorwärts auflösen und prüfen, dass er auf dieselbe IP zeigt. Das ist derselbe Zwei-Schritte-Ansatz wie bei der Verifizierung von Googlebot oder Bingbot; die Befehle stehen im Tab Skripte.

Baiduspider und robots.txt

Baidu macht in seiner eigenen FAQ eine ungewöhnlich starke, zitierfähige Aussage zur Einhaltung:

Baidu strictly complies with robots.txt protocol. (Übersetzung) „Baidu hält sich strikt an das robots.txt-Protokoll.“ (Wörtliches Zitat aus Baidus FAQ.)

Außerdem unterstützt Baiduspider die üblichen Steuerungen. Laut Baidus Ziyuan-Academy-Material unterstützt er Wildcard-Matching mit * und $ in robots.txt-Pfaden (wie Google und Bing) und eine exakte, groß-/kleinschreibungssensitive Pfadübereinstimmung. Regeln pro User-Agent sind möglich; Baidus FAQ enthält Beispiele, darunter eines, das für den allgemeinen Baiduspider alles blockiert, dem Bild-Crawler aber /image/ erlaubt:

User-agent: Baiduspider
Disallow: /
User-agent: Baiduspider-image
Allow: /image/

(Baidu weist außerdem darauf hin, dass Baiduspider-video diese Regeln derzeit nicht unterstützt.)

Die benannte Ausnahme von „strikter Einhaltung“

Die interessante Spannung: Baidu behauptet strikte Einhaltung, dokumentiert aber eine benannte, offizielle Ausnahme. Baiduspider-cpro (der Crawler des Werbenetzwerks) und Baiduspider-ads (Geschäftssuche) arbeiten unter separaten kommerziellen Vereinbarungen und ignorieren robots.txt absichtlich. Wörtlich aus der FAQ: “Baiduspider-cpro will not work on the records set by robots.txt” (Übersetzung) „Baiduspider-cpro arbeitet nicht nach den von robots.txt festgelegten Regeln“ und dasselbe für -ads. Die ehrliche Darstellung ist also nicht das vage “Baidu doesn’t always respect robots.txt” (Übersetzung) „Baidu respektiert robots.txt nicht immer“, das man auf Aggregatorseiten liest, sondern: Baidus Standardcrawler halten sich daran, mit zwei vertraglich ausgenommenen Werbecrawlern als konkreter dokumentierter Ausnahme.

Ein separater, engerer Punkt, der leicht verwechselt wird: Baiduspider beachtet die nicht standardisierte Direktive crawl-delay nicht. Search Engine Journals Abby Hamilton dokumentierte dies im Modern Guide To Robots.txt (November 2024); ihre Vergleichstabelle nennt für „Baidu | Baiduspider | No“ bei crawl-delay (YandexBot steht dagegen auf „Yes“). Das ist eine andere Aussage als die Einhaltung von Allow/Disallow und sollte getrennt bleiben, damit Sie Baidus eigene robots.txt-Aussage nicht versehentlich widersprechen.

Ein echtes Beispiel: die robots.txt von baidu.com selbst

Baidu segmentiert robots.txt auf seiner eigenen Domain. Die Live-robots.txt gibt seinem eigenen Baiduspider eine kürzere Disallow-Liste als Googlebot, MSNBot, Sogou und Youdao (für diese werden zusätzlich /shifen/, /homepage/ und /cpro blockiert) und blockiert standardmäßig alles (Disallow: /) für jeden nicht benannten User-Agent:

User-agent: Baiduspider
Disallow: /baidu
Disallow: /s?
Disallow: /ulink?
Disallow: /link?
Disallow: /home/news/data/
Disallow: /bh

Ein operatives Detail aus der FAQ: Wenn Sie robots.txt verschärfen, nachdem Baidu eine Website bereits indexiert hat, “it usually takes 48 hours for the updated robots.txt to take effect.” (Übersetzung) „Die Änderung wird in der Regel innerhalb von 48 Stunden wirksam.“

Rendert Baiduspider JavaScript?

Das ist Baiduspiders größte praktische Einschränkung gegenüber Googlebot; man sollte sauber zwischen offiziell und nicht offiziell unterscheiden. Baidus englische FAQ behandelt JavaScript-Rendering überhaupt nicht — es gibt keine Fähigkeitsspezifikation wie bei Googlebot. Stattdessen gibt es übereinstimmende Praxistests. Dan Taylor formulierte es im Google-vs.-Baidu-Vergleich des Search Engine Journal (März 2021) deutlich: “Baidu is notoriously bad when it comes to crawling JavaScript, so make sure that all your important content and links are served in plain HTML on both the mobile and desktop versions of your website.” (Übersetzung) „Baiduspider ist bekanntermaßen schlecht beim Crawlen von JavaScript; stellen Sie daher sicher, dass alle wichtigen Inhalte und Links auf den mobilen und Desktop-Versionen Ihrer Website als reines HTML ausgeliefert werden.“

Das entspricht der Position, die diese Website bereits vertritt. Die Contentful-SEO-Abdeckung weist darauf hin, dass Bing, Yandex und Baidu “may not index [client-side-rendered JS] at all,” (Übersetzung) „clientseitig gerendertes JavaScript möglicherweise überhaupt nicht indexieren“ und dass dynamisches Rendering als allgemeine Google-Technik veraltet ist. Stellen Sie die drei großen Crawler auf ein Spektrum: Googlebot rendert vollständiges Evergreen-Chromium, Bingbot solides Chromium/Edge und Baiduspider ist bei JavaScript der schwächste — normales serverseitig gerendertes HTML ist für alle die sichere Ausweichlösung.

Praktische Empfehlung für eine auf China ausgerichtete Website: standardmäßig serverseitig rendern oder statisches HTML verwenden, damit wichtige Inhalte, Links und Metadaten in der initialen Antwort vorhanden sind, bevor JavaScript läuft. Clientseitige Inhalte als eigenes Indexierungsrisiko für Baidu behandeln, unabhängig davon, ob sie bei Google gut ranken. SSR hier als Best Practice des Branchenkonsenses einordnen — nicht als offizielle Baidu-Empfehlung, weil es keine zitierbare primäre Baidu-Aussage zum JS-Rendering gibt.

Baiduspiders Crawl-Häufigkeit steuern

Baidu stellt die Crawl-Häufigkeit als algorithmisch selbst angepasst dar, nicht als etwas, das Sie direkt einstellen. Wörtlich aus der FAQ:

In order to ensure the search results cover most of your pages, Baiduspider must keep the crawling at a certain level. We have been trying our best to avoid increasing the loading to your servers, and to adjust the frequency based on combined factors, such as your server’s capability, your site’s quality and the update frequency of your site. (Übersetzung) „Damit die Suchergebnisse den Großteil Ihrer Seiten abdecken, muss Baiduspider regelmäßig crawlen. Baidu versucht, die Belastung Ihrer Server zu begrenzen und die Häufigkeit anhand mehrerer Faktoren wie Serverleistung, Website-Qualität und Aktualisierungsfrequenz anzupassen.“

Die FAQ nennt ein Feedbackformular (webmaster.baidu.com/feedback/index) als offiziellen Weg, übermäßiges Crawling zu melden: “If you find any unreasonable access from Baiduspider, please inform us.” (Übersetzung) „Wenn Sie einen unangemessenen Zugriff durch Baiduspider feststellen, informieren Sie uns bitte.“

Auf Produktebene ist die Baidu Search Resource Platform (百度搜索资源平台 unter ziyuan.baidu.com — die Konsole, die früher „Baidu Webmaster Tools“ hieß) Baidus Gegenstück zu Google Search Console und Bing Webmaster Tools. Ihr Handbuch bestätigt einen Produktbereich „抓取频次“ (Crawl Frequency), in dem Website-Betreiber Baiduspiders Crawl-Rate direkt ansehen und begrenzen können, neben Robots- und Crawl-Diagnostics-Tools. Das Feedbackformular als offiziellen Eskalationsweg in Baidus englischen Dokumenten und das Ziyuan-Crawl-Frequency-Dashboard als praktische UI-Steuerung behandeln. (Der genaue Menüpfad liegt hinter einem eingeloggten Ziyuan-Konto; bestätigen Sie die aktuelle UI, bevor Sie konkrete Schritte zitieren.)

hreflang und andere Google-Standardsignale

Nicht alle für Google üblichen Signale werden auf Baidu übertragen — das ist eine Erkenntnis aus Praxis und Branche, keine Aussage, die eines der Unternehmen dokumentiert. Googles eigene Dokumentation zu lokalisierten Versionen ist vollständig auf Google Search begrenzt und sagt nichts darüber, ob Baidu, Bing oder Yandex hreflang beachten. Der hreflang-Leitfaden dieser Website formuliert es klar: Baidu unterstützt hreflang überhaupt nicht — als Ausweichsignal sollten Sie content-language und <html lang> korrekt setzen, damit Baidu wenigstens die Seitensprache lesen kann. Das ergänzt meine Google-spezifische hreflang-Arbeit (den Ahrefs-Leitfaden zu hreflang-Tags und die Studie zu 374 756 Domains, beide nur zur Google-Implementierung), statt ihr zu widersprechen.

Keine englische Vertreterkultur — warum die FAQ besonders wertvoll ist

Was das Baidu-Ökosystem wirklich von Google (Gary Illyes, John Mueller), Bing (Fabrice Canel) und Yandex unterscheidet: Baidu pflegt keine sichtbare öffentliche Q&A-Kultur englischsprachiger Vertreter. Es gibt keinen namentlich bekannten Sprecher, der sich mit der SEO-Community austauscht. Baidus klarste offizielle Stimme auf Englisch ist die nicht unterzeichnete, institutionelle help.baidu.com-FAQ. Deshalb sind diese FAQ und die dahinterliegenden chinesischen Ziyuan-Academy-Seiten so wertvoll: Das meiste operative Wissen über Baiduspider in der englischsprachigen SEO-Welt stammt aus Praxistests (Serverlog-Analysen, DNS-Verifizierung, robots.txt-Versuche) und nicht aus Kommentaren offizieller Vertreter. Michael Bonfils fasste die größere Lehre in Search Engines Baidu vs. Google zusammen: “SEO strategies that work for Google may not always translate directly to success on Baidu, China’s dominant search engine.” (Übersetzung) „SEO-Strategien, die für Google funktionieren, führen bei Baidu, Chinas dominanter Suchmaschine, nicht immer direkt zum Erfolg.“

Für die Einordnung von Baiduspider — die Crawler-Familie, Googlebot und Bingbot als Gegenstücke, das User-Agent-Konzept und robots.txt — verbindet der Hub zu Crawling die Themen; International SEO ist die Anlaufstelle für den China-Markt-Kontext.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.