Baiduspider — robot indeksujący Baidu

Czym jest Baiduspider — warianty i user-agenty crawlera Baidu, zgodność z robots.txt (oraz wyjątek cpro/ads), weryfikacja odwrotnego DNS, słabe renderowanie JavaScript i kontrola indeksowania w Ziyuan.

Opublikowano po raz pierwszy: 3 lip 2026 · Ostatnia aktualizacja: 8 sie 2026 · Advanced
Języki
1 sygnał dowodowy na tej stronie

Baiduspider to web crawler Baidu — odpowiednik Googlebota na rynek chiński, bot, który odkrywa, pobiera i indeksuje strony dla Baidu Search w Chinach kontynentalnych. Działa w nazwanych wariantach dzielących wspólną rodzinę tokenów Baiduspider (image, video, news, favo, cpro, ads), plus wariant JavaScript Baiduspider-render, który Baidu dokumentuje tylko po chińsku. Zweryfikuj go za pomocą dwukierunkowego DNS do *.baidu.com lub *.baidu.jp (user-agent można sfałszować), ponieważ FAQ Baidu ostrzega przed oszustami. FAQ Baidu twierdzi, że ściśle przestrzega robots.txt — z jednym wyjątkiem: Baiduspider-cpro i Baiduspider-ads działają na podstawie umów komercyjnych i ignorują go. Jego największym praktycznym ograniczeniem w porównaniu z Googlebotem jest słabe renderowanie JavaScript, więc bezpiecznym domyślnym rozwiązaniem jest HTML renderowany po stronie serwera. Kontroluj jego szybkość indeksowania przez Baidu Search Resource Platform (Ziyuan).

TL;DR — Baiduspider to robot indeksujący Baidu — odpowiednik Googlebota na rynek chiński. Działa w nazwanych wariantach dzielących rodzinę tokenów Baiduspider (ogólny PC/mobilny, plus -image, -video, -news, -favo, -cpro, -ads) oraz wariant JavaScript Baiduspider-render, który Baidu dokumentuje tylko po chińsku. Zweryfikuj go przez dwukierunkowy DNS do *.baidu.com/*.baidu.jp — oficjalne FAQ Baidu ostrzega przed podszywającymi się. Baidu twierdzi, że “strictly complies with robots.txt protocol,” (tłumaczenie) „ściśle przestrzega protokołu robots.txt”, z nazwanym wyjątkiem: Baiduspider-cpro i Baiduspider-ads działają na podstawie umów komercyjnych i mogą stosować inne zasady dostępu; nie dokumentuje też niestandardowego crawl-delay jako niezawodnej kontroli. Ponieważ zachowanie renderowania może się zmieniać, serwerowo renderowany HTML jest konserwatywnym domyślnym wyborem dla krytycznych treści. Zweryfikuj aktualne kontrole w Baidu Search Resource Platform (Ziyuan).

Evidence for this claim Baiduspider is Baidu Search's crawler and Baidu's Search Resource Platform is the authoritative place to verify current crawler guidance. Scope: Current official Baidu webmaster platform; user-agent text alone is not authentication. Confidence: medium · Verified: Baidu Search Resource Platform Evidence for this claim Crawler access directives use the standardized robots.txt protocol, but engine-specific support and verification should be checked against Baidu's current documentation. Scope: Robots Exclusion Protocol baseline, distinct from undocumented Baidu-specific behavior. Confidence: high · Verified: IETF RFC 9309: Robots Exclusion Protocol

Czym Baiduspider naprawdę jest

Baiduspider (百度蜘蛛) to robot indeksujący obsługiwany przez Baidu, wyszukiwarkę, która dominuje w Chinach kontynentalnych, gdzie Google jest w dużej mierze niedostępny za Wielkim Murem Chińskim. Jego zadaniem jest standardowy proces crawl → index → serve: odkrywanie URL-i, pobieranie stron i budowanie indeksu, z którego korzysta Baidu Search. Oficjalne angielskie FAQ Baidu, “FAQs of Baiduspider” na help.baidu.com, to rzadki przykład podstawowej anglojęzycznej dokumentacji w tym temacie i to z niego pochodzi większość bezpośrednich cytatów poniżej.

Asymetria, która wszystko ramuje: Baidu ma znaczenie na rynku krajowym, a nie globalnym. StatCounter w czerwcu 2026 r. dla Chin podał, że Baidu ma 47,44 %, Bing 23,24 %, Haosou 14,02 %, Sogou 2,62 %, a Google zaledwie 2,28 % (StatCounter, Search Engine Market Share China). Traktuj to jako migawkę, a nie stałą — liczby StatCounter dla Chin zmieniają się znacząco z miesiąca na miesiąc w zależności od miksu urządzeń i metodologii (Baidu był raportowany w zakresie od około 40 % do 65 % w różnych migawkach z lat 2025–2026), więc sprawdź aktualną wartość, zamiast cytować jeden miesiąc w nieskończoność. Wniosek pozostaje niezmienny: Baidu prowadzi wewnątrz Chin, podczas gdy Google prowadzi w pozostałej części świata, dlatego optymalizacja pod Baiduspider jest traktowana jako odrębna specjalizacja SEO międzynarodowego, a nie dodatek do Googlebota. Nasz hub SEO dla konkretnych rynków omawia, gdzie Baidu wpisuje się obok Yandex, Naver i innych regionalnych wyszukiwarek.

Ciągi user-agent i warianty robota

Angielskie FAQ Baidu wymienia warianty robota bezpośrednio. Cytowane dosłownie (i tak, własny tekst Baidu powtarza “Baiduspider” zarówno dla PC, jak i mobile, zamiast podawać odrębne ciągi):

Name of Products | User-agent PC search | Baiduspider Mobile search | Baiduspider Image search | Baiduspider-image Video search | Baiduspider-video News search | Baiduspider-news Baidu bookmark | Baiduspider-favo Union baidu | Baiduspider-cpro Business search | Baiduspider-ads other search | Baiduspider

Tak więc oficjalnie nazwane warianty w angielskim FAQ to Baiduspider-image, -video, -news, -favo (zakładki), -cpro (robot sieci “union”/reklamowej) oraz -ads (wyszukiwanie biznesowe) — wszystkie współdzielą token rodziny Baiduspider. Dosłowny ogólny ciąg user-agent dla PC, podany na stronie Baidu, to:

Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.baidu.com/search/spider.html)

UA dla mobile zawiera Baiduspider/2.0 wewnątrz ciągu Android WebKit. Każdy zadeklarowany wariant wskazuje na ten sam adres URL referencyjny http://www.baidu.com/search/spider.html — odpowiednik google.com/bot.html dla Googlebota.

Baiduspider-render — wariant JS, który Baidu dokumentuje tylko po chińsku

Oto subtelność, którą warto dobrze zrozumieć, bo wiele artykułów się w niej myli: tabela z angielskiego FAQ powyżej nie wymienia wariantu “Baiduspider-render”, co skłoniło niektóre przewodniki do nazwania go jedynie folklorem osób trzecich. Tak nie jest. Baidu dokumentuje Baiduspider-render oficjalnie — tylko na swojej chińskojęzycznej stronie Ziyuan Academy, “【官方说法】只需两步,正确识别百度蜘蛛(User-Agent)” (“[Oficjalne oświadczenie] Dwa kroki do prawidłowej identyfikacji Baiduspider”). Ta strona dzieli UA na trzy kanały — 移动 (mobile), PC i 小程序 (mini-program) — i wymienia alternatywny render UA obok zwykłego:

Mozilla/5.0 (compatible; Baiduspider-render/2.0; +http://www.baidu.com/search/spider.html)

z pasującym ciągiem dla mobile i wariantem mini-program (Baiduspider-render/2.0;Smartapp). Zatem Baiduspider-render jest oficjalnie udokumentowany — tylko po chińsku, nieobecny w angielskim FAQ. Tego, co Baidu nie publikuje, to specyfikacja, czym “-render” właściwie różni się w działaniu; w przeciwieństwie do Google, Baidu nie dokumentuje swoich możliwości renderowania JavaScript. Ta luka jest źródłem poniższego zastrzeżenia dotyczącego renderowania JS.

Jak zweryfikować Baiduspider (a nie sfałszowanego bota)

Ciąg user-agent jest trywialnie podrabiany — każdy może wysłać żądanie, które mówi Baiduspider. Własne FAQ Baidu ostrzega właśnie o tym, opisując “spammers or other trouble makers who pretend to be Baiduspider,” i zaleca weryfikację za pomocą DNS, a nie ciągu znaków. Z FAQ, dosłownie:

“We recommend using reverse DNS lookup to verify Baiduspider. Verification methods are different under linux/windows/os environments.” (tłumaczenie) „Zalecamy użycie odwrotnego wyszukiwania DNS do weryfikacji Baiduspidera. Metody weryfikacji różnią się w środowiskach Linux/Windows/OS.”

Podaje polecenia dla poszczególnych systemów — host w Linuxie, nslookup w Windows, dig -x w macOS — z praktycznymi przykładami oraz zasadą, która ma znaczenie:

Zgodnie z FAQ Baidu nazwa hosta Baiduspidera to *.baidu.com lub *.baidu.jp; pozostałe nazwy hostów są fałszywe.

Dwie domeny *.baidu.com oraz *.baidu.jp to osobliwość, o której należy pamiętać — Baidu indeksuje zarówno z przestrzeni odwrotnego DNS .com, jak i .jp, więc prawidłowa nazwa hosta Baiduspider może kończyć się na którąkolwiek z nich. (Jeden z własnych przykładów Baidu nawet rozwiązuje się na BaiduMobaider-119-63-195-254.crawl.baidu.jp — zwróć uwagę na “BaiduMobaider,” nie “Baiduspider” w tej nazwie hosta; to prawdziwa osobliwość w dokumentacji Baidu, nie literówka do cichej poprawy.)

Angielskie FAQ Baidu w swojej prozie opisuje tylko połowę dotyczącą odwrotnego wyszukiwania, ale chińska strona Ziyuan Academy jest bardziej jednoznaczna: nazywa cały proces “双向DNS解析认证” (dwukierunkowe uwierzytelnianie przez DNS) i dzieli go na “第一步:DNS反查IP” (Krok 1: odwrotne wyszukiwanie IP) oraz “第二步:对域名运行正向DNS查找” (Krok 2: wykonaj bezpośrednie wyszukiwanie DNS dla nazwy hosta). To kompletna, poprawna metoda — odwrotnie wyszukaj IP, aby potwierdzić nazwę hosta *.baidu.com/*.baidu.jp, następnie wykonaj bezpośrednie wyszukiwanie tej nazwy hosta i potwierdź, że rozwiązuje się z powrotem na to samo IP. To to samo dwuetapowe podejście, którego użyłbyś do weryfikacji Googlebot lub Bingbot — polecenia znajdują się w zakładce Scripts.

Baiduspider i robots.txt

Baidu składa niezwykle mocne, cytowalne oświadczenie o zgodności we własnym FAQ:

“Baidu strictly complies with robots.txt protocol.” (tłumaczenie) „Baidu ściśle przestrzega protokołu robots.txt.”

Obsługuje też standardowe mechanizmy kontroli, których można się spodziewać. Według materiałów Ziyuan Academy Baiduspider obsługuje dopasowanie wieloznaczne z * i $ w ścieżkach robots.txt (na równi z Google i Bing) oraz wykonuje dokładne, uwzględniające wielkość liter dopasowanie ścieżek. Można ustawić reguły per user-agent — FAQ Baidu podaje praktyczne przykłady, w tym ten, który blokuje wszystko dla ogólnego Baiduspider, ale pozwala indeksatorowi obrazów na dostęp do /image/:

User-agent: Baiduspider
Disallow: /
User-agent: Baiduspider-image
Allow: /image/

(Baidu zauważa również, że Baiduspider-video obecnie nie obsługuje tych reguł.)

Nazwany wyjątek od “ścisłej zgodności”

Interesujące napięcie: Baidu twierdzi, że ściśle przestrzega zasad, ale dokumentuje nazwany, oficjalny wyjątek. Baiduspider-cpro (indeksator sieci reklamowej) i Baiduspider-ads (wyszukiwarka biznesowa) działają na podstawie odrębnych umów handlowych i celowo ignorują robots.txt. Dosłownie z FAQ: “Baiduspider-cpro will not work on the records set by robots.txt” (tłumaczenie) „Baiduspider-cpro nie działa na rekordach ustawionych przez robots.txt” — to samo dotyczy -ads. Zatem uczciwe ujęcie nie jest niejasnym “Baidu nie zawsze respektuje robots.txt”, które można zobaczyć na stronach agregatorów — chodzi o to, że standardowe indeksatory Baidu przestrzegają zasad, z dwoma wyłączonymi umownie indeksatorami reklamowymi jako jedynym konkretnym, udokumentowanym wyjątkiem.

Osobny, węższy punkt, który łatwo pomylić: Baiduspider nie honoruje niestandardowej dyrektywy crawl-delay. Abby Hamilton z Search Engine Journal udokumentowała to w The Modern Guide To Robots.txt (listopad 2024) — jej tabela porównawcza indeksatorów wymienia “Baidu | Baiduspider | No” dla obsługi crawl-delay (YandexBot od Yandex, w przeciwieństwie do tego, ma “Yes”). To inne twierdzenie niż standardowa zgodność z Allow/Disallow i warto je rozróżniać, aby przypadkiem nie zaprzeczyć własnemu oświadczeniu Baidu o robots.txt.

Prawdziwy przykład: robots.txt samego baidu.com

Baidu praktykuje segmentację robots.txt na własnej domenie. Jego aktywny robots.txt daje własnemu Baiduspiderowi krótszą listę zakazów niż Googlebotowi, MSNBotowi, Sogou i Youdao (które dodatkowo mają zablokowane /shifen/, /homepage/ i /cpro), a dla każdego nienazwanego user-agenta domyślnie blokuje wszystko (Disallow: /):

User-agent: Baiduspider
Disallow: /baidu
Disallow: /s?
Disallow: /ulink?
Disallow: /link?
Disallow: /home/news/data/
Disallow: /bh

Jeden szczegół operacyjny z FAQ, który warto znać podczas edytowania reguł: jeśli zaostrzysz robots.txt po tym, jak Baidu już zaindeksowało witrynę, “it usually takes 48 hours for the updated robots.txt to take effect.” (tłumaczenie) „zazwyczaj potrzeba 48 godzin, aby zaktualizowany robots.txt zaczął obowiązywać.”

Czy Baiduspider renderuje JavaScript?

To największe praktyczne ograniczenie Baiduspidera w porównaniu z Googlebotem i warto być precyzyjnym co do tego, co jest oficjalne, a co nie. Angielskie FAQ Baidu w ogóle nie porusza renderowania JavaScript — nie ma specyfikacji możliwości takiej, jaką Google publikuje dla Googlebota. Zamiast tego mamy spójne testy branżowe. Dan Taylor ujął to wprost w porównaniu Google vs Baidu w Search Engine Journal Google vs Baidu comparison (marzec 2021): “Baidu is notoriously bad when it comes to crawling JavaScript, so make sure that all your important content and links are served in plain HTML on both the mobile and desktop versions of your website.” (tłumaczenie) „Baidu jest notorycznie słabe w indeksowaniu JavaScript, więc upewnij się, że wszystkie ważne treści i linki są serwowane w czystym HTML zarówno na wersji mobilnej, jak i desktopowej Twojej witryny.”

To jest zgodne ze stanowiskiem, które ta witryna już przyjmuje. Nasze contentful SEO omówienie zauważa, że Bing, Yandex i Baidu “may not index [client-side-rendered JS] at all,” (tłumaczenie) „mogą w ogóle nie indeksować JavaScriptu renderowanego po stronie klienta”, i że dynamiczne renderowanie jest zdeprecjonowane jako ogólna technika Google. Umieść te trzy duże roboty na spektrum: Googlebot wykonuje pełne renderowanie evergreen-Chromium, Bingbot wykonuje solidne renderowanie Chromium/Edge, a Baiduspider jest najsłabszy z trzech w JavaScript — przy czym zwykły, serwerowo renderowany HTML jest uniwersalnie bezpiecznym rozwiązaniem awaryjnym dla wszystkich.

Praktyczna wskazówka dla witryny skierowanej do Chin: domyślnie wybierz renderowanie po stronie serwera lub statyczny HTML, aby krytyczne treści, linki i metadane znajdowały się w początkowej odpowiedzi przed uruchomieniem jakiegokolwiek JavaScript. Traktuj treści dostępne tylko po stronie klienta jako ryzyko indeksowania specyficznie dla Baidu, niezależnie od tego, czy dobrze pozycjonują się w Google. Przedstaw SSR jako branżową najlepszą praktykę — nie jako oficjalną rekomendację Baidu, ponieważ nie istnieje żadne podstawowe oświadczenie Baidu na temat renderowania JS, na które można się powołać.

Kontrolowanie częstotliwości indeksowania Baiduspidera

Baidu przedstawia częstotliwość indeksowania jako algorytmicznie samoregulującą się, a nie coś, co ustawiasz bezpośrednio. Z FAQ, dosłownie:

“In order to ensure the search results cover most of your pages, Baiduspider must keep the crawling at a certain level. We have been trying our best to avoid increasing the loading to your servers, and to adjust the frequency based on combined factors, such as your server’s capability, your site’s quality and the update frequency of your site.” (tłumaczenie) „Aby wyniki wyszukiwania obejmowały większość Twoich stron, Baiduspider musi utrzymywać indeksowanie na określonym poziomie. Dokładamy wszelkich starań, aby nie zwiększać obciążenia serwerów oraz dostosowywać częstotliwość na podstawie połączonych czynników, takich jak wydajność serwera, jakość witryny i częstotliwość jej aktualizacji.”

To ta sama logika pojemności serwera plus zapotrzebowania, którą opisują Google i Bing. FAQ wymienia formularz opinii (webmaster.baidu.com/feedback/index) jako oficjalną dźwignię do zgłaszania nadmiernego indeksowania — “If you find any unreasonable access from Baiduspider, please inform us.” (tłumaczenie) „Jeśli zauważysz jakikolwiek nietypowy dostęp od Baiduspidera, poinformuj nas.”

Na poziomie produktu, Baidu Search Resource Platform (百度搜索资源平台, na ziyuan.baidu.com — konsola historycznie nazywana “Baidu Webmaster Tools”) jest odpowiednikiem Google Search Console i Bing Webmaster Tools w Baidu. Jej ręczne indeksowanie potwierdza obszar produktu “抓取频次” (Crawl Frequency), w którym właściciele witryn mogą bezpośrednio przeglądać i ograniczać szybkość indeksowania Baiduspidera, wraz z narzędziami do robots i diagnostyki indeksowania. Traktuj formularz opinii jako oficjalną ścieżkę eskalacji w angielskiej dokumentacji Baidu, a pulpit nawigacyjny Ziyuan Crawl Frequency jako praktyczną kontrolę na poziomie interfejsu. (Dokładna ścieżka menu w produkcie znajduje się za zalogowanym kontem Ziyuan, więc potwierdź bieżący interfejs tam przed cytowaniem konkretnych kroków.)

hreflang i inne sygnały standardowe Google

Sygnały standardowe dla Google nie wszystkie przenoszą się na Baidu — a to jest wniosek branżowy/praktyczny, a nie coś, co dokumentują obie firmy. Dokumentacja Google dotycząca wersji zlokalizowanych jest ograniczona wyłącznie do wyszukiwarki Google i nie twierdzi, czy Baidu, Bing czy Yandex honorują hreflang. Na tej stronie nasz przewodnik po hreflang stwierdza to wprost: Baidu w ogóle nie obsługuje hreflang — rozwiązaniem zastępczym jest ustawienie dokładnego content-language i <html lang>, aby Baidu mogło przynajmniej odczytać język strony. To jest uzupełnienie mojej własnej pracy nad hreflang w kontekście Google (przewodnik Ahrefs po tagach hreflang oraz badanie 374 756 domen, z których oba omawiają wyłącznie implementację Google), a nie jej zaprzeczenie.

Brak kultury anglojęzycznych przedstawicieli — dlaczego FAQ jest wyjątkowo cenne

Jedna rzecz, która naprawdę wyróżnia ekosystem Baidu: w przeciwieństwie do Google (Gary Illyes, John Mueller), Bing (Fabrice Canel) czy Yandex, Baidu nie utrzymuje widocznej anglojęzycznej kultury pytań i odpowiedzi publicznych przedstawicieli. Nie ma nazwanego rzecznika prowadzącego wymianę zdań ze społecznością SEO. Najwyraźniejszym oficjalnym anglojęzycznym głosem Baidu jest niepodpisane, instytucjonalne FAQ na help.baidu.com. Dlatego właśnie to FAQ — oraz chińskojęzyczne strony Akademii Ziyuan za nim — są tak cenne: większość praktycznej wiedzy o Baiduspider w anglojęzycznym świecie SEO pochodzi z testów praktyków (analiza logów serwera, ćwiczenia weryfikacji DNS, próby i błędy z robots.txt), a nie z oficjalnych komentarzy przedstawicieli. Michael Bonfils podsumował szerszą lekcję w Search Engine Land Baidu vs. Google: “SEO strategies that work for Google may not always translate directly to success on Baidu, China’s dominant search engine.” (tłumaczenie) „Strategie SEO, które działają w Google, nie zawsze przekładają się bezpośrednio na sukces w Baidu, dominującej wyszukiwarce Chin.”

Aby zobaczyć, gdzie Baiduspider wpisuje się w szerszy obraz — rodzinę robotów indeksujących, Googlebota i Bingbota jako odpowiedniki, koncepcję user-agenta oraz robots.txt — centrum crawlingu spaja to wszystko, a SEO międzynarodowe jest miejscem dla kontekstu rynku chińskiego.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.