Panduan Baiduspider

What Baiduspider adalah — Baidu's crawler variants dan pengguna-agents, robots.txt compliance (dan cpro/ads exception), reverse-DNS verification, weak JS rendering, dan crawl control di Ziyuan.

Pertama kali diterbitkan: 3 Jul 2026 · Terakhir diperbarui: 22 Agu 2026 · Advanced
Bahasa
1 sinyal bukti di halaman ini

Baiduspider adalah crawler web Baidu—padanan Googlebot untuk pasar Tiongkok—yang menemukan, mengambil, dan mengindeks halaman untuk Baidu Search di Tiongkok daratan. Varian bernama dalam satu keluarga token mencakup image, video, news, favo, cpro, dan ads, serta varian JavaScript Baiduspider-render yang didokumentasikan Baidu hanya dalam bahasa Tionghoa. Verifikasi dengan DNS dua arah ke *.baidu.com atau *.baidu.jp karena user-agent dapat dipalsukan dan FAQ Baidu memperingatkan tentang peniru. FAQ Baidu menyatakan crawler mematuhi robots.txt secara ketat, dengan pengecualian bernama: Baiduspider-cpro dan Baiduspider-ads berjalan berdasarkan perjanjian komersial dan mengabaikannya. Keterbatasan praktis terbesarnya dibanding Googlebot adalah rendering JavaScript yang lemah, jadi HTML hasil render server adalah default aman. Kendalikan laju crawl melalui Baidu Search Resource Platform (Ziyuan).

TL;DR — Baiduspider adalah Baidu’s crawler — Chinese-market Googlebot. ini runs named variants sharing Baiduspider token family (umum PC/mobile, plus -image, -video, -news, -favo, -cpro, -ads), dan sebuah Baiduspider-render JavaScript variant itu Baidu documents hanya di Chinese. Verify ini oleh bidirectional DNS untuk *.baidu.com/*.baidu.jp — Baidu’s own FAQ warns tentang impersonators. Baidu claims ini “strictly complies with robots.txt protocol,” (terjemahan) “strictly complies dengan robots.txt protocol,” dengan sebuah named exception: Baiduspider-cpro dan Baiduspider-ads run di bawah commercial agreements dan dapat ikuti berbeda access aturan; ini juga doesn’t document non-standard crawl-delay sebagai sebuah reliable control. Because rendering perilaku dapat perubahan, server-rendered HTML adalah conservative default untuk critical konten. Verify saat ini controls di Baidu Search Resource Platform (Ziyuan).

Evidence for this claim Baiduspider is Baidu Search's crawler and Baidu's Search Resource Platform is the authoritative place to verify current crawler guidance. Scope: Current official Baidu webmaster platform; user-agent text alone is not authentication. Confidence: medium · Verified: Baidu Search Resource Platform Evidence for this claim Crawler access directives use the standardized robots.txt protocol, but engine-specific support and verification should be checked against Baidu's current documentation. Scope: Robots Exclusion Protocol baseline, distinct from undocumented Baidu-specific behavior. Confidence: high · Verified: IETF RFC 9309: Robots Exclusion Protocol

What Baiduspider actually adalah

Baiduspider (百度蜘蛛) adalah crawler operated oleh Baidu, mesin pencari itu dominates inside mainland China, where Google adalah largely inaccessible behind Great Firewall. -nya job adalah standard crawl → indeks → sajikan pipeline: menemukan URLs, fetch halaman, dan bangun indeks Baidu Search draws dari. Baidu’s official English FAQ, “FAQs of Baiduspider” (terjemahan) “FAQs dari Baiduspider” pada help.baidu.com, adalah rare piece dari primary English-language documentation here, dan ini adalah source untuk sebagian besar dari direct quotes below.

Asimetri inilah yang membingkai semuanya: Baidu penting di dalam negeri, bukan secara global. Snapshot Tiongkok StatCounter pada Juni 2026 menempatkan Baidu di 47,44%, Bing 23,24%, Haosou 14,02%, Sogou 2,62%, dan Google hanya 2,28% (StatCounter, pangsa pasar mesin pencari di Tiongkok). Perlakukan angka itu sebagai snapshot, bukan konstanta—angka Tiongkok StatCounter berubah cukup besar dari bulan ke bulan tergantung campuran perangkat dan metodologi (Baidu dilaporkan berada di kisaran 40% hingga 65% pada snapshot 2025–2026 yang berbeda), jadi periksa angka aktif alih-alih mengutip satu bulan selamanya. Kesimpulannya tetap sama: Baidu memimpin di dalam Tiongkok, sedangkan Google memimpin di seluruh dunia; karena itu, optimasi Baiduspider diperlakukan sebagai spesialisasi SEO internasional tersendiri, bukan catatan kaki Googlebot. Hub SEO khusus pasar kami membahas posisi Baidu bersama Yandex, Naver, dan mesin regional lainnya.

pengguna-agent strings dan crawler variants

Baidu’s English FAQ names crawler variants directly. Reproduced verbatim (dan yes, Baidu’s own copy repeats “Baiduspider” (terjemahan) “Baiduspider” untuk both PC dan mobile alih-alih giving distinct strings):

Name dari Products | pengguna-agent PC search | Baiduspider Mobile search | Baiduspider pencarian gambar | Baiduspider-image Video search | Baiduspider-video News search | Baiduspider-news Baidu bookmark | Baiduspider-favo Union baidu | Baiduspider-cpro Business search | Baiduspider-ads lainnya search | Baiduspider

So officially named variants di English FAQ adalah Baiduspider-image, -video, -news, -favo (bookmark), -cpro ( “union” (terjemahan) “union”/ad-network crawler), dan -ads (business search) — semua sharing Baiduspider family token. literal umum PC pengguna-agent string, given pada Baidu’s own situs, adalah:

Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.baidu.com/search/spider.html)

mobile UA embeds Baiduspider/2.0 inside sebuah Android WebKit string. setiap declared variant poin untuk yang sama http://www.baidu.com/search/spider.html reference URL — Baidu equivalent dari Googlebot’s google.com/bot.html.

Baiduspider-render — JS variant Baidu hanya documents di Chinese

Ada nuansa yang perlu tepat karena banyak tulisan keliru memahaminya: tabel FAQ berbahasa Inggris di atas memang tidak mencantumkan varian “Baiduspider-render”, sehingga sebagian panduan menyebutnya sekadar folklore pihak ketiga. Itu keliru. Baidu mendokumentasikan Baiduspider-render secara resmi—hanya pada halaman Ziyuan Academy berbahasa Tionghoa, “【官方说法】只需两步,正确识别百度蜘蛛(User-Agent)” (terjemahan) “【官方说法】只需两步,正确识别百度蜘蛛(User-Agent)” (“[Official statement] Two steps to correctly identify Baiduspider”) (terjemahan) “Pernyataan resmi: dua langkah untuk mengenali Baiduspider dengan benar”. Halaman itu membagi UA menjadi tiga kanal—移动 (mobile), PC, dan 小程序 (mini-program) —serta mencantumkan UA render alternatif di samping UA biasa:

Mozilla/5.0 (compatible; Baiduspider-render/2.0; +http://www.baidu.com/search/spider.html)

dengan string seluler yang sesuai dan varian mini-program (Baiduspider-render/2.0;Smartapp). Jadi Baiduspider-render didokumentasikan secara resmi—hanya dalam bahasa Mandarin dan tidak tercantum di FAQ Inggris. Baidu tidak menerbitkan spesifikasi tentang perbedaan perilaku “-render”; tidak seperti Google, Baidu tidak mendokumentasikan kemampuan rendering JavaScript-nya. Kesenjangan itulah asal peringatan tentang rendering JS di bawah.

cara verify Baiduspider (dan not sebuah spoofed bot)

pengguna-agent string adalah trivially spoofed — anyone dapat kirim permintaan itu says Baiduspider. Baidu’s own FAQ warns tentang exactly ini, describing “spammers or other trouble makers who pretend to be Baiduspider,” (terjemahan) “spammers atau lainnya trouble makers who pretend untuk menjadi Baiduspider,” dan -nya guidance adalah untuk verify dengan DNS, not string. dari FAQ, verbatim:

kami recommend menggunakan reverse DNS lookup untuk verify Baiduspider. Verification metode adalah berbeda di bawah linux/windows/os environments.

ini gives per-OS commands — host pada Linux, nslookup pada Windows, dig -x pada macOS — dengan worked contoh, dan aturan itu penting:

hostname dari Baiduspider adalah *.baidu.com atau *.baidu.jp. Others adalah fake hostnames.

Dua domain *.baidu.com dan *.baidu.jp adalah keunikan yang perlu diingat—Baidu merayapi dari namespace reverse-DNS .com dan .jp, sehingga hostname Baiduspider yang sah dapat berakhir dengan salah satunya. Salah satu contoh Baidu bahkan mengarah ke BaiduMobaider-119-63-195-254.crawl.baidu.jp—perhatikan nama “BaiduMobaider,” bukan “Baiduspider,” pada hostname itu; ini keunikan nyata dalam dokumentasi Baidu, bukan salah ketik yang boleh diperbaiki diam-diam.

Baidu’s English FAQ menjelaskan out hanya reverse-lookup bagian di -nya prose, tetapi -nya Chinese Ziyuan Academy halaman adalah lebih eksplisit: ini menamai seluruh proses “双向DNS解析认证” (terjemahan) “双向DNS解析认证” (bidirectional DNS resolution authentication) dan memecah ini ke “第一步:DNS反查IP” (terjemahan) “第一步:DNS反查IP” (langkah 1: reverse-lookup IP) dan “第二步:对域名运行正向DNS查找” (terjemahan) “第二步:对域名运行正向DNS查找” (langkah 2: run sebuah forward DNS lookup pada hostname). itu’s lengkap, correct metode — reverse-lookup IP untuk confirm sebuah *.baidu.com/*.baidu.jp hostname, lalu forward-lookup itu hostname dan confirm ini resolves back untuk yang sama IP. ini adalah yang sama two-langkah approach Anda’d gunakan untuk verify Googlebot atau Bingbot — commands adalah di Scripts tab.

Baiduspider dan robots.txt

Baidu membuat sebuah unusually strong, quotable compliance claim di -nya own FAQ:

Baidu strictly complies dengan robots.txt protocol.

dan ini mendukung standard controls Anda’d expect. Per Baidu’s Ziyuan Academy material, Baiduspider mendukung wildcard matching dengan * dan $ di robots.txt paths (parity dengan Google dan Bing), dan melakukan exact, case-sensitive path matching. Anda dapat set per-pengguna-agent aturan — Baidu’s FAQ gives worked contoh, including ini one itu blocks everything untuk umum Baiduspider tetapi allows image crawler ke /image/:

User-agent: Baiduspider
Disallow: /
User-agent: Baiduspider-image
Allow: /image/

(Baidu juga notes itu Baiduspider-video doesn’t currently mendukung ini aturan.)

Pengecualian bernama untuk klaim “kepatuhan ketat”

Ketegangannya menarik: Baidu mengklaim kepatuhan ketat, tetapi mendokumentasikan pengecualian resmi yang disebutkan namanya. Baiduspider-cpro (perayap jaringan iklan) dan Baiduspider-ads (pencarian bisnis) beroperasi berdasarkan perjanjian komersial terpisah dan mengabaikan robots.txt berdasarkan desain. FAQ menyatakannya secara verbatim: “Baiduspider-cpro will not work on the records set by robots.txt” (terjemahan) “Baiduspider-cpro tidak bekerja pada catatan yang ditetapkan oleh robots.txt”, dan hal yang sama berlaku untuk -ads. Jadi, pembingkaian yang jujur bukanlah klaim samar “Baidu doesn’t always respect robots.txt” (terjemahan) “Baidu tidak selalu mematuhi robots.txt” yang akan Anda lihat di situs agregator—melainkan bahwa perayap standar Baidu mematuhi aturan, dengan dua perayap iklan yang dikecualikan secara kontraktual sebagai satu-satunya celah konkret dan terdokumentasi.

Ada poin terpisah yang lebih sempit dan mudah tercampur: Baiduspider tidak mematuhi direktif nonstandar crawl-delay. Abby Hamilton dari pencarian Engine Journal mendokumentasikannya dalam Panduan Modern untuk Robots.txt (Nov 2024) —tabel perbandingan perayapnya mencantumkan “Baidu | Baiduspider | No” untuk dukungan crawl-delay (sebaliknya, YandexBot milik Yandex bernilai “Yes”). Klaim ini berbeda dari kepatuhan terhadap Allow/Disallow standar, dan perlu dijaga agar Anda tidak tanpa sengaja bertentangan dengan klaim robots.txt Baidu sendiri.

sebuah nyata contoh: baidu.com’s own robots.txt

Baidu practices robots.txt segmentation pada -nya own domain. -nya live robots.txt gives -nya own Baiduspider sebuah shorter disallow list daripada ini gives Googlebot, MSNBot, Sogou, dan Youdao (which additionally get /shifen/, /homepage/, dan /cpro blocked), dan blocks everything (Disallow: /) untuk apa pun unnamed pengguna-agent oleh default:

User-agent: Baiduspider
Disallow: /baidu
Disallow: /s?
Disallow: /ulink?
Disallow: /link?
Disallow: /home/news/data/
Disallow: /bh

One operational detail dari FAQ worth knowing when Anda’re editing aturan: jika Anda tighten robots.txt setelah Baidu memiliki sudah terindeks sebuah situs, “it usually takes 48 hours for the updated robots.txt to take effect.” (terjemahan) “ini biasanya takes 48 hours untuk updated robots.txt untuk take effect.”

melakukan Baiduspider render JavaScript?

Inilah keterbatasan praktis terbesar Baiduspider dibanding Googlebot, dan penting untuk membedakan apa yang resmi dan apa yang bukan. FAQ Inggris Baidu sama sekali tidak membahas rendering JavaScript—tidak ada spesifikasi kemampuan seperti yang diterbitkan Google untuk Googlebot. Yang tersedia adalah pengujian industri yang konsisten. Dan Taylor menyatakannya dengan tegas dalam perbandingan Google vs. Baidu di Search Engine Journal (Maret 2021): “Baidu is notoriously bad when it comes to crawling JavaScript, so make sure that all your important content and links are served in plain HTML on both the mobile and desktop versions of your website.” (terjemahan) “Baidu terkenal sangat buruk dalam merayapi JavaScript, jadi pastikan semua konten dan tautan penting Anda disajikan dalam HTML biasa pada versi mobile dan desktop situs.”

itu aligns dengan position ini situs sudah takes. kami contentful SEO coverage notes itu Bing, Yandex, dan Baidu “may not index [client-side-rendered JS] at all,” (terjemahan) “dapat not indeks [client-side-rendered JS] di semua,” dan itu dynamic rendering adalah deprecated sebagai sebuah umum Google technique. Put three big crawler pada sebuah spectrum: Googlebot melakukan full evergreen-Chromium rendering, Bingbot melakukan solid Chromium/Edge rendering, dan Baiduspider adalah weakest dari three di JavaScript — dengan plain, server-rendered HTML menjadi universally safe fallback di seluruh semua dari them.

Untuk situs yang menghadap Tiongkok, jadikan server-side rendering atau HTML statis sebagai default agar konten, tautan, dan metadata penting sudah ada dalam respons awal sebelum JavaScript berjalan. Perlakukan konten yang hanya ada di sisi klien sebagai risiko indeksasi khusus Baidu, terlepas dari apakah konten itu mendapat peringkat baik di Google. Bingkai SSR sebagai praktik terbaik berdasarkan konsensus industri, bukan sebagai rekomendasi resmi Baidu, karena tidak ada pernyataan primer Baidu tentang rendering JavaScript yang dapat dikutip.

Controlling Baiduspider’s crawl frequency

Baidu presents crawl frequency sebagai algorithmically self-adjusted, not something Anda set directly. dari FAQ, verbatim:

di order untuk ensure hasil pencarian cover sebagian besar dari Anda halaman, Baiduspider harus pertahankan crawling di sebuah certain tingkat. kami memiliki telah trying kami best untuk hindari increasing memuat untuk Anda server, dan untuk adjust frequency berdasarkan combined factors, such sebagai Anda server’s capability, Anda situs’s quality dan update frequency dari Anda situs.

itu’s yang sama server-capability-plus-demand logic Google dan Bing describe. FAQ names sebuah feedback form (webmaster.baidu.com/feedback/index) sebagai official lever untuk reporting di atas-crawling — “If you find any unreasonable access from Baiduspider, please inform us.” (terjemahan) “jika Anda temukan apa pun unreasonable access dari Baiduspider, please inform us.”

Pada tingkat produk, Baidu Search Resource Platform (百度搜索资源平台, di ziyuan.baidu.com—konsol yang dahulu disebut “Baidu Webmaster Tools” (terjemahan) “Alat Webmaster Baidu”) adalah padanan Baidu untuk Google Search Console dan Bing Webmaster Tools. Indeks manualnya mengonfirmasi area produk “抓取频次” (terjemahan) “frekuensi perayapan”, tempat pemilik situs dapat melihat dan membatasi laju perayapan Baiduspider secara langsung, bersama alat robots dan diagnosis perayapan. Perlakukan formulir umpan balik sebagai jalur eskalasi resmi dalam dokumentasi Inggris Baidu, dan dasbor Frekuensi Perayapan Ziyuan sebagai kontrol praktis di tingkat antarmuka. (Jalur menu persis di dalam produk berada di balik akun Ziyuan yang sudah masuk, jadi konfirmasikan antarmuka saat ini sebelum mengutip langkah spesifik.)

hreflang dan lainnya Google-standard signals

Sinyal yang standar di Google tidak semuanya berlaku di Baidu—ini temuan industri/praktisi, bukan sesuatu yang didokumentasikan oleh salah satu perusahaan. Dokumentasi versi lokal milik Google sepenuhnya terbatas pada Google Search dan tidak mengklaim apakah Baidu, Bing, atau Yandex menghormati hreflang. Panduan hreflang di situs ini menyatakannya secara gamblang: Baidu sama sekali tidak mendukung hreflang—gunakan content-language dan <html lang> yang akurat agar Baidu setidaknya dapat membaca bahasa halaman. Ini melengkapi pekerjaan hreflang saya yang berlingkup Google (panduan tag hreflang Ahrefs dan studi terhadap 374 756 domain, yang keduanya hanya membahas implementasi Google), bukan bertentangan dengannya.

No English rep culture — why FAQ adalah unusually valuable

Satu hal yang benar-benar membedakan ekosistem Baidu: tidak seperti Google (Gary Illyes, John Mueller), Bing (Fabrice Canel), atau Yandex, Baidu tidak memiliki budaya tanya jawab publik dengan perwakilan berbahasa Inggris yang terlihat. Tidak ada juru bicara bernama yang berdialog dengan komunitas SEO. Suara resmi Baidu dalam bahasa Inggris yang paling jelas adalah FAQ institusional tanpa nama di help.baidu.com. Itulah sebabnya FAQ tersebut—dan halaman Akademi Ziyuan berbahasa Mandarin di baliknya—sangat berharga: sebagian besar pengetahuan operasional tentang Baiduspider di dunia SEO berbahasa Inggris berasal dari pengujian praktisi (analisis log server, latihan verifikasi DNS, serta uji coba robots.txt), bukan komentar perwakilan resmi. Michael Bonfils merangkum pelajaran yang lebih luas dalam Baidu vs. Google: “SEO strategies that work for Google may not always translate directly to success on Baidu, China’s dominant search engine.” (terjemahan) “Strategi SEO yang berhasil untuk Google tidak selalu langsung menghasilkan keberhasilan di Baidu, mesin pencari dominan di Tiongkok.”

untuk where Baiduspider sits di bigger picture — crawler family, Googlebot dan Bingbot sebagai peers, pengguna-agent concept, dan robots.txt — crawling hub ties ini together, dan SEO internasional adalah home untuk China-market context.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.