BaiduspiderのSEO
Baiduspiderとは何か、Baiduのクローラーの派生とuser-agent、robots.txtへの準拠(cpro/adsの例外を含む)、逆引きDNS検証、JavaScriptレンダリングの弱さ、Ziyuanでのクロール制御を説明します。
言語
このページには証拠シグナルが1件あります
- 関連するライブツールDNS Checker
BaiduspiderはBaiduのウェブクローラーです。ページを発見、取得し、Baidu Searchのインデックスを構築します。中国本土が重要な市場なら、Baiduspiderの現在の派生、user-agent、双方向DNS検証、robots.txtの制御と名前付き例外を確認し、重要なコンテンツをサーバーでレンダリングしたHTMLとして配信します。BaiduはJavaScriptレンダリングの仕様を公開していないため、クライアント側だけのコンテンツを避け、クロール頻度はBaidu検索リソースプラットフォーム(Ziyuan)で確認します。
Evidence for this claim Baiduspider is Baidu Search's crawler and Baidu's Search Resource Platform is the authoritative place to verify current crawler guidance. Scope: Current official Baidu webmaster platform; user-agent text alone is not authentication. Confidence: medium · Verified: Baidu Search Resource Platform Evidence for this claim Crawler access directives use the standardized robots.txt protocol, but engine-specific support and verification should be checked against Baidu's current documentation. Scope: Robots Exclusion Protocol baseline, distinct from undocumented Baidu-specific behavior. Confidence: high · Verified: IETF RFC 9309: Robots Exclusion Protocol要約 — BaiduspiderはBaiduのウェブクローラーで、Baidu Searchのためにページを訪問して取得するボットです。中国本土が重要な市場なら、クロール監視にBaiduspiderを含めてください。特にJavaScriptのレンダリングやクローラー制御については、検索エンジン固有の挙動に依存する前に、Baiduの現行ウェブマスター文書を確認します。
Baiduspiderとは
Googleは中国本土では機能しません。そこで使われるのがBaiduです。Baiduは多くの人が利用する検索エンジンで、Baiduspiderがそのクローラーです。Baiduspiderはサイトを訪問すると、リンクをたどり、サイトマップを読み、ページを取得し、Baiduのインデックスを構築するためにページを引き渡します。Baiduのインデックスは、誰かが検索したときにBaiduが参照するデータベースです。Baiduspiderがページに到達して読み取れなければ、そのページはBaiduに表示されません。
Baidu自身の言葉(公式英語FAQより)では、“Baiduspider is Baidu search engine program which is used to visit pages on the internet and build information into Baidu index. This enables users to locate your site when they perform a search.” (翻訳)(Baiduspiderは、インターネット上のページを訪問して情報をBaiduのインデックスに構築するためのBaidu検索エンジンプログラムです。これにより、ユーザーが検索したときにサイトを見つけられます。)ということです。Googleに対するGooglebot、Bingに対するBingbotと同じ仕事です。
重要になる可能性がある理由
Baiduspiderが本当に重要なのは、中国本土で見つけてもらいたい場合です。中国ではBaiduが今も主導的で、Googleの存在感はほとんどありません。そのため、中国向けサイト(または中国の利用者を持つグローバルサイト)には、欧米のサイトにGooglebotが必要なのと同じようにBaiduspiderが必要です。中国の顧客にまったくサービスを提供しないなら、Baiduspiderはサーバーにアクセスする別のボットにすぎず、リソース節約のためブロックするサイトもあります。
注意点:BaiduspiderはJavaScriptが苦手
ここが最大のポイントです。Googlebotは最新のChromeを動かし、JavaScriptの多いサイトの大部分を問題なく読み取ります。一方、Baiduspiderはそうではなく、JavaScriptの実行が苦手だと広く報告されています。重要なコンテンツやリンクがJavaScriptの実行後にしか現れない場合、同じページがGoogleで問題なく順位を得ていても、Baiduには見えない可能性があります。中国向けサイトで安全を取るなら、JavaScriptが動く前に返されるプレーンHTMLに実際のコンテンツを置いてください。
Baiduspiderを許可または停止する方法
- 入れるには: 重要なページへリンクし、Baidu Search Resource Platform(Baidu版Search Console)でサイトマップを送信し、
robots.txtでそれらのページを誤ってブロックしないようにします。 - サイトの一部から締め出すには:
robots.txtを使います。Baiduは、そこでは標準ルールに従うと述べています。 - 速度を落とすには: Baidu Search Resource Platformにはクロール頻度の画面があり、Baiduspiderのクロール量を確認して上限を設定できます。
技術的な詳細 — 正確なuser-agent文字列、本物のBaiduspiderの確認方法、robots.txtの癖、クロール頻度の制御 — が必要ですか。Advancedタブへ切り替えてください。
Evidence for this claim Baiduspider is Baidu Search's crawler and Baidu's Search Resource Platform is the authoritative place to verify current crawler guidance. Scope: Current official Baidu webmaster platform; user-agent text alone is not authentication. Confidence: medium · Verified: Baidu Search Resource Platform Evidence for this claim Crawler access directives use the standardized robots.txt protocol, but engine-specific support and verification should be checked against Baidu's current documentation. Scope: Robots Exclusion Protocol baseline, distinct from undocumented Baidu-specific behavior. Confidence: high · Verified: IETF RFC 9309: Robots Exclusion Protocol要約 — BaiduspiderはBaiduのクローラーで、中国市場向けのGooglebotに相当します。
Baiduspiderトークンのファミリーを共有する名前付きの種類(一般PC/モバイル、-image、-video、-news、-favo、-cpro、-ads)があり、Baiduが中国語だけで文書化しているJavaScript向けのBaiduspider-renderもあります。確認には、*.baidu.com/*.baidu.jpへの双方向DNSを使います。Baidu自身のFAQも偽装を警告しています。Baiduは*“strictly complies with robots.txt protocol”* (翻訳)(robots.txtプロトコルを厳格に遵守する)と主張していますが、名前付きの例外があります。Baiduspider-cproとBaiduspider-adsは商業契約のもとで動作し、異なるアクセスルールに従う可能性があります。また、非標準のcrawl-delayを信頼できる制御としては文書化していません。レンダリングの挙動は変わり得るため、重要なコンテンツではサーバーレンダリングHTMLを保守的なデフォルトにします。現行の制御はBaidu Search Resource Platform(Ziyuan)で確認してください。
Baiduspiderの実体
Baiduspider(百度蜘蛛)は、Baiduが運用するクローラーです。Baiduは中国本土で優勢な検索エンジンで、Googleはグレートファイアウォールの背後でほぼ利用できません。Baiduspiderの役割は、URLを発見し、ページを取得し、Baidu Searchが使うインデックスを構築するという、標準的なクロール→インデックス→配信の流れです。ここで珍しい一次英語資料なのが、help.baidu.comにある公式英語FAQの「FAQs of Baiduspider」で、以下の直接引用の多くはそこから取っています。
全体像を決める非対称性は、Baiduが国内では重要で、世界全体ではそうではないことです。StatCounterの2026年6月の中国スナップショットでは、Baidu 47,44 %、Bing 23,24 %、Haosou 14,02 %、Sogou 2,62 %、Google 2,28 %でした(StatCounter:中国の検索エンジン市場シェア)。これは一定の値ではなくスナップショットとして扱ってください。StatCounterの中国の数値は、端末構成と方法論によって月ごとに大きく変わります(2025〜2026年の別のスナップショットでは、Baiduはおよそ40〜65%の範囲で報告されています)。1か月の数字を永遠に引用せず、ライブの数字を再確認してください。結論は変わりません。Baiduは中国国内を主導し、Googleは世界の大部分を主導します。だからBaiduspider最適化は、Googlebotのおまけではなく、独立したinternational SEOの専門領域として扱われます。このサイトの市場別SEOハブでは、BaiduをYandex、Naverなどの地域検索エンジンと並べて位置付けています。
User-agent文字列とクローラーの種類
Baiduの英語FAQは、クローラーの種類を直接示しています。逐語的に再掲します(Baidu自身の文面は、PCとモバイルで異なる文字列を用意せず、どちらにも「Baiduspider」を繰り返している点にも注目してください)。
製品名 | User-agent PC検索 | Baiduspider モバイル検索 | Baiduspider 画像検索 | Baiduspider-image 動画検索 | Baiduspider-video ニュース検索 | Baiduspider-news Baiduブックマーク | Baiduspider-favo Baidu連合 | Baiduspider-cpro ビジネス検索 | Baiduspider-ads その他の検索 | Baiduspider
英語FAQで正式に名前が付けられている種類は、Baiduspider-image、-video、-news、-favo(ブックマーク)、-cpro(「連合」/広告ネットワークのクローラー)、-ads(ビジネス検索)です。いずれもBaiduspiderファミリーのトークンを共有します。Baidu自身のサイトに掲載された、一般PC向けの文字列は次のとおりです。
Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.baidu.com/search/spider.html)モバイルUAには、Android WebKitの文字列内にBaiduspider/2.0が埋め込まれています。定義された種類はすべて同じhttp://www.baidu.com/search/spider.html参照URLを指します。これはGooglebotにおけるgoogle.com/bot.htmlに相当するBaiduのURLです。
Baiduspider-render — Baiduが中国語だけで文書化しているJS向けの種類
ここは正確に理解しておきたい細部です。上の英語FAQの表には「Baiduspider-render」の種類がなく、一部のガイドが単なる第三者のうわさとして扱う原因になっています。しかし、そうではありません。BaiduはBaiduspider-renderを公式に文書化しています。ただし、中国語のZiyuan Academyページ、「【官方说法】只需两步,正确识别百度蜘蛛(User-Agent)」(「【公式見解】2ステップでBaiduspider(User-Agent)を正しく識別する」)に掲載されています。このページはUAを移動(移动)、PC、小プログラム(小程序)の3つのチャネルに分け、通常のUAと並べて別のレンダーUAを示しています。
Mozilla/5.0 (compatible; Baiduspider-render/2.0; +http://www.baidu.com/search/spider.html)対応するモバイル文字列と、小プログラムの種類(Baiduspider-render/2.0;Smartapp)もあります。したがって、Baiduspider-renderは**公式に文書化されていますが、中国語のみで、英語FAQにはありません。**一方、Baiduが公開していないのは、「-render」が実際に何を違わせるのかという仕様です。Googleとは異なり、BaiduはJavaScriptのレンダリング能力を文書化していません。以下で扱うJSレンダリングの注意点は、その空白から生じています。
Baiduspiderを確認する(偽装ボットを見分ける)
User-agent文字列は簡単に偽装できます。誰でもBaiduspiderだと名乗るリクエストを送れます。Baidu自身のFAQもこの問題を警告し、“spammers or
other trouble makers who pretend to be Baiduspider” (翻訳)(Baiduspiderを装うスパマーやその他の迷惑行為者)と説明しています。文字列ではなくDNSで確認するのが案内です。FAQからの逐語的な説明は次のとおりです。
We recommend using reverse DNS lookup to verify Baiduspider. Verification methods are different under linux/windows/os environments. (翻訳)(Baiduspiderの確認には逆引きDNSを使うことを推奨します。Linux/Windows/OS環境によって確認方法は異なります。)
OSごとのコマンドとして、Linuxではhost、Windowsではnslookup、macOSではdig -xを、実行例とともに示しています。重要なルールは次のとおりです。
The hostname of Baiduspider is .baidu.com or .baidu.jp. Others are fake hostnames. (翻訳)(Baiduspiderのホスト名は.baidu.comまたは.baidu.jpです。それ以外は偽のホスト名です。)
覚えておくべき癖は、*.baidu.comと*.baidu.jpの2つのドメインです。Baiduは.comと.jpの逆引きDNS名前空間の両方からクロールするため、本物のBaiduspiderホスト名はどちらかで終わる可能性があります。Baidu自身の実行例の1つは、BaiduMobaider-119-63-195-254.crawl.baidu.jpに解決されます。このホスト名には「Baiduspider」ではなく「BaiduMobaider」と書かれていますが、これはBaiduの文書にある実際の癖であり、黙って修正する誤記ではありません。
Baiduの英語FAQ本文が明記しているのは逆引きの部分だけですが、中国語のZiyuan Academyページはさらに明確です。全体の手順を**「双向DNS解析认证」(双方向DNS名前解決認証)と名付け、「第一步:DNS反查IP」(ステップ1:IPをDNS逆引きする)と*「第二步:对域名运行正向DNS查找」*(ステップ2:ホスト名に対してDNS正引きを実行する)に分けています。これが完全で正しい方法です。IPを逆引きして*.baidu.com/*.baidu.jpのホスト名であることを確認し、次にそのホスト名を正引きして同じIPへ戻ることを確認します。GooglebotやBingbotを確認するときと同じ2段階の方法で、コマンドはScripts**タブにあります。
Baiduspiderとrobots.txt
Baiduは自身のFAQで、通常より強く、引用可能な遵守の主張をしています。
Baidu strictly complies with robots.txt protocol. (翻訳)(Baiduはrobots.txtプロトコルを厳格に遵守します。)
そして、期待される標準制御をサポートしています。BaiduのZiyuan Academy資料によれば、Baiduspiderはrobots.txtのパスで*と$によるワイルドカード照合をサポートし、正確で大文字と小文字を区別するパス照合を行います。user-agentごとのルールを設定でき、BaiduのFAQには、一般のBaiduspiderはすべてをブロックしつつ画像クローラーには/image/へのアクセスを許可する次の実行例があります。
User-agent: Baiduspider
Disallow: /
User-agent: Baiduspider-image
Allow: /image/(Baiduは、Baiduspider-videoは現在これらのルールをサポートしていないとも記しています。)
「厳格な遵守」に対する名前付きの例外
興味深い緊張関係があります。Baiduは厳格な遵守を主張する一方、名前付きで公式な例外も文書化しています。Baiduspider-cpro(広告ネットワークのクローラー)とBaiduspider-ads(ビジネス検索)は別個の商業契約のもとで動作し、設計上**robots.txtを無視します。**FAQからの逐語引用では、“Baiduspider-cpro will not work on the records set by robots.txt” (翻訳)(Baiduspider-cproはrobots.txtで設定された記録には従いません)で、-adsにも同じことが当てはまります。したがって、集約サイトで見かける曖昧な「Baiduはrobots.txtを常に尊重しない」という説明ではなく、標準クローラーは遵守し、契約上免除された2つの広告クローラーが具体的に文書化された例外だと説明するのが正確です。
もう1つ、混同しやすい、より狭い論点があります。Baiduspiderは非標準のcrawl-delayディレクティブを尊重しません。Search Engine JournalのAbby HamiltonがThe Modern Guide To Robots.txt(2024年11月)で文書化しており、クローラー比較表にはcrawl-delay対応について「Baidu | Baiduspider | No」とあります。対照的にYandexのYandexBotは「Yes」です。これは標準のAllow/Disallow遵守とは別の主張なので、Baidu自身のrobots.txtに関する主張と誤って矛盾させないよう整理してください。
実例:Baidu自身のrobots.txt
Baiduは自社ドメインでrobots.txtを分けて運用しています。ライブのrobots.txtでは、自分自身のBaiduspiderに対するDisallowリストは、Googlebot、MSNBot、Sogou、Youdaoに対するものより短くなっています。後者にはさらに/shifen/、/homepage/、/cproがブロックされ、名前のないuser-agentにはデフォルトでDisallow: /によってすべてがブロックされます。
User-agent: Baiduspider
Disallow: /baidu
Disallow: /s?
Disallow: /ulink?
Disallow: /link?
Disallow: /home/news/data/
Disallow: /bhルールを編集するときに知っておく価値のあるFAQの運用上の細部として、Baiduがすでにサイトをインデックス登録した後にrobots.txtを厳しくすると、“it usually takes 48 hours for the updated robots.txt to take effect.” (翻訳)(更新したrobots.txtが反映されるまで通常48時間かかります)。
BaiduspiderはJavaScriptをレンダリングするか
これはGooglebotと比べたBaiduspiderの最大の実務上の制限であり、公式なこととそうでないことを正確に区別する価値があります。Baiduの英語FAQはJavaScriptレンダリングをまったく扱っていません。GoogleがGooglebotについて公開しているような能力仕様はありません。代わりにあるのは、一貫した業界テストです。Dan TaylorはSearch Engine JournalのGoogle対Baidu比較(2021年3月)で、“Baidu is notoriously bad when it comes to crawling JavaScript, so make sure that all your important content and links are served in plain HTML on both the mobile and desktop versions of your website.” (翻訳)(BaiduはJavaScriptのクロールが悪いことで知られているため、重要なコンテンツとリンクはすべて、サイトのモバイル版とデスクトップ版の両方でプレーンHTMLとして配信するようにしてください)と率直に述べています。
これは、このサイトがすでに取っている立場とも一致します。contentful SEOの記事では、Bing、Yandex、Baiduが*“may not index [client-side-rendered JS] at all,”* (翻訳)(クライアント側でレンダリングされたJSをまったくインデックス登録しない可能性がある)と記し、動的レンダリングはGoogle向けの一般的な手法として非推奨になったと説明しています。3つの大きなクローラーを比較すると、Googlebotは常時更新されるChromiumで完全にレンダリングし、BingbotはChromium/Edgeで堅実にレンダリングします。そしてBaiduspiderは3つの中でJavaScriptに最も弱いため、プレーンなサーバーレンダリングHTMLがすべてに通用する安全なフォールバックです。
中国向けサイトへの実務的な指針は、サーバーサイドレンダリングまたは静的HTMLをデフォルトにし、重要なコンテンツ、リンク、メタデータがJavaScriptの実行前の初回レスポンスに存在するようにすることです。クライアント側だけのコンテンツは、Googleでは問題なく順位を得られるかどうかに関係なく、Baiduにとってインデックス登録のリスクだと考えてください。ここでSSRを業界の合意に基づくベストプラクティスとして説明し、公式Baidu推奨だとは表現しないでください。JavaScriptレンダリングについて引用できるBaiduの一次声明はないためです。
Baiduspiderのクロール頻度を制御する
Baiduはクロール頻度を、直接設定するものではなくアルゴリズムで自己調整されるものとして説明しています。FAQの逐語的な説明は次のとおりです。
In order to ensure the search results cover most of your pages, Baiduspider must keep the crawling at a certain level. We have been trying our best to avoid increasing the loading to your servers, and to adjust the frequency based on combined factors, such as your server’s capability, your site’s quality and the update frequency of your site. (翻訳)(検索結果がページの大部分をカバーできるよう、Baiduspiderは一定水準のクロールを維持する必要があります。サーバーへの負荷を増やさないよう努め、サーバーの能力、サイトの品質、サイトの更新頻度など、複数の要因に基づいて頻度を調整しています。)
これは、GoogleやBingが説明する、サーバー能力と需要を組み合わせた考え方と同じです。FAQは、過剰クロールを報告する公式の手段としてフィードバックフォーム(webmaster.baidu.com/feedback/index)を挙げ、“If you find any unreasonable access from
Baiduspider, please inform us.” (翻訳)(Baiduspiderから不合理なアクセスを見つけたら知らせてください)としています。
製品レベルでは、Baidu Search Resource Platform(百度搜索资源平台、ziyuan.baidu.comにある、歴史的には「Baidu Webmaster Tools」と呼ばれたコンソール)が、Google Search ConsoleやBing Webmaster Toolsに相当します。製品マニュアルの索引には、サイト所有者がBaiduspiderのクロール率を直接確認して上限設定できる**「抓取频次」(Crawl Frequency)**の領域が、robotsとクロール診断のツールと並んで掲載されています。Baiduの英語文書ではフィードバックフォームを公式のエスカレーション手段とし、実務上のUIレベルの制御にはZiyuanのCrawl Frequencyダッシュボードを使う、と整理してください。(製品内の正確なメニュー経路はログイン済みZiyuanアカウントの内側にあるため、具体的な手順を引用する前に現行UIを確認してください。)
hreflangなどGoogle標準のシグナル
Googleで標準的なシグナルが、すべてBaiduへ移行するわけではありません。これは業界・実務家の発見であり、どちらの会社も文書化していることではありません。Googleのローカライズ版ドキュメントはGoogle Searchだけを対象としており、Baidu、Bing、Yandexがhreflangを尊重するかどうかについては主張していません。このサイトのhreflangガイドは明確に、Baiduはhreflangをサポートしないと述べています。代わりに、正確なcontent-languageと<html lang>を設定すれば、少なくともBaiduがページの言語を読めるようになります。これは、Googleに限定した私のhreflang記事(Ahrefsのhreflangタグガイドと374,756ドメインの調査。どちらもGoogleの実装だけを扱います)に追加する話であり、矛盾ではありません。
英語の代表者文化がない理由 — FAQの価値
Baiduのエコシステムを特徴付ける点があります。Google(Gary Illyes、John Mueller)、Bing(Fabrice Canel)、Yandexとは違い、Baiduには**目に見える英語の公開代表者によるQ&A文化がありません。**SEOコミュニティと対話する名前付きの広報担当者もいません。Baiduの最も明確な公式英語の声は、署名のない制度的なhelp.baidu.com FAQです。だからこそ、そのFAQと、その背後にある中国語のZiyuan Academyページは非常に価値があります。英語圏のSEOでBaiduspiderについて運用上知ることの大部分は、公式代表者の解説ではなく、実務家のテスト(サーバーログ分析、DNS確認の演習、robots.txtの試行錯誤)から来ています。Michael BonfilsはSearch Engine LandのBaidu対Googleで、“SEO strategies that work for Google may not always translate directly to success on
Baidu, China’s dominant search engine.” (翻訳)(Googleで機能するSEO戦略が、Baiduのような中国の主要検索エンジンで成功へ直接つながるとは限りません)と、広い教訓をまとめています。
Baiduspiderの全体像 — クローラーファミリー、同格のGooglebotとBingbot、user-agentという概念、robots.txt — については、クロールハブがまとめて説明しています。中国市場の文脈については、international SEOが中心です。
AI要約
Advanced版の要点をまとめます。
- Baiduspider = Baiduのウェブクローラー: 中国市場向けのGooglebotです。Baiduは中国本土では優勢(StatCounter 2026年6月:Baidu約47%、Google約2%)なので、Googlebotのおまけではなくinternational SEOの専門領域です。シェアは月ごとに変動するため、スナップショットとして扱います。
- 種類は
Baiduspiderトークンのファミリーを共有: 一般PC/モバイルに加えて、-image、-video、-news、-favo(ブックマーク)、-cpro(広告ネットワーク)、-ads(ビジネス)があります。一般PC UAはMozilla/5.0 (compatible; Baiduspider/2.0; +http://www.baidu.com/search/spider.html)です。 - **
Baiduspider-renderは公式に文書化されています。**ただしBaiduの中国語Ziyuan Academyページだけで、英語FAQにはありません。「-render」が何を変えるかは仕様化されていません。 - 双方向DNSで確認:
*.baidu.comまたは*.baidu.jp(Baiduは両方からクロールします)へ逆引きし、そのホスト名を同じIPへ正引きします。user-agentは偽装でき、Baiduも偽装者を警告しています。 - robots.txt: Baiduは*“strictly complies”* (翻訳)(厳格に遵守する)と主張し、
*/$のワイルドカードと大文字・小文字を区別する照合をサポートします。名前付きの例外は、商業契約のもとで動作しrobots.txtを無視するBaiduspider-cproとBaiduspider-adsです。また、別途Baiduspiderは非標準のcrawl-delayを尊重しません(SEJのAbby Hamiltonによる)。ルール変更の反映には約48時間かかります。 - JavaScriptはGooglebotとの差が最も大きい部分: 公式の能力仕様はありませんが、業界の合意(Dan Taylor:「JavaScriptのクロールが悪いことで知られる」)では、サーバーレンダリング/静的HTMLが中国向けサイトの安全なデフォルトです。
- クロール頻度はアルゴリズムで決まります: サーバー能力、サイト品質、更新頻度をもとに調整されます。過剰クロールはBaiduのフィードバックフォームで報告し、Baidu Search Resource Platform(Ziyuan)(Baidu版Search Console)で頻度を確認・上限設定します。
- **hreflangはBaiduにサポートされません。**業界の発見であり、どちらの会社も肯定も否定も文書化していません。代わりに
content-language/<html lang>を使います。 - 英語の代表者文化はありません: Baiduの最も明確な公式英語の声は署名のないFAQなので、運用知識の大部分は実務家のテストに依存します。
- 英語の代表者文化はありません: Baiduの最も明確な公式英語の声は署名のないFAQなので、運用知識の大部分は実務家のテストに依存します。
公式ドキュメント
一次情報源となるドキュメントです。Baiduの資料は英語FAQと中国語のZiyuan(Baidu Search Resource Platform)ページに分かれています。Googleのリンクはhreflangとの対比のために示しています。
Baidu
- FAQs of Baiduspider(help.baidu.com) — Baiduspiderの実体、user-agent表、クロール頻度の方針、実行例付きのDNS確認、robots.txtの扱いを説明するBaidu公式の英語FAQです。主要な英語一次資料です。
- 【公式見解】2ステップで百度蜘蛛(User-Agent)を正しく識別(ziyuan.baidu.com) — Baiduspiderの識別に関するBaidu公式の中国語記事で、3つのUAチャネル(モバイル/PC/小プログラム)、
Baiduspider-renderのUA、完全な「双方向DNS認証」方法を説明します。 - Baidu Search Resource Platformマニュアル索引(ziyuan.baidu.com) — 抓取频次(Crawl Frequency)、robots、抓取诊断(Crawl Diagnostics)のツール領域を確認できるZiyuan製品マニュアルの索引です。
- baidu.com/robots.txt — クローラーごとの分離を実際に確認できる、Baidu自身のライブrobots.txtです。
Google(hreflangとの対比)
- ページのローカライズ版についてGoogleに知らせる — Google Searchだけを対象にしたGoogleのhreflang文書で、Baidu、Bing、Yandexがhreflangを尊重するかどうかについては何も述べていません。
情報源からの引用
Baiduには名前のある英語広報担当者がいないため、ここでの「情報源」は、Baidu自身の署名なしFAQと、GoogleやBingなら得られる代表者コメントの代わりになる、名前のある業界解説です。各リンクは引用箇所へ移動するディープリンクです。
Baidu — 「FAQs of Baiduspider」(help.baidu.com、英語)
- “Baiduspider is Baidu search engine program which is used to visit pages on the internet and build information into Baidu index. This enables users to locate your site when they perform a search.” (翻訳)(Baiduspiderはインターネット上のページを訪問し、情報をBaiduのインデックスに構築するBaidu検索エンジンプログラムです。これにより、ユーザーは検索時にサイトを見つけられます。) 引用箇所へ
- “In order to ensure the search results cover most of your pages, Baiduspider must keep the crawling at a certain level… to adjust the frequency based on combined factors, such as your server’s capability, your site’s quality and the update frequency of your site.” (翻訳)(検索結果がページの大部分をカバーできるよう、Baiduspiderは一定水準のクロールを維持し、サーバーの能力、サイトの品質、更新頻度など複数の要因に基づいて頻度を調整します。) 引用箇所へ
- “We recommend using reverse DNS lookup to verify Baiduspider.” (翻訳)(Baiduspiderの確認には逆引きDNSを使うことを推奨します。) 引用箇所へ
- “The hostname of Baiduspider is .baidu.com or .baidu.jp. Others are fake hostnames.” (翻訳)(Baiduspiderのホスト名は.baidu.comまたは.baidu.jpです。それ以外は偽のホスト名です。) 引用箇所へ
- “Baidu strictly complies with robots.txt protocol.” (翻訳)(Baiduはrobots.txtプロトコルを厳格に遵守します。) 引用箇所へ
Baidu — Ziyuan Academy(ziyuan.baidu.com、中国語)
- 原文:“二、双向DNS解析认证” (翻訳)(「2. 双方向DNS名前解決認証」)— 逆引きの後に同じIPへ戻る正引きを行ってBaiduspiderを確認する方法についての、Baidu自身の呼び方です。 ページを見る
Dan Taylor(Search Engine Journal)— JavaScriptについて
- “Baidu is notoriously bad when it comes to crawling JavaScript, so make sure that all your important content and links are served in plain HTML on both the mobile and desktop versions of your website.” (翻訳)(BaiduはJavaScriptのクロールが悪いことで知られているため、重要なコンテンツとリンクはモバイル版とデスクトップ版の両方でプレーンHTMLとして配信してください。)2021年3月。 引用箇所へ
Michael Bonfils(Search Engine Land)— 戦略の移行について
- “SEO strategies that work for Google may not always translate directly to success on Baidu, China’s dominant search engine.” (翻訳)(Googleで機能するSEO戦略が、Baiduのような中国の主要検索エンジンでの成功へ直接つながるとは限りません。) 引用箇所へ
Abby Hamilton(Search Engine Journal)— crawl-delayについて
- 彼女のクローラー比較表では、Baiduspiderは非標準の
crawl-delayディレクティブをサポートしないとされています(「Baidu | Baiduspider | No」)。2024年11月。 記事を読む
help.baidu.comのFAQは一部がJavaScriptでレンダリングされ、Ziyuan Academyのページは中国語のみです。上の英語引用はライブページの正確な部分文字列として確認していますが、最終的な文言として扱う前にライブページで再確認してください。JavaScriptレンダリングまたは中国語の情報源にはブラウザを使います。 Baiduspiderにサイトをクロールさせるべきか、どう扱うべきか
Baiduspiderに労力をかける価値があるのは、中国市場で実際に表示されたい場合だけです。順に確認していきます。
Deciding what to do about Baiduspider
ボットが本当にBaiduspiderか確認する
Baidu自身のFAQは、user-agent文字列が簡単に偽装できるため、逆引きDNSでBaiduspiderを確認するよう推奨しています。中国語のZiyuanページでBaiduが示す双方向確認を最後まで行います。IPを逆引きし(ホスト名は*.baidu.comまたは*.baidu.jpで終わらなければなりません)、そのホスト名を同じIPへ正引きします。
macOS / Linux
# 1) Reverse-DNS the IP from your logs — it must end in baidu.com or baidu.jp
host 123.125.66.120
# → 120.66.125.123.in-addr.arpa domain name pointer Baiduspider-123-125-66-120.crawl.baidu.com
# 2) Forward-DNS that hostname back — it must resolve to the same IP
host Baiduspider-123-125-66-120.crawl.baidu.com
# → Baiduspider-123-125-66-120.crawl.baidu.com has address 123.125.66.120macOSでのdig形式(BaiduのFAQにある形式)です。
dig -x 123.125.66.120Windows
nslookup 123.125.66.120
nslookup Baiduspider-123-125-66-120.crawl.baidu.com逆引き結果がbaidu.comまたはbaidu.jpで終わらない場合、または正引き結果が元のIPを返さない場合、それはBaiduspiderではありません。破棄するか、レート制限してください。(GooglebotとBingbotを確認する場合も同じ2段階の方法です。Google/Bing版のコマンドは、それぞれの記事のScriptsタブを参照してください。)
サーバーログからBaiduspiderのアクセスだけを取り出す
アクセスログからBaiduspider候補の行を取り出し、上のDNS確認で各IPを検証します。文字列だけを信用しないでください。
# Extract lines whose user-agent claims to be Baiduspider, print unique IPs
grep -i 'baiduspider' /var/log/nginx/access.log \
| awk '{print $1}' | sort -uホスト名がBaiduの許可されたドメインに一致するか確認する(正規表現)
ホスト名を逆引きしたら、この正規表現で、似せかけのホスト名ではなくBaiduの2つの正規クローラー名前空間(.baidu.comまたは.baidu.jp)に属することを確認できます。
# Passes only for hostnames ending in .baidu.com or .baidu.jp
echo "Baiduspider-123-125-66-120.crawl.baidu.com" \
| grep -Eiq '\.baidu\.(com|jp)$' && echo "legit namespace" || echo "FAKE"baidu.com.evil.exampleのような似せかけに注意してください。文字列の末尾($)にパターンを固定することが、そうした値の通過を防ぎます。
Baiduspider向けrobots.txtの出発点
# Let Baiduspider crawl everything except low-value spaces
User-agent: Baiduspider
Disallow: /search
Disallow: /*?*sort=
# Block Baiduspider entirely (China not a target market)
# User-agent: Baiduspider
# Disallow: /覚えておいてください。Disallowはクロールを制御するもので、インデックス登録を制御するものではありません。ルール変更の反映には約48時間かかります。広告クローラーのBaiduspider-cproとBaiduspider-adsは設計上robots.txtを無視します。
Baiduspider — チートシート
User-agent文字列とクローラーの種類
| 種類 | robots.txtトークン | User-agent |
|---|---|---|
| 一般(PC+モバイル) | Baiduspider | Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.baidu.com/search/spider.html) |
| 画像検索 | Baiduspider-image | Baiduspiderファミリーのトークンに-imageサフィックス |
| 動画検索 | Baiduspider-video | -videoサフィックス(user-agentごとのrobots.txtルールには現在対応しない) |
| ニュース検索 | Baiduspider-news | -newsサフィックス |
| Baiduブックマーク | Baiduspider-favo | -favoサフィックス |
| Baidu連合(広告ネットワーク) | Baiduspider-cpro | -cproサフィックス — robots.txtを無視(商業契約による) |
| ビジネス検索 | Baiduspider-ads | -adsサフィックス — robots.txtを無視(商業契約による) |
| レンダー(JS向け) | — | Mozilla/5.0 (compatible; Baiduspider-render/2.0; +http://www.baidu.com/search/spider.html) — Baiduの中国語Ziyuan Academyページだけで文書化され、英語FAQにはありません |
定義されている種類のUAはすべて同じ参照URL、http://www.baidu.com/search/spider.htmlを指します。これはGooglebotのgoogle.com/bot.htmlに相当するBaiduspiderのURLです。
robots.txt遵守の早見表
| クローラー | robots.txtに従うか |
|---|---|
一般のBaiduspider、-image、-video、-news、-favo | Yes — BaiduのFAQは*“Baidu strictly complies with robots.txt protocol”* (翻訳)(Baiduはrobots.txtプロトコルを厳格に遵守する)と述べています |
Baiduspider-cpro | No — 名前付きで文書化された例外(商業契約) |
Baiduspider-ads | No — 名前付きで文書化された例外(商業契約) |
非標準のcrawl-delayディレクティブ | No — Search Engine JournalのAbby Hamiltonによれば、Baiduspiderのどの種類も尊重しません |
速く確認する事実
- 双方向DNSで確認する: クロール元IPを逆引きして
*.baidu.comまたは*.baidu.jpで終わるホスト名を確認し、そのホスト名を同じIPへ正引きします。user-agent文字列だけでは何も証明できません。 - すでにインデックス登録されたサイトでのrobots.txtの変更は、反映に約48時間かかります。
- Baiduはrobots.txtのパスで
*と$のワイルドカード照合をサポートし、正確で大文字と小文字を区別するパス照合を行います。 - クロール頻度はアルゴリズムで自己調整されます(サーバー能力、サイト品質、更新頻度)。**Baidu Search Resource Platform(Ziyuan)**で確認・上限設定します。
- Googlebotと比べたBaiduspiderの最大の実務上の差は、JavaScriptレンダリングが弱いことです。中国向けコンテンツでは、サーバーレンダリングまたは静的HTMLを安全なデフォルトにします。
- Baiduはhreflangをサポートしません。代替シグナルは正確な
content-languageと<html lang>です。
Baiduspider対応チェックリスト
Baiduspiderに対して誤って逆効果になっていないかを確認する簡単なチェックです。Advancedタブと同じ内容をチェックリストにまとめています。
- Baidu検索結果で発見させたい範囲について、robots.txtが
Baiduspider(または対象の種類)をブロックしていない。 - **Baidu Search Resource Platform(Ziyuan)**でサイトマップを送信している。
- ボット確認は双方向DNSを使っている。
*.baidu.com/*.baidu.jpへ逆引きし、同じIPへ戻ることを正引きで確認する。user-agent文字列だけに頼らない。 - **
Baiduspider-cproとBaiduspider-ads**は設計上robots.txtを無視するため、そこをブロックしても止まらないことを理解している。 - 最近robots.txtを厳しくした場合、インデックス状況を再確認する前に反映のため約48時間待っている。
- 重要なコンテンツ、内部リンク、メタデータがすべてサーバーレンダリングHTMLのレスポンスに存在し、クライアント側JavaScriptだけで注入されていない。
- Baiduはhreflangをサポートしないため、
content-languageと<html lang>を正しく設定している。 - Baiduspiderのアクセスがサーバーに負荷をかけている場合、ZiyuanのCrawl Frequency(抓取频次)画面でクロール負荷を確認している。
- 不合理または過剰なクロールは、推測でブロックするのではなくBaiduのフィードバックフォーム(
webmaster.baidu.com/feedback/index)から報告している。 - Baidu MIPへの依存が残っていない。フレームワークは廃止済み(キャッシュは2020年6月に段階終了、サービス全体は2022年9月末までに終了)である。
Baiduspiderと作業するためのツール
- DNS Checker — Baidu自身のFAQが推奨する双方向DNS確認を行う自作ツールです。クロール元IPとレコードタイプPTRを入力して逆引きを実行します(本物のBaiduspiderホスト名は
.baidu.comまたは.baidu.jpで終わります)。次にホスト名とレコードタイプAを入力し、正引きが同じIPへ戻ることを確認します。Cloudflare、Google、Quad9へ横並びで問い合わせ、解決結果が異なるリゾルバーを見つけられます。 - robots.txt Tester — robots.txtのルールが意図したとおりBaiduspiderを許可・ブロックするか確認する自作ツールです。ファイルを貼り付け、カスタムuser-agent欄に
Baiduspider(またはBaiduspider-image、Baiduspider-newsなど)を入力し、実際のパスでテストします。URLごとに勝つ正確なルールを表示します。Baiduspider-cproとBaiduspider-adsは別個の商業契約で動くため、テスターの表示に関係なくrobots.txtを無視する点に注意してください。
Baiduspiderに関する神話と避けるべき間違い
神話:「Baiduspider」を含むuser-agentはすべて本物のBaiduである。
なぜ間違いか:user-agent文字列は簡単に偽装でき、Baidu自身のFAQも*“spammers or other trouble makers who pretend to be Baiduspider.”* (翻訳)(Baiduspiderを装うスパマーやその他の迷惑行為者)を警告しています。
代わりに行うこと:どの「Baiduspider」アクセスを信頼またはブロックする前にも、双方向DNS確認を実行します。*.baidu.com/*.baidu.jpのホスト名へ逆引きし、同じIPへ正引きで戻ることを確認してください。
神話:「Baiduはrobots.txtに決して従わない、または全般に信頼できない。」
なぜ間違いか:BaiduのFAQは標準クローラーについて*“Baidu strictly complies with robots.txt
protocol”* (翻訳)(Baiduはrobots.txtプロトコルを厳格に遵守する)と述べています。本当の例外は狭く、名前が付いています。Baiduspider-cproとBaiduspider-adsは商業契約のもとで動作しrobots.txtを無視します。曖昧に「Baiduはrobotsを無視する」という話ではありません。
代わりに行うこと:具体的なcpro/adsの例外を引用し、Baiduspiderが非標準のcrawl-delayディレクティブを尊重しないという別の事実と混同しないでください。
神話:「Baiduspiderは最新のGooglebotと同じ程度にJavaScriptをレンダリングする。」 なぜ間違いか:業界の合意(Dan TaylorはJavaScriptのクロールを*“notoriously bad”* (翻訳)(悪いことで知られている)と表現しました)では、Baiduspiderは常時更新されるChromiumのGooglebotに大きく遅れています。クライアント側だけのコンテンツは、Googleで問題なく順位を得られても、Baiduでは現実のインデックス登録リスクです。 代わりに行うこと:中国向けサイトでは、重要なコンテンツ、リンク、メタデータをサーバーレンダリングまたは静的HTMLで配信します。Googlebot、Bingbot、Baiduspiderのすべてに通用する安全なデフォルトです。
神話:「hreflangはBaiduでもGoogleと同じように機能する。」
なぜ間違いか:Baiduはhreflangをまったくサポートしません(業界の発見であり、Google自身の文書も他の検索エンジンについてはコメントしていません)。
代わりに行うこと:正確なcontent-languageと<html lang>に切り替え、Baiduが少なくともページの言語を読めるようにします。Baiduを誘導するためにhreflangへ依存しないでください。
神話:「Baiduspider-renderは公式に文書化された種類ではない。」
なぜ間違いか:Baiduの英語FAQ表にはありませんが、Baiduの中国語Ziyuan AcademyページはBaiduspider-render/2.0をPC/モバイルの代替UAと小プログラムの種類として文書化しています。公式ですが、中国語だけです。
代わりに行うこと:公式に文書化されている(中国語のみ)と説明しつつ、「-render」が実際に何を違わせるのかについてBaiduは仕様を公開していないと注記します。
神話:「Baidu MIPは今も現役で、推奨される順位向けのレバーである。」 なぜ間違いか:Baidu版AMPであるMIP(Mobile Instant Pages)はレガシーのフレームワークです。JademondのMIP用語集によれば、MIP Cacheは2020年6月に段階的に廃止され、MIPサービス全体も2022年9月末までに終了しました。それでも現在の日付の代理店コンテンツが現役として推奨することがあり、これ自体が混乱の原因です。 代わりに行うこと:MIPは廃止済みと扱い、現役の速度・順位向けレバーとして紹介する最近のガイドには注意してください。
Baiduspider理解度チェック
Baiduのクローラーについての簡単な5問です。それぞれ回答を選んでから、正解を確認してください。
役立つリソース
関連する自分の記事
- hreflangタグ:シンプル(ただし完全)なガイド — Joshua Hardwickと作成したAhrefsガイドです。Googleに限定した内容で、Baiduがhreflangをサポートしないことが別問題である理由の文脈になります。
- hreflangを使うドメインの67%以上に問題 — 374 756ドメインを対象にしたチームの調査です。Googleの実装に焦点を当て、Baiduがサポートしないこととの対比に使えます。
- Technical SEOビギナーズガイド — クローラーと国際シグナルが全体像のどこに位置付くかを説明します。
講演資料
- International SEO:変わった技術的論点(Pubcon Vegas 2019、SlideShare) — Baidu市場向けの作業が扱う、international SEOの技術的なエッジケースについての講演です。
業界の情報源
- FAQs of Baiduspider(Baidu、help.baidu.com) — UA表、DNS確認、robots.txtの処理、クロール頻度の方針を扱うBaidu自身の英語FAQです。英語の一次資料です。
- Google対Baidu:SEO戦略の主な違い(Dan Taylor、Search Engine Journal) — 「JavaScriptのクロールが悪いことで知られる」という評価と、プレーンHTMLの推奨です。
- Baidu対Google:2024年のSEO環境を読み解く(Michael Bonfils、Search Engine Land) — Googleの戦術がBaiduに直接移行しない理由についての代理店創業者の見方です。
- robots.txt現代ガイド(Abby Hamilton、Search Engine Journal) — Baiduspiderが
crawl-delayを尊重しないことを示すクローラー比較表です。 - ウェブクローラーガイド:知っておくべきこと(James Allen、Search Engine Land) — 広いクローラーのまとめの中でのBaiduspiderの位置付けです。
- Baidu Spiders、User Agent、robots.txtを理解する(Jademond Digital) — Baiduのクローラー種類とrobots処理を掘り下げた実務家向け記事です。
- Baidu MIP(用語集)(Jademond Digital) — MIPの廃止日(キャッシュは2020年6月、サービス全体は2022年9月末)を確認する情報源です。
変更履歴
2026年8月8日に更新。
編集概要と記録された変更の詳細。変更の詳細
-
変更の詳細な注記は現在英語でのみ提供されています。
完全な比較は利用できません — この改訂の以前のスナップショットがアーカイブされていません。