Guide : Baiduspider

Ce qu’est Baiduspider : les variantes et chaînes user-agent du robot d’exploration de Baidu, la conformité à robots.txt (et l’exception cpro/ads), la vérification par DNS inverse, le rendu JavaScript limité et le contrôle de la fréquence d’exploration dans Ziyuan.

Première publication : 3 juil. 2026 · Dernière mise à jour : 9 août 2026 · Advanced
Langues
1 indice probant sur cette page

Baiduspider est le robot d’exploration de Baidu, l’équivalent de Googlebot pour le marché chinois : il découvre, télécharge et indexe les pages destinées à Baidu Search en Chine continentale. Il possède plusieurs variantes qui partagent la famille de jetons Baiduspider (image, vidéo, actualités, favoris, cpro, ads), ainsi qu’une variante JavaScript Baiduspider-render documentée par Baidu uniquement en chinois. Vérifiez-le par DNS bidirectionnel vers *.baidu.com ou *.baidu.jp, car le user-agent est falsifiable et la FAQ de Baidu avertit contre les usurpateurs. Baidu affirme respecter strictement robots.txt, à l’exception nommée de Baiduspider-cpro et Baiduspider-ads, qui fonctionnent dans le cadre d’accords commerciaux et l’ignorent. Sa principale limite pratique face à Googlebot est le rendu JavaScript limité ; le HTML rendu par le serveur est donc le choix prudent. Contrôlez la fréquence d’exploration dans Baidu Search Resource Platform (Ziyuan).

TL;DR — Baiduspider est le robot d’exploration de Baidu — le Googlebot du marché chinois. Il utilise des variantes nommées qui partagent la famille de jetons Baiduspider (PC/mobile général, ainsi que -image, -video, -news, -favo, -cpro et -ads), et une variante JavaScript Baiduspider-render que Baidu documente uniquement en chinois. Vérifiez-le par DNS bidirectionnel vers *.baidu.com/*.baidu.jp : la FAQ de Baidu avertit contre les usurpateurs. Baidu affirme “strictly complies with robots.txt protocol,” (traduction) : « respecte strictement le protocole robots.txt », avec une exception nommée : Baiduspider-cpro et Baiduspider-ads fonctionnent dans le cadre d’accords commerciaux et peuvent suivre des règles d’accès différentes ; Baidu ne documente pas non plus crawl-delay comme un contrôle fiable. Comme le comportement du rendu peut évoluer, le HTML rendu par le serveur est le choix prudent pour le contenu critique. Vérifiez les contrôles actuels dans Baidu Search Resource Platform (Ziyuan).

Evidence for this claim Baiduspider is Baidu Search's crawler and Baidu's Search Resource Platform is the authoritative place to verify current crawler guidance. Scope: Current official Baidu webmaster platform; user-agent text alone is not authentication. Confidence: medium · Verified: Baidu Search Resource Platform Evidence for this claim Crawler access directives use the standardized robots.txt protocol, but engine-specific support and verification should be checked against Baidu's current documentation. Scope: Robots Exclusion Protocol baseline, distinct from undocumented Baidu-specific behavior. Confidence: high · Verified: IETF RFC 9309: Robots Exclusion Protocol

Ce qu’est réellement Baiduspider

Baiduspider (百度蜘蛛) est le robot exploité par Baidu, le moteur de recherche dominant en Chine continentale, où Google est largement inaccessible derrière la Grande Muraille. Son rôle suit le pipeline habituel exploration → indexation → diffusion : découvrir des URL, récupérer les pages et construire l’index utilisé par Baidu Search. La FAQ officielle en anglais de Baidu, “FAQ de Baiduspider” sur help.baidu.com, est l’un des rares documents primaires en anglais ; elle sert de source à la plupart des citations directes ci-dessous.

L’asymétrie qui explique tout : Baidu compte à l’intérieur du pays, pas à l’échelle mondiale. L’instantané chinois de StatCounter pour juin 2026 donnait Baidu à 47,44 %, Bing à 23,24 %, Haosou à 14,02 %, Sogou à 2,62 % et Google à seulement 2,28 % (StatCounter, part de marché des moteurs de recherche en Chine). Considérez ces chiffres comme un instantané, pas comme une constante : les chiffres chinois de StatCounter varient sensiblement d’un mois à l’autre selon les appareils et la méthode (Baidu a été annoncé entre environ 40 % et 65 % dans différents instantanés de 2025–2026). Revérifiez le chiffre actuel plutôt que de citer indéfiniment un seul mois. La conclusion reste la même : Baidu domine en Chine tandis que Google domine le reste du monde. C’est pourquoi l’optimisation de Baiduspider est traitée comme une spécialité SEO internationale à part entière, et non comme un simple ajout après Googlebot. Notre hub SEO par marché explique où situer Baidu aux côtés de Yandex, Naver et des autres moteurs régionaux.

Chaînes user-agent et variantes du robot

La FAQ anglaise de Baidu nomme directement les variantes du robot. Voici la reproduction fidèle (et oui, le texte de Baidu répète « Baiduspider » pour le PC et le mobile au lieu de fournir des chaînes distinctes) :

Nom du produit | Agent utilisateur Recherche sur PC | Baiduspider Recherche mobile | Baiduspider Recherche d’images | Baiduspider-image Recherche vidéo | Baiduspider-video Recherche d’actualités | Baiduspider-news Signets Baidu | Baiduspider-favo Réseau Baidu | Baiduspider-cpro Recherche commerciale | Baiduspider-ads Autre recherche | Baiduspider

Les variantes officiellement nommées dans la FAQ anglaise sont Baiduspider-image, -video, -news, -favo (signets), -cpro (robot du réseau publicitaire ou « union ») et -ads (recherche commerciale) — toutes partagent le jeton de la famille Baiduspider. La chaîne user-agent générale pour PC, telle qu’elle est donnée sur le site de Baidu, est :

Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.baidu.com/search/spider.html)

La chaîne UA mobile intègre Baiduspider/2.0 dans une chaîne Android WebKit. Chaque variante déclarée renvoie vers la même URL de référence http://www.baidu.com/search/spider.html — l’équivalent Baidu de la page google.com/bot.html de Googlebot.

Baiduspider-render — la variante JS que Baidu documente uniquement en chinois

Voici une nuance importante, car beaucoup d’articles la présentent mal : le tableau de la FAQ anglaise ci-dessus ne liste pas de variante « Baiduspider-render », ce qui a conduit certains guides à la réduire à une rumeur de tiers. Ce n’est pas le cas. Baidu documente Baiduspider-render officiellement, mais sur sa page chinoise de la Ziyuan Academy, “【官方说法】只需两步,正确识别百度蜘蛛(User-Agent)” (« [Déclaration officielle] Deux étapes pour identifier correctement Baiduspider »). Cette page répartit les UA en trois canaux — 移动 (mobile), PC et 小程序 (mini-programme) — et liste une UA de rendu alternative à côté de la chaîne simple :

Mozilla/5.0 (compatible; Baiduspider-render/2.0; +http://www.baidu.com/search/spider.html)

avec une chaîne mobile correspondante et une variante de mini-programme (Baiduspider-render/2.0;Smartapp). Ainsi, Baiduspider-render est officiellement documenté — uniquement en chinois, et absent de la FAQ anglaise. Baidu ne publie en revanche aucune spécification de ce que « -render » fait réellement différemment ; à la différence de Google, Baidu ne documente pas ses capacités de rendu JavaScript. C’est l’origine de la réserve sur le rendu JS exposée plus bas.

Comment vérifier Baiduspider (et éviter un robot usurpé)

La chaîne user-agent est triviale à usurper : n’importe qui peut envoyer une requête qui se présente comme Baiduspider. La FAQ de Baidu avertit précisément contre cela et décrit les “spammers or other trouble makers who pretend to be Baiduspider,” (traduction) : « spammeurs ou autres fauteurs de troubles qui se font passer pour Baiduspider » ; elle recommande de vérifier par DNS, pas avec la chaîne. Extrait textuel de la FAQ :

We recommend using reverse DNS lookup to verify Baiduspider. Verification methods are different under linux/windows/os environments. (traduction) : « Nous recommandons d’utiliser une résolution DNS inverse pour vérifier Baiduspider. Les méthodes de vérification diffèrent selon les environnements Linux, Windows et macOS. »

La FAQ donne des commandes propres à chaque système — host sous Linux, nslookup sous Windows et dig -x sous macOS — avec des exemples complets et la règle qui compte :

The hostname of Baiduspider is *.baidu.com or *.baidu.jp. Others are fake hostnames. (traduction) : « Le nom d’hôte de Baiduspider est *.baidu.com ou *.baidu.jp. Les autres noms d’hôte sont faux. »

Les deux domaines *.baidu.com et *.baidu.jp sont la particularité à retenir : Baidu explore depuis les deux espaces de noms DNS inverses, en .com et en .jp. Un nom d’hôte Baiduspider légitime peut donc se terminer par l’un ou l’autre. L’un des exemples fournis par Baidu se résout même vers BaiduMobaider-119-63-195-254.crawl.baidu.jp — notez « BaiduMobaider », et non « Baiduspider », dans ce nom d’hôte : c’est une particularité réelle de la documentation de Baidu, pas une coquille à corriger silencieusement.

La FAQ anglaise de Baidu n’explicite dans son texte que la partie de résolution inverse, mais la page chinoise de la Ziyuan Academy est plus précise : elle nomme le processus entier « 双向DNS解析认证 » (authentification DNS bidirectionnelle) et le découpe en « 第一步:DNS反查IP » (étape 1 : recherche inverse de l’IP) et « 第二步:对域名运行正向DNS查找 » (étape 2 : recherche DNS directe du nom d’hôte). C’est la méthode complète et correcte : résolvez l’IP en sens inverse pour confirmer un nom *.baidu.com/*.baidu.jp, puis résolvez ce nom en sens direct et vérifiez qu’il renvoie à la même IP. C’est la même approche en deux étapes que pour vérifier Googlebot ou Bingbot — les commandes se trouvent dans l’onglet Scripts.

Baiduspider et robots.txt

Baidu formule dans sa propre FAQ une affirmation de conformité particulièrement forte et facile à citer :

Baidu strictly complies with robots.txt protocol. (traduction) : « Baidu respecte strictement le protocole robots.txt. »

Baidu prend aussi en charge les contrôles standard attendus. D’après les documents de la Ziyuan Academy, Baiduspider prend en charge la correspondance par caractères génériques avec * et $ dans les chemins de robots.txt (comme Google et Bing), et applique une correspondance de chemin exacte et sensible à la casse. Vous pouvez définir des règles par user-agent : la FAQ de Baidu donne des exemples complets, notamment celui qui bloque tout pour Baiduspider général mais autorise le robot d’images à accéder à /image/ :

User-agent: Baiduspider
Disallow: /
User-agent: Baiduspider-image
Allow: /image/

(Baidu précise également que Baiduspider-video ne prend actuellement pas en charge ces règles.)

L’exception nommée à la « conformité stricte »

Le point intéressant est la tension entre la conformité stricte revendiquée par Baidu et une exception officielle nommée. Baiduspider-cpro (le robot du réseau publicitaire) et Baiduspider-ads (la recherche commerciale) fonctionnent dans le cadre d’accords commerciaux distincts et ignorent robots.txt par conception. La FAQ dit textuellement : “Baiduspider-cpro will not work on the records set by robots.txt” (traduction) : « Baiduspider-cpro n’appliquera pas les règles définies par robots.txt », et la même règle vaut pour -ads. Il est donc plus honnête de ne pas reprendre le vague « Baidu ne respecte pas toujours robots.txt » que l’on lit sur les sites agrégateurs : les robots standard de Baidu s’y conforment, avec deux robots publicitaires exemptés par contrat comme seul écart concret et documenté.

Un autre point, plus étroit et facile à confondre, est que Baiduspider ne respecte pas la directive non standard crawl-delay. Abby Hamilton, de Search Engine Journal, l’a documenté dans The Modern Guide To Robots.txt (novembre 2024) : son tableau de comparaison des robots indique « Baidu | Baiduspider | No » (traduction) : « Non » pour la prise en charge de crawl-delay (YandexBot de Yandex, en revanche, est indiqué « Yes », soit « Oui »). Il s’agit d’une affirmation différente de la conformité aux directives standard Allow/Disallow ; gardez cette distinction pour ne pas contredire la propre affirmation de Baidu sur robots.txt.

Exemple réel : le robots.txt de baidu.com

Baidu segmente effectivement son robots.txt sur son propre domaine. Son robots.txt actuel donne à son propre Baiduspider une liste d’interdictions plus courte que celle donnée à Googlebot, MSNBot, Sogou et Youdao (qui reçoivent en plus les blocages de /shifen/, /homepage/ et /cpro), et bloque tout (Disallow: /) pour tout user-agent non nommé par défaut :

User-agent: Baiduspider
Disallow: /baidu
Disallow: /s?
Disallow: /ulink?
Disallow: /link?
Disallow: /home/news/data/
Disallow: /bh

Un détail opérationnel de la FAQ mérite d’être retenu lorsque vous modifiez les règles : si vous durcissez robots.txt après l’indexation du site par Baidu, “it usually takes 48 hours for the updated robots.txt to take effect.” (traduction) : « l’effet du robots.txt mis à jour prend généralement 48 heures. »

Baiduspider rend-il le JavaScript ?

C’est la principale limite pratique de Baiduspider par rapport à Googlebot, et il faut distinguer soigneusement ce qui est officiel de ce qui ne l’est pas. La FAQ anglaise de Baidu ne traite pas du tout du rendu JavaScript : il n’existe pas de spécification de capacité équivalente à celle que Google publie pour Googlebot. Nous disposons plutôt de tests cohérents dans le secteur. Dan Taylor l’a formulé sans détour dans la comparaison Google contre Baidu de Search Engine Journal (mars 2021) : “Baidu is notoriously bad when it comes to crawling JavaScript, so make sure that all your important content and links are served in plain HTML on both the mobile and desktop versions of your website.” (traduction) : « Baidu est notoirement mauvais pour explorer JavaScript ; veillez donc à servir tout votre contenu et vos liens importants en HTML simple sur les versions mobile et ordinateur de votre site. »

Cela correspond à la position déjà adoptée par ce site. Notre article sur le SEO de Contentful note que Bing, Yandex et Baidu “may not index [client-side-rendered JS] at all,” (traduction) : « peuvent ne pas indexer du tout le JS rendu côté client », et que le rendu dynamique est déconseillé comme technique Google générale. Placez les trois grands robots sur une échelle : Googlebot utilise un rendu Chromium evergreen complet, Bingbot un rendu Chromium/Edge solide, et Baiduspider est le plus faible des trois pour JavaScript — le HTML simple rendu par le serveur restant la solution de repli sûre pour tous.

Pour un site destiné à la Chine, faites par défaut du rendu côté serveur ou du HTML statique afin que le contenu, les liens et les métadonnées critiques existent dans la réponse initiale, avant toute exécution de JavaScript. Considérez le contenu uniquement côté client comme un risque d’indexation propre à Baidu, même si la page se classe bien dans Google. Présentez le SSR comme une bonne pratique consensuelle du secteur — et non comme une recommandation officielle de Baidu, puisqu’aucune déclaration primaire de Baidu sur le rendu JavaScript ne peut être citée.

Contrôler la fréquence d’exploration de Baiduspider

Baidu présente la fréquence d’exploration comme ajustée automatiquement par algorithme, et non comme un paramètre que vous définissez directement. La FAQ indique, textuellement :

In order to ensure the search results cover most of your pages, Baiduspider must keep the crawling at a certain level. We have been trying our best to avoid increasing the loading to your servers, and to adjust the frequency based on combined factors, such as your server’s capability, your site’s quality and the update frequency of your site. (traduction) : « Pour que les résultats de recherche couvrent la plupart de vos pages, Baiduspider doit maintenir un certain niveau d’exploration et ajuster sa fréquence selon les capacités du serveur, la qualité du site et la fréquence des mises à jour. »

C’est la même logique, fondée sur les capacités du serveur et la demande, que décrivent Google et Bing. La FAQ cite un formulaire de retour (webmaster.baidu.com/feedback/index) comme levier officiel pour signaler une exploration excessive : “If you find any unreasonable access from Baiduspider, please inform us.” (traduction) : « Si vous constatez un accès déraisonnable de Baiduspider, veuillez nous en informer. »

Au niveau du produit, Baidu Search Resource Platform (百度搜索资源平台, à ziyuan.baidu.com — la console historiquement appelée « Baidu Webmaster Tools ») est l’équivalent Baidu de Google Search Console et de Bing Webmaster Tools. Son index de manuel confirme une zone produit « 抓取频次 » (fréquence d’exploration) où les propriétaires de sites peuvent consulter et plafonner directement le rythme de Baiduspider, aux côtés des outils robots et de diagnostic d’exploration. Considérez le formulaire de retour comme le canal d’escalade officiel de la documentation anglaise de Baidu, et le tableau de fréquence de Ziyuan comme le contrôle pratique au niveau de l’interface. (Le chemin exact du menu dans le produit se trouve derrière un compte Ziyuan connecté : vérifiez donc l’interface actuelle avant de citer des étapes précises.)

hreflang et autres signaux standard de Google

Les signaux standard de Google ne se transposent pas tous à Baidu — il s’agit d’un constat du secteur et des praticiens, pas d’un point documenté par l’une ou l’autre entreprise. La documentation des versions localisées de Google est entièrement consacrée à Google Search et ne dit pas si Baidu, Bing ou Yandex respectent hreflang. Ici, notre guide hreflang l’énonce clairement : Baidu ne prend pas du tout en charge hreflang ; le repli consiste à définir correctement content-language et <html lang> pour que Baidu puisse au moins lire la langue de la page. Cela complète mon travail hreflang centré sur Google (le guide Ahrefs sur les balises hreflang et l’étude de 374 756 domaines, qui traitent uniquement de l’implémentation de Google) au lieu de le contredire.

Aucune culture de représentants en anglais — pourquoi cette FAQ est précieuse

Un élément distingue réellement l’écosystème Baidu : contrairement à Google (Gary Illyes, John Mueller), Bing (Fabrice Canel) ou Yandex, Baidu ne possède aucune culture publique visible de questions-réponses avec des représentants anglophones. Aucun porte-parole nommé n’échange avec la communauté SEO. La voix officielle anglaise la plus claire de Baidu est la FAQ institutionnelle non signée de help.baidu.com. Voilà pourquoi cette FAQ — et les pages chinoises de la Ziyuan Academy qui l’accompagnent — sont si précieuses : dans le monde SEO anglophone, la plupart des connaissances opérationnelles sur Baiduspider viennent de tests de praticiens (analyse de journaux serveur, vérifications DNS, essais et erreurs avec robots.txt) plutôt que de commentaires de représentants officiels. Michael Bonfils a résumé la leçon dans B a i d u v s . G o o g l e : “SEO strategies that work for Google may not always translate directly to success on Baidu, China’s dominant search engine.” (traduction) : « Les stratégies SEO qui fonctionnent pour Google ne se transposent pas toujours directement en succès sur Baidu, le moteur dominant en Chine. »

Pour situer Baiduspider dans l’ensemble — la famille des robots, Googlebot et Bingbot comme pairs, la notion de user-agent et robots.txt — le hub sur l’exploration relie ces éléments, tandis que le guide du SEO international présente le contexte du marché chinois.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.