Guide : Baiduspider
Ce qu’est Baiduspider : les variantes et chaînes user-agent du robot d’exploration de Baidu, la conformité à robots.txt (et l’exception cpro/ads), la vérification par DNS inverse, le rendu JavaScript limité et le contrôle de la fréquence d’exploration dans Ziyuan.
Langues
1 indice probant sur cette page
- Outil en ligne associéDNS Checker
Baiduspider est le robot d’exploration de Baidu, l’équivalent de Googlebot pour le marché chinois : il découvre, télécharge et indexe les pages destinées à Baidu Search en Chine continentale. Il possède plusieurs variantes qui partagent la famille de jetons Baiduspider (image, vidéo, actualités, favoris, cpro, ads), ainsi qu’une variante JavaScript Baiduspider-render documentée par Baidu uniquement en chinois. Vérifiez-le par DNS bidirectionnel vers *.baidu.com ou *.baidu.jp, car le user-agent est falsifiable et la FAQ de Baidu avertit contre les usurpateurs. Baidu affirme respecter strictement robots.txt, à l’exception nommée de Baiduspider-cpro et Baiduspider-ads, qui fonctionnent dans le cadre d’accords commerciaux et l’ignorent. Sa principale limite pratique face à Googlebot est le rendu JavaScript limité ; le HTML rendu par le serveur est donc le choix prudent. Contrôlez la fréquence d’exploration dans Baidu Search Resource Platform (Ziyuan).
Evidence for this claim Baiduspider is Baidu Search's crawler and Baidu's Search Resource Platform is the authoritative place to verify current crawler guidance. Scope: Current official Baidu webmaster platform; user-agent text alone is not authentication. Confidence: medium · Verified: Baidu Search Resource Platform Evidence for this claim Crawler access directives use the standardized robots.txt protocol, but engine-specific support and verification should be checked against Baidu's current documentation. Scope: Robots Exclusion Protocol baseline, distinct from undocumented Baidu-specific behavior. Confidence: high · Verified: IETF RFC 9309: Robots Exclusion ProtocolTL;DR — Baiduspider est le robot d’exploration de Baidu : il visite vos pages et les télécharge pour Baidu Search. Si la Chine continentale est un marché important, incluez Baiduspider dans votre suivi de l’exploration. Consultez la documentation actuelle de Baidu destinée aux webmasters avant de vous fier à un comportement propre au moteur, notamment pour le rendu JavaScript et les contrôles d’exploration.
Qu’est-ce que Baiduspider ?
Google n’est pas accessible en Chine continentale. Baidu, lui, y est le moteur de recherche le plus utilisé, et Baiduspider est son robot d’exploration. Lorsqu’il visite votre site, il suit les liens, lit votre sitemap, télécharge vos pages et les transmet pour construire l’index de Baidu — la base de données dans laquelle Baidu puise lorsqu’une personne lance une recherche. Si Baiduspider ne peut pas atteindre et lire une page, celle-ci n’apparaîtra pas dans Baidu.
Selon les propres termes de Baidu (dans sa FAQ officielle en anglais) : “Baiduspider is Baidu search engine program which is used to visit pages on the internet and build information into Baidu index. This enables users to locate your site when they perform a search.” (traduction) : « Baiduspider est le programme du moteur de recherche de Baidu qui visite les pages d’Internet et transforme leurs informations en éléments de l’index de Baidu. Il permet aux utilisateurs de trouver votre site lorsqu’ils effectuent une recherche. » C’est le même rôle que Googlebot pour Google et Bingbot pour Bing.
Pourquoi cela peut vous concerner
Baiduspider ne compte vraiment que si vous voulez être trouvé en Chine continentale. Baidu y reste dominant tandis que Google y est presque absent : un site destiné à la Chine (ou un site mondial qui s’adresse à une audience chinoise) a besoin de Baiduspider comme un site occidental a besoin de Googlebot. Si vous ne servez aucun client en Chine, Baiduspider n’est qu’un robot de plus qui frappe votre serveur ; certains sites choisissent alors de le bloquer pour économiser leurs ressources.
Le point faible : Baiduspider gère mal JavaScript
C’est le point essentiel. Googlebot utilise une version moderne de Chrome et lit correctement la plupart des sites riches en JavaScript. Baiduspider, lui, non : de nombreux tests le décrivent comme peu performant pour exécuter JavaScript. Si votre contenu ou vos liens importants n’apparaissent qu’après l’exécution de JavaScript, Baidu risque de ne jamais les voir, même si la même page se classe bien dans Google. Pour un site destiné à la Chine, la solution prudente consiste à placer le contenu réel dans le HTML simple renvoyé avant toute exécution de JavaScript.
Comment aider Baiduspider (ou l’arrêter)
- Pour le laisser entrer : créez des liens vers vos pages importantes, envoyez un sitemap
dans Baidu Search Resource Platform (la version de Baidu de Search Console) et ne bloquez
pas accidentellement ces pages dans
robots.txt. - Pour l’empêcher d’accéder à certaines parties du site : utilisez
robots.txt— Baidu affirme suivre les règles standard. - Pour le ralentir : Baidu Search Resource Platform possède une zone de fréquence d’exploration où vous pouvez voir et plafonner le volume d’exploration de Baiduspider.
Vous voulez la version technique — les chaînes user-agent exactes, la vérification d’un Baiduspider authentique, les particularités de robots.txt et les contrôles de fréquence d’exploration ? Passez à l’onglet Advanced.
Evidence for this claim Baiduspider is Baidu Search's crawler and Baidu's Search Resource Platform is the authoritative place to verify current crawler guidance. Scope: Current official Baidu webmaster platform; user-agent text alone is not authentication. Confidence: medium · Verified: Baidu Search Resource Platform Evidence for this claim Crawler access directives use the standardized robots.txt protocol, but engine-specific support and verification should be checked against Baidu's current documentation. Scope: Robots Exclusion Protocol baseline, distinct from undocumented Baidu-specific behavior. Confidence: high · Verified: IETF RFC 9309: Robots Exclusion ProtocolTL;DR — Baiduspider est le robot d’exploration de Baidu — le Googlebot du marché chinois. Il utilise des variantes nommées qui partagent la famille de jetons
Baiduspider(PC/mobile général, ainsi que-image,-video,-news,-favo,-cproet-ads), et une variante JavaScriptBaiduspider-renderque Baidu documente uniquement en chinois. Vérifiez-le par DNS bidirectionnel vers*.baidu.com/*.baidu.jp: la FAQ de Baidu avertit contre les usurpateurs. Baidu affirme “strictly complies with robots.txt protocol,” (traduction) : « respecte strictement le protocole robots.txt », avec une exception nommée :Baiduspider-cproetBaiduspider-adsfonctionnent dans le cadre d’accords commerciaux et peuvent suivre des règles d’accès différentes ; Baidu ne documente pas non pluscrawl-delaycomme un contrôle fiable. Comme le comportement du rendu peut évoluer, le HTML rendu par le serveur est le choix prudent pour le contenu critique. Vérifiez les contrôles actuels dans Baidu Search Resource Platform (Ziyuan).
Ce qu’est réellement Baiduspider
Baiduspider (百度蜘蛛) est le robot exploité par Baidu, le moteur de recherche dominant
en Chine continentale, où Google est largement inaccessible derrière la Grande Muraille. Son
rôle suit le pipeline habituel exploration → indexation → diffusion : découvrir des URL,
récupérer les pages et construire l’index utilisé par Baidu Search. La FAQ officielle en
anglais de Baidu, “FAQ de Baiduspider”
sur help.baidu.com, est l’un des rares documents primaires en anglais ; elle sert de source
à la plupart des citations directes ci-dessous.
L’asymétrie qui explique tout : Baidu compte à l’intérieur du pays, pas à l’échelle mondiale. L’instantané chinois de StatCounter pour juin 2026 donnait Baidu à 47,44 %, Bing à 23,24 %, Haosou à 14,02 %, Sogou à 2,62 % et Google à seulement 2,28 % (StatCounter, part de marché des moteurs de recherche en Chine). Considérez ces chiffres comme un instantané, pas comme une constante : les chiffres chinois de StatCounter varient sensiblement d’un mois à l’autre selon les appareils et la méthode (Baidu a été annoncé entre environ 40 % et 65 % dans différents instantanés de 2025–2026). Revérifiez le chiffre actuel plutôt que de citer indéfiniment un seul mois. La conclusion reste la même : Baidu domine en Chine tandis que Google domine le reste du monde. C’est pourquoi l’optimisation de Baiduspider est traitée comme une spécialité SEO internationale à part entière, et non comme un simple ajout après Googlebot. Notre hub SEO par marché explique où situer Baidu aux côtés de Yandex, Naver et des autres moteurs régionaux.
Chaînes user-agent et variantes du robot
La FAQ anglaise de Baidu nomme directement les variantes du robot. Voici la reproduction fidèle (et oui, le texte de Baidu répète « Baiduspider » pour le PC et le mobile au lieu de fournir des chaînes distinctes) :
Nom du produit | Agent utilisateur Recherche sur PC | Baiduspider Recherche mobile | Baiduspider Recherche d’images | Baiduspider-image Recherche vidéo | Baiduspider-video Recherche d’actualités | Baiduspider-news Signets Baidu | Baiduspider-favo Réseau Baidu | Baiduspider-cpro Recherche commerciale | Baiduspider-ads Autre recherche | Baiduspider
Les variantes officiellement nommées dans la FAQ anglaise sont Baiduspider-image,
-video, -news, -favo (signets), -cpro (robot du réseau publicitaire ou
« union ») et -ads (recherche commerciale) — toutes partagent le jeton de la famille
Baiduspider. La chaîne user-agent générale pour PC, telle qu’elle est donnée sur le site
de Baidu, est :
Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.baidu.com/search/spider.html)La chaîne UA mobile intègre Baiduspider/2.0 dans une chaîne Android WebKit. Chaque
variante déclarée renvoie vers la même URL de référence
http://www.baidu.com/search/spider.html — l’équivalent Baidu de la page
google.com/bot.html de Googlebot.
Baiduspider-render — la variante JS que Baidu documente uniquement en chinois
Voici une nuance importante, car beaucoup d’articles la présentent mal : le tableau de la FAQ
anglaise ci-dessus ne liste pas de variante « Baiduspider-render », ce qui a conduit
certains guides à la réduire à une rumeur de tiers. Ce n’est pas le cas. Baidu documente
Baiduspider-render officiellement, mais sur sa page chinoise de la Ziyuan Academy,
“【官方说法】只需两步,正确识别百度蜘蛛(User-Agent)”
(« [Déclaration officielle] Deux étapes pour identifier correctement Baiduspider »). Cette
page répartit les UA en trois canaux — 移动 (mobile), PC et 小程序 (mini-programme) — et
liste une UA de rendu alternative à côté de la chaîne simple :
Mozilla/5.0 (compatible; Baiduspider-render/2.0; +http://www.baidu.com/search/spider.html)avec une chaîne mobile correspondante et une variante de mini-programme
(Baiduspider-render/2.0;Smartapp). Ainsi, Baiduspider-render est officiellement
documenté — uniquement en chinois, et absent de la FAQ anglaise. Baidu ne publie en
revanche aucune spécification de ce que « -render » fait réellement différemment ; à la
différence de Google, Baidu ne documente pas ses capacités de rendu JavaScript. C’est
l’origine de la réserve sur le rendu JS exposée plus bas.
Comment vérifier Baiduspider (et éviter un robot usurpé)
La chaîne user-agent est triviale à usurper : n’importe qui peut envoyer une requête qui
se présente comme Baiduspider. La FAQ de Baidu avertit précisément contre cela et décrit
les “spammers or other trouble makers who pretend to be Baiduspider,” (traduction) :
« spammeurs ou autres fauteurs de troubles qui se font passer pour Baiduspider » ; elle
recommande de vérifier par DNS, pas avec la chaîne. Extrait textuel de la FAQ :
We recommend using reverse DNS lookup to verify Baiduspider. Verification methods are different under linux/windows/os environments. (traduction) : « Nous recommandons d’utiliser une résolution DNS inverse pour vérifier Baiduspider. Les méthodes de vérification diffèrent selon les environnements Linux, Windows et macOS. »
La FAQ donne des commandes propres à chaque système — host sous Linux, nslookup sous
Windows et dig -x sous macOS — avec des exemples complets et la règle qui compte :
The hostname of Baiduspider is *.baidu.com or *.baidu.jp. Others are fake hostnames. (traduction) : « Le nom d’hôte de Baiduspider est *.baidu.com ou *.baidu.jp. Les autres noms d’hôte sont faux. »
Les deux domaines *.baidu.com et *.baidu.jp sont la particularité à retenir :
Baidu explore depuis les deux espaces de noms DNS inverses, en .com et en .jp. Un nom
d’hôte Baiduspider légitime peut donc se terminer par l’un ou l’autre. L’un des exemples
fournis par Baidu se résout même vers BaiduMobaider-119-63-195-254.crawl.baidu.jp — notez
« BaiduMobaider », et non « Baiduspider », dans ce nom d’hôte : c’est une particularité
réelle de la documentation de Baidu, pas une coquille à corriger silencieusement.
La FAQ anglaise de Baidu n’explicite dans son texte que la partie de résolution inverse,
mais la page chinoise de la Ziyuan Academy est plus précise : elle nomme le processus entier
« 双向DNS解析认证 » (authentification DNS bidirectionnelle) et le découpe en
« 第一步:DNS反查IP » (étape 1 : recherche inverse de l’IP) et
« 第二步:对域名运行正向DNS查找 » (étape 2 : recherche DNS directe du nom d’hôte). C’est
la méthode complète et correcte : résolvez l’IP en sens inverse pour confirmer un nom
*.baidu.com/*.baidu.jp, puis résolvez ce nom en sens direct et vérifiez qu’il renvoie
à la même IP. C’est la même approche en deux étapes que pour vérifier
Googlebot ou
Bingbot — les commandes se
trouvent dans l’onglet Scripts.
Baiduspider et robots.txt
Baidu formule dans sa propre FAQ une affirmation de conformité particulièrement forte et facile à citer :
Baidu strictly complies with robots.txt protocol. (traduction) : « Baidu respecte strictement le protocole robots.txt. »
Baidu prend aussi en charge les contrôles standard attendus. D’après les documents de
la Ziyuan Academy, Baiduspider prend en charge la correspondance par caractères génériques
avec * et $ dans les chemins de robots.txt (comme Google et Bing), et applique une
correspondance de chemin exacte et sensible à la casse. Vous pouvez définir des règles
par user-agent : la FAQ de Baidu donne des exemples complets, notamment celui qui bloque
tout pour Baiduspider général mais autorise le robot d’images à accéder à /image/ :
User-agent: Baiduspider
Disallow: /
User-agent: Baiduspider-image
Allow: /image/(Baidu précise également que Baiduspider-video ne prend actuellement pas en charge
ces règles.)
L’exception nommée à la « conformité stricte »
Le point intéressant est la tension entre la conformité stricte revendiquée par Baidu et
une exception officielle nommée. Baiduspider-cpro (le robot du réseau publicitaire)
et Baiduspider-ads (la recherche commerciale) fonctionnent dans le cadre d’accords
commerciaux distincts et ignorent robots.txt par conception. La FAQ dit textuellement :
“Baiduspider-cpro will not work on the records set by robots.txt” (traduction) :
« Baiduspider-cpro n’appliquera pas les règles définies par robots.txt », et la même règle
vaut pour -ads. Il est donc plus honnête de ne pas reprendre le vague « Baidu ne respecte
pas toujours robots.txt » que l’on lit sur les sites agrégateurs : les robots standard de
Baidu s’y conforment, avec deux robots publicitaires exemptés par contrat comme seul
écart concret et documenté.
Un autre point, plus étroit et facile à confondre, est que Baiduspider ne respecte pas
la directive non standard crawl-delay. Abby Hamilton, de Search Engine Journal, l’a
documenté dans The Modern Guide To Robots.txt
(novembre 2024) : son tableau de comparaison des robots indique « Baidu | Baiduspider | No »
(traduction) : « Non » pour la prise en charge de crawl-delay (YandexBot de Yandex,
en revanche, est indiqué « Yes », soit « Oui »). Il s’agit d’une affirmation différente de
la conformité aux directives standard Allow/Disallow ; gardez cette distinction pour
ne pas contredire la propre affirmation de Baidu sur robots.txt.
Exemple réel : le robots.txt de baidu.com
Baidu segmente effectivement son robots.txt sur son propre domaine. Son
robots.txt actuel donne à son propre Baiduspider une
liste d’interdictions plus courte que celle donnée à Googlebot, MSNBot, Sogou et Youdao
(qui reçoivent en plus les blocages de /shifen/, /homepage/ et /cpro), et bloque tout
(Disallow: /) pour tout user-agent non nommé par défaut :
User-agent: Baiduspider
Disallow: /baidu
Disallow: /s?
Disallow: /ulink?
Disallow: /link?
Disallow: /home/news/data/
Disallow: /bhUn détail opérationnel de la FAQ mérite d’être retenu lorsque vous modifiez les règles : si vous durcissez robots.txt après l’indexation du site par Baidu, “it usually takes 48 hours for the updated robots.txt to take effect.” (traduction) : « l’effet du robots.txt mis à jour prend généralement 48 heures. »
Baiduspider rend-il le JavaScript ?
C’est la principale limite pratique de Baiduspider par rapport à Googlebot, et il faut distinguer soigneusement ce qui est officiel de ce qui ne l’est pas. La FAQ anglaise de Baidu ne traite pas du tout du rendu JavaScript : il n’existe pas de spécification de capacité équivalente à celle que Google publie pour Googlebot. Nous disposons plutôt de tests cohérents dans le secteur. Dan Taylor l’a formulé sans détour dans la comparaison Google contre Baidu de Search Engine Journal (mars 2021) : “Baidu is notoriously bad when it comes to crawling JavaScript, so make sure that all your important content and links are served in plain HTML on both the mobile and desktop versions of your website.” (traduction) : « Baidu est notoirement mauvais pour explorer JavaScript ; veillez donc à servir tout votre contenu et vos liens importants en HTML simple sur les versions mobile et ordinateur de votre site. »
Cela correspond à la position déjà adoptée par ce site. Notre article sur le SEO de Contentful note que Bing, Yandex et Baidu “may not index [client-side-rendered JS] at all,” (traduction) : « peuvent ne pas indexer du tout le JS rendu côté client », et que le rendu dynamique est déconseillé comme technique Google générale. Placez les trois grands robots sur une échelle : Googlebot utilise un rendu Chromium evergreen complet, Bingbot un rendu Chromium/Edge solide, et Baiduspider est le plus faible des trois pour JavaScript — le HTML simple rendu par le serveur restant la solution de repli sûre pour tous.
Pour un site destiné à la Chine, faites par défaut du rendu côté serveur ou du HTML statique afin que le contenu, les liens et les métadonnées critiques existent dans la réponse initiale, avant toute exécution de JavaScript. Considérez le contenu uniquement côté client comme un risque d’indexation propre à Baidu, même si la page se classe bien dans Google. Présentez le SSR comme une bonne pratique consensuelle du secteur — et non comme une recommandation officielle de Baidu, puisqu’aucune déclaration primaire de Baidu sur le rendu JavaScript ne peut être citée.
Contrôler la fréquence d’exploration de Baiduspider
Baidu présente la fréquence d’exploration comme ajustée automatiquement par algorithme, et non comme un paramètre que vous définissez directement. La FAQ indique, textuellement :
In order to ensure the search results cover most of your pages, Baiduspider must keep the crawling at a certain level. We have been trying our best to avoid increasing the loading to your servers, and to adjust the frequency based on combined factors, such as your server’s capability, your site’s quality and the update frequency of your site. (traduction) : « Pour que les résultats de recherche couvrent la plupart de vos pages, Baiduspider doit maintenir un certain niveau d’exploration et ajuster sa fréquence selon les capacités du serveur, la qualité du site et la fréquence des mises à jour. »
C’est la même logique, fondée sur les capacités du serveur et la demande, que décrivent
Google et Bing. La FAQ cite un formulaire de retour (webmaster.baidu.com/feedback/index)
comme levier officiel pour signaler une exploration excessive : “If you find any unreasonable access from
Baiduspider, please inform us.” (traduction) : « Si vous constatez un accès déraisonnable
de Baiduspider, veuillez nous en informer. »
Au niveau du produit, Baidu Search Resource Platform (百度搜索资源平台, à
ziyuan.baidu.com — la console historiquement appelée « Baidu Webmaster Tools ») est
l’équivalent Baidu de Google Search Console et de Bing Webmaster Tools. Son index de manuel
confirme une zone produit « 抓取频次 » (fréquence d’exploration) où les propriétaires de
sites peuvent consulter et plafonner directement le rythme de Baiduspider, aux côtés des
outils robots et de diagnostic d’exploration. Considérez le formulaire de retour comme le
canal d’escalade officiel de la documentation anglaise de Baidu, et le tableau de fréquence
de Ziyuan comme le contrôle pratique au niveau de l’interface. (Le chemin exact du menu dans
le produit se trouve derrière un compte Ziyuan connecté : vérifiez donc l’interface actuelle
avant de citer des étapes précises.)
hreflang et autres signaux standard de Google
Les signaux standard de Google ne se transposent pas tous à Baidu — il s’agit d’un
constat du secteur et des praticiens, pas d’un point documenté par l’une ou l’autre entreprise.
La documentation des versions localisées
de Google est entièrement consacrée à Google Search et ne dit pas si Baidu, Bing ou Yandex
respectent hreflang. Ici, notre guide hreflang l’énonce
clairement : Baidu ne prend pas du tout en charge hreflang ; le repli consiste à définir
correctement content-language et <html lang> pour que Baidu puisse au moins lire la langue
de la page. Cela complète mon travail hreflang centré sur Google (le guide Ahrefs sur les
balises hreflang et l’étude de 374 756 domaines,
qui traitent uniquement de l’implémentation de Google) au lieu de le contredire.
Aucune culture de représentants en anglais — pourquoi cette FAQ est précieuse
Un élément distingue réellement l’écosystème Baidu : contrairement à Google (Gary Illyes,
John Mueller), Bing (Fabrice Canel) ou Yandex, Baidu ne possède aucune culture publique visible
de questions-réponses avec des représentants anglophones. Aucun porte-parole nommé n’échange
avec la communauté SEO. La voix officielle anglaise la plus claire de Baidu est la FAQ
institutionnelle non signée de help.baidu.com. Voilà pourquoi cette FAQ — et les pages
chinoises de la Ziyuan Academy qui l’accompagnent — sont si précieuses : dans le monde SEO
anglophone, la plupart des connaissances opérationnelles sur Baiduspider viennent de tests
de praticiens (analyse de journaux serveur, vérifications DNS, essais et erreurs avec robots.txt)
plutôt que de commentaires de représentants officiels. Michael Bonfils a résumé la leçon dans
B a i d u v s . G o o g l e :
“SEO strategies that work for Google may not always translate directly to success on
Baidu, China’s dominant search engine.” (traduction) : « Les stratégies SEO qui fonctionnent
pour Google ne se transposent pas toujours directement en succès sur Baidu, le moteur dominant
en Chine. »
Pour situer Baiduspider dans l’ensemble — la famille des robots, Googlebot et Bingbot comme pairs, la notion de user-agent et robots.txt — le hub sur l’exploration relie ces éléments, tandis que le guide du SEO international présente le contexte du marché chinois.
Résumé par IA
Une synthèse de la version avancée :
- Baiduspider = le robot d’exploration de Baidu — le Googlebot du marché chinois. Baidu domine en Chine continentale (StatCounter, juin 2026 : Baidu ~47 %, Google ~2 %), ce qui en fait une spécialité du SEO international, pas un simple complément à Googlebot. Cette part varie d’un mois à l’autre : considérez-la comme un instantané.
- Les variantes partagent la famille de jetons
Baiduspider: PC/mobile général, plus-image,-video,-news,-favo(signets),-cpro(réseau publicitaire) et-ads(recherche commerciale). UA PC général :Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.baidu.com/search/spider.html). Baiduspider-renderest officiellement documenté, mais uniquement sur la page chinoise de la Ziyuan Academy de Baidu, et absent de la FAQ anglaise. La documentation ne précise pas ce que « -render » fait différemment.- Vérifiez-le par DNS bidirectionnel vers
*.baidu.comou*.baidu.jp(Baidu explore depuis les deux) : résolution inverse de l’IP, puis résolution directe du nom d’hôte vers la même IP. Le user-agent est falsifiable ; Baidu avertit contre les usurpateurs. - robots.txt : Baidu affirme “strictly complies,” (traduction) : « respecte strictement
les règles », prend en charge les caractères génériques
*/$et la correspondance sensible à la casse — avec une exception nommée :Baiduspider-cproetBaiduspider-adsfonctionnent dans le cadre d’accords commerciaux et ignorent robots.txt. Par ailleurs, Baiduspider ne respecte pas la directive non standardcrawl-delay(selon Abby Hamilton de SEJ). Les changements de règles prennent environ 48 heures. - JavaScript est la principale différence face à Googlebot — il n’existe aucune spécification officielle de capacité ; selon le consensus du secteur (Dan Taylor : “notoriously bad… crawling JavaScript” (traduction) : « notoirement mauvais pour explorer JavaScript »), le HTML rendu par le serveur ou statique est le choix prudent pour les sites destinés à la Chine.
- La fréquence d’exploration est algorithmique (capacités du serveur + qualité du site + fréquence des mises à jour) : signalez l’exploration excessive via le formulaire de retour de Baidu et consultez/plafonnez le rythme dans Baidu Search Resource Platform (Ziyuan), l’équivalent de Search Console pour Baidu.
- Baidu ne prend pas hreflang en charge (constat du secteur ; aucune des deux entreprises
ne documente le contraire) — utilisez plutôt
content-language/<html lang>. - Aucune culture publique de représentants anglophones : la voix officielle anglaise la plus claire de Baidu est une FAQ non signée ; les tests de praticiens concentrent donc l’essentiel des connaissances opérationnelles.
Documentation officielle
Documentation issue de sources primaires. Les sources de Baidu sont réparties entre une FAQ anglaise et des pages chinoises de Ziyuan (Baidu Search Resource Platform) ; les liens Google servent à comparer l’intersection avec hreflang.
Baidu
- FAQ de Baiduspider (help.baidu.com) — FAQ officielle anglaise de Baidu : définition de Baiduspider, table des user-agents, politique de fréquence d’exploration, vérification DNS avec exemples et gestion de robots.txt. C’est la source anglaise principale.
- 【官方说法】只需两步,正确识别百度蜘蛛(User-Agent)(ziyuan.baidu.com) — article officiel chinois de Baidu sur l’identification de Baiduspider : trois canaux UA (mobile/PC/mini-programme), UA
Baiduspider-renderet méthode d’« authentification DNS bidirectionnelle » expliquée en détail. - Index du manuel de Baidu Search Resource Platform (ziyuan.baidu.com) — index du manuel produit de Ziyuan, qui confirme les zones de fréquence d’exploration (抓取频次), robots et diagnostic d’exploration (抓取诊断).
- baidu.com/robots.txt — robots.txt actuel de Baidu, exemple réel de segmentation entre robots.
Google (pour comparer l’intersection avec hreflang)
- Informer Google des versions localisées de votre page — documentation hreflang de Google, entièrement limitée à Google Search ; elle ne dit notamment rien sur la prise en charge de hreflang par Baidu, Bing ou Yandex.
Citations de la source
Baidu ne dispose d’aucun porte-parole anglophone nommé ; la « source » ici est donc sa FAQ institutionnelle non signée, complétée par des commentaires de spécialistes nommés qui tiennent lieu de citations de représentants comme on en trouve chez Google ou Bing. Chaque lien est un lien profond qui ouvre directement le passage cité.
Baidu — “FAQs of Baiduspider” (help.baidu.com, en anglais)
- “Baiduspider is Baidu search engine program which is used to visit pages on the internet and build information into Baidu index. This enables users to locate your site when they perform a search.” (traduction) : « Baiduspider est le programme du moteur de recherche de Baidu qui visite les pages d’Internet et construit l’index de Baidu. Il permet de trouver votre site lors d’une recherche. » Voir la citation
- “In order to ensure the search results cover most of your pages, Baiduspider must keep the crawling at a certain level… to adjust the frequency based on combined factors, such as your server’s capability, your site’s quality and the update frequency of your site.” (traduction) : « Pour couvrir la plupart de vos pages, Baiduspider doit maintenir un certain niveau d’exploration et ajuster sa fréquence selon les capacités du serveur, la qualité du site et la fréquence des mises à jour. » Voir la citation
- “We recommend using reverse DNS lookup to verify Baiduspider.” (traduction) : « Nous recommandons une résolution DNS inverse pour vérifier Baiduspider. » Voir la citation
- *“The hostname of Baiduspider is *.baidu.com or .baidu.jp. Others are fake hostnames.” (traduction) : « Le nom d’hôte de Baiduspider est *.baidu.com ou *.baidu.jp ; les autres noms d’hôte sont faux. » Voir la citation
- “Baidu strictly complies with robots.txt protocol.” (traduction) : « Baidu respecte strictement le protocole robots.txt. » Voir la citation
Baidu — Ziyuan Academy (ziyuan.baidu.com, en chinois)
- Original : “二、双向DNS解析认证” — paraphrase anglaise : “Step two: bidirectional DNS resolution authentication,” (traduction) : « Étape deux : authentification DNS bidirectionnelle ». C’est le nom donné par Baidu à la vérification de Baiduspider : une résolution inverse suivie d’une résolution directe qui doit renvoyer vers la même IP. Voir la page
Dan Taylor, Search Engine Journal — sur JavaScript
- “Baidu is notoriously bad when it comes to crawling JavaScript, so make sure that all your important content and links are served in plain HTML on both the mobile and desktop versions of your website.” (traduction) : « Baidu est notoirement mauvais pour explorer JavaScript ; veillez donc à servir tout votre contenu et vos liens importants en HTML simple sur les versions mobile et ordinateur de votre site. » (mars 2021.) Voir la citation
Michael Bonfils, Search Engine Land — sur le transfert des stratégies
- “SEO strategies that work for Google may not always translate directly to success on Baidu, China’s dominant search engine.” (traduction) : « Les stratégies SEO qui fonctionnent pour Google ne se transposent pas toujours directement en succès sur Baidu, le moteur dominant de Chine. » Voir la citation
Abby Hamilton, Search Engine Journal — sur crawl-delay
- Son tableau de comparaison des robots indique que Baiduspider ne prend pas en charge la directive non standard
crawl-delay(« Baidu | Baiduspider | No ») (traduction) : « Baidu | Baiduspider | Non ». (novembre 2024.) Lire l’article
help.baidu.com s’affiche partiellement via JavaScript et la page de la Ziyuan Academy est uniquement en chinois ; les citations anglaises ci-dessus ont été confirmées comme des sous-chaînes exactes des pages actuelles, mais vérifiez-les de nouveau sur les pages en ligne (et utilisez un navigateur pour les sources rendues en JavaScript ou en chinois) avant de les considérer comme définitives. Dois-je laisser Baiduspider explorer mon site — et comment le gérer ?
Baiduspider ne mérite l’effort que si vous cherchez réellement une visibilité sur le marché chinois. Cliquez pour continuer.
Deciding what to do about Baiduspider
Vérifier qu’un robot est bien Baiduspider
La FAQ de Baidu recommande le DNS inverse pour vérifier Baiduspider, car la chaîne
user-agent est triviale à usurper. Effectuez le contrôle bidirectionnel complet nommé
par Baidu sur sa page chinoise de Ziyuan : résolvez l’IP en sens inverse (le nom d’hôte
doit se terminer par *.baidu.com ou *.baidu.jp), puis résolvez ce nom en sens direct
pour retrouver la même IP.
macOS / Linux
# 1) Reverse-DNS the IP from your logs — it must end in baidu.com or baidu.jp
host 123.125.66.120
# → 120.66.125.123.in-addr.arpa domain name pointer Baiduspider-123-125-66-120.crawl.baidu.com
# 2) Forward-DNS that hostname back — it must resolve to the same IP
host Baiduspider-123-125-66-120.crawl.baidu.com
# → Baiduspider-123-125-66-120.crawl.baidu.com has address 123.125.66.120Forme macOS avec dig (telle que la donne la FAQ de Baidu) :
dig -x 123.125.66.120Windows
nslookup 123.125.66.120
nslookup Baiduspider-123-125-66-120.crawl.baidu.comSi la résolution inverse ne se termine pas par baidu.com ou baidu.jp, ou si la
résolution directe ne renvoie pas l’IP d’origine, ce n’est pas Baiduspider : ignorez-le
ou limitez son débit. (C’est la même approche en deux étapes que pour vérifier Googlebot
et Bingbot ; consultez les onglets Scripts de ces articles pour les versions Google et Bing.)
Extraire uniquement les accès de Baiduspider des journaux serveur
Extrayez les lignes candidates de Baiduspider dans un journal d’accès, puis vérifiez chaque IP avec le contrôle DNS ci-dessus — ne faites pas confiance à la chaîne seule.
# Extract lines whose user-agent claims to be Baiduspider, print unique IPs
grep -i 'baiduspider' /var/log/nginx/access.log \
| awk '{print $1}' | sort -uComparer un nom d’hôte aux domaines autorisés de Baidu (expression régulière)
Après avoir résolu un nom d’hôte en sens inverse, cette expression régulière confirme qu’il
appartient à l’un des deux espaces de noms légitimes des robots de Baidu (.baidu.com ou
.baidu.jp), plutôt qu’à un sosie :
# Passes only for hostnames ending in .baidu.com or .baidu.jp
echo "Baiduspider-123-125-66-120.crawl.baidu.com" \
| grep -Eiq '\.baidu\.(com|jp)$' && echo "legit namespace" || echo "FAKE"Méfiez-vous des sosies comme baidu.com.evil.example : c’est l’ancrage du motif à la fin
de la chaîne ($) qui les empêche de passer.
Point de départ pour le robots.txt de Baiduspider
# Let Baiduspider crawl everything except low-value spaces
User-agent: Baiduspider
Disallow: /search
Disallow: /*?*sort=
# Block Baiduspider entirely (China not a target market)
# User-agent: Baiduspider
# Disallow: /À retenir : Disallow contrôle l’exploration, pas l’indexation, et les changements de règles
mettent environ 48 heures à prendre effet. Les robots publicitaires Baiduspider-cpro et
Baiduspider-ads ignorent robots.txt par conception.
Baiduspider — fiche pratique
Chaînes user-agent et variantes du robot
| Variante | Jeton robots.txt | User-agent |
|---|---|---|
| Général (PC + mobile) | Baiduspider | Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.baidu.com/search/spider.html) |
| Recherche d’images | Baiduspider-image | Partage le jeton de la famille Baiduspider, suffixe -image |
| Recherche vidéo | Baiduspider-video | Suffixe -video (ne prend actuellement pas en charge les règles robots.txt par robot) |
| Recherche d’actualités | Baiduspider-news | Suffixe -news |
| Signets Baidu | Baiduspider-favo | Suffixe -favo |
| Réseau Baidu (publicité) | Baiduspider-cpro | Suffixe -cpro — ignore robots.txt en vertu d’un accord commercial |
| Recherche commerciale | Baiduspider-ads | Suffixe -ads — ignore robots.txt en vertu d’un accord commercial |
| Rendu (variante JS) | — | Mozilla/5.0 (compatible; Baiduspider-render/2.0; +http://www.baidu.com/search/spider.html) — documenté uniquement sur la page chinoise de la Ziyuan Academy de Baidu, absente de la FAQ anglaise |
L’UA de chaque variante déclarée pointe vers la même URL de référence,
http://www.baidu.com/search/spider.html — l’équivalent pour Baiduspider de
google.com/bot.html pour Googlebot.
Conformité à robots.txt en un coup d’œil
| Robot | Suit robots.txt ? |
|---|---|
Baiduspider général, -image, -video, -news, -favo | Oui — la FAQ de Baidu affirme “Baidu strictly complies with robots.txt protocol” (traduction) : « Baidu respecte strictement le protocole robots.txt » |
Baiduspider-cpro | Non — exception nommée et documentée (accord commercial) |
Baiduspider-ads | Non — exception nommée et documentée (accord commercial) |
Directive crawl-delay non standard | Non respectée par les variantes de Baiduspider, selon Abby Hamilton de Search Engine Journal |
Faits à retenir
- Vérifiez par DNS bidirectionnel : résolvez l’IP d’exploration en sens inverse pour confirmer un nom d’hôte qui se termine par
*.baidu.comou*.baidu.jp, puis résolvez ce nom en sens direct vers la même IP. La chaîne user-agent seule ne prouve rien. - Les changements de robots.txt prennent environ 48 heures pour agir sur un site déjà indexé.
- Baidu prend en charge les caractères génériques
*et$dans les chemins de robots.txt et effectue une correspondance de chemin exacte, sensible à la casse. - La fréquence d’exploration est ajustée automatiquement par algorithme (capacités du serveur, qualité du site, fréquence des mises à jour) : consultez-la et plafonnez-la dans Baidu Search Resource Platform (Ziyuan).
- Le principal écart pratique de Baiduspider face à Googlebot est son rendu JavaScript limité : le HTML rendu par le serveur ou statique est le choix prudent pour le contenu destiné à la Chine.
- Baidu ne prend pas hreflang en charge — le signal de repli est un
content-languagecorrect et<html lang>.
Liste de contrôle pour Baiduspider
Un contrôle rapide pour confirmer que vous travaillez avec Baiduspider et non contre lui par accident — les mêmes vérifications que dans l’onglet Advanced, sous forme de liste :
- robots.txt ne bloque pas
Baiduspider(ou la variante qui vous concerne) pour les pages que vous voulez faire apparaître dans les résultats Baidu. - Un sitemap est envoyé dans Baidu Search Resource Platform (Ziyuan).
- La vérification du robot utilise le DNS bidirectionnel — résolution inverse vers
*.baidu.com/*.baidu.jp, puis résolution directe confirmant la même IP — jamais la chaîne user-agent seule. - Sachez que
Baiduspider-cproetBaiduspider-adsignorent robots.txt par conception : les bloquer dans ce fichier ne les arrêtera donc pas réellement. - Tout durcissement récent de robots.txt a eu environ 48 heures pour se propager avant de revérifier l’état de l’indexation.
- Le contenu critique, les liens internes et les métadonnées existent tous dans la réponse HTML rendue par le serveur — ils ne sont pas injectés uniquement par JavaScript côté client.
-
content-languageet<html lang>sont correctement définis, puisque Baidu ne prend pas hreflang en charge. - La charge d’exploration est suivie dans la zone Crawl Frequency (抓取频次) de Ziyuan si le trafic de Baiduspider met le serveur sous tension.
- Les explorations déraisonnables ou excessives sont signalées via le formulaire de retour de Baidu (
webmaster.baidu.com/feedback/index), plutôt que bloquées ou devinées. - Il ne reste aucune dépendance à Baidu MIP — le framework est retiré (cache abandonné en juin 2020, service complet arrêté fin septembre 2022).
Outils pour travailler avec Baiduspider
- DNS Checker — mon outil pour effectuer le contrôle DNS bidirectionnel recommandé par la FAQ de Baidu. Saisissez l’IP d’exploration avec le type d’enregistrement PTR pour lancer la résolution inverse (un nom d’hôte Baiduspider authentique se termine par
.baidu.comou.baidu.jp), puis saisissez ce nom d’hôte avec le type d’enregistrement A pour confirmer que la résolution directe renvoie à la même IP. L’outil interroge Cloudflare, Google et Quad9 côte à côte afin de repérer un résolveur qui diverge. - robots.txt Tester — mon outil pour vérifier si vos règles robots.txt bloquent ou autorisent réellement Baiduspider comme prévu. Collez votre fichier, saisissez
Baiduspider(ouBaiduspider-image,Baiduspider-news, etc.) dans le champ user-agent personnalisé et testez-le sur de vrais chemins : l’outil montre la règle exacte qui l’emporte pour chaque URL. Souvenez-vous queBaiduspider-cproetBaiduspider-adsignorent robots.txt quoi que montre le testeur, car ils fonctionnent dans le cadre d’accords commerciaux distincts.
Mythes et erreurs à éviter à propos de Baiduspider
Mythe : « Tout user-agent contenant “Baiduspider” vient réellement de Baidu. »
Pourquoi c’est faux : la chaîne user-agent est triviale à usurper et la FAQ de Baidu avertit
contre les “spammers or other trouble makers who pretend to be Baiduspider.” (traduction) :
« spammeurs ou autres fauteurs de troubles qui se font passer pour Baiduspider ».
À faire : exécutez le contrôle DNS bidirectionnel — résolution inverse vers un nom d’hôte
*.baidu.com/*.baidu.jp, puis résolution directe vers la même IP — avant de faire confiance
à (ou de bloquer sur la base de) n’importe quel accès « Baiduspider ».
Mythe : « Baidu ne suit jamais robots.txt, ou le fait de manière généralement peu fiable. »
Pourquoi c’est faux : la FAQ de Baidu affirme “Baidu strictly complies with robots.txt
protocol” (traduction) : « Baidu respecte strictement le protocole robots.txt » pour ses
robots standard. La véritable exception est étroite et nommée : Baiduspider-cpro et
Baiduspider-ads fonctionnent dans le cadre d’accords commerciaux et ignorent robots.txt —
ce n’est pas le vague « Baidu ignore robots.txt ».
À faire : citez précisément l’exception cpro/ads et ne la confondez pas avec le fait distinct
que Baiduspider ne respecte pas la directive non standard crawl-delay.
Mythe : « Baiduspider rend JavaScript aussi bien que le Googlebot moderne. » Pourquoi c’est faux : le consensus du secteur (Dan Taylor le qualifie de “notoriously bad… crawling JavaScript” (traduction) : « notoirement mauvais pour explorer JavaScript ») est que Baiduspider est très en retard sur le Chromium evergreen de Googlebot ; le contenu uniquement côté client représente un risque réel d’indexation pour Baidu, même lorsque la page se classe bien dans Google. À faire : servez le contenu, les liens et les métadonnées importants dans du HTML rendu par le serveur ou statique pour les sites destinés à la Chine — le choix prudent pour Googlebot, Bingbot et Baiduspider.
Mythe : « hreflang fonctionne de la même manière pour Baidu et pour Google. »
Pourquoi c’est faux : Baidu ne prend pas du tout hreflang en charge (constat du secteur —
la documentation de Google ne se prononce pas davantage sur les autres moteurs).
À faire : utilisez en repli content-language et <html lang> afin que Baidu puisse au moins
lire la langue de la page ; ne comptez pas sur hreflang pour orienter Baidu.
Mythe : « “Baiduspider-render” n’est pas une variante officiellement documentée. »
Pourquoi c’est faux : la table de la FAQ anglaise de Baidu ne la liste pas, mais la page
chinoise de la Ziyuan Academy documente Baiduspider-render/2.0 comme UA PC/mobile
alternatif ainsi qu’une variante mini-programme. C’est officiel — simplement uniquement en
chinois.
À faire : décrivez-la comme officiellement documentée (en chinois uniquement), en précisant
que Baidu ne publie aucune spécification de ce que « -render » fait réellement différemment.
Mythe : « Baidu MIP est encore un levier de classement actif et recommandé. » Pourquoi c’est faux : le framework MIP (Mobile Instant Pages), comparable à AMP, est ancien. Selon le glossaire MIP de Jademond, le cache MIP a été abandonné en juin 2020 et le service MIP complet a été arrêté fin septembre 2022 ; pourtant certains contenus d’agences datés récemment le présentent encore comme actif, ce qui entretient la confusion. À faire : considérez MIP comme retiré et méfiez-vous de tout guide récent qui le présente comme un levier actif de vitesse ou de classement.
Testez vos connaissances : Baiduspider
Cinq questions rapides sur le robot de Baidu. Choisissez une réponse à chaque fois, puis vérifiez.
Ressources qui valent le détour
Mes articles connexes
- Balises hreflang : guide simple (mais complet) — mon guide Ahrefs (avec Joshua Hardwick) sur hreflang ; il est centré sur Google et explique pourquoi l’absence de prise en charge de hreflang par Baidu est une question distincte.
- Plus de 67% des domaines utilisant hreflang ont des problèmes — l’étude de mon équipe sur 374 756 domaines, centrée sur l’implémentation de Google et utile pour comparer avec l’absence de prise en charge par Baidu.
- Guide du SEO technique pour débutants — l’emplacement des robots d’exploration et des signaux internationaux dans la vue d’ensemble.
Mes interventions
- SEO international : les aspects techniques insolites (Pubcon Vegas 2019, SlideShare) — ma présentation sur les cas limites techniques du SEO international, le terrain sur lequel s’inscrit le travail SEO destiné au marché chinois.
Dans le secteur
- FAQ de Baiduspider (Baidu, help.baidu.com) — FAQ anglaise de Baidu : table UA, vérification DNS, gestion de robots.txt et politique de fréquence d’exploration. C’est la source anglaise principale.
- Google contre Baidu : différences clés de stratégie SEO (Dan Taylor, Search Engine Journal) — analyse du rendu « notoirement mauvais pour explorer JavaScript » et recommandation du HTML simple.
- Baidu contre Google : naviguer dans le SEO en 2024 (Michael Bonfils, Search Engine Land) — point de vue d’un fondateur d’agence sur les raisons pour lesquelles les tactiques Google ne se transposent pas directement à Baidu.
- Guide moderne de robots.txt (Abby Hamilton, Search Engine Journal) — tableau comparatif indiquant que Baiduspider ne respecte pas
crawl-delay. - Guide des robots du Web : ce qu’il faut savoir (James Allen, Search Engine Land) — place de Baiduspider dans un panorama plus large des robots d’exploration.
- Comprendre les robots Baidu, leurs user-agents et robots.txt (Jademond Digital) — analyse approfondie des variantes du robot Baidu et de la gestion de robots.txt.
- Baidu MIP (glossaire) (Jademond Digital) — source des dates de retrait de MIP (cache abandonné en juin 2020 ; service complet arrêté fin septembre 2022).
Journal des modifications
Mis à jour le 9 août 2026.
Résumé éditorial et détails enregistrés des changements.Détails des changements
- all
Les notes détaillées des changements sont actuellement disponibles en anglais.
-
Les notes détaillées des changements sont actuellement disponibles en anglais.
Comparaison complète indisponible — aucun instantané antérieur n’a été archivé pour cette révision.