Baiduspider: guida al crawler di Baidu
Che cos’è Baiduspider: le varianti e gli user-agent del crawler di Baidu, la conformità a robots.txt (e l’eccezione cpro/ads), la verifica tramite DNS inverso, il rendering JavaScript debole e il controllo del crawling in Ziyuan.
Lingue
1 segnale di evidenza in questa pagina
- Strumento live correlatoDNS Checker
Baiduspider è il crawler web di Baidu, l’equivalente per il mercato cinese di Googlebot e il bot che scopre, recupera e indicizza le pagine per Baidu Search nella Cina continentale. Esegue varianti nominate che condividono una famiglia di token Baiduspider (image, video, news, favo, cpro, ads), oltre a una variante JavaScript Baiduspider-render che Baidu documenta solo in cinese. Verificalo con DNS bidirezionale verso *.baidu.com o *.baidu.jp (lo user-agent è contraffattibile), perché le FAQ di Baidu mettono in guardia dagli imitatori. Le FAQ di Baidu affermano che rispetta rigorosamente robots.txt, con un’eccezione nominata: Baiduspider-cpro e Baiduspider-ads operano in base ad accordi commerciali e lo ignorano. Il principale limite pratico rispetto a Googlebot è il rendering JavaScript debole, quindi l’HTML renderizzato lato server è l’impostazione sicura predefinita. Controlla la frequenza di crawling tramite Baidu Search Resource Platform (Ziyuan).
Evidence for this claim Baiduspider is Baidu Search's crawler and Baidu's Search Resource Platform is the authoritative place to verify current crawler guidance. Scope: Current official Baidu webmaster platform; user-agent text alone is not authentication. Confidence: medium · Verified: Baidu Search Resource Platform Evidence for this claim Crawler access directives use the standardized robots.txt protocol, but engine-specific support and verification should be checked against Baidu's current documentation. Scope: Robots Exclusion Protocol baseline, distinct from undocumented Baidu-specific behavior. Confidence: high · Verified: IETF RFC 9309: Robots Exclusion ProtocolTL;DR — Baiduspider è il crawler web di Baidu, il bot che visita le tue pagine e le scarica per Baidu Search. Se la Cina continentale è un mercato importante, Baiduspider deve rientrare nel monitoraggio del crawling. Verifica la documentazione webmaster corrente di Baidu prima di affidarti a comportamenti specifici del motore, soprattutto per il rendering JavaScript e i controlli del crawler.
Che cos’è Baiduspider
Google non opera nella Cina continentale. Baidu sì: è il motore di ricerca usato dalla maggior parte delle persone lì e Baiduspider è il suo crawler. Quando Baiduspider visita il sito, segue i link, legge la sitemap, scarica le pagine e le consegna per costruire l’indice di Baidu, il database da cui Baidu attinge quando qualcuno esegue una ricerca. Se Baiduspider non riesce a raggiungere e leggere una pagina, quella pagina non comparirà su Baidu.
Secondo le parole di Baidu (dalle sue FAQ ufficiali in inglese): “Baiduspider is Baidu search engine program which is used to visit pages on the internet and build information into Baidu index. This enables users to locate your site when they perform a search.” (traduzione) «Baiduspider è il programma del motore di ricerca Baidu che visita le pagine Internet e ne inserisce le informazioni nell’indice, permettendo agli utenti di trovare il sito tramite una ricerca». È lo stesso lavoro che Googlebot svolge per Google e Bingbot per Bing.
Perché potrebbe interessarti
Baiduspider conta davvero solo se vuoi essere trovato all’interno della Cina continentale. Baidu continua a essere in testa, mentre Google è appena rilevante: quindi un sito rivolto alla Cina (o un sito globale con un pubblico cinese) ha bisogno di Baiduspider proprio come un sito occidentale ha bisogno di Googlebot. Se non servi affatto clienti in Cina, Baiduspider è solo un altro bot che colpisce il server e alcuni siti scelgono di bloccarlo per risparmiare risorse.
Il problema: Baiduspider è scarso con JavaScript
Questo è il punto principale. Googlebot esegue una versione moderna di Chrome e legge bene la maggior parte dei siti ricchi di JavaScript. Baiduspider no: è ampiamente segnalato come poco efficace nell’eseguire JavaScript. Se i contenuti o i link importanti compaiono solo dopo l’esecuzione di JavaScript, Baidu potrebbe non vederli mai, anche se la stessa pagina si posiziona bene su Google. La scelta sicura per un sito rivolto alla Cina è assicurarsi che i contenuti reali siano nell’HTML semplice restituito prima dell’esecuzione di qualsiasi JavaScript.
Come aiutare Baiduspider (o fermarlo)
- Per lasciarlo entrare: collega le pagine importanti, invia una sitemap nella Baidu Search Resource Platform (la versione di Baidu di Search Console) e non bloccare accidentalmente quelle pagine in
robots.txt. - Per tenerlo fuori da alcune parti del sito: usa
robots.txt: Baidu dice di seguire le regole standard. - Per rallentarlo: la Baidu Search Resource Platform ha un’area sulla frequenza di crawling dove puoi vedere e limitare quanto Baiduspider esegue il crawling.
Vuoi la versione tecnica — le stringhe esatte dello user-agent, come verificare un Baiduspider reale, le particolarità di robots.txt e i controlli della frequenza di crawling? Passa alla scheda Advanced.
Evidence for this claim Baiduspider is Baidu Search's crawler and Baidu's Search Resource Platform is the authoritative place to verify current crawler guidance. Scope: Current official Baidu webmaster platform; user-agent text alone is not authentication. Confidence: medium · Verified: Baidu Search Resource Platform Evidence for this claim Crawler access directives use the standardized robots.txt protocol, but engine-specific support and verification should be checked against Baidu's current documentation. Scope: Robots Exclusion Protocol baseline, distinct from undocumented Baidu-specific behavior. Confidence: high · Verified: IETF RFC 9309: Robots Exclusion ProtocolTL;DR — Baiduspider è il crawler di Baidu, il Googlebot del mercato cinese. Esegue varianti nominate che condividono la famiglia di token
Baiduspider(generale PC/mobile, più-image,-video,-news,-favo,-cpro,-ads) e una variante JavaScriptBaiduspider-renderche Baidu documenta solo in cinese. Verificalo con DNS bidirezionale verso*.baidu.com/*.baidu.jp: le FAQ di Baidu mettono in guardia dagli imitatori. Baidu afferma di “strictly complies with robots.txt protocol” (traduzione) «rispetta rigorosamente il protocollo robots.txt», con un’eccezione nominata:Baiduspider-cproeBaiduspider-adsoperano in base ad accordi commerciali e possono seguire regole di accesso diverse; inoltre non documentacrawl-delaycome controllo affidabile non standard. Poiché il comportamento di rendering può cambiare, l’HTML renderizzato lato server è l’impostazione prudente per i contenuti critici. Verifica i controlli correnti nella Baidu Search Resource Platform (Ziyuan).
Che cos’è davvero Baiduspider
Baiduspider (百度蜘蛛) è il crawler gestito da Baidu, il motore di ricerca dominante nella Cina continentale, dove Google è in gran parte inaccessibile dietro il Great Firewall. Svolge la pipeline standard crawl → index → serve: scopre gli URL, recupera le pagine e costruisce l’indice da cui attinge Baidu Search. Le FAQ ufficiali in inglese di Baidu, “Domande frequenti su Baiduspider” su help.baidu.com, sono il raro esempio di documentazione primaria in inglese e la fonte per la maggior parte delle citazioni dirette qui sotto.
L’asimmetria che inquadra tutto: Baidu conta a livello nazionale, non globale. Lo snapshot cinese di giugno 2026 di StatCounter assegnava a Baidu il 47,44%, a Bing il 23,24%, a Haosou il 14,02%, a Sogou il 2,62% e a Google appena il 2,28% (StatCounter, Search Engine Market Share China). Consideralo uno snapshot, non una costante: i numeri cinesi di StatCounter oscillano in modo significativo di mese in mese a seconda del mix di dispositivi e della metodologia (Baidu è stato riportato tra circa il 40% e il 65% in diversi snapshot del 2025–2026), quindi ricontrolla la cifra live invece di citare per sempre un solo mese. La conclusione resta valida: Baidu è in testa dentro la Cina mentre Google guida il resto del mondo, ed è per questo che l’ottimizzazione per Baiduspider è trattata come una specialità SEO internazionale distinta, non come un ripensamento dopo Googlebot. Il nostro hub SEO specifica per mercato spiega dove si colloca Baidu accanto a Yandex, Naver e agli altri motori regionali.
Stringhe user-agent e varianti del crawler
Le FAQ inglesi di Baidu nominano direttamente le varianti del crawler. Le riproduco verbatim (e sì, il testo proprietario di Baidu ripete “Baiduspider” sia per PC sia per mobile invece di fornire stringhe distinte):
Name of Products | User-agent PC search | Baiduspider Mobile search | Baiduspider Image search | Baiduspider-image Video search | Baiduspider-video News search | Baiduspider-news Baidu bookmark | Baiduspider-favo Union baidu | Baiduspider-cpro Business search | Baiduspider-ads other search | Baiduspider (traduzione) tabella dei prodotti — ricerca PC/mobile, immagini, video, notizie, segnalibri Baidu, Union baidu, ricerca business e altre ricerche — con le rispettive stringhe user-agent Baiduspider.
Quindi le varianti nominate ufficialmente nelle FAQ inglesi sono Baiduspider-image, -video, -news, -favo (bookmark), -cpro (crawler della rete “union”/pubblicitaria) e -ads (ricerca commerciale), tutte appartenenti alla famiglia di token Baiduspider. La stringa letterale dello user-agent generale PC, riportata dal sito proprietario di Baidu, è:
Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.baidu.com/search/spider.html)Lo UA mobile incorpora Baiduspider/2.0 in una stringa Android WebKit. Ogni variante dichiarata punta allo stesso URL di riferimento http://www.baidu.com/search/spider.html, l’equivalente Baidu di google.com/bot.html per Googlebot.
Baiduspider-render: la variante JS che Baidu documenta solo in cinese
Ecco una sottigliezza da trattare correttamente, perché molte pubblicazioni sbagliano: la tabella delle FAQ inglesi sopra non elenca una variante “Baiduspider-render”, e questo ha portato alcune guide a definirla semplice folklore di terze parti. Non lo è. Baidu documenta ufficialmente Baiduspider-render, ma nella pagina in lingua cinese della Ziyuan Academy, “【官方说法】只需两步,正确识别百度蜘蛛(User-Agent)” (“[Dichiarazione ufficiale] Due passaggi per identificare correttamente Baiduspider”). La pagina divide gli UA in tre canali — 移动 (mobile), PC e 小程序 (mini-program) — e elenca un UA alternativo di rendering accanto a quello semplice:
Mozilla/5.0 (compatible; Baiduspider-render/2.0; +http://www.baidu.com/search/spider.html)con una stringa mobile corrispondente e una variante mini-program (Baiduspider-render/2.0;Smartapp). Quindi Baiduspider-render è documentato ufficialmente, ma solo in cinese ed è assente dalle FAQ inglesi. Ciò che Baidu non pubblica è una specifica su che cosa faccia davvero in modo diverso “-render”; a differenza di Google, Baidu non documenta le proprie capacità di rendering JavaScript. È questa lacuna all’origine della cautela sul rendering JS qui sotto.
Come verificare Baiduspider (e non un bot contraffatto)
La stringa user-agent è facilmente contraffatta: chiunque può inviare una richiesta che dice di essere Baiduspider. Le FAQ di Baidu mettono in guardia proprio da questo, descrivendo “spammers or other trouble makers who pretend to be Baiduspider,” e indicano di verificare tramite DNS, non tramite la stringa. Dalle FAQ, verbatim: (traduzione) spammer o altri malintenzionati che fingono di essere Baiduspider.
We recommend using reverse DNS lookup to verify Baiduspider. Verification methods are different under linux/windows/os environments. (traduzione) Raccomandiamo di usare una ricerca DNS inversa per verificare Baiduspider. I metodi di verifica differiscono negli ambienti Linux/Windows/macOS.
Fornisce comandi per sistema operativo — host su Linux, nslookup su Windows, dig -x su macOS — con esempi funzionanti e la regola importante:
The hostname of Baiduspider is *.baidu.com or *.baidu.jp. Others are fake hostnames. (traduzione) Il nome host di Baiduspider è *.baidu.com o *.baidu.jp. Gli altri nomi host sono falsi.
I due domini *.baidu.com e *.baidu.jp sono la particolarità da ricordare: Baidu esegue il crawling da entrambi gli spazi dei nomi DNS inversi .com e .jp, quindi un nome host legittimo di Baiduspider può terminare con entrambi. Uno degli stessi esempi funzionanti di Baidu risolve perfino in BaiduMobaider-119-63-195-254.crawl.baidu.jp: nota “BaiduMobaider”, non “Baiduspider”, in quel nome host; è una vera peculiarità della documentazione Baidu, non un refuso da correggere in silenzio.
Le FAQ inglesi di Baidu esplicitano in prosa solo la metà della ricerca inversa, ma la pagina cinese della Ziyuan Academy è più chiara: chiama l’intero processo “双向DNS解析认证” (autenticazione della risoluzione DNS bidirezionale) e lo divide in “第一步:DNS反查IP” (Passaggio 1: ricerca inversa dell’IP) e “第二步:对域名运行正向DNS查找” (Passaggio 2: esegui una ricerca DNS diretta sul nome host). Questo è il metodo completo e corretto: ricerca inversamente l’IP per confermare un nome host *.baidu.com/*.baidu.jp, poi cerca quel nome host in avanti e conferma che risolva di nuovo allo stesso IP. È lo stesso approccio in due passaggi che useresti per verificare Googlebot o Bingbot: i comandi sono nella scheda Scripts.
Baiduspider e robots.txt
Baidu fa nell’FAQ una dichiarazione di conformità insolitamente forte e citabile:
Baidu strictly complies with robots.txt protocol. (traduzione) Baidu rispetta rigorosamente il protocollo robots.txt.
E supporta i controlli standard che ti aspetteresti. Secondo il materiale della Ziyuan Academy, Baiduspider supporta il wildcard matching con * e $ nei percorsi di robots.txt (alla pari di Google e Bing) ed esegue una corrispondenza dei percorsi esatta e sensibile alle maiuscole/minuscole. Puoi impostare regole per singolo user-agent: le FAQ di Baidu forniscono esempi funzionanti, incluso quello che blocca tutto per Baiduspider generale ma permette al crawler delle immagini di accedere a /image/:
User-agent: Baiduspider
Disallow: /
User-agent: Baiduspider-image
Allow: /image/(Baidu nota inoltre che Baiduspider-video al momento non supporta queste regole.)
L’eccezione nominata alla “conformità rigorosa”
La tensione interessante è questa: Baidu dichiara una conformità rigorosa, ma documenta un’eccezione ufficiale nominata. Baiduspider-cpro (il crawler della rete pubblicitaria) e Baiduspider-ads (ricerca commerciale) operano in base ad accordi commerciali separati e ignorano robots.txt per progettazione. Verbatim dalle FAQ: “Baiduspider-cpro will not work on the records set by robots.txt” (traduzione) «Baiduspider-cpro non applicherà le regole definite in robots.txt» e lo stesso vale per -ads. Quindi la formulazione onesta non è il vago “Baidu non rispetta sempre robots.txt” che trovi sui siti aggregatori: i crawler standard di Baidu lo rispettano, con due crawler pubblicitari esenti per contratto come unico caso concreto documentato.
Un punto separato e più circoscritto, facile da confondere: Baiduspider non rispetta la direttiva non standard crawl-delay. Abby Hamilton di Search Engine Journal lo ha documentato in Guida moderna a robots.txt (novembre 2024): la sua tabella di confronto dei crawler indica “Baidu | Baiduspider | No” per il supporto a crawl-delay (YandexBot di Yandex, al contrario, è “Yes”). È un’affermazione diversa dalla conformità alle direttive standard Allow/Disallow e conviene tenerle distinte per non contraddire accidentalmente la dichiarazione di Baidu su robots.txt.
Un esempio reale: il robots.txt di baidu.com
Baidu applica la segmentazione robots.txt al proprio dominio. Il suo robots.txt live offre al proprio Baiduspider una lista Disallow più corta rispetto a Googlebot, MSNBot, Sogou e Youdao (che ricevono in più il blocco di /shifen/, /homepage/ e /cpro) e blocca tutto (Disallow: /) per qualsiasi user-agent non nominato per impostazione predefinita:
User-agent: Baiduspider
Disallow: /baidu
Disallow: /s?
Disallow: /ulink?
Disallow: /link?
Disallow: /home/news/data/
Disallow: /bhUn dettaglio operativo utile dalle FAQ quando modifichi le regole: se restringi robots.txt dopo che Baidu ha già indicizzato un sito, “it usually takes 48 hours for the updated robots.txt to take effect.” (traduzione) Di solito servono 48 ore perché il robots.txt aggiornato abbia effetto.
Baiduspider esegue il rendering di JavaScript?
È il principale limite pratico di Baiduspider rispetto a Googlebot e vale la pena essere precisi su ciò che è ufficiale e ciò che non lo è. Le FAQ inglesi di Baidu non trattano affatto il rendering JavaScript: non esiste una specifica delle capacità come quella pubblicata da Google per Googlebot. Abbiamo invece test coerenti del settore. Dan Taylor lo ha detto senza mezzi termini nel confronto Google vs Baidu di Search Engine Journal (marzo 2021): “Baidu is notoriously bad when it comes to crawling JavaScript, so make sure that all your important content and links are served in plain HTML on both the mobile and desktop versions of your website.” (traduzione) Baidu è notoriamente scarso nel crawling di JavaScript, quindi assicurati che tutti i contenuti e i link importanti siano serviti in HTML semplice sia sulla versione mobile sia su quella desktop del sito.
È coerente con la posizione che questo sito assume già. La nostra trattazione SEO di Contentful nota che Bing, Yandex e Baidu “may not index [client-side-rendered JS] at all,” (traduzione) «potrebbe non indicizzare affatto il JavaScript renderizzato lato client» e che il rendering dinamico è deprecato come tecnica Google generale. Metti i tre grandi crawler su uno spettro: Googlebot esegue il rendering completo con Chromium evergreen, Bingbot esegue un rendering solido con Chromium/Edge e Baiduspider è il più debole dei tre con JavaScript; l’HTML semplice e renderizzato lato server è il fallback sicuro per tutti.
Indicazione pratica per un sito rivolto alla Cina: usa come impostazione predefinita server-side rendering o HTML statico, così contenuti critici, link e metadati esistono nella risposta iniziale prima dell’esecuzione di JavaScript. Considera i contenuti disponibili solo lato client un rischio di indicizzazione specifico per Baidu, indipendentemente dal fatto che si posizionino bene su Google. Presenta SSR come best practice condivisa dal settore, non come una raccomandazione ufficiale di Baidu, perché non esiste una dichiarazione primaria di Baidu sul rendering JS da citare.
Controllare la frequenza di crawling di Baiduspider
Baidu presenta la frequenza di crawling come regolata automaticamente dall’algoritmo, non come qualcosa che imposti direttamente. Dalle FAQ, verbatim:
In order to ensure the search results cover most of your pages, Baiduspider must keep the crawling at a certain level. We have been trying our best to avoid increasing the loading to your servers, and to adjust the frequency based on combined factors, such as your server’s capability, your site’s quality and the update frequency of your site. (traduzione) Per garantire che i risultati coprano la maggior parte delle pagine, Baiduspider deve mantenere il crawling a un certo livello. Cerchiamo di evitare di aumentare il carico sui server e di regolare la frequenza in base a fattori combinati come capacità del server, qualità e frequenza di aggiornamento del sito.
È la stessa logica basata su capacità del server e domanda descritta da Google e Bing. Le FAQ indicano un modulo di feedback (webmaster.baidu.com/feedback/index) come leva ufficiale per segnalare un crawling eccessivo: “If you find any unreasonable access from Baiduspider, please inform us.” (traduzione) Se rilevi accessi irragionevoli da parte di Baiduspider, informaci.
A livello di prodotto, la Baidu Search Resource Platform (百度搜索资源平台, all’indirizzo ziyuan.baidu.com, la console storicamente chiamata “Baidu Webmaster Tools”) è l’equivalente di Google Search Console e Bing Webmaster Tools. Il manuale dell’indice del prodotto conferma un’area “抓取频次” (Crawl Frequency) in cui i proprietari dei siti possono visualizzare e limitare direttamente la frequenza di crawling di Baiduspider, accanto agli strumenti robots e crawl diagnostics. Considera il modulo di feedback come il percorso ufficiale di escalation nella documentazione inglese di Baidu e la dashboard Ziyuan Crawl Frequency come il controllo pratico a livello di interfaccia. (Il percorso esatto del menu nel prodotto è dietro un account Ziyuan autenticato, quindi conferma lì l’interfaccia corrente prima di citare passaggi specifici.)
hreflang e altri segnali standard di Google
I segnali standard per Google non si trasferiscono tutti a Baidu: è un risultato del settore e dei professionisti, non qualcosa documentato da una delle due aziende. La documentazione di Google sulle versioni localizzate è interamente limitata a Google Search e non afferma se Baidu, Bing o Yandex supportino hreflang. Su questo sito, la nostra guida hreflang lo dichiara chiaramente: Baidu non supporta hreflang; il segnale alternativo è impostare content-language e <html lang> accurati affinché Baidu possa almeno leggere la lingua della pagina. Questo è complementare al mio lavoro su hreflang limitato a Google (la guida Ahrefs sui tag hreflang e lo studio su 374 756 domini, entrambi incentrati sull’implementazione Google), non in contraddizione con esso.
Nessuna cultura di rappresentanti in inglese: perché le FAQ hanno un valore insolito
Una caratteristica che distingue davvero l’ecosistema Baidu: a differenza di Google (Gary Illyes, John Mueller), Bing (Fabrice Canel) o Yandex, Baidu non mantiene nessuna cultura pubblica visibile di domande e risposte con rappresentanti in lingua inglese. Non c’è un portavoce nominato che dialoghi avanti e indietro con la comunità SEO. La voce ufficiale inglese più chiara di Baidu è la FAQ istituzionale e senza firma su help.baidu.com. Ecco perché quella FAQ, insieme alle pagine in cinese della Ziyuan Academy che la sostengono, è così preziosa: la maggior parte delle conoscenze operative su Baiduspider nel mondo SEO anglofono proviene da test dei professionisti (analisi dei log del server, esercizi di verifica DNS, tentativi ed errori con robots.txt) e non da commenti ufficiali dei rappresentanti. Michael Bonfils ha riassunto la lezione più ampia nell’articolo Baidu vs. Google di Search Engine Land: “SEO strategies that work for Google may not always translate directly to success on Baidu, China’s dominant search engine.” (traduzione) Le strategie SEO che funzionano su Google non si traducono sempre direttamente in successo su Baidu, il motore di ricerca dominante in Cina.
Per collocare Baiduspider nel quadro più ampio — la famiglia dei crawler, Googlebot e Bingbot come pari, il concetto di user-agent e robots.txt — l’hub crawling collega tutti gli elementi, mentre SEO internazionale è il punto di riferimento per il contesto del mercato cinese.
Riepilogo AI
Una sintesi della versione Advanced:
- Baiduspider = il crawler web di Baidu, il Googlebot del mercato cinese. Baidu domina dentro la Cina continentale (StatCounter giugno 2026: Baidu circa 47%, Google circa 2%), quindi è una specialità SEO internazionale, non un ripensamento dopo Googlebot. La quota oscilla di mese in mese: trattala come uno snapshot.
- Le varianti condividono la famiglia di token
Baiduspider: PC/mobile generale più-image,-video,-news,-favo(bookmark),-cpro(rete pubblicitaria),-ads(attività commerciale). UA PC generale:Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.baidu.com/search/spider.html). Baiduspider-renderè documentato ufficialmente, ma solo nella pagina in cinese della Ziyuan Academy, assente dalle FAQ inglesi. Non esiste una specifica su ciò che “-render” fa diversamente.- Verifica con DNS bidirezionale verso
*.baidu.comoppure*.baidu.jp(Baidu esegue crawling da entrambi): ricerca inversa dell’IP, poi ricerca diretta del nome host fino allo stesso IP. Lo user-agent è contraffattibile; Baidu mette in guardia dagli imitatori. - robots.txt: Baidu afferma che “strictly complies”, supporta i wildcard
*/$e la corrispondenza sensibile alle maiuscole, con un’eccezione nominata:Baiduspider-cproeBaiduspider-adsoperano in base ad accordi commerciali e ignorano robots.txt. Separatamente, Baiduspider non rispettacrawl-delaynon standard (secondo Abby Hamilton di SEJ). Le modifiche alle regole impiegano circa 48 ore per avere effetto. - JavaScript è il principale divario rispetto a Googlebot: non esiste una specifica ufficiale delle capacità; il consenso del settore (Dan Taylor: “notoriously bad… crawling JavaScript”) considera l’HTML renderizzato lato server/statico l’impostazione sicura per i siti rivolti alla Cina.
- La frequenza di crawling è algoritmica (capacità del server + qualità del sito + frequenza di aggiornamento); segnala il crawling eccessivo tramite il modulo di feedback di Baidu e visualizza/limita la frequenza nella Baidu Search Resource Platform (Ziyuan), l’equivalente di Search Console.
- hreflang non è supportato da Baidu (risultato del settore; nessuna delle due aziende lo documenta in un senso o nell’altro): usa come fallback
content-language/<html lang>. - Nessuna cultura di rappresentanti in inglese: la voce ufficiale inglese più chiara di Baidu è una FAQ senza firma, quindi la maggior parte delle conoscenze operative proviene dai test dei professionisti.
Documentazione ufficiale
Documentazione primaria. Quella di Baidu è divisa tra una FAQ in inglese e pagine Ziyuan (Baidu Search Resource Platform) in cinese; i link Google servono per il confronto sull’intersezione hreflang.
Baidu
- Domande frequenti su Baiduspider (help.baidu.com) — la FAQ ufficiale inglese di Baidu: che cos’è Baiduspider, la tabella degli user-agent, la policy sulla frequenza di crawling, la verifica DNS con esempi funzionanti e la gestione di robots.txt. È la fonte primaria in inglese.
- 【官方说法】只需两步,正确识别百度蜘蛛(User-Agent)(ziyuan.baidu.com) — l’articolo ufficiale in cinese di Baidu sull’identificazione di Baiduspider: i tre canali UA (mobile/PC/mini-program), gli UA
Baiduspider-rendere il metodo completo di “autenticazione DNS bidirezionale”. - Baidu Search Resource Platform manual index (ziyuan.baidu.com) — l’indice del manuale di prodotto Ziyuan che conferma le aree dedicate a 抓取频次 (Crawl Frequency), robots e 抓取诊断 (Crawl Diagnostics).
- baidu.com/robots.txt — il robots.txt live di Baidu, un esempio reale di segmentazione per crawler.
Google (per il confronto sull’intersezione hreflang)
- Comunicare a Google le versioni localizzate di una pagina — la documentazione hreflang di Google, interamente limitata a Google Search; non dice nulla, in particolare, sul fatto che Baidu, Bing o Yandex rispettino hreflang.
Citazioni dalla fonte
Baidu non mantiene un portavoce nominato in lingua inglese, quindi la “fonte” qui è la sua FAQ senza firma, insieme ai commenti nominati del settore che sostituiscono le citazioni dei rappresentanti che avresti da Google o Bing. Ogni link è un deep link che porta direttamente al passaggio citato.
Baidu — “Domande frequenti su Baiduspider” (help.baidu.com, inglese)
- “Baiduspider is Baidu search engine program which is used to visit pages on the internet and build information into Baidu index. This enables users to locate your site when they perform a search.” (traduzione) Baiduspider è il programma del motore di ricerca Baidu che visita le pagine su Internet e costruisce informazioni nell’indice Baidu, permettendo agli utenti di trovare il sito quando cercano. Vai alla citazione
- “In order to ensure the search results cover most of your pages, Baiduspider must keep the crawling at a certain level… to adjust the frequency based on combined factors, such as your server’s capability, your site’s quality and the update frequency of your site.” (traduzione) Per garantire che i risultati coprano la maggior parte delle pagine, Baiduspider deve mantenere il crawling a un certo livello e regolare la frequenza in base a fattori combinati come capacità del server, qualità e frequenza di aggiornamento del sito. Vai alla citazione
- “We recommend using reverse DNS lookup to verify Baiduspider.” (traduzione) Raccomandiamo di usare una ricerca DNS inversa per verificare Baiduspider. Vai alla citazione
- *“The hostname of Baiduspider is *.baidu.com or .baidu.jp. Others are fake hostnames.” (traduzione) Il nome host di Baiduspider è *.baidu.com o *.baidu.jp. Gli altri nomi host sono falsi. Vai alla citazione
- “Baidu strictly complies with robots.txt protocol.” (traduzione) Baidu rispetta rigorosamente il protocollo robots.txt. Vai alla citazione
Baidu — Ziyuan Academy (ziyuan.baidu.com, cinese)
- Originale: “二、双向DNS解析认证” — parafrasi inglese: “Step two: bidirectional DNS resolution authentication”, il nome che Baidu dà alla verifica di Baiduspider tramite una ricerca inversa seguita da una ricerca diretta che riporta allo stesso IP. (traduzione) Passaggio due: autenticazione della risoluzione DNS bidirezionale. Visualizza la pagina
Dan Taylor, Search Engine Journal — sul JavaScript
- “Baidu is notoriously bad when it comes to crawling JavaScript, so make sure that all your important content and links are served in plain HTML on both the mobile and desktop versions of your website.” (traduzione) Baidu è notoriamente scarso nel crawling di JavaScript: assicurati quindi che tutti i contenuti e i link importanti siano serviti in HTML semplice sia sulla versione mobile sia su quella desktop del sito. Vai alla citazione
Michael Bonfils, Search Engine Land — sul trasferimento della strategia
- “SEO strategies that work for Google may not always translate directly to success on Baidu, China’s dominant search engine.” (traduzione) Le strategie SEO che funzionano su Google non si traducono sempre direttamente in successo su Baidu, il motore di ricerca dominante in Cina. Vai alla citazione
Abby Hamilton, Search Engine Journal — su crawl-delay
- La sua tabella di confronto dei crawler indica che Baiduspider non supporta la direttiva non standard
crawl-delay(“Baidu | Baiduspider | No”). (novembre 2024.) Leggi la copertura
help.baidu.com viene renderizzata in parte tramite JavaScript e la pagina Ziyuan Academy è solo in cinese; le citazioni inglesi sopra sono state confermate come sottostringhe esatte delle pagine live, ma confermale rispetto alle pagine live (e usa un browser per le fonti renderizzate in JS o in cinese) prima di considerarle definitive. Dovrei consentire a Baiduspider di eseguire il crawling del sito e come devo gestirlo?
Baiduspider merita il lavoro solo se vuoi visibilità nel mercato cinese. Esploriamolo.
Deciding what to do about Baiduspider
Verifica che un bot sia davvero Baiduspider
Le FAQ di Baidu raccomandano il DNS inverso per verificare Baiduspider, perché la stringa user-agent è facilmente contraffatta. Esegui il controllo bidirezionale indicato da Baidu nella pagina Ziyuan in cinese: ricerca inversa dell’IP (il nome host deve terminare in *.baidu.com oppure *.baidu.jp), poi ricerca diretta di quel nome host fino allo stesso IP.
macOS / Linux
# 1) Reverse-DNS the IP from your logs — it must end in baidu.com or baidu.jp
host 123.125.66.120
# → 120.66.125.123.in-addr.arpa domain name pointer Baiduspider-123-125-66-120.crawl.baidu.com
# 2) Forward-DNS that hostname back — it must resolve to the same IP
host Baiduspider-123-125-66-120.crawl.baidu.com
# → Baiduspider-123-125-66-120.crawl.baidu.com has address 123.125.66.120Formato dig per macOS (come nelle FAQ di Baidu):
dig -x 123.125.66.120Windows
nslookup 123.125.66.120
nslookup Baiduspider-123-125-66-120.crawl.baidu.comSe la ricerca inversa non termina in baidu.com o baidu.jp, oppure la ricerca diretta non restituisce l’IP originale, non si tratta di Baiduspider: scartalo o limita la frequenza. (È lo stesso approccio in due passaggi usato per verificare Googlebot e Bingbot; per le versioni Google/Bing consulta le schede Scripts di quegli articoli.)
Estrarre solo gli accessi di Baiduspider dai log del server
Recupera da un access log le righe candidate di Baiduspider, poi verifica ogni IP con il controllo DNS sopra: non fidarti della stringa da sola.
# Extract lines whose user-agent claims to be Baiduspider, print unique IPs
grep -i 'baiduspider' /var/log/nginx/access.log \
| awk '{print $1}' | sort -uVerificare un nome host rispetto ai domini consentiti da Baidu (regex)
Dopo aver risolto inversamente un nome host, questa regex conferma che appartiene a uno dei due namespace legittimi dei crawler Baidu (.baidu.com o .baidu.jp) invece che a un’imitazione:
# Passes only for hostnames ending in .baidu.com or .baidu.jp
echo "Baiduspider-123-125-66-120.crawl.baidu.com" \
| grep -Eiq '\.baidu\.(com|jp)$' && echo "legit namespace" || echo "FAKE"Attenzione alle imitazioni come baidu.com.evil.example: ancorare il pattern alla fine della stringa ($) impedisce a questi valori di passare.
Un punto di partenza per robots.txt con Baiduspider
# Let Baiduspider crawl everything except low-value spaces
User-agent: Baiduspider
Disallow: /search
Disallow: /*?*sort=
# Block Baiduspider entirely (China not a target market)
# User-agent: Baiduspider
# Disallow: /Ricorda: Disallow controlla il crawling, non l’indicizzazione, e le modifiche alle regole impiegano circa 48 ore per avere effetto. I crawler pubblicitari Baiduspider-cpro e Baiduspider-ads ignorano robots.txt per progettazione.
Baiduspider: schema rapido
Stringhe user-agent e varianti del crawler
| Variante | Token robots.txt | User-agent |
|---|---|---|
| Generale (PC + mobile) | Baiduspider | Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.baidu.com/search/spider.html) |
| Ricerca immagini | Baiduspider-image | Condivide il token della famiglia Baiduspider, suffisso -image |
| Ricerca video | Baiduspider-video | Suffisso -video (attualmente non supporta regole robots.txt per singolo agente) |
| Ricerca notizie | Baiduspider-news | Suffisso -news |
| Bookmark Baidu | Baiduspider-favo | Suffisso -favo |
| Union baidu (rete pubblicitaria) | Baiduspider-cpro | Suffisso -cpro: ignora robots.txt per accordo commerciale |
| Ricerca commerciale | Baiduspider-ads | Suffisso -ads: ignora robots.txt per accordo commerciale |
| Render (variante JS) | — | Mozilla/5.0 (compatible; Baiduspider-render/2.0; +http://www.baidu.com/search/spider.html): documentato solo nella pagina Ziyuan Academy in cinese di Baidu, assente dalle FAQ inglesi |
Ogni UA delle varianti dichiarate punta allo stesso URL di riferimento, http://www.baidu.com/search/spider.html, l’equivalente Baiduspider di google.com/bot.html per Googlebot.
Conformità a robots.txt in breve
| Crawler | Segue robots.txt? |
|---|---|
Baiduspider generale, -image, -video, -news, -favo | Sì: le FAQ di Baidu affermano “Baidu strictly complies with robots.txt protocol” (traduzione) «Baidu rispetta rigorosamente il protocollo robots.txt» |
Baiduspider-cpro | No: eccezione nominata e documentata (accordo commerciale) |
Baiduspider-ads | No: eccezione nominata e documentata (accordo commerciale) |
Direttiva non standard crawl-delay | Non rispettata da alcuna variante Baiduspider, secondo Abby Hamilton di Search Engine Journal |
Informazioni rapide
- Verifica con DNS bidirezionale: ricerca inversa dell’IP del crawler per confermare un nome host che termina in
*.baidu.como*.baidu.jp, poi ricerca diretta di quel nome host fino allo stesso IP. La stringa user-agent da sola non dimostra nulla. - Le modifiche a robots.txt impiegano circa 48 ore per avere effetto su un sito già indicizzato.
- Baidu supporta i wildcard
*e$nei percorsi robots.txt ed esegue una corrispondenza esatta e sensibile alle maiuscole. - La frequenza di crawling viene regolata automaticamente dall’algoritmo (capacità del server, qualità del sito, frequenza di aggiornamento): visualizzala e limitane il valore nella Baidu Search Resource Platform (Ziyuan).
- Il maggiore divario pratico di Baiduspider rispetto a Googlebot è il debole rendering JavaScript: HTML renderizzato lato server o statico è il valore predefinito sicuro per i contenuti rivolti alla Cina.
- Baidu non supporta hreflang: il segnale alternativo è un
content-languagee un<html lang>accurati.
Checklist di preparazione per Baiduspider
Un controllo rapido per confermare che stai lavorando con Baiduspider e non accidentalmente contro di lui: lo stesso terreno coperto dalla scheda Advanced, in formato checklist.
- robots.txt non blocca
Baiduspider(o la variante che ti interessa) dalle risorse che vuoi far trovare nei risultati di Baidu. - Una sitemap è inviata nella Baidu Search Resource Platform (Ziyuan).
- La verifica del bot usa il DNS bidirezionale: ricerca inversa verso
*.baidu.com/*.baidu.jp, poi ricerca diretta che conferma lo stesso IP; mai la sola stringa user-agent. - Sai che
Baiduspider-cproeBaiduspider-adsignorano robots.txt per progettazione, quindi bloccarli lì non li fermerà davvero. - Ogni recente restrizione di robots.txt ha avuto circa 48 ore per propagarsi prima di ricontrollare lo stato dell’indicizzazione.
- Contenuti critici, link interni e metadati esistono tutti nella risposta HTML renderizzata lato server, non sono inseriti solo da JavaScript lato client.
-
content-languagee<html lang>sono impostati correttamente, perché Baidu non supporta hreflang. - Il carico di crawling è stato verificato nell’area Crawl Frequency (抓取频次) di Ziyuan se il traffico di Baiduspider affatica il server.
- Il crawling irragionevole o eccessivo viene segnalato tramite il modulo di feedback di Baidu (
webmaster.baidu.com/feedback/index) invece di essere bloccato o gestito per supposizioni. - Non rimane alcuna dipendenza da Baidu MIP: il framework è ritirato (cache dismessa a giugno 2020, servizio completo cessato verso la fine di settembre 2022).
Strumenti per lavorare con Baiduspider
- DNS Checker — il mio strumento per il controllo DNS bidirezionale raccomandato dalle FAQ di Baidu. Inserisci l’IP del crawling con il tipo di record PTR per eseguire la ricerca inversa (un nome host Baiduspider autentico termina in
.baidu.como.baidu.jp), poi inserisci quel nome host con il tipo A per confermare che la ricerca diretta risolva allo stesso IP. Interroga Cloudflare, Google e Quad9 affiancati per individuare un resolver in disaccordo. - robots.txt Tester — il mio strumento per controllare se le regole robots.txt bloccano o consentono davvero Baiduspider come previsto. Incolla il file, inserisci
Baiduspider(oBaiduspider-image,Baiduspider-newsecc.) nel campo user-agent personalizzato e testalo rispetto a percorsi reali: mostra la regola esatta che prevale per ogni URL. Ricorda cheBaiduspider-cproeBaiduspider-adsignorano robots.txt indipendentemente da ciò che mostra il tester, perché operano in base ad accordi commerciali separati.
Miti e errori su Baiduspider da evitare
Mito: “Qualunque user-agent che contenga ‘Baiduspider’ è davvero Baidu.”
Perché è sbagliato: la stringa user-agent è facilmente contraffatta e le FAQ proprietarie di Baidu mettono in guardia da “spammers or other trouble makers who pretend to be Baiduspider.”
Che cosa fare invece: esegui il controllo DNS bidirezionale, con ricerca inversa verso un nome host *.baidu.com/*.baidu.jp e poi ricerca diretta fino allo stesso IP, prima di fidarti di un accesso “Baiduspider” o bloccarlo. (traduzione) spammer o altri malintenzionati che fingono di essere Baiduspider.
Mito: “Baidu non segue mai robots.txt o in generale non è affidabile al riguardo.”
Perché è sbagliato: le FAQ di Baidu affermano “Baidu strictly complies with robots.txt protocol” (traduzione) «Baidu osserva rigorosamente il protocollo robots.txt» per i crawler standard. La vera eccezione è ristretta e nominata: Baiduspider-cpro e Baiduspider-ads operano in base ad accordi commerciali e ignorano robots.txt, non un vago “Baidu ignora robots”.
Che cosa fare invece: cita l’eccezione specifica cpro/ads e non confonderla con il fatto separato che Baiduspider non rispetta la direttiva non standard crawl-delay.
Mito: “Baiduspider esegue il rendering di JavaScript bene quanto il moderno Googlebot.” Perché è sbagliato: il consenso del settore (Dan Taylor lo ha definito “notoriously bad… crawling JavaScript”) è che Baiduspider sia molto indietro rispetto al Chromium evergreen di Googlebot; i contenuti disponibili solo lato client sono un rischio reale di indicizzazione per Baidu anche quando si posizionano bene su Google. Che cosa fare invece: servi contenuti, link e metadati importanti in HTML renderizzato lato server o statico per i siti rivolti alla Cina, il valore predefinito sicuro per Googlebot, Bingbot e Baiduspider. (traduzione) notoriamente scarso nel crawling di JavaScript.
Mito: “hreflang funziona per Baidu come per Google.”
Perché è sbagliato: Baidu non supporta affatto hreflang (un risultato del settore; la documentazione di Google non commenta gli altri motori in nessuna direzione).
Che cosa fare invece: usa come fallback content-language e <html lang> accurati, così Baidu può almeno leggere la lingua della pagina; non affidarti a hreflang per indirizzare Baidu.
Mito: “Baiduspider-render non è una variante documentata ufficialmente.”
Perché è sbagliato: la tabella delle FAQ inglesi di Baidu non lo elenca, ma la pagina della Ziyuan Academy in lingua cinese documenta Baiduspider-render/2.0 come UA alternativo PC/mobile e una variante mini-program. È ufficiale, ma solo in cinese.
Che cosa fare invece: descrivilo come documentato ufficialmente (solo in cinese), notando che Baidu non pubblica una specifica su ciò che “-render” fa effettivamente in modo diverso.
Mito: “Baidu MIP è ancora una leva di posizionamento attiva e raccomandata.” Perché è sbagliato: il framework MIP (Mobile Instant Pages), simile ad AMP, è un’eredità. Secondo il glossario MIP di Jademond, la MIP Cache è stata dismessa nel giugno 2020 e il servizio MIP completo è cessato verso la fine di settembre 2022; eppure alcuni contenuti di agenzie datati di recente lo promuovono ancora come attivo, creando ulteriore confusione. Che cosa fare invece: considera MIP ritirato e diffida delle guide recenti che lo presentano come leva attiva di velocità o posizionamento.
Mettiti alla prova: Baiduspider
Cinque domande rapide sul crawler di Baidu. Scegli una risposta per ciascuna domanda, poi verifica.
Risorse che meritano il tuo tempo
I miei articoli correlati
- Tag hreflang: una guida semplice ma completa — la mia guida Ahrefs (con Joshua Hardwick) su hreflang, limitata a Google e contesto per capire perché l’assenza di supporto hreflang di Baidu sia una questione separata.
- Oltre il 67% dei domini che usa hreflang presenta problemi — lo studio del mio team su 374 756 domini, incentrato sull’implementazione Google e utile come contrasto al mancato supporto di Baidu.
- Guida introduttiva alla SEO tecnica — dove crawler e segnali internazionali si inseriscono nel quadro più ampio.
I miei interventi
- SEO internazionale: gli aspetti tecnici insoliti (Pubcon Vegas 2019, SlideShare) — il mio intervento sui casi limite tecnici della SEO internazionale, il terreno in cui vive il lavoro sul mercato Baidu.
Dal settore
- Domande frequenti su Baiduspider (fonte Baidu) — la FAQ inglese proprietaria: tabella UA, verifica DNS, gestione di robots.txt e regole sulla frequenza di scansione. È la fonte primaria in inglese.
- Google e Baidu: differenze principali nella strategia SEO (Dan Taylor, Search Engine Journal) — la valutazione “notoriamente scarso nel crawling di JavaScript” e la raccomandazione dell’HTML semplice.
- Baidu e Google: orientarsi nel panorama SEO del 2024 (Michael Bonfils, Search Engine Land) — la prospettiva del fondatore di agenzia sul motivo per cui le tattiche Google non si trasferiscono direttamente a Baidu.
- Guida moderna a robots.txt (Abby Hamilton, Search Engine Journal) — la tabella di confronto dei crawler che mostra che Baiduspider non rispetta
crawl-delay. - Guida ai crawler web: che cosa bisogna sapere (James Allen, Search Engine Land) — il posto di Baiduspider in una panoramica più ampia dei crawler.
- Capire Baiduspider, user-agent e robots.txt (Jademond Digital) — approfondimento professionale sulle varianti del crawler Baidu e sulla gestione di robots.
- Baidu MIP (glossario) (Jademond Digital) — la fonte per le date della dismissione di MIP (cache ritirata a giugno 2020; servizio completo cessato verso la fine di settembre 2022).
Cronologia modifiche
Aggiornato il 11 ago 2026.
Riepilogo editoriale e dettagli registrati delle modifiche.Dettagli delle modifiche
-
Le note dettagliate sulle modifiche sono attualmente disponibili in inglese.
Confronto completo non disponibile — non è stata archiviata alcuna istantanea precedente per questa revisione.