Crawler Baiduspider
O que é o Baiduspider — variantes e user-agents do crawler do Baidu, conformidade com robots.txt (e a exceção cpro/ads), verificação por DNS reverso, renderização fraca de JS e controle de rastreamento no Ziyuan.
Idiomas
1 sinal de evidência nesta página
- Ferramenta relacionada ativaDNS Checker
O Baiduspider é o crawler do Baidu — o equivalente do Googlebot no mercado chinês e o bot que descobre, busca e indexa páginas para a Busca do Baidu dentro da China continental. Ele executa variantes nomeadas que compartilham uma família de tokens Baiduspider (image, video, news, favo, cpro, ads), além de uma variante JavaScript Baiduspider-render que o Baidu documenta apenas em chinês. Verifique-o por DNS bidirecional para *.baidu.com ou *.baidu.jp (o user-agent é falsificável), porque a própria FAQ do Baidu alerta sobre impostores. A FAQ do Baidu afirma que ele segue estritamente o robots.txt — com uma exceção nomeada: Baiduspider-cpro e Baiduspider-ads operam sob acordos comerciais e o ignoram. Sua maior limitação prática em relação ao Googlebot é a renderização fraca de JavaScript, portanto HTML renderizado no servidor é o padrão seguro. Controle sua taxa de rastreamento pela Plataforma de Recursos de Busca do Baidu (Ziyuan).
Evidence for this claim Baiduspider is Baidu Search's crawler and Baidu's Search Resource Platform is the authoritative place to verify current crawler guidance. Scope: Current official Baidu webmaster platform; user-agent text alone is not authentication. Confidence: medium · Verified: Baidu Search Resource Platform Evidence for this claim Crawler access directives use the standardized robots.txt protocol, but engine-specific support and verification should be checked against Baidu's current documentation. Scope: Robots Exclusion Protocol baseline, distinct from undocumented Baidu-specific behavior. Confidence: high · Verified: IETF RFC 9309: Robots Exclusion ProtocolTL;DR — O Baiduspider é o crawler do Baidu — o bot que visita suas páginas, baixa o conteúdo para a Busca do Baidu. Se a China continental é um mercado importante, inclua o Baiduspider no monitoramento de rastreamento. Consulte a documentação atual do Baidu para webmasters antes de confiar em comportamentos específicos do mecanismo, especialmente em relação à renderização de JavaScript e aos controles do crawler.
O que é o Baiduspider
O Google não funciona dentro da China continental. O Baidu funciona — é o mecanismo de busca que a maioria das pessoas usa lá, e o Baiduspider é seu crawler. Quando o Baiduspider visita seu site, ele segue links, lê seu sitemap, baixa suas páginas e as entrega para montar o índice do Baidu — o banco de dados de onde o Baidu consulta quando alguém pesquisa. Se o Baiduspider não consegue alcançar e ler uma página, ela não aparece no Baidu.
Nas palavras do próprio Baidu (da sua FAQ oficial em inglês): “Baiduspider is Baidu search engine program which is used to visit pages on the internet and build information into Baidu index. This enables users to locate your site when they perform a search.” (tradução) «O Baiduspider é o programa do mecanismo de busca Baidu usado para visitar páginas na internet e incorporar informações ao índice do Baidu. Isso permite que os usuários encontrem seu site ao fazer uma busca.» É a mesma tarefa que o Googlebot faz para o Google e o Bingbot faz para o Bing.
Por que isso pode importar para você
O Baiduspider só importa de verdade se você quer ser encontrado dentro da China continental. O Baidu ainda lidera lá, enquanto o Google mal aparece — portanto, um site voltado para a China (ou um site global com público chinês) precisa do Baiduspider assim como um site ocidental precisa do Googlebot. Se você não atende clientes na China, o Baiduspider é apenas mais um bot acessando seu servidor, e alguns sites escolhem bloqueá-lo para economizar recursos.
O problema: o Baiduspider é ruim com JavaScript
Este é o ponto principal. O Googlebot executa uma versão moderna do Chrome e lê bem a maioria dos sites pesados em JavaScript. O Baiduspider não — há muitos relatos de que ele é ruim em executar JavaScript. Se seu conteúdo importante ou seus links só aparecem depois que o JavaScript executa, o Baidu talvez nunca os veja, mesmo que a mesma página ranqueie bem no Google. A opção segura para um site voltado à China: garantir que o conteúdo real esteja no HTML simples retornado antes da execução de qualquer JavaScript.
Como ajudar (ou impedir) o Baiduspider
- Para deixá-lo entrar: crie links para suas páginas importantes, envie um sitemap na Plataforma de Recursos de Busca do Baidu (a versão do Baidu do Search Console) e não bloqueie essas páginas acidentalmente em
robots.txt. - Para mantê-lo fora de partes do site: use
robots.txt— o Baidu diz que segue as regras padrão nesse arquivo. - Para desacelerá-lo: a Plataforma de Recursos de Busca do Baidu tem uma área de frequência de rastreamento em que você pode ver e limitar quanto o Baiduspider rastreia.
Quer a versão técnica — as strings exatas de user-agent, como verificar um Baiduspider verdadeiro, as particularidades de robots.txt e os controles de frequência de rastreamento? Mude para a aba Avançado.
Evidence for this claim Baiduspider is Baidu Search's crawler and Baidu's Search Resource Platform is the authoritative place to verify current crawler guidance. Scope: Current official Baidu webmaster platform; user-agent text alone is not authentication. Confidence: medium · Verified: Baidu Search Resource Platform Evidence for this claim Crawler access directives use the standardized robots.txt protocol, but engine-specific support and verification should be checked against Baidu's current documentation. Scope: Robots Exclusion Protocol baseline, distinct from undocumented Baidu-specific behavior. Confidence: high · Verified: IETF RFC 9309: Robots Exclusion ProtocolTL;DR — O Baiduspider é o crawler do Baidu — o Googlebot do mercado chinês. Ele executa variantes nomeadas que compartilham a família de tokens
Baiduspider(PC/mobile geral, além de-image,-video,-news,-favo,-cproe-ads) e uma variante JavaScriptBaiduspider-renderque o Baidu documenta somente em chinês. Verifique-o por DNS bidirecional para*.baidu.com/*.baidu.jp— a própria FAQ do Baidu alerta sobre impostores. O Baidu afirma que ele “strictly complies with robots.txt protocol,” (tradução) «segue estritamente o protocolo robots.txt», com uma exceção nomeada:Baiduspider-cproeBaiduspider-adsoperam sob acordos comerciais e podem seguir regras de acesso diferentes; o Baidu também não documenta ocrawl-delayfora do padrão como um controle confiável. Como o comportamento de renderização pode mudar, HTML renderizado no servidor é o padrão conservador para conteúdo crítico. Verifique os controles atuais na Plataforma de Recursos de Busca do Baidu (Ziyuan).
O que o Baiduspider realmente é
Baiduspider (百度蜘蛛) é o crawler operado pelo Baidu, o mecanismo de busca que domina dentro da China continental, onde o Google é em grande parte inacessível atrás do Grande Firewall. Seu trabalho é o pipeline padrão de rastrear → indexar → servir: descobrir URLs, buscar páginas e montar o índice consultado pela Busca do Baidu. A FAQ oficial do Baidu em inglês, “Perguntas frequentes do Baiduspider” em help.baidu.com, é a rara documentação primária em inglês disponível aqui e é a fonte da maioria das citações diretas abaixo.
A assimetria que enquadra tudo: o Baidu importa internamente, não globalmente. O retrato da China em junho de 2026 da StatCounter colocou o Baidu em 47,44%, o Bing em 23,24%, o Haosou em 14,02%, o Sogou em 2,62% e o Google em apenas 2,28% (StatCounter, Search Engine Market Share China). Trate isso como um retrato, não como uma constante — os números da China da StatCounter oscilam significativamente de um mês para outro dependendo da combinação de dispositivos e da metodologia (há relatos do Baidu variando de aproximadamente 40% a 65% em diferentes retratos de 2025–2026), então confira novamente o valor ao vivo em vez de citar eternamente um único mês. A conclusão permanece: o Baidu lidera dentro da China, enquanto o Google lidera no restante do mundo; por isso, a otimização para o Baiduspider é tratada como uma especialidade própria de SEO internacional, e não como um detalhe secundário do Googlebot. Nosso hub de SEO específico por mercado explica onde o Baidu se encaixa ao lado do Yandex, do Naver e de outros mecanismos regionais.
Strings de user-agent e variantes do crawler
A FAQ do Baidu em inglês nomeia diretamente as variantes do crawler. Reproduzidas literalmente (e sim, o próprio texto do Baidu repete “Baiduspider” para PC e mobile em vez de fornecer strings distintas):
Nome dos produtos | User-agent Pesquisa para PC | Baiduspider Pesquisa mobile | Baiduspider Pesquisa de imagens | Baiduspider-image Pesquisa de vídeos | Baiduspider-video Pesquisa de notícias | Baiduspider-news Favoritos do Baidu | Baiduspider-favo Baidu Union | Baiduspider-cpro Pesquisa comercial | Baiduspider-ads outras pesquisas | Baiduspider
Assim, as variantes nomeadas oficialmente na FAQ em inglês são Baiduspider-image,
-video, -news, -favo (favoritos), -cpro (o crawler da “union”/rede de anúncios) e
-ads (pesquisa comercial) — todas compartilham o token de família Baiduspider. A string literal de user-agent geral para PC, fornecida no próprio site do Baidu, é:
Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.baidu.com/search/spider.html)O UA mobile inclui Baiduspider/2.0 em uma string Android WebKit. Toda variante declarada aponta para a mesma URL de referência http://www.baidu.com/search/spider.html — o equivalente do Baidu a google.com/bot.html do Googlebot.
Baiduspider-render — a variante JS que o Baidu documenta apenas em chinês
Há uma sutileza importante aqui, porque muitos textos explicativos erram nesse ponto: a tabela da FAQ em inglês acima não lista uma variante “Baiduspider-render”, o que levou alguns guias a tratá-la como mero folclore de terceiros. Não é. O Baidu documenta o Baiduspider-render oficialmente — apenas em sua página da Academia Ziyuan em chinês, “【官方说法】只需两步,正确识别百度蜘蛛(User-Agent)” (“[Declaração oficial] Duas etapas para identificar corretamente o Baiduspider”). A página divide os UAs em três canais — 移动 (mobile), PC e 小程序 (mini-programa) — e lista um UA alternativo de renderização ao lado do normal:
Mozilla/5.0 (compatible; Baiduspider-render/2.0; +http://www.baidu.com/search/spider.html)com uma string mobile correspondente e uma variante para mini-programa (Baiduspider-render/2.0;Smartapp). Assim, o Baiduspider-render é documentado oficialmente — apenas em chinês e ausente da FAQ em inglês. O que o Baidu não publica é uma especificação do que “-render” faz de diferente; ao contrário do Google, o Baidu não documenta seus recursos de renderização de JavaScript. É daí que vem a ressalva sobre renderização de JS abaixo.
Como verificar o Baiduspider (e não um bot falsificado)
A string de user-agent é trivialmente falsificada — qualquer pessoa pode enviar uma requisição que diz Baiduspider. A própria FAQ do Baidu alerta precisamente sobre isso, descrevendo “spammers or other trouble makers who pretend to be Baiduspider,” (tradução) «spammers ou outros agentes mal-intencionados que fingem ser o Baiduspider», e orientando a verificar por DNS, não pela string. Da FAQ, literalmente:
We recommend using reverse DNS lookup to verify Baiduspider. Verification methods are different under linux/windows/os environments. (tradução) «Recomendamos usar uma consulta DNS reversa para verificar o Baiduspider. Os métodos de verificação variam entre ambientes Linux, Windows e outros sistemas operacionais.»
Ela fornece comandos por sistema operacional — host no Linux, nslookup no Windows e dig -x no macOS — com exemplos funcionais e a regra importante:
The hostname of Baiduspider is *.baidu.com or *.baidu.jp. Others are fake hostnames. (tradução) «O hostname do Baiduspider é *.baidu.com ou *.baidu.jp. Os demais são hostnames falsos.»
Os dois domínios *.baidu.com e *.baidu.jp são a particularidade que você precisa lembrar — o Baidu rastreia a partir de ambos os namespaces de DNS reverso, um .com e um .jp, portanto um hostname legítimo do Baiduspider pode terminar em qualquer um deles. Um dos próprios exemplos funcionais do Baidu resolve até para BaiduMobaider-119-63-195-254.crawl.baidu.jp — observe “BaiduMobaider”, não “Baiduspider”, nesse hostname; é uma particularidade real da documentação do Baidu, não um erro a corrigir silenciosamente.
A FAQ do Baidu em inglês explicita apenas a metade de consulta reversa em sua prosa, mas a página chinesa da Academia Ziyuan é mais clara: ela chama o processo completo de “双向DNS解析认证” (autenticação de resolução DNS bidirecional) e o divide em “第一步:DNS反查IP” (Etapa 1: consultar o IP reversamente) e “第二步:对域名运行正向DNS查找” (Etapa 2: executar uma consulta DNS direta no hostname). Esse é o método completo e correto — consulte o IP reversamente para confirmar um hostname *.baidu.com/*.baidu.jp, depois consulte esse hostname diretamente e confirme que ele resolve de volta para o mesmo IP. É a mesma abordagem de duas etapas usada para verificar o Googlebot ou o Bingbot — os comandos estão na aba Scripts.
Baiduspider e robots.txt
O Baidu faz uma afirmação de conformidade excepcionalmente forte e citável em sua própria FAQ:
Baidu strictly complies with robots.txt protocol. (tradução) «O Baidu segue estritamente o protocolo robots.txt.»
E ele oferece os controles padrão esperados. Segundo o material da Academia Ziyuan, o Baiduspider aceita correspondência com curingas usando * e $ nos caminhos de robots.txt (em paridade com Google e Bing) e faz correspondência de caminhos exata e sensível a maiúsculas e minúsculas. Você pode definir regras por user-agent — a FAQ do Baidu traz exemplos funcionais, incluindo este que bloqueia tudo para o Baiduspider geral, mas permite que o crawler de imagens entre em /image/:
User-agent: Baiduspider
Disallow: /
User-agent: Baiduspider-image
Allow: /image/(O Baidu também observa que o Baiduspider-video atualmente não aceita essas regras.)
A exceção nomeada à “conformidade estrita”
A tensão interessante: o Baidu afirma conformidade estrita, mas documenta uma exceção oficial e nomeada. Baiduspider-cpro (o crawler da rede de anúncios) e Baiduspider-ads (pesquisa comercial) operam sob acordos comerciais separados e ignoram robots.txt por design. Literalmente na FAQ: “Baiduspider-cpro will not work on the records set by robots.txt” (tradução) «o Baiduspider-cpro não seguirá as regras definidas pelo robots.txt», e o mesmo vale para -ads. Portanto, a formulação honesta não é o vago “o Baidu nem sempre respeita robots.txt” que aparece em sites agregadores — é que os crawlers padrão do Baidu estão em conformidade, com dois crawlers de anúncios contratualmente isentos como a única exceção concreta e documentada.
Há um ponto separado e mais específico que é fácil de confundir: o Baiduspider não respeita a diretiva fora do padrão crawl-delay. Abby Hamilton, do Search Engine Journal, documentou isso em O guia moderno de robots.txt (nov. de 2024) — a tabela de comparação de crawlers lista “Baidu | Baiduspider | No” (tradução) «Baidu | Baiduspider | Não» para o suporte a crawl-delay (o YandexBot do Yandex, em contraste, aparece como “Yes” (tradução) «Sim»). Essa é uma afirmação diferente da conformidade com Allow/Disallow padrão e vale mantê-la separada para não contradizer acidentalmente a afirmação do próprio Baidu sobre robots.txt.
Um exemplo real: o robots.txt do próprio baidu.com
O Baidu pratica segmentação de robots.txt em seu próprio domínio. Seu robots.txt ao vivo fornece ao próprio Baiduspider uma lista de proibições mais curta do que a fornecida ao Googlebot, ao MSNBot, ao Sogou e ao Youdao (que adicionalmente recebem bloqueios para /shifen/, /homepage/ e /cpro), e bloqueia tudo (Disallow: /) para qualquer user-agent não nomeado por padrão:
User-agent: Baiduspider
Disallow: /baidu
Disallow: /s?
Disallow: /ulink?
Disallow: /link?
Disallow: /home/news/data/
Disallow: /bhUm detalhe operacional da FAQ que vale conhecer ao editar regras: se você tornar o robots.txt mais restritivo depois que o Baidu já tiver indexado um site, “it usually takes 48 hours for the updated robots.txt to take effect.” (tradução) «normalmente são necessárias 48 horas para que o robots.txt atualizado entre em vigor».
O Baiduspider renderiza JavaScript?
Esta é a maior limitação prática do Baiduspider em relação ao Googlebot, e vale ser preciso sobre o que é oficial e o que não é. A FAQ do Baidu em inglês não aborda renderização de JavaScript de forma alguma — não há uma especificação de capacidade como a que o Google publica para o Googlebot. O que temos em vez disso são testes consistentes do setor. Dan Taylor resumiu isso de forma direta no comparativo entre Google e Baidu do Search Engine Journal (mar. de 2021): “Baidu is notoriously bad when it comes to crawling JavaScript, so make sure that all your important content and links are served in plain HTML on both the mobile and desktop versions of your website.” (tradução) «O Baidu é notoriamente ruim para rastrear JavaScript; por isso, garanta que todo o conteúdo e todos os links importantes sejam entregues em HTML simples tanto na versão mobile quanto na versão desktop do site.»
Isso está alinhado com a posição que este site já adota. Nossa cobertura de SEO de Contentful observa que Bing, Yandex e Baidu “may not index [client-side-rendered JS] at all,” (tradução) «talvez não indexem [JS renderizado no lado do cliente] de forma alguma», e que a renderização dinâmica está obsoleta como técnica geral para o Google. Coloque os três grandes crawlers em um espectro: o Googlebot faz renderização completa com Chromium evergreen, o Bingbot faz renderização sólida com Chromium/Edge e o Baiduspider é o mais fraco dos três em JavaScript — com HTML simples renderizado no servidor sendo o fallback universalmente seguro para todos.
Orientação prática para um site voltado à China: prefira renderização no servidor ou HTML estático por padrão, para que o conteúdo crítico, os links e os metadados existam na resposta inicial antes que qualquer JavaScript execute. Trate conteúdo disponível apenas no cliente como um risco de indexação especificamente para o Baidu, independentemente de ele ranquear bem no Google. Apresente SSR como uma boa prática de consenso do setor — não como uma recomendação oficial do Baidu, porque não existe uma declaração primária do Baidu sobre renderização de JS que possa ser citada.
Controlando a frequência de rastreamento do Baiduspider
O Baidu apresenta a frequência de rastreamento como ajustada pelo algoritmo, não como algo que você define diretamente. Da FAQ, literalmente:
In order to ensure the search results cover most of your pages, Baiduspider must keep the crawling at a certain level. We have been trying our best to avoid increasing the loading to your servers, and to adjust the frequency based on combined factors, such as your server’s capability, your site’s quality and the update frequency of your site. (tradução) «Para garantir que os resultados da busca cubram a maioria das suas páginas, o Baiduspider precisa manter certo nível de rastreamento. Procuramos evitar o aumento da carga nos seus servidores e ajustar a frequência conforme fatores combinados, como a capacidade do servidor, a qualidade do site e sua frequência de atualização.»
Essa é a mesma lógica de capacidade do servidor mais demanda que Google e Bing descrevem. A FAQ nomeia um formulário de feedback (webmaster.baidu.com/feedback/index) como o canal oficial para relatar rastreamento excessivo — “If you find any unreasonable access from Baiduspider, please inform us.” (tradução) «Se você identificar algum acesso desproporcional do Baiduspider, avise-nos.»
No nível do produto, a Plataforma de Recursos de Busca do Baidu (百度搜索资源平台, em ziyuan.baidu.com — o console historicamente chamado de “Baidu Webmaster Tools”) é o equivalente do Baidu ao Google Search Console e ao Bing Webmaster Tools. O manual do índice confirma uma área de produto “抓取频次” (Frequência de rastreamento) em que os proprietários de sites podem ver e limitar diretamente a taxa de rastreamento do Baiduspider, ao lado das ferramentas de robots e de diagnóstico de rastreamento. Trate o formulário de feedback como o canal oficial de escalonamento na documentação inglesa do Baidu e o painel Ziyuan de Frequência de rastreamento como o controle prático em nível de interface. (O caminho exato do menu dentro do produto fica atrás de uma conta Ziyuan autenticada; portanto, confirme a interface atual antes de citar etapas específicas.)
hreflang e outros sinais padrão do Google
Os sinais padrão para o Google não são todos transferidos para o Baidu — e esta é uma descoberta do setor e de profissionais, não algo documentado por nenhuma das empresas. A própria documentação do Google sobre versões localizadas se limita inteiramente à Busca do Google e não afirma se Baidu, Bing ou Yandex respeitam hreflang. Em nosso site, o guia de hreflang afirma claramente: o Baidu não oferece suporte a hreflang — o fallback é definir corretamente content-language e <html lang> para que o Baidu ao menos consiga ler o idioma da página. Isso é adicional ao meu trabalho de hreflang com escopo no Google (o guia de tags hreflang da Ahrefs e o estudo de 374 756 domínios, ambos discutindo apenas a implementação do Google), e não uma contradição dele.
Não existe uma cultura de representantes em inglês — por que a FAQ é tão valiosa
Um aspecto que realmente diferencia o ecossistema do Baidu: ao contrário do Google (Gary Illyes, John Mueller), do Bing (Fabrice Canel) ou do Yandex, o Baidu não mantém uma cultura pública visível de perguntas e respostas com representantes em inglês. Não há um porta-voz nomeado fazendo conversas de SEO com a comunidade. A voz oficial mais clara do Baidu em inglês é a FAQ institucional sem assinatura em help.baidu.com. Por isso essa FAQ — e as páginas da Academia Ziyuan em chinês por trás dela — são tão valiosas: a maior parte do conhecimento operacional sobre o Baiduspider no mundo de SEO de língua inglesa vem de testes de profissionais (análise de logs do servidor, exercícios de verificação de DNS, tentativa e erro com robots.txt), e não de comentários de representantes oficiais. Michael Bonfils resumiu a lição mais ampla no Baidu vs. Google da Search Engine Land: “SEO strategies that work for Google may not always translate directly to success on Baidu, China’s dominant search engine.” (tradução) «Estratégias de SEO que funcionam no Google nem sempre se convertem diretamente em sucesso no Baidu, o mecanismo de busca dominante da China.»
Para entender onde o Baiduspider se encaixa no panorama maior — a família de crawlers, Googlebot e Bingbot como pares, o conceito de user-agent e robots.txt — o hub de rastreamento conecta tudo, e SEO internacional é a página de referência para o contexto do mercado chinês.
Resumo de IA
Uma versão condensada da versão Avançada:
- Baiduspider = crawler do Baidu — o Googlebot do mercado chinês. O Baidu domina dentro da China continental (StatCounter, junho de 2026: Baidu ~47%, Google ~2%), portanto é uma especialidade de SEO internacional, não um detalhe secundário do Googlebot. Essa participação oscila mês a mês — trate-a como um retrato.
- As variantes compartilham a família de tokens
Baiduspider: PC/mobile geral, além de-image,-video,-news,-favo(favoritos),-cpro(rede de anúncios) e-ads(comercial). UA geral de PC:Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.baidu.com/search/spider.html). Baiduspider-renderé documentado oficialmente — mas apenas na página da Academia Ziyuan em chinês do Baidu, ausente da FAQ em inglês. O que “-render” faz de diferente não é especificado.- Verifique por DNS bidirecional para
*.baidu.comou*.baidu.jp(o Baidu rastreia a partir dos dois): consulte o IP reversamente e depois consulte o hostname diretamente de volta para o mesmo IP. A string de user-agent é falsificável; o Baidu alerta sobre impostores. - robots.txt: o Baidu afirma que o crawler “strictly complies,” (tradução) «segue estritamente» o protocolo e aceita curingas
*/$e correspondência sensível a maiúsculas e minúsculas — com uma exceção nomeada:Baiduspider-cproeBaiduspider-adsoperam sob acordos comerciais e ignoram robots.txt. Separadamente, o Baiduspider não respeita ocrawl-delayfora do padrão (segundo Abby Hamilton, da SEJ). Mudanças nas regras levam cerca de 48 horas para entrar em vigor. - JavaScript é a maior diferença em relação ao Googlebot — não há especificação oficial de capacidade; o consenso do setor (Dan Taylor: “notoriously bad… crawling JavaScript” (tradução) «notoriamente ruim para rastrear JavaScript») é que HTML renderizado no servidor ou estático é o padrão seguro para sites voltados à China.
- A frequência de rastreamento é algorítmica (capacidade do servidor + qualidade do site + frequência de atualização); relate rastreamento excessivo pelo formulário de feedback do Baidu e veja/limite a taxa na Plataforma de Recursos de Busca do Baidu (Ziyuan) — o equivalente do Search Console do Baidu.
- O hreflang não é aceito pelo Baidu (descoberta do setor; nenhuma das empresas documenta a questão em um sentido ou no outro) — use como fallback
content-language/<html lang>. - Não há cultura de representantes em inglês: a voz oficial mais clara do Baidu em inglês é uma FAQ sem assinatura, portanto os testes de profissionais carregam a maior parte do conhecimento operacional.
Documentação oficial
Documentação de fontes primárias. A documentação do Baidu está dividida entre uma FAQ em inglês e páginas em chinês da Ziyuan (Plataforma de Recursos de Busca do Baidu); os links do Google servem para o contraste na interseção com hreflang.
Baidu
- Perguntas frequentes do Baiduspider (help.baidu.com) — FAQ oficial do Baidu em inglês: o que é o Baiduspider, a tabela de user-agents, a política de frequência de rastreamento, a verificação de DNS com exemplos funcionais e o tratamento de robots.txt. A fonte primária em inglês.
- 【官方说法】只需两步,正确识别百度蜘蛛(User-Agent)(ziyuan.baidu.com) — artigo oficial do Baidu em chinês sobre a identificação do Baiduspider: os três canais de UA (mobile/PC/mini-programa), os UAs
Baiduspider-rendere o método completo de “autenticação DNS bidirecional”. - Índice do manual da Plataforma de Recursos de Busca do Baidu (ziyuan.baidu.com) — índice do manual do produto Ziyuan que confirma as áreas de ferramentas de 抓取频次 (Frequência de rastreamento), robots e 抓取诊断 (Diagnóstico de rastreamento).
- baidu.com/robots.txt — o robots.txt ao vivo do próprio Baidu, um exemplo real de segmentação por crawler.
Google (para o contraste na interseção com hreflang)
- Informe ao Google sobre versões localizadas da sua página — documentação do Google sobre hreflang, inteiramente limitada à Busca do Google; notavelmente, não diz se Baidu, Bing ou Yandex respeitam hreflang.
Citações da fonte
O Baidu não mantém um porta-voz nomeado em inglês, então a “fonte” aqui é a própria FAQ sem assinatura do Baidu, acompanhada de comentários nomeados do setor que substituem as citações de representantes que você obteria do Google ou do Bing. Cada link é um link profundo que salta para o trecho citado.
Baidu — “Perguntas frequentes do Baiduspider” (help.baidu.com, em inglês)
- “Baiduspider is Baidu search engine program which is used to visit pages on the internet and build information into Baidu index. This enables users to locate your site when they perform a search.” (tradução) «O Baiduspider é um programa da busca do Baidu que visita páginas na internet e adiciona suas informações ao índice. Assim, os usuários conseguem localizar o site quando pesquisam.» Ir para a citação
- “In order to ensure the search results cover most of your pages, Baiduspider must keep the crawling at a certain level… to adjust the frequency based on combined factors, such as your server’s capability, your site’s quality and the update frequency of your site.” (tradução) «Para que os resultados da busca cubram a maioria das suas páginas, o Baiduspider precisa manter certo nível de rastreamento e ajustar a frequência conforme fatores combinados, como a capacidade do servidor, a qualidade do site e a frequência de atualização.» Ir para a citação
- “We recommend using reverse DNS lookup to verify Baiduspider.” (tradução) «Recomendamos usar uma consulta DNS reversa para verificar o Baiduspider.» Ir para a citação
- *“The hostname of Baiduspider is *.baidu.com or .baidu.jp. Others are fake hostnames.” (tradução) «O hostname do Baiduspider é *.baidu.com ou *.baidu.jp. Os demais são hostnames falsos.» Ir para a citação
- “Baidu strictly complies with robots.txt protocol.” (tradução) «O Baidu segue estritamente o protocolo robots.txt.» Ir para a citação
Baidu — Academia Ziyuan (ziyuan.baidu.com, em chinês)
- Original: “二、双向DNS解析认证” — paráfrase em português: «Etapa dois: autenticação de resolução DNS bidirecional», o nome que o próprio Baidu dá à verificação do Baiduspider por uma consulta reversa seguida de uma consulta direta de volta ao mesmo IP. Ver a página
Dan Taylor, Search Engine Journal — sobre JavaScript
- “Baidu is notoriously bad when it comes to crawling JavaScript, so make sure that all your important content and links are served in plain HTML on both the mobile and desktop versions of your website.” (tradução) «O Baidu é notoriamente ruim para rastrear JavaScript; portanto, garanta que todo o conteúdo e todos os links importantes sejam entregues em HTML simples nas versões mobile e desktop do site.» (mar. de 2021.) Ir para a citação
Michael Bonfils, Search Engine Land — sobre a transferência de estratégias
- “SEO strategies that work for Google may not always translate directly to success on Baidu, China’s dominant search engine.” (tradução) «Estratégias de SEO que funcionam no Google nem sempre resultam diretamente em sucesso no Baidu, o mecanismo de busca dominante da China.» Ir para a citação
Abby Hamilton, Search Engine Journal — sobre crawl-delay
- A tabela de comparação de crawlers dela lista o Baiduspider como não oferecendo suporte à diretiva fora do padrão
crawl-delay(“Baidu | Baiduspider | No” (tradução) «Baidu | Baiduspider | Não»). (nov. de 2024.) Ler a cobertura
help.baidu.com do Baidu é parcialmente renderizada por JavaScript e a página da Academia Ziyuan está apenas em chinês; as citações em inglês acima foram confirmadas como substrings exatas das páginas ao vivo, mas confirme-as nas páginas ao vivo (e use um navegador para as fontes renderizadas por JS/em chinês) antes de tratar qualquer uma como final. Devo deixar o Baiduspider rastrear meu site — e como lidar com isso?
O Baiduspider só vale o esforço se você realmente quer visibilidade no mercado chinês. Clique para acessar.
Deciding what to do about Baiduspider
Verifique se um bot é realmente o Baiduspider
A própria FAQ do Baidu recomenda DNS reverso para verificar o Baiduspider, porque a string de user-agent é trivialmente falsificável. Faça a verificação bidirecional completa que o Baidu nomeia em sua página chinesa da Ziyuan: consulte o IP reversamente (o hostname precisa terminar em *.baidu.com ou *.baidu.jp) e depois consulte esse hostname diretamente de volta para o mesmo IP.
macOS / Linux
# 1) Reverse-DNS the IP from your logs — it must end in baidu.com or baidu.jp
host 123.125.66.120
# → 120.66.125.123.in-addr.arpa domain name pointer Baiduspider-123-125-66-120.crawl.baidu.com
# 2) Forward-DNS that hostname back — it must resolve to the same IP
host Baiduspider-123-125-66-120.crawl.baidu.com
# → Baiduspider-123-125-66-120.crawl.baidu.com has address 123.125.66.120Forma dig do macOS (como aparece na FAQ do Baidu):
dig -x 123.125.66.120Windows
nslookup 123.125.66.120
nslookup Baiduspider-123-125-66-120.crawl.baidu.comSe a consulta reversa não terminar em baidu.com ou baidu.jp, ou se a consulta direta não devolver o IP original, não é o Baiduspider — descarte-o ou limite sua taxa. (A mesma abordagem de duas etapas usada para verificar Googlebot e Bingbot; consulte as abas Scripts dos artigos para as versões do Google/Bing.)
Extraia apenas os acessos do Baiduspider dos seus logs do servidor
Extraia as linhas candidatas do Baiduspider de um log de acesso e depois verifique cada IP com a consulta DNS acima — não confie apenas na string.
# Extract lines whose user-agent claims to be Baiduspider, print unique IPs
grep -i 'baiduspider' /var/log/nginx/access.log \
| awk '{print $1}' | sort -uFaça o hostname corresponder aos domínios permitidos pelo Baidu (regex)
Depois de resolver um hostname reversamente, esta regex confirma que ele está em um dos dois namespaces legítimos de crawler do Baidu (.baidu.com ou .baidu.jp), e não em um domínio parecido:
# Passes only for hostnames ending in .baidu.com or .baidu.jp
echo "Baiduspider-123-125-66-120.crawl.baidu.com" \
| grep -Eiq '\.baidu\.(com|jp)$' && echo "legit namespace" || echo "FAKE"Cuidado com falsos semelhantes como baidu.com.evil.example — ancorar o padrão no final da string ($) é o que impede que eles passem.
Um ponto de partida de robots.txt para o Baiduspider
# Let Baiduspider crawl everything except low-value spaces
User-agent: Baiduspider
Disallow: /search
Disallow: /*?*sort=
# Block Baiduspider entirely (China not a target market)
# User-agent: Baiduspider
# Disallow: /Lembre-se: Disallow controla o rastreamento, não a indexação, e as mudanças de regra levam cerca de 48 horas para entrar em vigor. Os crawlers de anúncios Baiduspider-cpro e Baiduspider-ads ignoram robots.txt por design.
Baiduspider — cola rápida
Strings de user-agent e variantes do crawler
| Variante | Token do robots.txt | User-agent |
|---|---|---|
| Geral (PC + mobile) | Baiduspider | Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.baidu.com/search/spider.html) |
| Pesquisa de imagens | Baiduspider-image | Compartilha o token da família Baiduspider, com o sufixo -image |
| Pesquisa de vídeos | Baiduspider-video | sufixo -video (atualmente não aceita regras de robots.txt por agente) |
| Pesquisa de notícias | Baiduspider-news | sufixo -news |
| Favoritos do Baidu | Baiduspider-favo | sufixo -favo |
| Baidu Union (rede de anúncios) | Baiduspider-cpro | sufixo -cpro — ignora robots.txt por acordo comercial |
| Pesquisa comercial | Baiduspider-ads | sufixo -ads — ignora robots.txt por acordo comercial |
| Render (variante JS) | — | Mozilla/5.0 (compatible; Baiduspider-render/2.0; +http://www.baidu.com/search/spider.html) — documentada apenas na página da Academia Ziyuan em chinês do Baidu, ausente da FAQ em inglês |
Toda variante declarada de UA aponta para a mesma URL de referência, http://www.baidu.com/search/spider.html — o equivalente do Baiduspider a google.com/bot.html do Googlebot.
Conformidade com robots.txt em resumo
| Crawler | Segue robots.txt? |
|---|---|
Baiduspider geral, -image, -video, -news, -favo | Sim — a FAQ do Baidu afirma “Baidu strictly complies with robots.txt protocol” (tradução) «O Baidu segue estritamente o protocolo robots.txt» |
Baiduspider-cpro | Não — exceção nomeada e documentada (acordo comercial) |
Baiduspider-ads | Não — exceção nomeada e documentada (acordo comercial) |
Diretiva fora do padrão crawl-delay | Não é respeitada por nenhuma variante do Baiduspider, segundo Abby Hamilton, do Search Engine Journal |
Fatos rápidos
- Verifique com DNS bidirecional: consulte reversamente o IP que rastreia para confirmar um hostname terminado em
*.baidu.comou*.baidu.jp, e depois consulte esse hostname diretamente de volta para o mesmo IP. A string de user-agent, sozinha, não prova nada. - Mudanças no robots.txt levam cerca de 48 horas para entrar em vigor em um site já indexado.
- O Baidu aceita correspondência com curingas
*e$nos caminhos de robots.txt e faz correspondência exata, sensível a maiúsculas e minúsculas. - A frequência de rastreamento é ajustada pelo algoritmo (capacidade do servidor, qualidade do site, frequência de atualização) — veja-a e limite-a na Plataforma de Recursos de Busca do Baidu (Ziyuan).
- A maior diferença prática do Baiduspider em relação ao Googlebot é a renderização fraca de JavaScript — HTML renderizado no servidor ou estático é o padrão seguro para conteúdo voltado à China.
- O Baidu não oferece suporte a hreflang — o sinal de fallback é um
content-languagee um<html lang>corretos.
Checklist de preparação para o Baiduspider
Uma verificação rápida para confirmar que você está trabalhando com o Baiduspider, e não acidentalmente contra ele — o mesmo conteúdo da aba Avançado em formato de checklist.
- O robots.txt não bloqueia o
Baiduspider(ou a variante desejada) de nada que você queira encontrar nos resultados de busca do Baidu. - Um sitemap foi enviado na Plataforma de Recursos de Busca do Baidu (Ziyuan).
- A verificação do bot usa DNS bidirecional — consulta reversa para
*.baidu.com/*.baidu.jp, seguida de uma consulta direta que confirma o mesmo IP — nunca apenas a string de user-agent. - Você sabe que
Baiduspider-cproeBaiduspider-adsignoram robots.txt por design; portanto, bloqueá-los ali não os deterá de fato. - Qualquer restrição recente no robots.txt teve aproximadamente 48 horas para se propagar antes de você verificar novamente o status de indexação.
- O conteúdo crítico, os links internos e os metadados existem na resposta HTML renderizada no servidor — não foram inseridos apenas por JavaScript no lado do cliente.
-
content-languagee<html lang>estão definidos corretamente, pois o Baidu não oferece suporte a hreflang. - A carga de rastreamento foi revisada na área de Frequência de rastreamento (抓取频次) da Ziyuan se o tráfego do Baiduspider estiver sobrecarregando o servidor.
- Rastreamento desproporcional ou excessivo foi relatado pelo formulário de feedback do Baidu (
webmaster.baidu.com/feedback/index), em vez de ser apenas presumido ou bloqueado. - Não há dependência restante do Baidu MIP — o framework foi aposentado (o Cache foi descontinuado em junho de 2020 e o serviço completo, no fim de setembro de 2022).
Ferramentas para trabalhar com o Baiduspider
- Verificador de DNS — minha própria ferramenta para a verificação DNS bidirecional recomendada pela FAQ do Baidu. Insira o IP de rastreamento com tipo de registro PTR para executar a consulta reversa (um hostname verdadeiro do Baiduspider termina em
.baidu.comou.baidu.jp) e depois insira esse hostname com tipo de registro A para confirmar que a consulta direta resolve para o mesmo IP. Ela consulta Cloudflare, Google e Quad9 lado a lado, para você identificar um resolvedor que discorde. - Testador de robots.txt — minha própria ferramenta para verificar se as regras do seu robots.txt realmente bloqueiam ou permitem o Baiduspider como você pretende. Cole seu arquivo, insira
Baiduspider(ouBaiduspider-image,Baiduspider-newsetc.) no campo de user-agent personalizado e teste-o contra caminhos reais — a ferramenta mostra a regra exata vencedora por URL. Lembre-se de queBaiduspider-cproeBaiduspider-adsignoram robots.txt independentemente do que o testador mostre, pois operam sob acordos comerciais separados.
Mitos e erros do Baiduspider a evitar
Mito: “Qualquer user-agent que contenha ‘Baiduspider’ é realmente do Baidu.”
Por que está errado: a string de user-agent é trivialmente falsificável, e a própria FAQ do Baidu alerta sobre “spammers or other trouble makers who pretend to be Baiduspider.” (tradução) «spammers ou outros agentes mal-intencionados que fingem ser o Baiduspider».
Faça isto: execute a verificação de DNS bidirecional — consulta reversa para um hostname *.baidu.com/*.baidu.jp, seguida de consulta direta de volta para o mesmo IP — antes de confiar em (ou bloquear com base em) qualquer acesso do “Baiduspider”.
Mito: “O Baidu nunca segue robots.txt, ou geralmente não é confiável nesse aspecto.”
Por que está errado: a FAQ do Baidu afirma “Baidu strictly complies with robots.txt protocol” (tradução) «O Baidu segue estritamente o protocolo robots.txt» para seus crawlers padrão. A exceção real é restrita e nomeada —
Baiduspider-cpro e Baiduspider-ads operam sob acordos comerciais e ignoram robots.txt — não é um vago “o Baidu ignora robots”.
Faça isto: cite a exceção específica de cpro/ads e não a confunda com o fato separado de que o Baiduspider não respeita a diretiva crawl-delay fora do padrão.
Mito: “O Baiduspider renderiza JavaScript tão bem quanto o Googlebot moderno.” Por que está errado: o consenso do setor (Dan Taylor o chamou de “notoriously bad… crawling JavaScript” (tradução) «notoriamente ruim para rastrear JavaScript») é que o Baiduspider fica muito atrás do Chromium evergreen do Googlebot; conteúdo disponível apenas no cliente é um risco real de indexação para o Baidu mesmo quando ranqueia bem no Google. Faça isto: sirva conteúdo, links e metadados importantes em HTML renderizado no servidor ou estático para sites voltados à China — o padrão seguro para Googlebot, Bingbot e Baiduspider.
Mito: “hreflang funciona no Baidu da mesma forma que no Google.”
Por que está errado: o Baidu não oferece suporte a hreflang (uma descoberta do setor — a própria documentação do Google também não comenta sobre os outros mecanismos).
Faça isto: use como fallback content-language e <html lang> corretos para que o Baidu ao menos consiga ler o idioma da página; não dependa de hreflang para orientar o Baidu.
Mito: “‘Baiduspider-render’ não é uma variante documentada oficialmente.”
Por que está errado: a tabela da FAQ em inglês do Baidu não a lista, mas a página da Academia Ziyuan em chinês documenta Baiduspider-render/2.0 como um UA alternativo de PC/mobile e uma variante para mini-programa. É oficial — apenas em chinês.
Faça isto: descreva-o como oficialmente documentado (somente em chinês), observando que o Baidu não publica uma especificação do que “-render” faz de diferente.
Mito: “O Baidu MIP ainda é uma alavanca de ranqueamento ativa e recomendada.” Por que está errado: o framework MIP (Mobile Instant Pages), semelhante ao AMP do Baidu, é legado. Segundo o glossário de MIP da Jademond, o cache MIP foi descontinuado em junho de 2020 e o serviço completo do MIP foi encerrado no fim de setembro de 2022 — ainda assim, alguns conteúdos de agências com datas atuais continuam promovendo-o como ativo, o que por si só gera confusão. Faça isto: trate o MIP como aposentado e desconfie de qualquer guia recente que o apresente como uma alavanca ativa de velocidade/ranqueamento.
Teste seus conhecimentos: Baiduspider
Cinco perguntas rápidas sobre o crawler do Baidu. Escolha uma resposta para cada uma e depois confira.
Recursos que valem seu tempo
Minha produção relacionada
- Tags hreflang: um guia simples (mas completo) — meu guia da Ahrefs (com Joshua Hardwick) sobre hreflang; com escopo no Google e contexto para entender por que a ausência de suporte a hreflang pelo Baidu é uma preocupação separada.
- Mais de 67% dos domínios que usam hreflang têm problemas — estudo da minha equipe sobre 374 756 domínios; focado na implementação do Google, útil como contraste com a falta de suporte do Baidu.
- Guia para iniciantes em SEO técnico — onde crawlers e sinais internacionais se encaixam no panorama maior.
Minhas palestras
- SEO internacional: os aspectos técnicos incomuns (Pubcon Vegas 2019, SlideShare) — minha palestra sobre os casos técnicos extremos de SEO internacional, o terreno em que se encaixa o trabalho para o mercado chinês.
Do setor
- Perguntas frequentes do Baiduspider (Baidu, help.baidu.com) — a própria FAQ do Baidu em inglês: tabela de UA, verificação de DNS, tratamento de robots.txt e política de frequência de rastreamento. A fonte primária em inglês.
- Google versus Baidu: principais diferenças na estratégia de SEO (Dan Taylor, Search Engine Journal) — a avaliação de que o crawler é muito ruim para rastrear JavaScript e a recomendação de HTML simples.
- Baidu versus Google: navegando pelo cenário de SEO em 2024 (Michael Bonfils, Search Engine Land) — a visão do fundador de agência sobre por que as táticas do Google não se transferem diretamente para o Baidu.
- O guia moderno de robots.txt (Abby Hamilton, Search Engine Journal) — a tabela de comparação de crawlers que mostra que o Baiduspider não respeita
crawl-delay. - Guia de crawlers da web: o que você precisa saber (James Allen, Search Engine Land) — o lugar do Baiduspider em um panorama mais amplo de crawlers.
- Entenda os spiders do Baidu, user-agents e robots.txt (Jademond Digital) — análise aprofundada de profissionais sobre as variantes do crawler do Baidu e o tratamento de robots.
- Baidu MIP (glossário) (Jademond Digital) — a fonte das datas de descontinuação do MIP (cache descontinuado em junho de 2020; serviço completo encerrado no fim de setembro de 2022).
Registro de alterações
Atualizado em 11 de ago. de 2026.
Resumo editorial e detalhes registrados da alteração.Detalhes da alteração
-
As notas detalhadas sobre as alterações estão disponíveis atualmente em inglês.
Não é possível fazer a comparação completa — nenhum instantâneo anterior foi arquivado para esta revisão.
Atualizado em 8 de ago. de 2026.
Resumo editorial e detalhes registrados da alteração.Detalhes da alteração
-
As notas detalhadas sobre as alterações estão disponíveis atualmente em inglês.
Não é possível fazer a comparação completa — nenhum instantâneo anterior foi arquivado para esta revisão.