Crawler Baiduspider

O que é o Baiduspider — variantes e user-agents do crawler do Baidu, conformidade com robots.txt (e a exceção cpro/ads), verificação por DNS reverso, renderização fraca de JS e controle de rastreamento no Ziyuan.

Publicado pela primeira vez: 3 de jul. de 2026 · Última atualização: 11 de ago. de 2026 · Avançado
Idiomas
1 sinal de evidência nesta página

O Baiduspider é o crawler do Baidu — o equivalente do Googlebot no mercado chinês e o bot que descobre, busca e indexa páginas para a Busca do Baidu dentro da China continental. Ele executa variantes nomeadas que compartilham uma família de tokens Baiduspider (image, video, news, favo, cpro, ads), além de uma variante JavaScript Baiduspider-render que o Baidu documenta apenas em chinês. Verifique-o por DNS bidirecional para *.baidu.com ou *.baidu.jp (o user-agent é falsificável), porque a própria FAQ do Baidu alerta sobre impostores. A FAQ do Baidu afirma que ele segue estritamente o robots.txt — com uma exceção nomeada: Baiduspider-cpro e Baiduspider-ads operam sob acordos comerciais e o ignoram. Sua maior limitação prática em relação ao Googlebot é a renderização fraca de JavaScript, portanto HTML renderizado no servidor é o padrão seguro. Controle sua taxa de rastreamento pela Plataforma de Recursos de Busca do Baidu (Ziyuan).

TL;DR — O Baiduspider é o crawler do Baidu — o Googlebot do mercado chinês. Ele executa variantes nomeadas que compartilham a família de tokens Baiduspider (PC/mobile geral, além de -image, -video, -news, -favo, -cpro e -ads) e uma variante JavaScript Baiduspider-render que o Baidu documenta somente em chinês. Verifique-o por DNS bidirecional para *.baidu.com/*.baidu.jp — a própria FAQ do Baidu alerta sobre impostores. O Baidu afirma que ele “strictly complies with robots.txt protocol,” (tradução) «segue estritamente o protocolo robots.txt», com uma exceção nomeada: Baiduspider-cpro e Baiduspider-ads operam sob acordos comerciais e podem seguir regras de acesso diferentes; o Baidu também não documenta o crawl-delay fora do padrão como um controle confiável. Como o comportamento de renderização pode mudar, HTML renderizado no servidor é o padrão conservador para conteúdo crítico. Verifique os controles atuais na Plataforma de Recursos de Busca do Baidu (Ziyuan).

Evidence for this claim Baiduspider is Baidu Search's crawler and Baidu's Search Resource Platform is the authoritative place to verify current crawler guidance. Scope: Current official Baidu webmaster platform; user-agent text alone is not authentication. Confidence: medium · Verified: Baidu Search Resource Platform Evidence for this claim Crawler access directives use the standardized robots.txt protocol, but engine-specific support and verification should be checked against Baidu's current documentation. Scope: Robots Exclusion Protocol baseline, distinct from undocumented Baidu-specific behavior. Confidence: high · Verified: IETF RFC 9309: Robots Exclusion Protocol

O que o Baiduspider realmente é

Baiduspider (百度蜘蛛) é o crawler operado pelo Baidu, o mecanismo de busca que domina dentro da China continental, onde o Google é em grande parte inacessível atrás do Grande Firewall. Seu trabalho é o pipeline padrão de rastrear → indexar → servir: descobrir URLs, buscar páginas e montar o índice consultado pela Busca do Baidu. A FAQ oficial do Baidu em inglês, “Perguntas frequentes do Baiduspider” em help.baidu.com, é a rara documentação primária em inglês disponível aqui e é a fonte da maioria das citações diretas abaixo.

A assimetria que enquadra tudo: o Baidu importa internamente, não globalmente. O retrato da China em junho de 2026 da StatCounter colocou o Baidu em 47,44%, o Bing em 23,24%, o Haosou em 14,02%, o Sogou em 2,62% e o Google em apenas 2,28% (StatCounter, Search Engine Market Share China). Trate isso como um retrato, não como uma constante — os números da China da StatCounter oscilam significativamente de um mês para outro dependendo da combinação de dispositivos e da metodologia (há relatos do Baidu variando de aproximadamente 40% a 65% em diferentes retratos de 2025–2026), então confira novamente o valor ao vivo em vez de citar eternamente um único mês. A conclusão permanece: o Baidu lidera dentro da China, enquanto o Google lidera no restante do mundo; por isso, a otimização para o Baiduspider é tratada como uma especialidade própria de SEO internacional, e não como um detalhe secundário do Googlebot. Nosso hub de SEO específico por mercado explica onde o Baidu se encaixa ao lado do Yandex, do Naver e de outros mecanismos regionais.

Strings de user-agent e variantes do crawler

A FAQ do Baidu em inglês nomeia diretamente as variantes do crawler. Reproduzidas literalmente (e sim, o próprio texto do Baidu repete “Baiduspider” para PC e mobile em vez de fornecer strings distintas):

Nome dos produtos | User-agent Pesquisa para PC | Baiduspider Pesquisa mobile | Baiduspider Pesquisa de imagens | Baiduspider-image Pesquisa de vídeos | Baiduspider-video Pesquisa de notícias | Baiduspider-news Favoritos do Baidu | Baiduspider-favo Baidu Union | Baiduspider-cpro Pesquisa comercial | Baiduspider-ads outras pesquisas | Baiduspider

Assim, as variantes nomeadas oficialmente na FAQ em inglês são Baiduspider-image, -video, -news, -favo (favoritos), -cpro (o crawler da “union”/rede de anúncios) e -ads (pesquisa comercial) — todas compartilham o token de família Baiduspider. A string literal de user-agent geral para PC, fornecida no próprio site do Baidu, é:

Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.baidu.com/search/spider.html)

O UA mobile inclui Baiduspider/2.0 em uma string Android WebKit. Toda variante declarada aponta para a mesma URL de referência http://www.baidu.com/search/spider.html — o equivalente do Baidu a google.com/bot.html do Googlebot.

Baiduspider-render — a variante JS que o Baidu documenta apenas em chinês

Há uma sutileza importante aqui, porque muitos textos explicativos erram nesse ponto: a tabela da FAQ em inglês acima não lista uma variante “Baiduspider-render”, o que levou alguns guias a tratá-la como mero folclore de terceiros. Não é. O Baidu documenta o Baiduspider-render oficialmente — apenas em sua página da Academia Ziyuan em chinês, “【官方说法】只需两步,正确识别百度蜘蛛(User-Agent)” (“[Declaração oficial] Duas etapas para identificar corretamente o Baiduspider”). A página divide os UAs em três canais — 移动 (mobile), PC e 小程序 (mini-programa) — e lista um UA alternativo de renderização ao lado do normal:

Mozilla/5.0 (compatible; Baiduspider-render/2.0; +http://www.baidu.com/search/spider.html)

com uma string mobile correspondente e uma variante para mini-programa (Baiduspider-render/2.0;Smartapp). Assim, o Baiduspider-render é documentado oficialmente — apenas em chinês e ausente da FAQ em inglês. O que o Baidu não publica é uma especificação do que “-render” faz de diferente; ao contrário do Google, o Baidu não documenta seus recursos de renderização de JavaScript. É daí que vem a ressalva sobre renderização de JS abaixo.

Como verificar o Baiduspider (e não um bot falsificado)

A string de user-agent é trivialmente falsificada — qualquer pessoa pode enviar uma requisição que diz Baiduspider. A própria FAQ do Baidu alerta precisamente sobre isso, descrevendo “spammers or other trouble makers who pretend to be Baiduspider,” (tradução) «spammers ou outros agentes mal-intencionados que fingem ser o Baiduspider», e orientando a verificar por DNS, não pela string. Da FAQ, literalmente:

We recommend using reverse DNS lookup to verify Baiduspider. Verification methods are different under linux/windows/os environments. (tradução) «Recomendamos usar uma consulta DNS reversa para verificar o Baiduspider. Os métodos de verificação variam entre ambientes Linux, Windows e outros sistemas operacionais.»

Ela fornece comandos por sistema operacional — host no Linux, nslookup no Windows e dig -x no macOS — com exemplos funcionais e a regra importante:

The hostname of Baiduspider is *.baidu.com or *.baidu.jp. Others are fake hostnames. (tradução) «O hostname do Baiduspider é *.baidu.com ou *.baidu.jp. Os demais são hostnames falsos.»

Os dois domínios *.baidu.com e *.baidu.jp são a particularidade que você precisa lembrar — o Baidu rastreia a partir de ambos os namespaces de DNS reverso, um .com e um .jp, portanto um hostname legítimo do Baiduspider pode terminar em qualquer um deles. Um dos próprios exemplos funcionais do Baidu resolve até para BaiduMobaider-119-63-195-254.crawl.baidu.jp — observe “BaiduMobaider”, não “Baiduspider”, nesse hostname; é uma particularidade real da documentação do Baidu, não um erro a corrigir silenciosamente.

A FAQ do Baidu em inglês explicita apenas a metade de consulta reversa em sua prosa, mas a página chinesa da Academia Ziyuan é mais clara: ela chama o processo completo de “双向DNS解析认证” (autenticação de resolução DNS bidirecional) e o divide em “第一步:DNS反查IP” (Etapa 1: consultar o IP reversamente) e “第二步:对域名运行正向DNS查找” (Etapa 2: executar uma consulta DNS direta no hostname). Esse é o método completo e correto — consulte o IP reversamente para confirmar um hostname *.baidu.com/*.baidu.jp, depois consulte esse hostname diretamente e confirme que ele resolve de volta para o mesmo IP. É a mesma abordagem de duas etapas usada para verificar o Googlebot ou o Bingbot — os comandos estão na aba Scripts.

Baiduspider e robots.txt

O Baidu faz uma afirmação de conformidade excepcionalmente forte e citável em sua própria FAQ:

Baidu strictly complies with robots.txt protocol. (tradução) «O Baidu segue estritamente o protocolo robots.txt.»

E ele oferece os controles padrão esperados. Segundo o material da Academia Ziyuan, o Baiduspider aceita correspondência com curingas usando * e $ nos caminhos de robots.txt (em paridade com Google e Bing) e faz correspondência de caminhos exata e sensível a maiúsculas e minúsculas. Você pode definir regras por user-agent — a FAQ do Baidu traz exemplos funcionais, incluindo este que bloqueia tudo para o Baiduspider geral, mas permite que o crawler de imagens entre em /image/:

User-agent: Baiduspider
Disallow: /
User-agent: Baiduspider-image
Allow: /image/

(O Baidu também observa que o Baiduspider-video atualmente não aceita essas regras.)

A exceção nomeada à “conformidade estrita”

A tensão interessante: o Baidu afirma conformidade estrita, mas documenta uma exceção oficial e nomeada. Baiduspider-cpro (o crawler da rede de anúncios) e Baiduspider-ads (pesquisa comercial) operam sob acordos comerciais separados e ignoram robots.txt por design. Literalmente na FAQ: “Baiduspider-cpro will not work on the records set by robots.txt” (tradução) «o Baiduspider-cpro não seguirá as regras definidas pelo robots.txt», e o mesmo vale para -ads. Portanto, a formulação honesta não é o vago “o Baidu nem sempre respeita robots.txt” que aparece em sites agregadores — é que os crawlers padrão do Baidu estão em conformidade, com dois crawlers de anúncios contratualmente isentos como a única exceção concreta e documentada.

Há um ponto separado e mais específico que é fácil de confundir: o Baiduspider não respeita a diretiva fora do padrão crawl-delay. Abby Hamilton, do Search Engine Journal, documentou isso em O guia moderno de robots.txt (nov. de 2024) — a tabela de comparação de crawlers lista “Baidu | Baiduspider | No” (tradução) «Baidu | Baiduspider | Não» para o suporte a crawl-delay (o YandexBot do Yandex, em contraste, aparece como “Yes” (tradução) «Sim»). Essa é uma afirmação diferente da conformidade com Allow/Disallow padrão e vale mantê-la separada para não contradizer acidentalmente a afirmação do próprio Baidu sobre robots.txt.

Um exemplo real: o robots.txt do próprio baidu.com

O Baidu pratica segmentação de robots.txt em seu próprio domínio. Seu robots.txt ao vivo fornece ao próprio Baiduspider uma lista de proibições mais curta do que a fornecida ao Googlebot, ao MSNBot, ao Sogou e ao Youdao (que adicionalmente recebem bloqueios para /shifen/, /homepage/ e /cpro), e bloqueia tudo (Disallow: /) para qualquer user-agent não nomeado por padrão:

User-agent: Baiduspider
Disallow: /baidu
Disallow: /s?
Disallow: /ulink?
Disallow: /link?
Disallow: /home/news/data/
Disallow: /bh

Um detalhe operacional da FAQ que vale conhecer ao editar regras: se você tornar o robots.txt mais restritivo depois que o Baidu já tiver indexado um site, “it usually takes 48 hours for the updated robots.txt to take effect.” (tradução) «normalmente são necessárias 48 horas para que o robots.txt atualizado entre em vigor».

O Baiduspider renderiza JavaScript?

Esta é a maior limitação prática do Baiduspider em relação ao Googlebot, e vale ser preciso sobre o que é oficial e o que não é. A FAQ do Baidu em inglês não aborda renderização de JavaScript de forma alguma — não há uma especificação de capacidade como a que o Google publica para o Googlebot. O que temos em vez disso são testes consistentes do setor. Dan Taylor resumiu isso de forma direta no comparativo entre Google e Baidu do Search Engine Journal (mar. de 2021): “Baidu is notoriously bad when it comes to crawling JavaScript, so make sure that all your important content and links are served in plain HTML on both the mobile and desktop versions of your website.” (tradução) «O Baidu é notoriamente ruim para rastrear JavaScript; por isso, garanta que todo o conteúdo e todos os links importantes sejam entregues em HTML simples tanto na versão mobile quanto na versão desktop do site.»

Isso está alinhado com a posição que este site já adota. Nossa cobertura de SEO de Contentful observa que Bing, Yandex e Baidu “may not index [client-side-rendered JS] at all,” (tradução) «talvez não indexem [JS renderizado no lado do cliente] de forma alguma», e que a renderização dinâmica está obsoleta como técnica geral para o Google. Coloque os três grandes crawlers em um espectro: o Googlebot faz renderização completa com Chromium evergreen, o Bingbot faz renderização sólida com Chromium/Edge e o Baiduspider é o mais fraco dos três em JavaScript — com HTML simples renderizado no servidor sendo o fallback universalmente seguro para todos.

Orientação prática para um site voltado à China: prefira renderização no servidor ou HTML estático por padrão, para que o conteúdo crítico, os links e os metadados existam na resposta inicial antes que qualquer JavaScript execute. Trate conteúdo disponível apenas no cliente como um risco de indexação especificamente para o Baidu, independentemente de ele ranquear bem no Google. Apresente SSR como uma boa prática de consenso do setor — não como uma recomendação oficial do Baidu, porque não existe uma declaração primária do Baidu sobre renderização de JS que possa ser citada.

Controlando a frequência de rastreamento do Baiduspider

O Baidu apresenta a frequência de rastreamento como ajustada pelo algoritmo, não como algo que você define diretamente. Da FAQ, literalmente:

In order to ensure the search results cover most of your pages, Baiduspider must keep the crawling at a certain level. We have been trying our best to avoid increasing the loading to your servers, and to adjust the frequency based on combined factors, such as your server’s capability, your site’s quality and the update frequency of your site. (tradução) «Para garantir que os resultados da busca cubram a maioria das suas páginas, o Baiduspider precisa manter certo nível de rastreamento. Procuramos evitar o aumento da carga nos seus servidores e ajustar a frequência conforme fatores combinados, como a capacidade do servidor, a qualidade do site e sua frequência de atualização.»

Essa é a mesma lógica de capacidade do servidor mais demanda que Google e Bing descrevem. A FAQ nomeia um formulário de feedback (webmaster.baidu.com/feedback/index) como o canal oficial para relatar rastreamento excessivo — “If you find any unreasonable access from Baiduspider, please inform us.” (tradução) «Se você identificar algum acesso desproporcional do Baiduspider, avise-nos.»

No nível do produto, a Plataforma de Recursos de Busca do Baidu (百度搜索资源平台, em ziyuan.baidu.com — o console historicamente chamado de “Baidu Webmaster Tools”) é o equivalente do Baidu ao Google Search Console e ao Bing Webmaster Tools. O manual do índice confirma uma área de produto “抓取频次” (Frequência de rastreamento) em que os proprietários de sites podem ver e limitar diretamente a taxa de rastreamento do Baiduspider, ao lado das ferramentas de robots e de diagnóstico de rastreamento. Trate o formulário de feedback como o canal oficial de escalonamento na documentação inglesa do Baidu e o painel Ziyuan de Frequência de rastreamento como o controle prático em nível de interface. (O caminho exato do menu dentro do produto fica atrás de uma conta Ziyuan autenticada; portanto, confirme a interface atual antes de citar etapas específicas.)

hreflang e outros sinais padrão do Google

Os sinais padrão para o Google não são todos transferidos para o Baidu — e esta é uma descoberta do setor e de profissionais, não algo documentado por nenhuma das empresas. A própria documentação do Google sobre versões localizadas se limita inteiramente à Busca do Google e não afirma se Baidu, Bing ou Yandex respeitam hreflang. Em nosso site, o guia de hreflang afirma claramente: o Baidu não oferece suporte a hreflang — o fallback é definir corretamente content-language e <html lang> para que o Baidu ao menos consiga ler o idioma da página. Isso é adicional ao meu trabalho de hreflang com escopo no Google (o guia de tags hreflang da Ahrefs e o estudo de 374 756 domínios, ambos discutindo apenas a implementação do Google), e não uma contradição dele.

Não existe uma cultura de representantes em inglês — por que a FAQ é tão valiosa

Um aspecto que realmente diferencia o ecossistema do Baidu: ao contrário do Google (Gary Illyes, John Mueller), do Bing (Fabrice Canel) ou do Yandex, o Baidu não mantém uma cultura pública visível de perguntas e respostas com representantes em inglês. Não há um porta-voz nomeado fazendo conversas de SEO com a comunidade. A voz oficial mais clara do Baidu em inglês é a FAQ institucional sem assinatura em help.baidu.com. Por isso essa FAQ — e as páginas da Academia Ziyuan em chinês por trás dela — são tão valiosas: a maior parte do conhecimento operacional sobre o Baiduspider no mundo de SEO de língua inglesa vem de testes de profissionais (análise de logs do servidor, exercícios de verificação de DNS, tentativa e erro com robots.txt), e não de comentários de representantes oficiais. Michael Bonfils resumiu a lição mais ampla no Baidu vs. Google da Search Engine Land: “SEO strategies that work for Google may not always translate directly to success on Baidu, China’s dominant search engine.” (tradução) «Estratégias de SEO que funcionam no Google nem sempre se convertem diretamente em sucesso no Baidu, o mecanismo de busca dominante da China.»

Para entender onde o Baiduspider se encaixa no panorama maior — a família de crawlers, Googlebot e Bingbot como pares, o conceito de user-agent e robots.txt — o hub de rastreamento conecta tudo, e SEO internacional é a página de referência para o contexto do mercado chinês.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.