Rastreador Baiduspider

Qué es Baiduspider: las variantes y los user-agents del rastreador de Baidu, el cumplimiento de robots.txt (y la excepción de cpro/ads), la verificación mediante DNS inverso, la débil renderización de JS y el control del rastreo en Ziyuan.

Publicado por primera vez: 3 jul 2026 · Última actualización: 11 ago 2026 · Avanzado
Idiomas
1 señal de evidencia en esta página

Baiduspider es el rastreador web de Baidu, el equivalente del mercado chino a Googlebot y el bot que descubre, obtiene e indexa páginas para Baidu Search dentro de China continental. Ejecuta variantes con nombre que comparten una familia de tokens Baiduspider (image, video, news, favo, cpro, ads), además de una variante JavaScript Baiduspider-render que Baidu documenta solo en chino. Verifícalo mediante DNS bidireccional hacia *.baidu.com o *.baidu.jp (el user-agent se puede suplantar), porque las preguntas frecuentes de Baidu advierten de las suplantaciones. La FAQ de Baidu afirma que cumple estrictamente robots.txt, con una excepción nombrada: Baiduspider-cpro y Baiduspider-ads operan bajo acuerdos comerciales e ignoran las reglas. Su mayor limitación práctica frente a Googlebot es la débil renderización de JavaScript, por lo que el HTML renderizado en el servidor es la opción segura. Controla su frecuencia de rastreo mediante Baidu Search Resource Platform (Ziyuan).

TL;DR — Baiduspider es el rastreador de Baidu, el Googlebot del mercado chino. Ejecuta variantes con nombre que comparten la familia de tokens Baiduspider (PC/móvil generales, además de -image, -video, -news, -favo, -cpro y -ads) y una variante JavaScript Baiduspider-render que Baidu documenta solo en chino. Verifícalo mediante DNS bidireccional hacia *.baidu.com/*.baidu.jp; las preguntas frecuentes de Baidu advierten sobre las suplantaciones. Baidu afirma que “strictly complies with robots.txt protocol” (traducción) «cumple estrictamente el protocolo robots.txt», con una excepción nombrada: Baiduspider-cpro y Baiduspider-ads operan bajo acuerdos comerciales y pueden seguir reglas de acceso diferentes; además, no documenta la directiva no estándar crawl-delay como control fiable. Como el comportamiento de renderización puede cambiar, el HTML renderizado en el servidor es la opción conservadora para el contenido crítico. Verifica los controles actuales en Baidu Search Resource Platform (Ziyuan).

Evidence for this claim Baiduspider is Baidu Search's crawler and Baidu's Search Resource Platform is the authoritative place to verify current crawler guidance. Scope: Current official Baidu webmaster platform; user-agent text alone is not authentication. Confidence: medium · Verified: Baidu Search Resource Platform Evidence for this claim Crawler access directives use the standardized robots.txt protocol, but engine-specific support and verification should be checked against Baidu's current documentation. Scope: Robots Exclusion Protocol baseline, distinct from undocumented Baidu-specific behavior. Confidence: high · Verified: IETF RFC 9309: Robots Exclusion Protocol

Qué es realmente Baiduspider

Baiduspider (百度蜘蛛) es el rastreador operado por Baidu, el motor de búsqueda que domina dentro de China continental, donde Google es en gran medida inaccesible tras el Gran Cortafuegos. Su función es el flujo habitual de rastrear → indexar → servir: descubrir URL, obtener páginas y construir el índice del que se nutre Baidu Search. Las preguntas frecuentes oficiales de Baidu en inglés, “Preguntas frecuentes sobre Baiduspider”, en help.baidu.com, son uno de los pocos documentos primarios en inglés disponibles aquí y la fuente de la mayoría de las citas directas que aparecen a continuación.

La asimetría que enmarca todo: Baidu importa a nivel nacional, no global. La instantánea de China de StatCounter de junio de 2026 situó a Baidu en 47,44 %, a Bing en 23,24 %, a Haosou en 14,02 %, a Sogou en 2,62 % y a Google en solo 2,28 % (StatCounter, Search Engine Market Share China). Trátalo como una instantánea, no como una constante: las cifras de China de StatCounter oscilan significativamente de un mes a otro según la mezcla de dispositivos y la metodología (se ha informado de que Baidu varía aproximadamente entre el 40 % y el 65 % en distintas instantáneas de 2025–2026), así que vuelve a comprobar la cifra actual en lugar de citar eternamente un solo mes. La conclusión se mantiene: Baidu lidera dentro de China mientras Google lidera el resto del mundo, por lo que la optimización para Baiduspider se trata como una especialidad propia del SEO internacional y no como una ocurrencia tardía para Googlebot. Nuestro hub de SEO específico de cada mercado explica dónde encaja Baidu junto a Yandex, Naver y los demás motores regionales.

Cadenas de user-agent y variantes del rastreador

Las preguntas frecuentes de Baidu en inglés nombran directamente las variantes del rastreador. Se reproducen literalmente (y sí, el propio texto de Baidu repite “Baiduspider” para PC y móvil en vez de proporcionar cadenas diferentes):

Name of Products | User-agent PC search | Baiduspider Mobile search | Baiduspider Image search | Baiduspider-image Video search | Baiduspider-video News search | Baiduspider-news Baidu bookmark | Baiduspider-favo Union baidu | Baiduspider-cpro Business search | Baiduspider-ads other search | Baiduspider (traducción de las etiquetas) «Nombre de los productos | User-agent; búsqueda en PC | Baiduspider; búsqueda móvil | Baiduspider; búsqueda de imágenes | Baiduspider-image; búsqueda de vídeos | Baiduspider-video; búsqueda de noticias | Baiduspider-news; marcador de Baidu | Baiduspider-favo; Union baidu | Baiduspider-cpro; búsqueda empresarial | Baiduspider-ads; otras búsquedas | Baiduspider».

Por tanto, las variantes nombradas oficialmente en las preguntas frecuentes en inglés son Baiduspider-image, -video, -news, -favo (marcador), -cpro (el rastreador de la «unión» o red publicitaria) y -ads (búsqueda empresarial), todas ellas pertenecientes a la familia de tokens Baiduspider. La cadena literal de user-agent del PC general, proporcionada en el propio sitio de Baidu, es:

Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.baidu.com/search/spider.html)

El UA móvil incluye Baiduspider/2.0 dentro de una cadena Android WebKit. Todas las variantes declaradas apuntan a la misma URL de referencia, http://www.baidu.com/search/spider.html, el equivalente de Baidu a google.com/bot.html de Googlebot.

Baiduspider-render: la variante JS que Baidu solo documenta en chino

Aquí hay un matiz que conviene expresar bien, porque muchos artículos se equivocan: la tabla de las preguntas frecuentes en inglés no incluye una variante «Baiduspider-render», lo que ha llevado a algunas guías a considerarla simple folclore de terceros. No lo es. Baidu documenta Baiduspider-render oficialmente, pero solo en su página en chino de Ziyuan Academy, “【官方说法】只需两步,正确识别百度蜘蛛(User-Agent)” («[Declaración oficial] Dos pasos para identificar correctamente Baiduspider»). Esa página divide los UA en tres canales: 移动 (móvil), PC y 小程序 (miniprograma), y enumera un UA de renderización alternativo junto al normal:

Mozilla/5.0 (compatible; Baiduspider-render/2.0; +http://www.baidu.com/search/spider.html)

con una cadena móvil equivalente y una variante para miniprogramas (Baiduspider-render/2.0;Smartapp). Por tanto, Baiduspider-render está documentado oficialmente, solo en chino y ausente de las preguntas frecuentes en inglés. Lo que Baidu no publica es una especificación de qué hace realmente de forma diferente «-render»; a diferencia de Google, Baidu no documenta sus capacidades de renderización de JavaScript. De ahí procede el matiz sobre la renderización de JS que aparece más adelante.

Cómo verificar Baiduspider (y no un bot suplantado)

La cadena de user-agent se puede suplantar trivialmente: cualquiera puede enviar una solicitud que diga Baiduspider. Las preguntas frecuentes de Baidu advierten precisamente de ello y describen a “spammers or other trouble makers who pretend to be Baiduspider,” (traducción) «spammers u otros alborotadores que se hacen pasar por Baiduspider»; su recomendación es verificarlo mediante DNS, no mediante la cadena. En las preguntas frecuentes, literalmente:

“We recommend using reverse DNS lookup to verify Baiduspider. Verification methods are different under linux/windows/os environments.” (traducción) «Baidu recomienda verificar Baiduspider mediante una consulta DNS inversa; los métodos cambian según el sistema operativo».

Proporciona comandos específicos por sistema operativo: host en Linux, nslookup en Windows y dig -x en macOS, con ejemplos prácticos y la regla importante:

*“The hostname of Baiduspider is *.baidu.com or .baidu.jp. Others are fake hostnames.” (traducción) «El nombre de host de Baiduspider termina en *.baidu.com o *.baidu.jp; los demás son nombres de host falsos».

Los dos dominios *.baidu.com y *.baidu.jp son el matiz que hay que recordar: Baidu rastrea desde ambos espacios de nombres DNS inversos, .com y .jp, así que un nombre de host legítimo de Baiduspider puede terminar en cualquiera de ellos. (Uno de los propios ejemplos de Baidu incluso resuelve a BaiduMobaider-119-63-195-254.crawl.baidu.jp; observa «BaiduMobaider», no «Baiduspider», en ese nombre de host: es un detalle curioso de la documentación de Baidu, no un error que debas corregir en silencio).

Las preguntas frecuentes de Baidu en inglés solo explican en su prosa la parte de la búsqueda inversa, pero su página china de Ziyuan Academy es más explícita: denomina a todo el proceso “双向DNS解析认证” (autenticación de resolución DNS bidireccional) y lo divide en “第一步:DNS反查IP” (Paso 1: búsqueda DNS inversa de la IP) y “第二步:对域名运行正向DNS查找” (Paso 2: ejecutar una búsqueda DNS directa del nombre de host). Ese es el método completo y correcto: buscar la IP de forma inversa para confirmar un nombre de host *.baidu.com/*.baidu.jp, y después buscar ese nombre de host de forma directa y confirmar que vuelve a resolver a la misma IP. Es el mismo enfoque de dos pasos que usarías para verificar Googlebot o Bingbot; los comandos están en la pestaña Scripts.

Baiduspider y robots.txt

Baidu hace en sus propias preguntas frecuentes una afirmación de cumplimiento inusualmente contundente y fácil de citar:

“Baidu strictly complies with robots.txt protocol.” (traducción) «Según Baidu, el rastreador cumple estrictamente el protocolo robots.txt».

También admite los controles estándar esperables. Según el material de Ziyuan Academy de Baidu, Baiduspider admite la coincidencia mediante comodines con * y $ en las rutas de robots.txt (al nivel de Google y Bing) y realiza una coincidencia de rutas exacta y sensible a mayúsculas y minúsculas. Puedes definir reglas por user-agent; las preguntas frecuentes de Baidu ofrecen ejemplos prácticos, incluido este que bloquea todo para Baiduspider general, pero permite que el rastreador de imágenes entre en /image/:

User-agent: Baiduspider
Disallow: /
User-agent: Baiduspider-image
Allow: /image/

(Baidu también señala que Baiduspider-video no admite actualmente estas reglas.)

La excepción nombrada al «cumplimiento estricto»

La tensión interesante es que Baidu afirma cumplir estrictamente, pero documenta una excepción oficial y nombrada. Baiduspider-cpro (el rastreador de la red publicitaria) y Baiduspider-ads (la búsqueda empresarial) operan bajo acuerdos comerciales independientes y ignoran robots.txt por diseño. Las preguntas frecuentes dicen literalmente: “Baiduspider-cpro will not work on the records set by robots.txt” (traducción) «Baiduspider-cpro no funcionará con los registros establecidos por robots.txt», y lo mismo se aplica a -ads. Por tanto, la formulación honesta no es el vago «Baidu no siempre respeta robots.txt» que se ve en sitios agregadores, sino que los rastreadores estándar de Baidu cumplen las reglas, con dos rastreadores publicitarios exentos contractualmente como única salvedad concreta documentada.

Hay otro punto más limitado que es fácil de mezclar con el anterior: Baiduspider no respeta la directiva no estándar crawl-delay. Abby Hamilton, de Search Engine Journal, lo documentó en The Modern Guide To Robots.txt (noviembre de 2024); su tabla comparativa de rastreadores indica «Baidu | Baiduspider | No» para la compatibilidad con crawl-delay (YandexBot de Yandex, en cambio, aparece como «Yes»). Esa afirmación es distinta de la compatibilidad con Allow/Disallow estándar, y conviene mantenerlas separadas para no contradecir accidentalmente la afirmación de Baidu sobre robots.txt.

Un ejemplo real: el robots.txt del propio baidu.com

Baidu practica la segmentación de robots.txt en su propio dominio. Su robots.txt activo proporciona a su propio Baiduspider una lista de prohibiciones más corta que la que proporciona a Googlebot, MSNBot, Sogou y Youdao (a estos últimos también les bloquea /shifen/, /homepage/ y /cpro), y bloquea todo (Disallow: /) para cualquier user-agent no nombrado por defecto:

User-agent: Baiduspider
Disallow: /baidu
Disallow: /s?
Disallow: /ulink?
Disallow: /link?
Disallow: /home/news/data/
Disallow: /bh

Hay un detalle operativo de las preguntas frecuentes que conviene conocer al editar reglas: si endureces robots.txt después de que Baidu ya haya indexado un sitio, “it usually takes 48 hours for the updated robots.txt to take effect.” (traducción) «normalmente se tarda 48 horas en aplicar el robots.txt actualizado».

¿Baiduspider renderiza JavaScript?

Esta es la mayor limitación práctica de Baiduspider frente a Googlebot, y conviene ser precisos sobre qué está documentado oficialmente y qué no. Las preguntas frecuentes de Baidu en inglés no abordan la renderización de JavaScript en absoluto: no existe una especificación de capacidades como la que Google publica para Googlebot. Lo que tenemos en su lugar son pruebas coherentes de la industria. Dan Taylor lo expresó claramente en su comparación de Google frente a Baidu de Search Engine Journal (marzo de 2021): “Baidu is notoriously bad when it comes to crawling JavaScript, so make sure that all your important content and links are served in plain HTML on both the mobile and desktop versions of your website.” (traducción) «Baidu es notoriamente malo al rastrear JavaScript, así que asegúrate de que todo tu contenido y tus enlaces importantes se sirvan en HTML plano tanto en la versión móvil como en la de escritorio de tu sitio web».

Eso coincide con la postura que ya adopta este sitio. Nuestra cobertura de SEO para Contentful señala que Bing, Yandex y Baidu “may not index [client-side-rendered JS] at all,” (traducción) «pueden no indexar en absoluto el JavaScript renderizado en el cliente», y que la renderización dinámica está obsoleta como técnica general para Google. Coloca los tres grandes rastreadores en una escala: Googlebot realiza una renderización completa con Chromium evergreen, Bingbot realiza una renderización sólida con Chromium/Edge y Baiduspider es el más débil de los tres con JavaScript, por lo que el HTML plano renderizado en el servidor es la alternativa segura universal para todos ellos.

Consejo práctico para un sitio orientado a China: usa por defecto renderización en el servidor o HTML estático para que el contenido crítico, los enlaces y los metadatos existan en la respuesta inicial antes de que se ejecute JavaScript. Trata el contenido que solo existe en el cliente como un riesgo de indexación específico para Baidu, independientemente de que se posicione bien en Google. Presenta SSR como una buena práctica respaldada por el consenso de la industria, no como una recomendación oficial de Baidu, porque no existe ninguna declaración primaria de Baidu sobre la renderización de JS que pueda citarse.

Cómo controlar la frecuencia de rastreo de Baiduspider

Baidu presenta la frecuencia de rastreo como autoajustada algorítmicamente, no como algo que configures directamente. En las preguntas frecuentes, literalmente:

“In order to ensure the search results cover most of your pages, Baiduspider must keep the crawling at a certain level. We have been trying our best to avoid increasing the loading to your servers, and to adjust the frequency based on combined factors, such as your server’s capability, your site’s quality and the update frequency of your site.” (traducción) «Para garantizar que los resultados de búsqueda cubran la mayoría de tus páginas, Baiduspider debe mantener el rastreo en cierto nivel. Hemos intentado por todos los medios evitar aumentar la carga de tus servidores y ajustar la frecuencia basándonos en factores combinados, como la capacidad de tu servidor, la calidad de tu sitio y la frecuencia de actualización de tu sitio».

Es la misma lógica de capacidad del servidor más demanda que describen Google y Bing. Las preguntas frecuentes nombran un formulario de comentarios (webmaster.baidu.com/feedback/index) como mecanismo oficial para informar de un rastreo excesivo: “If you find any unreasonable access from Baiduspider, please inform us.” (traducción) «Si detectas un acceso no razonable de Baiduspider, infórmanos».

A nivel de producto, Baidu Search Resource Platform (百度搜索资源平台, en ziyuan.baidu.com, la consola históricamente llamada «Baidu Webmaster Tools») es el equivalente de Baidu a Google Search Console y Bing Webmaster Tools. Su índice de manuales confirma un área de producto «抓取频次» (frecuencia de rastreo) donde los propietarios de sitios pueden consultar y limitar directamente la tasa de rastreo de Baiduspider, junto con herramientas de robots y diagnóstico del rastreo. Trata el formulario de comentarios como la vía oficial de escalado en la documentación inglesa de Baidu y el panel de frecuencia de rastreo de Ziyuan como el control práctico a nivel de interfaz. (La ruta exacta del menú dentro del producto está detrás de una cuenta de Ziyuan con sesión iniciada, así que confirma allí la interfaz actual antes de citar pasos específicos).

hreflang y otras señales estándar de Google

Las señales estándar de Google no se trasladan todas a Baidu, y esto es un hallazgo de la industria y de los profesionales, no algo que documente ninguna de las dos empresas. La propia documentación de Google sobre versiones localizadas se limita por completo a Google Search y no afirma si Baidu, Bing o Yandex respetan hreflang. En este sitio, nuestra guía de hreflang lo dice claramente: Baidu no admite hreflang; la alternativa es establecer correctamente content-language y <html lang> para que Baidu pueda al menos leer el idioma de la página. Eso complementa mi trabajo sobre hreflang específico de Google (la guía de etiquetas hreflang de Ahrefs y el estudio de 374 756 dominios, ambos centrados únicamente en la implementación de Google), en lugar de contradecirlo.

No hay una cultura de representantes en inglés: por qué las preguntas frecuentes son tan valiosas

Algo que realmente distingue al ecosistema de Baidu es que, a diferencia de Google (Gary Illyes, John Mueller), Bing (Fabrice Canel) o Yandex, Baidu no mantiene una cultura visible de preguntas y respuestas públicas con representantes en inglés. No hay un portavoz identificado que participe en conversaciones de SEO con la comunidad. La voz oficial más clara de Baidu en inglés es la de las preguntas frecuentes institucionales y sin firma de help.baidu.com. Por eso esas preguntas frecuentes, junto con las páginas en chino de Ziyuan Academy que hay detrás, son tan valiosas: la mayor parte del conocimiento operativo sobre Baiduspider en el mundo del SEO en inglés procede de pruebas de profesionales (análisis de logs del servidor, ejercicios de verificación DNS y ensayo y error con robots.txt), no de comentarios de representantes oficiales. Michael Bonfils resumió la lección general en Baidu frente a Google de Search Engine Land: “SEO strategies that work for Google may not always translate directly to success on Baidu, China’s dominant search engine.” (traducción) «Las estrategias de SEO que funcionan para Google no siempre se traducen directamente en éxito en Baidu, el motor de búsqueda dominante de China».

Para entender dónde encaja Baiduspider en el panorama general —la familia de rastreadores, Googlebot y Bingbot como pares, el concepto de user-agent y robots.txt—, el hub de rastreo lo conecta todo, y el SEO internacional es el lugar del contexto del mercado chino.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.