Rastreador Baiduspider
Qué es Baiduspider: las variantes y los user-agents del rastreador de Baidu, el cumplimiento de robots.txt (y la excepción de cpro/ads), la verificación mediante DNS inverso, la débil renderización de JS y el control del rastreo en Ziyuan.
Idiomas
1 señal de evidencia en esta página
- Herramienta activa relacionadaDNS Checker
Baiduspider es el rastreador web de Baidu, el equivalente del mercado chino a Googlebot y el bot que descubre, obtiene e indexa páginas para Baidu Search dentro de China continental. Ejecuta variantes con nombre que comparten una familia de tokens Baiduspider (image, video, news, favo, cpro, ads), además de una variante JavaScript Baiduspider-render que Baidu documenta solo en chino. Verifícalo mediante DNS bidireccional hacia *.baidu.com o *.baidu.jp (el user-agent se puede suplantar), porque las preguntas frecuentes de Baidu advierten de las suplantaciones. La FAQ de Baidu afirma que cumple estrictamente robots.txt, con una excepción nombrada: Baiduspider-cpro y Baiduspider-ads operan bajo acuerdos comerciales e ignoran las reglas. Su mayor limitación práctica frente a Googlebot es la débil renderización de JavaScript, por lo que el HTML renderizado en el servidor es la opción segura. Controla su frecuencia de rastreo mediante Baidu Search Resource Platform (Ziyuan).
Evidence for this claim Baiduspider is Baidu Search's crawler and Baidu's Search Resource Platform is the authoritative place to verify current crawler guidance. Scope: Current official Baidu webmaster platform; user-agent text alone is not authentication. Confidence: medium · Verified: Baidu Search Resource Platform Evidence for this claim Crawler access directives use the standardized robots.txt protocol, but engine-specific support and verification should be checked against Baidu's current documentation. Scope: Robots Exclusion Protocol baseline, distinct from undocumented Baidu-specific behavior. Confidence: high · Verified: IETF RFC 9309: Robots Exclusion ProtocolTL;DR — Baiduspider es el rastreador web de Baidu: el bot que visita tus páginas y las descarga para Baidu Search. Si China continental es un mercado importante, debes incluir Baiduspider en tu monitorización del rastreo. Consulta la documentación actual para webmasters de Baidu antes de confiar en comportamientos específicos del motor, especialmente en lo relativo a la renderización de JavaScript y los controles del rastreador.
Qué es Baiduspider
Google no funciona dentro de China continental. Baidu sí: es el motor de búsqueda que utiliza la mayoría de la población, y Baiduspider es su rastreador. Cuando Baiduspider visita tu sitio, sigue enlaces, lee tu sitemap, descarga tus páginas y las entrega para construir el índice de Baidu, la base de datos de la que Baidu obtiene resultados cuando alguien hace una búsqueda. Si Baiduspider no puede llegar a una página y leerla, esa página no aparecerá en Baidu.
En palabras de Baidu (de sus preguntas frecuentes oficiales en inglés): “Baiduspider is Baidu search engine program which is used to visit pages on the internet and build information into Baidu index. This enables users to locate your site when they perform a search.” (traducción) «Baiduspider es el programa del motor de búsqueda de Baidu que visita páginas de internet e incorpora información al índice de Baidu; así, los usuarios pueden encontrar tu sitio cuando hacen una búsqueda». Ese es el mismo trabajo que hace Googlebot para Google y Bingbot para Bing.
Por qué puede importarte
Baiduspider solo importa de verdad si quieres que te encuentren dentro de China continental. Baidu sigue liderando allí mientras Google apenas tiene presencia, así que un sitio orientado a China (o un sitio global con audiencia china) necesita Baiduspider del mismo modo que un sitio occidental necesita Googlebot. Si no atiendes a clientes en China, Baiduspider no es más que otro bot que llega a tu servidor, y algunos sitios optan por bloquearlo para ahorrar recursos.
El inconveniente: Baiduspider funciona mal con JavaScript
Este es el punto principal. Googlebot ejecuta una versión moderna de Chrome y lee bien la mayoría de los sitios con mucho JavaScript. Baiduspider no: se ha informado ampliamente de que ejecuta JavaScript mal. Si tu contenido o tus enlaces importantes solo aparecen después de ejecutar JavaScript, es posible que Baidu nunca los vea, aunque la misma página se posicione bien en Google. La opción segura para un sitio orientado a China es asegurarte de que el contenido real esté en el HTML plano que llega antes de que se ejecute JavaScript.
Cómo ayudar a Baiduspider (o detenerlo)
- Para dejarlo entrar: enlaza tus páginas importantes, envía un sitemap en Baidu Search Resource Platform (la versión de Baidu de Search Console) y no bloquees accidentalmente esas páginas en
robots.txt. - Para mantenerlo fuera de partes de tu sitio: utiliza
robots.txt; Baidu dice que allí sigue las reglas estándar. - Para ralentizarlo: Baidu Search Resource Platform tiene un área de frecuencia de rastreo donde puedes ver cuánto rastrea Baiduspider y limitarlo.
¿Quieres la versión técnica: las cadenas exactas de user-agent, cómo verificar un Baiduspider real, las particularidades de robots.txt y los controles de frecuencia de rastreo? Cambia a la pestaña Avanzado.
Evidence for this claim Baiduspider is Baidu Search's crawler and Baidu's Search Resource Platform is the authoritative place to verify current crawler guidance. Scope: Current official Baidu webmaster platform; user-agent text alone is not authentication. Confidence: medium · Verified: Baidu Search Resource Platform Evidence for this claim Crawler access directives use the standardized robots.txt protocol, but engine-specific support and verification should be checked against Baidu's current documentation. Scope: Robots Exclusion Protocol baseline, distinct from undocumented Baidu-specific behavior. Confidence: high · Verified: IETF RFC 9309: Robots Exclusion ProtocolTL;DR — Baiduspider es el rastreador de Baidu, el Googlebot del mercado chino. Ejecuta variantes con nombre que comparten la familia de tokens
Baiduspider(PC/móvil generales, además de-image,-video,-news,-favo,-cproy-ads) y una variante JavaScriptBaiduspider-renderque Baidu documenta solo en chino. Verifícalo mediante DNS bidireccional hacia*.baidu.com/*.baidu.jp; las preguntas frecuentes de Baidu advierten sobre las suplantaciones. Baidu afirma que “strictly complies with robots.txt protocol” (traducción) «cumple estrictamente el protocolo robots.txt», con una excepción nombrada:Baiduspider-cproyBaiduspider-adsoperan bajo acuerdos comerciales y pueden seguir reglas de acceso diferentes; además, no documenta la directiva no estándarcrawl-delaycomo control fiable. Como el comportamiento de renderización puede cambiar, el HTML renderizado en el servidor es la opción conservadora para el contenido crítico. Verifica los controles actuales en Baidu Search Resource Platform (Ziyuan).
Qué es realmente Baiduspider
Baiduspider (百度蜘蛛) es el rastreador operado por Baidu, el motor de búsqueda que domina dentro de China continental, donde Google es en gran medida inaccesible tras el Gran Cortafuegos. Su función es el flujo habitual de rastrear → indexar → servir: descubrir URL, obtener páginas y construir el índice del que se nutre Baidu Search. Las preguntas frecuentes oficiales de Baidu en inglés, “Preguntas frecuentes sobre Baiduspider”, en help.baidu.com, son uno de los pocos documentos primarios en inglés disponibles aquí y la fuente de la mayoría de las citas directas que aparecen a continuación.
La asimetría que enmarca todo: Baidu importa a nivel nacional, no global. La instantánea de China de StatCounter de junio de 2026 situó a Baidu en 47,44 %, a Bing en 23,24 %, a Haosou en 14,02 %, a Sogou en 2,62 % y a Google en solo 2,28 % (StatCounter, Search Engine Market Share China). Trátalo como una instantánea, no como una constante: las cifras de China de StatCounter oscilan significativamente de un mes a otro según la mezcla de dispositivos y la metodología (se ha informado de que Baidu varía aproximadamente entre el 40 % y el 65 % en distintas instantáneas de 2025–2026), así que vuelve a comprobar la cifra actual en lugar de citar eternamente un solo mes. La conclusión se mantiene: Baidu lidera dentro de China mientras Google lidera el resto del mundo, por lo que la optimización para Baiduspider se trata como una especialidad propia del SEO internacional y no como una ocurrencia tardía para Googlebot. Nuestro hub de SEO específico de cada mercado explica dónde encaja Baidu junto a Yandex, Naver y los demás motores regionales.
Cadenas de user-agent y variantes del rastreador
Las preguntas frecuentes de Baidu en inglés nombran directamente las variantes del rastreador. Se reproducen literalmente (y sí, el propio texto de Baidu repite “Baiduspider” para PC y móvil en vez de proporcionar cadenas diferentes):
Name of Products | User-agent PC search | Baiduspider Mobile search | Baiduspider Image search | Baiduspider-image Video search | Baiduspider-video News search | Baiduspider-news Baidu bookmark | Baiduspider-favo Union baidu | Baiduspider-cpro Business search | Baiduspider-ads other search | Baiduspider (traducción de las etiquetas) «Nombre de los productos | User-agent; búsqueda en PC | Baiduspider; búsqueda móvil | Baiduspider; búsqueda de imágenes | Baiduspider-image; búsqueda de vídeos | Baiduspider-video; búsqueda de noticias | Baiduspider-news; marcador de Baidu | Baiduspider-favo; Union baidu | Baiduspider-cpro; búsqueda empresarial | Baiduspider-ads; otras búsquedas | Baiduspider».
Por tanto, las variantes nombradas oficialmente en las preguntas frecuentes en inglés son Baiduspider-image, -video, -news, -favo (marcador), -cpro (el rastreador de la «unión» o red publicitaria) y -ads (búsqueda empresarial), todas ellas pertenecientes a la familia de tokens Baiduspider. La cadena literal de user-agent del PC general, proporcionada en el propio sitio de Baidu, es:
Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.baidu.com/search/spider.html)El UA móvil incluye Baiduspider/2.0 dentro de una cadena Android WebKit. Todas las variantes declaradas apuntan a la misma URL de referencia, http://www.baidu.com/search/spider.html, el equivalente de Baidu a google.com/bot.html de Googlebot.
Baiduspider-render: la variante JS que Baidu solo documenta en chino
Aquí hay un matiz que conviene expresar bien, porque muchos artículos se equivocan: la tabla de las preguntas frecuentes en inglés no incluye una variante «Baiduspider-render», lo que ha llevado a algunas guías a considerarla simple folclore de terceros. No lo es. Baidu documenta Baiduspider-render oficialmente, pero solo en su página en chino de Ziyuan Academy, “【官方说法】只需两步,正确识别百度蜘蛛(User-Agent)” («[Declaración oficial] Dos pasos para identificar correctamente Baiduspider»). Esa página divide los UA en tres canales: 移动 (móvil), PC y 小程序 (miniprograma), y enumera un UA de renderización alternativo junto al normal:
Mozilla/5.0 (compatible; Baiduspider-render/2.0; +http://www.baidu.com/search/spider.html)con una cadena móvil equivalente y una variante para miniprogramas (Baiduspider-render/2.0;Smartapp). Por tanto, Baiduspider-render está documentado oficialmente, solo en chino y ausente de las preguntas frecuentes en inglés. Lo que Baidu no publica es una especificación de qué hace realmente de forma diferente «-render»; a diferencia de Google, Baidu no documenta sus capacidades de renderización de JavaScript. De ahí procede el matiz sobre la renderización de JS que aparece más adelante.
Cómo verificar Baiduspider (y no un bot suplantado)
La cadena de user-agent se puede suplantar trivialmente: cualquiera puede enviar una solicitud que diga Baiduspider. Las preguntas frecuentes de Baidu advierten precisamente de ello y describen a “spammers or
other trouble makers who pretend to be Baiduspider,” (traducción) «spammers u otros alborotadores que se hacen pasar por Baiduspider»; su recomendación es verificarlo mediante DNS, no mediante la cadena. En las preguntas frecuentes, literalmente:
“We recommend using reverse DNS lookup to verify Baiduspider. Verification methods are different under linux/windows/os environments.” (traducción) «Baidu recomienda verificar Baiduspider mediante una consulta DNS inversa; los métodos cambian según el sistema operativo».
Proporciona comandos específicos por sistema operativo: host en Linux, nslookup en Windows y dig -x en macOS, con ejemplos prácticos y la regla importante:
*“The hostname of Baiduspider is *.baidu.com or .baidu.jp. Others are fake hostnames.” (traducción) «El nombre de host de Baiduspider termina en *.baidu.com o *.baidu.jp; los demás son nombres de host falsos».
Los dos dominios *.baidu.com y *.baidu.jp son el matiz que hay que recordar: Baidu rastrea desde ambos espacios de nombres DNS inversos, .com y .jp, así que un nombre de host legítimo de Baiduspider puede terminar en cualquiera de ellos. (Uno de los propios ejemplos de Baidu incluso resuelve a BaiduMobaider-119-63-195-254.crawl.baidu.jp; observa «BaiduMobaider», no «Baiduspider», en ese nombre de host: es un detalle curioso de la documentación de Baidu, no un error que debas corregir en silencio).
Las preguntas frecuentes de Baidu en inglés solo explican en su prosa la parte de la búsqueda inversa, pero su página china de Ziyuan Academy es más explícita: denomina a todo el proceso “双向DNS解析认证” (autenticación de resolución DNS bidireccional) y lo divide en “第一步:DNS反查IP” (Paso 1: búsqueda DNS inversa de la IP) y “第二步:对域名运行正向DNS查找” (Paso 2: ejecutar una búsqueda DNS directa del nombre de host). Ese es el método completo y correcto: buscar la IP de forma inversa para confirmar un nombre de host *.baidu.com/*.baidu.jp, y después buscar ese nombre de host de forma directa y confirmar que vuelve a resolver a la misma IP. Es el mismo enfoque de dos pasos que usarías para verificar Googlebot o Bingbot; los comandos están en la pestaña Scripts.
Baiduspider y robots.txt
Baidu hace en sus propias preguntas frecuentes una afirmación de cumplimiento inusualmente contundente y fácil de citar:
“Baidu strictly complies with robots.txt protocol.” (traducción) «Según Baidu, el rastreador cumple estrictamente el protocolo robots.txt».
También admite los controles estándar esperables. Según el material de Ziyuan Academy de Baidu, Baiduspider admite la coincidencia mediante comodines con * y $ en las rutas de robots.txt (al nivel de Google y Bing) y realiza una coincidencia de rutas exacta y sensible a mayúsculas y minúsculas. Puedes definir reglas por user-agent; las preguntas frecuentes de Baidu ofrecen ejemplos prácticos, incluido este que bloquea todo para Baiduspider general, pero permite que el rastreador de imágenes entre en /image/:
User-agent: Baiduspider
Disallow: /
User-agent: Baiduspider-image
Allow: /image/(Baidu también señala que Baiduspider-video no admite actualmente estas reglas.)
La excepción nombrada al «cumplimiento estricto»
La tensión interesante es que Baidu afirma cumplir estrictamente, pero documenta una excepción oficial y nombrada. Baiduspider-cpro (el rastreador de la red publicitaria) y Baiduspider-ads (la búsqueda empresarial) operan bajo acuerdos comerciales independientes y ignoran robots.txt por diseño. Las preguntas frecuentes dicen literalmente: “Baiduspider-cpro will not
work on the records set by robots.txt” (traducción) «Baiduspider-cpro no funcionará con los registros establecidos por robots.txt», y lo mismo se aplica a -ads. Por tanto, la formulación honesta no es el vago «Baidu no siempre respeta robots.txt» que se ve en sitios agregadores, sino que los rastreadores estándar de Baidu cumplen las reglas, con dos rastreadores publicitarios exentos contractualmente como única salvedad concreta documentada.
Hay otro punto más limitado que es fácil de mezclar con el anterior: Baiduspider no respeta la directiva no estándar crawl-delay. Abby Hamilton, de Search Engine Journal, lo documentó en The Modern Guide To Robots.txt (noviembre de 2024); su tabla comparativa de rastreadores indica «Baidu | Baiduspider | No» para la compatibilidad con crawl-delay (YandexBot de Yandex, en cambio, aparece como «Yes»). Esa afirmación es distinta de la compatibilidad con Allow/Disallow estándar, y conviene mantenerlas separadas para no contradecir accidentalmente la afirmación de Baidu sobre robots.txt.
Un ejemplo real: el robots.txt del propio baidu.com
Baidu practica la segmentación de robots.txt en su propio dominio. Su robots.txt activo proporciona a su propio Baiduspider una lista de prohibiciones más corta que la que proporciona a Googlebot, MSNBot, Sogou y Youdao (a estos últimos también les bloquea /shifen/, /homepage/ y /cpro), y bloquea todo (Disallow: /) para cualquier user-agent no nombrado por defecto:
User-agent: Baiduspider
Disallow: /baidu
Disallow: /s?
Disallow: /ulink?
Disallow: /link?
Disallow: /home/news/data/
Disallow: /bhHay un detalle operativo de las preguntas frecuentes que conviene conocer al editar reglas: si endureces robots.txt después de que Baidu ya haya indexado un sitio, “it usually takes 48 hours for the updated robots.txt to take effect.” (traducción) «normalmente se tarda 48 horas en aplicar el robots.txt actualizado».
¿Baiduspider renderiza JavaScript?
Esta es la mayor limitación práctica de Baiduspider frente a Googlebot, y conviene ser precisos sobre qué está documentado oficialmente y qué no. Las preguntas frecuentes de Baidu en inglés no abordan la renderización de JavaScript en absoluto: no existe una especificación de capacidades como la que Google publica para Googlebot. Lo que tenemos en su lugar son pruebas coherentes de la industria. Dan Taylor lo expresó claramente en su comparación de Google frente a Baidu de Search Engine Journal (marzo de 2021): “Baidu is notoriously bad when it comes to crawling JavaScript, so make sure that all your important content and links are served in plain HTML on both the mobile and desktop versions of your website.” (traducción) «Baidu es notoriamente malo al rastrear JavaScript, así que asegúrate de que todo tu contenido y tus enlaces importantes se sirvan en HTML plano tanto en la versión móvil como en la de escritorio de tu sitio web».
Eso coincide con la postura que ya adopta este sitio. Nuestra cobertura de SEO para Contentful señala que Bing, Yandex y Baidu “may not index [client-side-rendered JS] at all,” (traducción) «pueden no indexar en absoluto el JavaScript renderizado en el cliente», y que la renderización dinámica está obsoleta como técnica general para Google. Coloca los tres grandes rastreadores en una escala: Googlebot realiza una renderización completa con Chromium evergreen, Bingbot realiza una renderización sólida con Chromium/Edge y Baiduspider es el más débil de los tres con JavaScript, por lo que el HTML plano renderizado en el servidor es la alternativa segura universal para todos ellos.
Consejo práctico para un sitio orientado a China: usa por defecto renderización en el servidor o HTML estático para que el contenido crítico, los enlaces y los metadatos existan en la respuesta inicial antes de que se ejecute JavaScript. Trata el contenido que solo existe en el cliente como un riesgo de indexación específico para Baidu, independientemente de que se posicione bien en Google. Presenta SSR como una buena práctica respaldada por el consenso de la industria, no como una recomendación oficial de Baidu, porque no existe ninguna declaración primaria de Baidu sobre la renderización de JS que pueda citarse.
Cómo controlar la frecuencia de rastreo de Baiduspider
Baidu presenta la frecuencia de rastreo como autoajustada algorítmicamente, no como algo que configures directamente. En las preguntas frecuentes, literalmente:
“In order to ensure the search results cover most of your pages, Baiduspider must keep the crawling at a certain level. We have been trying our best to avoid increasing the loading to your servers, and to adjust the frequency based on combined factors, such as your server’s capability, your site’s quality and the update frequency of your site.” (traducción) «Para garantizar que los resultados de búsqueda cubran la mayoría de tus páginas, Baiduspider debe mantener el rastreo en cierto nivel. Hemos intentado por todos los medios evitar aumentar la carga de tus servidores y ajustar la frecuencia basándonos en factores combinados, como la capacidad de tu servidor, la calidad de tu sitio y la frecuencia de actualización de tu sitio».
Es la misma lógica de capacidad del servidor más demanda que describen Google y Bing. Las preguntas frecuentes nombran un formulario de comentarios (webmaster.baidu.com/feedback/index) como mecanismo oficial para informar de un rastreo excesivo: “If you find any unreasonable access from
Baiduspider, please inform us.” (traducción) «Si detectas un acceso no razonable de Baiduspider, infórmanos».
A nivel de producto, Baidu Search Resource Platform (百度搜索资源平台, en ziyuan.baidu.com, la consola históricamente llamada «Baidu Webmaster Tools») es el equivalente de Baidu a Google Search Console y Bing Webmaster Tools. Su índice de manuales confirma un área de producto «抓取频次» (frecuencia de rastreo) donde los propietarios de sitios pueden consultar y limitar directamente la tasa de rastreo de Baiduspider, junto con herramientas de robots y diagnóstico del rastreo. Trata el formulario de comentarios como la vía oficial de escalado en la documentación inglesa de Baidu y el panel de frecuencia de rastreo de Ziyuan como el control práctico a nivel de interfaz. (La ruta exacta del menú dentro del producto está detrás de una cuenta de Ziyuan con sesión iniciada, así que confirma allí la interfaz actual antes de citar pasos específicos).
hreflang y otras señales estándar de Google
Las señales estándar de Google no se trasladan todas a Baidu, y esto es un hallazgo de la industria y de los profesionales, no algo que documente ninguna de las dos empresas. La propia documentación de Google sobre versiones localizadas se limita por completo a Google Search y no afirma si Baidu, Bing o Yandex respetan hreflang. En este sitio, nuestra guía de hreflang lo dice claramente: Baidu no admite hreflang; la alternativa es establecer correctamente content-language y <html lang> para que Baidu pueda al menos leer el idioma de la página. Eso complementa mi trabajo sobre hreflang específico de Google (la guía de etiquetas hreflang de Ahrefs y el estudio de 374 756 dominios, ambos centrados únicamente en la implementación de Google), en lugar de contradecirlo.
No hay una cultura de representantes en inglés: por qué las preguntas frecuentes son tan valiosas
Algo que realmente distingue al ecosistema de Baidu es que, a diferencia de Google (Gary Illyes, John Mueller), Bing (Fabrice Canel) o Yandex, Baidu no mantiene una cultura visible de preguntas y respuestas públicas con representantes en inglés. No hay un portavoz identificado que participe en conversaciones de SEO con la comunidad. La voz oficial más clara de Baidu en inglés es la de las preguntas frecuentes institucionales y sin firma de help.baidu.com. Por eso esas preguntas frecuentes, junto con las páginas en chino de Ziyuan Academy que hay detrás, son tan valiosas: la mayor parte del conocimiento operativo sobre Baiduspider en el mundo del SEO en inglés procede de pruebas de profesionales (análisis de logs del servidor, ejercicios de verificación DNS y ensayo y error con robots.txt), no de comentarios de representantes oficiales. Michael Bonfils resumió la lección general en Baidu frente a Google de Search Engine Land: “SEO strategies that work for Google may not always translate directly to success on
Baidu, China’s dominant search engine.” (traducción) «Las estrategias de SEO que funcionan para Google no siempre se traducen directamente en éxito en Baidu, el motor de búsqueda dominante de China».
Para entender dónde encaja Baiduspider en el panorama general —la familia de rastreadores, Googlebot y Bingbot como pares, el concepto de user-agent y robots.txt—, el hub de rastreo lo conecta todo, y el SEO internacional es el lugar del contexto del mercado chino.
Resumen de IA
Una síntesis de la versión Avanzada:
- Baiduspider = el rastreador web de Baidu: el Googlebot del mercado chino. Baidu domina dentro de China continental (StatCounter, junio de 2026: Baidu ~47 %, Google ~2 %), así que es una especialidad del SEO internacional, no una ocurrencia tardía para Googlebot. Esa cuota oscila mes a mes: trátala como una instantánea.
- Las variantes comparten la familia de tokens
Baiduspider: PC/móvil general, además de-image,-video,-news,-favo(marcador),-cpro(red publicitaria) y-ads(empresas). UA del PC general:Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.baidu.com/search/spider.html). Baiduspider-renderestá documentado oficialmente, pero solo en la página en chino de Ziyuan Academy de Baidu y no en las preguntas frecuentes en inglés. No existe una especificación de qué hace de forma diferente «-render».- Verifica mediante DNS bidireccional hacia
*.baidu.como*.baidu.jp(Baidu rastrea desde ambos): busca la IP de forma inversa y luego busca el nombre de host de forma directa hasta la misma IP. El user-agent se puede suplantar; Baidu advierte sobre ello. - robots.txt: Baidu afirma que “strictly complies” (traducción) «cumple estrictamente», admite comodines
*/$y coincidencias sensibles a mayúsculas y minúsculas, con una excepción nombrada:Baiduspider-cproyBaiduspider-adsoperan bajo acuerdos comerciales e ignoran robots.txt. Por separado, Baiduspider no respeta la directiva no estándarcrawl-delay(según Abby Hamilton, de SEJ). Los cambios de reglas tardan aproximadamente 48 horas en surtir efecto. - JavaScript es la mayor brecha frente a Googlebot: no hay una especificación oficial de capacidades; el consenso de la industria (Dan Taylor: “notoriously bad… crawling JavaScript” (traducción) «notoriamente malo al rastrear JavaScript») considera que el HTML renderizado en servidor o estático es la opción segura para sitios orientados a China.
- La frecuencia de rastreo es algorítmica (capacidad del servidor + calidad del sitio + frecuencia de actualización); informa del rastreo excesivo mediante el formulario de comentarios de Baidu y consulta y limita la tasa en Baidu Search Resource Platform (Ziyuan), el equivalente de Search Console de Baidu.
- Baidu no admite hreflang (hallazgo de la industria; ninguna de las dos empresas se pronuncia en un sentido u otro), así que usa
content-language/<html lang>como alternativa. - No hay una cultura de representantes en inglés: la voz oficial más clara de Baidu es un documento de preguntas frecuentes sin firma, por lo que las pruebas de profesionales aportan la mayor parte del conocimiento operativo.
Documentación oficial
Documentación de fuentes primarias. La de Baidu está dividida entre unas preguntas frecuentes en inglés y las páginas en chino de Ziyuan (Baidu Search Resource Platform); los enlaces de Google sirven para contrastar la intersección de hreflang.
Baidu
- Preguntas frecuentes sobre Baiduspider (help.baidu.com) — preguntas frecuentes oficiales de Baidu en inglés: qué es Baiduspider, la tabla de user-agents, la política de frecuencia de rastreo, la verificación DNS con ejemplos prácticos y el tratamiento de robots.txt. La fuente primaria en inglés.
- 【官方说法】只需两步,正确识别百度蜘蛛(User-Agent)(ziyuan.baidu.com) — artículo oficial de Baidu en chino sobre la identificación de Baiduspider: los tres canales de UA (móvil/PC/miniprograma), los UA
Baiduspider-rendery el método de «autenticación DNS bidireccional» explicado en su totalidad. - Índice de manuales de la plataforma de recursos de búsqueda de Baidu (ziyuan.baidu.com) — índice de manuales del producto Ziyuan que confirma las áreas de herramientas de 抓取频次 (frecuencia de rastreo), robots y 抓取诊断 (diagnóstico del rastreo).
- baidu.com/robots.txt — robots.txt activo del propio Baidu, un ejemplo real de segmentación por rastreador.
Google (para contrastar la intersección de hreflang)
- Informa a Google de las versiones localizadas de tu página — documentación de Google sobre hreflang, limitada por completo a Google Search; destaca que no dice nada sobre si Baidu, Bing o Yandex respetan hreflang.
Citas de la fuente
Baidu no mantiene ningún portavoz de habla inglesa identificado, así que la «fuente» aquí son las propias preguntas frecuentes de Baidu, junto con comentarios de profesionales identificados que representan las citas de representantes que obtendrías de Google o Bing. Cada enlace es un enlace profundo que salta al pasaje citado.
Baidu — «FAQs of Baiduspider» (help.baidu.com, inglés)
- “Baiduspider is Baidu search engine program which is used to visit pages on the internet and build information into Baidu index. This enables users to locate your site when they perform a search.” (traducción) «Baiduspider es el programa del motor de búsqueda de Baidu que se utiliza para visitar páginas en internet e incorporar información al índice de Baidu. Esto permite a los usuarios encontrar tu sitio cuando realizan una búsqueda». Saltar a la cita
- “In order to ensure the search results cover most of your pages, Baiduspider must keep the crawling at a certain level… to adjust the frequency based on combined factors, such as your server’s capability, your site’s quality and the update frequency of your site.” (traducción) «Para garantizar que los resultados de búsqueda cubran la mayoría de tus páginas, Baiduspider debe mantener el rastreo en cierto nivel… y ajustar la frecuencia basándose en factores combinados, como la capacidad de tu servidor, la calidad de tu sitio y la frecuencia de actualización de tu sitio». Saltar a la cita
- “We recommend using reverse DNS lookup to verify Baiduspider.” (traducción) «Recomendamos utilizar una búsqueda DNS inversa para verificar Baiduspider». Saltar a la cita
- *“The hostname of Baiduspider is *.baidu.com or .baidu.jp. Others are fake hostnames.” (traducción) «El nombre de host de Baiduspider es *.baidu.com o *.baidu.jp. Los demás nombres de host son falsos». Saltar a la cita
- “Baidu strictly complies with robots.txt protocol.” (traducción) «Baidu cumple estrictamente el protocolo robots.txt». Saltar a la cita
Baidu — Ziyuan Academy (ziyuan.baidu.com, chino)
- Original: “二、双向DNS解析认证” — paráfrasis en inglés: «Step two: bidirectional DNS resolution authentication» (traducción) «Paso dos: autenticación de resolución DNS bidireccional», el nombre que Baidu da a la verificación de Baiduspider mediante una búsqueda inversa seguida de una búsqueda directa que vuelve a la misma IP. Ver la página
Dan Taylor, Search Engine Journal — sobre JavaScript
- “Baidu is notoriously bad when it comes to crawling JavaScript, so make sure that all your important content and links are served in plain HTML on both the mobile and desktop versions of your website.” (traducción) «Baidu es notoriamente malo al rastrear JavaScript, así que asegúrate de que todo tu contenido y tus enlaces importantes se sirvan en HTML plano tanto en la versión móvil como en la de escritorio de tu sitio web» (marzo de 2021). Saltar a la cita
Michael Bonfils, Search Engine Land — sobre la transferencia de estrategias
- “SEO strategies that work for Google may not always translate directly to success on Baidu, China’s dominant search engine.” (traducción) «Las estrategias de SEO que funcionan para Google no siempre se traducen directamente en éxito en Baidu, el motor de búsqueda dominante de China». Saltar a la cita
Abby Hamilton, Search Engine Journal — sobre crawl-delay
- Su tabla comparativa de rastreadores indica que Baiduspider no admite la directiva no estándar
crawl-delay(«Baidu | Baiduspider | No»). (noviembre de 2024). Leer la cobertura
help.baidu.com se renderizan parcialmente mediante JavaScript y la página de Ziyuan Academy está solo en chino; las citas en inglés anteriores se confirmaron como subcadenas exactas de las páginas activas, pero debes confirmarlas con las páginas activas (y usar un navegador para las fuentes renderizadas con JS o en chino) antes de tratarlas como definitivas. ¿Debería dejar que Baiduspider rastree mi sitio y cómo debo gestionarlo?
Baiduspider solo merece el esfuerzo si realmente quieres visibilidad en el mercado chino. Haz clic para continuar.
Deciding what to do about Baiduspider
Verifica que un bot sea realmente Baiduspider
Las propias preguntas frecuentes de Baidu recomiendan el DNS inverso para verificar Baiduspider, porque la cadena de user-agent se puede suplantar trivialmente. Haz la comprobación bidireccional completa que Baidu nombra en su página china de Ziyuan: busca la IP de forma inversa (el nombre de host debe terminar en *.baidu.com o *.baidu.jp) y después busca ese nombre de host de forma directa hasta volver a la misma IP.
macOS / Linux
# 1) Reverse-DNS the IP from your logs — it must end in baidu.com or baidu.jp
host 123.125.66.120
# → 120.66.125.123.in-addr.arpa domain name pointer Baiduspider-123-125-66-120.crawl.baidu.com
# 2) Forward-DNS that hostname back — it must resolve to the same IP
host Baiduspider-123-125-66-120.crawl.baidu.com
# → Baiduspider-123-125-66-120.crawl.baidu.com has address 123.125.66.120Formato dig de macOS (tal como lo proporciona la FAQ de Baidu):
dig -x 123.125.66.120Windows
nslookup 123.125.66.120
nslookup Baiduspider-123-125-66-120.crawl.baidu.comSi la búsqueda inversa no termina en baidu.com o baidu.jp, o si la búsqueda directa no devuelve la IP original, no es Baiduspider: descártalo o limita su velocidad. (Es el mismo enfoque de dos pasos que al verificar Googlebot y Bingbot; consulta las pestañas Scripts de esos artículos para ver las versiones de Google y Bing).
Extrae solo las visitas de Baiduspider de los logs de tu servidor
Extrae de un log de acceso las líneas candidatas a ser de Baiduspider y después verifica cada IP con la comprobación DNS anterior; no confíes solo en la cadena.
# Extract lines whose user-agent claims to be Baiduspider, print unique IPs
grep -i 'baiduspider' /var/log/nginx/access.log \
| awk '{print $1}' | sort -uComprueba un nombre de host frente a los dominios permitidos de Baidu (regex)
Una vez que hayas resuelto un nombre de host mediante DNS inverso, esta expresión regular confirma que pertenece a uno de los dos espacios de nombres legítimos de rastreadores de Baidu (.baidu.com o .baidu.jp) y no a una imitación:
# Passes only for hostnames ending in .baidu.com or .baidu.jp
echo "Baiduspider-123-125-66-120.crawl.baidu.com" \
| grep -Eiq '\.baidu\.(com|jp)$' && echo "legit namespace" || echo "FAKE"Cuidado con imitaciones como baidu.com.evil.example: anclar el patrón al final de la cadena ($) es lo que impide que pasen.
Un punto de partida para robots.txt de Baiduspider
# Let Baiduspider crawl everything except low-value spaces
User-agent: Baiduspider
Disallow: /search
Disallow: /*?*sort=
# Block Baiduspider entirely (China not a target market)
# User-agent: Baiduspider
# Disallow: /Recuerda: Disallow controla el rastreo, no la indexación, y los cambios de reglas tardan aproximadamente 48 horas en surtir efecto. Los rastreadores publicitarios Baiduspider-cpro y Baiduspider-ads ignoran robots.txt por diseño.
Baiduspider: hoja de referencia rápida
Cadenas de user-agent y variantes del rastreador
| Variante | Token de robots.txt | User-agent |
|---|---|---|
| General (PC + móvil) | Baiduspider | Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.baidu.com/search/spider.html) |
| Búsqueda de imágenes | Baiduspider-image | Comparte el token de la familia Baiduspider, con el sufijo -image |
| Búsqueda de vídeos | Baiduspider-video | Sufijo -video (actualmente no admite reglas de robots.txt por agente) |
| Búsqueda de noticias | Baiduspider-news | Sufijo -news |
| Marcador de Baidu | Baiduspider-favo | Sufijo -favo |
| Union baidu (red publicitaria) | Baiduspider-cpro | Sufijo -cpro: ignora robots.txt por acuerdo comercial |
| Búsqueda empresarial | Baiduspider-ads | Sufijo -ads: ignora robots.txt por acuerdo comercial |
| Render (variante JS) | — | Mozilla/5.0 (compatible; Baiduspider-render/2.0; +http://www.baidu.com/search/spider.html): documentada solo en la página en chino de Ziyuan Academy de Baidu y ausente de las preguntas frecuentes en inglés |
El UA de cada variante declarada apunta a la misma URL de referencia, http://www.baidu.com/search/spider.html, el equivalente de Baiduspider a google.com/bot.html de Googlebot.
Cumplimiento de robots.txt de un vistazo
| Rastreador | ¿Sigue robots.txt? |
|---|---|
Baiduspider general, -image, -video, -news, -favo | Sí: las preguntas frecuentes de Baidu afirman “Baidu strictly complies with robots.txt protocol” (traducción) «Baidu cumple estrictamente el protocolo robots.txt» |
Baiduspider-cpro | No: excepción nombrada y documentada (acuerdo comercial) |
Baiduspider-ads | No: excepción nombrada y documentada (acuerdo comercial) |
Directiva no estándar crawl-delay | Ninguna variante de Baiduspider la respeta, según Abby Hamilton, de Search Engine Journal |
Datos rápidos
- Verifica mediante DNS bidireccional: busca de forma inversa la IP que rastrea para confirmar un nombre de host que termine en
*.baidu.como*.baidu.jp, y después busca ese nombre de host de forma directa hasta volver a la misma IP. La cadena de user-agent por sí sola no demuestra nada. - Los cambios de robots.txt tardan aproximadamente 48 horas en surtir efecto en un sitio ya indexado.
- Baidu admite coincidencias mediante comodines
*y$en las rutas de robots.txt y realiza coincidencias exactas sensibles a mayúsculas y minúsculas. - La frecuencia de rastreo se autoajusta algorítmicamente (capacidad del servidor, calidad del sitio y frecuencia de actualización): puedes consultarla y limitarla en Baidu Search Resource Platform (Ziyuan).
- La mayor carencia práctica de Baiduspider frente a Googlebot es la débil renderización de JavaScript: el HTML renderizado en el servidor o estático es la opción segura para contenido orientado a China.
- Baidu no admite hreflang: la señal alternativa es un
content-languagey un<html lang>correctos.
Lista de comprobación de preparación para Baiduspider
Una comprobación rápida para confirmar que estás trabajando con Baiduspider y no accidentalmente contra él: el mismo terreno cubierto en la pestaña Avanzado, presentado como lista de comprobación.
- robots.txt no bloquea
Baiduspider(ni la variante que te interese) para nada que quieras que aparezca en los resultados de búsqueda de Baidu. - Se ha enviado un sitemap en Baidu Search Resource Platform (Ziyuan).
- La verificación del bot utiliza DNS bidireccional: búsqueda inversa hacia
*.baidu.com/*.baidu.jpy después una búsqueda directa que confirma la misma IP; nunca solo la cadena de user-agent. - Sabes que
Baiduspider-cproyBaiduspider-adsignoran robots.txt por diseño, así que bloquearlos allí no los detendrá. - Cualquier endurecimiento reciente de robots.txt ha tenido aproximadamente 48 horas para propagarse antes de volver a comprobar el estado de indexación.
- El contenido crítico, los enlaces internos y los metadatos existen en la respuesta HTML renderizada en el servidor, no están inyectados únicamente mediante JavaScript del cliente.
-
content-languagey<html lang>están configurados correctamente, porque Baidu no admite hreflang. - La carga de rastreo se ha revisado en el área Crawl Frequency (抓取频次) de Ziyuan si el tráfico de Baiduspider está sobrecargando el servidor.
- El rastreo no razonable o excesivo se ha comunicado mediante el formulario de comentarios de Baidu (
webmaster.baidu.com/feedback/index) en lugar de adivinar o bloquearlo directamente. - No queda ninguna dependencia de Baidu MIP: el marco está retirado (la caché dejó de funcionar en junio de 2020 y el servicio completo se suspendió a finales de septiembre de 2022).
Herramientas para trabajar con Baiduspider
- DNS Checker: herramienta propia para la comprobación DNS bidireccional que recomienda la propia FAQ de Baidu. Introduce la IP de rastreo con el tipo de registro PTR para ejecutar la búsqueda inversa (un nombre de host genuino de Baiduspider termina en
.baidu.como.baidu.jp) y después introduce ese nombre de host con el tipo de registro A para confirmar que la búsqueda directa devuelve la misma IP. Consulta Cloudflare, Google y Quad9 en paralelo para que puedas detectar si un resolver discrepa. - robots.txt Tester: herramienta propia para comprobar si las reglas de tu robots.txt realmente bloquean o permiten Baiduspider como pretendes. Pega tu archivo, introduce
Baiduspider(oBaiduspider-image,Baiduspider-news, etc.) en el campo personalizado de user-agent y pruébalo contra rutas reales: muestra la regla exacta que gana para cada URL. Recuerda queBaiduspider-cproyBaiduspider-adsignoran robots.txt independientemente de lo que muestre el tester, porque operan bajo acuerdos comerciales separados.
Mitos y errores de Baiduspider que debes evitar
Mito: «Cualquier user-agent que contenga “Baiduspider” es realmente Baidu».
Por qué es incorrecto: la cadena de user-agent se puede suplantar trivialmente y las preguntas frecuentes de Baidu advierten de “spammers or other trouble makers who pretend to be Baiduspider.” (traducción) «spammers u otros alborotadores que se hacen pasar por Baiduspider».
Qué hacer: ejecuta la comprobación DNS bidireccional —búsqueda inversa hacia un nombre de host *.baidu.com/*.baidu.jp y después búsqueda directa hasta volver a la misma IP— antes de confiar en cualquier visita de «Baiduspider» (o bloquearla basándote en ella).
Mito: «Baidu nunca sigue robots.txt o, en general, no es fiable al respecto».
Por qué es incorrecto: las preguntas frecuentes de Baidu afirman “Baidu strictly complies with robots.txt
protocol” (traducción) «Baidu cumple estrictamente el protocolo robots.txt» para sus rastreadores estándar. La excepción real es limitada y nombrada: Baiduspider-cpro y Baiduspider-ads operan bajo acuerdos comerciales e ignoran robots.txt; no se trata de un vago «Baidu ignora los robots».
Qué hacer: cita la excepción concreta de cpro/ads y no la mezcles con el hecho separado de que Baiduspider no respeta la directiva no estándar crawl-delay.
Mito: «Baiduspider renderiza JavaScript casi tan bien como el Googlebot moderno». Por qué es incorrecto: el consenso de la industria (Dan Taylor lo calificó de “notoriously bad… crawling JavaScript” (traducción) «notoriamente malo al rastrear JavaScript») es que Baiduspider está muy por detrás del Chromium evergreen de Googlebot; el contenido que solo existe en el cliente supone un riesgo real de indexación para Baidu aunque se posicione bien en Google. Qué hacer: sirve el contenido, los enlaces y los metadatos importantes en HTML renderizado en el servidor o estático para los sitios orientados a China: es la opción segura para Googlebot, Bingbot y Baiduspider por igual.
Mito: «hreflang funciona igual para Baidu que para Google».
Por qué es incorrecto: Baidu no admite hreflang (es un hallazgo de la industria; la propia documentación de Google tampoco comenta nada sobre los demás motores).
Qué hacer: usa como alternativa content-language y <html lang> correctos para que Baidu pueda al menos leer el idioma de la página; no dependas de hreflang para dirigir a Baidu.
Mito: «“Baiduspider-render” no es una variante documentada oficialmente».
Por qué es incorrecto: la tabla de las preguntas frecuentes en inglés de Baidu no lo incluye, pero la página de Ziyuan Academy en chino de Baidu documenta Baiduspider-render/2.0 como UA alternativo para PC/móvil y una variante para miniprogramas. Es oficial, pero solo está en chino.
Qué hacer: descríbelo como documentado oficialmente (solo en chino) y señala que Baidu no publica ninguna especificación de qué hace realmente de forma diferente «-render».
Mito: «Baidu MIP sigue siendo una palanca de posicionamiento activa y recomendada». Por qué es incorrecto: el marco MIP (Mobile Instant Pages), parecido a AMP, es heredado. Según el glosario de MIP de Jademond, la caché de MIP se retiró en junio de 2020 y el servicio completo de MIP se suspendió a finales de septiembre de 2022, pero algunos contenidos de agencias con fecha reciente siguen promocionándolo como activo, lo que genera más confusión. Qué hacer: trata MIP como retirado y desconfía de cualquier guía reciente que lo presente como una palanca activa de velocidad o posicionamiento.
Ponte a prueba: Baiduspider
Cinco preguntas rápidas sobre el rastreador de Baidu. Elige una respuesta para cada una y después comprueba el resultado.
Recursos que merecen tu tiempo
Mis textos relacionados
- Hreflang Tags: A Simple (But Complete) Guide — mi guía de Ahrefs (con Joshua Hardwick) sobre hreflang, centrada en Google y útil como contexto para entender por qué la falta de compatibilidad de Baidu con hreflang es una cuestión aparte.
- Over 67% of Domains Using Hreflang Have Issues — estudio de mi equipo sobre 374 756 dominios, centrado en la implementación de Google y útil como contraste con la falta de compatibilidad de Baidu.
- The Beginner’s Guide to Technical SEO — el lugar donde los rastreadores y las señales internacionales encajan en el panorama general.
Mis charlas
- SEO internacional: los aspectos técnicos extraños (Pubcon Vegas 2019, SlideShare): mi charla sobre los casos límite técnicos del SEO internacional, el terreno en el que se mueve el trabajo de mercado de Baidu.
Del sector
- Preguntas frecuentes sobre Baiduspider (Baidu, help.baidu.com): las propias preguntas frecuentes de Baidu en inglés, con la tabla de UA, la verificación DNS, el tratamiento de robots.txt y la política de frecuencia de rastreo. La fuente primaria en inglés.
- Google frente a Baidu: diferencias clave en la estrategia SEO (Dan Taylor, Search Engine Journal): la valoración de que es «notoriamente malo al rastrear JavaScript» y la recomendación de HTML plano.
- Baidu frente a Google: cómo orientarse en el panorama SEO de 2024 (Michael Bonfils, Search Engine Land): perspectiva de un fundador de agencia sobre por qué las tácticas de Google no se trasladan directamente a Baidu.
- The Modern Guide To Robots.txt (Abby Hamilton, Search Engine Journal): la tabla comparativa de rastreadores que muestra que Baiduspider no respeta
crawl-delay. - Guía de rastreadores web: lo que necesitas saber (James Allen, Search Engine Land): el lugar de Baiduspider en un resumen más amplio de rastreadores.
- Understanding Baidu Spiders, User Agents & robots.txt (Jademond Digital): análisis detallado de los profesionales sobre las variantes del rastreador de Baidu y el tratamiento de robots.
- Baidu MIP (glossary) (Jademond Digital): la fuente de las fechas de retirada de MIP (la caché dejó de funcionar en junio de 2020 y el servicio completo se suspendió a finales de septiembre de 2022).
Registro de cambios
Actualizado el 11 ago 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.
Actualizado el 9 ago 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.