Googlebot: rastreo, renderizado y verificación

Qué es realmente Googlebot: Smartphone frente a Desktop, renderizado con Chromium evergreen, cadenas de user-agent, verificación de rangos de IP, límites de bytes y la diferencia entre rastrear y posicionar.

Publicado por primera vez: 24 jun 2026 · Última actualización: 9 ago 2026 · Avanzado
Idiomas
1 señal de evidencia en esta página

Googlebot es el rastreador web de Google: el software que descarga páginas para que Google pueda indexarlas y posicionarlas. Tiene dos variantes que comparten un token de robots.txt: Googlebot Smartphone (principal, con indexación centrada en los móviles) y Googlebot Desktop. Ejecuta un Chromium evergreen y renderiza JavaScript en una cola separada y posterior (rastrear no es renderizar). Rastrear no es un factor de posicionamiento, y bloquear Googlebot en robots.txt no equivale a desindexar: una URL bloqueada todavía puede indexarse solo por URL. El user-agent se falsifica con facilidad, así que verifícalo mediante DNS inverso + directo o con los rangos de IP publicados por Google. «Googlebot» es realmente la parte de la plataforma de rastreo mucho mayor que sirve a la Búsqueda de Google.

TL;DR — Googlebot es el rastreador de la Búsqueda de Google, dividido en Smartphone (principal, centrado en los móviles) y Desktop; ambos comparten un único token de Googlebot en robots.txt, así que no puedes orientarlos por separado. Ejecuta un Chromium evergreen y renderiza JavaScript en una cola separada y posterior (rastrear ≠ renderizar). Rastrear es necesario para posicionarse, pero no es una señal de posicionamiento, y una URL bloqueada por robots todavía puede indexarse solo por URL. Verifícalo mediante DNS inverso + directo hacia un dominio de Google o contra los rangos de IP publicados por Google: el user-agent se falsifica con facilidad. Y «Googlebot» es realmente solo la parte visible para Search de una plataforma de rastreo mucho mayor.

Evidence for this claim Googlebot is Google's crawler, with smartphone and desktop crawler types that share the same product token. Scope: Current Googlebot crawler and user-agent documentation. Confidence: high · Verified: Google Search Central: Googlebot Evidence for this claim A claimed Google crawler can be verified using reverse and forward DNS or Google's published IP ranges. Scope: Google's current crawler-verification methods. Confidence: high · Verified: Google Search Central: Verify Googlebot

Qué es realmente Googlebot

Google es preciso con el nombre: “Googlebot is the generic name for two types of web crawlers used by Google Search.” (traducción) «Googlebot es el nombre genérico de dos tipos de rastreadores web utilizados por la Búsqueda de Google». Esos dos tipos son Googlebot Smartphone (“a mobile crawler that simulates a user on a mobile device” (traducción) «un rastreador móvil que simula a un usuario en un dispositivo móvil») y Googlebot Desktop (“a desktop crawler that simulates a user on desktop” (traducción) «un rastreador de sobremesa que simula a un usuario en un ordenador de sobremesa»).

No es un único programita que se ejecuta en una sola máquina. “Googlebot runs on thousands of machines,” (traducción) «Googlebot se ejecuta en miles de máquinas», como describo en mi guía de Googlebot, “they determine how fast and what to crawl on websites,” (traducción) «determinan a qué velocidad y qué rastrear en los sitios web», distribuidas por centros de datos de todo el mundo, aunque salen principalmente de direcciones IP de Estados Unidos. El descubrimiento ocurre sobre todo mediante enlaces: Google encuentra URL «primarily from links embedded in previously crawled pages» (traducción) «principalmente mediante enlaces insertados en páginas rastreadas anteriormente», además de sitemaps. (El panorama completo de descubrimiento y programación corresponde al centro de rastreo.)

Smartphone frente a Desktop y por qué es «smartphone primero»

Con la indexación centrada en los móviles, el rastreador de smartphone es el principal. Google dice: “For most sites Google Search primarily indexes the mobile version of the content. As such the majority of Googlebot crawl requests will be made using the mobile crawler, and a minority using the desktop crawler.” (traducción) «para la mayoría de los sitios, la Búsqueda de Google indexa principalmente la versión móvil del contenido. Por tanto, la mayoría de las solicitudes de rastreo de Googlebot se hará mediante el rastreador móvil y una minoría mediante el rastreador de sobremesa». La indexación centrada en los móviles se completó para todos los sitios en octubre de 2023, así que la regla práctica es: si el contenido no es visible para el agente de smartphone, no se indexa. Mantén iguales el contenido, los datos estructurados, los metadatos y las etiquetas de robots en móvil y sobremesa.

El detalle de robots.txt: “Both crawler types obey the same product token (user agent token) in robots.txt, and so you cannot selectively target either Googlebot Smartphone or Googlebot Desktop using robots.txt.” (traducción) «ambos tipos de rastreador obedecen el mismo token de producto (token de user-agent) en robots.txt, por lo que no puedes dirigirte selectivamente a Googlebot Smartphone o Googlebot Desktop mediante robots.txt». La única forma de diferenciarlos es leer la cabecera HTTP user-agent de la solicitud en tu propia lógica del lado del servidor. (Para conocer la mecánica del formato de esa cabecera, consulta indexación centrada en los móviles y user-agent.)

Las cadenas del user-agent

El token de producto de robots.txt para ambos es simplemente Googlebot. Las cadenas UA completas son distintas:

Googlebot Desktop:

Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Googlebot/2.1; +http://www.google.com/bot.html) Chrome/W.X.Y.Z Safari/537.36

Googlebot Smartphone:

Mozilla/5.0 (Linux; Android 6.0.1; Nexus 5X Build/MMB29P) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/W.X.Y.Z Mobile Safari/537.36 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)

W.X.Y.Z es un marcador de posición para la versión actual de Chrome, que cambia cuando se actualiza el Chromium evergreen de Googlebot. No confíes solo en esa cadena: se puede falsificar con mucha facilidad (consulta la verificación más abajo).

Chromium evergreen y la cola de renderizado

Esta es la distinción que más confunde a la gente: rastrear y renderizar son pasos separados. Googlebot ejecuta “an evergreen version of Chromium,” (traducción) «una versión evergreen de Chromium», y se volvió evergreen en mayo de 2019 (pasó del antiguo Chrome 41 a la versión estable actual), por lo que ahora maneja ES6+, IntersectionObserver, Web Components y CSS moderno. Pero no ejecuta tu JavaScript en el mismo momento en que descarga el HTML.

Google: “Googlebot queues all pages with a 200 HTTP status code for rendering, unless a robots meta tag or header tells Google not to index the page. The page may stay on this queue for a few seconds, but it can take longer than that. Once Google’s resources allow, a headless Chromium renders the page and executes the JavaScript.” (traducción) «Googlebot pone en cola para renderizar todas las páginas con un código de estado HTTP 200, salvo que una etiqueta meta o una cabecera de robots indique a Google que no indexe la página. La página puede permanecer en esta cola unos segundos, pero puede tardar más. Cuando los recursos de Google lo permiten, un Chromium sin interfaz renderiza la página y ejecuta el JavaScript». El servicio de renderizado (WRS) se comporta como un navegador moderno, pero tiene algunos detalles importantes: es sin estado en la práctica (el almacenamiento local/de sesión y las cookies se borran entre cargas), no descarga imágenes ni vídeos (para ahorrar ancho de banda), aplica una caché agresiva (y puede ignorar tus cabeceras de caché) y no admite WebSockets ni WebRTC. Si tu contenido solo aparece después de hacer clic o de una navegación controlada por JS que no es un enlace <a href> real, espera problemas de renderizado. (La profundidad está en el artículo hermano de renderizado.)

Límites de bytes

Googlebot no descarga una cantidad ilimitada por URL. Según la actualización Inside Googlebot de Google de marzo de 2026, obtiene aproximadamente los primeros 2 MB de cualquier URL individual (incluida la cabecera HTTP) y hasta 64 MB para un PDF. La cifra es móvil: Google explica que “this limit is not set in stone and may change over time as the web evolves and HTML pages grow in size,” (traducción) «este límite no está fijado y puede cambiar con el tiempo a medida que evoluciona la web y aumentan de tamaño las páginas HTML», y documentos anteriores indicaban 15 MB (que resultó ser el valor predeterminado de la infraestructura general, no el de Search). El punto práctico se mantiene: todo lo que queda después del corte simplemente no se descarga; “to Googlebot, they simply don’t exist.” (traducción) «para Googlebot, sencillamente no existe». Mantén el contenido y el marcado críticos por encima de la saturación.

Fallo práctico: el canónico existe, pero Googlebot nunca lo recibe

Imagina una plantilla de producto que devuelve 2,4 MB de HTML. Una aplicación serializa cerca del principio del documento un objeto enorme de estado del producto y una carga de recomendaciones; el canónico, la descripción del producto, los datos estructurados y los enlaces a productos relacionados no aparecen hasta aproximadamente el byte 2 180 000. Un navegador descarga toda la respuesta, por lo que Ver código fuente parece correcto. Googlebot Search se detiene cerca de su límite documentado de 2 MB, así que esas señales posteriores no existen en el recurso descargado.

Diagnostica la respuesta en orden de bytes, no solo en el DOM renderizado:

curl -sS -D response-headers.txt -o page.html https://example.com/product
wc -c response-headers.txt page.html
LC_ALL=C grep -abo 'rel="canonical"' page.html
LC_ALL=C grep -abo 'application/ld+json' page.html

Los recuentos locales de bytes son una aproximación porque los intermediarios de entrega y el tratamiento de la respuesta pueden variar, pero responden a la primera pregunta útil: ¿las señales críticas aparecen con margen al principio o están cerca del límite o más allá? La solución es eliminar o aplazar los datos insertados de gran tamaño y emitir pronto los metadatos esenciales, el contenido principal y los enlaces rastreables; no mover el mismo exceso de un sitio a otro esperando que cambie el corte.

Cómo obtiene Googlebot los datos, con moderación

  • La velocidad de rastreo es algorítmica y se autorregula. “For most sites, Googlebot shouldn’t access your site more than once every few seconds on average.” (traducción) «para la mayoría de los sitios, Googlebot no debería acceder a tu sitio más de una vez cada pocos segundos de media». Acelera o reduce el ritmo según el estado de tu servidor.
  • Los códigos de estado son la palanca. Devolver 429, 500 o 503 indica a Googlebot que reduzca el ritmo, pero afecta al hostname completo, no solo a las URL con errores, y solo funciona durante uno o dos días antes de que los errores continuados empiecen a sacar páginas del índice. John Mueller: “I’d only expect the crawl rate to react that quickly if they were returning 429 / 500 / 503 / timeouts,” (traducción) «solo esperaría que la velocidad de rastreo reaccionara tan rápido si devolvieran 429 / 500 / 503 / timeouts», y “404s are generally fine & once discovered, Googlebot will retry them anyway.” (traducción) «los errores de página no encontrada suelen estar bien y, una vez descubiertos, Googlebot volverá a intentarlo de todos modos».
  • Se ignora crawl-delay. Google no procesa en absoluto la directiva no estándar crawl-delay de robots.txt. (Bing la respeta: es una de las divergencias reales entre Googlebot y Bingbot.)
  • El rastreo sigue la demanda de rastreo, no una cuota fija: capacidad (lo que aguanta tu servidor) más demanda (popularidad y antigüedad). Para la mayoría de los sitios no es un problema; solo afecta a escalas reales. El tratamiento completo está en presupuesto de rastreo.

Cómo verificar que realmente es Googlebot

La cabecera user-agent se “often spoofed by other crawlers” (traducción) «falsifica a menudo otros rastreadores», así que por sí sola no demuestra nada. Los rastreadores de Google se identifican de tres maneras: la cabecera user-agent, la IP de origen y el hostname de DNS inverso de esa IP. Hay dos métodos de verificación reales:

  1. Manual (una sola vez). Haz DNS inverso de la IP de origen; confirma que resuelve a un hostname que termina en googlebot.com, google.com o googleusercontent.com (la máscara se parece a crawl-***-***-***-***.googlebot.com); después haz DNS directo de ese hostname y confirma que devuelve la IP original.
  2. Automático (a escala). Compara la IP con los rangos CIDR publicados por Google. Google separó estos rangos del antiguo googlebot.json único en varios archivos por categoría de rastreador; el de Googlebot es https://www.gstatic.com/ipranges/common-crawlers.json (la URL antigua googlebot.json sigue redirigiendo a los mismos datos).

Ambos métodos están en la pestaña Scripts, para macOS/Linux y Windows. ¿Por qué molestarse? Mucho tráfico miente diciendo ser Googlebot, así que los registros que «muestran Googlebot» pueden ser en gran medida impostores; verifica antes de confiar en ellos.

Googlebot es un bot dentro de una flota

«Googlebot» es realmente un nombre un poco engañoso. Gary Illyes, marzo de 2026: “I mean, calling it Googlebot, that’s a misnomer,” (traducción) «quiero decir que llamarlo Googlebot es un nombre engañoso», y “Googlebot is not our crawler infrastructure.” (traducción) «Googlebot no es nuestra infraestructura de rastreo». La infraestructura subyacente, en sus palabras, es “software as a service, if you like. SaaS” (traducción) «software como servicio, si se quiere. SaaS»: una plataforma compartida de la que se sirven muchos productos de Google. Lo que ves en tus registros es su parte de Search: “When you see Googlebot in your server logs, you are just looking at Google Search.” (traducción) «cuando ves Googlebot en los registros de tu servidor, simplemente estás viendo la Búsqueda de Google». También señala que hay “dozens, if not hundreds of different crawlers,” (traducción) «docenas, si no cientos, de rastreadores diferentes», la mayoría demasiado pequeños como para documentarlos.

Los nombres que realmente encontrarás junto a Googlebot incluyen Googlebot-Image, Googlebot-Video y Googlebot-News (que comparten las cadenas/tokens de Googlebot), Storebot-Google y Google-InspectionTool (que impulsa las herramientas de inspección de URL y resultados enriquecidos). Dos se comportan de manera poco habitual: AdsBot ignora la regla global * de robots.txt (un Disallow: / bajo User-agent: * no lo detendrá) y Google-Safety ignora robots.txt por completo. También existen los rastreadores relacionados con IA: Google-Extended (controla el entrenamiento de Gemini; no es una señal de posicionamiento) y GoogleOther (rastreo de I+D, descargado de Googlebot); el artículo hermano de rastreores de IA los trata en profundidad, así que enlazaré allí en vez de duplicarlo.

Cómo controlar Googlebot

Tres controles, tres efectos diferentes:

  • robots.txt detiene el rastreo, no la indexación. Úsalo para mantener a los bots fuera de espacios de URL de poco valor; nunca como herramienta para desindexar.
  • noindex detiene la indexación, pero Googlebot debe poder rastrear la página para ver la etiqueta en primer lugar.
  • La protección con contraseña bloquea el acceso por completo.

Esto nos lleva al hecho de Googlebot que más se malinterpreta: “There’s a difference between crawling and indexing; blocking Googlebot from crawling a page doesn’t prevent the URL of the page from appearing in search results.” (traducción) «hay una diferencia entre rastrear e indexar; impedir que Googlebot rastree una página no evita que la URL aparezca en los resultados de búsqueda». Una URL bloqueada por robots todavía puede indexarse solo por URL si algo enlaza a ella. Para eliminar realmente una página, permite el rastreo y añade noindex. Lo he explicado con detalle en Indexada aunque bloqueada por robots.txt.

Para conocer el flujo más amplio en el que vive Googlebot —descubrimiento de URL, programador de rastreo, renderizado y diferencias entre rastrear, indexar y posicionar— consulta el centro de rastreo y Cómo funciona la Búsqueda.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.