Googlebot: rastreo, renderizado y verificación
Qué es realmente Googlebot: Smartphone frente a Desktop, renderizado con Chromium evergreen, cadenas de user-agent, verificación de rangos de IP, límites de bytes y la diferencia entre rastrear y posicionar.
Idiomas
1 señal de evidencia en esta página
- Herramienta activa relacionadarobots.txt Tester
Googlebot es el rastreador web de Google: el software que descarga páginas para que Google pueda indexarlas y posicionarlas. Tiene dos variantes que comparten un token de robots.txt: Googlebot Smartphone (principal, con indexación centrada en los móviles) y Googlebot Desktop. Ejecuta un Chromium evergreen y renderiza JavaScript en una cola separada y posterior (rastrear no es renderizar). Rastrear no es un factor de posicionamiento, y bloquear Googlebot en robots.txt no equivale a desindexar: una URL bloqueada todavía puede indexarse solo por URL. El user-agent se falsifica con facilidad, así que verifícalo mediante DNS inverso + directo o con los rangos de IP publicados por Google. «Googlebot» es realmente la parte de la plataforma de rastreo mucho mayor que sirve a la Búsqueda de Google.
Evidence for this claim Googlebot is Google's crawler, with smartphone and desktop crawler types that share the same product token. Scope: Current Googlebot crawler and user-agent documentation. Confidence: high · Verified: Google Search Central: Googlebot Evidence for this claim A claimed Google crawler can be verified using reverse and forward DNS or Google's published IP ranges. Scope: Google's current crawler-verification methods. Confidence: high · Verified: Google Search Central: Verify GooglebotTL;DR — Googlebot es el rastreador web de Google: el programa que visita tus páginas, las descarga y las entrega para que Google las indexe y las posicione. Hay dos (uno para smartphones y otro para ordenadores), y el de smartphone hace la mayor parte del trabajo. Que te rastreen es necesario para aparecer en las búsquedas, pero que te rastreen más no mejora tu posicionamiento.
Qué es Googlebot
Google no explora la web como tú. Envía un programa automatizado —un rastreador o bot— que visita las páginas, descarga su contenido y sigue enlaces para encontrar más páginas. Ese programa es Googlebot. (El equivalente de Bing es Bingbot.)
Lo describo de forma sencilla en mi guía de Ahrefs sobre Googlebot: “Googlebot is the web crawler used by Google to gather the information needed and build a searchable index of the web.” (traducción) «Googlebot es el rastreador web que Google utiliza para recopilar la información necesaria y construir un índice web consultable». Todo lo que Google te muestra en los resultados de búsqueda empezó cuando Googlebot descargó la página.
En realidad hay dos Googlebot
Googlebot tiene dos variantes:
- Googlebot Smartphone — simula ser alguien que usa un teléfono. Es el principal. Google observa sobre todo la versión móvil de tu sitio (lo que se denomina indexación centrada en los móviles), así que la mayoría de los rastreos procede del bot para smartphones.
- Googlebot Desktop — simula ser alguien que usa un ordenador de sobremesa. Representa una parte menor del rastreo.
Aquí está el detalle importante: en tu archivo robots.txt (el archivo que indica a los bots adónde pueden ir), ambos comparten el mismo nombre: Googlebot. Por eso no puedes decirle a robots.txt «deja entrar al de sobremesa, pero no al móvil». Es todo o nada.
¿Googlebot ejecuta JavaScript?
Sí. Googlebot utiliza una versión reciente de Chrome internamente, así que puede leer sitios modernos con mucho JavaScript. Como explico en mi guía de Googlebot: “Googlebot is evergreen, meaning it sees websites as users would in the latest Chrome browser.” (traducción) «Googlebot es evergreen, lo que significa que ve los sitios web como los usuarios los verían en la versión más reciente del navegador Chrome». Pero ese JavaScript se ejecuta un poco después, en un paso separado, no en el instante en que se descarga la página por primera vez.
Las dos cosas que la gente confunde
- Rastrear no es posicionar. Que te rastreen más a menudo no hará que subas en los resultados. Rastrea es simplemente cómo Google encuentra y descarga tu página: es una puerta que tienes que atravesar, no un marcador.
- Bloquear Googlebot en
robots.txtno te elimina de Google. Solo impide que Google lea la página. Si otros sitios enlazan a ella, la URL todavía puede aparecer en los resultados (aunque sin una descripción útil). Para mantener realmente una página fuera, permite que Google la rastree y añade una etiquetanoindex.
¿Quieres la versión técnica —las cadenas exactas del user-agent, cómo verificar un Googlebot real, los límites de bytes y la cola de renderizado—? Cambia a la pestaña Avanzado.
Evidence for this claim Googlebot is Google's crawler, with smartphone and desktop crawler types that share the same product token. Scope: Current Googlebot crawler and user-agent documentation. Confidence: high · Verified: Google Search Central: Googlebot Evidence for this claim A claimed Google crawler can be verified using reverse and forward DNS or Google's published IP ranges. Scope: Google's current crawler-verification methods. Confidence: high · Verified: Google Search Central: Verify GooglebotTL;DR — Googlebot es el rastreador de la Búsqueda de Google, dividido en Smartphone (principal, centrado en los móviles) y Desktop; ambos comparten un único token de
Googlebotenrobots.txt, así que no puedes orientarlos por separado. Ejecuta un Chromium evergreen y renderiza JavaScript en una cola separada y posterior (rastrear ≠ renderizar). Rastrear es necesario para posicionarse, pero no es una señal de posicionamiento, y una URL bloqueada por robots todavía puede indexarse solo por URL. Verifícalo mediante DNS inverso + directo hacia un dominio de Google o contra los rangos de IP publicados por Google: el user-agent se falsifica con facilidad. Y «Googlebot» es realmente solo la parte visible para Search de una plataforma de rastreo mucho mayor.
Qué es realmente Googlebot
Google es preciso con el nombre: “Googlebot is the generic name for two types of web crawlers used by Google Search.” (traducción) «Googlebot es el nombre genérico de dos tipos de rastreadores web utilizados por la Búsqueda de Google». Esos dos tipos son Googlebot Smartphone (“a mobile crawler that simulates a user on a mobile device” (traducción) «un rastreador móvil que simula a un usuario en un dispositivo móvil») y Googlebot Desktop (“a desktop crawler that simulates a user on desktop” (traducción) «un rastreador de sobremesa que simula a un usuario en un ordenador de sobremesa»).
No es un único programita que se ejecuta en una sola máquina. “Googlebot runs on thousands of machines,” (traducción) «Googlebot se ejecuta en miles de máquinas», como describo en mi guía de Googlebot, “they determine how fast and what to crawl on websites,” (traducción) «determinan a qué velocidad y qué rastrear en los sitios web», distribuidas por centros de datos de todo el mundo, aunque salen principalmente de direcciones IP de Estados Unidos. El descubrimiento ocurre sobre todo mediante enlaces: Google encuentra URL «primarily from links embedded in previously crawled pages» (traducción) «principalmente mediante enlaces insertados en páginas rastreadas anteriormente», además de sitemaps. (El panorama completo de descubrimiento y programación corresponde al centro de rastreo.)
Smartphone frente a Desktop y por qué es «smartphone primero»
Con la indexación centrada en los móviles, el rastreador de smartphone es el principal. Google dice: “For most sites Google Search primarily indexes the mobile version of the content. As such the majority of Googlebot crawl requests will be made using the mobile crawler, and a minority using the desktop crawler.” (traducción) «para la mayoría de los sitios, la Búsqueda de Google indexa principalmente la versión móvil del contenido. Por tanto, la mayoría de las solicitudes de rastreo de Googlebot se hará mediante el rastreador móvil y una minoría mediante el rastreador de sobremesa». La indexación centrada en los móviles se completó para todos los sitios en octubre de 2023, así que la regla práctica es: si el contenido no es visible para el agente de smartphone, no se indexa. Mantén iguales el contenido, los datos estructurados, los metadatos y las etiquetas de robots en móvil y sobremesa.
El detalle de robots.txt: “Both crawler types obey the same product token (user agent token) in robots.txt, and so you cannot selectively target either Googlebot Smartphone or Googlebot Desktop using robots.txt.” (traducción) «ambos tipos de rastreador obedecen el mismo token de producto (token de user-agent) en robots.txt, por lo que no puedes dirigirte selectivamente a Googlebot Smartphone o Googlebot Desktop mediante robots.txt». La única forma de diferenciarlos es leer la cabecera HTTP user-agent de la solicitud en tu propia lógica del lado del servidor. (Para conocer la mecánica del formato de esa cabecera, consulta indexación centrada en los móviles y user-agent.)
Las cadenas del user-agent
El token de producto de robots.txt para ambos es simplemente Googlebot. Las cadenas UA completas son distintas:
Googlebot Desktop:
Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; Googlebot/2.1; +http://www.google.com/bot.html) Chrome/W.X.Y.Z Safari/537.36Googlebot Smartphone:
Mozilla/5.0 (Linux; Android 6.0.1; Nexus 5X Build/MMB29P) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/W.X.Y.Z Mobile Safari/537.36 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)W.X.Y.Z es un marcador de posición para la versión actual de Chrome, que cambia cuando se actualiza el Chromium evergreen de Googlebot. No confíes solo en esa cadena: se puede falsificar con mucha facilidad (consulta la verificación más abajo).
Chromium evergreen y la cola de renderizado
Esta es la distinción que más confunde a la gente: rastrear y renderizar son pasos separados. Googlebot ejecuta “an evergreen version of Chromium,” (traducción) «una versión evergreen de Chromium», y se volvió evergreen en mayo de 2019 (pasó del antiguo Chrome 41 a la versión estable actual), por lo que ahora maneja ES6+, IntersectionObserver, Web Components y CSS moderno. Pero no ejecuta tu JavaScript en el mismo momento en que descarga el HTML.
Google: “Googlebot queues all pages with a 200 HTTP status code for rendering, unless a robots meta tag or header tells Google not to index the page. The page may stay on this queue for a few seconds, but it can take longer than that. Once Google’s resources allow, a headless Chromium renders the page and executes the JavaScript.” (traducción) «Googlebot pone en cola para renderizar todas las páginas con un código de estado HTTP 200, salvo que una etiqueta meta o una cabecera de robots indique a Google que no indexe la página. La página puede permanecer en esta cola unos segundos, pero puede tardar más. Cuando los recursos de Google lo permiten, un Chromium sin interfaz renderiza la página y ejecuta el JavaScript». El servicio de renderizado (WRS) se comporta como un navegador moderno, pero tiene algunos detalles importantes: es sin estado en la práctica (el almacenamiento local/de sesión y las cookies se borran entre cargas), no descarga imágenes ni vídeos (para ahorrar ancho de banda), aplica una caché agresiva (y puede ignorar tus cabeceras de caché) y no admite WebSockets ni WebRTC. Si tu contenido solo aparece después de hacer clic o de una navegación controlada por JS que no es un enlace <a href> real, espera problemas de renderizado. (La profundidad está en el artículo hermano de renderizado.)
Límites de bytes
Googlebot no descarga una cantidad ilimitada por URL. Según la actualización Inside Googlebot de Google de marzo de 2026, obtiene aproximadamente los primeros 2 MB de cualquier URL individual (incluida la cabecera HTTP) y hasta 64 MB para un PDF. La cifra es móvil: Google explica que “this limit is not set in stone and may change over time as the web evolves and HTML pages grow in size,” (traducción) «este límite no está fijado y puede cambiar con el tiempo a medida que evoluciona la web y aumentan de tamaño las páginas HTML», y documentos anteriores indicaban 15 MB (que resultó ser el valor predeterminado de la infraestructura general, no el de Search). El punto práctico se mantiene: todo lo que queda después del corte simplemente no se descarga; “to Googlebot, they simply don’t exist.” (traducción) «para Googlebot, sencillamente no existe». Mantén el contenido y el marcado críticos por encima de la saturación.
Fallo práctico: el canónico existe, pero Googlebot nunca lo recibe
Imagina una plantilla de producto que devuelve 2,4 MB de HTML. Una aplicación serializa cerca del principio del documento un objeto enorme de estado del producto y una carga de recomendaciones; el canónico, la descripción del producto, los datos estructurados y los enlaces a productos relacionados no aparecen hasta aproximadamente el byte 2 180 000. Un navegador descarga toda la respuesta, por lo que Ver código fuente parece correcto. Googlebot Search se detiene cerca de su límite documentado de 2 MB, así que esas señales posteriores no existen en el recurso descargado.
Diagnostica la respuesta en orden de bytes, no solo en el DOM renderizado:
curl -sS -D response-headers.txt -o page.html https://example.com/product
wc -c response-headers.txt page.html
LC_ALL=C grep -abo 'rel="canonical"' page.html
LC_ALL=C grep -abo 'application/ld+json' page.htmlLos recuentos locales de bytes son una aproximación porque los intermediarios de entrega y el tratamiento de la respuesta pueden variar, pero responden a la primera pregunta útil: ¿las señales críticas aparecen con margen al principio o están cerca del límite o más allá? La solución es eliminar o aplazar los datos insertados de gran tamaño y emitir pronto los metadatos esenciales, el contenido principal y los enlaces rastreables; no mover el mismo exceso de un sitio a otro esperando que cambie el corte.
Cómo obtiene Googlebot los datos, con moderación
- La velocidad de rastreo es algorítmica y se autorregula. “For most sites, Googlebot shouldn’t access your site more than once every few seconds on average.” (traducción) «para la mayoría de los sitios, Googlebot no debería acceder a tu sitio más de una vez cada pocos segundos de media». Acelera o reduce el ritmo según el estado de tu servidor.
- Los códigos de estado son la palanca. Devolver
429,500o503indica a Googlebot que reduzca el ritmo, pero afecta al hostname completo, no solo a las URL con errores, y solo funciona durante uno o dos días antes de que los errores continuados empiecen a sacar páginas del índice. John Mueller: “I’d only expect the crawl rate to react that quickly if they were returning 429 / 500 / 503 / timeouts,” (traducción) «solo esperaría que la velocidad de rastreo reaccionara tan rápido si devolvieran 429 / 500 / 503 / timeouts», y “404s are generally fine & once discovered, Googlebot will retry them anyway.” (traducción) «los errores de página no encontrada suelen estar bien y, una vez descubiertos, Googlebot volverá a intentarlo de todos modos». - Se ignora
crawl-delay. Google no procesa en absoluto la directiva no estándarcrawl-delayde robots.txt. (Bing sí la respeta: es una de las divergencias reales entre Googlebot y Bingbot.) - El rastreo sigue la demanda de rastreo, no una cuota fija: capacidad (lo que aguanta tu servidor) más demanda (popularidad y antigüedad). Para la mayoría de los sitios no es un problema; solo afecta a escalas reales. El tratamiento completo está en presupuesto de rastreo.
Cómo verificar que realmente es Googlebot
La cabecera user-agent se “often spoofed by other crawlers” (traducción) «falsifica a menudo otros rastreadores», así que por sí sola no demuestra nada. Los rastreadores de Google se identifican de tres maneras: la cabecera user-agent, la IP de origen y el hostname de DNS inverso de esa IP. Hay dos métodos de verificación reales:
- Manual (una sola vez). Haz DNS inverso de la IP de origen; confirma que resuelve a un hostname que termina en
googlebot.com,google.comogoogleusercontent.com(la máscara se parece acrawl-***-***-***-***.googlebot.com); después haz DNS directo de ese hostname y confirma que devuelve la IP original. - Automático (a escala). Compara la IP con los rangos CIDR publicados por Google. Google separó estos rangos del antiguo
googlebot.jsonúnico en varios archivos por categoría de rastreador; el de Googlebot eshttps://www.gstatic.com/ipranges/common-crawlers.json(la URL antiguagooglebot.jsonsigue redirigiendo a los mismos datos).
Ambos métodos están en la pestaña Scripts, para macOS/Linux y Windows. ¿Por qué molestarse? Mucho tráfico miente diciendo ser Googlebot, así que los registros que «muestran Googlebot» pueden ser en gran medida impostores; verifica antes de confiar en ellos.
Googlebot es un bot dentro de una flota
«Googlebot» es realmente un nombre un poco engañoso. Gary Illyes, marzo de 2026: “I mean, calling it Googlebot, that’s a misnomer,” (traducción) «quiero decir que llamarlo Googlebot es un nombre engañoso», y “Googlebot is not our crawler infrastructure.” (traducción) «Googlebot no es nuestra infraestructura de rastreo». La infraestructura subyacente, en sus palabras, es “software as a service, if you like. SaaS” (traducción) «software como servicio, si se quiere. SaaS»: una plataforma compartida de la que se sirven muchos productos de Google. Lo que ves en tus registros es su parte de Search: “When you see Googlebot in your server logs, you are just looking at Google Search.” (traducción) «cuando ves Googlebot en los registros de tu servidor, simplemente estás viendo la Búsqueda de Google». También señala que hay “dozens, if not hundreds of different crawlers,” (traducción) «docenas, si no cientos, de rastreadores diferentes», la mayoría demasiado pequeños como para documentarlos.
Los nombres que realmente encontrarás junto a Googlebot incluyen Googlebot-Image, Googlebot-Video y Googlebot-News (que comparten las cadenas/tokens de Googlebot), Storebot-Google y Google-InspectionTool (que impulsa las herramientas de inspección de URL y resultados enriquecidos). Dos se comportan de manera poco habitual: AdsBot ignora la regla global * de robots.txt (un Disallow: / bajo User-agent: * no lo detendrá) y Google-Safety ignora robots.txt por completo. También existen los rastreadores relacionados con IA: Google-Extended (controla el entrenamiento de Gemini; no es una señal de posicionamiento) y GoogleOther (rastreo de I+D, descargado de Googlebot); el artículo hermano de rastreores de IA los trata en profundidad, así que enlazaré allí en vez de duplicarlo.
Cómo controlar Googlebot
Tres controles, tres efectos diferentes:
robots.txtdetiene el rastreo, no la indexación. Úsalo para mantener a los bots fuera de espacios de URL de poco valor; nunca como herramienta para desindexar.noindexdetiene la indexación, pero Googlebot debe poder rastrear la página para ver la etiqueta en primer lugar.- La protección con contraseña bloquea el acceso por completo.
Esto nos lleva al hecho de Googlebot que más se malinterpreta: “There’s a difference between crawling and indexing; blocking Googlebot from crawling a page doesn’t prevent the URL of the page from appearing in search results.” (traducción) «hay una diferencia entre rastrear e indexar; impedir que Googlebot rastree una página no evita que la URL aparezca en los resultados de búsqueda». Una URL bloqueada por robots todavía puede indexarse solo por URL si algo enlaza a ella. Para eliminar realmente una página, permite el rastreo y añade noindex. Lo he explicado con detalle en Indexada aunque bloqueada por robots.txt.
Para conocer el flujo más amplio en el que vive Googlebot —descubrimiento de URL, programador de rastreo, renderizado y diferencias entre rastrear, indexar y posicionar— consulta el centro de rastreo y Cómo funciona la Búsqueda.
Resumen de IA
Una síntesis de la versión Avanzada:
- Googlebot = el rastreador web de la Búsqueda de Google, en dos variantes: Smartphone (principal, con indexación centrada en los móviles) y Desktop. Comparten un único token
Googlebotde robots.txt, por lo que no puedes orientarlos por separado; solo mediante la cabecera HTTP user-agent. - Centrado en los móviles desde octubre de 2023: si el contenido no es visible para el agente de smartphone, no se indexa.
- Chromium evergreen y cola de renderizado separada: Googlebot ejecuta el Chromium actual, pero el JavaScript se ejecuta después, en un paso de renderizado sin estado (se borran el almacenamiento y las cookies; no se descargan imágenes ni vídeos; la caché es agresiva). Rastrear ≠ renderizar.
- Límite de aproximadamente 2 MB por URL (los PDF, 64 MB) en 2026: el contenido posterior al corte no se descarga. La cifra exacta «no está fijada».
- Obtención moderada y algorítmica:
429/5xxindican «reduce el ritmo» (afecta al hostname completo y a corto plazo);crawl-delayse ignora (Bing sí lo respeta). - Rastrear ≠ posicionar, y bloquear por robots ≠ desindexar: una URL bloqueada todavía puede indexarse solo por URL. Elimina páginas con
noindex(permitiendo el rastreo), no con robots.txt. - Verifica mediante DNS inverso + directo hacia
*.googlebot.com/*.google.com/*.googleusercontent.com, o contra los rangos de IP publicados por Google (common-crawlers.json); el user-agent se falsifica con facilidad. - «Googlebot» es una flota, no un solo programa: la parte visible para Search de una plataforma de rastreo mayor, junto a Googlebot-Image/Video/News, Google-InspectionTool, AdsBot (ignora
*), Google-Safety (ignora robots.txt) y los rastreadores de IA (Google-Extended, GoogleOther; consulta el artículo hermano de rastreores de IA).
Documentación oficial
Documentación de fuentes primarias de los motores de búsqueda.
- Googlebot — la documentación canónica: los dos tipos de rastreador, las cadenas UA, los límites de bytes y los controles de rastreo/indexación. Empieza aquí.
- Descripción general de los rastreadores y fetchers de Google — todos los user-agents de Google, las tres categorías de rastreadores y los rangos de IP publicados.
- Rastreadores comunes de Google — referencia completa de cadenas UA y tokens de robots para Googlebot y sus hermanos.
- Verificar los rastreadores y fetchers de Google — DNS inverso/directo y archivos JSON de rangos de IP.
- Prácticas recomendadas de indexación centrada en los móviles — por qué Smartphone es el principal y qué debes mantener coherente.
- Fundamentos de SEO para JavaScript — el renderizador Chromium evergreen y la cola de renderizado.
- Cómo afectan los códigos de estado HTTP a los rastreadores de Google — cómo
2xx/3xx/4xx/429/5xxcambian el comportamiento de rastreo. - Inside Googlebot (marzo de 2026) — los límites de bytes actuales y la explicación de que «Googlebot es simplemente la Búsqueda de Google».
Bing / Microsoft (como contraste)
- Control de rastreo de Bingbot — programación manual del rastreo de Bing y su compatibilidad con
crawl-delay, que Googlebot no tiene.
Citas de la fuente
Declaraciones registradas de Google. Cada enlace es un enlace profundo que salta al pasaje citado en la página de origen.
Google: qué es Googlebot
- “Googlebot is the generic name for two types of web crawlers used by Google Search.” (traducción) «Googlebot es el nombre genérico de dos tipos de rastreadores web utilizados por la Búsqueda de Google». — Documentación de Google Search Central. Ir a la cita
- “For most sites Google Search primarily indexes the mobile version of the content. As such the majority of Googlebot crawl requests will be made using the mobile crawler, and a minority using the desktop crawler.” (traducción) «en la mayoría de los sitios, Google Search indexa principalmente la versión móvil del contenido. Por ello, el rastreador móvil realizará la mayoría de las solicitudes de rastreo de Googlebot y el rastreador de sobremesa, una minoría». Ir a la cita
- “Google uses the mobile version of a site’s content, crawled with the smartphone agent, for indexing and ranking.” (traducción) «Google utiliza para indexar y posicionar la versión móvil del contenido de un sitio, rastreada con el agente de smartphone». Ir a la cita
Google: renderizado y límites de bytes
- “While Google Search runs JavaScript with an evergreen version of Chromium, there are a few things that you can optimize.” (traducción) «aunque la Búsqueda de Google ejecuta JavaScript con una versión evergreen de Chromium, hay algunas cosas que puedes optimizar». Ir a la cita
- “Googlebot queues all pages with a 200 HTTP status code for rendering, unless a robots meta tag or header tells Google not to index the page.” (traducción) «Googlebot pone en cola para renderizar todas las páginas con un código de estado HTTP 200, salvo que una etiqueta meta o una cabecera de robots indique a Google que no indexe la página». Ir a la cita
- “Googlebot crawls the first 2MB of a supported file type, and the first 64MB of a PDF file.” (traducción) «Googlebot rastrea los primeros 2 MB de un tipo de archivo compatible y los primeros 64 MB de un archivo PDF». Ir a la cita
Google: rastreo frente a indexación
- “There’s a difference between crawling and indexing; blocking Googlebot from crawling a page doesn’t prevent the URL of the page from appearing in search results.” (traducción) «hay una diferencia entre rastrear e indexar; impedir que Googlebot rastree una página no evita que la URL aparezca en los resultados de búsqueda». — Documentación de Google Search Central. Ir a la cita
Gary Illyes, Google (según lo publicado por Search Engine Journal y la entrada del blog de Google de marzo de 2026)
- “I mean, calling it Googlebot, that’s a misnomer.” (traducción) «quiero decir que llamarlo Googlebot es un nombre engañoso». … “Googlebot is not our crawler infrastructure.” (traducción) «Googlebot no es nuestra infraestructura de rastreo». … “it’s software as a service, if you like. SaaS.” (traducción) «es software como servicio, si se quiere. SaaS». Leer la cobertura
- “When you see Googlebot in your server logs, you are just looking at Google Search.” (traducción) «cuando ves Googlebot en los registros de tu servidor, simplemente estás viendo la Búsqueda de Google». Leer la cobertura
John Mueller, Google (según la cobertura de Reddit de Search Engine Journal)
- “I’d only expect the crawl rate to react that quickly if they were returning 429 / 500 / 503 / timeouts.” (traducción) «solo esperaría que la velocidad de rastreo reaccionara tan rápido si devolvieran 429 / 500 / 503 / timeouts». … “404s are generally fine & once discovered, Googlebot will retry them anyway.” (traducción) «los errores de página no encontrada suelen estar bien y, una vez descubiertos, Googlebot volverá a intentarlo de todos modos». Leer la cobertura
Lista de comprobación para preparar Googlebot
Una comprobación rápida para confirmar que Googlebot puede encontrar, descargar, renderizar y gestionar correctamente tus páginas:
- El contenido importante es accesible mediante enlaces
<a href>reales (no mediante una navegación que solo funcione al hacer clic o controlada por JS que el renderizador no pueda seguir). - Las versiones móvil y de sobremesa coinciden: mismo contenido, datos estructurados, metadatos y etiquetas de robots (con la indexación centrada en los móviles cuenta la vista del agente de smartphone).
- El contenido y el marcado críticos están por encima del corte de descarga de aproximadamente 2 MB; los PDF deben estar por debajo de 64 MB.
-
robots.txtno bloquea nada que quieras indexar y no lo usas para intentar desindexar (ese trabajo corresponde anoindex, permitiendo el rastreo). - El servidor devuelve respuestas rápidas y estables: pocos
5xx/429/timeouts, ya que ralentizan el rastreo de todo el hostname. - No dependes de
crawl-delay(Google lo ignora). - Los registros del servidor se comprueban con un Googlebot verificado (DNS inverso + directo o rangos de IP), no con coincidencias sin más del user-agent, que los impostores pueden falsificar.
- Entiendes que una URL bloqueada por robots todavía puede indexarse solo por URL si alguien enlaza a ella.
Googlebot: hoja rápida
Los dos tipos de rastreador
| Googlebot Smartphone | Googlebot Desktop | |
|---|---|---|
| Simula a | Un usuario de un dispositivo móvil | Un usuario de un ordenador de sobremesa |
| Proporción de rastreos | Mayoría (centrado en los móviles) | Minoría |
| Token de robots.txt | Googlebot | Googlebot (el mismo; no se pueden separar) |
| Se distinguen mediante | Cabecera HTTP user-agent | Cabecera HTTP user-agent |
Token de producto de robots.txt (ambos): Googlebot
Otros rastreadores de Google que verás en los registros
| Rastreador | Token de robots | Nota |
|---|---|---|
| Googlebot | Googlebot | Rastreador principal de Search |
| Googlebot-Image / -Video / -News | Googlebot-Image, etc. (o Googlebot) | Usa las cadenas UA de Googlebot |
| Google-InspectionTool | Google-InspectionTool (o Googlebot) | Pruebas de inspección de URL / resultados enriquecidos |
| Storebot-Google | Storebot-Google | Shopping |
| AdsBot | AdsBot-Google | Ignora la regla global * de robots.txt |
| Google-Safety | — | Ignora robots.txt por completo |
| GoogleOther / Google-Extended | GoogleOther / Google-Extended | I+D / entrenamiento de IA; consulta rastreores de IA |
Datos rápidos
- Límite de descarga: aproximadamente 2 MB por URL (los PDF, 64 MB), en 2026; lo que queda después no se descarga. («No está fijado».)
- Renderiza con Chromium evergreen, en una cola separada y posterior (rastrear ≠ renderizar).
crawl-delay: Google lo ignora (Bing lo respeta).429/5xx: «reduce el ritmo» temporal; afecta a todo el hostname.- Verifica mediante DNS inverso + directo o rangos de IP publicados; nunca solo con la cadena UA.
- Rastrear no es un factor de posicionamiento; bloquear con robots no es desindexar.
Verifica que un bot sea realmente Googlebot
La cabecera user-agent se puede falsificar con facilidad, así que confírmalo con una búsqueda de DNS inverso (debe terminar en un dominio de Google) seguida de una búsqueda de DNS directo (debe resolver de nuevo a la misma IP).
macOS / Linux
# 1) Reverse-DNS the IP from your logs — it should end in
# googlebot.com, google.com, or googleusercontent.com
host 66.249.66.1
# → 1.66.249.66.in-addr.arpa domain name pointer crawl-66-249-66-1.googlebot.com
# 2) Forward-DNS that hostname back — it must resolve to the same IP
host crawl-66-249-66-1.googlebot.com
# → crawl-66-249-66-1.googlebot.com has address 66.249.66.1Windows
nslookup 66.249.66.1
nslookup crawl-66-249-66-1.googlebot.comSi la búsqueda inversa no termina en un dominio de Google o la búsqueda directa no coincide con la IP original, no es Googlebot.
Verifica a escala contra los rangos de IP de Google
Para comprobaciones a gran escala, compara las IP de origen con los rangos CIDR publicados por Google en vez de hacer DNS por cada solicitud. Google dividió el antiguo googlebot.json único en varios archivos por categoría; Googlebot vive en common-crawlers.json:
# Fetch the current Googlebot (common crawlers) ranges
curl -s https://www.gstatic.com/ipranges/common-crawlers.json
# The legacy URL still works and redirects to the same data:
# https://developers.google.com/static/search/apis/ipranges/googlebot.jsonCarga los prefijos CIDR de ese JSON y comprueba si cada IP registrada pertenece a ellos antes de confiar en una visita que diga ser «Googlebot».
Recursos que merecen tu tiempo
Mis textos relacionados
- ¿Qué es Googlebot y cómo funciona? — mi guía completa de Ahrefs sobre Googlebot, con detalles de rastreo, control y verificación.
- Conoce los nuevos rastreadores web: los bots de IA se acercan a los bots de los motores de búsqueda — cómo se compara Googlebot con los rastreadores de IA por proporción y velocidad.
- Problemas y buenas prácticas de SEO para JavaScript — el lado del renderizado de lo que hace Googlebot.
- Indexada aunque bloqueada por robots.txt — por qué una URL bloqueada por robots todavía puede indexarse.
- Guía de SEO técnico para principiantes — dónde encaja Googlebot en el panorama general.
Mis charlas
- Cómo funciona la Búsqueda (SlideShare) — mi explicación del rastreo, renderizado, indexación y posicionamiento. (Se aplica el descargo habitual: “This is my understanding of systems… not going to be 100% complete or accurate.” (traducción) «esta es mi comprensión de los sistemas… no será 100 % completa ni exacta».)
De otras fuentes
- Serie Crawling December de Google — el mejor conjunto concentrado de explicaciones oficiales sobre rastreo.
- r/TechSEO — la comunidad para depurar rastreo e indexación.
- Googlebot: qué es, cómo funciona y cómo optimizarlo (Search Engine Land) — guía práctica exhaustiva, con la profundidad editorial de SEL; buena para una segunda opinión sobre los fundamentos.
- Google explica cómo funciona el rastreo en 2026 (Barry Schwartz, Search Engine Land) — explicación sólida de la publicación Inside Googlebot de Gary Illyes de marzo de 2026, incluida la aclaración del límite de 2 MB.
- Google dice que despliega cientos de rastreadores no documentados (Search Engine Journal) — trata en profundidad las declaraciones de Gary Illyes de que llamar a todo Googlebot es un nombre engañoso.
- ¿Han terminado las dos oleadas de indexación de Google? (Onely) — conversación registrada de Martin Splitt sobre la cola de rastreo y renderizado y cómo se reduce la diferencia; sigue siendo el tratamiento más claro del momento de WRS en la industria.
- Google revela secretos del renderizado de JavaScript en Chrome Dev Summit 2018 (Lumar) — notas detalladas sobre el comportamiento sin estado de WRS (cookies/localStorage borrados, no descarga de imágenes y WebSockets no compatibles) que siguen siendo pertinentes.
- De Googlebot a GPTBot: ¿quién rastrea tu sitio? (blog de Cloudflare) — datos de Cloudflare Radar sobre proporción y velocidad de rastreadores, con Googlebot a la cabeza del tráfico de «bots buenos».
- ¿Era realmente un bot de Google el que rastreaba mi sitio? (Imperva Research) — análisis basado en datos de la suplantación de Googlebot; contexto para entender por qué importa la verificación DNS.
Estadísticas que merece la pena citar
- Googlebot es el rastreador más rápido de la web. Según mi lectura de los datos de Cloudflare Radar: “Googlebot is the fastest crawler on the web according to Cloudflare Radar, with Ahrefsbot being the 2nd fastest.” (traducción) «Googlebot es el rastreador más rápido de la web según Cloudflare Radar, y Ahrefsbot es el segundo más rápido». Fuente
- Los bots de IA se acercan a los bots de búsqueda. Según mi análisis de Cloudflare Radar, los rastreadores de motores de búsqueda (entre ellos Googlebot) siguen siendo los que más rastrean, pero los bots de IA son un claro número dos y avanzan para superarlos en un par de años. Fuente
- Límite de bytes: aproximadamente 2 MB por URL (los PDF, 64 MB): es el límite de descarga documentado de Googlebot en 2026, con la advertencia explícita de que la cifra no es fija. Fuente
Errores de Googlebot que debes evitar
Usar robots.txt para intentar desindexar una página. robots.txt detiene el rastreo, no la indexación. Una URL bloqueada por robots todavía puede aparecer en los resultados (indexada solo por URL) si algo enlaza a ella. Haz esto: permite que Google rastree la página y añade una etiqueta noindex; es la única forma fiable de retirarla.
Intentar dirigirte por separado al rastreador de sobremesa o al de smartphone en robots.txt. Ambos comparten el único token de producto Googlebot, así que una regla escrita para uno se aplica a los dos. Haz esto: si necesitas un comportamiento distinto por dispositivo, lee la cabecera HTTP user-agent de la solicitud en tu propia lógica del lado del servidor; robots.txt no puede establecer esa distinción.
Dejar que las versiones móvil y de sobremesa de una página diverjan. Con la indexación centrada en los móviles, la vista del agente de smartphone es la que se indexa y posiciona. El contenido, los datos estructurados, los metadatos o las etiquetas de robots que solo existen en sobremesa son prácticamente invisibles para Google. Haz esto: mantén ambas versiones sincronizadas y comprueba qué ve realmente el agente de smartphone.
Confiar en crawl-delay para ralentizar Googlebot. Google no procesa en absoluto la directiva no estándar crawl-delay; es una palanca exclusiva de Bing. Haz esto: devuelve 429/500/503 si de verdad necesitas que Google reduzca el ritmo, entendiendo que eso ralentiza todo el hostname y solo dura uno o dos días antes de que los errores continuados empiecen a sacar páginas del índice.
Dar por buena la cadena de user-agent Googlebot de tus registros. La cabecera UA se falsifica con facilidad y mucho tráfico que afirma ser Googlebot no lo es. Haz esto: verifica mediante DNS inverso + directo o contra los rangos de IP publicados por Google antes de tratar como real el tráfico «Googlebot» de tus analíticas.
Suponer que la navegación exclusiva de JavaScript (controladores de clic, sin un <a href> real) se descubrirá y renderizará como un enlace normal. Googlebot descubre las URL principalmente mediante enlaces, y el renderizado ocurre después en una cola separada y sin estado que no ejecuta interacciones arbitrarias de la interfaz. Haz esto: expón cada ruta importante como un enlace <a href> real que funcione sin JavaScript.
Tratar la frecuencia de rastreo como una palanca de posicionamiento. Que te rastreen más a menudo no es un marcador; es simplemente la puerta que debes atravesar para poder posicionarte. Haz esto: dedica el esfuerzo al contenido y a la salud técnica, no a intentar atraer más visitas de rastreo por sí mismas.
Problemas habituales de Googlebot
Una página está bloqueada en robots.txt, pero sigue apareciendo en las búsquedas
- Causa: robots.txt solo detiene el rastreo, no la indexación. Si otras páginas enlazan a la URL bloqueada, Google todavía puede indexarla solo por URL (normalmente sin fragmento descriptivo).
- Solución: si realmente quieres que desaparezca de los resultados, permite el rastreo en
robots.txty añade una etiquetanoindex; Googlebot tiene que poder leer la página para ver la etiqueta. Confirma la solución con la herramienta robots-txt-tester y vuelve a comprobar el estado de la URL cuando se haya rastreado de nuevo.
El contenido renderizado por JavaScript no aparece en el índice
- Causa: rastrear y renderizar son pasos separados. El HTML descargado se pone en cola para renderizarse —normalmente durante unos segundos, aunque a veces mucho más— antes de que un Chromium sin interfaz ejecute el JavaScript. El contenido que depende de una navegación que solo funciona al hacer clic o que no usa un enlace
<a href>puede no renderizarse nunca, porque el servicio de renderizado web no ejecuta interacciones arbitrarias de la interfaz. - Solución: comprueba si el contenido existe en la respuesta HTML sin procesar o solo después de ejecutar JS, y asegúrate de que las rutas importantes sean enlaces
<a href>reales. La herramienta render-gap está hecha exactamente para esta comprobación: muestra la diferencia entre lo que se descarga y lo que realmente se renderiza.
Los registros del servidor muestran mucho tráfico «Googlebot» que parece extraño
- Causa: la cadena de user-agent
Googlebotse falsifica con facilidad. Una parte significativa del tráfico que afirma ser Googlebot en los registros sin procesar son impostores. - Solución: verifica mediante DNS inverso (debe resolver a un hostname que termine en
googlebot.com,google.comogoogleusercontent.com) y después DNS directo de vuelta a la misma IP, o compara con los rangos de IP publicados por Google (common-crawlers.json) para comprobaciones masivas de registros; consulta la pestaña Scripts para ambos métodos o pasa los registros por la herramienta log-file-analyzer, que marca automáticamente las visitas de Googlebot falsificadas.
La velocidad de rastreo cae de repente
- Causa: la velocidad de rastreo de Googlebot es algorítmica y se autorregula; respuestas continuadas
429,500,503o timeouts le indican que reduzca el ritmo, y esa ralentización se aplica a todo el hostname, no solo a las URL con errores. - Solución: comprueba las tasas de errores recientes del servidor y los códigos de respuesta con la herramienta http-status-checker o con tus registros. Si los errores duran más de uno o dos días, espera que las páginas empiecen a salir del índice, no solo que el rastreo sea más lento. Corregir la causa de
5xx/429es lo que restaura la velocidad de rastreo; no existe una palanca independiente para «desralentizarlo».
El contenido que solo existe en sobremesa no se posiciona
- Causa: con la indexación centrada en los móviles, la vista del agente de smartphone es la que se indexa y posiciona. Si el contenido, los datos estructurados o los metadatos solo existen en la versión de sobremesa, son prácticamente invisibles para Google.
- Solución: compara lo que sirven las versiones móvil y de sobremesa; usa la herramienta mobile-friendly-tester para ver lo que renderiza el agente de smartphone y vuelve a sincronizar ambas versiones.
Herramientas para trabajar con Googlebot
- robots-txt-tester — comprueba si una URL concreta está permitida o bloqueada para
Googlebotantes de dar por hecho que turobots.txthace lo que crees. - log-file-analyzer — analiza los registros del servidor para ver la actividad real de rastreo de Googlebot y marca el tráfico que afirma ser Googlebot pero no supera la verificación de IP/DNS.
- render-gap — compara lo que descarga Googlebot con lo que realmente se renderiza después de ejecutar JavaScript; es directamente útil para la distinción entre rastreo y renderizado de este artículo.
- mobile-friendly-tester — comprueba qué ve en una página el rastreador de smartphone (el principal con la indexación centrada en los móviles).
- http-status-checker — confirma los códigos de estado que devuelve tu servidor, ya que las respuestas continuadas
429/5xxson las que realmente ralentizan la velocidad de rastreo de Googlebot.
De terceros: la herramienta de inspección de URL de Google Search Console muestra cómo Googlebot rastreó y renderizó por última vez una URL concreta, incluido qué rastreador (móvil o de sobremesa) la descargó. Screaming Frog puede rastrear un sitio simulando ser Googlebot para comparar el HTML sin procesar con la salida renderizada a escala.
Cuestionario
Cinco preguntas para comprobar qué has retenido sobre Googlebot.
Registro de cambios
Actualizado el 9 ago 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.
Actualizado el 28 jul 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.
Actualizado el 18 jul 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.