Rastreo
Cómo los motores de búsqueda descubren y descargan la web: Googlebot y Bingbot, URL discovery, el programador de rastreo, el renderizado y en qué se diferencia el rastreo de la indexación y del posicionamiento. El hub de todo lo relacionado con el rastreo.
Idiomas
1 señal de evidencia en esta página
- Datos de origen enlazadosgooglebot.json
El rastreo es la primera etapa de la búsqueda (rastreo → indexación → publicación): bots como Googlebot y Bingbot descubren URLs y descargan páginas para que puedan renderizarse, indexarse y posicionarse. Es necesario para aparecer en la búsqueda, pero no es un factor de posicionamiento, y es distinto tanto de la indexación como del renderizado. La mayoría de los sitios nunca necesitan gestionar el presupuesto de rastreo; cuando el rastreo falla, los logs del servidor son la fuente de verdad. Este hub explica todo el proceso y le remite a los análisis en profundidad.
TL;DR — El rastreo es la forma en que los motores de búsqueda encuentran y descargan sus páginas. Un bot (Googlebot en el caso de Google, Bingbot en el de Bing) sigue enlaces y lee sitemaps para descubrir URLs, y después las solicita. Una página tiene que rastrearse antes de poder aparecer en la búsqueda, pero que se rastree mucho no hace que posicione mejor.
Qué es el rastreo
Los motores de búsqueda no navegan por la web como lo hace una persona. Envían programas automatizados —llamados rastreadores (crawlers), bots o arañas— que visitan páginas, descargan lo que contienen y siguen los enlaces para encontrar más páginas. El rastreador de Google es Googlebot; el de Bing es Bingbot.
Piénselo como tres pasos, en este orden:
- Rastreo (crawl) — el bot descubre una URL y descarga la página.
- Indexación (index) — el motor procesa esa página y la archiva en una enorme base de datos con todo lo que podría mostrar en los resultados.
- Publicación o posicionamiento (serve/rank) — cuando alguien busca, el motor extrae del índice las mejores coincidencias y las ordena.
El rastreo es el paso uno. Si una página nunca se rastrea, no puede indexarse, y si no está indexada, no puede posicionar. Así que el rastreo importa, pero es una puerta de acceso, no un marcador.
Cómo encuentran los rastreadores sus páginas
Dos vías principales:
- Siguiendo enlaces. Cuando un bot rastrea una página, toma los enlaces que contiene y añade esas URLs a su lista de páginas por rastrear. Un buen enlazado interno es la forma en que se encuentran las páginas nuevas.
- Sitemaps. Un sitemap XML es una lista de sus URLs que se entrega directamente a los motores de búsqueda para que no tengan que descubrirlo todo a través de enlaces.
También existen opciones de «push» con las que se avisa activamente a un motor de que una página ha cambiado —más sobre ellas más abajo—, pero los enlaces y los sitemaps hacen casi todo el trabajo.
Cómo ayudar a los motores de búsqueda a rastrear su sitio
- Enlace sus páginas importantes desde otras páginas (en especial desde la página de inicio y la navegación principal).
- Envíe un sitemap XML en Google Search Console y en Bing Webmaster Tools.
- No bloquee por accidente páginas que quiere que se encuentren (revise su
robots.txt). - Mantenga su servidor rápido y en buen estado: si va lento o devuelve errores, los bots se retiran y rastrean menos.
Lo que la mayoría de la gente entiende mal
El rastreo no es posicionamiento. Que le rastreen más a menudo no le hará
subir en los resultados. Y bloquear una página en robots.txt no la elimina de
Google: solo impide que Google la lea. Evidence for this claim robots.txt controls crawler access and is not a reliable way to keep a URL out of Google. Scope: Google Search behavior for URLs blocked by robots.txt; blocked URLs may still be indexed when discovered elsewhere. Confidence: high · Verified: Google Search Central: Introduction to robots.txt Si de verdad quiere que una página
desaparezca, deje que se rastree y añada una etiqueta noindex. (Yo mismo probé
la parte del bloqueo: véala en la versión Avanzado.)
¿Quiere la versión más profunda, con el funcionamiento del programador de rastreo, los límites de bytes y la distinción entre rastreo, indexación y posicionamiento? Cambie a la pestaña Avanzado.
TL;DR — El rastreo es la primera de las tres etapas de la búsqueda (rastreo → indexación → publicación). Los bots descubren URLs por pull (enlaces y sitemaps) y por push (IndexNow, Indexing API), y después las solicitan siguiendo una planificación algorítmica que se ajusta al estado de su servidor. Renderizar JavaScript es un paso aparte. El rastreo es necesario para posicionar, pero no es en sí mismo una señal de posicionamiento, y es distinto de la indexación: una página bloqueada por robots puede seguir estando indexada. La mayoría de los sitios no necesitan gestionar el presupuesto de rastreo; los logs son la forma de ver qué ocurrió realmente.
El rastreo es la primera de tres etapas
Tres etapas se suceden de izquierda a derecha. Rastreo: un bot descubre una URL y descarga la página. Indexación: el motor procesa la página y almacena la información que reúne los requisitos. Publicación de resultados o posicionamiento: las mejores coincidencias indexadas se ordenan para una consulta. La etapa de rastreo aparece destacada y una nota señala que no todas las páginas avanzan por todas las etapas.
© Patrick Stox LLC · CC BY 4.0 ·
Google es tajante sobre el proceso: “Google Search works in three stages, and not all pages make it through each stage” (traducción) «La Búsqueda de Google funciona en tres etapas, y no todas las páginas superan cada etapa» — rastreo, indexación y publicación. Evidence for this claim Google describes Search as three stages: crawling, indexing, and serving results. Scope: Google Search's documented processing model; it does not guarantee that a page reaches every stage. Confidence: high · Verified: Google Search Central: In-depth guide to how Google Search works La parte del «no todas las páginas lo consiguen» es lo que realmente está en juego en el SEO técnico. Una página puede rastrearse pero no indexarse, o indexarse y no publicarse nunca para una consulta. Mantener las etapas separadas mentalmente es el modelo más útil que existe aquí.
Quién hace realmente el rastreo
«Googlebot» suena a un único programa. No lo es. En mi presentación How Search Works lo describo como más de 1 000 sistemas que ejecutan una familia de rastreadores especializados —de escritorio, móvil, imágenes, noticias, video, anuncios— con las solicitudes originadas en su mayoría en Mountain View. Todos beben del mismo fondo de presupuesto de rastreo, y por eso un rastreo descontrolado de imágenes o de parámetros puede dejar sin recursos el rastreo de su contenido real.
Y ya no son solo los motores de búsqueda. En mi análisis de los datos de Cloudflare Radar (Conoce los nuevos rastreadores web), los bots de motores de búsqueda siguen siendo los que más rastrean, pero los bots de IA están firmemente en segundo lugar y camino de superarlos en el próximo par de años. Si lee sus logs, el reparto de personajes ha cambiado.
Cómo descubren URLs los rastreadores
Dos rutas de descubrimiento alimentan una misma cola de rastreo. El descubrimiento de tipo pull incluye seguir enlaces y leer sitemaps. El descubrimiento de tipo push incluye IndexNow, que usan Bing, Yandex y otros motores participantes, pero no Google para páginas generales; la Google Indexing API para páginas JobPosting y BroadcastEvent; y las notificaciones de cambios mediante lastmod del sitemap, RSS y WebSub.
© Patrick Stox LLC · CC BY 4.0 ·
El descubrimiento es tanto pull como push:
- Pull — enlaces. Google: “Other pages are discovered when Google extracts a link from a known page to a new page.” (traducción) «Otras páginas se descubren cuando Google extrae un enlace de una página conocida hacia una página nueva.» Por eso las páginas huérfanas (orphan pages, aquellas a las que nada enlaza) tienen dificultades para ser encontradas.
- Pull — sitemaps. “Still other pages are discovered when you submit a list of pages (a sitemap) for Google to crawl.” (traducción) «Otras páginas se descubren cuando se envía una lista de páginas (un sitemap) para que Google la rastree.»
- Push — notificaciones de cambio. En lugar de esperar a que se vuelva a
rastrear, se avisa al motor de que algo ha cambiado: IndexNow (Bing, Yandex y
otros; Google no lo usa para páginas generales) y la Indexing API de Google
(oficialmente solo para páginas
JobPostingyBroadcastEvent). Ellastmodde los sitemaps, RSS y WebSub completan las opciones de push.
Google llama a todo el conjunto “URL discovery.” (traducción) «descubrimiento de URLs».
Cómo obtienen las páginas los rastreadores
- La planificación es algorítmica. “Googlebot uses an algorithmic process to determine which sites to crawl, how often, and how many pages to fetch from each site.” (traducción) «Googlebot utiliza un proceso algorítmico para determinar qué sitios rastrear, con qué frecuencia y cuántas páginas obtener de cada sitio.» Usted influye en ello; no lo fija.
- El rastreo es educado. Los bots se autolimitan para no tumbar su sitio:
“they try not to crawl the site too fast to avoid overloading it… HTTP
500 errors mean ‘slow down.’” (traducción) «intentan no rastrear el sitio
demasiado rápido para evitar sobrecargarlo… los errores HTTP 500 significan
“reduce la velocidad”.» Esta es la palanca que hay detrás de ralentizar
temporalmente un rastreo: devuelva
503/429y Googlebot se contiene (durante un día o dos, no para siempre). - Hay un límite de bytes. Desde la actualización Inside Googlebot de Google de marzo de 2026, Googlebot obtiene hasta aproximadamente 2 MB por URL (frente a la cifra antigua de 15 MB), con PDFs permitidos hasta 64 MB. Si se supera, la descarga se trunca, no se rechaza: solo la parte descargada pasa a la indexación. Si su contenido crítico queda por debajo de 2 MB de código superfluo, eso importa.
- La caché reduce el costo de volver a rastrear. Los rastreadores de Google usan conditional requests y caché para no volver a descargar cada vez los recursos que no han cambiado. Google no publica una duración exacta de caché para los recursos de renderizado, así que no dé por supuesta una ventana fija de actualización para un cambio de código: espere cierto retardo, no un reflejo instantáneo.
Renderizar no es rastrear
Esto confunde a la gente constantemente. “During the crawl, Google renders the page
and runs any JavaScript it finds using a recent version of Chrome.” (traducción)
«Durante el rastreo, Google renderiza la página y ejecuta el JavaScript que
encuentra usando una versión reciente de Chrome.» El renderizado es un paso
distinto de la descarga del HTML. El renderizador (el Web Rendering Service) es
sin estado: el almacenamiento y las cookies se borran entre cargas, deniega las
solicitudes de permisos y rechaza los service workers. Si su contenido solo aparece
después de un clic o de una navegación gestionada por JS que no es un enlace
<a href> real, espere problemas de descubrimiento y de renderizado. (Tratamiento
completo en JavaScript SEO.)
Rastreo vs. indexación vs. posicionamiento
Las distinciones más importantes de esta página:
- Rastreo ≠ posicionamiento. El rastreo es necesario para estar en los resultados, pero no es una señal de posicionamiento. Una mayor velocidad de rastreo no mejorará sus posiciones. El presupuesto de rastreo es una cuestión de eficiencia, sin más.
- Rastreo ≠ indexación. Una página que bloquee en
robots.txtpuede seguir indexándose si otras páginas la enlazan: lo único que ocurre es que Google no puede ver el contenido, ni ninguna etiquetanoindexque haya puesto ahí. Como lo expresé en Indexed, though blocked by robots.txt: “crawling and indexing are two different things.” (traducción) «el rastreo y la indexación son dos cosas distintas». Para eliminar realmente una página, permita el rastreo y añadanoindex; no la bloquee.
Probé la parte del bloqueo directamente. En La historia de bloquear 2 páginas con posicionamiento alto usando Robots.txt bloqueé dos de nuestras páginas posicionadas. El resultado: “We lost a position here or there and all of the featured snippets for the pages… I expected a lot more impact, but the world didn’t end.” (traducción) «Perdimos alguna posición aquí y allá y todos los featured snippets de las páginas… Esperaba mucho más impacto, pero el mundo no se acabó.» Mi conclusión se mantiene: “Don’t block pages you want indexed. It hurts. Not as bad as you might think it does — but it still hurts.” (traducción) «No bloquee páginas que quiera tener indexadas. Duele. No tanto como podría pensar, pero duele.»
Cómo controlar el rastreo
robots.txtcontrola el rastreo, no la indexación. “A robots.txt file tells search engine crawlers which URLs the crawler can access on your site.” (traducción) «Un archivo robots.txt indica a los rastreadores de los motores de búsqueda a qué URLs puede acceder el rastreador en su sitio.» Evidence for this claim robots.txt controls crawler access and is not a reliable way to keep a URL out of Google. Scope: Google Search behavior for URLs blocked by robots.txt; blocked URLs may still be indexed when discovered elsewhere. Confidence: high · Verified: Google Search Central: Introduction to robots.txt Úselo para mantener a los bots fuera de espacios de poco valor, no como herramienta de desindexación.- La arquitectura del sitio web y los enlaces internos determinan a qué profundidad quedan las páginas y si llegan a descubrirse (véase crawl depth, profundidad de rastreo).
- Controles de velocidad de rastreo. Google retiró su control manual de velocidad de rastreo en Search Console (principios de 2024): ahora se apoya en las respuestas de su servidor y en un mínimo automático más bajo. Bing sigue ofreciendo una cuadrícula manual de Crawl Control en Bing Webmaster Tools (véase velocidad de rastreo).
Eficiencia de rastreo y presupuesto de rastreo
Los dos motores piensan el rastreo en términos de eficiencia. Gary Illyes plantea la parte de Google como límite de velocidad de rastreo + demanda de rastreo (popularidad y obsolescencia). Fabrice Canel, de Bing, lo llama su “crawl efficiency north star … to crawl a URL only when the content has been added … updated.” (traducción) «estrella polar de la eficiencia de rastreo … rastrear una URL solo cuando el contenido se ha añadido … actualizado».
La parte tranquilizadora: la mayoría de los sitios no necesitan preocuparse por esto. Google lo dice sin rodeos: si su sitio no tiene un gran número de páginas que cambian rápidamente, o si sus páginas se rastrean el mismo día en que se publican, “you don’t need to read this guide.” (traducción) «no necesita leer esta guía». Empieza a importar en torno a más de 1 millón de páginas que cambian semanalmente o más de 10 000 que cambian a diario (véanse presupuesto de rastreo y frecuencia de rastreo).
Evidence for this claim Sites without many rapidly changing pages, or whose new pages are crawled the day they are published, generally do not need crawl-budget management. Scope: large websites Confidence: high · Verified: Optimize your crawl budgetCuando el rastreo falla: cómo verlo
Antes de recurrir a una solución, determine qué etapa está fallando realmente: los síntomas y los remedios son distintos en cada una:
-
¿No se ha descubierto en absoluto? Nada enlaza a la página y falta en su sitemap. Corrija el enlazado interno y la cobertura del sitemap; véanse crawl depth (profundidad de rastreo) y frecuencia de rastreo.
-
¿Descubierta pero nunca obtenida? Errores de servidor, tiempos de espera agotados o un bloqueo en
robots.txtestán rechazando a los bots. Revise el Crawl Stats report (Informe “Estadísticas de rastreo”) de GSC y sus logs; véanse presupuesto de rastreo y velocidad de rastreo. -
¿Obtenida pero con renderizado incorrecto? El contenido depende de un clic o de una navegación solo con JS que Googlebot no ejecutará, o el WRS agota el tiempo de espera. Véase SEO en JavaScript para los modos de fallo propios del renderizado.
-
¿Obtenida y renderizada pero aún sin indexar? Esa es una decisión aparte que toma el índice; consulte el hub de Indexación en lugar de tratarlo como un problema de rastreo.
-
Log file analysis (el análisis de archivos de log) es la fuente de verdad. Sus logs de servidor muestran exactamente qué URLs visitaron realmente los bots, con qué frecuencia y qué códigos de estado recibieron: la mejor forma de detectar rastreo desperdiciado y de encontrar páginas a las que los bots nunca llegan (véase log file analysis).
-
Spider traps (trampas para arañas) —espacios infinitos de URLs generados por calendarios, navegación por facetas, IDs de sesión o explosiones de enlaces relativos— consumen en silencio su presupuesto de rastreo en URLs basura (véase spider traps).
Dónde continuar: el clúster de rastreo
Este hub es el mapa. Cada tema de abajo es su propio análisis en profundidad:
Eficiencia de rastreo: cuánto y con qué frecuencia
- Presupuesto de rastreo (crawl budget) — qué es (capacidad + demanda), qué lo desperdicia y a quién le debe importar de verdad.
- Velocidad de rastreo (crawl rate) — a qué velocidad obtienen los bots las páginas, por qué desapareció el control de velocidad de GSC y cómo acelerar o ralentizar un rastreo hoy.
- Frecuencia de rastreo (crawl frequency) — qué hace que Google vuelva a
rastrear una página antes (popularidad, obsolescencia, un
lastmodexacto) y qué no. - Crawl depth (profundidad de rastreo) — profundidad de clics frente a profundidad de recorrido del rastreo, y por qué las páginas importantes deben estar cerca de la página de inicio.
Conozca a los rastreadores: quién obtiene realmente sus páginas
- Rastreador (crawler) — qué es un rastreador web (bot, araña) y el bucle obtener → analizar → seguir que todos ejecutan.
- Agente de usuario (user-agent) — la cadena de user-agent y el token de robots.txt con los que un bot se identifica, y por qué no puede confiar solo en la cadena.
- Googlebot — el rastreador de Google: Smartphone frente a Desktop, renderizado y cómo verificarlo.
- Bingbot — el rastreador de Microsoft, en qué se diferencia y las superficies más allá de Bing a las que alimenta.
- Rastreadores de IA — los bots de las empresas de IA (entrenamiento frente a búsqueda con IA frente a descargadores activados por el usuario) y cómo controlarlos.
Diagnosticar problemas de rastreo
- Log file analysis (análisis de archivos de log) — verificar bots reales y leer qué rastrearon.
- Spider traps (crawler traps) — los patrones que generan URLs infinitas y cómo corregirlos.
Todos los temas anteriores son análisis en profundidad anidados bajo este hub; también están en la barra lateral.
Cualificar sus enlaces salientes es un control on-page relacionado que se solapa con el rastreo: estos indican a Google cómo tratar un enlace, más que si debe rastrearlo: nofollow (el comodín original, ahora una sugerencia), más rel=sponsored y rel=ugc para enlaces de pago o publicitarios y para los generados por usuarios. Los tres viven en el clúster de metaetiquetas on-page.
Ser encontrado en primer lugar es una etapa relacionada pero distinta. Cómo los motores de búsqueda descubren sus URLs —enlaces internos, sitemaps (XML, índice de sitemaps, de imágenes y de video) y los protocolos push IndexNow y la Google Indexing API (para qué sirve realmente cada uno y por qué Google no usa IndexNow)— vive ahora en su propio hub de Descubrimiento. Para el tema más amplio, véase Cómo funciona la búsqueda.
Resumen con IA
Una versión condensada de la versión Avanzado:
- Rastreo = primera etapa de la búsqueda (rastreo → indexación → publicación). Es necesario para posicionar pero no es una señal de posicionamiento, y es distinto de la indexación y del renderizado.
- El descubrimiento es pull + push: enlaces y sitemaps (pull); IndexNow y la Indexing API (push). Google lo llama “URL discovery” (traducción) «descubrimiento de URLs».
- La obtención es algorítmica y educada: Google decide qué, con qué frecuencia
y cuántas páginas, y se autolimita con
5xx/429(“slow down”, (traducción) «reduce la velocidad»). Googlebot obtiene ~2 MB por URL (PDFs hasta 64 MB) a fecha de 2026, y trunca lo que exceda. - El renderizado es aparte: el JS se ejecuta en un Chrome headless sin estado; Google almacena recursos en caché para reducir el costo de volver a rastrear, pero no publica una duración exacta, así que los cambios pueden tardar.
- Rastreo ≠ índice: una página bloqueada por robots puede seguir indexándose a
través de enlaces; use
noindex(con el rastreo permitido) para eliminar una página. El experimento de bloqueo de Patrick mostró que las páginas bloqueadas conservaron en gran medida su posicionamiento, “but it still hurts” (traducción) «pero sigue doliendo». - Presupuesto de rastreo = capacidad + demanda (popularidad + obsolescencia). La mayoría de los sitios no necesitan gestionarlo.
- Diagnostique con logs; vigile los spider traps que desperdician presupuesto. Los bots de IA son ya una parte importante y creciente del tráfico de rastreo.
Documentación oficial
Documentación de fuente primaria de los motores de búsqueda.
- Guía detallada de cómo funciona la Búsqueda de Google — la visión general de rastreo → indexación → publicación, el descubrimiento de URL y el programador de rastreo.
- Rastreo e indexación — el hub sobre robots, sitemaps, canonicalización y controles de rastreo.
- Introducción a robots.txt — qué hace (y qué no hace) robots.txt.
- Optimiza tu presupuesto de rastreo — capacidad + demanda de rastreo; quién lo necesita.
- Visión general de los rastreadores y captadores de Google — todos los user-agent de Google y los rangos de IP publicados.
- Inside Googlebot (marzo de 2026) — los límites de bytes actuales y la arquitectura de rastreo.
- Googlebot y el límite de 15 MB (2022) — el límite anterior, útil para mostrar el cambio.
- Serie «Diciembre del rastreo» (2024) — Googlebot, caché HTTP, navegación por facetas y CDNs.
Bing / Microsoft
- Serie de bingbot: maximiza la eficiencia del rastreo — la definición de rastreo de Bing y su «crawl efficiency north star» (traducción) «estrella polar de la eficiencia de rastreo».
- Herramientas para webmasters de Bing — Crawl Control — fije la velocidad y los horarios de Bingbot.
- IndexNow / indexnow.org — el protocolo push para señalar al instante las URLs modificadas.
Citas de la fuente
Declaraciones oficiales de Google y de Bing. Cada enlace es un enlace profundo que salta al pasaje citado en la página de origen.
Google — cómo funciona el rastreo
- “Google Search works in three stages, and not all pages make it through each stage.” (traducción) «La Búsqueda de Google funciona en tres etapas, y no todas las páginas superan cada etapa.» — documentación de Google Search Central. Ir a la cita
- “Other pages are discovered when Google extracts a link from a known page to a new page… Still other pages are discovered when you submit a list of pages (a sitemap) for Google to crawl. This process is called ‘URL discovery’.” (traducción) «Otras páginas se descubren cuando Google extrae un enlace de una página conocida hacia una página nueva… Otras páginas se descubren cuando se envía una lista de páginas (un sitemap) para que Google la rastree. Este proceso se denomina “URL discovery”.» Ir a la cita
- “Googlebot uses an algorithmic process to determine which sites to crawl, how often, and how many pages to fetch from each site.” (traducción) «Googlebot utiliza un proceso algorítmico para determinar qué sitios rastrear, con qué frecuencia y cuántas páginas obtener de cada sitio.» Ir a la cita
- “They try not to crawl the site too fast to avoid overloading it. This mechanism is based on the responses of the site (for example, HTTP 500 errors mean ‘slow down’).” (traducción) «Intentan no rastrear el sitio demasiado rápido para evitar sobrecargarlo. Este mecanismo se basa en las respuestas del sitio (por ejemplo, los errores HTTP 500 significan “reduce la velocidad”).» Ir a la cita
- “During the crawl, Google renders the page and runs any JavaScript it finds using a recent version of Chrome.” (traducción) «Durante el rastreo, Google renderiza la página y ejecuta el JavaScript que encuentra usando una versión reciente de Chrome.» Ir a la cita
Google — robots.txt, presupuesto de rastreo
- “A robots.txt file tells search engine crawlers which URLs the crawler can access on your site.” (traducción) «Un archivo robots.txt indica a los rastreadores de los motores de búsqueda a qué URLs puede acceder el rastreador en su sitio.» — documentación de Google Search Central. Ir a la cita
- “Taking crawl capacity and crawl demand together, Google defines a site’s crawl budget as the set of URLs that Google can and wants to crawl.” (traducción) «Tomando conjuntamente la capacidad de rastreo y la demanda de rastreo, Google define el presupuesto de rastreo de un sitio como el conjunto de URLs que Google puede y quiere rastrear.» Ir a la cita
- “If your site doesn’t have a large number of pages that change rapidly, or if your pages seem to be crawled the same day that they are published, you don’t need to read this guide.” (traducción) «Si su sitio no tiene un gran número de páginas que cambian rápidamente, o si sus páginas parecen rastrearse el mismo día en que se publican, no necesita leer esta guía.» Ir a la cita
Gary Illyes, Google (a través de la reproducción textual que hizo Search Engine Land del artículo de Google de 2017 sobre el presupuesto de rastreo)
- El límite de velocidad de rastreo es “the number of simultaneous parallel connections Googlebot may use to crawl the site, as well as the time it has to wait between the fetches.” (traducción) «el número de conexiones paralelas simultáneas que Googlebot puede usar para rastrear el sitio, así como el tiempo que debe esperar entre las descargas». La demanda de rastreo se rige por la popularidad y la obsolescencia. Leer la cobertura
Fabrice Canel, Microsoft Bing
- “Crawling is the process by which bingbot discovers new and updated documents or content to be added to Bing’s searchable index.” (traducción) «El rastreo es el proceso por el que bingbot descubre documentos o contenido nuevos y actualizados para añadirlos al índice consultable de Bing.» Ir a la cita
- “Our crawl efficiency north star is to crawl a URL only when the content has been added (URL not crawled before), updated (fresh on-page context or useful outbound links).” (traducción) «Nuestra estrella polar de la eficiencia de rastreo es rastrear una URL solo cuando el contenido se ha añadido (URL no rastreada antes), actualizado (contexto nuevo en la página o enlaces salientes útiles).» Ir a la cita
Lista de comprobación de salud del rastreo
Una revisión rápida para confirmar que los motores de búsqueda pueden encontrar y obtener lo que importa:
- Las páginas importantes están enlazadas desde algún sitio rastreable (sin huérfanas).
-
robots.txtno bloquea nada que quiera tener indexado (y sí bloquea espacios de poco valor como los resultados de búsqueda interna). - El sitemap XML está enviado en Google Search Console y en Bing Webmaster
Tools, lista solo URLs canónicas e indexables y tiene un
lastmodexacto. - El servidor devuelve respuestas rápidas y estables, con un mínimo de
5xxy de tiempos de espera agotados (los bots se ralentizan cuando su servidor sufre). - No está usando
robots.txtpara intentar desindexar: ese es el trabajo denoindex(con el rastreo permitido). - No hay spider traps que generen URLs infinitas (calendarios, facetas, IDs de sesión).
- Revisado el Crawl Stats report (Informe “Estadísticas de rastreo”) de GSC en busca de picos de códigos de respuesta y del tiempo medio de respuesta.
- Revisados los logs del servidor en busca de rastreo desperdiciado y de URLs importantes sin rastrear.
- El contenido que depende de JS es accesible mediante enlaces
<a href>reales, no mediante navegación solo con clic.
Los modelos mentales
1. El proceso: rastreo → renderizado → indexación → publicación. Cada etapa es un filtro, y “not all pages make it through each stage” (traducción) «no todas las páginas superan cada etapa». Cuando una página no rinde, localice en qué etapa está fallando antes de cambiar nada: ¿se rastreó?, ¿se renderizó?, ¿se indexó?, ¿se publicó para la consulta?
2. Los tres “no es igual a”. Mantenga estos separados y la mayor parte de la confusión sobre el rastreo desaparece:
- Rastreo ≠ indexación (las páginas bloqueadas pueden seguir indexándose a través de enlaces)
- Rastreo ≠ posicionamiento (la velocidad de rastreo no es una señal de posicionamiento)
- Rastreo ≠ renderizado (el JS se ejecuta en un paso aparte y cacheable)
3. Descubrimiento = pull + push.
Pull: enlaces + sitemaps. Push: IndexNow / Indexing API / lastmod. Si una página
no se encuentra, pregúntese qué canal debería estar transportándola, y si algo la
enlaza en absoluto.
4. Presupuesto de rastreo = capacidad + demanda. La capacidad es lo que su servidor puede soportar; la demanda es popularidad + obsolescencia. El presupuesto efectivo se eleva eliminando desperdicio (trampas, duplicados, parámetros basura) mucho más que intentando que Google rastree «más».
5. La regla de decisión para eliminar una página.
¿Quiere que desaparezca de la búsqueda? Permita el rastreo + noindex.
¿Quiere que los bots se salten un espacio por completo (y no le importa la
indexación)? Disallow en robots.txt. Nunca use Disallow para desindexar.
Controlar el rastreo: hoja de referencia rápida
Qué hace realmente cada control
| Control | ¿Detiene el rastreo? | ¿Detiene la indexación? | Úselo para |
|---|---|---|---|
Disallow en robots.txt | Sí | No | Mantener a los bots fuera de espacios de URLs de poco valor |
noindex (meta/cabecera) | No (debe ser rastreable) | Sí | Eliminar una página del índice |
rel=canonical | No | Consolida, no obliga | Señalar el duplicado preferido |
nofollow en enlaces | Desincentiva seguirlos | No | No respaldar / no rastrear un enlace |
rel="sponsored" / rel="ugc" | Sugerencia (como nofollow) | No | Etiquetar enlaces de pago o publicitarios y generados por usuarios |
5xx / 503 / 429 | Ralentiza temporalmente | No | Señal de «reduce la velocidad» a corto plazo para Googlebot |
Códigos de estado que importan a los bots
200— obtenida correctamente.301/308— redirección permanente (consolida).404/410— desaparecida; sale del índice con el tiempo (410algo más rápido).429/500/503— «reduce la velocidad» / inténtelo más tarde; si es sostenido, el rastreo cae.
Datos rápidos
- Límite de descarga de Googlebot: ~2 MB por URL (PDFs 64 MB), truncado si se supera.
- Control manual de velocidad de rastreo en GSC: retirado (enero de 2024); ahora manda la señal del servidor.
- Equivalente en Bing: cuadrícula Crawl Control en Bing Webmaster Tools.
- IndexNow: Bing/Yandex/otros, no Google. Indexing API: Google, solo JobPosting + BroadcastEvent.
Verificar que un bot es realmente Googlebot
Mucho tráfico afirma ser Googlebot. Confírmelo con una comprobación de DNS inverso y directo (Google no publica ningún atajo; los user-agent falsos son habituales).
O haga la misma comprobación a mano:
macOS / Linux
# 1) Reverse DNS the IP from your logs — it should end in googlebot.com or google.com
host 66.249.66.1
# → 1.66.249.66.in-addr.arpa domain name pointer crawl-66-249-66-1.googlebot.com
# 2) Forward DNS that hostname back — it must resolve to the same IP
host crawl-66-249-66-1.googlebot.com
# → crawl-66-249-66-1.googlebot.com has address 66.249.66.1Windows
nslookup 66.249.66.1
nslookup crawl-66-249-66-1.googlebot.comSi la búsqueda inversa no termina en un dominio de Google, o si la búsqueda directa no coincide con la IP original, no es Googlebot. También puede compararla con los rangos de IP publicados por Google (googlebot.json).
Un punto de partida seguro para robots.txt
User-agent: *
Disallow: /search # internal search result pages
Disallow: /*?*sort= # sort-order parameter spaces
Allow: /
Sitemap: https://example.com/sitemap.xmlRecuerde: Disallow bloquea el rastreo, no la indexación; no lo use para
eliminar una página de los resultados.
Herramientas para ver y gestionar el rastreo
- Google Search Console — Crawl Stats report (Informe “Estadísticas de rastreo”) — la propia visión de Google sobre cómo le rastrea: solicitudes a lo largo del tiempo, códigos de respuesta, tiempo medio de respuesta, por tipo de archivo y por tipo de Googlebot.
- Bing Webmaster Tools — información de rastreo, Crawl Control y Site Scan.
- Log file analysis del servidor — la fuente de verdad. Herramientas: Screaming Frog Log File Analyser, o volcar los logs en BigQuery o en una plataforma de logs. (Véase log file analysis.)
- Rastreadores / auditorías de sitio — Ahrefs Site Audit y Screaming Frog SEO Spider simulan un rastreo y muestran la profundidad, las cadenas de redirecciones, las URLs bloqueadas y los patrones parecidos a trampas.
- Ahrefs Webmaster Tools — rastreo y auditoría gratuitos para los sitios que verifique.
- URL Inspection (Herramienta de inspección de URLs) (GSC) — compruebe cómo se rastreó, se renderizó y se indexó una única URL.
Recursos que merecen su tiempo
Lo que he escrito al respecto
- Guía para principiantes de SEO técnico — dónde encaja el rastreo en el panorama general.
- La historia de bloquear 2 páginas con posicionamiento alto usando Robots.txt — mi experimento de primera mano sobre rastreo frente a posicionamiento.
- Indexada aunque bloqueada por robots.txt — por qué las páginas bloqueadas se siguen indexando.
- Robots.txt y SEO: todo lo que necesitas saber.
- Problemas y buenas prácticas de SEO con JavaScript — el lado del renderizado.
- Conoce los nuevos rastreadores web: los bots de IA se acercan a los bots de búsqueda.
Mis ponencias
- Cómo funciona la búsqueda (SlideShare) — mi recorrido por el rastreo, el renderizado, la indexación y el posicionamiento. (Se aplica mi advertencia habitual: «This is my understanding of systems… not going to be 100% complete or accurate.» (traducción) «Esto es mi comprensión de los sistemas… no va a ser 100 % completa ni exacta».)
De otros
- r/TechSEO — la comunidad para depurar problemas de rastreo e indexación.
- La serie «Diciembre del rastreo» de Google (oficial, pero el mejor conjunto concentrado de explicaciones sobre rastreo).
- Google explica el presupuesto de rastreo para webmasters (Search Engine Land) — reproducción textual del artículo original de Gary Illyes sobre el presupuesto de rastreo, con las definiciones de límite de velocidad de rastreo + demanda de rastreo.
- Explicación del presupuesto de rastreo de Googlebot (Search Engine Journal) — desglose en lenguaje llano del modelo de capacidad y demanda de rastreo.
- Google explica los límites de bytes de Googlebot y la arquitectura de rastreo (Search Engine Journal) — cobertura de la actualización «Inside Googlebot» de marzo de 2026; 2 MB por URL, PDFs de 64 MB, comportamiento de truncado.
- Cómo funciona Bingbot: descubrir, rastrear, extraer e indexar (Search Engine Journal) — el lado de Bing del proceso de rastreo, con contexto de Fabrice Canel.
- Límite de tamaño de archivo de Googlebot (DebugBear) — explica qué ocurre cuando una página supera el límite de descarga de Googlebot (truncado, no rechazo).
Podcasts
- Pódcast de Google sobre rastreo (Search Off the Record) — Cómo rastrea Googlebot la web. Gary Illyes y Martin Splitt sobre el pasado, el presente y el futuro de Googlebot: infraestructura de rastreo unificada, HTTP/1.1 frente a HTTP/2, conditional requests y límites de bytes. Escuchar
Videos
- Google Search Central (YouTube) — la serie How Google Search Works y las explicaciones de Martin Splitt sobre rastreo y renderizado, incluidos los videos de SEO en JavaScript. Canal
Estadísticas que merece la pena citar
- Los bots de IA se están acercando a los bots de búsqueda. Según mi análisis de Cloudflare Radar, los rastreadores de motores de búsqueda siguen siendo los que más rastrean, pero los bots de IA son un claro número 2 y van camino de superarlos en un par de años. Fuente
- Decenas de miles de millones de URLs normalizadas nunca vistas antes son descubiertas por Bing cada día: la escala del problema de descubrimiento que los motores filtran de forma agresiva (Fabrice Canel, Microsoft Bing, 2022). Cobertura
- Qué rastreadores bloquean más unos 140 millones de sitios — datos de tasa de bloqueo en robots.txt de mi estudio con Xibeijia Guan; útiles para entender cómo la web abierta filtra a los bots. Fuente
- Límite de bytes: ~2 MB por URL (PDFs 64 MB) — el límite de descarga de Googlebot documentado por Google a fecha de marzo de 2026 (frente a los 15 MB anteriores). Fuente
Póngase a prueba: rastreo
Cinco preguntas rápidas sobre cómo los motores de búsqueda descubren y obtienen páginas. Elija una respuesta para cada una y después compruebe.
Registro de cambios
Actualizado el 8 ago 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.
Actualizado el 17 jul 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.