Rastreo

Cómo los motores de búsqueda descubren y descargan la web: Googlebot y Bingbot, URL discovery, el programador de rastreo, el renderizado y en qué se diferencia el rastreo de la indexación y del posicionamiento. El hub de todo lo relacionado con el rastreo.

Publicado por primera vez: 22 jun 2026 · Última actualización: 8 ago 2026 · Avanzado
Idiomas
1 señal de evidencia en esta página

El rastreo es la primera etapa de la búsqueda (rastreo → indexación → publicación): bots como Googlebot y Bingbot descubren URLs y descargan páginas para que puedan renderizarse, indexarse y posicionarse. Es necesario para aparecer en la búsqueda, pero no es un factor de posicionamiento, y es distinto tanto de la indexación como del renderizado. La mayoría de los sitios nunca necesitan gestionar el presupuesto de rastreo; cuando el rastreo falla, los logs del servidor son la fuente de verdad. Este hub explica todo el proceso y le remite a los análisis en profundidad.

TL;DR — El rastreo es la primera de las tres etapas de la búsqueda (rastreo → indexación → publicación). Los bots descubren URLs por pull (enlaces y sitemaps) y por push (IndexNow, Indexing API), y después las solicitan siguiendo una planificación algorítmica que se ajusta al estado de su servidor. Renderizar JavaScript es un paso aparte. El rastreo es necesario para posicionar, pero no es en sí mismo una señal de posicionamiento, y es distinto de la indexación: una página bloqueada por robots puede seguir estando indexada. La mayoría de los sitios no necesitan gestionar el presupuesto de rastreo; los logs son la forma de ver qué ocurrió realmente.

El rastreo es la primera de tres etapas

El rastreo es la primera de las tres etapas. Una página debe superar cada etapa antes de poder posicionarse. Fuente: /technical-seo/how-search-works/crawling/

Tres etapas se suceden de izquierda a derecha. Rastreo: un bot descubre una URL y descarga la página. Indexación: el motor procesa la página y almacena la información que reúne los requisitos. Publicación de resultados o posicionamiento: las mejores coincidencias indexadas se ordenan para una consulta. La etapa de rastreo aparece destacada y una nota señala que no todas las páginas avanzan por todas las etapas.

© Patrick Stox LLC · CC BY 4.0 ·

Google es tajante sobre el proceso: “Google Search works in three stages, and not all pages make it through each stage” (traducción) «La Búsqueda de Google funciona en tres etapas, y no todas las páginas superan cada etapa» — rastreo, indexación y publicación. Evidence for this claim Google describes Search as three stages: crawling, indexing, and serving results. Scope: Google Search's documented processing model; it does not guarantee that a page reaches every stage. Confidence: high · Verified: Google Search Central: In-depth guide to how Google Search works La parte del «no todas las páginas lo consiguen» es lo que realmente está en juego en el SEO técnico. Una página puede rastrearse pero no indexarse, o indexarse y no publicarse nunca para una consulta. Mantener las etapas separadas mentalmente es el modelo más útil que existe aquí.

Quién hace realmente el rastreo

«Googlebot» suena a un único programa. No lo es. En mi presentación How Search Works lo describo como más de 1 000 sistemas que ejecutan una familia de rastreadores especializados —de escritorio, móvil, imágenes, noticias, video, anuncios— con las solicitudes originadas en su mayoría en Mountain View. Todos beben del mismo fondo de presupuesto de rastreo, y por eso un rastreo descontrolado de imágenes o de parámetros puede dejar sin recursos el rastreo de su contenido real.

Y ya no son solo los motores de búsqueda. En mi análisis de los datos de Cloudflare Radar (Conoce los nuevos rastreadores web), los bots de motores de búsqueda siguen siendo los que más rastrean, pero los bots de IA están firmemente en segundo lugar y camino de superarlos en el próximo par de años. Si lee sus logs, el reparto de personajes ha cambiado.

Cómo descubren URLs los rastreadores

El descubrimiento es tanto pull como push; Google llama al conjunto «URL discovery». Fuente: /technical-seo/how-search-works/crawling/

Dos rutas de descubrimiento alimentan una misma cola de rastreo. El descubrimiento de tipo pull incluye seguir enlaces y leer sitemaps. El descubrimiento de tipo push incluye IndexNow, que usan Bing, Yandex y otros motores participantes, pero no Google para páginas generales; la Google Indexing API para páginas JobPosting y BroadcastEvent; y las notificaciones de cambios mediante lastmod del sitemap, RSS y WebSub.

© Patrick Stox LLC · CC BY 4.0 ·

El descubrimiento es tanto pull como push:

  • Pull — enlaces. Google: “Other pages are discovered when Google extracts a link from a known page to a new page.” (traducción) «Otras páginas se descubren cuando Google extrae un enlace de una página conocida hacia una página nueva.» Por eso las páginas huérfanas (orphan pages, aquellas a las que nada enlaza) tienen dificultades para ser encontradas.
  • Pull — sitemaps. “Still other pages are discovered when you submit a list of pages (a sitemap) for Google to crawl.” (traducción) «Otras páginas se descubren cuando se envía una lista de páginas (un sitemap) para que Google la rastree.»
  • Push — notificaciones de cambio. En lugar de esperar a que se vuelva a rastrear, se avisa al motor de que algo ha cambiado: IndexNow (Bing, Yandex y otros; Google no lo usa para páginas generales) y la Indexing API de Google (oficialmente solo para páginas JobPosting y BroadcastEvent). El lastmod de los sitemaps, RSS y WebSub completan las opciones de push.

Google llama a todo el conjunto “URL discovery.” (traducción) «descubrimiento de URLs».

Cómo obtienen las páginas los rastreadores

  • La planificación es algorítmica. “Googlebot uses an algorithmic process to determine which sites to crawl, how often, and how many pages to fetch from each site.” (traducción) «Googlebot utiliza un proceso algorítmico para determinar qué sitios rastrear, con qué frecuencia y cuántas páginas obtener de cada sitio.» Usted influye en ello; no lo fija.
  • El rastreo es educado. Los bots se autolimitan para no tumbar su sitio: “they try not to crawl the site too fast to avoid overloading it… HTTP 500 errors mean ‘slow down.’” (traducción) «intentan no rastrear el sitio demasiado rápido para evitar sobrecargarlo… los errores HTTP 500 significan “reduce la velocidad”.» Esta es la palanca que hay detrás de ralentizar temporalmente un rastreo: devuelva 503/429 y Googlebot se contiene (durante un día o dos, no para siempre).
  • Hay un límite de bytes. Desde la actualización Inside Googlebot de Google de marzo de 2026, Googlebot obtiene hasta aproximadamente 2 MB por URL (frente a la cifra antigua de 15 MB), con PDFs permitidos hasta 64 MB. Si se supera, la descarga se trunca, no se rechaza: solo la parte descargada pasa a la indexación. Si su contenido crítico queda por debajo de 2 MB de código superfluo, eso importa.
  • La caché reduce el costo de volver a rastrear. Los rastreadores de Google usan conditional requests y caché para no volver a descargar cada vez los recursos que no han cambiado. Google no publica una duración exacta de caché para los recursos de renderizado, así que no dé por supuesta una ventana fija de actualización para un cambio de código: espere cierto retardo, no un reflejo instantáneo.
Evidence for this claim Googlebot algorithmically determines which sites to crawl, how often to crawl them, and how many pages to fetch. Scope: web Confidence: high · Verified: In-Depth Guide to How Google Search Works

Renderizar no es rastrear

Esto confunde a la gente constantemente. “During the crawl, Google renders the page and runs any JavaScript it finds using a recent version of Chrome.” (traducción) «Durante el rastreo, Google renderiza la página y ejecuta el JavaScript que encuentra usando una versión reciente de Chrome.» El renderizado es un paso distinto de la descarga del HTML. El renderizador (el Web Rendering Service) es sin estado: el almacenamiento y las cookies se borran entre cargas, deniega las solicitudes de permisos y rechaza los service workers. Si su contenido solo aparece después de un clic o de una navegación gestionada por JS que no es un enlace <a href> real, espere problemas de descubrimiento y de renderizado. (Tratamiento completo en JavaScript SEO.)

Rastreo vs. indexación vs. posicionamiento

Las distinciones más importantes de esta página:

  • Rastreo ≠ posicionamiento. El rastreo es necesario para estar en los resultados, pero no es una señal de posicionamiento. Una mayor velocidad de rastreo no mejorará sus posiciones. El presupuesto de rastreo es una cuestión de eficiencia, sin más.
  • Rastreo ≠ indexación. Una página que bloquee en robots.txt puede seguir indexándose si otras páginas la enlazan: lo único que ocurre es que Google no puede ver el contenido, ni ninguna etiqueta noindex que haya puesto ahí. Como lo expresé en Indexed, though blocked by robots.txt: “crawling and indexing are two different things.” (traducción) «el rastreo y la indexación son dos cosas distintas». Para eliminar realmente una página, permita el rastreo y añada noindex; no la bloquee.

Probé la parte del bloqueo directamente. En La historia de bloquear 2 páginas con posicionamiento alto usando Robots.txt bloqueé dos de nuestras páginas posicionadas. El resultado: “We lost a position here or there and all of the featured snippets for the pages… I expected a lot more impact, but the world didn’t end.” (traducción) «Perdimos alguna posición aquí y allá y todos los featured snippets de las páginas… Esperaba mucho más impacto, pero el mundo no se acabó.» Mi conclusión se mantiene: “Don’t block pages you want indexed. It hurts. Not as bad as you might think it does — but it still hurts.” (traducción) «No bloquee páginas que quiera tener indexadas. Duele. No tanto como podría pensar, pero duele.»

Cómo controlar el rastreo

  • robots.txt controla el rastreo, no la indexación. “A robots.txt file tells search engine crawlers which URLs the crawler can access on your site.” (traducción) «Un archivo robots.txt indica a los rastreadores de los motores de búsqueda a qué URLs puede acceder el rastreador en su sitio.» Evidence for this claim robots.txt controls crawler access and is not a reliable way to keep a URL out of Google. Scope: Google Search behavior for URLs blocked by robots.txt; blocked URLs may still be indexed when discovered elsewhere. Confidence: high · Verified: Google Search Central: Introduction to robots.txt Úselo para mantener a los bots fuera de espacios de poco valor, no como herramienta de desindexación.
  • La arquitectura del sitio web y los enlaces internos determinan a qué profundidad quedan las páginas y si llegan a descubrirse (véase crawl depth, profundidad de rastreo).
  • Controles de velocidad de rastreo. Google retiró su control manual de velocidad de rastreo en Search Console (principios de 2024): ahora se apoya en las respuestas de su servidor y en un mínimo automático más bajo. Bing sigue ofreciendo una cuadrícula manual de Crawl Control en Bing Webmaster Tools (véase velocidad de rastreo).

Eficiencia de rastreo y presupuesto de rastreo

Los dos motores piensan el rastreo en términos de eficiencia. Gary Illyes plantea la parte de Google como límite de velocidad de rastreo + demanda de rastreo (popularidad y obsolescencia). Fabrice Canel, de Bing, lo llama su “crawl efficiency north star … to crawl a URL only when the content has been added … updated.” (traducción) «estrella polar de la eficiencia de rastreo … rastrear una URL solo cuando el contenido se ha añadido … actualizado».

La parte tranquilizadora: la mayoría de los sitios no necesitan preocuparse por esto. Google lo dice sin rodeos: si su sitio no tiene un gran número de páginas que cambian rápidamente, o si sus páginas se rastrean el mismo día en que se publican, “you don’t need to read this guide.” (traducción) «no necesita leer esta guía». Empieza a importar en torno a más de 1 millón de páginas que cambian semanalmente o más de 10 000 que cambian a diario (véanse presupuesto de rastreo y frecuencia de rastreo).

Evidence for this claim Sites without many rapidly changing pages, or whose new pages are crawled the day they are published, generally do not need crawl-budget management. Scope: large websites Confidence: high · Verified: Optimize your crawl budget

Cuando el rastreo falla: cómo verlo

Antes de recurrir a una solución, determine qué etapa está fallando realmente: los síntomas y los remedios son distintos en cada una:

  • ¿No se ha descubierto en absoluto? Nada enlaza a la página y falta en su sitemap. Corrija el enlazado interno y la cobertura del sitemap; véanse crawl depth (profundidad de rastreo) y frecuencia de rastreo.

  • ¿Descubierta pero nunca obtenida? Errores de servidor, tiempos de espera agotados o un bloqueo en robots.txt están rechazando a los bots. Revise el Crawl Stats report (Informe “Estadísticas de rastreo”) de GSC y sus logs; véanse presupuesto de rastreo y velocidad de rastreo.

  • ¿Obtenida pero con renderizado incorrecto? El contenido depende de un clic o de una navegación solo con JS que Googlebot no ejecutará, o el WRS agota el tiempo de espera. Véase SEO en JavaScript para los modos de fallo propios del renderizado.

  • ¿Obtenida y renderizada pero aún sin indexar? Esa es una decisión aparte que toma el índice; consulte el hub de Indexación en lugar de tratarlo como un problema de rastreo.

  • Log file analysis (el análisis de archivos de log) es la fuente de verdad. Sus logs de servidor muestran exactamente qué URLs visitaron realmente los bots, con qué frecuencia y qué códigos de estado recibieron: la mejor forma de detectar rastreo desperdiciado y de encontrar páginas a las que los bots nunca llegan (véase log file analysis).

  • Spider traps (trampas para arañas) —espacios infinitos de URLs generados por calendarios, navegación por facetas, IDs de sesión o explosiones de enlaces relativos— consumen en silencio su presupuesto de rastreo en URLs basura (véase spider traps).

Dónde continuar: el clúster de rastreo

Este hub es el mapa. Cada tema de abajo es su propio análisis en profundidad:

Eficiencia de rastreo: cuánto y con qué frecuencia

  • Presupuesto de rastreo (crawl budget) — qué es (capacidad + demanda), qué lo desperdicia y a quién le debe importar de verdad.
  • Velocidad de rastreo (crawl rate) — a qué velocidad obtienen los bots las páginas, por qué desapareció el control de velocidad de GSC y cómo acelerar o ralentizar un rastreo hoy.
  • Frecuencia de rastreo (crawl frequency) — qué hace que Google vuelva a rastrear una página antes (popularidad, obsolescencia, un lastmod exacto) y qué no.
  • Crawl depth (profundidad de rastreo) — profundidad de clics frente a profundidad de recorrido del rastreo, y por qué las páginas importantes deben estar cerca de la página de inicio.

Conozca a los rastreadores: quién obtiene realmente sus páginas

  • Rastreador (crawler) — qué es un rastreador web (bot, araña) y el bucle obtener → analizar → seguir que todos ejecutan.
  • Agente de usuario (user-agent) — la cadena de user-agent y el token de robots.txt con los que un bot se identifica, y por qué no puede confiar solo en la cadena.
  • Googlebot — el rastreador de Google: Smartphone frente a Desktop, renderizado y cómo verificarlo.
  • Bingbot — el rastreador de Microsoft, en qué se diferencia y las superficies más allá de Bing a las que alimenta.
  • Rastreadores de IA — los bots de las empresas de IA (entrenamiento frente a búsqueda con IA frente a descargadores activados por el usuario) y cómo controlarlos.

Diagnosticar problemas de rastreo

  • Log file analysis (análisis de archivos de log) — verificar bots reales y leer qué rastrearon.
  • Spider traps (crawler traps) — los patrones que generan URLs infinitas y cómo corregirlos.

Todos los temas anteriores son análisis en profundidad anidados bajo este hub; también están en la barra lateral.

Cualificar sus enlaces salientes es un control on-page relacionado que se solapa con el rastreo: estos indican a Google cómo tratar un enlace, más que si debe rastrearlo: nofollow (el comodín original, ahora una sugerencia), más rel=sponsored y rel=ugc para enlaces de pago o publicitarios y para los generados por usuarios. Los tres viven en el clúster de metaetiquetas on-page.

Ser encontrado en primer lugar es una etapa relacionada pero distinta. Cómo los motores de búsqueda descubren sus URLs —enlaces internos, sitemaps (XML, índice de sitemaps, de imágenes y de video) y los protocolos push IndexNow y la Google Indexing API (para qué sirve realmente cada uno y por qué Google no usa IndexNow)— vive ahora en su propio hub de Descubrimiento. Para el tema más amplio, véase Cómo funciona la búsqueda.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.