Presupuesto de rastreo
Qué es realmente el presupuesto de rastreo —capacidad de rastreo más demanda de rastreo—, qué lo desperdicia y la prueba honesta para saber si su sitio es lo bastante grande como para preocuparse.
Idiomas
1 señal de evidencia en esta página
- Herramienta activa relacionadaLog File Analyzer
El presupuesto de rastreo es cuánto puede y quiere rastrear un motor de búsqueda de su sitio: la capacidad de rastreo (lo que soporta su servidor) multiplicada por la demanda de rastreo (popularidad y antigüedad). No es un factor de posicionamiento: rastrear más no mejora las posiciones. La mayoría de los sitios nunca necesita gestionarlo: Mueller dice que cien mil URL normalmente no cambian la situación y la guía de Google indica que los sitios pequeños o rastreados el mismo día no deben preocuparse. Importa sobre todo con más de 1 millón de páginas, más de 10 000 páginas que cambian a diario o muchas URL en «Discovered – currently not indexed» _(traducción)_ «Descubierto: actualmente no indexado». La palanca principal es eliminar desperdicio (navegación por facetas, duplicados, errores blandos y espacios infinitos) para que el presupuesto llegue a las URL que importan.
TL;DR — El presupuesto de rastreo es la cantidad que un motor de búsqueda está dispuesto a rastrear de su sitio. Es el resultado de multiplicar dos cosas: cuánto puede soportar su servidor y cuánto quiere rastrear Google. Rastrear más no mejora su posición, y para la mayoría de los sitios no es un problema. Si sus páginas se rastrean el mismo día en que las publica, no tiene un problema de presupuesto de rastreo.
Qué es el presupuesto de rastreo
Cuando un motor de búsqueda rastrea su sitio, no lo hace para siempre. Rastrea cierta cantidad de sus URL durante un intervalo de tiempo y luego continúa. Esa cantidad es lo que los profesionales de SEO llaman presupuesto de rastreo.
Todo se reduce a dos preguntas que el motor de búsqueda responde constantemente:
- ¿Cuánto puedo rastrear? Su servidor solo puede soportar cierta carga antes de ralentizarse o empezar a devolver errores. Google lo observa y reduce la velocidad. Es la capacidad de rastreo (en documentación antigua, el límite de frecuencia de rastreo).
- ¿Cuánto quiero rastrear? Las páginas populares y las que cambian con frecuencia se rastrean más. Las páginas a las que nadie enlaza o que nunca cambian se rastrean poco. Es la demanda de rastreo.
Multiplique las dos y obtendrá su presupuesto de rastreo: aproximadamente, el número de URL que Google puede y quiere rastrear. Evidence for this claim Google defines crawl budget using crawl capacity limit and crawl demand. Scope: Google Search crawling for larger sites. Confidence: high · Verified: Google: Large site crawl budget guide
Conviene establecer una distinción desde el principio: el presupuesto de rastreo determina si Google solicita una URL. Que después indexe lo que encuentra es una decisión posterior y separada. Una página puede rastrearse y aun así no indexarse: el rastreo no garantiza la indexación, solo es la puerta que debe atravesar primero.
Lo primero que debe entender: probablemente no tiene que preocuparse por esto
Esta es la parte que la mayoría de los artículos dejan en segundo plano. La mayoría de los sitios no tiene un problema de presupuesto de rastreo. Google lo dice directamente: si sus páginas se rastrean el mismo día en que se publican, o si su sitio no es enorme y no cambia rápidamente, puede omitir todo el tema. Evidence for this claim Google says sites without many rapidly changing pages, or whose pages are crawled the day they publish, generally do not need crawl-budget guidance. Scope: Google's rough applicability guidance, not a guarantee for every site. Confidence: high · Verified: Google: Large site crawl budget guide
Una comprobación sencilla: busque algunas de sus URL en Google o use la herramienta de inspección de URL de Search Console. Si sus páginas nuevas aparecen en uno o dos días, su presupuesto de rastreo está bien. Dedique el tiempo al contenido y a los enlaces.
El presupuesto de rastreo empieza a importar cuando un sitio tiene cientos de miles o millones de páginas, especialmente si muchas cambian constantemente (por ejemplo, una gran tienda de ecommerce o un sitio de noticias).
Rastrear más no significa obtener mejores posiciones
Conviene desmontar pronto este mito: rastrear una página con más frecuencia no la hace subir en los resultados. El rastreo es simplemente la forma en que el motor encuentra y descarga su página. Es una puerta que debe atravesar para poder posicionarse, pero una vez que lo ha hecho, la frecuencia con que vuelve a rastrearse no es un factor de posicionamiento.
Por tanto, el objetivo no es «conseguir más rastreos». Es asegurarse de que se rastreen las páginas que le importan y de que el motor no pierda tiempo con URL basura.
Qué consume el presupuesto de rastreo
Si tiene un sitio grande, el presupuesto se agota por culpa de:
- URL de filtros y ordenación (navegación por facetas): cada combinación de filtros de una tienda de ecommerce puede generar miles de URL casi idénticas.
- Páginas duplicadas: el mismo contenido accesible mediante varias URL (con y sin
www, con parámetros añadidos, etc.). - Páginas «no encontradas»: páginas que devuelven un estado
200 OK, por lo que el motor sigue rastreándolas. - Cadenas de redirecciones rotas y páginas lentas: hacen que cada rastreo cueste más.
La solución casi siempre consiste en eliminar el desperdicio para que el presupuesto llegue a las páginas reales, no en intentar convencer a Google de que rastree «más».
¿Quiere el modelo completo —capacidad de rastreo frente a demanda, umbrales exactos de tamaño, qué hacer con la navegación por facetas, cómo lo gestiona Bing de otra manera y cómo medirlo—? Cambie a la pestaña Avanzado.
TL;DR — El presupuesto de rastreo = límite de capacidad de rastreo (lo que puede soportar su servidor) × demanda de rastreo (popularidad + antigüedad + inventario percibido). Es una cuestión de eficiencia, no una señal de posicionamiento. Internamente es una programación ordenada por importancia y limitada por la carga del host, no una cuota fija por sitio. La mayoría de los sitios puede ignorarlo: Mueller considera que cien mil URL «normalmente no son suficientes» y la guía de Google dice a los sitios que se rastrean el mismo día que no se molesten. Importa cuando hay aproximadamente 1 millón o más de páginas (cambio semanal), 10 000 o más páginas que cambian a diario, o cuando crece la cantidad de URL en «Discovered – currently not indexed» (traducción) «Descubierto: actualmente no indexado». La medida con más impacto es eliminar desperdicio —facetas, duplicados, errores blandos y espacios infinitos— para consolidar el presupuesto en las URL que importan. Evidence for this claim Google defines crawl budget using crawl capacity limit and crawl demand. Scope: Google Search crawling for larger sites. Confidence: high · Verified: Google: Large site crawl budget guide
El modelo de dos factores
Google lo define claramente: “The amount of time and resources that Google devotes to crawling a site is commonly called the site’s crawl budget and it’s determined by two main elements: crawl capacity limit and crawl demand.” (traducción) «La cantidad de tiempo y recursos que Google dedica a rastrear un sitio se denomina habitualmente presupuesto de rastreo y está determinada por dos elementos principales: el límite de capacidad de rastreo y la demanda de rastreo». La formulación de Gary Illyes de 2017 es la frase breve a la que sigo recurriendo: el presupuesto de rastreo es “the number of URLs Googlebot can and wants to crawl.” (traducción) «el número de URL que Googlebot puede y quiere rastrear». Evidence for this claim Google defines crawl budget using crawl capacity limit and crawl demand. Scope: Google Search crawling for larger sites. Confidence: high · Verified: Google: Large site crawl budget guide Mantenga este alcance: el presupuesto de rastreo controla la obtención, no la indexación. Una URL rastreada sigue pasando por una decisión de indexación separada; mezclar ambas cosas exagera lo que controla el presupuesto de rastreo.
Límite de capacidad de rastreo (el lado de la oferta). Es “the maximum number of simultaneous parallel connections that Google can use to crawl a site, as well as the time delay between fetches.” (traducción) «el número máximo de conexiones paralelas simultáneas que Google puede usar para rastrear un sitio, así como el intervalo entre solicitudes». Cambia con el estado de salud de su servidor. Responda rápido y correctamente y el límite subirá; sirva respuestas lentas, errores 5xx o 429 y Googlebot reducirá la velocidad. En mi presentación How Search Works enumero los mismos factores que activan el límite: estabilidad del servidor, respuestas lentas, errores de servidor 5xx y 429 (demasiadas solicitudes). Esto es lo que el servidor «puede».
Demanda de rastreo (el lado de la demanda). Está impulsada por la popularidad (la cantidad de enlaces y la importancia de una URL) y la antigüedad (cuánto tiempo ha pasado desde el último rastreo y con qué frecuencia cambia). La misma presentación desglosa la demanda en PageRank, frecuencia de cambio de la página, tiempo desde el último rastreo y cambios importantes del sitio. Lo esencial es que Google señala el inventario percibido como la palanca que más puede controlar: “Without guidance from you, Google tries to crawl all or most of the URLs that it knows about on your site. If many of these URLs are duplicates, or you don’t want them crawled for some other reason… this wastes a lot of Google crawling time on your site. This is the factor that you can positively control the most.” (traducción) «Sin indicaciones suyas, Google intenta rastrear todas o la mayoría de las URL que conoce de su sitio. Si muchas son duplicadas, o no quiere que se rastreen por algún otro motivo, se desperdicia mucho tiempo de rastreo de Google. Es la palanca que puede gobernar con mayor efecto positivo».
Crawl demand comes from popularity, genuine change, and the value of the URL inventory. It orders URLs in a priority queue. Crawl capacity comes from server response speed, stability, and error behavior. It limits how far Googlebot proceeds through that queue. Their interaction is the site's realized crawl budget, not a fixed daily URL quota.
© Patrick Stox LLC · CC BY 4.0 ·
Un par de hechos estructurales que suelen sorprender:
- El presupuesto es por nombre de host.
https://www.example.com/yhttps://code.example.com/son dos nombres de host diferentes y, por tanto, tienen presupuestos de rastreo separados. Los subdominios no comparten el presupuesto. - Probablemente los distintos tipos de Googlebot usan un mismo conjunto. Según mis propios informes, las variantes de imagen, noticias, vídeo, anuncios y demás parecen recurrir al mismo presupuesto por sitio. No tengo una fuente primaria actual que lo determine exactamente, así que considérelo una observación práctica, no una política documentada. En cualquier caso, consulte el desglose por tipo de rastreador del informe Estadísticas de rastreo si sospecha que un tipo está desplazando a los demás.
Qué es realmente en el interior: programación por importancia
«Presupuesto de rastreo» es un término paraguas creado por el sector del SEO. Internamente se parece más a una programación limitada por la carga del host. Illyes ha descrito que el programador de Google “sets a bucket of URLs in importance order and GoogleBot will crawl in that order based on the schedule the host load decided. If Google thinks your server can handle it, it will crawl the whole bucket, if not, it will stop.” (traducción) «crea un grupo de URL ordenadas por importancia y Googlebot las rastrea en ese orden según el programa que determina la carga del host. Si Google considera que el servidor puede soportarlo, rastreará todo el grupo; si no, se detendrá».
Eso cambia la forma de ver todo el tema. No es una cuota plana de «recibe N páginas al día», sino una cola priorizada, y el rastreo sigue la demanda de búsqueda. Illyes añade: “If search demand goes down, then that also correlates to the crawl limit going down,” (traducción) «si la demanda de búsqueda baja, eso también se correlaciona con una bajada del límite de rastreo», y “if you want to increase how much we crawl, then you somehow have to convince search that your stuff is worth fetching, which is basically what the scheduler is listening to.” (traducción) «si quiere que rastreemos más, de algún modo tiene que convencer a la búsqueda de que su contenido merece obtenerse, que es básicamente lo que escucha el programador». El equipo de Search Relations ha llamado explícitamente falsa la idea de una «cuota fija diaria de páginas».
¿Tiene realmente su sitio un problema de presupuesto de rastreo?
Esta es la sección más valiosa, así que seré directo: la mayoría de los sitios no tiene que preocuparse por el presupuesto de rastreo. La propia guía de Google empieza rebajando la alarma: “If your site doesn’t have a large number of pages that change rapidly, or if your pages seem to be crawled the same day that they are published, you don’t need to read this guide. For Google Search specifically, merely keeping your sitemap up to date and checking your index coverage regularly is adequate.” (traducción) «Si su sitio no tiene muchas páginas que cambien rápidamente, o si parece que sus páginas se rastrean el mismo día en que se publican, no necesita leer esta guía. Para la Búsqueda de Google, basta con mantener actualizado el sitemap y comprobar periódicamente la cobertura del índice». Evidence for this claim Google says sites without many rapidly changing pages, or whose pages are crawled the day they publish, generally do not need crawl-budget guidance. Scope: Google's rough applicability guidance, not a guarantee for every site. Confidence: high · Verified: Google: Large site crawl budget guide
John Mueller dio la cifra concreta: “100k URLs is usually not enough to affect crawl budget (it’s <1/minute over 3 months).” (traducción) «Cien mil URL normalmente no bastan para afectar al presupuesto de rastreo (son menos de una por minuto durante 3 meses)». Si está por debajo de seis cifras de URL y las páginas se rastrean rápidamente, siga adelante.
Cuando sí importa, los umbrales aproximados de Google son:
- Sitios grandes: más de 1 millón de páginas únicas cuyo contenido cambia con frecuencia moderada (aproximadamente cada semana).
- Sitios medianos o grandes: más de 10 000 páginas únicas con contenido que cambia muy rápidamente (a diario).
- Sitios con una gran parte de sus URL clasificadas como «Discovered – currently not indexed» (traducción) «Descubierto: actualmente no indexado» en Search Console: es la señal de alarma de que Google conoce las URL pero no llega a rastrearlas.
Google añade la advertencia de que “the numbers given here are a rough estimate… not exact thresholds.” (traducción) «las cifras indicadas son una estimación aproximada, no umbrales exactos». Incluso en los sitios grandes, mi experiencia aporta un matiz: suelen retrasarse las páginas nuevas, con pocos enlaces o estáticas, no las populares.
¿Afecta el presupuesto de rastreo al posicionamiento? No.
El rastreo es necesario para posicionarse, pero no es una señal de posicionamiento. Google dijo en 2017: “An increased crawl rate will not necessarily lead to better positions in Search results. Google uses hundreds of signals to rank the results, and while crawling is necessary for being in the results, it’s not a ranking signal.” (traducción) «Aumentar la frecuencia de rastreo no necesariamente conduce a mejores posiciones en los resultados de búsqueda. Google emplea cientos de señales para ordenar los resultados y, aunque el rastreo es necesario para aparecer en ellos, no es una señal de posicionamiento». En mi guía de Ahrefs lo expreso igual: “More crawling doesn’t mean you’ll rank better, but if your pages aren’t crawled and indexed they aren’t going to rank at all.” (traducción) «Rastrear más no significa que vaya a posicionarse mejor, pero si sus páginas no se rastrean ni se indexan, no van a posicionarse». Considere el presupuesto de rastreo un problema de eficiencia, sin más.
Qué consume el presupuesto de rastreo
Illyes publicó la lista canónica de URL de bajo valor añadido “in order of significance” (traducción) «en orden de importancia»:
- Navegación por facetas e identificadores de sesión: el principal culpable, especialmente las combinaciones de filtros y ordenación de ecommerce que multiplican las URL de forma combinatoria.
- Contenido duplicado en el sitio: las variantes técnicas clásicas: HTTP frente a HTTPS, no-www frente a www, barra final frente a ninguna, mayúsculas frente a minúsculas, páginas predeterminadas o index y parámetros de URL. (Según una estimación interna de Google, aproximadamente el 60 % de la web es contenido duplicado.)
- Páginas de error blandas: los errores blandos que devuelven
200siguen rastreándose. - Páginas pirateadas.
- Espacios infinitos y proxies: calendarios, paginación de desplazamiento infinito que duplica contenido y combinaciones facetadas; los patrones clásicos de trampa para arañas.
- Contenido de baja calidad y spam.
El coste es concreto: “Wasting server resources on pages like these will drain crawl activity from pages that do actually have value, which may cause a significant delay in discovering great content on a site.” (traducción) «Desperdiciar recursos del servidor en páginas como estas desviará la actividad de rastreo de las páginas que sí tienen valor, lo que puede retrasar considerablemente el descubrimiento de contenido excelente del sitio». Además, las cadenas largas de redirecciones “have a negative effect on crawling” (traducción) «tienen un efecto negativo en el rastreo», y las páginas lentas y pesadas hacen que cada solicitud sea más cara.
Cómo optimizarlo
Todo consiste en consolidar el presupuesto en las URL que importan:
- Consolide los duplicados. Google: “Consolidate duplicate content to focus crawling on unique content rather than unique URLs.” (traducción) «Consolide el contenido duplicado para centrar el rastreo en contenido único y no en URL únicas». Elija un host, un protocolo y una convención de barra final; haga la canonicalización y gestione los parámetros.
- Bloquee las rutas realmente inútiles con
robots.txt: solo las que nunca quiera que se rastreen. Para la navegación por facetas, las opciones habituales son bloquear las rutas con parámetros enrobots.txto usar#en lugar de?para que las URL no sean rastreables. - No use
noindexpara ahorrar presupuesto. Google: “Don’t use noindex, as Google will still request, but then drop the page when it sees a noindex meta tag or header in the HTTP response, wasting crawling time.” (traducción) «No use noindex, porque Google seguirá solicitando la página y después la descartará al ver una metaetiqueta noindex o un encabezado en la respuesta HTTP, desperdiciando tiempo de rastreo». La solicitud sigue teniendo un coste. Bloquéela enrobots.txtsi nunca quiere que se obtenga. - No espere que
robots.txtredistribuya el presupuesto. “Google won’t shift this newly available crawl budget to other pages unless Google is already hitting your site’s serving limit.” (traducción) «Google no trasladará este presupuesto de rastreo recién disponible a otras páginas a menos que ya esté alcanzando el límite de servicio de su sitio». Bloquear basura es buena higiene, pero no entrega los rastreos liberados a sus buenas páginas si no estaba limitado por la capacidad. - Corrija los errores blandos; devuelva 404/410 reales para páginas eliminadas. “A 404 status code is a strong signal not to crawl that URL again.” (traducción) «Un código de estado 404 es una señal fuerte para no volver a rastrear esa URL».
- Acorte las cadenas de redirecciones, mantenga los sitemaps actualizados (con un
lastmodhonesto) y mejore la velocidad del servidor. - Refuerce los enlaces internos a páginas importantes y nuevas: es más fácil que cualquier otra cosa porque está totalmente bajo su control.
Y las dos —solo dos— formas que Google menciona para aumentar realmente el presupuesto son: “Add more server resources… [and] optimize your content’s quality.” (traducción) «Añadir más recursos al servidor y optimizar la calidad del contenido». La trampa es que un servidor más rápido eleva el techo de capacidad, pero si la demanda es baja Google seguirá rastreando menos. Necesita ambas cosas.
Cómo medirlo
- GSC > Settings > Crawl Stats report: solicitudes de rastreo totales a lo largo del tiempo, tiempo medio de respuesta, estado del host y desglose por código de respuesta, tipo de archivo y tipo de Googlebot. Es la visión de Google sobre cómo rastrea su sitio.
- Análisis de archivos de registro del servidor: la fuente de verdad. Muestra las visitas reales de Googlebot por patrón de URL, para que pueda ver el desperdicio de rastreo y las páginas importantes que no se han rastreado. Verifique que el bot sea realmente Googlebot mediante DNS inverso y directo o con los rangos de IP publicados por Google (muchos bots falsos suplantan el agente de usuario).
- «Discovered – currently not indexed» (traducción) «Descubierto: actualmente no indexado» en GSC: considere que una acumulación creciente es una señal de alarma del presupuesto de rastreo: Google conoce las URL, pero no llega a ellas.
In a synthetic cohort, product pages are 28 percent of the URL inventory, 24 percent of Googlebot requests, and 52 percent of useful 200 responses. Category pages are 7, 10, and 21 percent. Facet URLs are 45, 61, and 8 percent. Gone URLs are 20, 5, and 0 percent. The figures illustrate comparison logic, not a live log sample.
Bing y otros motores: «eficiencia de rastreo»
Bing replantea el tema como eficiencia de rastreo, no como presupuesto. La definición de Fabrice Canel es: “The crawl efficiency is how often we crawl and discover new and fresh content per page crawled.” (traducción) «La eficiencia de rastreo es la frecuencia con la que rastreamos y descubrimos contenido nuevo y actualizado por cada página rastreada». El objetivo es “crawl an URL only when the content has been added (URL not crawled before), updated (fresh on-page context or useful outbound links).” (traducción) «rastrear una URL solo cuando se ha añadido el contenido (la URL no se había rastreado antes) o se ha actualizado (contexto nuevo en la página o enlaces salientes útiles)». La filosofía directa de Bing es: “Less is more for SEO. Never forget that. Less URLs to crawl, better for SEO.” (traducción) «Para el SEO, menos es más: no lo olvide. Menos URL que rastrear significa mejor SEO».
La solución preferida de Bing es IndexNow: enviar las URL modificadas para que bingbot no tenga que hacer rastreos exploratorios; y Crawl Control en Bing Webmaster Tools, que permite programar por hora cuándo rastrea bingbot para proteger la carga del servidor. Esta es una diferencia real entre Google y Bing: Google retiró su antiguo limitador de frecuencia de rastreo en Search Console, mientras que Bing todavía permite configurar activamente el horario de rastreo.
Mitos sobre el presupuesto de rastreo, corregidos
- «Todo sitio debe optimizar el presupuesto de rastreo». No: la mayoría no debería hacerlo. Si el rastreo es el mismo día y tiene menos de cien mil URL, está bien.
- «Más rastreo = mejores posiciones». No. El rastreo es necesario, pero no es una señal de posicionamiento.
- «Es una cuota fija diaria de páginas». No: es una programación impulsada por la importancia y limitada por la carga del host.
- «Use
noindexpara ahorrar presupuesto». No: Google solicita primero la página. - «Bloquee páginas en
robots.txtpara dar más presupuesto a otras». Por lo general, no, salvo que ya esté en el límite de servicio. - «Un servidor más rápido eleva por sí solo el presupuesto». Solo eleva el techo de capacidad; una demanda baja sigue produciendo menos rastreos.
Para conocer el flujo más amplio en el que encaja esto —descubrimiento, programador de rastreo, renderizado y diferencias entre rastreo e indexación—, consulte el hub de rastreo. Los temas relacionados (frecuencia de rastreo, demanda de rastreo, trampas para arañas y análisis de archivos de registro) profundizan en cada parte.
Resumen de IA
Una síntesis de la versión avanzada:
- Presupuesto de rastreo = límite de capacidad de rastreo × demanda de rastreo. La capacidad es lo que soporta su servidor (sube con respuestas rápidas y correctas, baja con
5xx/429); la demanda es popularidad + antigüedad + inventario percibido. La frase de Google: “the number of URLs Googlebot can and wants to crawl.” (traducción) «el número de URL que Googlebot puede y quiere rastrear». - No es un factor de posicionamiento. El rastreo es necesario para posicionarse, pero rastrear más no mejora las posiciones: es una cuestión de eficiencia.
- Internamente es una programación por importancia limitada por la carga del host: una cola priorizada, no una cuota fija diaria de páginas. El rastreo sigue la demanda de búsqueda.
- La mayoría de los sitios no necesita gestionarlo. Mueller: cien mil URL normalmente no bastan para que importe. Google: si las páginas se rastrean el mismo día, omita la guía. Importa con aproximadamente 1 millón o más de páginas (cambio semanal), 10 000 o más (cambio diario), o una gran acumulación de «Discovered – currently not indexed» (traducción) «Descubierto: actualmente no indexado».
- Lo que lo consume (en el orden de Google): navegación por facetas/ID de sesión, contenido duplicado, errores blandos, páginas pirateadas, espacios infinitos y contenido de baja calidad, además de cadenas de redirecciones y páginas lentas.
- Optimice eliminando desperdicio: consolide duplicados, bloquee rutas inútiles en
robots.txt(nonoindex: Google solicita primero), corrija los errores blandos, acorte redirecciones, mantenga limpios los sitemaps y refuerce enlaces internos. Solo hay dos formas de aumentar realmente el presupuesto: más capacidad del servidor y mayor calidad del contenido. - Mídalo con Estadísticas de rastreo de GSC, análisis de archivos de registro y el informe «Discovered – currently not indexed» (traducción) «Descubierto: actualmente no indexado».
- Bing lo llama eficiencia de rastreo («menos es más») y promueve IndexNow + Crawl Control frente al enfoque más pasivo de Google.
Documentación oficial
Documentación de fuentes primarias de los motores de búsqueda.
- Optimice su presupuesto de rastreo: documento canónico (trasladado desde la antigua URL de la guía para propietarios de sitios grandes en la documentación de infraestructura de rastreo de Google; última actualización: diciembre de 2025): capacidad y demanda de rastreo, quién lo necesita, lista de desperdicios y optimización. Empiece aquí.
- Qué significa el presupuesto de rastreo para Googlebot (Gary Illyes, 2017): formulación original: límite de frecuencia de rastreo + demanda de rastreo y categorías de URL de bajo valor añadido.
- Rastreo e indexación: hub para robots, sitemaps, canonicalización y controles de rastreo.
- Serie Crawling December (2024): Googlebot, caché HTTP, navegación por facetas y CDN.
Bing / Microsoft
- Serie de bingbot: maximizar la eficiencia de rastreo: reformulación de Bing como «eficiencia de rastreo» y su objetivo principal.
- Serie de bingbot: optimizar la frecuencia de rastreo: cómo decide Bing la frecuencia de nuevos rastreos.
- Bing Webmaster Tools — Crawl Control: programe por hora cuándo rastrea bingbot.
- IndexNow / indexnow.org: envíe las URL modificadas para que los motores no tengan que hacer rastreos exploratorios.
Citas de las fuentes
Declaraciones registradas de Google y Bing. Cada enlace es un enlace profundo que salta al pasaje citado en la página de origen.
Google — la definición
- “The amount of time and resources that Google devotes to crawling a site is commonly called the site’s crawl budget and it’s determined by two main elements: crawl capacity limit and crawl demand.” (traducción) «La cantidad de tiempo y recursos que Google dedica a rastrear un sitio se denomina presupuesto de rastreo y está determinada por el límite de capacidad y la demanda de rastreo». — Documentación de Google Search Central. Saltar a la cita
- “Google’s crawlers calculate a crawl capacity limit, which is the maximum number of simultaneous parallel connections that Google can use to crawl a site, as well as the time delay between fetches.” (traducción) «Los rastreadores de Google calculan un límite de capacidad de rastreo: el número máximo de conexiones paralelas simultáneas que Google puede usar para rastrear un sitio y el intervalo entre solicitudes». Saltar a la cita
- “Taking crawl rate and crawl demand together we define crawl budget as the number of URLs Googlebot can and wants to crawl.” (traducción) «Considerando conjuntamente la frecuencia y la demanda de rastreo, definimos el presupuesto de rastreo como el número de URL que Googlebot puede y quiere rastrear». — Gary Illyes, Google (2017). Saltar a la cita
Google — cuándo no tiene que preocuparse
- “If your site doesn’t have a large number of pages that change rapidly, or if your pages seem to be crawled the same day that they are published, you don’t need to read this guide.” (traducción) «Si su sitio no tiene muchas páginas que cambien rápidamente, o si sus páginas parecen rastrearse el mismo día en que se publican, no necesita leer esta guía». Saltar a la cita
- “100k URLs is usually not enough to affect crawl budget (it’s <1/minute over 3 months).” (traducción) «Cien mil URL normalmente no bastan para afectar al presupuesto de rastreo (son menos de una por minuto durante 3 meses)». — John Mueller, Google (2021). Leer la cobertura
Google — lo que usted controla y rastreo frente a posicionamiento
- “If many of these URLs are duplicates, or you don’t want them crawled for some other reason (removed, unimportant, and so on), this wastes a lot of Google crawling time on your site. This is the factor that you can positively control the most.” (traducción) «Si muchas de estas URL son duplicadas, o no quiere que se rastreen por algún otro motivo (eliminadas, sin importancia, etc.), se desperdicia mucho tiempo de rastreo de Google en su sitio. Es la palanca que más puede controlar de forma positiva». Saltar a la cita
- “An increased crawl rate will not necessarily lead to better positions in Search results. Google uses hundreds of signals to rank the results, and while crawling is necessary for being in the results, it’s not a ranking signal.” (traducción) «Una mayor frecuencia de rastreo no necesariamente conduce a mejores posiciones en los resultados de búsqueda. Google se vale de cientos de señales para ordenar los resultados y, aunque el rastreo es necesario para aparecer en ellos, no es una señal de posicionamiento». — Gary Illyes, Google (2017). Saltar a la cita
Google — la lista de desperdicios y lo que no debe hacer
- “Faceted navigation and session identifiers / On-site duplicate content / Soft error pages / Hacked pages / Infinite spaces and proxies / Low quality and spam content” (traducción) «Navegación por facetas e identificadores de sesión / contenido duplicado en el sitio / páginas de error blandas / páginas pirateadas / espacios infinitos y proxies / contenido de baja calidad y spam»: categorías de bajo valor añadido, en orden de importancia. — Gary Illyes, Google (2017). Saltar a la cita
- “Consolidate duplicate content to focus crawling on unique content rather than unique URLs.” (traducción) «Consolide el contenido duplicado para centrar el rastreo en contenido único y no en URL únicas». Saltar a la cita
- “Don’t use noindex, as Google will still request, but then drop the page when it sees a noindex meta tag or header in the HTTP response, wasting crawling time.” (traducción) «No use noindex: Google seguirá solicitando la página y luego la descartará al ver una metaetiqueta noindex o un encabezado en la respuesta HTTP, desperdiciando tiempo de rastreo». Saltar a la cita
- “Google won’t shift this newly available crawl budget to other pages unless Google is already hitting your site’s serving limit.” (traducción) «Google no trasladará este presupuesto de rastreo recién disponible a otras páginas a menos que ya esté alcanzando el límite de servicio de su sitio». Saltar a la cita
Gary Illyes, Google — programación y carga del host (a través de la cobertura de Search Engine Roundtable sobre una sesión de preguntas y respuestas de Stone Temple)
- “Host load kind of sets a bucket of URLs in importance order and GoogleBot will crawl in that order based on the schedule the host load decided. If Google thinks your server can handle it, it will crawl the whole bucket, if not, it will stop.” (traducción) «La carga del host organiza un grupo de URL por importancia y Googlebot lo rastrea en ese orden según el programa que determina la carga del host. Si Google juzga que el servidor admite la carga, rastreará todo el grupo; si no, se detendrá». Saltar a la cita
Fabrice Canel, Microsoft Bing
- “The crawl efficiency is how often we crawl and discover new and fresh content per page crawled.” (traducción) «La eficiencia de rastreo es la frecuencia con la que rastreamos y descubrimos contenido nuevo y actualizado por cada página rastreada». Saltar a la cita
- “Less is more for SEO. Never forget that. Less URLs to crawl, better for SEO.” (traducción) «Menos es más para el SEO. No lo olvide. Menos URL que rastrear significa mejor SEO». Saltar a la cita
Lista de comprobación para optimizar el presupuesto de rastreo
Solo merece la pena recorrerla si ha confirmado que realmente tiene un problema de presupuesto (sitio grande, rastreo lento pese a publicarse el mismo día o una acumulación creciente de «Discovered – currently not indexed» (traducción) «Descubierto: actualmente no indexado»). En ese caso:
- Confirmé que el problema es real: comprobé Estadísticas de rastreo de GSC y «Discovered – currently not indexed» (traducción) «Descubierto: actualmente no indexado» antes de optimizar nada.
- Elegí una convención principal (host, protocolo, barra final y mayúsculas) y consolidé los duplicados en ella.
- Gestioné los parámetros de URL: hice la canonicalización o bloqueé los que solo crean variantes duplicadas o de bajo valor.
- Controlé la navegación por facetas: bloqueé las combinaciones inútiles de filtros y ordenación en
robots.txt, o las moví detrás de#para que no fueran rastreables. - Corregí los errores blandos y devuelvo
404/410reales para páginas retiradas permanentemente. - Eliminé o acorté las cadenas de redirecciones.
- Los sitemaps solo enumeran URL definitivas e indexables con un
lastmodexacto. - No usé
noindexpara «ahorrar» presupuesto (Google lo solicita igualmente) y no esperé que los bloqueos derobots.txtredistribuyeran el presupuesto a otras páginas. - Reforcé los enlaces internos a páginas importantes y recién publicadas.
- Mejoré el tiempo de respuesta y la eficiencia de carga del servidor.
- (Bing) Adopté IndexNow para enviar cambios y usé Crawl Control si la carga del servidor es la limitación.
Modelos mentales
1. Presupuesto = capacidad × demanda. La capacidad de rastreo es lo que puede soportar su servidor; la demanda de rastreo es popularidad + antigüedad + inventario percibido. Ambas deben existir: un servidor rápido con poca demanda se rastrea menos, y una demanda alta se ve limitada por un servidor que tiene dificultades. Para aumentar el presupuesto efectivo, casi siempre hay que eliminar desperdicio, no «pedir más».
2. La barrera «¿tengo siquiera un problema?». Ejecute esto antes de tocar nada:
- ¿Las páginas se rastrean el mismo día en que se publican? → No hay problema. Deténgase aquí.
- ¿Tiene menos de aproximadamente cien mil URL (la regla general de Mueller)? → Casi con seguridad no hay problema.
- ¿Tiene más de 1 millón de páginas que cambian semanalmente, o más de 10 000 que cambian a diario, o una gran acumulación de «Discovered – currently not indexed» (traducción) «Descubierto: actualmente no indexado»? → Ahora sí merece su tiempo.
3. Elimine desperdicio antes de pedir a Google que rastree más. Es la idea con mayor impacto potencial de esta página. Google intenta rastrear todo lo que conoce; si la mitad son duplicados, facetas y errores blandos, está gastando su presupuesto en basura. Elimine la basura y el presupuesto se consolidará en las páginas que importan: esa es «la palanca que más puede controlar de forma positiva».
4. Rastrear ≠ posicionar. El rastreo es una puerta, no un marcador. Rastrear más no mejora las posiciones. Por tanto, el objetivo es la cobertura de las URL correctas, nunca el volumen bruto de rastreo.
5. Es una cola prioritaria, no una cuota. Internamente es una programación ordenada por importancia y limitada por la carga del host: un grupo priorizado de URL, no una cuota plana de «N páginas al día». Se avanza en la cola siendo más importante (enlaces y demanda) y evitando solicitudes desperdiciadas.
Presupuesto de rastreo — guía rápida
Qué lo consume (orden de importancia de Google)
| # | Categoría | Causa habitual |
|---|---|---|
| 1 | Navegación por facetas e ID de sesión | Combinaciones de filtros y ordenación de ecommerce que multiplican las URL |
| 2 | Contenido duplicado en el sitio | www/no-www, HTTP/HTTPS, barra, mayúsculas, index y parámetros |
| 3 | Páginas de error blandas | Páginas «no encontradas» que devuelven 200 |
| 4 | Páginas pirateadas | URL de spam inyectadas |
| 5 | Espacios infinitos y proxies | Calendarios, desplazamiento infinito y combinaciones facetadas |
| 6 | Contenido de baja calidad y spam | Páginas escasas o generadas automáticamente |
Además, las cadenas largas de redirecciones y las páginas lentas o pesadas hacen que cada solicitud cueste más.
¿Tiene siquiera que preocuparse?
- Rastreo el mismo día → no.
- Menos de aproximadamente cien mil URL (Mueller) → casi con seguridad no.
- Más de 1 millón de páginas que cambian semanalmente, o más de 10 000 que cambian a diario, o una gran acumulación de «Discovered – currently not indexed» (traducción) «Descubierto: actualmente no indexado» → sí.
Soluciones que funcionan
- Consolide los duplicados y haga la canonicalización.
- Bloquee las rutas inútiles en
robots.txt(facetas y parámetros); nunca usenoindexpara «ahorrar» presupuesto. - Corrija los errores blandos y devuelva
404/410reales. - Acorte las cadenas de redirecciones y acelere el servidor.
- Mantenga limpios los sitemaps y refuerce los enlaces internos.
Solo hay dos formas de aumentar el presupuesto (Google): más capacidad del servidor y mayor calidad del contenido. Una sin la otra no funciona.
Bing: lo llama «eficiencia de rastreo»: envíe cambios con IndexNow y programe el rastreo con Crawl Control.
Herramientas para medir y gestionar el presupuesto de rastreo
- Google Search Console — informe Estadísticas de rastreo (Settings → Crawl Stats): la visión propia de Google: solicitudes totales a lo largo del tiempo, tiempo medio de respuesta, estado del host y desglose por código de respuesta, tipo de archivo y tipo de Googlebot. Empiece aquí.
- GSC «Discovered – currently not indexed» (traducción) «Descubierto: actualmente no indexado» (informe de páginas): la señal de alarma de las URL que Google conoce pero no rastrea.
- Análisis de archivos de registro del servidor: la fuente de verdad sobre qué URL visitan realmente los bots y con qué frecuencia. Herramientas: Screaming Frog Log File Analyser, o canalice los registros a BigQuery o a una plataforma de logs. (Consulte análisis de archivos de registro).
- Ahrefs Site Audit / Screaming Frog SEO Spider: simule un rastreo para encontrar URL duplicadas, cadenas de redirecciones, errores blandos, URL bloqueadas y espacios facetados parecidos a trampas.
- Ahrefs Webmaster Tools: rastreo y auditoría gratuitos para los sitios que verifique.
- Inspección de URL (GSC): comprobación rápida del rastreo del mismo día para una URL.
- Bing Webmaster Tools — Crawl Control: programe por hora el rastreo de bingbot si la carga del servidor es la limitación.
¿Tiene un problema de presupuesto de rastreo?
Should you work on crawl budget now?
Comprobación mensual del estado del presupuesto de rastreo
- Exporte las solicitudes de los rastreadores de búsqueda desde los registros del servidor usando el mismo intervalo de informes cada mes.
- Divida las solicitudes por código de estado, directorio, tipo de página y si la URL es indexable.
- Revise los patrones de parámetros de gran volumen, las rutas duplicadas, las redirecciones, los errores blandos y los errores del servidor.
- Compare la cuota de rastreo de las plantillas valiosas con el periodo anterior y anote lanzamientos o migraciones.
- Asigne a cada nuevo patrón de desperdicio una persona responsable y un control: enlaces, parámetros, redirecciones, canonicalización, eliminación o reparación del servidor.
- Vuelva a comprobar el patrón afectado en el siguiente intervalo de registros; el procedimiento termina cuando las URL valiosas conservan el acceso y el desperdicio disminuye respecto a la línea base del sitio.
Errores del presupuesto de rastreo
- Perseguir un número mayor de solicitudes. Rastrear más no mejora las posiciones. En su lugar, compruebe si las URL importantes se rastrean cuando hace falta.
- Bloquear el desperdicio solo en robots.txt. Eso puede detener la obtención sin eliminar las URL descubiertas ni corregir los enlaces que las generan. Elimine las rutas de rastreo y consolide el inventario cuando corresponda.
- Actualizar el
lastmodde todos los sitemaps en cada compilación. La frescura falsa enseña a los rastreadores a no confiar en la señal. Cámbielo solo cuando haya actualizaciones relevantes de la página. - Ignorar los errores del servidor mientras ajusta los patrones de URL. Un problema de capacidad limita el rastreo útil. Repare primero los tiempos de espera y las respuestas 5xx.
- Tratar cada URL excluida como desperdicio. Algunos recursos no indexados ayudan al renderizado o al descubrimiento. Clasifique su finalidad antes de bloquear nada.
Prompt: clasificar el desperdicio del registro de rastreo
Pegue un CSV derivado de registros con URL, plantilla, estado, bot, solicitudes, bytes e indexabilidad. Elimine primero los valores de consulta o los datos de usuario.
Act as a technical SEO analyst. Classify each URL pattern as valuable crawling, necessary support crawling, redirect/error waste, duplicate/parameter waste, or unclear. Do not infer intent from the URL alone: list the evidence needed for every unclear row. Rank patterns by crawler requests and bytes, propose the safest control, and state what could break if that control is wrong. Return a table plus a short validation plan.Prompt: cuestionar un diagnóstico de presupuesto de rastreo
Review the crawl-budget diagnosis below. Separate evidence of capacity, demand, discovery, and URL-inventory problems. Flag claims that confuse crawling with indexing or rankings. Then give the three smallest tests that would confirm or reject the diagnosis. Do not invent thresholds; use changes against the site's own baseline.
[PASTE DIAGNOSIS AND OBSERVATIONS] Resumir los códigos de estado de los rastreadores a partir de un registro de acceso
Ejecute esto contra un registro con formato nginx/Apache después de ajustar el patrón del bot a su tráfico de rastreo verificado:
awk 'BEGIN{IGNORECASE=1} /Googlebot|bingbot/ {print $9}' access.log | sort | uniq -c | sort -nrEn PowerShell:
Select-String -Path .\access.log -Pattern 'Googlebot|bingbot' | ForEach-Object { if ($_.Line -match '"\s(\d{3})\s') { $Matches[1] } } | Group-Object | Sort-Object Count -DescendingExtraer familias de parámetros de consulta
Use esta expresión regular en una exportación del rastreador o en un editor de texto para capturar el primer nombre de parámetro de consulta:
\?([^=&]+)(?:=[^&]*)?El grupo 1 es el nombre del parámetro. Un número alto de solicitudes identifica patrones que investigar, no URL que bloquear automáticamente.
Póngase a prueba: presupuesto de rastreo
Recursos que merecen su tiempo
Mis artículos relacionados
- ¿Cuándo debería preocuparse por el presupuesto de rastreo?: mi guía completa de Ahrefs sobre el tema, con los detalles de optimización y las decisiones sobre navegación por facetas.
- Cómo corregir «Discovered – currently not indexed»: la señal de GSC que también funciona como alarma del presupuesto de rastreo.
- Guía para principiantes de SEO técnico: dónde encaja el presupuesto de rastreo en el conjunto.
- Estrategias de SEO empresarial: para la minoría de sitios grandes que realmente necesita gestionarlo.
Mis charlas
- How Search Works (SlideShare): mi explicación del modelo de demanda de rastreo frente a límite de frecuencia de rastreo. (Se aplica el aviso habitual: “This is my understanding of systems… not going to be 100% complete or accurate.” (traducción) «Esta es mi comprensión de los sistemas; no será 100 % completa ni exacta»).
De la industria
- Serie Crawling December de Google (oficial, pero el conjunto más concentrado de explicaciones sobre rastreo, incluida la navegación por facetas).
- Google explica qué significa «presupuesto de rastreo» para los webmasters (Barry Schwartz, Search Engine Land, 2017): resumen en lenguaje claro de la publicación original de Google; útil para el contexto “most sites don’t need to worry” (traducción) «la mayoría de los sitios no necesita preocuparse».
- Gary Illyes explica la diferencia entre presupuesto de rastreo, programación y carga del host (Search Engine Roundtable): fuente del marco del «grupo ordenado por importancia» y la carga del host, que muestra que es una cola prioritaria, no una cuota plana.
- Google: 100 000 URL normalmente no afectan al presupuesto de rastreo (Search Engine Roundtable, 2021): cifra concreta de 100 000 de Mueller y el contexto de menos de 1 por minuto durante 3 meses.
- Prioridades de rastreo de Google: ideas del analista Gary Illyes (Search Engine Journal): desmonta la «cuota fija diaria de páginas» y explica la idea de convencer a la búsqueda de que su contenido merece obtenerse.
- Las cinco puertas de infraestructura tras el rastreo, el renderizado y la indexación (Search Engine Land): fuente de la cita de Fabrice Canel «menos es más para el SEO» y de la filosofía de eficiencia de rastreo de Bing.
- Serie de bingbot: optimizar la frecuencia de rastreo (Bing Webmaster Blog, Fabrice Canel): cómo decide Bing la frecuencia de nuevos rastreos; complemento de la publicación sobre maximizar la eficiencia.
- r/TechSEO: comunidad para depurar problemas de rastreo e indexación.
Estadísticas que merece la pena citar
- Cien mil URL normalmente no bastan para que importe. El dato concreto de John Mueller: “100k URLs is usually not enough to affect crawl budget (it’s <1/minute over 3 months).” (traducción) «Cien mil URL normalmente no bastan para afectar al presupuesto de rastreo (son menos de una por minuto durante 3 meses)». Es la cifra más útil para rebajar la preocupación por el presupuesto de rastreo. Fuente
- Los umbrales en los que empieza a importar: más de 1 millón de páginas que cambian aproximadamente cada semana, o más de 10 000 páginas que cambian a diario (estimaciones aproximadas de Google, no umbrales exactos). (ancla original: “Large sites (1 million+ unique pages”) (traducción) «sitios grandes (1 millón o más de páginas únicas». Fuente
- Aproximadamente el 60 % de la web es contenido duplicado: estimación interna de Google y motivo por el que las URL duplicadas son un drenaje tan fiable del presupuesto de rastreo. (ancla original: “duplicate content”) (traducción) «contenido duplicado en el sitio». Fuente
El KPI permanente de la eficiencia de rastreo
El presupuesto de rastreo no es una cifra que Google le entregue: se infiere observando dónde gasta realmente sus solicitudes Googlebot. El KPI es la distribución: cuánto rastreo llega a las páginas que quiere indexar frente a las páginas que son puro desperdicio. (Primero, la comprobación de honestidad: esto solo importa a escala; Google dice que el presupuesto de rastreo preocupa principalmente a sitios de alrededor de 1 millón o más de páginas, o a sitios medianos que generan muchas URL automáticamente. Un sitio estático pequeño puede omitir esta métrica por completo.)
Distribución del rastreo — solicitudes valiosas frente a desperdiciadas
- Métrica: proporción de solicitudes de Googlebot verificado que llegan a URL importantes e indexables frente a URL desperdiciadas (duplicados, URL con parámetros o facetas, variantes no canónicas, saltos de redirección y errores 4xx/5xx).
- Qué indica: si la capacidad de rastreo se gasta en páginas que pueden posicionarse. Una proporción creciente de desperdicio es un indicador adelantado del retraso de descubrimiento/indexación, antes de que aparezca como problema de posicionamiento.
- Cómo obtenerla: procese los registros del servidor con el Analizador de archivos de registro y segmente las visitas de Googlebot verificado por clase de URL; corrobórelo con el informe Estadísticas de rastreo de GSC (solicitudes totales, por respuesta, por finalidad del archivo y estado del host).
- Referencia / rango realista: depende de la situación; no existe un «porcentaje de desperdicio» universal honesto porque depende de la arquitectura de URL. Establezca su propia línea base y reduzca la proporción desperdiciada con el tiempo: la señal es la tendencia, no un absoluto inventado.
- Periodicidad: mensual y con mayor frecuencia inmediatamente después de un cambio estructural (nuevas facetas, una migración) o cuando Estadísticas de rastreo muestre un aumento repentino de solicitudes o de respuestas 4xx/5xx. El rastreo desperdiciado es una métrica adelantada; el recuento de páginas indexadas va por detrás.
Registro de cambios
Actualizado el 8 ago 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.
Actualizado el 27 jul 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.
Actualizado el 17 jul 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.