Informe de estadísticas de rastreo
Cómo leer el Crawl Stats report de Google Search Console: solicitudes totales, tamaño de descarga, tiempo de respuesta y los desgloses por respuesta, tipo de archivo, tipo de Googlebot y propósito.
Idiomas
El Crawl Stats report (Search Console → Configuración → Estadísticas de rastreo) muestra cómo Google rastreó tu sitio durante los últimos 90 días: solicitudes de rastreo totales, tamaño de descarga total y tiempo de respuesta promedio, además de desgloses por código de respuesta, tipo de archivo, tipo de Googlebot y propósito (Descubrimiento frente a Actualización). Solo está disponible para propiedades de nivel raíz —una propiedad de dominio o una propiedad de prefijo de URL verificada en la raíz del sitio—, no para propiedades de subcarpeta. Para la mayoría de los sitios, no es un panel de presupuesto de rastreo para optimizar, sino un sistema de alerta temprana sobre el estado del servidor. El aumento de los tiempos de respuesta o los errores 5xx hacen que Google reduzca el rastreo; la indisponibilidad sostenida de robots.txt puede detener el rastreo. Es lo más cerca que GSC está de los datos de registro, pero solo cubre los rastreadores de Google y no garantiza incluir todas las solicitudes.
Evidence for this claim The Crawl Stats report shows Googlebot request totals, download size, response time, host status, and request breakdowns. Scope: Current Search Console Crawl Stats report. Confidence: high · Verified: Google Search Console: Crawl Stats report Evidence for this claim Google says crawl-budget management is mainly relevant to very large or rapidly changing sites; most sites can rely on normal crawling. Scope: Google's current crawl-budget guidance. Confidence: high · Verified: Google Search Central: Crawl budget managementTL;DR — El Crawl Stats report muestra cómo Google ha estado rastreando tu sitio durante los últimos 90 días: cuántas veces solicitó páginas, cuánto descargó y con qué rapidez respondió tu servidor. Lo encuentras en Settings en Google Search Console, y está disponible para una propiedad de nivel raíz en lugar de una propiedad con ámbito de ruta. Para la mayoría de los sitios, es una comprobación de salud, no algo que necesites optimizar.
Qué es el Crawl Stats report
Cuando el rastreador de Google —Googlebot— visita tu sitio, cada solicitud que realiza queda registrada por parte de Google. El Crawl Stats report es donde Google te muestra un resumen de esa actividad: con qué frecuencia pasó, qué descargó y si se encontró con problemas.
Lo encontrarás en Google Search Console en Settings → Crawl stats (no está en la barra lateral principal con los demás informes). Abarca aproximadamente los últimos 90 días.
Dónde encontrarlo (y por qué puede que no lo veas)
La razón más común por la que las personas no pueden encontrar el informe es simple: solo aparece para las propiedades de nivel raíz. Esto incluye una propiedad de dominio (solo el dominio, sin el prefijo https://) y una propiedad de prefijo de URL verificada en la raíz del sitio (como https://example.com). Si añadiste una propiedad de prefijo de URL que apunta a una subcarpeta o subruta, no obtendrás el informe.
La solución es verificar una propiedad de nivel raíz —dominio o prefijo de URL raíz—. Mismo sitio, diferente tipo de propiedad — y aparece el informe.
Los tres números de la parte superior
- Total de solicitudes de rastreo — cuántas veces Googlebot solicitó una URL de tu sitio, independientemente de si tuvo éxito o no.
- Tamaño total de descarga — cuántos bytes descargó Google durante el rastreo.
- Tiempo de respuesta promedio — cuánto tiempo, en promedio, tardó tu servidor en responder.
Estas son tendencias para observar, no objetivos que alcanzar. No hay un número “correcto”. Lo que importa es la forma de la línea a lo largo del tiempo.
¿Deberías siquiera preocuparte por esto?
Probablemente no, honestamente. Hay mucha ansiedad en torno al “presupuesto de rastreo”, pero la mayoría de los sitios nunca necesitan pensar en él. El informe es mucho más útil como sistema de alerta temprana para problemas del servidor que como un panel para optimizar.
Lo que debes vigilar es que tu servidor tenga dificultades. Si tu tiempo de respuesta medio aumenta o empiezas a ver errores del servidor, Google lo nota y te rastrea menos para evitar empeorar las cosas. Así que si de repente las páginas no se rastrean, este informe es uno de los primeros lugares donde yo miraría.
Aquí también hay un resumen de Host status que indica si Google tuvo problemas para acceder a tu sitio (al obtener robots.txt, DNS, conectarse al servidor). Ese es el bloque más importante: si está en rojo, corrígelo primero.
¿Quieres el desglose completo métrica por métrica y lo que significa cada patrón? Cambia a la pestaña Avanzado.
Evidence for this claim The Crawl Stats report shows Googlebot request totals, download size, response time, host status, and request breakdowns. Scope: Current Search Console Crawl Stats report. Confidence: high · Verified: Google Search Console: Crawl Stats report Evidence for this claim Google says crawl-budget management is mainly relevant to very large or rapidly changing sites; most sites can rely on normal crawling. Scope: Google's current crawl-budget guidance. Confidence: high · Verified: Google Search Central: Crawl budget managementTL;DR — Crawl Stats (Configuración → Crawl stats, solo propiedades de nivel raíz — dominio o prefijo de URL raíz) muestra el total de solicitudes de rastreo, el tamaño total de descarga y el tiempo medio de respuesta durante aproximadamente 90 días, además de desgloses por respuesta, tipo de archivo, tipo de Googlebot y propósito (Discovery vs Refresh). Léelo como un monitor de salud del servidor, no como un panel de vanidad del presupuesto de rastreo: un aumento del tiempo de respuesta o los errores 5xx hacen que Google reduzca la capacidad de rastreo, y un fallo sostenido de robots.txt puede detener el rastreo. Es lo más cerca que GSC está de los datos de registro, pero solo cubre los rastreadores de Google y no se garantiza que esté completo a nivel de solicitudes; para todos los bots, los usuarios y un registro completo, aún necesitas los registros del servidor. Google limita su propia guía de presupuesto de rastreo a sitios grandes que cambian con frecuencia; para la mayoría de los sitios más pequeños, en mi experiencia, casi nunca importa.
Qué es y dónde se encuentra
La formulación del propio Google es directa: “The Crawl Stats report shows you statistics about Google’s crawling history on your website.” (traducción) «El Crawl Stats report te muestra estadísticas sobre el historial de rastreo de Google en tu sitio web.» Puedes acceder a él en Settings → Crawl stats — no en la barra lateral principal de informes, lo que confunde a muchas personas.
La razón más importante por la que las personas creen que el informe está “desaparecido” o “roto”:
Google solo lo muestra para propiedades de nivel raíz. En sus palabras:
“This report is
available only for root-level properties.”
(traducción) «Este informe solo está disponible para propiedades de nivel raíz.»
Esto abarca tanto una propiedad de dominio como una propiedad de prefijo de URL verificada en la raíz del sitio (por ejemplo, https:// example.com) —no se limita a las propiedades de dominio sin protocolo. Si verificaste una propiedad de prefijo de URL limitada a una subcarpeta o subruta, vuelve a verificarla en el nivel raíz y aparecerá. No hay ningún problema con tu sitio.
¿Debería importarte? El replanteamiento del presupuesto de rastreo
La mayoría de los sitios no necesitan optimizar el presupuesto de rastreo, y el valor real del informe es la supervisión del estado más que el ajuste del presupuesto. Google limita su propia orientación sobre el presupuesto de rastreo a sitios grandes (1M+ páginas únicas) y sitios medianos o más grandes (10k+ páginas con cambios diarios). Por debajo de eso, esto es un diagnóstico, no un proyecto.
Google también presenta el propio informe como algo pensado para usuarios avanzados, y afirma que los sitios con menos de aproximadamente 1 000 páginas por lo general no necesitan profundizar en él con este nivel de granularidad —un umbral menor que la guía sobre presupuesto de rastreo anterior—. Mi propia regla general es más flexible: para la mayoría de los sitios con menos de unas 10 000 páginas, yo aun así no dedicaría mucho tiempo al presupuesto de rastreo. Considera esto como el criterio de un profesional, no como un límite oficial.
La frecuencia de rastreo está regida por dos cosas que trabajan en conjunto — límite de capacidad de rastreo y demanda de rastreo. La capacidad es lo que tu servidor puede manejar. Google define el límite de capacidad como “The maximum number of simultaneous parallel connections that Google can use to crawl a site, as well as the time delay between fetches.” (traducción) «El número máximo de conexiones paralelas simultáneas que Google puede utilizar para rastrear un sitio, así como el retraso temporal entre recuperaciones.» La demanda es cuánto quiere rastrear Google, impulsada por factores como la popularidad y la falta de actualización. El informe es donde se muestran las consecuencias de ambos. (Más información sobre el concepto en presupuesto de rastreo.)
Algunos detalles del alcance que vale la pena conocer antes de leer los números: el informe cuenta la URL real que solicitó Googlebot en lugar de la URL canónica a la que se resuelve, y cuenta las solicitudes duplicadas y cada salto de redirección del lado del servidor por separado (las redirecciones del lado del cliente no se cuentan aquí como respuestas de redirección). Su alcance es la propiedad o el host que estás viendo — los recursos en otros dominios, y a veces los dominios hermanos o secundarios, pueden estar subrepresentados o sobrerrepresentados según el tipo de propiedad. Y según la propia documentación de Google, el informe refleja la mayoría de las solicitudes de rastreo pero puede omitir algunas, por lo que es esperable una pequeña discrepancia con tus propios registros de servidor, no un error.
Esto es lo más parecido a los datos de archivos de registro que te ofrece Search Console, pero solo incluye los rastreadores de Google, está agregado y no se garantiza que esté completo a nivel de solicitudes. Si quieres las solicitudes de todos los bots y usuarios, o un registro completo garantizado, necesitas los registros de tu servidor. Considera Crawl Stats como el primer vistazo gratuito antes de invertir en análisis de registros.
Las tres métricas principales
Interprétalas como tendencias, no como objetivos:
- Solicitudes de rastreo totales — “The total number of crawl requests issued for URLs on your site, whether successful or not.” (traducción) «El número total de solicitudes de rastreo emitidas para las URL de tu sitio, tengan éxito o no.» Cada solicitud cuenta, incluidas las que fallaron.
- Tamaño de descarga total — “Total number of bytes downloaded from your site during crawling, for the specified time period.” (traducción) «El número total de bytes descargados de tu sitio durante el rastreo, para el período de tiempo especificado.»
- Tiempo de respuesta promedio — “Average response time for all resources fetched from your site during the specified time period.” (traducción) «El tiempo de respuesta promedio para todos los recursos obtenidos de tu sitio durante el período de tiempo especificado.» Esto es, en la práctica, un indicador indirecto del estado del servidor. Un pico sostenido es una alarma de rendimiento, y Google puede responder reduciendo tu límite de capacidad de rastreo, por lo que el daño de SEO es indirecto (rastreo más lento y menor), separado de cualquier factor de posicionamiento de velocidad de página.
Desglose: Por respuesta
Esta tabla, en palabras de Google, muestra “the responses that Google received when crawling your site, grouped by response type, as a percentage of all crawl responses.” (traducción) «las respuestas que recibió Google al rastrear tu sitio, agrupadas por tipo de respuesta, como porcentaje de todas las respuestas de rastreo.» Los tipos de respuesta incluyen OK (200), Movido permanentemente (301), Movido temporalmente (302), error 404, Server error (5XX) y robots.txt no disponible.
Cómo interpreto cada patrón:
- 200 debería ser la gran mayoría. Google no publica un porcentaje objetivo específico, así que evalúa esto con respecto a tu propia línea base y observa cambios sostenidos en lugar de buscar un número exacto.
- Muchos 404 no son fatales, pero indican rastreo desperdiciado: Google gasta solicitudes en URL que no existen.
- Muchos 301 apuntan a cadenas de redirecciones o enlaces internos que todavía apuntan a URL antiguas. Corrige los enlaces para que apunten al destino final.
- Un pico de 5xx es el patrón más perjudicial del informe. Tu servidor está generando errores bajo la carga de rastreo, lo que reduce el límite de capacidad, lo que significa menos rastreo. Los 5xx sostenidos pueden, en la práctica, limitar el rastreo de Google a un mínimo.
- robots.txt not available no debería aparecer de forma sostenida y significativa. Google no publica un porcentaje objetivo fijo, pero una proporción persistente significa que Google periódicamente no pudo obtener tu robots.txt. Eso importa porque si tu robots.txt permanece no disponible, Google pausará de manera conservadora el rastreo durante un tiempo en lugar de adivinar. (Para saber qué controla y qué no controla robots.txt, consulta robots.txt.)
Desglose: Por tipo de archivo
Google agrupa el rastreo por tipo de archivo — HTML, imagen, JavaScript, CSS, JSON, PDF, y otros. Esta es una pista de diagnóstico, no una prueba de desperdicio por sí sola — la cantidad de JS, CSS, imágenes o JSON que se rastrea de forma normal depende de cómo esté construido tu sitio (una aplicación con mucho JS necesita legítimamente más rastreo de recursos que un sitio HTML estático). Una proporción de JS/CSS/imágenes que sea alta en relación con tu propia línea base, o que aumenta de repente, vale la pena investigarla como posible sobrecarga de recursos de renderizado. La aparición de tipos de archivo inesperados puede revelar una trampa de rastreo — un espacio de URL infinito o casi infinito que genera basura.
Desglose: por tipo de Googlebot
Esto divide el rastreo según qué Googlebot realizó la obtención: smartphone, escritorio, imágenes, video, carga de recursos de la página y AdsBot. Google no documenta una combinación obligatoria, pero en un rastreo mobile-first, el smartphone suele liderar en la mayoría de los sitios. Un perfil con mucho escritorio, o un volumen inesperado de imágenes o AdsBot, es una pista que vale la pena investigar, no una infracción por sí sola — puede significar que Google no está tratando tu sitio como mobile-first, que el rastreo de anuncios/imágenes está consumiendo presupuesto de rastreo que preferirías destinar a contenido, o simplemente que tu sitio tiene necesidades de recursos poco habituales.
Desglose: por propósito — Discovery vs Refresh
Dos categorías, y Google las define solo por el historial de rastreo previo — las etiquetas por sí solas no te indican si la combinación es saludable:
- Discovery — “The URL requested was never crawled by Google before.” (traducción) «La URL solicitada nunca antes había sido rastreada por Google.»
- Refresh — “A recrawl of a known page.” (traducción) «Un nuevo rastreo de una página conocida.»
Un aumento en Discovery es esperable durante un lanzamiento o migración (Google está encontrando tus nuevas URL); el mismo aumento es un problema si proviene de URL de espacio infinito o de parámetros: es presupuesto de rastreo yéndose a la basura. Una mezcla dominada por Refresh es normal para un sitio establecido que no publica mucho contenido nuevo. Juzga cualquiera de ellas frente a tu propia línea base y lo que sabes que cambió, no frente a una proporción “saludable” fija.
Host status — el bloque más accionable
Host status resume si Google encontró problemas de disponibilidad al intentar rastrear tu sitio, agrupados en tres subcomprobaciones: obtención de robots.txt, resolución de DNS y conectividad del servidor. Un Host status rojo es una de las señales más accionables en el informe: normalmente significa que Google fue bloqueado o limitado en el nivel de infraestructura, durante esa ventana, antes de llegar siquiera a tu contenido. Sin embargo, es una alerta agregada, no una prueba de que todas las URL se vieran afectadas o de que el problema siga ocurriendo ahora: revisa la cronología y confirma el estado actual (una obtención en vivo, Inspección de URL o tus registros) antes de darlo por solucionado. Aun así, trata un Host status rojo como lo primero que investigar. (Se aborda de forma independiente en Host status.)
Lectura de picos y caídas
El mecanismo que debes internalizar: el comportamiento de tu servidor retroalimenta cuánto rastrea Google. Si el sitio responde rápida y fiablemente, el límite de capacidad de Google puede subir; si se ralentiza o empieza a devolver errores de servidor, el límite baja. Así que:
- Pico de tiempo de respuesta → el límite de capacidad puede bajar → menos rastreo.
- Aumento de 5xx → el límite de capacidad baja → menos rastreo; si se mantiene, puede limitar tu rastreo de forma severa.
- robots.txt no disponible → si sigue no disponible, Google pausa el rastreo de forma conservadora.
Nada de esto es una penalización de posicionamiento. El daño es indirecto: si las páginas no se rastrean ni se indexan, no pueden posicionarse en absoluto — pero el rastreo adicional no mejora las posiciones tampoco. (Consulta el concepto de presupuesto de rastreo para ver el modelo completo de capacidad más demanda.)
Crawl Stats vs registros del servidor
Crawl Stats es lo más cerca que GSC está de los registros, pero las lagunas importan:
| Crawl Stats report | Registros del servidor | |
|---|---|---|
| A quiénes cubre | Solo los rastreadores de Google | Todos los bots y todos los usuarios |
| Granularidad | Agregada; puede omitir algunas solicitudes | Cada solicitud individual |
| Retención | ~90 días | Lo que conserves |
| Detalle por URL | No | Sí |
| Costo | Gratis, en GSC | Almacenamiento + esfuerzo de análisis |
Si Crawl Stats se te queda corto —necesitas datos por URL, bots que no sean de Google o un historial más largo—, ese es el momento de pasar al log file analysis. Crawl Stats te dice que algo no está bien; los registros te dicen exactamente dónde.
Cómo se relaciona esto con el resto del rastreo
El Crawl Stats report es tu forma de ver el rastreo una vez que ha ocurrido. Para el aspecto de indexación de lo que sucede a continuación, el Page Indexing report es el complemento — Crawl Stats muestra lo que Google obtuvo; Page Indexing muestra lo que llegó al índice. Y Host status, que aparece dentro de este informe, es la señal a nivel de infraestructura con la que vale la pena comenzar.
Resumen de IA
Una perspectiva condensada de la versión avanzada:
- Dónde está: Search Console → Settings → Crawl stats. Abarca ~90 días. Solo está disponible para propiedades de nivel raíz — una propiedad de dominio o una propiedad de prefijo de URL verificada en la raíz del sitio —; por eso está “ausente” para subcarpetas de prefijo de URL.
- Tres métricas principales: solicitudes de rastreo totales, tamaño de descarga total y tiempo de respuesta promedio. Léelas como tendencias, no objetivos.
- Cuatro desgloses: Por respuesta (200/301/404/5xx/robots.txt no disponible), Por tipo de archivo (HTML/JS/CSS/imagen/PDF…), Por tipo de Googlebot (smartphone/escritorio/imagen/video/AdsBot), Por propósito (Descubrimiento vs. Actualización).
- Es un monitor de salud del servidor, no un panel de presupuesto. El aumento del tiempo de respuesta o los 5xx hacen que Google reduzca su límite de capacidad de rastreo y rastree menos; una indisponibilidad de robots.txt sostenida puede pausar el rastreo.
- Host status (recuperación de robots.txt, DNS, conectividad del servidor) es el bloque más accionable — arregla primero un Host status en rojo.
- Rastreo ≠ posicionamiento: un mayor rastreo no mejora el posicionamiento, pero las páginas no rastreadas no pueden posicionarse en absoluto.
- Es lo más cerca que GSC está de los registros, pero es solo de Google, agregado y sin garantía de estar completo a nivel de solicitud — para todos los rastreadores/usuarios y detalle por URL, usa los registros del servidor.
- Google limita la guía oficial sobre presupuesto de rastreo a sitios grandes que cambian con frecuencia (e incluso marca el propio informe como detalle innecesario para sitios con menos de ~1 000 páginas). Regla práctica de los profesionales: la mayoría de los sitios con bastante menos de 10k páginas no necesitan optimizar el presupuesto de rastreo — pero eso es un criterio, no un límite oficial.
Documentación oficial
Documentación de fuente primaria de Google.
- Crawl Stats report — la página de ayuda de Search Console para este informe: métricas, desgloses, Host status y el requisito de propiedad a nivel de raíz.
- Optimiza tu presupuesto de rastreo — límite de capacidad de rastreo + demanda de rastreo, y quién realmente necesita gestionar el presupuesto.
- Rastreo e indexación — el centro más amplio para robots, sitemaps y controles de rastreo.
Citas de la fuente
Declaraciones oficiales de Google. Cada enlace es un enlace profundo que salta al fragmento citado en la página de origen.
Google — qué muestra el informe
- “The Crawl Stats report shows you statistics about Google’s crawling history on your website.” (traducción) «Crawl Stats report te muestra estadísticas sobre el historial de rastreo de Google en tu sitio web.» — Ayuda de Google Search Console. Ir a la cita
- “This report is available only for root-level properties.” (traducción) «Este informe solo está disponible para propiedades a nivel de raíz.» Ir a la cita
Google — las tres métricas
- “The total number of crawl requests issued for URLs on your site, whether successful or not.” (traducción) «El número total de solicitudes de rastreo emitidas para las URL de tu sitio, ya sean exitosas o no.» Ir a la cita
- “Total number of bytes downloaded from your site during crawling, for the specified time period.” (traducción) «Número total de bytes descargados de tu sitio durante el rastreo, para el período de tiempo especificado.» Ir a la cita
- “Average response time for all resources fetched from your site during the specified time period.” (traducción) «Tiempo de respuesta promedio de todos los recursos obtenidos de tu sitio durante el período de tiempo especificado.» Ir a la cita
Google — los desgloses
- “This table shows the responses that Google received when crawling your site, grouped by response type, as a percentage of all crawl responses.” (traducción) «Esta tabla muestra las respuestas que Google recibió al rastrear tu sitio, agrupadas por tipo de respuesta, como porcentaje de todas las respuestas de rastreo.» Ir a la cita
- “Discovery: The URL requested was never crawled by Google before.” (traducción) «Descubrimiento: la URL solicitada nunca antes había sido rastreada por Google.» Ir a la cita
- “Refresh: A recrawl of a known page.” (traducción) «Actualización: un nuevo rastreo de una página conocida.» Ir a la cita
Google — capacidad de rastreo (el mecanismo de presupuesto de rastreo detrás de los números)
- Límite de capacidad de rastreo: “The maximum number of simultaneous parallel connections that Google can use to crawl a site, as well as the time delay between fetches.” (traducción) «El número máximo de conexiones paralelas simultáneas que Google puede usar para rastrear un sitio, así como el retraso de tiempo entre solicitudes.» — Google Search Central, guía de presupuesto de rastreo para sitios grandes. Ir a la cita
Lectura del Crawl Stats report — lista de verificación
Un repaso rápido para extraer la señal del informe:
- Estás en una propiedad de dominio (nivel raíz); de lo contrario, el informe no se mostrará.
- Host status está en verde (la obtención de robots.txt, DNS y conectividad del servidor están bien). Corrige primero cualquier rojo aquí.
- El tiempo medio de respuesta es estable, no tiende al alza.
- Por respuesta muestra una gran mayoría de 200; 5xx y robots.txt-unavailable no muestran una participación significativa y sostenida (Google no publica un objetivo fijo — observa tu propia tendencia).
- Sin volumen sorprendente de 404s (rastreo desperdiciado) o 301s (cadenas de redirecciones / enlaces internos obsoletos).
- Por tipo de Googlebot generalmente se inclina hacia Smartphone en un rastreo mobile-first — no existe una mezcla oficial requerida, pero un cambio repentino merece una revisión.
- Por tipo de archivo no está dominado por JS/CSS/imágenes en relación con tu propia línea base, y no muestra tipos de archivo sorprendentes (posible trampa de rastreo).
- Por propósito: evalúa Discovery frente a Refresh con respecto a tu propia línea base y lo que cambió (lanzamiento, migración, actualización de sitemap) — un salto no explicado en cualquier sentido merece comprobar si hay desperdicio de parámetros/URL infinitas o rerastreo estancado.
- Si necesitas detalle por URL, rastreadores que no sean de Google o un historial más largo, pasa a análisis de registros del servidor.
Los modelos mentales
1. Es un monitor de salud, no un marcador. Los números son tendencias para observar, no objetivos para maximizar. Estás buscando la forma de la curva — picos y caídas repentinos — no un valor absoluto “bueno”.
2. El bucle de retroalimentación del servidor. Servidor rápido y estable → el límite de capacidad puede aumentar → más rastreo. Servidor lento o 5xx → el límite de capacidad baja → menos rastreo. El tiempo de respuesta y la tasa de errores son las palancas que gobiernan silenciosamente todo lo demás en el informe.
3. Host status primero, luego las respuestas, luego el resto. Clasifica en orden de impacto: un Host status en rojo bloquea todo → arréglalo. Luego por respuesta (5xx y robots.txt-unavailable son los peligrosos). Solo entonces preocúpate por el matiz de tipo de archivo/tipo de Googlebot/propósito.
4. Crawl Stats vs logs — la regla de progresión. Crawl Stats te dice que algo está fallando (solo de Google, agregado, sin garantía de estar completo, 90 días). Los logs del servidor te dicen exactamente qué (todos los bots/usuarios, cada solicitud, por URL). Empieza con Crawl Stats; pasa a los logs cuando necesites precisión.
5. El filtro de «¿debería importarme?». Google presenta el propio informe para usuarios avanzados y lo marca como innecesario para sitios de menos de ~1 000 páginas; la orientación oficial sobre presupuesto de rastreo se dirige a sitios mucho más grandes y que cambian con frecuencia. Mi propia regla práctica como profesional es más flexible — por debajo de ~10k páginas, el presupuesto de rastreo básicamente no aplica — pero tómalo como un criterio, no como un límite oficial. De todos modos, usa el informe como alerta temprana de la salud del servidor, y deja de optimizar un número que no mueve las posiciones.
Crawl Stats report — guía rápida
Dónde y alcance
- Settings → Crawl stats en Search Console. ~90 días. Solo propiedades a nivel de raíz — Dominio o prefijo de URL raíz.
Tres métricas principales
- Total de solicitudes de rastreo — todas las solicitudes, tengan éxito o no.
- Tamaño total de descarga — bytes descargados.
- Tiempo de respuesta promedio — indicador indirecto del estado del servidor; un pico sostenido → menos rastreo.
Por respuesta — qué significa cada patrón
| Respuesta | Qué esperar | Qué indica |
|---|---|---|
| 200 OK | La gran mayoría (sin un objetivo fijo) | Rastreo normal y saludable |
| 301 / 302 | Algunas son normales | Cadenas de redirecciones / enlaces internos obsoletos |
| error 404 | Bajo | Rastreo desperdiciado en URLs inactivas |
| Error del servidor 5XX | Mínimo — observa la tendencia | El servidor devuelve errores → la capacidad disminuye → menos rastreo |
| robots.txt no disponible | Mínimo — observa la tendencia | Si se mantiene, Google pausa el rastreo |
Por tipo de archivo — HTML, imagen, JavaScript, CSS, JSON, PDF, otros. Una proporción alta respecto a tu propia línea base es una pista de diagnóstico, no una prueba de desperdicio; vigila la sobrecarga de recursos y los tipos inesperados (trampas de rastreo).
Por tipo de Googlebot — Smartphone (normalmente lidera, no hay una combinación oficial requerida), Desktop, Image, Video, Page resource load, AdsBot.
Por propósito — Descubrimiento (URL nunca rastreada antes) vs Actualización (nuevo rastreo de una página conocida).
Estado del host — obtención de robots.txt · resolución de DNS · conectividad del servidor. Rojo = corregir primero.
Datos rápidos
- ¿El informe aparece como “ausente”? Estás en una propiedad de prefijo de URL limitada a una subcarpeta — vuelve a verificar en el nivel raíz (propiedad de dominio o propiedad de prefijo de URL raíz).
- Más rastreo ≠ mejores posiciones; pero lo no rastreado = no posicionable.
- Es lo más cerca que GSC está de los registros, pero solo rastreadores de Google, datos agregados, sin garantía de que estén todas las solicitudes, 90 días.
Herramientas para ver cómo te rastrea Google
- Google Search Console — Crawl Stats report — el tema de esta página: Configuración → Crawl stats, para propiedades de nivel raíz (Dominio o prefijo de URL raíz).
- Google Search Console — Inspección de URL — comprueba cómo una única URL fue rastreada, renderizada e indexada.
- Google Search Console — Page Indexing report — la vista complementaria: qué llegó del rastreo al índice.
- Análisis de archivos de registro del servidor — la fuente de verdad, que cubre todos los bots y usuarios. Herramientas: Screaming Frog Log File Analyser, o enviar los registros a BigQuery / una plataforma de registros.
- Rastreadores / auditorías de sitio — Ahrefs Site Audit y Screaming Frog SEO Spider simulan un rastreo y detectan cadenas de redirecciones, URL bloqueadas y patrones similares a trampas.
- Ahrefs Webmaster Tools — rastreo + auditoría gratuitos para sitios que verifiques.
Ponte a prueba: Crawl Stats
SOP: revisión semanal de la salud del rastreo
Usa esto como una comprobación recurrente breve, no como una razón para optimizar el volumen de rastreo por su propio bien.
- Abre la propiedad correcta. Ve a la propiedad de Search Console de nivel raíz y luego a Settings → Crawl stats.
- Establece el contexto. Toma nota de despliegues, migraciones, interrupciones, eventos de tráfico y cambios de sitemap que se solapen con el gráfico.
- Comprueba primero Host status. Clasifica las advertencias de obtención de robots.txt, DNS o conectividad del servidor antes de interpretar el resto del informe.
- Compara las tres tendencias. Revisa solicitudes, tamaño de descarga y tiempo de respuesta con las semanas previas de la propia propiedad, no con un benchmark genérico.
- Abre “By response”. Investiga los errores 5xx sostenidos, la indisponibilidad de robots.txt, el crecimiento de redirecciones y los patrones 404 que empiezan a aumentar.
- Revisa la combinación. Observa el tipo de archivo, el tipo de Googlebot y Discovery frente a Refresh para detectar cambios inexplicados o trampas de rastreo.
- Correlaciona los informes posteriores. Consulta la herramienta de inspección de url y Page Indexing para las URL representativas. Más solicitudes no importan si las páginas importantes permanecen sin rastrear o sin indexar.
- Escala cuando los agregados no sean suficientes. Extrae registros del servidor para obtener evidencia por URL, marcas de tiempo exactas, agentes de usuario (user-agent) y tráfico que no sea de Google.
- Registra el hallazgo. Guarda la fecha, la anomalía, la causa probable, el responsable, la acción y la métrica que debería normalizarse. Cierra el problema solo después de que la tendencia se recupere.
Solución de problemas de Crawl Stats
El informe no aparece
Causa probable: estás viendo una propiedad de prefijo de URL a nivel de ruta. Solución: abre o verifica la propiedad a nivel de raíz. La ausencia del informe en una propiedad más restringida no dice nada sobre si Google está rastreando el sitio.
Aumenta el tiempo de respuesta promedio mientras disminuyen las solicitudes de rastreo
Causa probable: Google está reduciendo el ritmo a medida que el origen, el CDN o la aplicación se ralentizan bajo carga. Solución: correlaciona la marca de tiempo con la monitorización y los registros, identifica las rutas lentas o los tipos de recurso, restaura una capacidad fiable y luego observa si el tiempo de respuesta baja antes de esperar que se recupere el volumen de rastreo.
Se disparan las respuestas 5xx
Causa probable: una interrupción, un limitador de frecuencia, un origen sobrecargado o una regla de seguridad específica para bots está provocando fallos en las solicitudes de Googlebot. Solución: inspecciona las entradas de registro exactas, valida a Googlebot cuando sea necesario, elimina el bloqueo accidental y prueba las URL afectadas desde fuera de la sesión de la aplicación.
Aparece “robots.txt not available”
Causa probable: los fallos de DNS, TLS, CDN, redirección o servidor impidieron que Google
obtuviera el archivo; no necesariamente una directiva incorrecta dentro de él. Solución: solicita
/robots.txt directamente en los hosts afectados, confirma una respuesta exitosa y estable,
y comprueba Host status y los registros de la ventana de fallos.
El descubrimiento aumenta inesperadamente
Causa probable: un nuevo lanzamiento o una migración está funcionando según lo previsto, o Google encontró un espacio de URL ilimitado, como parámetros, filtros, calendarios o páginas de búsqueda interna. Solución: toma muestras de los registros y de los enlaces internos para identificar el nuevo patrón de URL. Conserva los descubrimientos intencionales; restringe las trampas de rastreo en su origen.
El informe parece saludable, pero las páginas importantes no están indexadas
Causa probable: la salud general del host está bien, mientras que las URL individuales tienen problemas de descubrimiento, canonicalización, calidad o indexación. Solución: usa la herramienta de inspección de URL y Page Indexing para esas páginas. Crawl Stats no puede demostrar que una URL concreta haya sido seleccionada para el índice.
Mide la salud de rastreo como tendencias, no como cuotas
No existe un número “bueno” universal de solicitudes de rastreo. Establece una línea base para este sitio y anótala con despliegues e incidentes.
| Métrica | Interpretación útil | Combínala con |
|---|---|---|
| Tiempo de respuesta promedio | Los aumentos sostenidos pueden indicar una capacidad de servicio reducida | Latencia de origen/CDN y registros del servidor |
| Proporción de 5xx y de robots.txt no disponible | Fallos de disponibilidad que pueden reducir o pausar el rastreo | Host status y cronologías de incidentes |
| Proporción de respuestas correctas | Si las solicitudes de Google llegan mayormente a recursos utilizables | Combinación de respuestas por plantilla en los registros |
| Proporción de redirecciones y 404 | Rutas obsoletas, cadenas, eliminaciones o solicitudes desperdiciadas | Rastreo de enlaces internos y mapa de redirecciones |
| Combinación de descubrimiento frente a actualización | Descubrimiento de URL nuevas frente a nuevo rastreo de URL conocidas | Fechas de lanzamiento/migración y cambios en el sitemap |
| Combinación de HTML frente a recursos | Si el rastreo se desplazó hacia scripts, imágenes o tipos inesperados | Dependencias de renderizado y registros de tipo de archivo |
| Solicitudes de rastreo y tamaño de descarga | Escala de la obtención y cambio de la carga útil con el tiempo | Lanzamientos de contenido, tiempo de respuesta y almacenamiento en caché |
| Retraso en el nuevo rastreo de URL importantes | Si las páginas prioritarias realmente se vuelven a visitar después de un cambio | Inspección de URL y registros por URL |
Define el éxito en función del incidente que estás resolviendo. Después de un problema del servidor, el éxito es una disponibilidad estable y un tiempo de respuesta normalizado, seguidos de una recuperación del rastreo. Después de cerrar una trampa de rastreo, el éxito es tener menos solicitudes al patrón no deseado sin reducir el descubrimiento ni la actualización de las URL importantes. Las solicitudes adicionales por sí mismas no son un resultado de SEO, y Crawl Stats por sí solo no puede medir el posicionamiento ni la calidad del índice.
Recursos que merecen tu tiempo
Mis artículos relacionados
- ¿Cuándo deberías preocuparte por el presupuesto de rastreo? — mi perspectiva sobre el presupuesto de rastreo, dónde encaja Crawl Stats y por qué la mayoría de los sitios no necesita obsesionarse con él.
- ¿Qué es Googlebot y cómo funciona? — el rastreador detrás de cada número de este informe.
- La guía para principiantes sobre SEO técnico — dónde encajan el rastreo y Search Console en el panorama general.
Oficial
- Crawl Stats report — Ayuda de Search Console — la fuente principal para cada métrica y desglose.
- Optimiza tu presupuesto de rastreo — capacidad + demanda, y los umbrales de tamaño.
Desde la industria
- El presupuesto de rastreo de Googlebot explicado por Gary Illyes de Google — Cobertura de Search Engine Journal de la explicación sobre el presupuesto de rastreo de Gary Illyes; contexto útil para interpretar qué impulsa los números del informe.
- Presupuesto de rastreo para SEO: todo lo que necesitas saber — Análisis detallado de Search Engine Journal sobre los conceptos del presupuesto de rastreo, la capacidad y la demanda de rastreo.
- Rastreo e indexación — Página central de Google Search Central para toda la documentación oficial sobre rastreo, robots.txt y sitemaps.
- El pódcast Search Off the Record: cómo Googlebot rastrea la web — Gary Illyes y Martin Splitt sobre la infraestructura de rastreo y cómo el programador de rastreo reacciona a tu servidor.
- r/TechSEO — La comunidad para la depuración de rastreo/indexación.
Pódcasts
- Search Off the Record (Relaciones de búsqueda de Google) — Cómo Googlebot rastrea la web. Gary Illyes y Martin Splitt sobre la infraestructura de rastreo, las solicitudes condicionales y cómo el programador de rastreo reacciona a tu servidor — contexto sobre qué impulsa los números de este informe. Escuchar
Videos
- Google Search Central (YouTube) — explicaciones de Martin Splitt sobre rastreo/renderizado y la serie How Google Search Works. Buena base para lo que Googlebot hace antes de llegar al Crawl Stats report. Canal
Registro de cambios
Actualizado el 8 ago 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.
Actualizado el 17 jul 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.