Informe de estadísticas de rastreo

Cómo leer el Crawl Stats report de Google Search Console: solicitudes totales, tamaño de descarga, tiempo de respuesta y los desgloses por respuesta, tipo de archivo, tipo de Googlebot y propósito.

Publicado por primera vez: 23 jun 2026 · Última actualización: 8 ago 2026 · Avanzado
Idiomas

El Crawl Stats report (Search Console → Configuración → Estadísticas de rastreo) muestra cómo Google rastreó tu sitio durante los últimos 90 días: solicitudes de rastreo totales, tamaño de descarga total y tiempo de respuesta promedio, además de desgloses por código de respuesta, tipo de archivo, tipo de Googlebot y propósito (Descubrimiento frente a Actualización). Solo está disponible para propiedades de nivel raíz —una propiedad de dominio o una propiedad de prefijo de URL verificada en la raíz del sitio—, no para propiedades de subcarpeta. Para la mayoría de los sitios, no es un panel de presupuesto de rastreo para optimizar, sino un sistema de alerta temprana sobre el estado del servidor. El aumento de los tiempos de respuesta o los errores 5xx hacen que Google reduzca el rastreo; la indisponibilidad sostenida de robots.txt puede detener el rastreo. Es lo más cerca que GSC está de los datos de registro, pero solo cubre los rastreadores de Google y no garantiza incluir todas las solicitudes.

TL;DR — Crawl Stats (Configuración → Crawl stats, solo propiedades de nivel raíz — dominio o prefijo de URL raíz) muestra el total de solicitudes de rastreo, el tamaño total de descarga y el tiempo medio de respuesta durante aproximadamente 90 días, además de desgloses por respuesta, tipo de archivo, tipo de Googlebot y propósito (Discovery vs Refresh). Léelo como un monitor de salud del servidor, no como un panel de vanidad del presupuesto de rastreo: un aumento del tiempo de respuesta o los errores 5xx hacen que Google reduzca la capacidad de rastreo, y un fallo sostenido de robots.txt puede detener el rastreo. Es lo más cerca que GSC está de los datos de registro, pero solo cubre los rastreadores de Google y no se garantiza que esté completo a nivel de solicitudes; para todos los bots, los usuarios y un registro completo, aún necesitas los registros del servidor. Google limita su propia guía de presupuesto de rastreo a sitios grandes que cambian con frecuencia; para la mayoría de los sitios más pequeños, en mi experiencia, casi nunca importa.

Evidence for this claim The Crawl Stats report shows Googlebot request totals, download size, response time, host status, and request breakdowns. Scope: Current Search Console Crawl Stats report. Confidence: high · Verified: Google Search Console: Crawl Stats report Evidence for this claim Google says crawl-budget management is mainly relevant to very large or rapidly changing sites; most sites can rely on normal crawling. Scope: Google's current crawl-budget guidance. Confidence: high · Verified: Google Search Central: Crawl budget management

Qué es y dónde se encuentra

La formulación del propio Google es directa: “The Crawl Stats report shows you statistics about Google’s crawling history on your website.” (traducción) «El Crawl Stats report te muestra estadísticas sobre el historial de rastreo de Google en tu sitio web.» Puedes acceder a él en Settings → Crawl stats — no en la barra lateral principal de informes, lo que confunde a muchas personas.

La razón más importante por la que las personas creen que el informe está “desaparecido” o “roto”: Google solo lo muestra para propiedades de nivel raíz. En sus palabras: “This report is available only for root-level properties.” (traducción) «Este informe solo está disponible para propiedades de nivel raíz.» Esto abarca tanto una propiedad de dominio como una propiedad de prefijo de URL verificada en la raíz del sitio (por ejemplo, https:// example.com) —no se limita a las propiedades de dominio sin protocolo. Si verificaste una propiedad de prefijo de URL limitada a una subcarpeta o subruta, vuelve a verificarla en el nivel raíz y aparecerá. No hay ningún problema con tu sitio.

Evidence for this claim Crawl Stats is available for root-level properties, including a Domain property or a URL-prefix property at a host root; saying it requires a Domain property or a property without a protocol is too narrow. Scope: root-level properties Confidence: high · Verified: Crawl Stats report

¿Debería importarte? El replanteamiento del presupuesto de rastreo

La mayoría de los sitios no necesitan optimizar el presupuesto de rastreo, y el valor real del informe es la supervisión del estado más que el ajuste del presupuesto. Google limita su propia orientación sobre el presupuesto de rastreo a sitios grandes (1M+ páginas únicas) y sitios medianos o más grandes (10k+ páginas con cambios diarios). Por debajo de eso, esto es un diagnóstico, no un proyecto.

Google también presenta el propio informe como algo pensado para usuarios avanzados, y afirma que los sitios con menos de aproximadamente 1 000 páginas por lo general no necesitan profundizar en él con este nivel de granularidad —un umbral menor que la guía sobre presupuesto de rastreo anterior—. Mi propia regla general es más flexible: para la mayoría de los sitios con menos de unas 10 000 páginas, yo aun así no dedicaría mucho tiempo al presupuesto de rastreo. Considera esto como el criterio de un profesional, no como un límite oficial.

La frecuencia de rastreo está regida por dos cosas que trabajan en conjunto — límite de capacidad de rastreo y demanda de rastreo. La capacidad es lo que tu servidor puede manejar. Google define el límite de capacidad como “The maximum number of simultaneous parallel connections that Google can use to crawl a site, as well as the time delay between fetches.” (traducción) «El número máximo de conexiones paralelas simultáneas que Google puede utilizar para rastrear un sitio, así como el retraso temporal entre recuperaciones.» La demanda es cuánto quiere rastrear Google, impulsada por factores como la popularidad y la falta de actualización. El informe es donde se muestran las consecuencias de ambos. (Más información sobre el concepto en presupuesto de rastreo.)

Algunos detalles del alcance que vale la pena conocer antes de leer los números: el informe cuenta la URL real que solicitó Googlebot en lugar de la URL canónica a la que se resuelve, y cuenta las solicitudes duplicadas y cada salto de redirección del lado del servidor por separado (las redirecciones del lado del cliente no se cuentan aquí como respuestas de redirección). Su alcance es la propiedad o el host que estás viendo — los recursos en otros dominios, y a veces los dominios hermanos o secundarios, pueden estar subrepresentados o sobrerrepresentados según el tipo de propiedad. Y según la propia documentación de Google, el informe refleja la mayoría de las solicitudes de rastreo pero puede omitir algunas, por lo que es esperable una pequeña discrepancia con tus propios registros de servidor, no un error.

Esto es lo más parecido a los datos de archivos de registro que te ofrece Search Console, pero solo incluye los rastreadores de Google, está agregado y no se garantiza que esté completo a nivel de solicitudes. Si quieres las solicitudes de todos los bots y usuarios, o un registro completo garantizado, necesitas los registros de tu servidor. Considera Crawl Stats como el primer vistazo gratuito antes de invertir en análisis de registros.

Las tres métricas principales

Interprétalas como tendencias, no como objetivos:

  • Solicitudes de rastreo totales“The total number of crawl requests issued for URLs on your site, whether successful or not.” (traducción) «El número total de solicitudes de rastreo emitidas para las URL de tu sitio, tengan éxito o no.» Cada solicitud cuenta, incluidas las que fallaron.
  • Tamaño de descarga total“Total number of bytes downloaded from your site during crawling, for the specified time period.” (traducción) «El número total de bytes descargados de tu sitio durante el rastreo, para el período de tiempo especificado.»
  • Tiempo de respuesta promedio“Average response time for all resources fetched from your site during the specified time period.” (traducción) «El tiempo de respuesta promedio para todos los recursos obtenidos de tu sitio durante el período de tiempo especificado.» Esto es, en la práctica, un indicador indirecto del estado del servidor. Un pico sostenido es una alarma de rendimiento, y Google puede responder reduciendo tu límite de capacidad de rastreo, por lo que el daño de SEO es indirecto (rastreo más lento y menor), separado de cualquier factor de posicionamiento de velocidad de página.

Desglose: Por respuesta

Esta tabla, en palabras de Google, muestra “the responses that Google received when crawling your site, grouped by response type, as a percentage of all crawl responses.” (traducción) «las respuestas que recibió Google al rastrear tu sitio, agrupadas por tipo de respuesta, como porcentaje de todas las respuestas de rastreo.» Los tipos de respuesta incluyen OK (200), Movido permanentemente (301), Movido temporalmente (302), error 404, Server error (5XX) y robots.txt no disponible.

Cómo interpreto cada patrón:

  • 200 debería ser la gran mayoría. Google no publica un porcentaje objetivo específico, así que evalúa esto con respecto a tu propia línea base y observa cambios sostenidos en lugar de buscar un número exacto.
  • Muchos 404 no son fatales, pero indican rastreo desperdiciado: Google gasta solicitudes en URL que no existen.
  • Muchos 301 apuntan a cadenas de redirecciones o enlaces internos que todavía apuntan a URL antiguas. Corrige los enlaces para que apunten al destino final.
  • Un pico de 5xx es el patrón más perjudicial del informe. Tu servidor está generando errores bajo la carga de rastreo, lo que reduce el límite de capacidad, lo que significa menos rastreo. Los 5xx sostenidos pueden, en la práctica, limitar el rastreo de Google a un mínimo.
  • robots.txt not available no debería aparecer de forma sostenida y significativa. Google no publica un porcentaje objetivo fijo, pero una proporción persistente significa que Google periódicamente no pudo obtener tu robots.txt. Eso importa porque si tu robots.txt permanece no disponible, Google pausará de manera conservadora el rastreo durante un tiempo en lugar de adivinar. (Para saber qué controla y qué no controla robots.txt, consulta robots.txt.)

Desglose: Por tipo de archivo

Google agrupa el rastreo por tipo de archivo — HTML, imagen, JavaScript, CSS, JSON, PDF, y otros. Esta es una pista de diagnóstico, no una prueba de desperdicio por sí sola — la cantidad de JS, CSS, imágenes o JSON que se rastrea de forma normal depende de cómo esté construido tu sitio (una aplicación con mucho JS necesita legítimamente más rastreo de recursos que un sitio HTML estático). Una proporción de JS/CSS/imágenes que sea alta en relación con tu propia línea base, o que aumenta de repente, vale la pena investigarla como posible sobrecarga de recursos de renderizado. La aparición de tipos de archivo inesperados puede revelar una trampa de rastreo — un espacio de URL infinito o casi infinito que genera basura.

Desglose: por tipo de Googlebot

Esto divide el rastreo según qué Googlebot realizó la obtención: smartphone, escritorio, imágenes, video, carga de recursos de la página y AdsBot. Google no documenta una combinación obligatoria, pero en un rastreo mobile-first, el smartphone suele liderar en la mayoría de los sitios. Un perfil con mucho escritorio, o un volumen inesperado de imágenes o AdsBot, es una pista que vale la pena investigar, no una infracción por sí sola — puede significar que Google no está tratando tu sitio como mobile-first, que el rastreo de anuncios/imágenes está consumiendo presupuesto de rastreo que preferirías destinar a contenido, o simplemente que tu sitio tiene necesidades de recursos poco habituales.

Desglose: por propósito — Discovery vs Refresh

Dos categorías, y Google las define solo por el historial de rastreo previo — las etiquetas por sí solas no te indican si la combinación es saludable:

  • Discovery“The URL requested was never crawled by Google before.” (traducción) «La URL solicitada nunca antes había sido rastreada por Google.»
  • Refresh“A recrawl of a known page.” (traducción) «Un nuevo rastreo de una página conocida.»

Un aumento en Discovery es esperable durante un lanzamiento o migración (Google está encontrando tus nuevas URL); el mismo aumento es un problema si proviene de URL de espacio infinito o de parámetros: es presupuesto de rastreo yéndose a la basura. Una mezcla dominada por Refresh es normal para un sitio establecido que no publica mucho contenido nuevo. Juzga cualquiera de ellas frente a tu propia línea base y lo que sabes que cambió, no frente a una proporción “saludable” fija.

Host status — el bloque más accionable

Host status resume si Google encontró problemas de disponibilidad al intentar rastrear tu sitio, agrupados en tres subcomprobaciones: obtención de robots.txt, resolución de DNS y conectividad del servidor. Un Host status rojo es una de las señales más accionables en el informe: normalmente significa que Google fue bloqueado o limitado en el nivel de infraestructura, durante esa ventana, antes de llegar siquiera a tu contenido. Sin embargo, es una alerta agregada, no una prueba de que todas las URL se vieran afectadas o de que el problema siga ocurriendo ahora: revisa la cronología y confirma el estado actual (una obtención en vivo, Inspección de URL o tus registros) antes de darlo por solucionado. Aun así, trata un Host status rojo como lo primero que investigar. (Se aborda de forma independiente en Host status.)

Lectura de picos y caídas

El mecanismo que debes internalizar: el comportamiento de tu servidor retroalimenta cuánto rastrea Google. Si el sitio responde rápida y fiablemente, el límite de capacidad de Google puede subir; si se ralentiza o empieza a devolver errores de servidor, el límite baja. Así que:

  • Pico de tiempo de respuesta → el límite de capacidad puede bajar → menos rastreo.
  • Aumento de 5xx → el límite de capacidad baja → menos rastreo; si se mantiene, puede limitar tu rastreo de forma severa.
  • robots.txt no disponible → si sigue no disponible, Google pausa el rastreo de forma conservadora.

Nada de esto es una penalización de posicionamiento. El daño es indirecto: si las páginas no se rastrean ni se indexan, no pueden posicionarse en absoluto — pero el rastreo adicional no mejora las posiciones tampoco. (Consulta el concepto de presupuesto de rastreo para ver el modelo completo de capacidad más demanda.)

Crawl Stats vs registros del servidor

Crawl Stats es lo más cerca que GSC está de los registros, pero las lagunas importan:

Crawl Stats reportRegistros del servidor
A quiénes cubreSolo los rastreadores de GoogleTodos los bots y todos los usuarios
GranularidadAgregada; puede omitir algunas solicitudesCada solicitud individual
Retención~90 díasLo que conserves
Detalle por URLNo
CostoGratis, en GSCAlmacenamiento + esfuerzo de análisis

Si Crawl Stats se te queda corto —necesitas datos por URL, bots que no sean de Google o un historial más largo—, ese es el momento de pasar al log file analysis. Crawl Stats te dice que algo no está bien; los registros te dicen exactamente dónde.

Cómo se relaciona esto con el resto del rastreo

El Crawl Stats report es tu forma de ver el rastreo una vez que ha ocurrido. Para el aspecto de indexación de lo que sucede a continuación, el Page Indexing report es el complemento — Crawl Stats muestra lo que Google obtuvo; Page Indexing muestra lo que llegó al índice. Y Host status, que aparece dentro de este informe, es la señal a nivel de infraestructura con la que vale la pena comenzar.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.