Problemas de rastreabilidad: qué rompe el rastreo y cómo corregirlo

Los problemas de rastreabilidad son las condiciones técnicas que impiden que los motores de búsqueda descubran, accedan u obtengan sus páginas. Guía de triaje para los cuatro grupos: acceso bloqueado, enlaces rotos, servidores que fallan e inventario de URL inflado; cómo encontrarlos y cómo corregirlos.

Publicado por primera vez: 27 jun 2026 · Última actualización: 8 ago 2026 · Avanzado
Idiomas

La rastreabilidad indica lo bien que los rastreadores pueden descubrir, acceder y obtener sus páginas, y un problema de rastreabilidad es cualquier cosa que lo rompa. Casi todos los problemas encajan en uno de cuatro grupos: acceso bloqueado (robots.txt, muros de inicio de sesión, 403s y JS/CSS bloqueado), enlaces rotos o no rastreables (navegación solo con JS y páginas huérfanas), un servidor que falla o limita el tráfico (5xx, DNS, obtenciones lentas o truncadas y cadenas de redirecciones) o un inventario de URL inflado (trampas para arañas, duplicados con parámetros y Soft 404s). La rastreabilidad es previa a la indexación y al posicionamiento: es necesaria, pero no es una señal de posicionamiento y es distinta de la indexabilidad. Este hub organiza los problemas comunes de mayor impacto y enlaza a los análisis detallados.

TL;DR — La rastreabilidad es el grado en que los rastreadores pueden descubrir, acceder y obtener sus páginas; un problema de rastreabilidad es cualquier cosa que lo rompa. Casi todos encajan en cuatro grupos: acceso bloqueado (robots.txt, muros de inicio de sesión, 403, JS/CSS bloqueado), enlaces rotos (navegación solo con JS, huérfanos, páginas profundas), servidor fallando (5xx, fallos DNS, obtenciones lentas o truncadas, cadenas de redirecciones) e inventario de URL inflado (trampas para arañas, duplicados con parámetros y Soft 404). La rastreabilidad es previa a la indexación y al posicionamiento: es necesaria para posicionarse, pero no es una señal de posicionamiento y es distinta de la indexabilidad. Diagnostique con GSC (Indexación de páginas, Estadísticas de rastreo e Inspección de URL) y con registros del servidor; corrija primero el acceso y después el inventario. Este hub organiza cada problema y enlaza a los análisis detallados.

Qué es la rastreabilidad (y qué no es)

La rastreabilidad es la primera etapa de la cadena de búsqueda: descubrir → rastrear → renderizar → indexar → servir. Evidence for this claim Google describes Search as crawling, indexing, and serving, and not every page proceeds through every stage. Scope: Google Search processing model. Confidence: high · Verified: Google: How Search works Cada fallo aquí es previo a la indexación y al posicionamiento. El término es un paraguas de SEO, no uno de Google: el modelo propio de Google nombra tres etapas de Search —rastreo, indexación y servicio— y mete el descubrimiento y el renderizado dentro del rastreo en lugar de darles una etapa principal. La cadena de cinco pasos y el triaje de cuatro grupos que siguen son mi síntesis para organizar el trabajo de forma accionable; sirven para localizar un problema rápidamente, pero no son una cita sobre las etapas formales internas de Google.

Tres «no es igual» evitan la mayor parte de la confusión:

  • Rastreabilidad ≠ indexabilidad. Una página puede ser perfectamente rastreable pero estar bloqueada para el índice por una etiqueta noindex, o ser técnicamente rastreable y aun así no indexarse por señales de calidad. La rastreabilidad es una condición necesaria pero no suficiente para la indexación. (Consulte rastreada — actualmente no indexada para el caso de calidad posterior.)
  • Rastreo ≠ posicionamiento. El rastreo es necesario para aparecer en los resultados, pero Google dice: “an increased crawl rate will not necessarily lead to better positions in Search results… while crawling is necessary for being in the results, it’s not a ranking signal.” (traducción) «una mayor frecuencia de rastreo no necesariamente conduce a mejores posiciones; aunque el rastreo es necesario para aparecer en los resultados, no es una señal de posicionamiento».
  • Rastreo ≠ renderizado. Google renderiza la página y ejecuta JavaScript en una etapa separada: “during the crawl, Google renders the page and runs any JavaScript it finds using a recent version of Chrome” (traducción) «durante el rastreo, Google renderiza la página y ejecuta el JavaScript que encuentra con una versión reciente de Chrome»; ese renderizador tiene su propia cola y puede quedar retrasado respecto a la obtención inicial.

La cadena completa está en el hub de crawling; este artículo es la capa de triaje para cuando se rompe.

Los cuatro grupos de problemas de rastreabilidad

Úselos para localizar rápidamente el problema. Cada uno recibe aquí un tratamiento breve con un enlace al análisis detallado: no intente corregir lo que aún no ha categorizado. Es una lente de triaje, no una clasificación exhaustiva: sitemaps, noindex, etiquetas canónicas, nofollow, paridad móvil y contenido duplicado son problemas reales, pero la mayoría pertenece al descubrimiento, la indexabilidad, el renderizado o la eficiencia de rastreo, no a un fallo puro de acceso u obtención. Por eso tienen sus propias páginas enlazadas abajo en lugar de mezclarse en una lista plana de auditoría.

1. El acceso está bloqueado

Bloqueo mediante robots.txt (intencionado o accidental). Una regla Disallow impide que los rastreadores obtengan la URL. Google es explícito: “A robots.txt file tells search engine crawlers which URLs the crawler can access on your site… It is not a mechanism for keeping a web page out of Google.” (traducción) «Un archivo robots.txt indica a los rastreadores qué URL pueden acceder de su sitio; no es un mecanismo para mantener una página web fuera de Google». Los accidentes clásicos son publicar en producción un Disallow: / del sitio de staging, un plugin del CMS que añade una regla demasiado amplia o bloquear los recursos *.js/*.css que la página necesita para renderizarse. Evidence for this claim Google says robots.txt controls crawler access and is not a mechanism for keeping a page out of Google. Scope: Google robots.txt behavior; noindex must remain crawlable to be observed. Confidence: high · Verified: Google: robots.txt introduction (Consulte robots.txt y el estado de GSC bloqueado por robots.txt.)

La trampa de noindex + disallow. Esto ocurre constantemente. Si a la vez prohíbe una página en robots.txt y le pone noindex, Google nunca puede obtenerla para ver el noindex, así que puede seguir indexada a través de enlaces externos. Para desindexar una página, permita el rastreo y añada noindex. Nunca use disallow para desindexar. Escribí sobre el experimento real en Indexada aunque bloqueada por robots.txt: “crawling and indexing are two different things.” (traducción) «rastrear e indexar son dos cosas distintas».

Muros de inicio de sesión y 401. Si el contenido está detrás de un inicio de sesión interactivo o un flujo OAuth que Googlebot no puede completar, es inalcanzable: no se puede rastrear ni indexar. Eso no equivale a decir que «todo muro de pago es imposible de rastrear»: los editores pueden mostrar el contenido restringido o de suscripción de una forma distinta a los visitantes normales. Trate «requiere un inicio de sesión que Googlebot no puede superar» y «contenido medido o de pago» como casos separados, no suponga que todos los muros se comportan igual. (Consulte blocked 401.)

403 Forbidden. Antes de recurrir a una lista blanca de IP, revise las causas probables en orden, en lugar de asumir que la primera encontrada es la única:

  1. robots.txt: confirme que la ruta exacta no está prohibida para el agente de usuario de ese rastreador; es la causa más común y la más rápida de descartar.
  2. Bloqueos intermitentes o en caché: vuelva a probar la misma URL más de una vez y desde más de un punto de observación. Una regla de WAF/CDN que solo se activa a veces, o un 403 antiguo en caché, puede parecer permanente sin serlo.
  3. Bloqueos por agente de usuario: una regla de WAF/CDN que niega una cadena concreta de bot (recuerde que la cadena se puede falsificar, así que no detenga aquí la investigación).
  4. Bloqueos por rango de IP: el cortafuegos, CDN o regla geográfica que niega los rangos IP reales de Googlebot o la ubicación de su centro de datos. Solo incluya en la lista blanca a Googlebot verificado —confirmado mediante DNS inverso y directo, no solo por el encabezado del agente de usuario— cuando haya localizado la capa que lo bloquea. (Consulte blocked 403 y blocked other 4xx.)

JS/CSS bloqueado. Google renderiza en un Chrome sin interfaz. Si robots.txt bloquea *.js/*.css o un CDN rechaza esos recursos para Googlebot, la página renderizada aparece rota: el contenido que solo aparece después del renderizado puede no indexarse y los enlaces que solo aparecen tras JS pueden no seguirse. Pruebe con Inspección de URL → Prueba en directo y mire la captura renderizada.

2. Los enlaces están rotos o no son rastreables

Enlaces no rastreables. “Google can only crawl your link if it’s an <a> HTML element with an href attribute. Most links in other formats won’t be parsed and extracted by Google’s crawlers.” (traducción) «Google solo puede rastrear su enlace si es un elemento HTML <a> con un atributo href. Los rastreadores de Google no analizarán ni extraerán la mayoría de los enlaces en otros formatos». Eso descarta <a routerLink="...">, <span href="..."> y <a onclick="goto(...)">. Si la navegación principal solo usa controladores de clic JS, puede que nunca se descubran secciones enteras del sitio. (Consulte la sección de renderizado del hub de crawling y mis problemas y buenas prácticas de SEO para JavaScript.)

Páginas huérfanas. Una página sin enlaces internos que apunten a ella solo puede encontrarse mediante un sitemap o un enlace externo. Los enlaces son el canal de descubrimiento dominante, así que un huérfano suele aparecer como descubierta — actualmente no indexada en GSC. Una entrada del sitemap ayuda al descubrimiento; no sustituye la señal del enlace. Solución: enlace la página desde un hub o página de categoría relevante. (Consulte discovery y crawl depth.)

Páginas profundas. Las páginas enterradas a muchos clics de la página de inicio se rastrean más tarde y con menor frecuencia. Mantenga superficiales las páginas importantes (consulte crawl depth).

3. El servidor falla o limita el tráfico

Errores 5xx del servidor. Un 500/502/503/504 devuelve un error en lugar de contenido. Los 5xx sostenidos hacen que Googlebot reduzca la velocidad —“they try not to crawl the site too fast to avoid overloading it… HTTP 500 errors mean ‘slow down’” (traducción) «intentan no rastrear el sitio demasiado rápido para no sobrecargarlo; los errores HTTP 500 significan “más despacio”»— y finalmente puede retirar páginas ya indexadas. Si robots.txt devuelve 5xx, no es una parada instantánea e indefinida para todo el sitio: el comportamiento publicado por Google es gradual: el rastreo se detiene unas 12 horas, después Google puede recurrir al último robots.txt válido durante hasta 30 días, y lo posterior depende de las reglas almacenadas y de si el sitio suele ser accesible. Tenga en cuenta el matiz de 503: un 503 con encabezado Retry-After es la respuesta correcta durante una breve interrupción planificada; solo varias semanas causarían daño. Google agrupa 429 (demasiadas solicitudes) con el mismo comportamiento de retroceso. (Consulte server error (5xx) y crawl rate.)

Fallos de DNS. Son anteriores al HTTP: si el dominio no resuelve —registro caducado, migración de servidores de nombres defectuosa o resolución rota del dominio raíz— no hay respuesta del servidor que pueda devolver siquiera un 5xx. Un fallo DNS sostenido derriba todo el sitio. Detectelo en GSC Estadísticas de rastreo → Estado del host o, más rápido, con supervisión externa de disponibilidad.

Respuestas lentas y obtenciones truncadas. El mecanismo de cortesía de Google reduce la velocidad según la salud del servidor, así que las respuestas lentas producen menos rastreos. Además hay un límite estricto de bytes: según la actualización de marzo de 2026 de Inside Googlebot, Googlebot obtiene aproximadamente 2 MB por URL (frente a los 15 MB antiguos), y los PDF hasta 64 MB. Si se supera el límite, la obtención se trunca, no se rechaza: solo se indexa la parte descargada. Si su contenido crítico queda por debajo de 2 MB de desperdicio, puede cortarse.

Cadenas y bucles de redirecciones. Cada salto consume crédito de rastreo y las cadenas largas perjudican el rastreo; Google sigue solo unos cinco saltos antes de abandonar el destino. Los bucles agotan el tiempo y aparecen como error de redirección en GSC. Una causa habitual son las cadenas acumuladas www → no-www → HTTPS de migraciones sucesivas. (Consulte crawl budget, que enumera las cadenas de redirecciones como desperdicio.)

4. El inventario de URL está inflado

Trampas para arañas. Estructuras que generan un número de URL efectivamente infinito: combinaciones de filtros facetados, enlaces de calendario de «mes siguiente» sin fin, ID de sesión en las URL y paginación infinita. Los rastreadores gastan el presupuesto en basura casi duplicada mientras las páginas reales se rastrean menos. Google ha señalado la navegación por facetas y los parámetros de acción como responsables de gran parte de sus problemas de rastreo, y los «espacios infinitos» encabezan la lista de desperdicio desde 2008. No existe un umbral universal fijo para lo que es «demasiado»: la señal es una cuota desproporcionada de visitas concentrada en un patrón de URL basura respecto a la línea base normal del sitio, no un porcentaje concreto aplicable a todos. (Consulte spider traps.)

Parámetros de URL. Las cadenas de consulta (?key=value) crean varias URL para el mismo contenido: los parámetros activos (ordenación, filtros y paginación) generan casi duplicados; los pasivos (seguimiento e ID de sesión) generan duplicados puros. Ambos desperdician presupuesto y diluyen las señales de enlace. Nota: Google retiró su herramienta de parámetros de URL en abril de 2022 (solo encontró útil aproximadamente el 1 % de las configuraciones y ahora gestiona la mayoría de los casos automáticamente); no diga a la gente que la use. Bing todavía tiene una herramienta Ignore URL Parameters. Solución actual: ordenar los parámetros de forma coherente, usar rel=canonical para parámetros pasivos y bloquear en robots.txt solo las trampas reales. (Consulte url parameters y canonicalization.)

Soft 404. Página funcionalmente «no encontrada» (resultados de búsqueda vacíos o producto agotado y vaciado) que devuelve 200 OK. Google sigue rastreándola porque el estado dice que existe, desperdiciando presupuesto sin contenido indexable. Solución: devuelva un 404 o 410 real (410 Gone es ligeramente más rápido para retirar algo). Un 404 auténtico es una señal fuerte para no volver a rastrear esa URL.

Agotamiento del presupuesto de rastreo (solo sitios grandes)

Este es el problema del cuarto grupo a escala y merece su propia advertencia: la mayoría de los sitios nunca lo alcanza. Google dice claramente: “if your site doesn’t have a large number of pages that change rapidly, or if your pages seem to be crawled the same day that they are published, you don’t need to read this guide.” (traducción) «si su sitio no tiene muchas páginas que cambien rápidamente, o si sus páginas parecen rastrearse el mismo día en que se publican, no necesita leer esta guía». John Mueller ha dado una cifra: 100 000 URL normalmente no bastan para afectar al presupuesto de rastreo. En la práctica importa con aproximadamente 1 millón o más de páginas que cambian semanalmente o más de 10 000 que cambian a diario. El presupuesto es por nombre de host, y todos los rastreadores de Google (imagen, vídeo, noticias y anuncios) recurren al mismo conjunto por sitio. La señal de alarma es una cifra grande y creciente de descubierta — actualmente no indexada. (Tratamiento completo en crawl budget; también escribí ¿Cuándo debería preocuparse por el presupuesto de rastreo?.)

Cómo encontrar problemas de rastreabilidad

Google Search Console.

  • El informe de Indexación de páginas muestra fallos con nombre: bloqueado por robots.txt, error del servidor (5xx), no encontrado (404) y error de redirección.
  • El informe Estadísticas de rastreo muestra tendencias de códigos de respuesta, tiempo medio de respuesta y un panel de estado del host que señala problemas de DNS, robots.txt y conectividad del servidor. (Consulte crawl stats report.)
  • La Inspección de URL (prueba en directo) muestra qué obtuvo y renderizó Googlebot realmente para una URL; la captura renderizada es la forma más rápida de detectar JS/CSS bloqueado.
  • «Descubierta — actualmente no indexada» es la alarma de rastreo: Google conoce la URL, pero no la ha obtenido (normalmente es un problema de enlaces o de prioridad).

El análisis de archivos de registro del servidor es la fuente de verdad. Los registros muestran exactamente qué URL visitaron los bots, con qué frecuencia y con qué estado; son la única forma de distinguir Googlebot real (verificado mediante DNS inverso y directo) de los bots que falsifican el agente de usuario. Una trampa para arañas aparece como una cuota desproporcionada de visitas a un patrón de URL. (Consulte log file analysis.)

Los rastreadores de auditoría del sitio —Ahrefs Site Audit y Screaming Frog SEO Spider— simulan un rastreo y muestran en una pasada cadenas de redirecciones, URL bloqueadas, páginas huérfanas y profundidad de rastreo.

Rastreabilidad frente a indexabilidad: no las confunda

En resumen: la rastreabilidad indica si un bot puede alcanzar la página; la indexabilidad indica si Google decide guardarla una vez obtenida. Cuando se arregla la rastreabilidad, la indexabilidad es la siguiente puerta.

El estado de GSC es una hipótesis inicial útil, no un diagnóstico garantizado. Descubierta — actualmente no indexada suele apuntar a un problema de programación o prioridad de rastreo (añada enlaces internos y mejore la calidad del sitio). Rastreada — actualmente no indexada suele apuntar a un problema de contenido o calidad posterior al rastreo (contenido escaso, duplicado o que no coincide con la intención), pero Google no publica un mapa causal exhaustivo para ese estado y factores superpuestos como retrasos de renderizado, señales de canonicalización o comprobaciones de elegibilidad pueden producir la misma etiqueta. Trate el estado como primera pista, confírmelo con Inspección de URL y registros, y no aplique correcciones de rastreo a un problema de indexabilidad, ni al revés.

Cómo difiere la rastreabilidad de Bing de la de Google

Conviene conocer algunas diferencias prácticas si optimiza para ambos:

  • IndexNow: Bing (y Yandex, Naver, Seznam y Yep) lo acepta para notificar cambios al instante; Google no participa. No espere que IndexNow ayude a la rastreabilidad de Google.
  • Crawl Control: Bing todavía tiene una cuadrícula manual en Bing Webmaster Tools para programar las horas de rastreo; Google retiró su control deslizante de frecuencia en enero de 2024.
  • Ignore URL Parameters: Bing todavía lo ofrece; Google retiró el equivalente en abril de 2022.
  • lastmod: Bing le da más peso como señal de nuevo rastreo; Google ignora en gran medida los valores inexactos de lastmod.

Fabrice Canel, de Microsoft Bing, resume la filosofía de Bing así: “Less is more for SEO… Less URLs to crawl, better for SEO” (traducción) «Menos es más para el SEO; menos URL que rastrear significa mejor SEO». Leer la cobertura: toda la idea de la rastreabilidad en una línea. (Consulte bingbot.)

Adónde ir después

Este hub es el mapa; los análisis detallados hacen el trabajo. Para los controles de acceso, consulte robots.txt y noindex. Para el servidor, consulte error del servidor (5xx), frecuencia de rastreo y error de redirección. Para el inventario inflado, consulte trampas para arañas, parámetros de URL y presupuesto de rastreo. Para el descubrimiento y los enlaces, consulte descubrimiento, profundidad de rastreo y páginas huérfanas. Y para ver toda la cadena en un solo lugar, empiece por el hub de rastreo.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.