Problemas de rastreabilidad: qué rompe el rastreo y cómo corregirlo
Los problemas de rastreabilidad son las condiciones técnicas que impiden que los motores de búsqueda descubran, accedan u obtengan sus páginas. Guía de triaje para los cuatro grupos: acceso bloqueado, enlaces rotos, servidores que fallan e inventario de URL inflado; cómo encontrarlos y cómo corregirlos.
Idiomas
La rastreabilidad indica lo bien que los rastreadores pueden descubrir, acceder y obtener sus páginas, y un problema de rastreabilidad es cualquier cosa que lo rompa. Casi todos los problemas encajan en uno de cuatro grupos: acceso bloqueado (robots.txt, muros de inicio de sesión, 403s y JS/CSS bloqueado), enlaces rotos o no rastreables (navegación solo con JS y páginas huérfanas), un servidor que falla o limita el tráfico (5xx, DNS, obtenciones lentas o truncadas y cadenas de redirecciones) o un inventario de URL inflado (trampas para arañas, duplicados con parámetros y Soft 404s). La rastreabilidad es previa a la indexación y al posicionamiento: es necesaria, pero no es una señal de posicionamiento y es distinta de la indexabilidad. Este hub organiza los problemas comunes de mayor impacto y enlaza a los análisis detallados.
TL;DR — La rastreabilidad es la posibilidad de que los motores de búsqueda encuentren y alcancen sus páginas. Un problema de rastreabilidad es cualquier obstáculo: una página bloqueada en
robots.txt, un enlace que los bots no pueden seguir, un servidor que devuelve errores continuamente o una avalancha de URL basura. Si una página no se puede rastrear, no se puede indexar; y si no está indexada, no puede aparecer en la búsqueda. Corrija primero el problema de acceso: todo lo demás viene después.
Qué es la rastreabilidad
Antes de que una página pueda posicionarse, un motor de búsqueda tiene que rastrearla: enviar un bot (Googlebot para Google, Bingbot para Bing) para descubrir la URL y descargar la página. La rastreabilidad es simplemente la facilidad con la que puede hacerlo. Un problema de rastreabilidad es cualquier problema técnico que lo detiene o lo ralentiza. Evidence for this claim Google describes Search as crawling, indexing, and serving, and not every page proceeds through every stage. Scope: Google Search processing model. Confidence: high · Verified: Google: How Search works
Piense en la búsqueda como una cadena: descubrir → rastrear → renderizar → indexar → servir. Este desglose de cinco pasos es mi forma práctica de organizar el trabajo; el modelo oficial de Google agrupa el descubrimiento y el renderizado dentro de una etapa más amplia de «rastreo» en lugar de enumerarlos por separado. En cualquier caso, el rastreo está cerca del principio y todo lo posterior depende de él. Por eso un problema de rastreabilidad es el peor tipo de problema de SEO: no importa lo bueno que sea su contenido si el bot nunca llega a leerlo. Evidence for this claim Crawlability is a useful SEO umbrella for whether crawlers can discover, access, fetch, and render content, but Google's official model has three Search stages and treats URL discovery and rendering within crawling; the article's five-step pipeline and four buckets are Patrick's synthesis, not a Google taxonomy. Scope: web search Confidence: high · Verified: In-depth guide to how Google Search works
Los cuatro tipos de problemas de rastreabilidad
Casi todos los problemas encajan en uno de cuatro grupos. Es un atajo para el triaje, no una lista exhaustiva: cosas como la falta de sitemap o una etiqueta noindex perdida quedan justo fuera de estos cuatro. Cuando algo no se encuentra, determine primero en qué grupo está:
- El acceso está bloqueado. Su
robots.txtprohíbe la página, está detrás de un inicio de sesión, un cortafuegos devuelve «403 Forbidden» o están bloqueados el CSS o el JS que la página necesita. - Los enlaces están rotos o no son rastreables. La navegación solo funciona con clics de JavaScript en lugar de enlaces reales, o ninguna página enlaza a la URL (es un «huérfano»).
- El servidor falla. Devuelve errores (500s), el dominio no resuelve, es extremadamente lento o las páginas pasan por largas cadenas de redirecciones.
- El inventario de URL está inflado. Los filtros, calendarios y etiquetas de seguimiento generan infinitas URL casi duplicadas, y los bots pierden el tiempo en basura en lugar de sus páginas reales.
Lo que la mayoría entiende mal
Bloquear una página en robots.txt no la elimina de Google. Solo impide que Google la lea. La página aún puede aparecer en los resultados (sin descripción) si otros sitios enlazan a ella. Si realmente quiere que desaparezca, permita que se rastree y añada una etiqueta noindex. Evidence for this claim Google says robots.txt controls crawler access and is not a mechanism for keeping a page out of Google. Scope: Google robots.txt behavior; noindex must remain crawlable to be observed. Confidence: high · Verified: Google: robots.txt introduction
Y rastrear no es posicionarse. Que una página se rastree con más frecuencia no la hará subir en los resultados: el rastreo es una puerta que debe atravesar, no una puntuación.
¿Quiere el marco completo de triaje, cómo encontrar problemas en Search Console y en los registros del servidor y cómo corregir cada uno? Cambie a la pestaña Avanzado.
TL;DR — La rastreabilidad es el grado en que los rastreadores pueden descubrir, acceder y obtener sus páginas; un problema de rastreabilidad es cualquier cosa que lo rompa. Casi todos encajan en cuatro grupos: acceso bloqueado (robots.txt, muros de inicio de sesión, 403, JS/CSS bloqueado), enlaces rotos (navegación solo con JS, huérfanos, páginas profundas), servidor fallando (5xx, fallos DNS, obtenciones lentas o truncadas, cadenas de redirecciones) e inventario de URL inflado (trampas para arañas, duplicados con parámetros y Soft 404). La rastreabilidad es previa a la indexación y al posicionamiento: es necesaria para posicionarse, pero no es una señal de posicionamiento y es distinta de la indexabilidad. Diagnostique con GSC (Indexación de páginas, Estadísticas de rastreo e Inspección de URL) y con registros del servidor; corrija primero el acceso y después el inventario. Este hub organiza cada problema y enlaza a los análisis detallados.
Qué es la rastreabilidad (y qué no es)
La rastreabilidad es la primera etapa de la cadena de búsqueda: descubrir → rastrear → renderizar → indexar → servir. Evidence for this claim Google describes Search as crawling, indexing, and serving, and not every page proceeds through every stage. Scope: Google Search processing model. Confidence: high · Verified: Google: How Search works Cada fallo aquí es previo a la indexación y al posicionamiento. El término es un paraguas de SEO, no uno de Google: el modelo propio de Google nombra tres etapas de Search —rastreo, indexación y servicio— y mete el descubrimiento y el renderizado dentro del rastreo en lugar de darles una etapa principal. La cadena de cinco pasos y el triaje de cuatro grupos que siguen son mi síntesis para organizar el trabajo de forma accionable; sirven para localizar un problema rápidamente, pero no son una cita sobre las etapas formales internas de Google.
Tres «no es igual» evitan la mayor parte de la confusión:
- Rastreabilidad ≠ indexabilidad. Una página puede ser perfectamente rastreable pero estar bloqueada para el índice por una etiqueta
noindex, o ser técnicamente rastreable y aun así no indexarse por señales de calidad. La rastreabilidad es una condición necesaria pero no suficiente para la indexación. (Consulte rastreada — actualmente no indexada para el caso de calidad posterior.) - Rastreo ≠ posicionamiento. El rastreo es necesario para aparecer en los resultados, pero Google dice: “an increased crawl rate will not necessarily lead to better positions in Search results… while crawling is necessary for being in the results, it’s not a ranking signal.” (traducción) «una mayor frecuencia de rastreo no necesariamente conduce a mejores posiciones; aunque el rastreo es necesario para aparecer en los resultados, no es una señal de posicionamiento».
- Rastreo ≠ renderizado. Google renderiza la página y ejecuta JavaScript en una etapa separada: “during the crawl, Google renders the page and runs any JavaScript it finds using a recent version of Chrome” (traducción) «durante el rastreo, Google renderiza la página y ejecuta el JavaScript que encuentra con una versión reciente de Chrome»; ese renderizador tiene su propia cola y puede quedar retrasado respecto a la obtención inicial.
La cadena completa está en el hub de crawling; este artículo es la capa de triaje para cuando se rompe.
Los cuatro grupos de problemas de rastreabilidad
Úselos para localizar rápidamente el problema. Cada uno recibe aquí un tratamiento breve con un enlace al análisis detallado: no intente corregir lo que aún no ha categorizado. Es una lente de triaje, no una clasificación exhaustiva: sitemaps, noindex, etiquetas canónicas, nofollow, paridad móvil y contenido duplicado son problemas reales, pero la mayoría pertenece al descubrimiento, la indexabilidad, el renderizado o la eficiencia de rastreo, no a un fallo puro de acceso u obtención. Por eso tienen sus propias páginas enlazadas abajo en lugar de mezclarse en una lista plana de auditoría.
1. El acceso está bloqueado
Bloqueo mediante robots.txt (intencionado o accidental). Una regla Disallow impide que los rastreadores obtengan la URL. Google es explícito: “A robots.txt file tells search engine crawlers which URLs the crawler can access on your site… It is not a mechanism for keeping a web page out of Google.” (traducción) «Un archivo robots.txt indica a los rastreadores qué URL pueden acceder de su sitio; no es un mecanismo para mantener una página web fuera de Google». Los accidentes clásicos son publicar en producción un Disallow: / del sitio de staging, un plugin del CMS que añade una regla demasiado amplia o bloquear los recursos *.js/*.css que la página necesita para renderizarse. Evidence for this claim Google says robots.txt controls crawler access and is not a mechanism for keeping a page out of Google. Scope: Google robots.txt behavior; noindex must remain crawlable to be observed. Confidence: high · Verified: Google: robots.txt introduction (Consulte robots.txt y el estado de GSC bloqueado por robots.txt.)
La trampa de noindex + disallow. Esto ocurre constantemente. Si a la vez prohíbe una página en robots.txt y le pone noindex, Google nunca puede obtenerla para ver el noindex, así que puede seguir indexada a través de enlaces externos. Para desindexar una página, permita el rastreo y añada noindex. Nunca use disallow para desindexar. Escribí sobre el experimento real en Indexada aunque bloqueada por robots.txt: “crawling and indexing are two different things.” (traducción) «rastrear e indexar son dos cosas distintas».
Muros de inicio de sesión y 401. Si el contenido está detrás de un inicio de sesión interactivo o un flujo OAuth que Googlebot no puede completar, es inalcanzable: no se puede rastrear ni indexar. Eso no equivale a decir que «todo muro de pago es imposible de rastrear»: los editores pueden mostrar el contenido restringido o de suscripción de una forma distinta a los visitantes normales. Trate «requiere un inicio de sesión que Googlebot no puede superar» y «contenido medido o de pago» como casos separados, no suponga que todos los muros se comportan igual. (Consulte blocked 401.)
403 Forbidden. Antes de recurrir a una lista blanca de IP, revise las causas probables en orden, en lugar de asumir que la primera encontrada es la única:
- robots.txt: confirme que la ruta exacta no está prohibida para el agente de usuario de ese rastreador; es la causa más común y la más rápida de descartar.
- Bloqueos intermitentes o en caché: vuelva a probar la misma URL más de una vez y desde más de un punto de observación. Una regla de WAF/CDN que solo se activa a veces, o un 403 antiguo en caché, puede parecer permanente sin serlo.
- Bloqueos por agente de usuario: una regla de WAF/CDN que niega una cadena concreta de bot (recuerde que la cadena se puede falsificar, así que no detenga aquí la investigación).
- Bloqueos por rango de IP: el cortafuegos, CDN o regla geográfica que niega los rangos IP reales de Googlebot o la ubicación de su centro de datos. Solo incluya en la lista blanca a Googlebot verificado —confirmado mediante DNS inverso y directo, no solo por el encabezado del agente de usuario— cuando haya localizado la capa que lo bloquea. (Consulte blocked 403 y blocked other 4xx.)
JS/CSS bloqueado. Google renderiza en un Chrome sin interfaz. Si robots.txt bloquea *.js/*.css o un CDN rechaza esos recursos para Googlebot, la página renderizada aparece rota: el contenido que solo aparece después del renderizado puede no indexarse y los enlaces que solo aparecen tras JS pueden no seguirse. Pruebe con Inspección de URL → Prueba en directo y mire la captura renderizada.
2. Los enlaces están rotos o no son rastreables
Enlaces no rastreables. “Google can only crawl your link if it’s an <a> HTML element with an href attribute. Most links in other formats won’t be parsed and extracted by Google’s crawlers.” (traducción) «Google solo puede rastrear su enlace si es un elemento HTML <a> con un atributo href. Los rastreadores de Google no analizarán ni extraerán la mayoría de los enlaces en otros formatos». Eso descarta <a routerLink="...">, <span href="..."> y <a onclick="goto(...)">. Si la navegación principal solo usa controladores de clic JS, puede que nunca se descubran secciones enteras del sitio. (Consulte la sección de renderizado del hub de crawling y mis problemas y buenas prácticas de SEO para JavaScript.)
Páginas huérfanas. Una página sin enlaces internos que apunten a ella solo puede encontrarse mediante un sitemap o un enlace externo. Los enlaces son el canal de descubrimiento dominante, así que un huérfano suele aparecer como descubierta — actualmente no indexada en GSC. Una entrada del sitemap ayuda al descubrimiento; no sustituye la señal del enlace. Solución: enlace la página desde un hub o página de categoría relevante. (Consulte discovery y crawl depth.)
Páginas profundas. Las páginas enterradas a muchos clics de la página de inicio se rastrean más tarde y con menor frecuencia. Mantenga superficiales las páginas importantes (consulte crawl depth).
3. El servidor falla o limita el tráfico
Errores 5xx del servidor. Un 500/502/503/504 devuelve un error en lugar de contenido. Los 5xx sostenidos hacen que Googlebot reduzca la velocidad —“they try not to crawl the site too fast to avoid overloading it… HTTP 500 errors mean ‘slow down’” (traducción) «intentan no rastrear el sitio demasiado rápido para no sobrecargarlo; los errores HTTP 500 significan “más despacio”»— y finalmente puede retirar páginas ya indexadas. Si robots.txt devuelve 5xx, no es una parada instantánea e indefinida para todo el sitio: el comportamiento publicado por Google es gradual: el rastreo se detiene unas 12 horas, después Google puede recurrir al último robots.txt válido durante hasta 30 días, y lo posterior depende de las reglas almacenadas y de si el sitio suele ser accesible. Tenga en cuenta el matiz de 503: un 503 con encabezado Retry-After es la respuesta correcta durante una breve interrupción planificada; solo varias semanas causarían daño. Google agrupa 429 (demasiadas solicitudes) con el mismo comportamiento de retroceso. (Consulte server error (5xx) y crawl rate.)
Fallos de DNS. Son anteriores al HTTP: si el dominio no resuelve —registro caducado, migración de servidores de nombres defectuosa o resolución rota del dominio raíz— no hay respuesta del servidor que pueda devolver siquiera un 5xx. Un fallo DNS sostenido derriba todo el sitio. Detectelo en GSC Estadísticas de rastreo → Estado del host o, más rápido, con supervisión externa de disponibilidad.
Respuestas lentas y obtenciones truncadas. El mecanismo de cortesía de Google reduce la velocidad según la salud del servidor, así que las respuestas lentas producen menos rastreos. Además hay un límite estricto de bytes: según la actualización de marzo de 2026 de Inside Googlebot, Googlebot obtiene aproximadamente 2 MB por URL (frente a los 15 MB antiguos), y los PDF hasta 64 MB. Si se supera el límite, la obtención se trunca, no se rechaza: solo se indexa la parte descargada. Si su contenido crítico queda por debajo de 2 MB de desperdicio, puede cortarse.
Cadenas y bucles de redirecciones. Cada salto consume crédito de rastreo y las cadenas largas perjudican el rastreo; Google sigue solo unos cinco saltos antes de abandonar el destino. Los bucles agotan el tiempo y aparecen como error de redirección en GSC. Una causa habitual son las cadenas acumuladas www → no-www → HTTPS de migraciones sucesivas. (Consulte crawl budget, que enumera las cadenas de redirecciones como desperdicio.)
4. El inventario de URL está inflado
Trampas para arañas. Estructuras que generan un número de URL efectivamente infinito: combinaciones de filtros facetados, enlaces de calendario de «mes siguiente» sin fin, ID de sesión en las URL y paginación infinita. Los rastreadores gastan el presupuesto en basura casi duplicada mientras las páginas reales se rastrean menos. Google ha señalado la navegación por facetas y los parámetros de acción como responsables de gran parte de sus problemas de rastreo, y los «espacios infinitos» encabezan la lista de desperdicio desde 2008. No existe un umbral universal fijo para lo que es «demasiado»: la señal es una cuota desproporcionada de visitas concentrada en un patrón de URL basura respecto a la línea base normal del sitio, no un porcentaje concreto aplicable a todos. (Consulte spider traps.)
Parámetros de URL. Las cadenas de consulta (?key=value) crean varias URL para el mismo contenido: los parámetros activos (ordenación, filtros y paginación) generan casi duplicados; los pasivos (seguimiento e ID de sesión) generan duplicados puros. Ambos desperdician presupuesto y diluyen las señales de enlace. Nota: Google retiró su herramienta de parámetros de URL en abril de 2022 (solo encontró útil aproximadamente el 1 % de las configuraciones y ahora gestiona la mayoría de los casos automáticamente); no diga a la gente que la use. Bing todavía tiene una herramienta Ignore URL Parameters. Solución actual: ordenar los parámetros de forma coherente, usar rel=canonical para parámetros pasivos y bloquear en robots.txt solo las trampas reales. (Consulte url parameters y canonicalization.)
Soft 404. Página funcionalmente «no encontrada» (resultados de búsqueda vacíos o producto agotado y vaciado) que devuelve 200 OK. Google sigue rastreándola porque el estado dice que existe, desperdiciando presupuesto sin contenido indexable. Solución: devuelva un 404 o 410 real (410 Gone es ligeramente más rápido para retirar algo). Un 404 auténtico es una señal fuerte para no volver a rastrear esa URL.
Agotamiento del presupuesto de rastreo (solo sitios grandes)
Este es el problema del cuarto grupo a escala y merece su propia advertencia: la mayoría de los sitios nunca lo alcanza. Google dice claramente: “if your site doesn’t have a large number of pages that change rapidly, or if your pages seem to be crawled the same day that they are published, you don’t need to read this guide.” (traducción) «si su sitio no tiene muchas páginas que cambien rápidamente, o si sus páginas parecen rastrearse el mismo día en que se publican, no necesita leer esta guía». John Mueller ha dado una cifra: 100 000 URL normalmente no bastan para afectar al presupuesto de rastreo. En la práctica importa con aproximadamente 1 millón o más de páginas que cambian semanalmente o más de 10 000 que cambian a diario. El presupuesto es por nombre de host, y todos los rastreadores de Google (imagen, vídeo, noticias y anuncios) recurren al mismo conjunto por sitio. La señal de alarma es una cifra grande y creciente de descubierta — actualmente no indexada. (Tratamiento completo en crawl budget; también escribí ¿Cuándo debería preocuparse por el presupuesto de rastreo?.)
Cómo encontrar problemas de rastreabilidad
Google Search Console.
- El informe de Indexación de páginas muestra fallos con nombre: bloqueado por robots.txt, error del servidor (5xx), no encontrado (404) y error de redirección.
- El informe Estadísticas de rastreo muestra tendencias de códigos de respuesta, tiempo medio de respuesta y un panel de estado del host que señala problemas de DNS, robots.txt y conectividad del servidor. (Consulte crawl stats report.)
- La Inspección de URL (prueba en directo) muestra qué obtuvo y renderizó Googlebot realmente para una URL; la captura renderizada es la forma más rápida de detectar JS/CSS bloqueado.
- «Descubierta — actualmente no indexada» es la alarma de rastreo: Google conoce la URL, pero no la ha obtenido (normalmente es un problema de enlaces o de prioridad).
El análisis de archivos de registro del servidor es la fuente de verdad. Los registros muestran exactamente qué URL visitaron los bots, con qué frecuencia y con qué estado; son la única forma de distinguir Googlebot real (verificado mediante DNS inverso y directo) de los bots que falsifican el agente de usuario. Una trampa para arañas aparece como una cuota desproporcionada de visitas a un patrón de URL. (Consulte log file analysis.)
Los rastreadores de auditoría del sitio —Ahrefs Site Audit y Screaming Frog SEO Spider— simulan un rastreo y muestran en una pasada cadenas de redirecciones, URL bloqueadas, páginas huérfanas y profundidad de rastreo.
Rastreabilidad frente a indexabilidad: no las confunda
En resumen: la rastreabilidad indica si un bot puede alcanzar la página; la indexabilidad indica si Google decide guardarla una vez obtenida. Cuando se arregla la rastreabilidad, la indexabilidad es la siguiente puerta.
El estado de GSC es una hipótesis inicial útil, no un diagnóstico garantizado. Descubierta — actualmente no indexada suele apuntar a un problema de programación o prioridad de rastreo (añada enlaces internos y mejore la calidad del sitio). Rastreada — actualmente no indexada suele apuntar a un problema de contenido o calidad posterior al rastreo (contenido escaso, duplicado o que no coincide con la intención), pero Google no publica un mapa causal exhaustivo para ese estado y factores superpuestos como retrasos de renderizado, señales de canonicalización o comprobaciones de elegibilidad pueden producir la misma etiqueta. Trate el estado como primera pista, confírmelo con Inspección de URL y registros, y no aplique correcciones de rastreo a un problema de indexabilidad, ni al revés.
Cómo difiere la rastreabilidad de Bing de la de Google
Conviene conocer algunas diferencias prácticas si optimiza para ambos:
- IndexNow: Bing (y Yandex, Naver, Seznam y Yep) lo acepta para notificar cambios al instante; Google no participa. No espere que IndexNow ayude a la rastreabilidad de Google.
- Crawl Control: Bing todavía tiene una cuadrícula manual en Bing Webmaster Tools para programar las horas de rastreo; Google retiró su control deslizante de frecuencia en enero de 2024.
- Ignore URL Parameters: Bing todavía lo ofrece; Google retiró el equivalente en abril de 2022.
lastmod: Bing le da más peso como señal de nuevo rastreo; Google ignora en gran medida los valores inexactos delastmod.
Fabrice Canel, de Microsoft Bing, resume la filosofía de Bing así: “Less is more for SEO… Less URLs to crawl, better for SEO” (traducción) «Menos es más para el SEO; menos URL que rastrear significa mejor SEO». Leer la cobertura: toda la idea de la rastreabilidad en una línea. (Consulte bingbot.)
Adónde ir después
Este hub es el mapa; los análisis detallados hacen el trabajo. Para los controles de acceso, consulte robots.txt y noindex. Para el servidor, consulte error del servidor (5xx), frecuencia de rastreo y error de redirección. Para el inventario inflado, consulte trampas para arañas, parámetros de URL y presupuesto de rastreo. Para el descubrimiento y los enlaces, consulte descubrimiento, profundidad de rastreo y páginas huérfanas. Y para ver toda la cadena en un solo lugar, empiece por el hub de rastreo.
Resumen de IA
Una síntesis de la versión avanzada:
- Rastreabilidad = facilidad con la que los rastreadores descubren, acceden y obtienen sus páginas. Un problema de rastreabilidad es cualquier cosa que lo rompa. Es la primera etapa de la cadena (descubrir → rastrear → renderizar → indexar → servir; síntesis práctica de Patrick; el modelo de Google agrupa descubrimiento y renderizado dentro del rastreo), así que es previa a todo lo demás.
- Tres «no es igual»: rastreabilidad ≠ indexabilidad (una página rastreable puede tener
noindex); rastreo ≠ posicionamiento («no es una señal de posicionamiento», según Google); rastreo ≠ renderizado (JS se ejecuta en una etapa separada y retrasada). - Cuatro grupos: (1) acceso bloqueado —robots.txt, muros de inicio de sesión/401, 403 del WAF/CDN y JS/CSS bloqueado—; (2) enlaces rotos —navegación solo con JS sin
<a href>, huérfanos y páginas profundas—; (3) servidor fallando —5xx (reduce la velocidad y después retira páginas), fallos DNS (todo el sitio), obtenciones lentas o truncadas (límite aproximado de 2 MB) y cadenas de redirecciones (unos 5 saltos)—; (4) inventario inflado —trampas para arañas, duplicados con parámetros y Soft 404s (200 OK sin contenido)—. - La gran trampa: noindex + disallow significa que Google nunca ve el noindex. Para desindexar, permita el rastreo + noindex; nunca use robots.txt para retirar una página.
- El presupuesto de rastreo solo importa en sitios enormes y que cambian rápido (aproximadamente 1 millón o más de páginas por semana; 100k URL normalmente no bastan). Es por host y se comparte entre los rastreadores de Google.
- Diagnostique con GSC (Indexación de páginas, Estadísticas de rastreo e Inspección de URL) y registros del servidor (la fuente de verdad y la única forma de verificar bots reales). Corrija primero el acceso y después el inventario.
- Bing difiere: IndexNow (no Google), Crawl Control, Ignore URL Parameters y mayor peso de
lastmod.
Documentación oficial
Documentación de fuentes primarias sobre lo que rompe el rastreo.
- Guía detallada de cómo funciona la Búsqueda de Google: cadena rastrear → indexar → servir, descubrimiento de URL y mecanismo de limitación «más despacio».
- Hub de rastreo e indexación: robots, sitemaps, canonicalización y controles de rastreo.
- Introducción a robots.txt: qué hace robots.txt y, sobre todo, qué no hace.
- Haga que sus enlaces sean rastreables: requisito
<a href>y formatos que Google no puede seguir. - Optimice su presupuesto de rastreo: capacidad y demanda, categorías de desperdicio y quién debe preocuparse.
- Descripción general de los rastreadores y fetchers de Google: agentes de usuario, rangos IP y cómo se identifican los rastreadores de Google.
- Inside Googlebot (marzo de 2026): límites actuales de bytes (aproximadamente 2 MB por URL y 64 MB para PDF) y comportamiento de truncamiento.
- Ayuda del informe de Indexación de páginas: significado de cada código de estado de rastreo e indexación.
Bing / Microsoft
- Serie de bingbot: maximizar la eficiencia de rastreo: definición de Bing del rastreo y su objetivo de «eficiencia de rastreo».
- Bing Webmaster Tools — Crawl Control: programe las horas de rastreo de Bingbot (Google no tiene equivalente).
- IndexNow: protocolo de envío que Bing y otros usan para notificar cambios al instante (no Google).
Citas de las fuentes
Declaraciones registradas de Google y Bing. Cada enlace es un enlace profundo que salta al pasaje citado en la página de origen.
Google — robots.txt no es una herramienta de retirada
- “A robots.txt file tells search engine crawlers which URLs the crawler can access on your site.” (traducción) «Un archivo robots.txt indica a los rastreadores qué URL pueden acceder de su sitio». — Documentación de Google Search Central. Saltar a la cita
- “It is not a mechanism for keeping a web page out of Google.” (traducción) «No es un mecanismo para mantener una página web fuera de Google». Saltar a la cita
- “The instructions in robots.txt files cannot enforce crawler behavior; it’s up to the crawler to obey them.” (traducción) «Las instrucciones de los archivos robots.txt no pueden imponer el comportamiento del rastreador; depende del rastreador obedecerlas». Saltar a la cita
Google — enlaces rastreables
- “Google can only crawl your link if it’s an
<a>HTML element with anhrefattribute.” (traducción) «Google solo puede rastrear su enlace si es un elemento HTML<a>con un atributohref». — Haga que sus enlaces sean rastreables. Saltar a la cita - “Most links in other formats won’t be parsed and extracted by Google’s crawlers.” (traducción) «Los rastreadores de Google no analizarán ni extraerán la mayoría de los enlaces en otros formatos». Saltar a la cita
Google — salud del servidor y renderizado
- “They try not to crawl the site too fast to avoid overloading it. This mechanism is based on the responses of the site (for example, HTTP 500 errors mean ‘slow down’).” (traducción) «Intentan no rastrear el sitio demasiado rápido para evitar sobrecargarlo. Este mecanismo se basa en las respuestas del sitio (por ejemplo, los errores HTTP 500 significan “más despacio”)». Saltar a la cita
- “During the crawl, Google renders the page and runs any JavaScript it finds using a recent version of Chrome.” (traducción) «Durante el rastreo, Google renderiza la página y ejecuta el JavaScript que encuentra con una versión reciente de Chrome». Saltar a la cita
Google — presupuesto de rastreo y rastreo frente a posicionamiento (publicación de 2017 sobre presupuesto de rastreo; reproducida literalmente por Search Engine Land)
- “An increased crawl rate will not necessarily lead to better positions in Search results… while crawling is necessary for being in the results, it’s not a ranking signal.” (traducción) «Una mayor frecuencia de rastreo no necesariamente conduce a mejores posiciones; aunque el rastreo es necesario para aparecer en los resultados, no es una señal de posicionamiento». Leer la cobertura
- “If your site doesn’t have a large number of pages that change rapidly, or if your pages seem to be crawled the same day that they are published, you don’t need to read this guide.” (traducción) «Si su sitio no tiene muchas páginas que cambien rápidamente, o sus páginas parecen rastrearse el mismo día en que se publican, no necesita leer esta guía». — Guía de rastreo para sitios grandes. Saltar a la cita
Fabrice Canel, Microsoft Bing
- “Crawling is the process by which bingbot discovers new and updated documents or content to be added to Bing’s searchable index.” (traducción) «El rastreo es el proceso mediante el cual bingbot descubre documentos o contenido nuevos y actualizados para añadirlos al índice de búsqueda de Bing». Saltar a la cita
- “Less is more for SEO. Never forget that. Less URLs to crawl, better for SEO.” (traducción) «Menos es más para el SEO. No lo olvide. Menos URL que rastrear significa mejor SEO». — reproducido por Search Engine Land. Leer la cobertura
Lista de comprobación de triaje de rastreabilidad
Ejecútelas en este orden: primero los problemas de acceso, porque son los más catastróficos y los más comunes:
- robots.txt no prohíbe nada que quiera indexar (busque un
Disallow: /perdido del staging y compruebe que*.js/*.cssno estén bloqueados). - Ninguna página combina noindex + disallow (el noindex nunca puede verse; para desindexar, permita el rastreo y añada noindex).
- El contenido importante no está detrás de un muro de inicio de sesión / 401 ni devuelve 403 a Googlebot verificado (compruebe reglas de WAF/CDN/geográficas).
- La navegación usa enlaces
<a href>reales, no controladores de clic solo con JS. - No hay páginas huérfanas: cada página que le importe enlaza desde al menos otra página rastreable.
- El servidor devuelve respuestas rápidas y estables, con un mínimo de 5xx; las interrupciones planificadas usan 503 + Retry-After.
- El DNS resuelve de forma fiable (compruébelo en Estado del host de GSC y con supervisión externa).
- No hay cadenas de redirecciones de más de uno o dos saltos ni bucles.
- El contenido crítico está por debajo del límite de obtención de unos 2 MB (no por debajo del desperdicio de página).
- No hay trampas para arañas que generen URL infinitas (calendarios, facetas e ID de sesión).
- Los parámetros de URL no generan duplicados rastreables (orden coherente y canónicas para parámetros pasivos).
- No hay Soft 404: las páginas «no encontradas» devuelven
404/410reales, no200. - Revisé Estadísticas de rastreo de GSC para detectar picos de códigos de respuesta y del tiempo medio.
- Revisé los registros del servidor para encontrar desperdicio de rastreo y URL importantes que los bots nunca alcanzan.
Modelos mentales
1. Los cuatro grupos. Todo problema de rastreabilidad es de uno de estos tipos: acceso bloqueado, enlaces rotos, servidor fallando o inventario inflado. Categorícelo antes de corregirlo: el grupo indica qué herramienta debe usar.
2. La cadena: descubrir → rastrear → renderizar → indexar → servir. Localice en qué etapa falla la página antes de cambiar nada. ¿Se descubrió? ¿Se rastreó? ¿Se renderizó? ¿Se indexó? ¿Se sirvió? Una solución dirigida a la etapa equivocada no hace nada.
3. Los tres «no es igual».
- Rastrear ≠ indexar (una página bloqueada por robots puede indexarse a través de enlaces).
- Rastrear ≠ posicionar (la frecuencia de rastreo no es una señal de posicionamiento).
- Rastrear ≠ renderizar (JS se ejecuta en una etapa separada y retrasada).
4. Regla de decisión para desindexar.
¿Quiere que una página desaparezca de la búsqueda? Permita el rastreo + noindex. ¿Quiere que los bots omitan por completo un espacio de URL y no le importa la indexación? Disallow en robots.txt. Nunca use disallow para desindexar: el bot no puede ver su noindex a través del bloqueo.
5. Corrija la fuente y después bloquee. Para el inventario inflado, deje de generar primero las URL basura (la solución limpia) y solo después bloquee lo que quede en robots.txt. Bloquear por sí solo no recupera presupuesto a menos que ya esté en el techo de capacidad del servidor.
6. Triaje por gravedad.
Primero el sitio completo (fallo DNS, Disallow: / en robots.txt o robots.txt devolviendo 5xx) → después una sección completa (navegación solo con JS o directorio bloqueado) → después una página (una cadena de redirecciones o un huérfano). Detenga la hemorragia antes de ajustar detalles.
Problemas de rastreabilidad — guía rápida
Los cuatro grupos y sus síntomas característicos
| Grupo | Problemas comunes | Dónde aparece |
|---|---|---|
| Acceso bloqueado | Disallow en robots.txt, inicio de sesión 401, WAF 403, JS/CSS bloqueado | GSC: bloqueado por robots.txt; captura renderizada de Inspección de URL |
| Enlaces rotos | Navegación solo con JS, páginas huérfanas y páginas profundas | GSC: descubierta — actualmente no indexada; rastreador de auditoría |
| Servidor fallando | 5xx, fallo DNS, obtención lenta o truncada y cadenas de redirecciones | GSC: error del servidor (5xx), error de redirección; Estadísticas de rastreo |
| Inventario inflado | Trampas para arañas, duplicados con parámetros y Soft 404s | Registros del servidor (visitas desiguales); aumento de descubierta — no indexada |
Códigos de estado que importan a los bots
200— obtenido correctamente (pero una página «no encontrada» que devuelve 200 es un Soft 404).301/308— redirección permanente (mantenga cortas las cadenas; máximo aproximado de 5 saltos).403/401— acceso denegado/autenticación requerida (compruebe el WAF y verifique que no se esté bloqueando a Googlebot real).404/410— desaparecida; señal fuerte de no volver a rastrear (410 es algo más rápido).429/500/503— «más despacio»/inténtelo más tarde; 503 +Retry-Afteres correcto durante una interrupción planificada; si se mantiene, el rastreo cae.
Datos rápidos
- Límite de obtención: aproximadamente 2 MB por URL (PDF 64 MB); lo que supera el límite se trunca, no se rechaza.
- Saltos de redirección que sigue Google: aproximadamente 5 antes de abandonar el destino.
- El presupuesto de rastreo rara vez importa por debajo de unas 100k URL; es por nombre de host.
- Herramienta de parámetros de URL de GSC: retirada en abril de 2022. Control deslizante manual de frecuencia de rastreo: retirado en enero de 2024.
- IndexNow = Bing/Yandex/otros, no Google.
Herramientas para encontrar problemas de rastreabilidad
- Google Search Console — informe de Indexación de páginas: muestra los fallos con nombre: bloqueado por robots.txt, error del servidor (5xx), no encontrado (404), error de redirección y los estados descubierta/rastreada — actualmente no indexada.
- GSC — informe Estadísticas de rastreo: tendencias de códigos de respuesta, tiempo medio de respuesta y un panel de estado del host que señala problemas de DNS, robots.txt y conectividad. (Consulte crawl stats report.)
- GSC — Inspección de URL (prueba en directo): vea exactamente qué obtuvo y renderizó Googlebot para una URL; la captura renderizada es la comprobación más rápida de JS/CSS bloqueado.
- Análisis de archivos de registro del servidor: fuente de verdad: qué URL visitaron realmente los bots, con qué frecuencia y qué recibieron. Es la única forma de verificar Googlebot real (DNS inverso y directo) y detectar el patrón desigual de visitas de una trampa para arañas. Herramientas: Screaming Frog Log File Analyser o canalice los registros a BigQuery o una plataforma de logs. (Consulte log file analysis.)
- Rastreadores de auditoría del sitio: Ahrefs Site Audit y Screaming Frog SEO Spider simulan un rastreo y muestran cadenas de redirecciones, URL bloqueadas, huérfanos y profundidad.
- Ahrefs Webmaster Tools: rastreo y auditoría gratuitos para los sitios que verifique.
- Bing Webmaster Tools: información de rastreo, Crawl Control y Site Scan; además de la herramienta Ignore URL Parameters que Google retiró.
Póngase a prueba: problemas de rastreabilidad
Cinco preguntas rápidas sobre lo que rompe el rastreo y cómo arreglarlo. Elija una respuesta para cada una y después compruébelas.
¿Por qué el rastreador no puede alcanzar la página?
Triage a crawlability failure
Manual de incidente: una sección importante desaparece del rastreo
- Confirme el alcance. Pruebe URL representativas y compare el momento del primer fallo con publicaciones, cambios de cortafuegos e incidentes del servidor.
- Compruebe el camino de obtención. Resuelva DNS, TLS, redirecciones, códigos de estado, autenticación y completitud de la respuesta. Corrija los fallos antes de profundizar en el análisis de SEO.
- Compruebe el acceso del rastreador. Pruebe las URL exactas contra robots.txt y verifique que las reglas de WAF/CDN no bloqueen bots verificados.
- Compruebe el descubrimiento. Rastree desde la página de inicio y los hubs de sección. Si las URL son huérfanas o solo tienen clics JS, restaure enlaces de anclaje normales y su pertenencia al sitemap.
- Compruebe el renderizado y el inventario. Confirme que cargan los recursos necesarios e identifique trampas o rutas duplicadas que consuman solicitudes.
- Valide la recuperación. Vuelva a obtener URL representativas y observe los registros de rastreadores verificados; si el acceso funciona pero la indexación no se recupera, pase a un diagnóstico de indexabilidad.
La URL devuelve 200 en un navegador, pero los rastreadores reciben 403
Causas probables, en el orden en que las compruebo: disallow en robots.txt para ese agente de usuario, después un bloqueo intermitente o en caché (vuelva a probar más de una vez), luego una regla de WAF/CDN específica del agente y, por último, un bloqueo por rango de IP o geográfico. Solución: confirme qué capa es realmente responsable antes de tocar nada, verifique la IP del rastreador mediante DNS inverso y directo, inspeccione los registros del edge y estreche la regla de bloqueo. Confirmación: el rastreador verificado y un usuario normal reciben la respuesta prevista.
La página existe, pero los rastreadores nunca la solicitan
Causas probables: orfandad, controles solo con JS, paginación rota o falta de descubrimiento desde el sitemap. Solución: añada enlaces <a href> rastreables desde páginas relevantes e incluya la URL canónica en el sitemap correcto. Confirmación: un rastreo del sitio la alcanza y los registros posteriores muestran una obtención de un rastreador verificado.
Las herramientas de rastreo informan de recursos bloqueados
Causas probables: reglas de robots.txt que cubren recursos CSS, JavaScript o API necesarios para el renderizado. Solución: permita los recursos necesarios sin exponer endpoints privados. Confirmación: la salida renderizada contiene el mismo contenido principal y los mismos enlaces disponibles para los usuarios.
El volumen de rastreo aumenta en URL basura
Causas probables: parámetros facetados, calendarios, búsquedas internas, identificadores de sesión o navegación infinita. Solución: elimine las rutas que generan URL rastreables y consolide o bloquee solo después de comprender los efectos sobre la indexación y el renderizado. Confirmación: en ventanas de registros equivalentes, el patrón disminuye mientras las URL valiosas siguen siendo descubribles.
Prompt: convertir evidencia de rastreo en una tabla de triaje
Analyze the crawlability evidence below. For each URL, classify the failure as access, discovery/linking, server/redirect, rendering/resource, or URL-inventory. Cite only the supplied evidence, list missing checks, and return symptom → likely cause → safest fix → pass/fail verification. Keep crawlability separate from indexability.
[PASTE STATUS, HEADERS, ROBOTS TEST, CRAWL PATH, RENDERED HTML, AND LOG OBSERVATIONS]Prompt: revisar un cambio de robots.txt de forma segura
Review this proposed robots.txt change against the supplied sample URLs and user agents. Build an allow/block matrix, identify the winning rule, flag required resources or valuable pages that would become blocked, and propose the smallest safe change. Do not claim the file removes URLs from the index.
[PASTE CURRENT FILE, PROPOSED FILE, USER AGENTS, AND URL SAMPLES] Comprobar las respuestas de rastreo de una lista de URL
while IFS= read -r url; do curl -L -sS -o /dev/null -w '%{http_code}\t%{url_effective}\t%{time_total}\n' "$url"; done < urls.txtEquivalente en PowerShell:
Get-Content .\urls.txt | ForEach-Object { try { $r = Invoke-WebRequest -Uri $_ -MaximumRedirection 10; "{0}`t{1}" -f $r.StatusCode,$r.BaseResponse.ResponseUri } catch { "ERROR`t$_" } }Encontrar controles de enlaces no rastreables en HTML renderizado
Ejecute esto en la consola de DevTools del navegador. Enumera elementos con comportamiento de clic que no son enlaces normales:
[...document.querySelectorAll('[onclick], [role="link"]')].filter(el => !el.matches('a[href]')).map(el => ({text: el.textContent.trim(), html: el.outerHTML.slice(0, 300)}));El resultado es una cola de revisión, no una prueba de que cada elemento deba convertirse en un enlace.
Recursos que merecen su tiempo
Mis artículos relacionados
- Indexada aunque bloqueada por robots.txt: por qué una página bloqueada aún puede indexarse y la trampa noindex frente a disallow.
- La historia de bloquear 2 páginas con gran posicionamiento mediante Robots.txt: mi experimento de primera mano sobre lo que ocurre al bloquear páginas posicionadas.
- ¿Cuándo debería preocuparse por el presupuesto de rastreo?: quién debe preocuparse y qué desperdicia el presupuesto.
- Problemas y buenas prácticas de SEO para JavaScript: el lado del renderizado, cuando los enlaces y el contenido dependientes de JS rompen el descubrimiento.
- Conozca los nuevos rastreadores web: quién le rastrea realmente, según datos de Cloudflare Radar.
Mis charlas
- How Search Works (SlideShare): mi explicación del rastreo, el renderizado, la indexación y el posicionamiento. (Aviso habitual: “This is my understanding of systems… not going to be 100% complete or accurate.” (traducción) «Esta es mi comprensión de los sistemas; no será 100 % completa ni exacta».)
De la industria
- Serie Crawling December de Google: el conjunto más concentrado de explicaciones oficiales sobre rastreo (Googlebot, caché HTTP, navegación por facetas y CDN).
- Google explica el presupuesto de rastreo para webmasters (Search Engine Land): reproducción literal de la publicación de Gary Illyes de 2017, incluida la frase “not a ranking signal” (traducción) «no es una señal de posicionamiento».
- Google: 100.000 URL normalmente no afectan al presupuesto de rastreo (Search Engine Roundtable): la cita de John Mueller que fija la escala.
- Las cinco puertas de infraestructura tras rastreo, renderizado e indexación (Search Engine Land): marco de Fabrice Canel de «menos es más para el SEO» sobre la eficiencia de rastreo.
- Google explica los límites de bytes de Googlebot y la arquitectura de rastreo (Search Engine Journal): cobertura de la actualización de marzo de 2026; 2 MB por URL, PDF de 64 MB y truncamiento.
- Límite de tamaño de archivo de Googlebot (DebugBear): qué ocurre al superar el límite de obtención (truncamiento, no rechazo).
Registro de cambios
Actualizado el 8 ago 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.
Actualizado el 17 jul 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.