Trampas para rastreadores

Qué son las trampas para rastreadores, cómo las crean filtros, calendarios, parámetros y bucles, cómo detectarlas en registros y cómo corregirlas sin perjudicar la indexación.

Publicado por primera vez: 22 jun 2026 · Última actualización: 13 ago 2026 · Avanzado
Idiomas
1 señal de evidencia en esta página

Una trampa para rastreadores es cualquier parte de un sitio que genera una cantidad prácticamente infinita de URL mediante filtros por facetas, calendarios sin fin, identificadores de sesión, parámetros de ordenamiento o seguimiento, paginación infinita, bucles de redirección o proliferación de rutas relativas. Los rastreadores consumen el presupuesto en páginas irrelevantes casi duplicadas en vez de llegar al contenido real. Google denominó al problema «espacios infinitos» en 2008; en febrero de 2026, Gary Illyes indicó que la navegación por facetas y los parámetros de acción explicaban cerca del 75 % de los problemas de rastreo observados por Google. Afecta sobre todo a sitios grandes, nuevos y de comercio electrónico. Debe detectarse primero en los registros, buscando un patrón que consuma una proporción desmedida frente a la línea base propia, y corregirse en el origen: dejar de generar las URL o aplicar robots.txt, noindex y 404 en el orden adecuado. Canonical y nofollow ayudan, pero no detienen el rastreo; si se bloquea demasiado pronto, noindex no llega a verse.

TL;DR — Una trampa para rastreadores es cualquier estructura que genera una cantidad prácticamente infinita de URL —navegación por facetas, calendarios, identificadores de sesión, parámetros de ordenamiento o seguimiento, paginación infinita, bucles de redirección o proliferación de rutas relativas— y hace que los rastreadores desperdicien capacidad en páginas irrelevantes casi duplicadas. Google lleva años describiendo estos patrones como “infinite spaces” (traducción) «espacios infinitos». El impacto suele ser mayor en sitios grandes, nuevos o de comercio electrónico, aunque un sitio pequeño también puede crear una trampa. Debe buscarse primero en los registros y corregirse en el origen. robots.txt detiene el rastreo, pero no la indexación; noindex necesita acceso de rastreo para que se lea; y canonical es una señal lenta. Por eso importa el orden de las correcciones.

Evidence for this claim Faceted navigation can generate effectively unbounded URL spaces that consume crawling resources; Google recommends controlling crawlable combinations. Scope: Current Google faceted-navigation crawl guidance. Confidence: high · Verified: Google Search Central: Managing faceted navigation Evidence for this claim Large duplicate or low-value URL inventories can waste crawl activity, while most smaller sites do not need specialized crawl-budget management. Scope: Current Google crawl-budget guidance. Confidence: high · Verified: Google Search Central: Crawl budget management

Qué es realmente una trampa para rastreadores

Una spider trap, sinónimo de crawler trap, es una parte del sitio que genera una cantidad de URL prácticamente infinita o imposible de gestionar. El rastreador sigue solicitando páginas de poco valor, casi duplicadas o vacías y consume su presupuesto antes de llegar al contenido real. Google denomina al fenómeno “infinite spaces” o “infinite URL spaces” (traducción) «espacios infinitos» o «espacios infinitos de URL».

La palabra clave es prácticamente. Una trampa no tiene que ser infinita en sentido literal; basta con que lo sea de facto. Unos pocos filtros que pueden combinarse en cualquier orden producen una cantidad astronómica de URL para el mismo grupo reducido de productos. El problema no es una URL aislada, sino la explosión combinatoria.

Los rastreadores tampoco pueden evitarla de antemano. La documentación de Google sobre navegación por facetas explica: “Because the URLs created for the faceted navigation seem to be novel and crawlers can’t determine whether the URLs are going to be useful without crawling first, the crawlers will typically access a very large number of faceted navigation URLs.” (traducción) «Como las URL creadas para la navegación por facetas parecen nuevas y los rastreadores no pueden saber si serán útiles sin rastrearlas primero, normalmente accederán a una cantidad muy grande de URL de navegación por facetas». Gary Illyes expresó la misma idea con mayor sencillez: no es posible juzgar si un espacio de URL es bueno hasta haber rastreado una parte grande de él. La trampa funciona precisamente porque el bot debe entrar para descubrirla.

Por qué perjudican al SEO

El daño es un costo de oportunidad. Google lo expresa así: “If crawling is spent on useless URLs, the crawlers have less time to spend on new, useful URLs.” (traducción) «Si el rastreo se dedica a URL inútiles, los rastreadores tienen menos tiempo para las URL nuevas y útiles». La Web, según Google, es “a nearly infinite space, exceeding Google’s ability to explore and index every available URL” (traducción) «un espacio casi infinito que supera la capacidad de Google para explorar e indexar todas las URL disponibles». Una capacidad finita consumida por páginas irrelevantes deja contenido sin descubrir.

Es un problema de presupuesto de rastreo: una cuestión de eficiencia, no una señal de posicionamiento. Más rastreo no mejora por sí mismo las posiciones. Como se explica en la guía sobre presupuesto de rastreo, “More crawling doesn’t mean you’ll rank better, but if your pages aren’t crawled and indexed they aren’t going to rank at all.” (traducción) «Más rastreo no significa que se vaya a posicionar mejor, pero si las páginas no se rastrean ni se indexan, no se posicionarán». Una trampa grave en un sitio grande puede dejar páginas importantes en “Discovered – currently not indexed” (traducción) «Descubierta: actualmente sin indexar» porque el presupuesto se gastó en contenido irrelevante.

¿En qué casos merece atención? La guía de Google sobre presupuesto de rastreo se dirige a sitios grandes —más de un millón de páginas únicas que cambian al menos cada semana—, a sitios medianos o grandes —más de 10 000 páginas únicas— que cambian a diario, y a cualquier sitio con una proporción elevada de URL en “Discovered – currently not indexed”. Por extensión, también incluye comercios electrónicos con catálogos por facetas, que alcanzan esas cifras con rapidez. Google presenta estas cifras como estimaciones, no como umbrales exactos. La mayoría de los sitios pequeños se rastrea por completo. Una trampa es precisamente uno de los casos en que el presupuesto importa, y Google define el concepto mediante la capacidad de rastreo —lo que admite el servidor— y la demanda de rastreo —lo que Google desea rastrear—, no como una cuota fija para todos los sitios.

No es un problema nuevo ni poco común

Google utilizó el nombre “infinite spaces” en 2008, en la publicación To infinity and beyond? No!, donde señaló los calendarios sin fin y los filtros acumulados de resultados como causas, y mencionó robots.txt y nofollow como soluciones. La publicación es antigua y se representa con JavaScript; por eso aquí se parafrasea en lugar de citarla literalmente.

El problema no desapareció: creció. Google dedicó la serie Crawling December a la navegación por facetas en diciembre de 2024. Más recientemente, en un episodio de Search Off the Record que resumía el informe de rastreo de cierre de 2025, Gary Illyes desglosó las principales fuentes de desperdicio: la navegación por facetas y los parámetros de acción representan en conjunto cerca del 75 % de los problemas de rastreo que observa Google; un 50 % corresponde a las facetas y un 25 % a parámetros que ejecutan una acción en vez de cambiar el contenido. El resto incluye cerca de un 10 % de parámetros «irrelevantes», como identificadores de sesión y etiquetas UTM; un 5 % de complementos y widgets que generan URL problemáticas; y un 2 % de casos especiales, como URL con doble codificación. Dieciocho años después, la navegación por facetas sigue siendo, con diferencia, la mayor fuente del problema.

Tipos de trampas para rastreadores

Este catálogo resume la señal principal de cada tipo. La pestaña Cheat Sheets contiene la corrección breve correspondiente.

  • Navegación por facetas o combinaciones de filtros: es la trampa principal. Se eligen algunos filtros y el rastreador prueba todas las permutaciones. Google: “This often means a very large number of possible combinations of filters, which translates to a very large number of possible URLs.” (traducción) «Esto suele implicar una cantidad muy grande de combinaciones posibles de filtros, que se convierte en una cantidad muy grande de URL posibles».
  • Calendarios infinitos: los enlaces «mes siguiente» o «año siguiente» no tienen límite. Un bot puede avanzar indefinidamente; el ejemplo memorable de Illyes fue un widget de calendario que generaba una URL válida para el año 3000.
  • Identificadores de sesión en URL: ?sid=, jsessionid y variantes crean una URL única por visitante para el mismo contenido.
  • Parámetros de ordenamiento: ?sort=price, ?order=desc. Google señala que las “differently sorted versions of the same page” (traducción) «versiones de la misma página ordenadas de manera diferente» no deberían rastrearse.
  • Desplazamiento infinito o paginación en bucle: «cargar más» o «siguiente» nunca termina o duplica contenido enlazado. Google señala las “infinite scrolling pages that duplicate information on linked pages” (traducción) «páginas con desplazamiento infinito que duplican información de las páginas enlazadas».
  • Bucles de redirección o cadenas largas: A → B → A sin fin, a menudo por una regla de reescritura mal escrita.
  • Proliferación de rutas o URL relativas: enlaces relativos defectuosos añaden directorios sin parar (/abc/def/abc/def/abc/def/…) hasta que el servidor falla.
  • Páginas de resultados de búsqueda interna: las URL de búsqueda se tratan como contenido rastreable; una búsqueda de una sola letra puede generar un millón de páginas.
  • URL dinámicas o «mágicas»: aceptan texto o identificadores arbitrarios y aun así devuelven 200.
  • Parámetros de seguimiento o de acción: las etiquetas UTM y las acciones de añadir al carrito o comparar crean variantes de URL infinitas de facto; constituyen la parte de «parámetros de acción» del 75 % citado por Google.

Cómo detectar una trampa para rastreadores

  • Primero, los registros del servidor: es la señal más rápida. Muestran las URL que solicitan los bots y su frecuencia. No existe un umbral universal de «demasiado». La señal es una proporción sesgada y desmedida de solicitudes concentrada en un solo patrón irrelevante frente a la línea base normal del propio sitio. Joost de Valk, fundador de Yoast, ha escrito que, según su experiencia, no es inusual que una trampa consuma entre el 20 % y el 30 % o más del rastreo. Sirve para dimensionar el posible sesgo, no como referencia universal. Véase análisis de archivos de registro.
  • Ejecutar un rastreo: con Screaming Frog, Ahrefs Site Audit o Sitebulb. Deben buscarse rastreos que no terminan, URL cada vez más largas o una cantidad creciente de combinaciones de parámetros.
  • Google Search Console: pueden aparecer muchas URL en “Discovered – currently not indexed” (traducción) «Descubierta: actualmente sin indexar», un informe de Soft 404 en crecimiento por páginas vacías autogeneradas, estadísticas de rastreo sesgadas hacia rutas irrelevantes o el mensaje “Googlebot encountered an extremely high number of URLs” (traducción) «Googlebot encontró una cantidad extremadamente alta de URL».
  • Comprobación básica del sitio y del índice: si solo una fracción mínima de las URL indexadas genera tráfico, es probable que exista una trampa.
  • Operadores de búsqueda: site: junto con inurl: para una cadena de parámetros conocida.
  • Bing: Site Scan y Crawl Control en Bing Webmaster Tools.

Cómo corregir y prevenir las trampas para rastreadores

Las correcciones aparecen aproximadamente de la mejor opción al último recurso. El orden importa porque estos controles cumplen funciones distintas.

  1. La mejor solución es no generar las URL. Debe detenerse su creación en el origen. La opción más limpia es usar filtros con JavaScript o fragmentos, para que actualicen la página sin crear una dirección rastreable nueva. Tanto la documentación de Google sobre facetas como SEJ recomiendan convertir los parámetros de faceta en fragmentos de URL. Las demás medidas son parches en comparación.
  2. Elegir qué facetas merecen indexación y bloquear las demás. Google: “Oftentimes there’s no good reason to allow crawling of filtered items, as it consumes server resources for no or negligible benefit.” (traducción) «A menudo no hay una buena razón para permitir el rastreo de elementos filtrados, ya que consume recursos del servidor con un beneficio nulo o insignificante». Puede permitirse un listado sin filtros y las páginas individuales, y bloquearse el espacio combinatorio filtrado.
  3. Bloquear en robots.txt los patrones de la trampa cuando no deban indexarse. Es la recomendación principal de Google para URL filtradas u ordenadas de poco valor. Advertencia: robots.txt bloquea el rastreo, no la indexación.
  4. Usar noindex para retirar páginas irrelevantes ya indexadas. Si ya están en el índice, no deben bloquearse primero en robots.txt: Google necesita rastrearlas para leer noindex. El orden correcto es mantenerlas rastreables, dejar que noindex las retire y, después, bloquearlas opcionalmente en robots.txt para detener rastreos futuros. Si se bloquean antes, noindex no llega a verse.
  5. Devolver 404 o 410 para combinaciones de filtros vacías. Google: “Return an HTTP 404 status code when a filter combination doesn’t return results.” (traducción) «Devuelva un código de estado HTTP 404 cuando una combinación de filtros no produzca resultados». También indica: “Eliminate soft 404 errors. Soft 404 pages will continue to be crawled, and waste your budget.” (traducción) «Deben eliminarse los 404 indirectos, porque esas páginas continuarán recibiendo rastreos y consumirán el presupuesto».
  6. Usar rel="canonical" para consolidar las URL ordenadas o variantes en la versión limpia. Es útil, pero lento y constituye una señal, no una directiva. Google dice que “may, over time, decrease the crawl volume of non-canonical versions of those URLs.” (traducción) «puede reducir con el tiempo el volumen de rastreo de las versiones no canónicas de esas URL». No detiene el rastreo, y Bing advierte: “relying on canonical tag is not necessarily the perfect solution to fix all your duplicate content problems.” (traducción) «depender de la etiqueta canonical no es necesariamente la solución perfecta para corregir todos los problemas de contenido duplicado».
  7. Añadir rel="nofollow" a los enlaces de filtros. Solo funciona si se aplica a todos los enlaces, internos y externos. Google: “Every anchor pointing to a specific URL must have the rel=“nofollow” attribute in order for it to be effective.” (traducción) «Para que sea eficaz, todo enlace que apunte a una URL específica debe tener el atributo rel=“nofollow”».
  8. Aplicar la solución propia de cada trampa: limitar los enlaces de calendario a un horizonte razonable y marcar con noindex las fechas lejanas; retirar los identificadores de sesión de las URL y usar cookies; corregir los bucles de redirección para que el origen apunte directamente al destino final; usar URL absolutas y reglas del servidor contra la proliferación de rutas relativas; y aplicar noindex o bloqueo a las páginas de búsqueda interna.

Los parámetros limpios y un orden estable también evitan variantes innecesarias. Google retiró la herramienta URL Parameters en 2022, por lo que robots.txt, canonical y noindex cumplen ahora esa función en Google. En Bing, el equivalente es URL Normalization, que permite indicar los parámetros que deben ignorarse.

Un matiz: no debe romperse la paginación legítima

La corrección excesiva también crea problemas. Ante una paginación «infinita», a veces se bloquean o canonicalizan todas las páginas paginadas. En la guía sobre paginación se explica: “Blocking the pages from crawling will again make it more difficult to find content on the website, end up orphaning pages,” (traducción) «Bloquear el rastreo de las páginas vuelve más difícil encontrar el contenido del sitio y acaba dejando páginas huérfanas». Canonicalizar todas las páginas hacia la primera “makes it harder for search engines to find and index valuable content, and also cuts off the flow of PageRank.” (traducción) «dificulta que los buscadores encuentren e indexen contenido valioso y, además, corta el flujo de PageRank». Debe distinguirse una trampa de paginación genuinamente infinita o en bucle de una paginación finita legítima; esta última debe seguir siendo rastreable.

Contexto dentro del rastreo

Las trampas son un problema de eficiencia de rastreo, relacionado con el presupuesto de rastreo —lo que consumen— y el análisis de archivos de registro —cómo se detectan—. Es el modo de fallo que hace necesario gestionar el presupuesto en los sitios donde realmente importa.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.