Trampas para rastreadores
Qué son las trampas para rastreadores, cómo las crean filtros, calendarios, parámetros y bucles, cómo detectarlas en registros y cómo corregirlas sin perjudicar la indexación.
Idiomas
1 señal de evidencia en esta página
- Herramienta activa relacionadaLog File Analyzer
Una trampa para rastreadores es cualquier parte de un sitio que genera una cantidad prácticamente infinita de URL mediante filtros por facetas, calendarios sin fin, identificadores de sesión, parámetros de ordenamiento o seguimiento, paginación infinita, bucles de redirección o proliferación de rutas relativas. Los rastreadores consumen el presupuesto en páginas irrelevantes casi duplicadas en vez de llegar al contenido real. Google denominó al problema «espacios infinitos» en 2008; en febrero de 2026, Gary Illyes indicó que la navegación por facetas y los parámetros de acción explicaban cerca del 75 % de los problemas de rastreo observados por Google. Afecta sobre todo a sitios grandes, nuevos y de comercio electrónico. Debe detectarse primero en los registros, buscando un patrón que consuma una proporción desmedida frente a la línea base propia, y corregirse en el origen: dejar de generar las URL o aplicar robots.txt, noindex y 404 en el orden adecuado. Canonical y nofollow ayudan, pero no detienen el rastreo; si se bloquea demasiado pronto, noindex no llega a verse.
Evidence for this claim Faceted navigation can generate effectively unbounded URL spaces that consume crawling resources; Google recommends controlling crawlable combinations. Scope: Current Google faceted-navigation crawl guidance. Confidence: high · Verified: Google Search Central: Managing faceted navigation Evidence for this claim Large duplicate or low-value URL inventories can waste crawl activity, while most smaller sites do not need specialized crawl-budget management. Scope: Current Google crawl-budget guidance. Confidence: high · Verified: Google Search Central: Crawl budget managementTL;DR — Una trampa para rastreadores es una parte del sitio que crea accidentalmente una cantidad casi infinita de URL, como combinaciones de filtros, calendarios sin límite o identificadores de sesión. Los bots consumen capacidad en esas páginas en lugar de rastrear el contenido importante. En sitios grandes, esto puede reducir la frecuencia con que se rastrean las páginas valiosas.
Qué es una trampa para rastreadores
Cuando un buscador visita un sitio, sigue enlaces y descarga páginas: eso es el rastreo. Una trampa ofrece una cantidad prácticamente infinita de enlaces, en su mayoría hacia páginas casi idénticas o vacías. El bot continúa solicitándolas sin encontrar contenido nuevo.
«Spider trap» y «crawler trap» designan el mismo problema. Google denomina este fenómeno “infinite spaces” (traducción) «espacios infinitos».
Causas habituales
Entre los patrones clásicos están:
- Filtros: cada combinación de color, talla, marca, precio u orden crea otra URL.
- Calendarios: un enlace «mes siguiente» sin límite permite avanzar indefinidamente.
- Identificadores de sesión: la misma página aparece bajo miles de direcciones.
- Bucles de redirección: una página envía a otra que vuelve al origen.
Por qué importa y cuándo no
Los bots disponen de capacidad limitada para cada sitio. El tiempo dedicado a URL de poco valor no se usa en contenido importante. En sitios pequeños rara vez es decisivo; en sitios grandes, nuevos o de comercio electrónico puede retrasar o impedir el rastreo de páginas relevantes.
Detección y corrección
La señal más clara está en los registros del servidor: un patrón extraño de URL consume una parte desproporcionada del rastreo frente a la línea base normal. La mejor solución es dejar de generar esas URL. Cuando no sea posible, deben bloquearse los patrones de poco valor para que los bots los omitan.
La pestaña Advanced contiene el catálogo por tipo, el flujo de detección y el orden correcto de las correcciones.
Evidence for this claim Faceted navigation can generate effectively unbounded URL spaces that consume crawling resources; Google recommends controlling crawlable combinations. Scope: Current Google faceted-navigation crawl guidance. Confidence: high · Verified: Google Search Central: Managing faceted navigation Evidence for this claim Large duplicate or low-value URL inventories can waste crawl activity, while most smaller sites do not need specialized crawl-budget management. Scope: Current Google crawl-budget guidance. Confidence: high · Verified: Google Search Central: Crawl budget managementTL;DR — Una trampa para rastreadores es cualquier estructura que genera una cantidad prácticamente infinita de URL —navegación por facetas, calendarios, identificadores de sesión, parámetros de ordenamiento o seguimiento, paginación infinita, bucles de redirección o proliferación de rutas relativas— y hace que los rastreadores desperdicien capacidad en páginas irrelevantes casi duplicadas. Google lleva años describiendo estos patrones como “infinite spaces” (traducción) «espacios infinitos». El impacto suele ser mayor en sitios grandes, nuevos o de comercio electrónico, aunque un sitio pequeño también puede crear una trampa. Debe buscarse primero en los registros y corregirse en el origen. robots.txt detiene el rastreo, pero no la indexación; noindex necesita acceso de rastreo para que se lea; y canonical es una señal lenta. Por eso importa el orden de las correcciones.
Qué es realmente una trampa para rastreadores
Una spider trap, sinónimo de crawler trap, es una parte del sitio que genera una cantidad de URL prácticamente infinita o imposible de gestionar. El rastreador sigue solicitando páginas de poco valor, casi duplicadas o vacías y consume su presupuesto antes de llegar al contenido real. Google denomina al fenómeno “infinite spaces” o “infinite URL spaces” (traducción) «espacios infinitos» o «espacios infinitos de URL».
La palabra clave es prácticamente. Una trampa no tiene que ser infinita en sentido literal; basta con que lo sea de facto. Unos pocos filtros que pueden combinarse en cualquier orden producen una cantidad astronómica de URL para el mismo grupo reducido de productos. El problema no es una URL aislada, sino la explosión combinatoria.
Los rastreadores tampoco pueden evitarla de antemano. La documentación de Google sobre navegación por facetas explica: “Because the URLs created for the faceted navigation seem to be novel and crawlers can’t determine whether the URLs are going to be useful without crawling first, the crawlers will typically access a very large number of faceted navigation URLs.” (traducción) «Como las URL creadas para la navegación por facetas parecen nuevas y los rastreadores no pueden saber si serán útiles sin rastrearlas primero, normalmente accederán a una cantidad muy grande de URL de navegación por facetas». Gary Illyes expresó la misma idea con mayor sencillez: no es posible juzgar si un espacio de URL es bueno hasta haber rastreado una parte grande de él. La trampa funciona precisamente porque el bot debe entrar para descubrirla.
Por qué perjudican al SEO
El daño es un costo de oportunidad. Google lo expresa así: “If crawling is spent on useless URLs, the crawlers have less time to spend on new, useful URLs.” (traducción) «Si el rastreo se dedica a URL inútiles, los rastreadores tienen menos tiempo para las URL nuevas y útiles». La Web, según Google, es “a nearly infinite space, exceeding Google’s ability to explore and index every available URL” (traducción) «un espacio casi infinito que supera la capacidad de Google para explorar e indexar todas las URL disponibles». Una capacidad finita consumida por páginas irrelevantes deja contenido sin descubrir.
Es un problema de presupuesto de rastreo: una cuestión de eficiencia, no una señal de posicionamiento. Más rastreo no mejora por sí mismo las posiciones. Como se explica en la guía sobre presupuesto de rastreo, “More crawling doesn’t mean you’ll rank better, but if your pages aren’t crawled and indexed they aren’t going to rank at all.” (traducción) «Más rastreo no significa que se vaya a posicionar mejor, pero si las páginas no se rastrean ni se indexan, no se posicionarán». Una trampa grave en un sitio grande puede dejar páginas importantes en “Discovered – currently not indexed” (traducción) «Descubierta: actualmente sin indexar» porque el presupuesto se gastó en contenido irrelevante.
¿En qué casos merece atención? La guía de Google sobre presupuesto de rastreo se dirige a sitios grandes —más de un millón de páginas únicas que cambian al menos cada semana—, a sitios medianos o grandes —más de 10 000 páginas únicas— que cambian a diario, y a cualquier sitio con una proporción elevada de URL en “Discovered – currently not indexed”. Por extensión, también incluye comercios electrónicos con catálogos por facetas, que alcanzan esas cifras con rapidez. Google presenta estas cifras como estimaciones, no como umbrales exactos. La mayoría de los sitios pequeños se rastrea por completo. Una trampa es precisamente uno de los casos en que el presupuesto sí importa, y Google define el concepto mediante la capacidad de rastreo —lo que admite el servidor— y la demanda de rastreo —lo que Google desea rastrear—, no como una cuota fija para todos los sitios.
No es un problema nuevo ni poco común
Google utilizó el nombre “infinite spaces” en 2008, en la publicación To infinity
and beyond? No!, donde señaló los calendarios sin fin y los filtros acumulados de
resultados como causas, y mencionó robots.txt y nofollow como soluciones. La
publicación es antigua y se representa con JavaScript; por eso aquí se parafrasea en
lugar de citarla literalmente.
El problema no desapareció: creció. Google dedicó la serie Crawling December a la navegación por facetas en diciembre de 2024. Más recientemente, en un episodio de Search Off the Record que resumía el informe de rastreo de cierre de 2025, Gary Illyes desglosó las principales fuentes de desperdicio: la navegación por facetas y los parámetros de acción representan en conjunto cerca del 75 % de los problemas de rastreo que observa Google; un 50 % corresponde a las facetas y un 25 % a parámetros que ejecutan una acción en vez de cambiar el contenido. El resto incluye cerca de un 10 % de parámetros «irrelevantes», como identificadores de sesión y etiquetas UTM; un 5 % de complementos y widgets que generan URL problemáticas; y un 2 % de casos especiales, como URL con doble codificación. Dieciocho años después, la navegación por facetas sigue siendo, con diferencia, la mayor fuente del problema.
Tipos de trampas para rastreadores
Este catálogo resume la señal principal de cada tipo. La pestaña Cheat Sheets contiene la corrección breve correspondiente.
- Navegación por facetas o combinaciones de filtros: es la trampa principal. Se eligen algunos filtros y el rastreador prueba todas las permutaciones. Google: “This often means a very large number of possible combinations of filters, which translates to a very large number of possible URLs.” (traducción) «Esto suele implicar una cantidad muy grande de combinaciones posibles de filtros, que se convierte en una cantidad muy grande de URL posibles».
- Calendarios infinitos: los enlaces «mes siguiente» o «año siguiente» no tienen límite. Un bot puede avanzar indefinidamente; el ejemplo memorable de Illyes fue un widget de calendario que generaba una URL válida para el año 3000.
- Identificadores de sesión en URL:
?sid=,jsessionidy variantes crean una URL única por visitante para el mismo contenido. - Parámetros de ordenamiento:
?sort=price,?order=desc. Google señala que las “differently sorted versions of the same page” (traducción) «versiones de la misma página ordenadas de manera diferente» no deberían rastrearse. - Desplazamiento infinito o paginación en bucle: «cargar más» o «siguiente» nunca termina o duplica contenido enlazado. Google señala las “infinite scrolling pages that duplicate information on linked pages” (traducción) «páginas con desplazamiento infinito que duplican información de las páginas enlazadas».
- Bucles de redirección o cadenas largas: A → B → A sin fin, a menudo por una regla de reescritura mal escrita.
- Proliferación de rutas o URL relativas: enlaces relativos defectuosos añaden
directorios sin parar (
/abc/def/abc/def/abc/def/…) hasta que el servidor falla. - Páginas de resultados de búsqueda interna: las URL de búsqueda se tratan como contenido rastreable; una búsqueda de una sola letra puede generar un millón de páginas.
- URL dinámicas o «mágicas»: aceptan texto o identificadores arbitrarios y aun así
devuelven
200. - Parámetros de seguimiento o de acción: las etiquetas UTM y las acciones de añadir al carrito o comparar crean variantes de URL infinitas de facto; constituyen la parte de «parámetros de acción» del 75 % citado por Google.
Cómo detectar una trampa para rastreadores
- Primero, los registros del servidor: es la señal más rápida. Muestran las URL que solicitan los bots y su frecuencia. No existe un umbral universal de «demasiado». La señal es una proporción sesgada y desmedida de solicitudes concentrada en un solo patrón irrelevante frente a la línea base normal del propio sitio. Joost de Valk, fundador de Yoast, ha escrito que, según su experiencia, no es inusual que una trampa consuma entre el 20 % y el 30 % o más del rastreo. Sirve para dimensionar el posible sesgo, no como referencia universal. Véase análisis de archivos de registro.
- Ejecutar un rastreo: con Screaming Frog, Ahrefs Site Audit o Sitebulb. Deben buscarse rastreos que no terminan, URL cada vez más largas o una cantidad creciente de combinaciones de parámetros.
- Google Search Console: pueden aparecer muchas URL en “Discovered – currently not indexed” (traducción) «Descubierta: actualmente sin indexar», un informe de Soft 404 en crecimiento por páginas vacías autogeneradas, estadísticas de rastreo sesgadas hacia rutas irrelevantes o el mensaje “Googlebot encountered an extremely high number of URLs” (traducción) «Googlebot encontró una cantidad extremadamente alta de URL».
- Comprobación básica del sitio y del índice: si solo una fracción mínima de las URL indexadas genera tráfico, es probable que exista una trampa.
- Operadores de búsqueda:
site:junto coninurl:para una cadena de parámetros conocida. - Bing: Site Scan y Crawl Control en Bing Webmaster Tools.
Cómo corregir y prevenir las trampas para rastreadores
Las correcciones aparecen aproximadamente de la mejor opción al último recurso. El orden importa porque estos controles cumplen funciones distintas.
- La mejor solución es no generar las URL. Debe detenerse su creación en el origen. La opción más limpia es usar filtros con JavaScript o fragmentos, para que actualicen la página sin crear una dirección rastreable nueva. Tanto la documentación de Google sobre facetas como SEJ recomiendan convertir los parámetros de faceta en fragmentos de URL. Las demás medidas son parches en comparación.
- Elegir qué facetas merecen indexación y bloquear las demás. Google: “Oftentimes there’s no good reason to allow crawling of filtered items, as it consumes server resources for no or negligible benefit.” (traducción) «A menudo no hay una buena razón para permitir el rastreo de elementos filtrados, ya que consume recursos del servidor con un beneficio nulo o insignificante». Puede permitirse un listado sin filtros y las páginas individuales, y bloquearse el espacio combinatorio filtrado.
- Bloquear en
robots.txtlos patrones de la trampa cuando no deban indexarse. Es la recomendación principal de Google para URL filtradas u ordenadas de poco valor. Advertencia:robots.txtbloquea el rastreo, no la indexación. - Usar
noindexpara retirar páginas irrelevantes ya indexadas. Si ya están en el índice, no deben bloquearse primero enrobots.txt: Google necesita rastrearlas para leernoindex. El orden correcto es mantenerlas rastreables, dejar quenoindexlas retire y, después, bloquearlas opcionalmente enrobots.txtpara detener rastreos futuros. Si se bloquean antes,noindexno llega a verse. - Devolver
404o410para combinaciones de filtros vacías. Google: “Return an HTTP 404 status code when a filter combination doesn’t return results.” (traducción) «Devuelva un código de estado HTTP 404 cuando una combinación de filtros no produzca resultados». También indica: “Eliminate soft 404 errors. Soft 404 pages will continue to be crawled, and waste your budget.” (traducción) «Deben eliminarse los 404 indirectos, porque esas páginas continuarán recibiendo rastreos y consumirán el presupuesto». - Usar
rel="canonical"para consolidar las URL ordenadas o variantes en la versión limpia. Es útil, pero lento y constituye una señal, no una directiva. Google dice que “may, over time, decrease the crawl volume of non-canonical versions of those URLs.” (traducción) «puede reducir con el tiempo el volumen de rastreo de las versiones no canónicas de esas URL». No detiene el rastreo, y Bing advierte: “relying on canonical tag is not necessarily the perfect solution to fix all your duplicate content problems.” (traducción) «depender de la etiqueta canonical no es necesariamente la solución perfecta para corregir todos los problemas de contenido duplicado». - Añadir
rel="nofollow"a los enlaces de filtros. Solo funciona si se aplica a todos los enlaces, internos y externos. Google: “Every anchor pointing to a specific URL must have the rel=“nofollow” attribute in order for it to be effective.” (traducción) «Para que sea eficaz, todo enlace que apunte a una URL específica debe tener el atributo rel=“nofollow”». - Aplicar la solución propia de cada trampa: limitar los enlaces de calendario a
un horizonte razonable y marcar con
noindexlas fechas lejanas; retirar los identificadores de sesión de las URL y usar cookies; corregir los bucles de redirección para que el origen apunte directamente al destino final; usar URL absolutas y reglas del servidor contra la proliferación de rutas relativas; y aplicarnoindexo bloqueo a las páginas de búsqueda interna.
Los parámetros limpios y un orden estable también evitan variantes innecesarias. Google retiró la herramienta URL Parameters en 2022, por lo que robots.txt, canonical y noindex cumplen ahora esa función en Google. En Bing, el equivalente es URL Normalization, que permite indicar los parámetros que deben ignorarse.
Un matiz: no debe romperse la paginación legítima
La corrección excesiva también crea problemas. Ante una paginación «infinita», a veces se bloquean o canonicalizan todas las páginas paginadas. En la guía sobre paginación se explica: “Blocking the pages from crawling will again make it more difficult to find content on the website, end up orphaning pages,” (traducción) «Bloquear el rastreo de las páginas vuelve más difícil encontrar el contenido del sitio y acaba dejando páginas huérfanas». Canonicalizar todas las páginas hacia la primera “makes it harder for search engines to find and index valuable content, and also cuts off the flow of PageRank.” (traducción) «dificulta que los buscadores encuentren e indexen contenido valioso y, además, corta el flujo de PageRank». Debe distinguirse una trampa de paginación genuinamente infinita o en bucle de una paginación finita legítima; esta última debe seguir siendo rastreable.
Contexto dentro del rastreo
Las trampas son un problema de eficiencia de rastreo, relacionado con el presupuesto de rastreo —lo que consumen— y el análisis de archivos de registro —cómo se detectan—. Es el modo de fallo que hace necesario gestionar el presupuesto en los sitios donde realmente importa.
Resumen de IA
Versión condensada de la perspectiva Advanced:
- Una spider trap es una crawler trap: una estructura que genera una cantidad prácticamente infinita de URL y hace que los rastreadores desperdicien presupuesto en páginas irrelevantes casi duplicadas. Google la denomina “infinite spaces” (traducción) «espacios infinitos».
- No tiene que ser infinita en sentido literal: basta una explosión combinatoria «infinita de facto». Un rastreador no sabe que una URL carece de valor sin solicitarla, por lo que entra en la trampa.
- El costo es de oportunidad: “If crawling is spent on useless URLs, the crawlers have less time to spend on new, useful URLs.” (traducción) «Si el rastreo se dedica a URL inútiles, queda menos tiempo para URL nuevas y útiles». Es un problema de eficiencia del presupuesto, no una señal de posicionamiento.
- Dónde importa: sitios grandes, nuevos, que cambian con rapidez o de comercio electrónico. En los sitios pequeños no suele ser determinante.
- No es nuevo; aumentó de escala: Google lo nombró en 2008. Gary Illyes indicó en febrero de 2026, al comentar el informe de cierre de 2025, que la navegación por facetas y los parámetros de acción causan cerca del 75 % de los problemas de rastreo: 50 % las facetas, 25 % los parámetros de acción y proporciones menores los parámetros de seguimiento y los complementos.
- Tipos: navegación por facetas, calendarios infinitos, identificadores de sesión, parámetros de ordenamiento o seguimiento, desplazamiento o paginación en bucle, bucles de redirección, proliferación de URL relativas, búsqueda interna y URL «mágicas».
- Detección: primero los registros, buscando un patrón que consuma una proporción desmedida frente a la línea base propia, no un porcentaje fijo. Después se usan rastreadores, GSC —“Discovered – currently not indexed”, Soft 404 y “extremely high number of URLs”— y Bing Site Scan.
- Corrección, en orden: dejar de generar URL → elegir las facetas indexables y
bloquear las demás → usar robots.txt para contenido irrelevante → retirar con
noindexlo ya indexado antes de bloquear su rastreo → devolver404o410en resultados vacíos → usar canonical y nofollow como señales lentas. robots.txt,noindexy canonical no son equivalentes; la secuencia importa.
Documentación oficial
Documentación de fuentes primarias sobre espacios infinitos, navegación por facetas y presupuesto de rastreo.
- To infinity and beyond? No! — publicación original de 2008 que denominó “infinite spaces” al problema, con ejemplos de calendarios sin fin y filtros acumulados, y las soluciones mediante robots.txt y
nofollow. - Managing crawling of faceted navigation URLs — fuente textual actual sobre por qué las facetas provocan un exceso de rastreo, cuándo bloquearlas y cuáles son las prácticas de indexación recomendadas: separador, orden estable de filtros,
404para resultados vacíos, canonical ynofollow. La antigua URLsearch/docs/crawling-indexing/crawling-managing-faceted-navigationahora redirige aquí con un 301. - Faceted navigation best (and 5 of the worst) practices — publicación de 2014 que demuestra que la navegación por facetas lleva más de una década reconocida como trampa.
- Crawl Budget Management — presenta el «espacio casi infinito», el modelo de capacidad y demanda de rastreo, los tamaños de sitio a los que se dirige la guía y las instrucciones de no rastrear duplicados por desplazamiento infinito ni versiones ordenadas de forma distinta, y de eliminar los errores 404 indirectos. También contiene ahora la antigua guía independiente para propietarios de sitios grandes, cuya URL redirige aquí.
- Crawling December: Faceted navigation (2024) — publicación de diciembre de 2024 dedicada a la navegación por facetas; es anterior y distinta del desglose de problemas de febrero de 2026 citado más abajo.
- GSC Help: Googlebot encountered an extremely high number of URLs — señal de una trampa dentro del producto.
Bing / Microsoft
- Better than canonical; URL Normalization — postura de Bing según la cual “the real number of URLs on the Internet is infinity” (traducción) «la cantidad real de URL en Internet es infinita», con el ejemplo de calendario “Next Day” y URL Normalization como solución preferida para parámetros duplicados.
- Bing Webmaster Tools — Site Scan — auditoría del sitio bajo demanda.
- Bing Webmaster Tools — Block URLs — bloqueo temporal de patrones de URL, combinado con una metaetiqueta NOINDEX.
- Bing Webmaster Tools — Crawl Control — regulación de Bingbot.
Citas de la fuente
Declaraciones textuales de Google y Bing. Cada enlace lleva al pasaje citado en la página de origen. Se conserva la redacción inglesa y se añade una glosa en español.
Google — navegación por facetas, la trampa principal
- “This often means a very large number of possible combinations of filters, which translates to a very large number of possible URLs.” (traducción) «Esto suele implicar una cantidad muy grande de combinaciones posibles de filtros, que se convierte en una cantidad muy grande de URL posibles». Ir a la cita
- “Because the URLs created for the faceted navigation seem to be novel and crawlers can’t determine whether the URLs are going to be useful without crawling first, the crawlers will typically access a very large number of faceted navigation URLs.” (traducción) «Como las URL creadas para la navegación por facetas parecen nuevas y los rastreadores no pueden determinar si serán útiles sin rastrearlas primero, normalmente accederán a una cantidad muy grande de URL de navegación por facetas». Ir a la cita
- “If crawling is spent on useless URLs, the crawlers have less time to spend on new, useful URLs.” (traducción) «Si el rastreo se dedica a URL inútiles, los rastreadores tienen menos tiempo para URL nuevas y útiles». Ir a la cita
- “Oftentimes there’s no good reason to allow crawling of filtered items, as it consumes server resources for no or negligible benefit.” (traducción) «A menudo no hay una buena razón para permitir el rastreo de elementos filtrados, ya que consume recursos del servidor con un beneficio nulo o insignificante». Ir a la cita
- “Return an HTTP 404 status code when a filter combination doesn’t return results.” (traducción) «Devuelva un código de estado HTTP 404 cuando una combinación de filtros no produzca resultados». Ir a la cita
- Sobre canonical: “may, over time, decrease the crawl volume of non-canonical versions of those URLs.” (traducción) «puede reducir con el tiempo el volumen de rastreo de las versiones no canónicas de esas URL». Ir a la cita
- Sobre nofollow: “Every anchor pointing to a specific URL must have the rel=“nofollow” attribute in order for it to be effective.” (traducción) «Para que sea eficaz, todo enlace que apunte a una URL específica debe tener el atributo rel=“nofollow”». Ir a la cita
Google — presupuesto de rastreo y espacios infinitos
- “The web is a nearly infinite space, exceeding Google’s ability to explore and index every available URL.” (traducción) «La Web es un espacio casi infinito que supera la capacidad de Google para explorar e indexar todas las URL disponibles». Ir a la cita
- No deben rastrearse “infinite scrolling pages that duplicate information on linked pages, or differently sorted versions of the same page.” (traducción) «páginas con desplazamiento infinito que duplican información de páginas enlazadas ni versiones de la misma página ordenadas de forma diferente». Ir a la cita
- “Eliminate soft 404 errors. Soft 404 pages will continue to be crawled, and waste your budget.” (traducción) «Elimine los errores 404 indirectos. Estas páginas seguirán rastreándose y desperdiciarán el presupuesto». Ir a la cita
Gary Illyes, Google (Search Off the Record, resumen del informe de rastreo de cierre de 2025 de Google; publicado por Search Engine Land en febrero de 2026)
- La navegación por facetas y los parámetros de acción “accounted for about 75% of the problems” (traducción) «representaron cerca del 75 % de los problemas» que Google encuentra al rastrear. El mismo artículo lo desglosa en un 50 % de navegación por facetas, un 25 % de parámetros de acción, un 10 % de parámetros «irrelevantes» de seguimiento o sesión, un 5 % de complementos o widgets y un 2 % de casos especiales, como URL con doble codificación. Ir a la cita
- Sobre por qué los rastreadores no pueden evitar la trampa: “Once it discovers a set of URLs, it cannot make a decision about whether that URL space is good or not unless it crawled a large chunk of that URL space.” (traducción) «Una vez que descubre un conjunto de URL, no puede decidir si ese espacio de URL es bueno o no sin rastrear una parte grande de él». Ir a la cita
Bing / Microsoft — URL Normalization
- “the real number of URLs on the Internet is infinity.” (traducción) «la cantidad real de URL en Internet es infinita». Ir a la cita
- “relying on canonical tag is not necessarily the perfect solution to fix all your duplicate content problems.” (traducción) «depender de la etiqueta canonical no es necesariamente la solución perfecta para corregir todos los problemas de contenido duplicado». Ir a la cita
Lista de comprobación para detectar y corregir
Detectar
- Extraer los registros del servidor y buscar un patrón de URL que consuma una proporción desmedida de solicitudes de bots frente a la línea base normal del sitio; no existe un porcentaje universal de «demasiado».
- Ejecutar un rastreo con Screaming Frog, Ahrefs Site Audit o Sitebulb y observar si no termina, si las URL se alargan o si crecen las combinaciones.
- Revisar GSC: aumento de “Discovered – currently not indexed”, informe Soft 404 creciente, estadísticas sesgadas hacia rutas irrelevantes o mensaje sobre una cantidad extremadamente alta de URL.
- Comparar las URL indexadas con las que generan tráfico; una fracción muy pequeña con tráfico puede señalar una trampa.
- Comprobar una cadena de parámetros conocida con
site:másinurl:. - Revisar Bing mediante Site Scan y Crawl Control.
Corregir, en orden
- Dejar de generar las URL cuando sea posible, mediante filtros con JavaScript o fragmentos.
- Decidir qué facetas merecen indexación y bloquear las demás.
- Si las páginas irrelevantes aún no están indexadas, bloquear el patrón en
robots.txt. - Si ya están indexadas, mantenerlas rastreables, añadir
noindex, esperar a que salgan del índice y después bloquearlas opcionalmente enrobots.txt. - Devolver
404o410para combinaciones vacías y eliminar los 404 indirectos. - Usar
rel=canonicalpara consolidar variantes ordenadas; es una señal lenta, no un bloqueo. - Usar
rel=nofollowsolo si se aplica a todos los enlaces hacia esas URL. - Mantener parámetros limpios y un orden estable para no crear variantes.
- Según la trampa: limitar calendarios, retirar identificadores de sesión
y usar cookies, corregir bucles de redirección, usar URL absolutas y
aplicar
noindexo bloqueo a la búsqueda interna.
Modelos mentales
1. «Infinito de facto» importa más que «infinito en sentido literal». Una trampa no tiene que carecer de fin. Unos pocos filtros combinables en cualquier orden generan una cantidad astronómica de URL para el mismo contenido. El daño lo causa la explosión combinatoria, no una URL aislada.
2. El costo de descubrirla impide que los rastreadores la eviten. No puede saberse que una URL carece de valor sin solicitarla. Como explicó Illyes, no puede juzgarse un espacio de URL “unless it crawled a large chunk of that URL space” (traducción) «sin haber rastreado una parte grande de ese espacio». El bot debe entrar para reconocer la trampa.
3. El consumo es un costo de oportunidad, no una penalización. Una trampa no constituye una penalización de posicionamiento. El presupuesto gastado en URL inútiles deja de emplearse en URL nuevas y útiles. Ante una capacidad finita y contenido irrelevante infinito, las páginas reales pierden atención. Por eso afecta principalmente a sitios grandes, nuevos o de comercio electrónico.
4. Tres controles, tres funciones y un orden.
robots.txt detiene el rastreo, pero no la indexación. noindex retira del índice,
pero la página debe ser rastreable para que se lea. canonical es una señal lenta,
no un bloqueo. Para retirar páginas ya indexadas: permitir el rastreo → añadir
noindex → esperar a la desindexación → después bloquear en robots.txt. Si se
bloquea primero, noindex nunca se lee.
5. Prevenir supera a parchear. La mejor solución es no crear las URL: filtros con JavaScript o fragmentos, ningún identificador de sesión en la dirección y calendarios con límite. Añadir canonical después es la medida más débil porque el rastreo sigue ocurriendo.
Tipos de trampa → corrección breve
| Trampa | Apariencia | Corrección breve |
|---|---|---|
| Navegación por facetas o filtros | cada combinación crea una URL y la cantidad se dispara | usar filtros con JavaScript o fragmentos; indexar pocas combinaciones elegidas y bloquear el resto |
| Calendarios infinitos | «mes siguiente» sin fin, incluso hasta el año 3000 | limitar el horizonte; aplicar noindex o bloqueo a fechas lejanas |
| Identificadores de sesión en URL | ?sid= o jsessionid; una URL por visitante | retirarlos de la URL y usar cookies |
| Parámetros de ordenamiento | duplicados con ?sort=price o ?order=desc | canonicalizar hacia la URL limpia o bloquearlos en robots.txt |
| Desplazamiento infinito o paginación en bucle | «cargar más» o «siguiente» sin fin que duplica contenido | paginar de forma finita con enlaces <a href> reales y sin bucles |
| Bucles o cadenas de redirección | A → B → A o muchos saltos | redirigir el origen directamente al destino final |
| Proliferación de URL relativas | /abc/def/abc/def/… sigue creciendo | usar URL absolutas y corregir enlaces relativos defectuosos |
| Páginas de búsqueda interna | URL /?s= tratadas como contenido | aplicar noindex o bloquear la ruta de búsqueda |
| URL dinámicas o «mágicas» | texto o identificadores arbitrarios devuelven 200 | validar antes de servir 200 y devolver 404 cuando corresponda |
| Parámetros de seguimiento o acción | variantes UTM, añadir al carrito o comparar | retirar o ignorar parámetros y mantener un orden estable |
Referencia rápida
Señal de detección: un patrón irrelevante consume una proporción desmedida del rastreo frente a la línea base propia; no existe un porcentaje universal.
Desglose del 75 % atribuido a Gary Illyes sobre el informe de cierre de 2025 y publicado en febrero de 2026: facetas y parámetros de acción ≈ 75 % de los problemas —50 % facetas, 25 % acción, 10 % seguimiento o sesión, 5 % complementos o widgets y 2 % otros casos—.
Función de cada control
| Control | ¿Detiene el rastreo? | ¿Detiene la indexación? |
|---|---|---|
bloqueo en robots.txt | Sí | No |
noindex —requiere acceso de rastreo— | No | Sí |
rel=canonical | No | Consolida; es una señal lenta |
rel=nofollow —en todos los enlaces— | Desalienta | No |
404 / 410 | Disminuye con el tiempo | Sí, con el tiempo |
Herramienta retirada: URL Parameters de Google dejó de funcionar en 2022. El equivalente de Bing es URL Normalization.
Herramientas para detectar y corregir trampas
- Análisis de archivos de registro del servidor: es la fuente más fiable y la forma más rápida de detectar una trampa. Debe buscarse un patrón que domine las solicitudes de bots. Pueden usarse Screaming Frog Log File Analyser, BigQuery o una plataforma de registros. Véase análisis de archivos de registro.
- Ahrefs Site Audit: simula un rastreo y muestra cadenas de redirección, proliferación de parámetros, espacios de URL casi duplicadas y rastreos que crecen sin control, todas señales clásicas de una trampa.
- Screaming Frog SEO Spider: su rastreo de escritorio revela proliferación de rutas, bucles de redirección y combinaciones de parámetros en aumento. Debe observarse si el rastreo no termina.
- Google Search Console: Crawl Stats para detectar sesgo hacia rutas irrelevantes, el informe Pages con “Discovered – currently not indexed” y Soft 404, y el mensaje sobre una cantidad extremadamente alta de URL.
- Bing Webmaster Tools: Site Scan, Crawl Control y URL Normalization para indicar a Bing qué parámetros debe ignorar.
- URL Inspection (Inspección de URLs) en GSC: permite confirmar cómo se rastreó e indexó una URL sospechosa concreta.
KPI permanente: proporción de rastreo irrelevante
Una trampa no aparece como una alerta aislada, sino como una proporción del rastreo destinada a páginas que no la merecen. Esta métrica importa sobre todo en sitios grandes, que cambian con rapidez o que tienen catálogos por facetas; el rastreo de un sitio pequeño rara vez se sesga lo suficiente como para justificar el seguimiento.
Proporción de solicitudes hacia el patrón irrelevante
- Métrica: fracción de las solicitudes de Googlebot verificado —o Bingbot— en los registros del servidor que alcanza un mismo patrón sospechoso, como un parámetro de faceta, identificador de sesión o ruta de calendario, frente al contenido real e indexable.
- Qué indica: si una estructura consume presupuesto de verdad o solo podría hacerlo en teoría. Un patrón con una proporción grande y desmedida del total de solicitudes es la señal de trampa descrita en este artículo.
- Cómo obtenerla: procesar los registros sin transformar con Log File Analyzer, agrupar las solicitudes por patrón de URL y contrastar el mismo intervalo con Crawl Stats de GSC desglosado por ruta.
- Referencia o intervalo realista: no existe un umbral universal válido; depende de la arquitectura y de la cantidad de patrones del sitio. Debe usarse como línea base propia que se reduce con el tiempo, no como una cifra absoluta.
- Cadencia: comprobarla al detectar una posible trampa o publicar una corrección. En los demás casos, una revisión mensual suele bastar. Debe repetirse al añadir filtros, ordenamientos o una sección dinámica.
Cantidad en “Discovered / Crawled – currently not indexed”
- Métrica: cantidad de URL del informe Pages de GSC bajo “Discovered – currently not indexed” o “Crawled – currently not indexed”.
- Qué indica: un aumento junto con un patrón de trampa conocido es coherente con que Google encuentre URL que no considera merecedoras del presupuesto de rastreo o indexación. Es un síntoma, no una prueba por sí solo, porque existen otras causas.
- Cómo obtenerla: abrir GSC → informe Pages → filtrar por motivos de «sin indexar»; tomar una muestra y comprobar si coincide con el patrón investigado.
- Referencia o intervalo realista: depende del caso. Conviene seguir la tendencia del propio sitio, no compararla con el recuento de terceros.
- Cadencia: mensual o después de publicar una corrección. Este recuento puede retrasarse días o semanas respecto de los registros, por lo que no cambia de inmediato.
Encontrar y delimitar el patrón de una trampa
Estos ejemplos son puntos de partida, no herramientas terminadas. El resultado debe revisarse antes de confiar en él y las posiciones de campos y rutas deben adaptarse al formato real de los registros.
Buscar un patrón sospechoso en los registros con grep
El comando se aplica a un registro de acceso sin transformar en formato combinado de Apache o Nginx. Cuenta cuántas solicitudes atrae un patrón sospechoso y comprueba si declaran el agente de usuario de Googlebot. Esa cadena puede falsificarse; antes de tratar las solicitudes como desperdicio real, debe confirmarse la IP con Googlebot Verifier:
# Count requests to a suspect pattern (e.g. a filter parameter) by user-agent
grep -i "googlebot" access.log | grep -oE '"[A-Z]+ [^ ]*\?[^ "]*calendar[^ "]*' | wc -l
# Same, but for a session-ID pattern
grep -i "googlebot" access.log | grep -oE '"[A-Z]+ [^ "]*[?&](sid|jsessionid)=[^ "&]*' | wc -l
# Total Googlebot requests in the same window, for the share calculation
grep -ci "googlebot" access.logLa cantidad del patrón se divide entre el total para obtener la proporción de rastreo irrelevante descrita en How to Measure.
Expresión regular para parámetros clásicos de espacios infinitos
Esta lista inicial incluye facetas, ordenamiento, identificadores de sesión y parámetros de seguimiento o acción. Debe ampliarse con los patrones que genere el sitio:
[?&](sort|order|page|sid|jsessionid|phpsessid|utm_[a-z]+|ref|affid|add_to_cart|compare)=Debe ejecutarse sobre una exportación de rastreo o una muestra de registros para marcar URL candidatas antes de decidir si se bloquean en robots.txt, se canonicalizan o reciben noindex. No debe bloquearse solo por una coincidencia sin revisar antes una muestra de las URL afectadas.
Screaming Frog: detectar un rastreo que no termina
No existe una configuración mágica, pero tres ajustes convierten Screaming Frog en un detector de trampas en vez de dejar que el rastreo continúe sin fin:
- Configuration → Spider → Limits: establecer un límite de URL y una profundidad máxima para que un espacio realmente infinito detenga el rastreo en vez de durar horas.
- Configuration → URL Rewriting: retirar identificadores de sesión y parámetros de seguimiento conocidos antes de que el rastreador trate cada variante como URL nueva.
- Observar en directo las columnas URL length y response codes. Las URL que se alargan o una cantidad de parámetros que sigue creciendo son la versión durante el rastreo de la señal que aparece en los registros.
Prompts para clasificar trampas para rastreadores
Deben pegarse los extractos de registros o las listas de URL donde se indique. Antes de actuar, el resultado del modelo debe contrastarse con una muestra de URL reales; puede juzgar mal qué parámetros cambian el contenido.
Marcar patrones de trampa candidatos en una lista de URL
Entrada: una lista de URL obtenida de una exportación de rastreo, de registros del
servidor o de una búsqueda site:. Resultado esperado: URL agrupadas por patrón
probable —filtros por facetas, calendarios, identificadores de sesión o parámetros de
ordenamiento y seguimiento— con una justificación breve para cada grupo.
Here is a list of URLs from my site. Group them by pattern that looks
like a spider trap / infinite space: faceted-navigation filter
combinations, calendar/date paths with no apparent end, session IDs
in the URL, sort or tracking parameters, or redirect-loop candidates.
For each group, give a one-line reason it's suspect and roughly how
many URLs are in it.
URLs:
[paste URL list here]Redactar un bloqueo en robots.txt para un patrón confirmado
Entrada: un patrón de trampa confirmado y el archivo robots.txt actual. Resultado esperado: una regla Disallow limitada al patrón y una comprobación de si afectaría por accidente a páginas legítimas, como una paginación real.
Here is a URL pattern I've confirmed is a spider trap (with example
URLs) and my current robots.txt. Write a Disallow rule scoped to just
this pattern, and tell me if it risks blocking anything else on the
site, especially legitimate finite pagination or individual item pages
that happen to share part of the path.
Pattern + example URLs:
[paste here]
Current robots.txt:
[paste here]Comprobar la secuencia de corrección antes de publicarla
Entrada: una descripción sencilla del estado actual del patrón sospechoso —si ya está indexado, si robots.txt lo bloquea o si incluye noindex—. Resultado esperado: evaluación de si el orden es seguro, teniendo en cuenta que noindex necesita acceso de rastreo y que robots.txt bloquea el rastreo, no la indexación.
Here's the current state of a URL pattern I think is a spider trap:
[describe: is it already indexed? currently crawlable? does it have
a noindex tag? is robots.txt already blocking it?]
Tell me if my planned fix sequence is safe, given that: robots.txt
disallow stops crawling but not indexing, and noindex needs the page
to stay crawlable to be seen and processed. Flag if I'm about to block
crawling before a noindex has had a chance to be read. Demostrar que la corrección detuvo el rastreo
Bloquear un patrón no demuestra que haya dejado de consumir presupuesto. Estas pruebas confirman que las solicitudes disminuyeron, ordenadas de la verificación más rápida a la más lenta.
Prueba 1 — El patrón bloqueado devuelve la respuesta esperada
- Prueba: solicitar directamente algunas URL coincidentes mediante
curl -Io Redirect Checker si se corrigió con redirecciones, y comprobar enrobots.txtla nueva línea Disallow. - Resultado esperado: la regla está presente y tiene el alcance correcto. Si la
corrección usa noindex o 404 en vez de
robots.txt, la URL devuelve el estado o la metaetiqueta esperados. - Interpretación del fallo: una regla ausente o mal delimitada indica que la corrección no se publicó. Deben buscarse errores en la ruta o un patrón demasiado estrecho para abarcar las URL reales.
- Ventana de supervisión: inmediata.
- Criterio de reversión: si la regla afecta por accidente a páginas legítimas, como una paginación finita o fichas reales, debe limitarse antes de perjudicar su rastreo.
Prueba 2 — Las solicitudes al patrón disminuyen en los registros
- Prueba: repetir la comprobación del patrón con Log File Analyzer descrita en How to Measure una o dos semanas después de publicar la corrección.
- Resultado esperado: la proporción de solicitudes irrelevantes se acerca a cero. Un patrón bloqueado en robots.txt no llega a cero de inmediato porque Google puede volver a comprobar ocasionalmente una ruta bloqueada durante un tiempo.
- Interpretación del fallo: si no disminuye, la regla quizá no coincida con las URL solicitadas o estas todavía se descubran mediante una ruta sin corregir, como un enlace interno o una entrada antigua del sitemap.
- Ventana de supervisión: entre una y varias semanas de registros, para separar la tendencia del ruido diario.
- Criterio de reversión: no debe relajarse el bloqueo solo porque la disminución sea lenta. Primero debe distinguirse entre URL aún no rastreadas de nuevo y una regla que no funciona.
Prueba 3 — Crawl Stats y los recuentos «sin indexar» avanzan en la misma dirección
- Prueba: comprobar Crawl Stats, con desglose por ruta si puede inferirse, y los recuentos “Discovered/Crawled – currently not indexed” del informe Pages.
- Resultado esperado: las solicitudes a la clase de ruta afectada tienden a bajar y, para correcciones con noindex, el recuento del patrón disminuye cuando las páginas salen del índice.
- Interpretación del fallo: Crawl Stats se retrasa respecto de los registros del servidor. Que no cambie en unos días no es alarmante; un aumento sostenido después de un mes sugiere que la corrección no alcanza el espacio real de URL.
- Ventana de supervisión: varias semanas; los agregados de GSC reflejan los cambios más despacio que los registros sin transformar.
- Criterio de reversión: un aumento sostenido sin estabilización después de un mes exige auditar de nuevo la coincidencia del patrón, no añadir una segunda corrección más amplia antes de confirmar el alcance de la primera.
Recursos recomendados
Artículos relacionados del autor
- When Should You Worry About Crawl Budget? — texto principal sobre lo que desperdicia presupuesto —parámetros, facetas, ordenamiento e identificadores de sesión— y por qué eliminar duplicados permite a Google concentrarse en URL únicas. Sitúa la trampa como problema de presupuesto.
- Robots.txt and SEO: Everything You Need to Know — cómo bloquear patrones correctamente y por qué robots.txt no sirve para desindexar.
- Indexed, though blocked by robots.txt — la trampa de secuencia: si se bloquea demasiado pronto,
noindexno llega a verse. - SEOs Are Breaking Pagination After Google Changed Rel=Prev/Next — cómo una corrección excesiva de la paginación crea problemas nuevos de rastreo y páginas huérfanas; distingue la paginación finita de un bucle real.
- The Beginner’s Guide to Technical SEO — contexto general de la eficiencia de rastreo.
(El autor suele tratar este problema bajo presupuesto de rastreo, robots.txt y paginación, no con la etiqueta literal “spider trap”; esta página reúne el término y esas áreas.)
Presentaciones del autor
- A Crash Course in Technical SEO (SlideShare) — cubre parámetros, navegación por facetas, identificadores de sesión y barras finales como fuentes de duplicación.
- How Search Works (SlideShare) — explica cómo Googlebot descubre URL y programa el rastreo; aporta contexto sobre por qué los espacios infinitos agotan una capacidad finita. No trata directamente las trampas y solo debe citarse para el contexto de descubrimiento y presupuesto.
Fuentes de terceros
- Crawler Traps: Causes, Solutions & Prevention (Hamlet Batista, SEJ) — lista amplia de tipos con correcciones para desarrollo.
- Crawler Traps: How to Identify and Avoid Them (Conductor) — lista de tipos y detección mediante registros, operadores y GSC.
- Spider trap(s): sniffs and solutions (Joost de Valk, Yoast) — definición sencilla y enfoque de detección en registros.
- Field Guide to Spider Traps (Matthew Henry, Portent) — marco práctico y pasos de detección por tipo.
- Serie Crawling December de Google — conjunto concentrado de explicaciones oficiales, incluida la navegación por facetas.
- How to Identify, Analyze, and Fix Infinite Spaces (Glenn Gabe, GSQI) — caso empresarial con triangulación de GSC, rastreo y analítica, y la secuencia correcta de desindexar antes de bloquear.
- Spider trap (Wikipedia) — definición, origen del término y contramedidas clásicas.
- Google: 75% of crawling issues come from two common URL mistakes (Search Engine Land) — cobertura de la declaración de Gary Illyes de que las facetas y los parámetros de acción explican cerca del 75 % de los problemas de rastreo de Google.
Evaluación: trampas para rastreadores
Cinco preguntas breves sobre las trampas para rastreadores y su corrección. Debe elegirse una respuesta para cada pregunta y comprobarse al final.
Registro de cambios
Actualizado el 13 ago 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.
Actualizado el 13 ago 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.
Actualizado el 18 jul 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.