Indexación

Cómo almacenan y organizan las páginas los motores de búsqueda para poder posicionarlas: análisis del contenido, canonicalización, por qué rastreada no significa indexada y cómo leer el Informe de indexación de páginas de GSC.

Publicado por primera vez: 23 jun 2026 · Última actualización: 22 ago 2026 · Avanzado
Idiomas
1 señal de evidencia en esta página

La indexación es la segunda etapa de la búsqueda (rastreo → indexación → publicación): después de rastrear una página, el motor la entiende, elimina duplicados, la canonicaliza y, si cumple los requisitos, la guarda en el índice de búsqueda. Que se rastree no significa que esté indexada: Google elige qué conservar, y la indexación no está garantizada. No es un factor de posicionamiento, pero una página debe estar indexada para poder posicionarse. Para mantener una página fuera, usa noindex y déjala rastreable: no la bloquees mediante el archivo de reglas para rastreadores. Este centro explica toda la etapa y te dirige a los análisis profundos.

TL;DR — La indexación es la segunda de las tres etapas de la búsqueda (rastreo → indexación → publicación): Google entiende una página rastreada (texto, etiquetas clave, imágenes y vídeo; renderiza JS), detecta duplicados, agrupa páginas similares y elige la más representativa (canonicalización: rel=canonical es una pista, no una regla), calcula señales y guarda la canónica en el índice. Que una página se rastree no significa que esté indexada: “indexing isn’t guaranteed” (traducción) «la indexación no está garantizada», y la decisión depende en gran medida de la calidad y el valor. El Informe de indexación de páginas de Search Console es tu panel de control. Para desindexar, usa noindex y mantén la página rastreable; nunca uses robots.txt para retirar una página, porque una página bloqueada aún puede indexarse (simplemente sin fragmento).

Evidence for this claim Google must be able to crawl a page to see and apply its noindex rule. Scope: Google-supported robots meta and X-Robots-Tag directives; a robots.txt block can prevent Google from seeing the rule. Confidence: high · Verified: Google Search Central: Block Search indexing with noindex

La indexación es la segunda de tres etapas

La indexación es la segunda de las tres etapas: el filtro intermedio entre el rastreo y la clasificación. Fuente: /technical-seo/how-search-works/indexing/

Tres etapas se suceden de izquierda a derecha. El rastreo descubre y descarga una URL. La indexación procesa la página y almacena la información que reúne los requisitos. La publicación de resultados, o clasificación, ordena las mejores coincidencias indexadas para una consulta. La etapa de indexación aparece resaltada, y una nota indica que no todas las páginas avanzan por todas las etapas.

© Patrick Stox LLC · CC BY 4.0 ·

Google es tajante sobre el proceso: “Google Search works in three stages, and not all pages make it through each stage” (traducción) «La Búsqueda de Google funciona en tres etapas, y no todas las páginas superan cada etapa» — rastreo, indexación y publicación. La indexación es la etapa intermedia, y el documento la define claramente: “Indexing: Google analyzes the text, images, and video files on the page, and stores the information in the Google index, which is a large database.” (traducción) «Indexación: Google analiza el texto, las imágenes y los archivos de vídeo de la página, y almacena la información en el índice de Google, que es una gran base de datos».

Evidence for this claim Google Search describes crawling, indexing, and serving as three distinct stages; indexing analyzes page content and stores eligible information in Google's index. Scope: web search Confidence: high · Verified: In-depth guide to how Google Search works

Una página tiene que rastrearse antes de poder indexarse, y tiene que indexarse antes de poder posicionarse. Pero nada de eso está garantizado: cada etapa es un filtro. Mantener separadas las tres etapas en tu cabeza es el modelo mental más útil del SEO técnico, y por eso siempre pregunto en qué etapa está fallando una página antes de cambiar nada. (Para la etapa anterior, consulta el centro de rastreo: rastreo → indexación es el proceso.)

Qué ocurre realmente durante la indexación

La indexación es una secuencia: comprender, agrupar y seleccionar una versión canónica, y después almacenar. Fuente: /technical-seo/how-search-works/indexing/

El primer paso analiza una página rastreada en busca de texto, título, texto alternativo, imágenes y video. El segundo paso agrupa las URL duplicadas en un clúster y elige la página más representativa como versión canónica. El tercer paso almacena la página canónica y la información de su clúster en el índice de Google.

© Patrick Stox LLC · CC BY 4.0 ·

La indexación no es una sola cosa, sino una secuencia:

  • Comprender el contenido. Google: «Después de rastrear una página, Google intenta comprender de qué trata. Esta etapa se denomina indexación». Eso significa que «Google analiza el contenido textual y las etiquetas y atributos clave, como los elementos <title> y los atributos alt, además de imágenes, vídeos y otros elementos». JavaScript se renderiza como parte de este proceso: si tu contenido solo aparece después de ejecutar JS, todavía tiene que renderizarse antes de poder entenderse.
  • Detección de duplicados y selección de URL principal. Esta es la parte que la mayoría de las explicaciones omite, y aquí viven muchos misterios de «¿por qué no se indexa?». Google «determina si una página es un duplicado de otra página de Internet o la principal». El mecanismo es el siguiente: «primero agrupamos las páginas que encontramos en Internet con contenido similar y después seleccionamos la más representativa del grupo». Esa página representativa es la principal: «La principal es la página que puede mostrarse en los resultados de búsqueda».
  • Calcular señales y almacenar. Por último, «La información recopilada sobre la página principal y su clúster puede almacenarse en el índice de Google, una gran base de datos alojada en miles de ordenadores». El sistema de indexación de Google que está detrás de todo esto se llama Caffeine: es la capa que incorpora los datos del rastreo, renderiza y extrae información, calcula señales y crea el índice que se publica.

Canonicalización: una pista, no una orden

Como la canonicalización ocurre durante la indexación, merece una nota propia. “Canonicalization is the process of selecting the representative –canonical– URL of a piece of content,” (traducción) «La canonicalización es el proceso de seleccionar la URL representativa —canónica— de un contenido», y existe porque “this process helps Google show only one version of the otherwise duplicate content in its search results.” (traducción) «este proceso ayuda a Google a mostrar una sola versión del contenido que, de otro modo, estaría duplicado en sus resultados de búsqueda».

El detalle decisivo: tu rel=canonical es una sugerencia. En palabras de Google: «indicar una preferencia principal es una pista, no una regla». Google sopesa muchas señales: en mi guía de selección de URL principal señalo que, según Allan Scott, de Google, hay aproximadamente 40 señales distintas para elegir la principal, y puede seleccionar una URL diferente de la que marcaste. Eso es exactamente lo que indica el estado «Duplicada: Google eligió una principal distinta de la del usuario» en Search Console. La denominación exacta del informe es “Duplicate, Google chose different canonical than user” (traducción) «Duplicada: Google eligió una URL principal distinta de la indicada por el usuario».

Que se rastree no significa que esté indexada: por qué las páginas no se indexan

Aquí está el desmontaje del mito, directamente de la documentación: “Indexing isn’t guaranteed; not every page that Google processes will be indexed.” (traducción) «La indexación no está garantizada; no se indexarán todas las páginas que procesa Google». Evidence for this claim Google does not guarantee that every processed page will be indexed. Scope: Google Search indexing; the source gives examples of possible causes rather than an exhaustive decision formula. Confidence: high · Verified: Google Search Central: In-depth guide to how Google Search works Google enumera motivos habituales: “The quality of the content on page is low,” (traducción) «La calidad del contenido de la página es baja», “Robots meta rules disallow indexing,” (traducción) «Las reglas meta de robots impiden la indexación», y “The design of the website might make indexing difficult.” (traducción) «El diseño del sitio web puede dificultar la indexación».

Los representantes de Google son aún más directos: esto es una decisión de selección impulsada por el valor, no una cuota que puedas comprar:

  • John Mueller, sobre cuánto puede durar «Descubierta/Rastreada: actualmente no indexada»: “That can be forever. It’s something where we just don’t crawl and index all pages.” (traducción) «Eso puede durar para siempre. Simplemente no rastreamos ni indexamos todas las páginas». La solución no es volver a enviarla, sino lograr que los sistemas reconozcan el valor, para “continue working on the website and making sure that our systems recognize that there’s value in crawling and indexing more and then over time we will crawl and index more.” (traducción) «seguir trabajando en el sitio web y asegurarse de que nuestros sistemas reconozcan que merece la pena rastrear e indexar más; con el tiempo rastrearemos e indexaremos más».
  • Mueller de nuevo: “it’s important to keep in mind that Google just doesn’t index every page on the web, even if it’s submitted directly.” (traducción) «Es importante tener presente que Google no indexa todas las páginas de la Web, aunque se envíen directamente». Y, sin rodeos: “Well, lots of SEOs & sites (perhaps not you/yours!) produce terrible content that’s not worth indexing.” (traducción) «Muchos profesionales del SEO y sitios producen contenido pésimo que no merece indexarse».
  • Gary Illyes, sobre por qué es selectivo: “we don’t have infinite space, so we want to index stuff that we think– well, not we– but our algorithms determine that it might be searched for…” (traducción) «No tenemos espacio infinito, así que queremos indexar aquello que nuestros algoritmos determinan que podría buscarse…».
  • Martin Splitt lo presenta como un equilibrio: “I usually describe it as a challenge with the balance between not overwhelming the website and also spending our resources where it matters.” (traducción) «Suelo describirlo como el reto de equilibrar no saturar el sitio web y dedicar nuestros recursos a lo que importa».

La conclusión práctica: un sitemap o una «solicitud de indexación» ayudan al descubrimiento, no a la selección. Volver a enviar una página no hará que entre a la fuerza. La palanca es la calidad y el valor del sitio.

Cómo leer el Informe de indexación de páginas de Google Search Console

El Informe de indexación de páginas es donde aparecen realmente los problemas de indexación. Trata cada estado como un diagnóstico. Estas son las descripciones textuales de Google:

  • Rastreada: actualmente no indexada: «Google rastreó la página, pero no la indexó. Puede que se indexe en el futuro o que no; no es necesario volver a enviarla para rastrearla». Normalmente es una decisión de calidad o valor: mejora la página, no envíes otra vez la solicitud.
  • Descubierta: actualmente no indexada: «Google encontró la página, pero todavía no la ha rastreado. Normalmente quería rastrear la URL, pero esperaba que hacerlo sobrecargara el sitio, por lo que reprogramó el rastreo». Técnicamente es un estado previo al rastreo, condicionado por la capacidad; pero si persiste, los representantes lo relacionan con el valor, igual que el anterior.
  • Duplicada sin principal elegida por el usuario: «Esta página duplica otra y no indica una principal preferida. Google eligió la otra página como principal, por lo que no mostrará esta en la Búsqueda».
  • Duplicada: Google eligió una canonical distinta de la del usuario: «Esta página está marcada como principal de un conjunto, pero Google considera que otra URL es una principal mejor». (El resultado de «pista, no regla» en la práctica.)
  • Página alternativa con una etiqueta principal adecuada: «Esta página está marcada como alternativa de otra y apunta correctamente a la página principal, que está indexada, por lo que no tienes que hacer nada».
  • Indexada aunque bloqueada por robots.txt: «La página se indexó pese a estar bloqueada por el archivo robots.txt del sitio. Google siempre respeta robots.txt, pero eso no impide necesariamente la indexación si otra página enlaza con ella». Esta es la prueba de que bloquear el rastreo no bloquea la indexación.
  • URL bloqueada por robots.txt: «Esta página estaba bloqueada por el archivo robots.txt del sitio».
  • URL marcada como «noindex»: «Cuando Google intentó indexar la página encontró una directiva noindex y, por tanto, no la indexó». (Así funciona correctamente la desindexación.)
  • Página con redirección: «Esta URL no principal redirige a otra página, por lo que no se indexará».
  • 404 suave: «La solicitud devuelve lo que consideramos una respuesta 404 suave: muestra un mensaje de página no encontrada, pero no un código de respuesta HTTP 404».

Cómo controlar la indexación de la forma correcta

Para indexar una página: haz que se pueda rastrear, enlázala internamente, inclúyela en tu sitemap y, por encima de todo, haz que merezca la pena indexarla. Las ayudas al descubrimiento no anulan la evaluación del valor.

Para mantenerla FUERA —el control que más se hace mal en SEO—: usa noindex, “a rule set with either a <meta> tag or HTTP response header,” (traducción) «un conjunto de reglas mediante una etiqueta meta o una cabecera de respuesta HTTP», y mantén la página rastreable. La advertencia decisiva de Google es: “For the noindex rule to be effective, the page or resource must not be blocked by a robots.txt file, and it has to be otherwise accessible to the crawler.” (traducción) «Para que la regla noindex sea efectiva, la página o el recurso no debe estar bloqueado por robots.txt y debe ser accesible para el rastreador».

Evidence for this claim For Google to apply noindex, the crawler must be allowed to access the page or resource; a robots.txt block can prevent Google from seeing the rule. Scope: HTML and HTTP resources Confidence: high · Verified: Block Search indexing with noindex

El error que veo constantemente es añadir noindex y bloquear la página en robots.txt. Es contraproducente. Como explico en Cómo eliminar URL de la Búsqueda de Google: “For these tags to be seen, a search engine needs to be able to crawl the pages—so make sure they aren’t blocked in robots.txt,” (traducción) «Para que se vean estas etiquetas, el buscador debe poder rastrear las páginas; asegúrate de que robots.txt no las bloquee», y “Crawling is not the same thing as indexing. Even if Google is blocked from crawling pages, if there are any internal or external links to a page they can still index it.” (traducción) «Rastrear no es lo mismo que indexar. Aunque Google no pueda rastrear una página, puede indexarla si hay enlaces internos o externos que apunten a ella». En mi artículo sobre el estado Indexada aunque bloqueada por robots.txt lo digo aún más claramente: “Unless Google can crawl a page, they won’t see the noindex meta tag and may still index it because it has links.” (traducción) «Si Google no puede rastrear una página, no verá la metaetiqueta noindex y aún puede indexarla porque tiene enlaces». La solución: “Just add a noindex meta robots tag and make sure to allow crawling—assuming it’s canonical.” (traducción) «Añade una metaetiqueta robots noindex y permite el rastreo, suponiendo que sea la canónica».

Para consultar el árbol de decisión completo de retirada —404/410 frente a noindex, la retención de unos 6 meses de la herramienta de retiradas y la protección con contraseña—, consulta cómo desindexar una página.

La indexación en Bing

Bing utiliza el mismo proceso. Microsoft lo describe así: “As Bingbot crawls the web, it sends information to Bing about what it finds. These pages are then added to the Bing index.” (traducción) «Mientras Bingbot rastrea la Web, envía a Bing información sobre lo que encuentra. Después, esas páginas se añaden al índice de Bing». Se aplican los mismos controles: una directiva noindex mantiene una página fuera, y un robots.txt demasiado restrictivo puede impedir que Bingbot la rastree. Bing también necesita al menos un enlace que apunte a tu sitio para encontrarlo inicialmente.

No todas las páginas deben estar en el índice

Un filtro sencillo, no una regla universal: una página merece indexarse si puede aparecer en una búsqueda con un resultado distinto y útil. Ese es el criterio para evaluar duplicados, variantes de parámetros, URL privadas o de staging y páginas de inventario escasas o repetitivas; no es una razón para aplicar noindex a todo un tipo de página por defecto. Haz la auditoría completa en las páginas creadas para ser propietarias de esa intención, a continuación.

Adónde ir después: el clúster de indexación

Este centro ofrece la visión general. A escala, hay dos cosas que salen mal y cada una tiene su propio análisis profundo:

  • Inflación del índice — cuando demasiadas URL de poco valor, duplicadas o escasas terminan en el índice, diluyen el sitio y desperdician recursos de rastreo e indexación. Cómo diagnosticarla y depurarla de forma segura.
  • Indexación centrada en móviles — Google indexa la versión móvil de tus páginas, por lo que el contenido, los enlaces y los datos estructurados deben alcanzar la paridad entre móvil y escritorio. Qué comprobar y qué se rompe.

Ambos temas dependen de este centro; también aparecen en la barra lateral y enlazarán de vuelta aquí.

La etapa anterior a esta —cómo los bots descubren y descargan tus páginas— vive en el centro de rastreo; rastreo → indexación es el proceso, y una página tiene que superar el rastreo antes de que se aplique nada de esto. Para una visión más amplia, consulta Cómo funciona la búsqueda.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.