Indexación
Cómo almacenan y organizan las páginas los motores de búsqueda para poder posicionarlas: análisis del contenido, canonicalización, por qué rastreada no significa indexada y cómo leer el Informe de indexación de páginas de GSC.
Idiomas
1 señal de evidencia en esta página
- Herramienta activa relacionadaGoogle Index Checker
La indexación es la segunda etapa de la búsqueda (rastreo → indexación → publicación): después de rastrear una página, el motor la entiende, elimina duplicados, la canonicaliza y, si cumple los requisitos, la guarda en el índice de búsqueda. Que se rastree no significa que esté indexada: Google elige qué conservar, y la indexación no está garantizada. No es un factor de posicionamiento, pero una página debe estar indexada para poder posicionarse. Para mantener una página fuera, usa noindex y déjala rastreable: no la bloquees mediante el archivo de reglas para rastreadores. Este centro explica toda la etapa y te dirige a los análisis profundos.
TL;DR — La indexación es la forma en que un motor de búsqueda guarda tu página para poder mostrarla en los resultados. Después de rastrear (descargar) una página, el motor determina de qué trata y decide si conservarla. Que una página se rastree no significa que esté indexada: Google elige qué merece conservar. Y estar indexada no es lo mismo que posicionarse; solo significa que puede competir.
Qué es la indexación
La búsqueda funciona en tres pasos, en orden:
- Rastreo — un bot como Googlebot descubre una URL y descarga la página.
- Indexación — el motor lee esa página, determina de qué trata y la archiva en una enorme base de datos con todo lo que podría mostrar en los resultados.
- Publicación (posicionamiento) — cuando alguien busca, el motor extrae de esa base de datos las coincidencias más adecuadas y las ordena.
La indexación es el segundo paso. Si una página no está indexada, no puede posicionarse: simplemente no está en la base de datos de la que se extraen los resultados. Pero la indexación por sí sola no te hace subir posiciones; solo te pone en la competición.
Que se rastree no significa que esté indexada
Esta es la parte que mucha gente pasa por alto. Google no indexa todas las páginas que rastrea: elige cuáles merece la pena conservar. En palabras del propio Google, “Indexing isn’t guaranteed; not every page that Google processes will be indexed.” (traducción) «La indexación no está garantizada; no se indexarán todas las páginas que procesa Google». Evidence for this claim Google does not guarantee that every processed page will be indexed. Scope: Google Search indexing; the source gives examples of possible causes rather than an exhaustive decision formula. Confidence: high · Verified: Google Search Central: In-depth guide to how Google Search works Las páginas suelen quedar fuera porque el contenido es escaso o de poco valor, porque una regla noindex indica a Google que las omita o porque algún aspecto técnico dificulta su procesamiento.
Por eso, si una página no aparece en la búsqueda, «Google no la ha rastreado» y «Google la ha rastreado, pero no la ha conservado» son dos problemas distintos con soluciones distintas.
Cómo comprobar si estás indexado
- Google Search Console es la respuesta fiable. La herramienta de inspección de URL te dice si una página concreta está indexada, y el Informe de indexación de páginas muestra por qué las páginas de tu sitio están o no están indexadas.
- Para una URL concreta, usa la inspección de URL: no puedes buscar ni filtrar el Informe de indexación de páginas por URL, así que ese informe sirve para detectar patrones en todo el sitio, no para consultar una sola página. Además, una prueba en tiempo real correcta en la inspección de URL no cuenta toda la historia: no comprueba todo lo que comprueba el informe, especialmente las condiciones de duplicación y canonicalización.
- Un atajo aproximado es el operador
site:(por ejemplo,site:example.com/page): resulta práctico, pero Search Console es la fuente de verdad.
Cómo mantener una página FUERA del índice
Aquí es donde mucha gente lo entiende al revés. Si quieres que una página desaparezca de la búsqueda:
- Añade una etiqueta
noindex(una etiqueta meta de robots o una cabeceraX-Robots-Tag), y - Asegúrate de que la página siga pudiéndose rastrear: no la bloquees en
robots.txt.
¿Por qué? Porque Google tiene que poder rastrear la página para ver el noindex. Si la bloqueas en robots.txt, Google no puede leer la etiqueta y la página puede seguir indexada si otras páginas enlazan con ella. Evidence for this claim Google must be able to crawl a page to see and apply its noindex rule. Scope: Google-supported robots meta and X-Robots-Tag directives; a robots.txt block can prevent Google from seeing the rule. Confidence: high · Verified: Google Search Central: Block Search indexing with noindex
Esto cubre el caso habitual. Para casos límite de retirada —páginas que necesitas eliminar rápido, una página protegida con contraseña o privada que se filtró al índice, o la decisión entre un 404/410 completo y noindex— consulta la guía específica cómo desindexar una página.
¿Quieres la versión más profunda —qué ocurre realmente durante la indexación, cómo funciona la canonicalización y cómo leer cada estado del Informe de indexación de páginas de Search Console—? Cambia a la pestaña Avanzado.
Evidence for this claim Google must be able to crawl a page to see and apply its noindex rule. Scope: Google-supported robots meta and X-Robots-Tag directives; a robots.txt block can prevent Google from seeing the rule. Confidence: high · Verified: Google Search Central: Block Search indexing with noindexTL;DR — La indexación es la segunda de las tres etapas de la búsqueda (rastreo → indexación → publicación): Google entiende una página rastreada (texto, etiquetas clave, imágenes y vídeo; renderiza JS), detecta duplicados, agrupa páginas similares y elige la más representativa (canonicalización:
rel=canonicales una pista, no una regla), calcula señales y guarda la canónica en el índice. Que una página se rastree no significa que esté indexada: “indexing isn’t guaranteed” (traducción) «la indexación no está garantizada», y la decisión depende en gran medida de la calidad y el valor. El Informe de indexación de páginas de Search Console es tu panel de control. Para desindexar, usanoindexy mantén la página rastreable; nunca usesrobots.txtpara retirar una página, porque una página bloqueada aún puede indexarse (simplemente sin fragmento).
La indexación es la segunda de tres etapas
Tres etapas se suceden de izquierda a derecha. El rastreo descubre y descarga una URL. La indexación procesa la página y almacena la información que reúne los requisitos. La publicación de resultados, o clasificación, ordena las mejores coincidencias indexadas para una consulta. La etapa de indexación aparece resaltada, y una nota indica que no todas las páginas avanzan por todas las etapas.
© Patrick Stox LLC · CC BY 4.0 ·
Google es tajante sobre el proceso: “Google Search works in three stages, and not all pages make it through each stage” (traducción) «La Búsqueda de Google funciona en tres etapas, y no todas las páginas superan cada etapa» — rastreo, indexación y publicación. La indexación es la etapa intermedia, y el documento la define claramente: “Indexing: Google analyzes the text, images, and video files on the page, and stores the information in the Google index, which is a large database.” (traducción) «Indexación: Google analiza el texto, las imágenes y los archivos de vídeo de la página, y almacena la información en el índice de Google, que es una gran base de datos».
Evidence for this claim Google Search describes crawling, indexing, and serving as three distinct stages; indexing analyzes page content and stores eligible information in Google's index. Scope: web search Confidence: high · Verified: In-depth guide to how Google Search worksUna página tiene que rastrearse antes de poder indexarse, y tiene que indexarse antes de poder posicionarse. Pero nada de eso está garantizado: cada etapa es un filtro. Mantener separadas las tres etapas en tu cabeza es el modelo mental más útil del SEO técnico, y por eso siempre pregunto en qué etapa está fallando una página antes de cambiar nada. (Para la etapa anterior, consulta el centro de rastreo: rastreo → indexación es el proceso.)
Qué ocurre realmente durante la indexación
El primer paso analiza una página rastreada en busca de texto, título, texto alternativo, imágenes y video. El segundo paso agrupa las URL duplicadas en un clúster y elige la página más representativa como versión canónica. El tercer paso almacena la página canónica y la información de su clúster en el índice de Google.
© Patrick Stox LLC · CC BY 4.0 ·
La indexación no es una sola cosa, sino una secuencia:
- Comprender el contenido. Google: «Después de rastrear una página, Google intenta comprender de qué trata. Esta etapa se denomina indexación». Eso significa que «Google analiza el contenido textual y las etiquetas y atributos clave, como los elementos
<title>y los atributos alt, además de imágenes, vídeos y otros elementos». JavaScript se renderiza como parte de este proceso: si tu contenido solo aparece después de ejecutar JS, todavía tiene que renderizarse antes de poder entenderse. - Detección de duplicados y selección de URL principal. Esta es la parte que la mayoría de las explicaciones omite, y aquí viven muchos misterios de «¿por qué no se indexa?». Google «determina si una página es un duplicado de otra página de Internet o la principal». El mecanismo es el siguiente: «primero agrupamos las páginas que encontramos en Internet con contenido similar y después seleccionamos la más representativa del grupo». Esa página representativa es la principal: «La principal es la página que puede mostrarse en los resultados de búsqueda».
- Calcular señales y almacenar. Por último, «La información recopilada sobre la página principal y su clúster puede almacenarse en el índice de Google, una gran base de datos alojada en miles de ordenadores». El sistema de indexación de Google que está detrás de todo esto se llama Caffeine: es la capa que incorpora los datos del rastreo, renderiza y extrae información, calcula señales y crea el índice que se publica.
Canonicalización: una pista, no una orden
Como la canonicalización ocurre durante la indexación, merece una nota propia. “Canonicalization is the process of selecting the representative –canonical– URL of a piece of content,” (traducción) «La canonicalización es el proceso de seleccionar la URL representativa —canónica— de un contenido», y existe porque “this process helps Google show only one version of the otherwise duplicate content in its search results.” (traducción) «este proceso ayuda a Google a mostrar una sola versión del contenido que, de otro modo, estaría duplicado en sus resultados de búsqueda».
El detalle decisivo: tu rel=canonical es una sugerencia. En palabras de Google: «indicar una preferencia principal es una pista, no una regla». Google sopesa muchas señales: en mi guía de selección de URL principal señalo que, según Allan Scott, de Google, hay aproximadamente 40 señales distintas para elegir la principal, y puede seleccionar una URL diferente de la que marcaste. Eso es exactamente lo que indica el estado «Duplicada: Google eligió una principal distinta de la del usuario» en Search Console. La denominación exacta del informe es “Duplicate, Google chose different canonical than user” (traducción) «Duplicada: Google eligió una URL principal distinta de la indicada por el usuario».
Que se rastree no significa que esté indexada: por qué las páginas no se indexan
Aquí está el desmontaje del mito, directamente de la documentación: “Indexing isn’t guaranteed; not every page that Google processes will be indexed.” (traducción) «La indexación no está garantizada; no se indexarán todas las páginas que procesa Google». Evidence for this claim Google does not guarantee that every processed page will be indexed. Scope: Google Search indexing; the source gives examples of possible causes rather than an exhaustive decision formula. Confidence: high · Verified: Google Search Central: In-depth guide to how Google Search works Google enumera motivos habituales: “The quality of the content on page is low,” (traducción) «La calidad del contenido de la página es baja», “Robots meta rules disallow indexing,” (traducción) «Las reglas meta de robots impiden la indexación», y “The design of the website might make indexing difficult.” (traducción) «El diseño del sitio web puede dificultar la indexación».
Los representantes de Google son aún más directos: esto es una decisión de selección impulsada por el valor, no una cuota que puedas comprar:
- John Mueller, sobre cuánto puede durar «Descubierta/Rastreada: actualmente no indexada»: “That can be forever. It’s something where we just don’t crawl and index all pages.” (traducción) «Eso puede durar para siempre. Simplemente no rastreamos ni indexamos todas las páginas». La solución no es volver a enviarla, sino lograr que los sistemas reconozcan el valor, para “continue working on the website and making sure that our systems recognize that there’s value in crawling and indexing more and then over time we will crawl and index more.” (traducción) «seguir trabajando en el sitio web y asegurarse de que nuestros sistemas reconozcan que merece la pena rastrear e indexar más; con el tiempo rastrearemos e indexaremos más».
- Mueller de nuevo: “it’s important to keep in mind that Google just doesn’t index every page on the web, even if it’s submitted directly.” (traducción) «Es importante tener presente que Google no indexa todas las páginas de la Web, aunque se envíen directamente». Y, sin rodeos: “Well, lots of SEOs & sites (perhaps not you/yours!) produce terrible content that’s not worth indexing.” (traducción) «Muchos profesionales del SEO y sitios producen contenido pésimo que no merece indexarse».
- Gary Illyes, sobre por qué es selectivo: “we don’t have infinite space, so we want to index stuff that we think– well, not we– but our algorithms determine that it might be searched for…” (traducción) «No tenemos espacio infinito, así que queremos indexar aquello que nuestros algoritmos determinan que podría buscarse…».
- Martin Splitt lo presenta como un equilibrio: “I usually describe it as a challenge with the balance between not overwhelming the website and also spending our resources where it matters.” (traducción) «Suelo describirlo como el reto de equilibrar no saturar el sitio web y dedicar nuestros recursos a lo que importa».
La conclusión práctica: un sitemap o una «solicitud de indexación» ayudan al descubrimiento, no a la selección. Volver a enviar una página no hará que entre a la fuerza. La palanca es la calidad y el valor del sitio.
Cómo leer el Informe de indexación de páginas de Google Search Console
El Informe de indexación de páginas es donde aparecen realmente los problemas de indexación. Trata cada estado como un diagnóstico. Estas son las descripciones textuales de Google:
- Rastreada: actualmente no indexada: «Google rastreó la página, pero no la indexó. Puede que se indexe en el futuro o que no; no es necesario volver a enviarla para rastrearla». Normalmente es una decisión de calidad o valor: mejora la página, no envíes otra vez la solicitud.
- Descubierta: actualmente no indexada: «Google encontró la página, pero todavía no la ha rastreado. Normalmente quería rastrear la URL, pero esperaba que hacerlo sobrecargara el sitio, por lo que reprogramó el rastreo». Técnicamente es un estado previo al rastreo, condicionado por la capacidad; pero si persiste, los representantes lo relacionan con el valor, igual que el anterior.
- Duplicada sin principal elegida por el usuario: «Esta página duplica otra y no indica una principal preferida. Google eligió la otra página como principal, por lo que no mostrará esta en la Búsqueda».
- Duplicada: Google eligió una canonical distinta de la del usuario: «Esta página está marcada como principal de un conjunto, pero Google considera que otra URL es una principal mejor». (El resultado de «pista, no regla» en la práctica.)
- Página alternativa con una etiqueta principal adecuada: «Esta página está marcada como alternativa de otra y apunta correctamente a la página principal, que está indexada, por lo que no tienes que hacer nada».
- Indexada aunque bloqueada por robots.txt: «La página se indexó pese a estar bloqueada por el archivo robots.txt del sitio. Google siempre respeta robots.txt, pero eso no impide necesariamente la indexación si otra página enlaza con ella». Esta es la prueba de que bloquear el rastreo no bloquea la indexación.
- URL bloqueada por robots.txt: «Esta página estaba bloqueada por el archivo robots.txt del sitio».
- URL marcada como «noindex»: «Cuando Google intentó indexar la página encontró una directiva noindex y, por tanto, no la indexó». (Así funciona correctamente la desindexación.)
- Página con redirección: «Esta URL no principal redirige a otra página, por lo que no se indexará».
- 404 suave: «La solicitud devuelve lo que consideramos una respuesta 404 suave: muestra un mensaje de página no encontrada, pero no un código de respuesta HTTP 404».
Cómo controlar la indexación de la forma correcta
Para indexar una página: haz que se pueda rastrear, enlázala internamente, inclúyela en tu sitemap y, por encima de todo, haz que merezca la pena indexarla. Las ayudas al descubrimiento no anulan la evaluación del valor.
Para mantenerla FUERA —el control que más se hace mal en SEO—: usa noindex, “a rule set with either a <meta> tag or HTTP response header,” (traducción) «un conjunto de reglas mediante una etiqueta meta o una cabecera de respuesta HTTP», y mantén la página rastreable. La advertencia decisiva de Google es: “For the noindex rule to be effective, the page or resource must not be blocked by a robots.txt file, and it has to be otherwise accessible to the crawler.” (traducción) «Para que la regla noindex sea efectiva, la página o el recurso no debe estar bloqueado por robots.txt y debe ser accesible para el rastreador».
El error que veo constantemente es añadir noindex y bloquear la página en robots.txt. Es contraproducente. Como explico en Cómo eliminar URL de la Búsqueda de Google: “For these tags to be seen, a search engine needs to be able to crawl the pages—so make sure they aren’t blocked in robots.txt,” (traducción) «Para que se vean estas etiquetas, el buscador debe poder rastrear las páginas; asegúrate de que robots.txt no las bloquee», y “Crawling is not the same thing as indexing. Even if Google is blocked from crawling pages, if there are any internal or external links to a page they can still index it.” (traducción) «Rastrear no es lo mismo que indexar. Aunque Google no pueda rastrear una página, puede indexarla si hay enlaces internos o externos que apunten a ella». En mi artículo sobre el estado Indexada aunque bloqueada por robots.txt lo digo aún más claramente: “Unless Google can crawl a page, they won’t see the noindex meta tag and may still index it because it has links.” (traducción) «Si Google no puede rastrear una página, no verá la metaetiqueta noindex y aún puede indexarla porque tiene enlaces». La solución: “Just add a noindex meta robots tag and make sure to allow crawling—assuming it’s canonical.” (traducción) «Añade una metaetiqueta robots noindex y permite el rastreo, suponiendo que sea la canónica».
Para consultar el árbol de decisión completo de retirada —404/410 frente a noindex, la retención de unos 6 meses de la herramienta de retiradas y la protección con contraseña—, consulta cómo desindexar una página.
La indexación en Bing
Bing utiliza el mismo proceso. Microsoft lo describe así: “As Bingbot crawls the web, it sends information to Bing about what it finds. These pages are then added to the Bing index.” (traducción) «Mientras Bingbot rastrea la Web, envía a Bing información sobre lo que encuentra. Después, esas páginas se añaden al índice de Bing». Se aplican los mismos controles: una directiva noindex mantiene una página fuera, y un robots.txt demasiado restrictivo puede impedir que Bingbot la rastree. Bing también necesita al menos un enlace que apunte a tu sitio para encontrarlo inicialmente.
No todas las páginas deben estar en el índice
Un filtro sencillo, no una regla universal: una página merece indexarse si puede aparecer en una búsqueda con un resultado distinto y útil. Ese es el criterio para evaluar duplicados, variantes de parámetros, URL privadas o de staging y páginas de inventario escasas o repetitivas; no es una razón para aplicar noindex a todo un tipo de página por defecto. Haz la auditoría completa en las páginas creadas para ser propietarias de esa intención, a continuación.
Adónde ir después: el clúster de indexación
Este centro ofrece la visión general. A escala, hay dos cosas que salen mal y cada una tiene su propio análisis profundo:
- Inflación del índice — cuando demasiadas URL de poco valor, duplicadas o escasas terminan en el índice, diluyen el sitio y desperdician recursos de rastreo e indexación. Cómo diagnosticarla y depurarla de forma segura.
- Indexación centrada en móviles — Google indexa la versión móvil de tus páginas, por lo que el contenido, los enlaces y los datos estructurados deben alcanzar la paridad entre móvil y escritorio. Qué comprobar y qué se rompe.
Ambos temas dependen de este centro; también aparecen en la barra lateral y enlazarán de vuelta aquí.
La etapa anterior a esta —cómo los bots descubren y descargan tus páginas— vive en el centro de rastreo; rastreo → indexación es el proceso, y una página tiene que superar el rastreo antes de que se aplique nada de esto. Para una visión más amplia, consulta Cómo funciona la búsqueda.
Resumen de IA
Una versión condensada de la pestaña Avanzado:
- La indexación es la segunda etapa de la búsqueda (rastreo → indexación → publicación). Una página debe rastrearse para indexarse y estar indexada para posicionarse, pero nada de eso está garantizado. No es un factor de posicionamiento, sino una condición de elegibilidad.
- Qué ocurre durante la indexación: Google entiende el contenido (texto, etiquetas clave, imágenes y vídeo; renderiza JS), detecta duplicados, agrupa páginas similares y elige la más representativa (la canónica), calcula señales y la guarda en el índice de Google (sistema: Caffeine).
- La canonicalización ocurre durante la indexación.
rel=canonicales “a hint, not a rule” (traducción) «una pista, no una regla»: Google puede elegir otra URL (hay unas 40 señales de selección). - Que se rastree no significa que esté indexada. “Indexing isn’t guaranteed.” (traducción) «La indexación no está garantizada». Es una decisión de calidad y valor: Mueller — “That can be forever” (traducción) «Eso puede durar para siempre»; Illyes — “we don’t have infinite space.” (traducción) «no tenemos espacio infinito». Volver a enviarla no obligará a Google a incluirla; mejorar el sitio es la palanca.
- El Informe de indexación de páginas de GSC es el panel de control: «Rastreada/Descubierta: actualmente no indexada» (a menudo valor), los estados de duplicación y canonicalización, «Indexada aunque bloqueada por robots.txt» y «URL marcada como noindex».
- Para desindexar: usa
noindex(meta o cabecera HTTP) y mantén la página rastreable: Google debe rastrearla para ver la etiqueta. Nunca usesrobots.txtpara desindexar: una página bloqueada aún puede indexarse mediante enlaces (sin fragmento). - Bing refleja el proceso. Se aplican las mismas reglas de
noindex. - A escala, hay dos fallos principales: inflación del índice (demasiadas URL de poco valor) e indexación centrada en móviles (qué versión indexa Google).
Documentación oficial
Documentación de fuentes primarias de los motores de búsqueda.
- Guía detallada de cómo funciona la Búsqueda de Google — la visión general de rastreo → indexación → publicación, la etapa de indexación y por qué «la indexación no está garantizada».
- Canonicalización y URL duplicadas — cómo Google agrupa los duplicados y elige una URL canónica (la documentación de «pista, no regla»).
- Bloquear la indexación de la Búsqueda con noindex — la herramienta correcta para desindexar y por qué la página debe seguir siendo rastreable.
- Informe de indexación de páginas — la ayuda de Search Console para cada estado de indexación y su significado.
- Rastreo e indexación — el centro de robots, sitemaps, canonicalización y controles de indexación.
Bing / Microsoft
- Cómo ofrece Bing los resultados de búsqueda — el proceso de rastreo → indexación de Bing descrito por Microsoft.
- ¿Por qué mi sitio no está en el índice? — ayuda de Bing Webmaster Tools sobre las barreras de indexación.
Citas de la fuente
Declaraciones públicas de Google y Bing. Cada enlace es un enlace profundo que salta al pasaje citado en la fuente.
Google — qué es la indexación
- “Google Search works in three stages, and not all pages make it through each stage.” (traducción) «La Búsqueda de Google funciona en tres etapas, y no todas las páginas superan cada etapa». — Documentación central de la Búsqueda de Google. Ir a la cita
- “After a page is crawled, Google tries to understand what the page is about. This stage is called indexing.” (traducción) «Una vez rastreada una página, Google trata de averiguar su temática; a esa fase la llama indexación». Ir a la cita
- “Google analyzes the textual content and key content tags and attributes, such as
<title>elements and alt attributes, images, videos, and more.” (traducción) «Google analiza el contenido textual y las etiquetas y atributos clave, como los elementos<title>y los atributos alt, además de imágenes, vídeos y otros elementos». Ir a la cita - “The canonical is the page that may be shown in search results… we first group together (also known as clustering) the pages that we found on the internet that have similar content, and then we select the one that’s most representative of the group.” (traducción) «La URL principal es la página que puede mostrarse en los resultados de búsqueda; primero agrupamos las páginas que encontramos en Internet con contenido similar y después seleccionamos la más representativa del grupo». Ir a la cita
- “The collected information about the canonical page and its cluster may be stored in the Google index, a large database hosted on thousands of computers.” (traducción) «La información recopilada sobre la página principal y su clúster puede almacenarse en el índice de Google, una gran base de datos alojada en miles de ordenadores». Ir a la cita
- “Indexing isn’t guaranteed; not every page that Google processes will be indexed.” (traducción) «La indexación no está garantizada; no se indexarán todas las páginas que procesa Google». Ir a la cita
Google — canonicalización y noindex
- «La selección de URL principal es el proceso de seleccionar la URL representativa —principal— de un contenido». — Documentación central de la Búsqueda de Google. Ir a la cita
- «Es decir, indicar una preferencia principal es una pista, no una regla». Ir a la cita
- «Para que la regla
noindexsea efectiva, la página o el recurso no debe estar bloqueado por un archivo robots.txt y debe ser accesible para el rastreador». — Documentación central de la Búsqueda de Google. Ir a la cita
John Mueller, Google (a través de Search Engine Journal)
- “That can be forever. It’s something where we just don’t crawl and index all pages.” (traducción) «Puede prolongarse indefinidamente; hay páginas que sencillamente no rastreamos ni incorporamos al índice». Leer la cobertura
- “it’s important to keep in mind that Google just doesn’t index every page on the web, even if it’s submitted directly.” (traducción) «Es importante tener presente que Google no indexa todas las páginas de la Web, aunque se envíen directamente». Leer la cobertura
Gary Illyes y Martin Splitt, Google (a través de Search Engine Journal)
- Illyes: “we don’t have infinite space, so we want to index stuff that we think– well, not we– but our algorithms determine that it might be searched for…” (traducción) «No tenemos espacio infinito, así que queremos indexar aquello que creemos —bueno, no nosotros, sino nuestros algoritmos— que podría buscarse…». Leer la cobertura
- Splitt: “I usually describe it as a challenge with the balance between not overwhelming the website and also spending our resources where it matters.” (traducción) «Suelo describirlo como el reto de equilibrar no saturar el sitio web y dedicar nuestros recursos a lo que importa». Leer la cobertura
Bing / Microsoft
- “As Bingbot crawls the web, it sends information to Bing about what it finds. These pages are then added to the Bing index.” (traducción) «Bingbot comunica a Bing lo que descubre durante su recorrido por la Web, y esas páginas pasan después al índice de Bing». — Microsoft Support. Leer la fuente
Lista de comprobación de salud de la indexación
Una comprobación rápida para confirmar que las páginas correctas están indexadas y las incorrectas no:
- Las páginas que quieres indexar se pueden rastrear (no están bloqueadas en
robots.txt) y se pueden alcanzar mediante enlaces internos: no hay páginas huérfanas. - Las páginas importantes devuelven
200, no tienennoindexpor accidente y apuntan con surel=canonicala sí mismas (o a la canonical correcta). - El Informe de indexación de páginas de Search Console muestra tus plantillas clave como «Indexada» y has clasificado «Rastreada/Descubierta: actualmente no indexada».
- Se han revisado los estados de duplicación y canonicalización: confirma que la canonical elegida por Google coincide con tu intención.
- Las páginas que quieres mantener fuera usan
noindex(meta oX-Robots-Tag) y siguen siendo rastreables para que Google pueda ver la etiqueta. - No usas
robots.txtpara desindexar nada (bloqueada ≠ retirada). - No hay sorpresas de «Indexada aunque bloqueada por robots.txt» en el informe.
- El contenido que depende de JS se renderiza como HTML indexable (tiene que renderizarse antes de poder entenderse).
- El sitemap solo incluye URL canónicas e indexables (ayuda al descubrimiento, no a la selección).
Los modelos mentales
1. El proceso — rastreo → indexación → publicación. Cada etapa es un filtro y «no todas las páginas superan cada etapa». Antes de cambiar nada, localiza en qué etapa está fallando una página: ¿se ha rastreado? ¿se ha indexado? ¿se ha publicado para la consulta?
2. Rastreo ≠ indexación ≠ posicionamiento. Rastreada significa descargada. Indexada significa guardada y apta. El posicionamiento es una competición aparte entre páginas indexadas. La indexación no es un factor de posicionamiento, pero no puedes posicionarte sin ella.
3. La indexación es una decisión de selección. Google elige qué conservar: «la indexación no está garantizada». Si una página no está indexada, la pregunta rara vez es «¿la envié?» y casi siempre «¿merece la pena conservarla?». Mejora el valor; no la vuelvas a enviar.
4. La canonicalización forma parte de la indexación.
Los duplicados se agrupan y se guarda una URL representativa. rel=canonical es una pista: Google puede ignorarla. Si se indexa la URL equivocada, analiza las señales (enlaces internos, sitemaps, redirecciones), no solo la etiqueta.
5. La regla de decisión para mantener una página fuera.
¿Quieres que desaparezca del índice? Permite el rastreo + noindex. ¿Quieres que los bots no entren en un espacio de URL completo (y no te importa que copias aisladas se indexen mediante enlaces)? Bloqueo en robots.txt. Nunca uses un bloqueo para desindexar.
Controles y estados de indexación — chuleta
Qué hace realmente cada control
| Control | ¿Detiene el rastreo? | ¿Detiene la indexación? | Úsalo para |
|---|---|---|---|
noindex (meta/cabecera) | No (debe seguir siendo rastreable) | Sí | Retirar una página del índice |
Bloqueo en robots.txt | Sí | No | Mantener a los bots fuera de espacios de URL de poco valor |
rel=canonical | No | Consolida (es una pista) | Apuntar al duplicado preferido |
| Herramienta de retirada de URL (GSC) | No | Temporalmente (unos 6 meses) | Ocultación rápida y breve mientras añades noindex |
Cómo leer el Informe de indexación de páginas (estados de alto valor)
| Estado | Qué significa | Qué hacer |
|---|---|---|
| Rastreada: actualmente no indexada | Rastreada, pero considerada poco valiosa para conservarla | Mejora la calidad/el valor; no la vuelvas a enviar |
| Descubierta: actualmente no indexada | Encontrada, con el rastreo aplazado; la persistencia indica valor | Mejora el valor; comprueba los enlaces internos |
| Duplicada: Google eligió una canonical distinta | Se ignoró tu canonical | Refuerza las señales hacia tu URL preferida |
| Indexada aunque bloqueada por robots.txt | Bloqueada, pero indexada mediante enlaces | Desbloquea y añade noindex para retirarla |
| URL marcada como «noindex» | Se vio y respetó noindex | Nada (funciona como debe) |
| Página con redirección / 404 suave | Redirección no canónica / 404 falso | Corrige la redirección o devuelve un 404/410 real |
Datos rápidos
- «La indexación no está garantizada»: Google selecciona qué conservar.
noindexsolo funciona si la página es rastreable.robots.txtbloquea el rastreo, no la indexación: una página bloqueada aún puede indexarse.rel=canonicales una pista, no una directiva (unas 40 señales de selección de canonical).- La indexación no es un factor de posicionamiento: es la puerta para poder posicionarse.
Herramientas para ver y gestionar la indexación
Comprueba si una página concreta está indexada con el Comprobador de indexación de Google:
- Pega la URL pública exacta en la herramienta.
- Ejecuta Comprobar señales para obtener la respuesta activa.
- Lee las señales de estado, redirección,
noindexy canonical que muestra. - Sigue el traspaso de Abrir inspección de URL para conocer el veredicto real de Google sobre el índice: la herramienta solo informa de lo que se puede observar desde la página pública.
- Google Search Console — Informe de indexación de páginas — la visión propia de Google sobre qué páginas están indexadas y por qué otras no, estado por estado.
- Inspección de URL (GSC) — comprueba si una URL está indexada, ve la canonical elegida por Google y consulta el HTML renderizado.
- Bing Webmaster Tools — cobertura del índice, inspección de URL y envío a Bing.
- El operador
site:— comprobación rápida y aproximada de lo que está indexado (no sustituye a Search Console). - Rastreadores y auditorías de sitios — Ahrefs Site Audit y Screaming Frog SEO Spider muestran etiquetas
noindex, conflictos de canonicalización, grupos de duplicados y problemas de indexabilidad a escala. - Ahrefs Webmaster Tools — rastreo y auditoría gratuitos para sitios que verifiques, con avisos de problemas de indexabilidad.
Recursos que merecen tu tiempo
Mis artículos relacionados
- Guía para principiantes de SEO técnico — dónde encaja la indexación en el panorama general.
- Cómo eliminar URL de la Búsqueda de Google (5 métodos) — formas correctas e incorrectas de desindexar.
- Indexada aunque bloqueada por robots.txt — por qué las páginas bloqueadas siguen indexándose y cómo solucionarlo.
- Canonicalización: guía para principiantes — cómo elige Google la URL que indexa.
- Qué significa «Rastreada: actualmente no indexada» en Google Search Console — diagnóstico del estado «no indexada» más habitual.
De otros autores
- Etiqueta meta de robots y X-Robots-Tag: todo lo que necesitas saber (Michal Pecánek, Ahrefs) — la referencia definitiva sobre las directivas
noindex, incluida esta regla: “Never disallow crawling of content that you’re trying to get deindexed in robots.txt.” (traducción) «Nunca impidas el rastreo del contenido que intentas desindexar mediante robots.txt». - r/TechSEO — la comunidad para depurar problemas de rastreo e indexación.
De todo el sector
- Google dice que el estado «Descubierta: actualmente no indexada» puede durar para siempre (SEJ) — la cita “That can be forever” (traducción) «Eso puede durar para siempre» de Mueller en contexto, con conclusiones prácticas para sitios atascados en este estado.
- Google comparte información sobre la indexación y el presupuesto de rastreo (SEJ) — Mueller, Illyes y Splitt sobre por qué Google no indexa todo y cómo pensar en la decisión de valor de rastreo/indexación.
- Gary Illyes habla sobre recuperación de información en la Búsqueda de Google (SER) — Illyes sobre el espacio finito del índice y por qué Google es selectivo con lo que guarda.
- Así funciona Caffeine, el sistema de indexación de Google (pódcast de Google) — el equipo de relaciones de búsqueda de Google explica cómo Caffeine incorpora datos de rastreo, renderiza páginas, extrae señales y crea el índice.
Mis charlas
- Cómo funciona la búsqueda (SlideShare) — mi explicación del rastreo, el renderizado, la indexación y el posicionamiento. (Se aplica mi aviso habitual: “This is my understanding of systems… not going to be 100% complete or accurate.” (traducción) «Así entiendo yo estos sistemas; puede que no sea una explicación completa o totalmente exacta».)
Podcasts
- Charlas internas sobre la Búsqueda (equipo de relaciones de búsqueda de Google) — ¡Se desvela el funcionamiento de Caffeine (el sistema de indexación de Google) y mucho más! El equipo de Google explica cómo el sistema de indexación incorpora datos de rastreo, renderiza y extrae información, calcula señales y crea el índice. Escuchar
Vídeos
- Google Search Central (YouTube) — la serie How Google Search Works y las explicaciones de Martin Splitt sobre indexación y renderizado, incluidos los vídeos sobre canonicalización y SEO para JavaScript. Canal
Ponte a prueba: indexación
Cinco preguntas rápidas sobre cómo se indexan las páginas (y por qué puede que no se indexen). Elige una respuesta para cada una y comprueba el resultado después.
Registro de cambios
Actualizado el 22 ago 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.
Actualizado el 10 ago 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.
Actualizado el 18 jul 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
- Principiante
Los detalles del cambio están disponibles actualmente en inglés.
- Principiante
Los detalles del cambio están disponibles actualmente en inglés.
- Avanzado
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.