URL marcada como 'noindex' (estado de GSC)
Qué significa el estado "URL marcada como 'noindex'" en Google Search Console, y la variante "URL enviada marcada como 'noindex'" y el nombre heredado "Excluida por la etiqueta 'noindex'". Cuándo es intencional vs. un error, dónde vive el noindex (etiqueta meta vs. cabecera X-Robots-Tag), el conflicto con robots.txt, el noindex fantasma/CDN, y cómo corregirlo y validarlo.
Idiomas
1 señal de evidencia en esta página
- Herramienta activa relacionadaGoogle Index Checker
"URL marcada como 'noindex'" es el estado de indexación de páginas de Google Search Console para una página que Google rastreó y encontró una directiva noindex (una etiqueta meta robots o una cabecera X-Robots-Tag), por lo que la mantuvo fuera del índice. Misma condición, varios nombres: el actual "URL marcada como 'noindex'", la redacción más precisa para sitemaps "URL enviada marcada como 'noindex'" que usan comúnmente los informes y herramientas, y el nombre heredado "Excluida por la etiqueta 'noindex'". Suele ser intencional y correcto: valida la lista de URLs antes de "arreglar" nada. La verdadera señal de alerta es una página con noindex que aún está en tu sitemap: el envío del sitemap es una sugerencia para Google, no una garantía, y las dos directivas se contradicen. Como el noindex depende del rastreo, no lo combines con una desautorización en robots.txt: Google no puede ver un noindex que no puede rastrear. Revisa dos lugares (la etiqueta meta y la cabecera X-Robots-Tag), depura el noindex fantasma/CDN con una obtención de Googlebot en vivo, luego elimina la directiva, valida la corrección y espera que el reprocesamiento tarde más de un día o dos.
Evidence for this claim Google reports URL marked noindex when it encounters a noindex directive and does not index the page. Scope: Google Search Console report terminology and documented Search behavior; the label alone may not prove the underlying root cause. Confidence: high · Verified: Google: Page indexing reportTL;DR — “URL marcada como ‘noindex’” en Google Search Console significa que Google miró tu página, vio una instrucción
noindexen ella y la mantuvo fuera de la búsqueda a propósito. La mayoría de las veces eso es intencional — muchas páginas deberían estar noindexed. La situación que realmente debería preocuparte es una página que pusiste en tu sitemap (pidiendo a Google que la indexe) que también dice no-indexes — algunos informes la llaman “Submitted URL marked ‘noindex’” (traducción) «URL enviada marcada como “noindex”». Mira la lista de páginas afectadas: si todas son las que querías ocultar, has terminado.
Qué te está diciendo este estado
Esta etiqueta significa que Google encontró una directiva noindex al procesar la página. Evidence for this claim Google reports URL marked noindex when it encounters a noindex directive and does not index the page. Scope: Google Search Console report terminology and documented Search behavior; the label alone may not prove the underlying root cause. Confidence: high · Verified: Google: Page indexing report Google admite noindex en un elemento meta robots o en el encabezado de respuesta X-Robots-Tag. Evidence for this claim Google supports noindex through a robots meta tag or X-Robots-Tag header and must crawl the page to observe it. Scope: Google Search Console report terminology and documented Search behavior; the label alone may not prove the underlying root cause. Confidence: high · Verified: Google: Block indexing with noindex
Cuando abres el informe Indexación de páginas en Search Console y ves una fila llamada
“URL marcada como ‘noindex’”, esto es lo que pasó: Google visitó (rastreó) la
página, encontró una instrucción noindex en ella y decidió no ponerla en los resultados
de búsqueda. Eso es todo. La página no está rota — Google hizo exactamente lo que la página
le dijo que hiciera.
Un noindex es una pequeña instrucción que dice “no muestres esta página en la búsqueda.” Se
encuentra en uno de dos lugares:
- Una línea en el código de la página (una etiqueta meta robots), o
- Una configuración en la respuesta del servidor de la página (un encabezado X-Robots-Tag) — esta no puedes verla solo mirando la página.
¿Es esto malo? Normalmente no
La palabra que asusta a la gente es “No indexada” (la sección bajo la que vive este estado). Suena como un error. Normalmente no lo es. Muchas páginas deberían mantenerse fuera de la búsqueda:
- Páginas de agradecimiento / confirmación de pedido
- Resultados de búsqueda interna
- Páginas de inicio de sesión, cuenta y administración
- Versiones filtradas u ordenadas de un listado
Si las páginas en esta lista son las que querías ocultar, déjalas en paz. No hay nada que arreglar.
Cuándo sí necesitas actuar
Dos situaciones:
- Una página que quieres en Google está en esta lista. Algo puso un
noindexen una página que debería posicionarse. Eso es un error que debes rastrear. - Ves “URL enviada marcada como ‘noindex’” (una redacción ligeramente diferente y más
directa que usan algunos informes y herramientas). En cualquier caso, la sustancia es la misma:
enviaste la página en tu sitemap — que está destinado a listar páginas que quieres
en la Búsqueda — pero la página también dice “no indexes.” Esas dos cosas
se contradicen entre sí. O eliminas el
noindex(si quieres que se indexe) o quitas la URL de tu sitemap (si no quieres).
La confusión de nombres
La variante atribuida “Submitted URL marked ‘noindex’,” (traducción) «URL enviada marcada como “noindex”» y el nombre “Excluded by ‘noindex’ tag” (traducción) «Excluida por la etiqueta “noindex”» describen la misma condición. Este último es solo el nombre más antiguo para lo mismo del informe anterior de Google. Así que tres etiquetas — “URL marcada como ‘noindex’,” “URL enviada marcada como ‘noindex’,” y “Excluida por la etiqueta ‘noindex’” — todas describen una situación: Google encontró un noindex.
Una trampa que debes conocer
Un instinto común es también bloquear la página en robots.txt para “realmente” mantenerla
fuera. No lo hagas. Bloquear el rastreo impide que Google lea la página por completo — lo que
significa que tampoco puede ver tu noindex. Contraintuitivamente, la página puede permanecer
en la búsqueda. Para eliminar una página, deja que Google la rastree y mantén el noindex en ella.
¿Quieres la versión de diagnóstico completa — detección de meta etiqueta vs. encabezado, noindex fantasma/CDN, y el flujo de corregir y validar — cambia a la pestaña Avanzado.
TL;DR — “URL marcada como ‘noindex’” es el estado de Indexación de páginas de GSC para una página que Google rastreó y encontró un
noindexen — etiqueta meta robots o cabecera X-Robots-Tag , y Google también respeta una etiqueta meta robots colocada en el cuerpo de la página, no solo en el<head>. Varios nombres, un mismo estado: el actual “URL marcada como ‘noindex’”, la redacción más precisa de sitemap “Submitted URL marked ‘noindex’” (traducción) «URL enviada marcada como “noindex”» que los informes y herramientas suelen usar, y el legado «Excluida por etiqueta “noindex”». Es distinto de bloqueada por robots.txt (nunca rastreada) y de “Rastreada — actualmente no indexada” (sin directiva). Normalmente es intencional — valida primero la lista de URLs. Una URL con noindex que sigue en tu sitemap es la señal real (el envío del sitemap es una pista, no una garantía).noindexes dependiente del rastreo: combínalo con una desautorización en robots.txt y Google no puede verlo, así que la página puede seguir indexada. Cuando las reglas entran en conflicto, Google aplica la más restrictiva. Comprueba dos fuentes (el HTML renderizado y la cabecera HTTP), depura un noindex fantasma/de CDN con una búsqueda en vivo de Googlebot (Inspección de URLs / Prueba de Resultados Enriquecidos), luego elimina la directiva, valida la corrección y espera que el reprocesamiento tarde más de un día o dos — Google dice que puede llegar a meses para páginas de menor prioridad.
Qué significa realmente el estado
El informe describe la directiva observada por Google, no por qué un CMS, plantilla o CDN la añadió. Evidence for this claim Google reports URL marked noindex when it encounters a noindex directive and does not index the page. Scope: Google Search Console report terminology and documented Search behavior; the label alone may not prove the underlying root cause. Confidence: high · Verified: Google: Page indexing report Google debe poder rastrear la página para observar y aplicar noindex. Evidence for this claim Google supports noindex through a robots meta tag or X-Robots-Tag header and must crawl the page to observe it. Scope: Google Search Console report terminology and documented Search behavior; the label alone may not prove the underlying root cause. Confidence: high · Verified: Google: Block indexing with noindex
La definición de Google es precisa: cuando Google intentó indexar la página, se
encontró con una directiva noindex y, por lo tanto, no la indexó. La palabra clave es
encontró — Google tuvo que rastrear la página para ver la directiva. Así que este
estado conlleva dos hechos a la vez: Google llegó a la página, y la página le dijo
que no se indexara.
Esa es toda la columna vertebral de precisión aquí, y es lo que separa este estado de sus vecinos:
- Bloqueada por robots.txt → Google nunca tuvo permiso para rastrear, así que no leyó ningún contenido ni ninguna directiva.
- “Rastreada — actualmente no indexada” → Google rastreó, no encontró ninguna directiva, y decidió no indexar de todos modos.
- “URL marcada como ‘noindex’” → Google rastreó, encontró un
noindexy lo obedeció.
Los tres nombres son una misma condición
Esto confunde a la gente porque la etiqueta ha cambiado con el tiempo y varía según cómo se encontró la URL:
- “URL marcada como ‘noindex’” — la etiqueta actual y general en el informe de Indexación de páginas. Se encuentra bajo “No indexada” (antes “Excluida”). Esta es la redacción que usa y define la documentación actual del informe de Indexación de páginas de Google.
- “URL enviada marcada como ‘noindex’” — la misma condición subyacente, pero para una URL que también está en un sitemap que enviaste. Esta es la redacción más precisa que los profesionales y las herramientas SEO de terceros suelen informar para esa combinación. La documentación de ayuda actual de Google no la define como un estado separado y distinto de “URL marcada como ‘noindex’”, así que trata la etiqueta exacta como dependiente del informe — pero la sustancia se mantiene independientemente de cómo la llame una herramienta determinada: un sitemap está pensado para listar las URLs que quieres en la Búsqueda (y enviar uno es una pista para Google, no una garantía de indexación), así que una URL con noindex que está en él es una contradicción que vale la pena resolver.
- “Excluida por etiqueta ‘noindex’” — el nombre legado del informe “Cobertura de indexación” anterior a 2021. Sigue siendo la versión coloquial más buscada. La misma cosa subyacente.
Si has llegado aquí desde cualquiera de esos tres, estás en el mismo lugar.
¿Es un problema? La decisión entre intencional y accidental
No “arregles” esto por reflejo. El árbol de decisión:
- Obtén la lista de URLs afectadas (haz clic en el estado).
- ¿Son estas páginas que querías excluir? Páginas de agradecimiento, búsqueda interna, URLs de facetas/filtros, cuentas/administración, staging que no debería estar en vivo. → No se requiere acción. “No indexada” no es lo mismo que “rota”, y Google lo dice: estas URLs no han sido indexadas, pero no necesariamente debido a un error.
- ¿Hay una página que quieres indexar en esta lista? → Un noindex se filtró en ella. Encuéntralo y elimínalo.
- ¿La URL con noindex también está en tu sitemap enviado (a menudo
aparece como “URL enviada marcada como ‘noindex’”)? → Resuelve la contradicción
directamente: elimina el
noindex(para indexarla) o elimina la URL de tu sitemap (para dejarla sin indexar). No dejes una URL con noindex en un sitemap: el envío del sitemap es una pista para Google sobre lo que quieres indexar, no una solicitud que anule la directiva de la propia página.
La razón por la que los competidores tratan esto como un puro “error a corregir” es que se saltan el paso 2. La mayoría de las veces, este estado es el sistema funcionando correctamente.
Dónde vive el noindex: metaetiqueta vs. cabecera X-Robots-Tag
Hay exactamente dos métodos de entrega, y debes revisar ambos porque se ven completamente diferentes:
- Metaetiqueta robots —
<meta name="robots" content="noindex">en el<head>de la página. Apunta a todos los rastreadores;<meta name="googlebot" content="noindex">apunta solo a Google. Esta es la que puedes detectar en el HTML. - Cabecera HTTP X-Robots-Tag —
X-Robots-Tag: noindexen las cabeceras de respuesta del servidor. Esta es la sigilosa. Se configura en el servidor, CMS o CDN, no en el código fuente de la página, por lo que “Ver código fuente” no la mostrará. El método de cabecera también es la única forma de aplicar noindex a archivos que no son HTML: una cabecera de respuesta puede usarse para recursos no HTML como PDFs, archivos de video y archivos de imagen, que no tienen<head>para contener una metaetiqueta.
Cuando GSC dice noindex y juras que la página no lo tiene, la cabecera es el primer lugar donde mirar (la pestaña de la hoja de referencia los muestra uno al lado del otro).
Cómo encontrar la directiva en una página
- Ver código fuente / DOM renderizado — busca
noindex. Revisa el<head>renderizado, no solo el código fuente crudo, ya que una etiqueta puede ser inyectada por JavaScript o un gestor de etiquetas. Tampoco te detengas en<head>: Google ha dicho que no aplica la ubicación de meta-robots y respeta una metaetiqueta robots encontrada en el<body>de la página también, por lo que una directiva inyectada más abajo en el documento sigue contando. - Cabeceras de respuesta —
curl -I https://example.com/page/(o Herramientas de desarrollador del navegador → Red → la solicitud del documento → Cabeceras de respuesta) y busca una líneaX-Robots-Tag. - URL Inspection (Inspección de URLs) (GSC) → Probar URL en vivo — esto obtiene la página como Googlebot e informa el veredicto de indexación y la respuesta. Esta es la que detecta directivas servidas solo a Google.
- Rich Results Test (Prueba de resultados enriquecidos) — otra obtención real de Googlebot que devuelve la respuesta HTTP y una instantánea renderizada de exactamente lo que el servidor muestra a Google.
- Verifica reglas de robots en conflicto, no solo una etiqueta única. Si más de
una directiva de robots se aplica a la página (por ejemplo, una plantilla establece
indexpero un plugin o cabecera añadenoindex), Google aplica la regla más restrictiva — por lo que unnoindexsuelto en cualquier lugar gana incluso si otra regla diceindex. No dejes de buscar una vez que hayas encontrado una directiva que parezca permisiva.
El conflicto de robots.txt (por qué disallow + noindex resulta contraproducente)
Este es el punto más confuso en todas las demás guías, así que quiero ser exacto.
noindex depende del rastreo: Google tiene que poder obtener la página para leer
la directiva. Google establece la regla claramente: para que la regla noindex sea
efectiva, la página no debe estar bloqueada por un archivo robots.txt y debe ser
accesible de otro modo para el rastreador; si está bloqueada o el rastreador no puede
acceder a ella, el rastreador nunca verá el noindex, y la página aún puede aparecer
en la búsqueda (por ejemplo, si otras páginas enlazan a ella).
He escrito sobre el lado opuesto de esto durante años. En mi artículo de Ahrefs sobre «Indexada aunque esté bloqueada por robots.txt», el punto central es “crawling and indexing are two different things” (traducción) «rastrear e indexar son dos cosas distintas»: “if you block a page from being crawled, Google may still index it.” (traducción) «si impides que una página se rastree, Google aún puede indexarla». Y específicamente sobre este conflicto: “Unless Google can crawl a page, they won’t see the noindex meta tag and may still index it because it has links.” (traducción) «A menos que Google pueda rastrear una página, no verá la metaetiqueta noindex y aún puede indexarla porque tiene enlaces». Así que la combinación contraproducente es noindex + desautorización en robots.txt: la desautorización oculta el noindex, y la página puede permanecer indexada mediante enlaces externos.
La secuencia correcta para eliminar realmente una página:
- Permite el rastreo y mantén el
noindexen su lugar. - Espera a que Google vuelva a rastrear, vea la directiva y elimine la página.
- Solo entonces, si quieres ahorrar presupuesto de rastreo, puedes desautorizarla en robots.txt — después de la desindexación, no antes.
Mi recomendación habitual, de ese mismo artículo, es “Just add a noindex meta robots tag and make sure to allow crawling — assuming it’s canonical.” (traducción) «Añade una metaetiqueta robots noindex y asegúrate de permitir el rastreo, siempre que sea la URL principal».
Noindex fantasma: caché de CDN y directivas solo para Googlebot
La versión más difícil de esto es el noindex “fantasma”: miras la página, no ves ningún noindex en ninguna parte, y GSC aún informa uno. John Mueller ha abordado exactamente esto — en los casos que ha visto, sí había un noindex real, a veces mostrado solo a Google, lo que puede ser muy difícil de depurar. (Señaló ese escenario cuando surgió; estoy parafraseando su punto en lugar de citarlo como una declaración formal).
Los sospechosos habituales — trátalos como hipótesis a verificar, no como causas confirmadas, hasta que la respuesta en vivo muestre realmente uno de ellos:
- Un CDN o caché que sirve un encabezado
X-Robots-Tag: noindexobsoleto que ya no está en tu configuración de origen. - Una directiva condicional según el agente de usuario — el servidor devuelve una página limpia a tu navegador y una con noindex a Googlebot.
- Una fuga de plantilla de staging — un noindex destinado a un entorno de staging que llega a producción a través de una plantilla compartida.
El diagnóstico es el mismo en los tres casos: no confíes en “Ver código fuente” en tu propio navegador. Haz una obtención real de Googlebot — la Prueba de URL en vivo de Inspección de URLs o la Prueba de resultados enriquecidos — que te muestra la respuesta HTTP y la página renderizada exactamente como Google la recibe. Así es como detectas un servidor/CDN que te sirve una cosa a ti y otra al rastreador.
Cómo corregirlo y validarlo
Una vez que hayas confirmado que el noindex es un error:
- Elimina la directiva en su fuente real: la etiqueta meta en la plantilla, o
el encabezado
X-Robots-Tagen la configuración del servidor/CMS/CDN. Limpia cualquier caché de CDN/página para que la corrección se esté sirviendo realmente. - Confirma con una búsqueda en vivo de Googlebot (Inspección de URLs → Probar URL en vivo) que la página ahora devuelve sin noindex y muestra “URL disponible para Google”.
- Solicita la indexación para URLs de alta prioridad y/o usa el botón Validar corrección del informe para pedirle a Google que vuelva a verificar todo el conjunto afectado.
- Espera. La desindexación y la reindexación no son instantáneas: Google tiene que volver a rastrear para ver el cambio primero, y la propia guía de Google dice que el tiempo de revisita depende de la importancia de la página y puede tardar considerablemente más de un día o dos (su documentación da “meses” como posibilidad para páginas de menor prioridad). Solicitar la indexación en una URL prioritaria es cómo le pides a Google que intente antes, no una forma de forzar un cronograma específico. No entres en pánico si el estado persiste durante el reprocesamiento.
Para el caso inverso — una página que quieres con noindex pero que está atascada en el índice
porque también estaba bloqueada por robots.txt — desbloquea primero el rastreo para que Google pueda
finalmente ver el noindex.
Dónde encaja esto
Este estado es un nodo en el informe Indexación de páginas de Google. La directiva de robots
que hay detrás — noindex — se puede entregar como una etiqueta meta robots o un
encabezado X-Robots-Tag, y la herramienta adecuada depende de si trabajas con
archivos HTML o no HTML. Los estados vecinos (“Indexada, aunque bloqueada por
robots.txt” y “Rastreada — actualmente no indexada”) describen estados diferentes y
necesitan correcciones diferentes; mantenerlos claros es la mayor parte de la batalla.
Resumen de IA
Una versión condensada de la versión avanzada:
- Qué significa: «URL marcada como “noindex”» es el estado de Indexación de páginas de GSC para una página que Google rastreó y encontró un
noindex— por lo que la mantuvo fuera del índice a propósito. Google tuvo que rastrear la página para ver la directiva, y respeta esa directiva ya sea en el<head>o en el cuerpo de la página. - Varios nombres, un mismo estado: el actual «URL marcada como “noindex”», la redacción más precisa de sitemap «URL enviada marcada como “noindex”» que los informes y herramientas usan comúnmente, y el heredado «Excluida por la etiqueta “noindex”».
- Distinta de sus vecinas: bloqueada por robots.txt = nunca rastreada; «Rastreada — actualmente no indexada» = rastreada, sin directiva; este estado = rastreada, encontró un noindex, lo obedeció.
- Generalmente intencional. Valida primero la lista de URLs. Páginas de agradecimiento, búsqueda interna, facetas, administración = bien, sin acción. Solo actúa si una página que quieres indexar está en la lista — o si la URL está noindexada pero sigue en tu sitemap (una contradicción, ya que el envío al sitemap es una pista de lo que quieres indexar, no una garantía): elimina el noindex o elimínala del sitemap.
- Dos métodos de entrega: una etiqueta meta robots en cualquier parte del HTML renderizado (no solo en el
<head>), o una cabecera HTTP X-Robots-Tag (la única forma para archivos no HTML como PDFs, y la sigilosa — no está en el código fuente de la página). Comprueba ambas, y recuerda que cuando varias reglas de robots entran en conflicto, Google aplica la más restrictiva. - El conflicto con robots.txt:
noindexdepende del rastreo. Disallow + noindex resulta contraproducente — Google no puede ver un noindex que no puede rastrear, por lo que la página puede seguir indexada a través de enlaces. Para eliminar una página: permite el rastreo + mantén el noindex, y luego opcionalmente aplica Disallow después de la desindexación. - Noindex fantasma: el propietario no ve ninguno, Google sí — normalmente un CDN/caché que sirve una cabecera obsoleta, una directiva solo para Googlebot, o una fuga de staging/plantilla (trátalas como hipótesis a confirmar, no como causas asumidas). Depura con una búsqueda real de Googlebot (prueba en vivo de Inspección de URLs / Prueba de resultados enriquecidos), no con Ver código fuente.
- Corregir → validar: elimina la directiva en su origen, limpia las cachés, confirma con una búsqueda real de Googlebot, Solicita indexación / Valida la corrección, y luego espera — la propia guía de Google dice que el reprocesamiento depende de la importancia de la página y puede tardar mucho más de un día o dos, hasta meses para páginas de menor prioridad.
Documentación oficial
Documentación de fuentes primarias de los motores de búsqueda.
- Informe de indexación de páginas — el informe en el que vive este estado; incluye “Indexed, though blocked by robots.txt” (traducción) «Indexada aunque esté bloqueada por robots.txt» como estado relacionado (su texto actual no detalla por separado «URL enviada marcada como “noindex”» como un nombre distinto, aunque la contradicción subyacente del sitemap que describe es real).
- Bloquear la indexación en la búsqueda con noindex — qué hace
noindex, los métodos de metaetiqueta vs. cabecera X-Robots-Tag, la regla dependiente del rastreo (una página bloqueada nunca ve el noindex), y la propia nota de Google de que volver a visitar una página después de un cambio puede llevar meses dependiendo de su importancia. - Especificaciones de la metaetiqueta de robots, data-nosnippet y X-Robots-Tag — cómo se resuelven las reglas de robots conflictivas (gana la regla más restrictiva) y la confirmación de que Google también respeta una metaetiqueta de robots colocada en el cuerpo de la página, no solo en el
<head>. - Introducción a robots.txt — por qué robots.txt controla el rastreo, no la indexación, y por qué no es una herramienta de desindexación.
- Herramienta de inspección de URLs — “Probar URL en vivo” obtiene la página como Googlebot, la forma de detectar directivas servidas solo a Google.
- Crear y enviar un sitemap — los sitemaps deben enumerar las URLs que quieres en la Búsqueda, y enviar uno es una pista para Google, no una garantía de rastreo o indexación.
Bing / Microsoft
- Bing Webmaster Tools — Ayuda y guías — Bing respeta la etiqueta de robots
<meta name="robots" content="noindex">y la cabeceraX-Robots-Tagde la misma manera; sus informes de índice muestran páginas noindexed de forma similar. (Prioridad menor para este estado específico de Google).
Citas de la fuente
Declaraciones oficiales de Google, además de mi propio escrito sobre el conflicto de robots.txt. Cada enlace es un enlace profundo que salta al pasaje citado en la página de origen.
Google — qué significa el estado
- “When Google tried to index the page it encountered a ‘noindex’ directive and therefore did not index it.” (traducción) «Cuando Google intentó indexar la página, encontró una directiva ‘noindex’ y por lo tanto no la indexó.» — Ayuda de Google Search Console (Informe de indexación de páginas). Ir a la cita
Google — noindex depende del rastreo
- “For the noindex rule to be effective, the page or resource must not be blocked by a robots.txt file, and it has to be otherwise accessible to the crawler. If the page is blocked by a robots.txt file or the crawler can’t access the page, the crawler will never see the noindex rule, and the page can still appear in search results, for example if other pages link to it.” (traducción) «Para que la regla noindex sea efectiva, la página o el recurso no debe estar bloqueado por un archivo robots.txt, y debe ser accesible de otro modo para el rastreador. Si la página está bloqueada por un archivo robots.txt o el rastreador no puede acceder a la página, el rastreador nunca verá la regla noindex, y la página aún puede aparecer en los resultados de búsqueda, por ejemplo si otras páginas enlazan a ella.» — Documentación de Google Search Central (Bloquear la indexación en la búsqueda con noindex). Ir a la cita
- “Depending on the importance of the page on the internet, it may take months for Googlebot to revisit a page.” (traducción) «Dependiendo de la importancia de la página en internet, puede llevar meses que Googlebot vuelva a visitar una página.» — Documentación de Google Search Central (Bloquear la indexación en la búsqueda con noindex), sobre cuánto tiempo puede llevar el reprocesamiento después de un cambio de noindex. Leer el artículo
Google — reglas conflictivas y dónde puede vivir una directiva
- “Google Search doesn’t enforce placement of meta robots in the HTML head and will respect robots meta tags in the body section of an HTML document as well.” (traducción) «Google Search no exige la ubicación de meta robots en el head del HTML y respetará las meta etiquetas robots en la sección del cuerpo de un documento HTML también.» — Documentación de Google Search Central (especificaciones de la meta etiqueta robots, data-nosnippet y X-Robots-Tag). Leer el artículo
- “In the case of conflicting robots rules, the more restrictive rule applies.” (traducción) «En caso de reglas robots conflictivas, se aplica la regla más restrictiva.» — Documentación de Google Search Central (misma especificación). Leer el artículo
Patrick Stox (Ahrefs) — el conflicto de robots.txt
- “If you block a page from being crawled, Google may still index it because crawling and indexing are two different things.” (traducción) «Si bloqueas una página para que no se rastree, Google puede indexarla igualmente porque rastrear e indexar son dos cosas diferentes.» — yo, «“Indexada aunque esté bloqueada por robots.txt” puede significar más que un bloqueo de robots.txt» (Ahrefs). Ir a la cita
- “Unless Google can crawl a page, they won’t see the noindex meta tag and may still index it because it has links.” (traducción) «A menos que Google pueda rastrear una página, no verá la meta etiqueta noindex y puede indexarla igualmente porque tiene enlaces.» — yo (mismo artículo). Leer el artículo
- “Just add a noindex meta robots tag and make sure to allow crawling—assuming it’s canonical.” (traducción) «Solo añade una meta etiqueta robots noindex y asegúrate de permitir el rastreo, asumiendo que es canónica.» — yo (mismo artículo). Leer el artículo
Lista de verificación de triaje para “URL marcada como ‘noindex’”
Trabaja de arriba a abajo: la mayoría de estos terminan en el paso 2 con “no se necesita acción”.
- Abre la lista de URLs afectadas en el informe de Indexación de páginas (haz clic en la fila de estado).
- Decide si es intencional o accidental: ¿son estas páginas que querías excluir (agradecimiento, búsqueda interna, facetas, administración, staging)? Si es así → listo.
- ¿La URL también está en tu sitemap enviado (a menudo aparece como
“URL enviada marcada como ‘noindex’”)? Resuelve la contradicción: elimina
el
noindex(para indexar) o elimina la URL del sitemap (para mantenerla fuera). - Para páginas que deberían indexarse, busca la directiva en ambos lugares:
-
<head>renderizado para<meta name="robots" ... noindex>(verifica el DOM renderizado, no solo Ver código fuente). - Cabeceras de respuesta para
X-Robots-Tag: noindex(curl -Io DevTools → Red).
-
- Confirma lo que ve Googlebot con Inspección de URL → Probar URL en vivo (o la Prueba de resultados enriquecidos): detecta directivas solo de Googlebot / servidas por CDN.
- Verifica el conflicto de robots.txt: la URL no está también desautorizada (una desautorización oculta el noindex y puede dejar la página indexada).
- Elimina la directiva en su fuente real (plantilla / servidor / CMS / CDN), luego limpia cualquier caché de CDN o de página.
- Vuelve a probar en vivo que la página ya no devuelve noindex.
- Solicita la indexación y/o toca Validar corrección; luego espera — el tiempo de recrawleo no es fijo. Google dice que depende de la importancia de la página y puede tardar mucho más de un día o dos, hasta meses para páginas de menor prioridad.
Hojas de referencia
Los tres nombres: la misma condición
| Etiqueta que viste | Cuándo aparece | Gravedad |
|---|---|---|
| URL marcada como ‘noindex’ | Google rastreó la página y encontró un noindex | Información (bajo “No indexada”) — a menudo intencional |
| URL enviada marcada como ‘noindex’ | Igual, pero la URL estaba en un sitemap enviado | A menudo aparece como una fila de nivel de error — independientemente de la etiqueta, una contradicción a resolver |
| Excluida por la etiqueta ‘noindex’ | Nombre heredado (informe de Cobertura de indexación anterior a 2021) | Igual que “URL marcada como ‘noindex’” |
Dónde vive el noindex: etiqueta meta vs. cabecera X-Robots-Tag
| Etiqueta meta robots | Cabecera X-Robots-Tag | |
|---|---|---|
| Forma | <meta name="robots" content="noindex"> | X-Robots-Tag: noindex |
| Vive en | El <head> de la página (HTML) | Las cabeceras de respuesta HTTP |
| ¿Visible en Ver código fuente? | Sí (si no es inyectado por JS) | No — comprueba curl -I / DevTools |
| Configurado por | Plantilla / CMS / editor de página | Configuración del servidor / CMS / CDN |
| ¿Funciona para no-HTML (PDF, imagen, vídeo)? | No (no tiene <head>) | Sí |
| ¿Apuntar a un motor? | name="googlebot" etc. | X-Robots-Tag: googlebot: noindex |
Cómo se diferencia este estado de sus vecinos
| Estado | ¿Rastreada? | ¿Directiva encontrada? | Significado |
|---|---|---|---|
| URL marcada como ‘noindex’ | Sí | noindex | Google obedeció tu noindex |
| Indexada, aunque bloqueada por robots.txt | No | n/a (no puede leerla) | Bloqueada del rastreo pero indexada mediante enlaces |
| Rastreada — actualmente no indexada | Sí | Ninguna | Sin directiva; Google simplemente eligió no indexarla |
Árbol de decisión intencional vs. accidental
| Pregunta | Si sí | Si no |
|---|---|---|
| ¿Son páginas que querías excluir? | Sin acción | baja ↓ |
| ¿Es la variante de error “Enviada”? | Elimina el noindex o elimínala del sitemap | baja ↓ |
| ¿Quieres que esta página esté indexada? | Encuentra y elimina el noindex, luego Valida la corrección | Déjala (y elimínala del sitemap si está presente) |
Los modelos mentales
1. Rastreada y la vio. Este estado solo existe porque Google rastreó la página y leyó una directiva. Ese único hecho lo distingue de bloqueada por robots.txt (nunca rastreada) y de “Rastreada — actualmente no indexada” (rastreada, sin directiva). Localiza en cuál de los tres estás antes de tocar nada.
2. “No indexada” ≠ roto. La suposición por defecto debería ser intencional, no error. Valida primero la lista de URLs; la mayoría de las veces el movimiento correcto es no hacer nada. La única combinación que merece tratarse como urgente es una URL con noindex que también está en tu sitemap enviado — porque un sitemap está pensado para listar lo que quieres indexar (el envío es solo una pista para Google, no una garantía), y una URL de sitemap con noindex contradice eso.
3. Dos fuentes, comprueba siempre ambas.
Un noindex es o una etiqueta meta (en el <head> renderizado) o una cabecera
X-Robots-Tag (en la respuesta HTTP). La cabecera es invisible en Ver código
fuente, así que “no tengo un noindex” normalmente significa “no comprobé la
cabecera”. Comprueba ambas, cada vez.
4. Dependiente del rastreo — nunca combines noindex con un disallow. Google debe rastrear una página para ver su noindex. Bloquea el rastreo en robots.txt y el noindex se vuelve invisible, dejando la página indexable mediante enlaces. Para eliminar una página: permite el rastreo + mantén el noindex, espera la desindexación, luego opcionalmente añade el disallow.
5. Confía en la vista de Googlebot, no en la de tu navegador. Para un noindex fantasma (tú no ves ninguno, GSC ve uno), Ver código fuente de tu navegador es el instrumento equivocado. Un CDN, caché o regla de user-agent puede mostrar a Googlebot algo diferente. Diagnostica con una búsqueda real de Googlebot — la prueba en vivo de Inspección de URLs o la Prueba de resultados enriquecidos — que muestra la respuesta exacta que Google recibe.
Manual: acabas de ver un estado “marcada como ‘noindex’”
Lee esto de arriba a abajo la primera vez que encuentres uno de estos estados. Rama en cada “si ves” — la mayoría de las ejecuciones terminan pronto.
1. Abre el informe de Indexación de páginas y haz clic en la fila de estado. Observa cuál de las tres etiquetas es: “URL marcada como ‘noindex’”, “URL enviada marcada como ‘noindex’” o la heredada “Excluida por la etiqueta ‘noindex’”. Obtén la lista completa de las URLs afectadas; no juzgues solo por el recuento.
2. Revisa la lista de URLs para ver su forma. Si ves principalmente páginas de agradecimiento, búsqueda interna, URLs de filtros/facetas o páginas de administración/cuenta — estas son páginas que normalmente querrías fuera del índice. → Detente aquí. No se necesita ninguna acción; esto es el sistema funcionando como se espera.
3. Si ves una URL que realmente quieres que aparezca en los resultados, aíslala.
Alguien o algo puso un noindex en una página que debería ser indexable. Pasa al
paso 4 para encontrar de dónde viene.
4. Si la etiqueta es “URL enviada marcada como ‘noindex’” — o simplemente notas que la
URL está tanto con noindex como en tu sitemap — trátalo como urgente.
El envío del sitemap está pensado para señalar las URLs que quieres en la Búsqueda (Google
lo trata como una sugerencia, no como una garantía), por lo que un noindex en esa misma URL es una
contradicción directa, y muchos informes y herramientas lo muestran como una fila
de nivel de error precisamente por esa razón. Decide qué lado es el correcto — quieres que esté
indexada (elimina el noindex) o no (sácala del sitemap) — y
resuelve la contradicción el mismo día que la encuentres.
5. Localiza la directiva.
Revisa el <head> renderizado para ver si hay una etiqueta <meta name="robots" content="noindex">,
luego revisa los encabezados de respuesta (curl -I o DevTools → Red) para ver si hay un
X-Robots-Tag: noindex. Si ninguno muestra nada y GSC aún informa uno,
es probable que tengas un noindex fantasma — ve al paso 6.
6. Si Ver código fuente está limpio pero GSC aún dice noindex, no confíes en tu navegador. Ejecuta una búsqueda en vivo de Googlebot (Inspección de URLs → Probar URL en vivo, o la Prueba de resultados enriquecidos). Busca una CDN/caché que sirva un encabezado obsoleto, una directiva condicionada por el agente de usuario, o una plantilla de ensayo que se filtre a producción.
7. Si la URL también está deshabilitada en robots.txt, corrige eso primero.
Una deshabilitación oculta el noindex de Google por completo, por lo que nada de lo que hagas con el
noindex tendrá efecto hasta que el rastreo vuelva a estar permitido. Elimina la deshabilitación
(o espera a que se levante) antes de continuar.
8. Elimina la directiva en su fuente real — plantilla, configuración del servidor, campo del CMS o regla de borde de CDN — y purga cualquier caché que esté delante de ella.
9. Vuelve a verificar con una búsqueda en vivo de Googlebot que la página ahora no devuelve ningún noindex, luego usa Solicitar indexación para las URLs prioritarias y/o Validar corrección para todo el conjunto afectado.
10. Espera y vuelve a comprobar. El recrawleo y la reindexación no son instantáneos, y no hay un tiempo de respuesta fijo — la propia guía de Google es que el tiempo de revisita depende de la importancia de la página y puede llegar a meses para páginas de menor prioridad, no solo días. Solicitar indexación pide a Google que lo intente antes; no garantiza un plazo. Y si deshabilitaste la página en el paso 7 solo para ahorrar presupuesto de rastreo después de la eliminación, ese es el único caso donde deshabilitar después del noindex es correcto.
Scripts y fragmentos
Revisa los encabezados de respuesta (macOS/Linux, shell) — la única forma de ver un
X-Robots-Tag, ya que nunca aparece en Ver código fuente:
curl -sI -A "Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)" "https://example.com/page/" | grep -i "x-robots-tag\|^HTTP"Revisa los encabezados de respuesta (Windows, PowerShell) — misma comprobación, sin necesidad de curl
:
$r = Invoke-WebRequest -Uri "https://example.com/page/" -UserAgent "Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)" -UseBasicParsing
$r.Headers["X-Robots-Tag"]
$r.StatusCodeEncuentra una etiqueta meta robots en el DOM renderizado (Consola de DevTools) — pega en el panel de Consola en la página en vivo; detecta etiquetas inyectadas por un administrador de etiquetas que Ver código fuente sin procesar no detectaría:
[...document.querySelectorAll('meta[name="robots"], meta[name="googlebot"]')].map(m => m.outerHTML)Marcador — comprueba la etiqueta meta robots de la página actual con un clic. Guárdalo como un marcador con esto como URL, luego haz clic en él en cualquier página que estés auditando:
javascript:(function(){var m=[...document.querySelectorAll('meta[name="robots"],meta[name="googlebot"]')].map(function(x){return x.outerHTML}).join('\n')||'No meta robots tag found in DOM';alert(m);})();Regex — extrae noindex de una exportación HTML masiva. Si estás buscando en un lote
de archivos de código fuente de páginas guardadas o una exportación de rastreo valores de content="...noindex...",
esto captura el atributo content completo para que puedas ver si noindex está
combinado con algo más (como nofollow o noarchive):
<meta\s+name=["'](?:robots|googlebot)["']\s+content=["']([^"']*)["']El grupo de captura (([^"']*)) es la lista completa de directivas: revísalo para ver si contiene noindex específicamente, en lugar de asumir que una coincidencia significa noindex, ya que la misma etiqueta puede incluir noarchive u otras directivas sin él.
Herramientas para esta tarea
Herramientas de este sitio
- Comprobador de índice de Google: obtiene una URL como Googlebot e informa señales observables de indexabilidad: estado, redirecciones, directivas noindex (metaetiqueta y cabecera) y pistas sobre la URL principal, todo en una sola pasada. Explica que no puede ver el estado real del índice de Google (solo Search Console puede hacerlo), pero es la forma más rápida de comprobar la combinación de noindex, URL principal y estado antes de acercarte a GSC.
- Comprobador de cabeceras HTTP: cabeceras de respuesta sin procesar para una URL, incluida
X-Robots-Tag. Úsalo cuando necesites específicamente confirmar un noindex basado en cabecera (o confirmar que ha desaparecido después de una corrección), independientemente de cualquier cosa en el HTML de la página. - Probador de robots.txt: comprueba si una URL determinada está deshabilitada para un agente de usuario determinado. Ejecútalo siempre que estés diagnosticando un noindex que parece no tener efecto: una deshabilitación en la misma URL es la causa clásica.
Herramientas de terceros
- Google Search Console: el informe de indexación de páginas (donde vive este estado), el informe de sitemaps (para la variante “Enviada”) y Inspección de URL → Probar URL en vivo, la única herramienta que te muestra una obtención y veredicto de Googlebot en tiempo real.
- Prueba de resultados enriquecidos: otra obtención en vivo de Googlebot; útil como segunda lectura de la respuesta HTTP y la instantánea renderizada cuando estás persiguiendo un noindex fantasma o servido por CDN.
Pruebas de validación
Ejecuta estas pruebas después de eliminar un noindex que no querías, o después de resolver una contradicción de “URL enviada marcada como ‘noindex’”.
Prueba 1: La cabecera ya no envía X-Robots-Tag: noindex
- Prueba a ejecutar:
curl -Ia la URL (o el Comprobador de cabeceras HTTP) e inspecciona las cabeceras de respuesta. - Resultado esperado: Sin cabecera
X-Robots-Tag, o una sinnoindexen ella. - Interpretación del fallo: La directiva todavía se está sirviendo: revisa la configuración del servidor/CMS de nuevo y limpia cualquier caché de CDN o de borde que pueda estar sirviendo una respuesta obsoleta.
- Ventana de monitoreo: Inmediata: esto es una obtención en vivo, no una señal dependiente del rastreo.
- Disparador de reversión: N/A (esta prueba no cambia nada); vuelve a ejecutarla después de cada cambio de configuración o caché hasta que pase.
Prueba 2: La página renderizada no tiene meta robots noindex
- Prueba a ejecutar: Comprobador de índice de Google o una comprobación de DevTools/Ver código fuente del
<head>renderizado. - Resultado esperado: Sin
<meta name="robots" content="noindex">(o variantegooglebot) en el DOM renderizado. - Interpretación del fallo: Una plantilla, un gestor de etiquetas o una inyección de JS todavía está añadiendo la etiqueta: comprueba el DOM renderizado, no solo el código fuente sin procesar.
- Ventana de monitoreo: Inmediata.
- Disparador de reversión: N/A; vuelve a ejecutarla después de cada cambio de plantilla/configuración.
Prueba 3: La obtención en vivo de Googlebot confirma que la página es indexable
- Prueba a ejecutar: GSC Inspección de URL → Probar URL en vivo.
- Resultado esperado: “La URL está disponible para Google” sin noindex marcado en el resultado de la prueba en vivo.
- Interpretación del fallo: Googlebot está viendo algo que tu navegador no ve: comprueba si hay una directiva condicional por agente de usuario o una regla de CDN que sirva a Google una respuesta diferente de la que tú obtienes.
- Ventana de monitoreo: Inmediata para el resultado de la prueba en vivo en sí.
- Disparador de reversión: Si la prueba en vivo todavía muestra noindex después de un cambio de configuración más una purga de caché, trata la corrección como aún no activa y sigue depurando antes de solicitar la indexación.
Prueba 4: La URL tampoco está bloqueada por robots.txt
- Prueba a ejecutar: Robots.txt Tester contra la misma URL.
- Resultado esperado: Permitido para Googlebot.
- Interpretación del fallo: Una desautorización está ocultando cualquier estado de noindex que exista: Google no puede volver a rastrear para ver tu corrección. Elimina primero la desautorización.
- Ventana de monitoreo: Inmediata.
- Disparador de reversión: N/A; esto debe pasar antes de que las demás pruebas signifiquen algo para una página que quieres indexar.
Prueba 5: El informe de indexación de páginas aclara el estado
- Prueba a ejecutar: Informe de indexación de páginas de GSC, después de hacer clic en Validar corrección en el grupo afectado (o Solicitar indexación para una URL prioritaria individual).
- Resultado esperado: La URL sale de “URL marcada como ‘noindex’” / “URL enviada marcada como ‘noindex’” y pasa a “Indexada” (o tu estado previsto) en el informe.
- Interpretación del fallo: Aún pendiente de recrawleo, o la directiva sigue presente en algún lugar que no has revisado (vuelve a ejecutar las Pruebas 1–3).
- Ventana de monitoreo: Variable, no fija: la validación se ejecuta en segundo plano según el propio calendario de recrawleo de Google. La documentación de Google dice que el momento de la revisión depende de la importancia de la página y puede tardar considerablemente más que unos días, hasta meses para páginas de menor prioridad; no trates una actualización lenta como un fallo por sí sola.
- Disparador de reversión: Si la validación aún no se ha movido después de una espera realmente larga (y las Pruebas 1–4 pasan todas), vuelve a revisar las Pruebas 1–4 en orden en lugar de reenviar la misma corrección.
Cuestionario
Cinco preguntas para comprobar qué se ha retenido realmente de este artículo.
Registro de cambios
Actualizado el 11 ago 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.
Actualizado el 18 jul 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.