Guía de noindex para SEO

Noindex mantiene una página fuera de los resultados de búsqueda, pero solo si Google puede rastrearla. Conoce los dos métodos válidos, la trampa de robots.txt y cómo comprobar que funcionó.

Publicado por primera vez: 23 jun 2026 · Última actualización: 22 ago 2026 · Avanzado
Idiomas

Noindex es la directiva que mantiene una página fuera del índice y, por tanto, de los resultados de búsqueda. Se puede configurar de dos formas válidas: con la metaetiqueta robots (`<meta name="robots" content="noindex">`) o con la cabecera HTTP `X-Robots-Tag: noindex`, la única opción para archivos que no son HTML, como los PDF. El error principal consiste en bloquear la página en robots.txt: Google no puede rastrearla para leer la regla. Para retirar una página, permite el rastreo y sirve noindex. No pongas noindex en robots.txt, porque dejó de admitirse el 1 de septiembre de 2019. Si noindex y canonical conviven, comprueba la intención en lugar de tratarlo como un error automático. La retirada del índice solo ocurre después de un nuevo rastreo.

TL;DR — noindex elimina una página del índice mediante uno de dos métodos válidos: la metaetiqueta de robots (<meta name="robots" content="noindex">) o el encabezado HTTP X-Robots-Tag: noindex (requerido para archivos no HTML como PDFs). El detalle clave: una página bloqueada en robots.txt no puede ser noindexada — Google nunca la rastrea para ver la regla, “el rastreador nunca verá la regla noindex,” y una URL enlazada puede permanecer indexada. Así que para eliminar una página, permite el rastreo y sirve noindex. No pongas noindex en robots.txt (no compatible desde el 1 de septiembre de 2019), revisa noindex con un canonical que apunte a otro lugar como potencialmente conflictivo, y ten en cuenta que la desindexación solo ocurre después de un recrawl — la propia guía de Google dice que una página de baja prioridad puede tardar meses. Según un comentario de Mueller de 2017 (no política documentada), noindex,follow a largo plazo tiende a comportarse como noindex,nofollow una vez que la página desaparece del índice. Verifica en GSC bajo «URL marcada como “noindex”».

Qué es noindex — control de índice, no control de rastreo

noindex es la directiva principal de control de indexación. Google la define en una sola frase: “Do not show this page, media, or resource in search results.” (traducción) «No mostrar esta página, contenido multimedia o recurso en los resultados de búsqueda». Cuando se respeta, el efecto es total: “When Googlebot crawls that page and extracts the tag or header, Google will drop that page entirely from Google Search results, regardless of whether other sites link to it.” (traducción) «Cuando Googlebot rastrea esa página y extrae la etiqueta o la cabecera, Google retira por completo la página de los resultados de la Búsqueda de Google, independientemente de que otros sitios enlacen con ella». Evidence for this claim Google's noindex rule prevents the page, media, or resource from appearing in Google Search results after Google sees the rule. Scope: Google Search; noindex is not an access-control or privacy mechanism. Confidence: high · Verified: Google Search Central: Block Search indexing with noindex

Ten presente una distinción, porque casi todos los errores de noindex provienen de confundirla: noindex controla la indexación; robots.txt controla el rastreo. Son etapas diferentes del proceso. Lo expresé así en mi guía de Ahrefs sobre cómo eliminar URLs: “Crawling is not the same thing as indexing. Even if Google is blocked from crawling pages, if there are any internal or external links to a page they can still index it.” (traducción) «Rastrear no es lo mismo que indexar. Incluso si Google está bloqueado para rastrear páginas, si hay enlaces internos o externos hacia una página, aún puede indexarla.» Esa frase es la razón de que exista el resto de este artículo.

Microsoft le da a la misma directiva una consecuencia adicional específica de Bing: el contenido marcado con noindex también se excluye del entrenamiento del modelo fundacional de Microsoft. El requisito previo sigue siendo importante: Bingbot debe poder rastrear y procesar la directiva a nivel de página. Por lo tanto, un bloqueo en robots.txt más noindex no es prueba de que se haya aplicado la desindexación o la exclusión del entrenamiento.

Evidence for this claim Microsoft says content marked noindex is not included in the Bing index and is not used to train its generative AI foundation models. Scope: Bing and Microsoft foundation-model use; Bingbot must be able to crawl and process the directive before the outcome can be inferred. Confidence: high · Verified: Bing Webmaster Blog: New controls for Bing Chat

Los dos métodos válidos de entrega

Hay exactamente dos, y noindex en robots.txt no es uno de ellos (más sobre eso a continuación).

Método 1: la metaetiqueta robots. Para una página HTML, coloca esto en el <head>:

<meta name="robots" content="noindex">

La instrucción de Google es textual: “To prevent all search engines that support the noindex rule from indexing a page on your site, place the following <meta> tag into the <head> section of your page.” (traducción) «Para evitar que todos los motores de búsqueda que admiten la regla noindex indexen una página de tu sitio, coloca la siguiente etiqueta <meta> en la sección <head> de tu página.» El valor robots se dirige a todos los rastreadores que admiten la regla; cambia a googlebot para dirigirte solo a Google (<meta name="googlebot" content="noindex">).

Método 2: la cabecera HTTP X-Robots-Tag. La misma directiva, enviada en la cabecera de respuesta en lugar del marcado:

X-Robots-Tag: noindex

Esta es la única forma de aplicar noindex a recursos que no son HTML, porque no hay <head> para alojar una metaetiqueta. Google: “A response header can be used for non-HTML resources, such as PDFs, video files, and image files.” (traducción) «Se puede usar una cabecera de respuesta para recursos que no son HTML, como PDF, archivos de video y archivos de imagen.» Y de la especificación de robots: puedes usar X-Robots-Tag “for non-HTML files like image files where the usage of robots meta tags in HTML is not possible.” (traducción) «para archivos que no son HTML, como archivos de imagen, donde no es posible usar etiquetas meta de robots en HTML.» Evidence for this claim Google supports noindex in an HTML robots meta tag or an X-Robots-Tag HTTP response header. Scope: Google Search delivery methods; the HTTP header is applicable to non-HTML resources as well as HTML. Confidence: high · Verified: Google Search Central: Robots meta tag and X-Robots-Tag specifications

Una nota sobre la ubicación: coloca la metaetiqueta en el <head> — ese es el lugar estándar y más seguro, y es lo que muestra el tutorial de Google. La página de especificaciones de Google sí dice que “doesn’t enforce placement of meta robots in the HTML head and will respect robots meta tags in the body section of an HTML document as well,” (traducción) «no exige la ubicación de meta robots en el head de HTML y también respetará las metaetiquetas robots en la sección del cuerpo de un documento HTML», pero no confíes en eso como método principal; una etiqueta <meta> extraviada que algún CMS inyecta en el <body> puede aplicar noindex a una página por accidente, igual que una que pretendías añadir al <head>.

Como la cabecera se configura a nivel del servidor, varía según la pila. Dos ejemplos comunes para aplicar noindex a todos los PDF de un sitio:

Apache (.htaccess o vhost):

<FilesMatch "\.pdf$">
  Header set X-Robots-Tag "noindex"
</FilesMatch>

Nginx (bloque server/location):

location ~* \.pdf$ {
  add_header X-Robots-Tag "noindex";
}

El error número 1: noindex + un bloqueo en robots.txt

Noindex is crawl-then-obey: keep the URL fetchable long enough for the directive to be processed.

The same page contains a meta robots noindex directive. With crawling allowed, Google can fetch the page, see noindex, and remove the URL after processing. With crawling blocked in robots.txt, Google cannot see noindex and the linked URL may remain in results.

Este es el modo de fallo que más veo, así que aquí está el mecanismo completo. La etiqueta noindex vive en la página; Google tiene que obtener la página para leerla. Google establece el requisito directamente:

Google explica que, para que la regla noindex sea eficaz, la página o el recurso no debe estar bloqueado por robots.txt y tiene que ser accesible para el rastreador. Si el rastreador no puede obtener la página, nunca verá la regla; aun así, la página puede aparecer en los resultados si otras páginas enlazan con ella. La cita literal y su traducción se conservan en la pestaña Citas de la fuente.

Dicho aún más directamente: “We have to crawl your page in order to see <meta> tags and HTTP headers.” (traducción) «Tenemos que rastrear tu página para ver las etiquetas <meta> y las cabeceras HTTP.» Sin rastreo, no hay regla.

robots.txt es la causa más habitual de que una página deje de ser rastreable, pero la redacción de Google abarca más situaciones. La frase “the crawler can’t access the page,” (traducción) «el rastreador no puede acceder a la página» incluye errores reiterados del servidor (5xx), tiempos de espera y una barrera de autenticación no intencionada. Cualquiera de estos problemas hace que noindex falle en silencio, igual que un bloqueo en robots.txt.

Así que el instinto de “bloquearlo en robots.txt y ponerle noindex, por si acaso” es exactamente al revés: el bloqueo impide el rastreo, el rastreo es lo que revela el noindex, y la página puede permanecer en el índice indefinidamente (a menudo como una URL sin descripción). En Google Search Console esto aparece como el estado “Indexada, aunque bloqueada por robots.txt” — una página que bloqueaste pero que se indexó de todos modos porque algo enlaza a ella.

La solución: desbloquea la página en robots.txt, mantén noindex en ella y deja que Google vuelva a rastrearla. Solo después de que la página haya desaparecido del índice — si entonces quieres ahorrarte el rastreo por completo — es seguro añadir un disallow.

Ejemplo de despliegue real: el sitio de staging que no desaparecía

Un rediseño se lanza desde staging.example.com. Las plantillas de staging ya contienen noindex, pero la lista de verificación del despliegue también añade:

User-agent: *
Disallow: /

Eso parece dos capas de protección. En realidad es una trampa si Google ya descubrió las URLs de staging a través de un enlace de QA compartido, un sitemap antiguo, un ticket público o un enlace en contenido de producción copiado. El disallow impide el siguiente rastreo, por lo que Google no puede confirmar el noindex; el nombre de host puede permanecer como resultados débiles, solo con URL.

La secuencia de limpieza es: elimina el disallow, mantén noindex en cada respuesta de staging, confirma que la respuesta en vivo es rastreable y expone la directiva, solicita un nuevo rastreo para una muestra representativa y monitorea el nombre de host hasta que desaparezca. Luego pon el entorno detrás de autenticación. La autenticación es el control de privacidad durable; noindex es solo un control del índice de búsqueda.

noindex vs nofollow vs disallow

Tres directivas que la gente confunde constantemente. Operan en diferentes etapas:

  • noindex — control de índice. La página se rastrea, se mantiene fuera de los resultados. La definición de Google: “Do not show this page, media, or resource in search results.” (traducción) «No mostrar esta página, medio o recurso en los resultados de búsqueda.»
  • nofollow — control de enlaces. Google: “Do not follow the links on this page.” (traducción) «No seguir los enlaces de esta página.» No dice nada sobre indexar la página en sí.
  • disallow (robots.txt) — control de rastreo. Detiene la obtención por completo. No es un control de índice: una URL no permitida aún puede indexarse si está enlazada.

También existe none, que Google documenta como “Equivalent to noindex, nofollow.” (traducción) «Equivale a aplicar ambas directivas». Cuando las reglas de robots entran en conflicto, la especificación es clara: “In the case of conflicting robots rules, the more restrictive rule applies.” (traducción) «Cuando existen reglas de robots contradictorias, se aplica la más restrictiva». La tabla completa está en la pestaña Cheat Sheets.

Trata noindex con rel=canonical como una verificación de intención

Colocar noindex y rel="canonical" en la misma página no es automáticamente incorrecto, pero sí crea una configuración que conviene revisar con cuidado. Antes de tratarla como un error, determina qué resultado se pretende y comprueba que las dos señales respondan a esa intención: una pide consolidar señales y la otra excluir esta URL. Para elegir entre duplicados, usa la etiqueta rel="canonical". Google desaconseja expresamente emplear noindex para impedir la selección de una página preferida dentro de un mismo sitio, porque eso bloquearía por completo la página en la Búsqueda. El texto literal, acompañado de su versión española, se conserva en la pestaña Citas de la fuente. La advertencia se refiere específicamente a usar noindex para elegir qué duplicado será el preferido dentro de tu propio sitio; no afirma que ambas declaraciones sean técnicamente incompatibles en todos los casos. Una página que realmente estés retirando aún puede incluir una referencia a sí misma. Si esa referencia apunta a una URL diferente, revisa el caso con especial atención y confirma que tanto la exclusión como la consolidación sean intencionadas. Consolida duplicados con rel="canonical" y usa noindex solo cuando de verdad quieras retirar esta página de los resultados.

noindex,follow vs noindex,nofollow — la decadencia lenta

Un patrón habitual es noindex,follow: mantener la página fuera de los resultados y, a la vez, seguir sus enlaces para que la autoridad pueda circular, algo útil durante una migración o mientras una página está temporalmente retirada. La documentación oficial actual de Google no afirma que esta combinación se degrade de forma automática; permite combinar noindex con otras reglas, incluida la configuración deliberada de noindex,nofollow desde el primer día. La idea de que «se desvanece con el tiempo» procede de un encuentro para webmasters de 2017, en el que John Mueller explicó que un noindex prolongado tiende a tratarse en la práctica como noindex,nofollow: cuando Google concluye que la página no pertenece a la búsqueda y deja de procesarla, también deja de seguir sus enlaces. Es una observación profesional basada en la transcripción de un vídeo, no una política documentada de Google; tómala como orientación, no como garantía. La conclusión práctica se mantiene: noindex,follow sirve como estado transitorio, pero no como estrategia permanente para conservar autoridad. Corrige los enlaces subyacentes o retira la página.

¿Cuánto tarda noindex?

No es instantáneo. noindex solo se aplica después de que Google vuelve a rastrear y reprocesa la página — hasta entonces, la página puede permanecer indexada aunque la etiqueta esté activa. Google no se compromete a un plazo fijo, y su propia guía se inclina hacia “podría tardar un tiempo”, no “en cualquier momento”: “Depending on the importance of the page on the internet, it may take months for Googlebot to revisit a page.” (traducción) «Dependiendo de la importancia de la página en internet, Googlebot puede tardar meses en volver a visitar una página.» Una página de alto tráfico y con muchos enlaces podría volver a rastrearse en días; una de bajo valor y con pocos enlaces puede permanecer durante meses. Si necesitas que una página salga de los resultados urgentemente, la herramienta Removals de GSC es un paliativo (oculta la URL temporalmente mientras el noindex permanente hace su trabajo más lento). Para páginas realmente eliminadas, un 404/410 también las elimina: como escribí en mi guía de eliminación, “If you remove the page and serve either a 404 (not found) or 410 (gone) status code, then the page will be removed from the index shortly after the page is re-crawled.” (traducción) «Si eliminas la página y sirves un código de estado 404 (no encontrado) o 410 (eliminado), la página se eliminará del índice poco después de que se vuelva a rastrear.» El mismo tema en todas partes — ocurre en el re-rastreo.

noindex en robots.txt está obsoleto (desde el 1 de septiembre de 2019)

Todavía verás a gente sugerir una línea Noindex: en robots.txt. No lo hagas. Nunca fue una regla oficialmente compatible, y Google retiró incluso su manejo no oficial hace años. Del anuncio de Search Central de julio de 2019: “Since these rules were never documented by Google, naturally, their usage in relation to Googlebot is very low.” (traducción) «Dado que estas reglas nunca fueron documentadas por Google, naturalmente, su uso en relación con Googlebot es muy bajo.» Y la fecha: “we’re retiring all code that handles unsupported and unpublished rules (such as noindex) on September 1, 2019.” (traducción) «estamos retirando todo el código que maneja reglas no compatibles y no publicadas (como noindex) el 1 de septiembre de 2019.»

La misma publicación nombró las alternativas compatibles, y noindex a través de la metaetiqueta / cabecera encabezó la lista: noindex in robots meta tags: Supported both in the HTTP response headers and in HTML, the noindex rule is the most effective way to remove URLs from the index when crawling is allowed.” (traducción) «noindex en metaetiquetas robots: Compatible tanto en las cabeceras de respuesta HTTP como en HTML, la regla noindex es la forma más efectiva de eliminar URLs del índice cuando el rastreo está permitido.» (También se enumeran: códigos de estado 404/410, protección con contraseña, disallow de robots.txt para la prevención del rastreo, y la herramienta de eliminación de Search Console.)

Cómo verificar noindex en Google Search Console

Dos comprobaciones:

  • URL Inspection (Inspección de URLs). Inspecciona la URL y después selecciona Test live URL (traducción) «Probar URL publicada». La herramienta indica si la página puede indexarse y si Google detecta una directiva noindex; es la forma más rápida de confirmar que la etiqueta se lee en la respuesta actual.
  • Informe de Indexación de páginas. Las páginas con noindex aparecen con el estado “URL marked ‘noindex’” (traducción) «URL marcada con noindex» en la sección Not indexed (traducción) «No indexadas». El texto de ayuda de Google dice: “When Google tried to index the page it encountered a ‘noindex’ directive and therefore did not index it.” (traducción) «Cuando Google intentó indexar la página, encontró una directiva noindex y, por tanto, no la indexó». Si querías que esa página estuviera indexada, ese es el problema: elimina la directiva.

Una nota terminológica para quien consulte documentación antigua: el informe Coverage anterior llamaba a este estado “Excluded by ‘noindex’ tag” (traducción) «Excluida por la etiqueta noindex». El informe actual de Indexación de páginas usa “URL marked ‘noindex’” (traducción) «URL marcada con noindex». Se trata del mismo estado con una etiqueta más reciente.

Lo que noindex no garantiza

Estas son algunas ventajas que a menudo se atribuyen a noindex, pero que la directiva no ofrece:

  • Ahorro de presupuesto de rastreo. Google todavía tiene que obtener la página para ver la etiqueta — noindex por sí solo no reduce el rastreo. Si también quieres eso, añade disallow en robots.txt, pero solo después de que la página ya haya salido del índice (ver el error anterior para saber por qué hacerlo de entrada resulta contraproducente).
  • Eliminación instantánea. Cubierto arriba — ocurre en el re-rastreo, sin un cronograma fijo, y el propio Google dice que una página de baja prioridad puede tardar meses.
  • Consolidación de duplicados. Para eso está rel="canonical"; noindex solo elimina la página de la Búsqueda, no fusiona señales hacia otra URL.
  • Confidencialidad. La página sigue siendo solicitable públicamente por cualquiera que tenga la URL. Si algo realmente necesita ser privado, eso es un problema de autenticación, no un problema de directiva de búsqueda.
  • Recuperación de posiciones si lo reviertes. Quitar noindex no restaura las posiciones antiguas de una página — Google tiene que re-rastrear, re-evaluar y efectivamente volver a ganar su posición desde cero.
  • Mismo momento en todos los motores de búsqueda. Bing y otros motores ejecutan sus propios cronogramas de rastreo y re-rastreo independientemente de los de Google.
  • Exclusión de todo uso no relacionado con la búsqueda de tu contenido. noindex bloquea una página de la Búsqueda de Google en su totalidad — incluidas las funciones de IA de la propia Búsqueda (AI Overviews y similares se basan en páginas que están indexadas y son elegibles para mostrarse, por lo que una página con noindex también queda fuera de esas). Lo que no hace es controlar el ajuste separado de Google-Extended, que determina si tu contenido puede usarse para entrenar o fundamentar los modelos de IA generativa de Google fuera de la Búsqueda. Son dos controles diferentes para dos trabajos diferentes.

Dónde encaja noindex con todo lo demás

noindex es la herramienta adecuada cuando una página está en el índice pero no debería estarlo: resuelve una forma de inflación del índice causada por páginas con poco contenido, páginas utilitarias o duplicados aproximados sin valor para la búsqueda. Está estrechamente relacionado con la metaetiqueta robots y la cabecera X-Robots-Tag, que son sus dos métodos de entrega; con robots.txt y su directiva disallow, que controlan el rastreo y suelen confundirse con noindex; con la etiqueta canonical, que sirve para consolidar duplicados; y con las etapas generales de rastreo e indexación. Cuando distingues rastreo de indexación, noindex deja de ser misterioso: permite el rastreo, sirve la etiqueta y espera al siguiente rastreo.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.