Etiqueta Meta Robots
La etiqueta meta robots controla cómo se indexa y se sirve una página: cada directiva, la regla de rastrear y luego obedecer, la resolución de conflictos y la etiqueta meta frente a X-Robots-Tag.
Idiomas
1 señal de evidencia en esta página
- Herramienta activa relacionadaHTTP Header Checker
La etiqueta meta robots — <meta name="robots" content="noindex"> en el <head> — indica a los motores de búsqueda cómo indexar y servir una sola página. La regla que rompe todo: es rastrear y luego obedecer, por lo que una página bloqueada en robots.txt nunca se obtiene y su noindex nunca se ve. Sin etiqueta, el valor predeterminado es index, follow. Las reglas conflictivas se resuelven a la más restrictiva; para una etiqueta nombrada googlebot frente a la etiqueta genérica robots, Googlebot toma la suma de las reglas negativas. La etiqueta es solo HTML: use el encabezado X-Robots-Tag para PDF, imágenes y otros no HTML.
TL;DR — La etiqueta meta robots es una línea de HTML que pones en el
<head>de una página para decirle a los motores de búsqueda cómo manejar esa página en particular — la mayoría de las veces<meta name="robots" content="noindex">para mantenerla fuera de la búsqueda. El detalle que confunde a todos: Google tiene que poder rastrear la página para leer la etiqueta. Si también bloqueas la página enrobots.txt, Google nunca ve la etiqueta, y la página puede permanecer en la búsqueda. Sin etiqueta alguna, el valor predeterminado es “indexarla y seguir los enlaces.”
Qué es la etiqueta meta robots
La etiqueta meta robots es un pequeño elemento HTML que se encuentra en el <head> de una página:
<meta name="robots" content="noindex">Le dice a los motores de búsqueda cómo tratar esta página específica — si mostrarla
en los resultados, si seguir los enlaces en ella, si mostrar un fragmento, y así
sucesivamente. La parte name="robots" significa “todos los motores de búsqueda que leen esta etiqueta.” Puedes
cambiar el nombre de un rastreador, como name="googlebot", para hablar solo con un motor.
Si no hay una etiqueta meta robots en una página, el valor predeterminado es index, follow — mostrarla
en la búsqueda y seguir sus enlaces. Así que solo necesitas la etiqueta cuando quieres
cambiar ese valor predeterminado. Evidence for this claim For Google, the default robots meta behavior is index, follow when no restrictive rule is present. Scope: Google-supported robots meta rules; other crawlers publish their own support and defaults. Confidence: high · Verified: Google Search Central: Robots meta tag specifications
Lo único que hay que hacer bien: no bloquees la página que intentas noindex
Este es el error que veo con más frecuencia. La gente quiere sacar una página de Google, así que hacen ambas cosas a la vez:
- Agregar
noindexa la página, y - Bloquear la página en
robots.txt.
Ese segundo paso anula el primero. Bloquear una URL en robots.txt le dice a Google
“ni siquiera traigas esta página.” Así que Google nunca la descarga, nunca lee el
noindex, y la página puede permanecer en el índice. La solución es dejar la página
rastreable y dejar que Google lea el noindex. Evidence for this claim Google can read and follow page-level robots rules only when it is allowed to access the page. Scope: Google-supported robots meta and X-Robots-Tag rules; robots.txt blocking can prevent rule discovery. Confidence: high · Verified: Google Search Central: Robots meta tag specifications
Piénsalo como dos trabajos diferentes:
robots.txtcontrola el rastreo — si los bots traen la página o no.- La etiqueta meta robots controla la indexación y el servicio — qué sucede una vez que la página se trae.
No son intercambiables, y no quieres ambas en la misma URL cuando tu objetivo es eliminarla de la búsqueda.
The same page contains a meta robots noindex directive. In the first path, crawling is allowed, so the crawler fetches the page, reads noindex, and can remove the URL from results after processing. In the second path, robots.txt blocks crawling, so the crawler cannot fetch the page or see noindex, and the URL may remain in results. Crawl control and index control are separate jobs.
© Patrick Stox LLC · CC BY 4.0 ·
Las directivas comunes
Algunas que realmente usarás:
noindex— mantén esta página fuera de los resultados de búsqueda.nofollow— no sigas los enlaces en esta página. (Diferente de ponerrel="nofollow"en un solo enlace — esta se aplica a todos los enlaces en la página.)none— abreviatura denoindex, nofollow.nosnippet— no muestres un fragmento de texto para esta página en los resultados.
Puedes combinarlas con una coma: <meta name="robots" content="noindex, nofollow">.
Algunas advertencias honestas
noindexno hace que una página sea privada. La página sigue siendo pública y rastreable — simplemente no se mostrará en la búsqueda. Para privacidad real, usa un inicio de sesión.noindexno ahorra presupuesto de rastreo. Google todavía tiene que traer la página para ver la etiqueta.- Para un PDF o una imagen, no puedes agregar una etiqueta
<meta>— no hay HTML<head>. Para eso está la cabecera HTTP X-Robots-Tag (más sobre eso en la versión Avanzada). - No hay un cronograma fijo para que una página con
noindexsalga de Google. Google dice que puede tomar meses para que una página de menor prioridad se vuelva a rastrear y procesar — no prometas a un cliente “2-4 semanas.”
¿Quieres la lista completa de directivas, cómo resuelve Google las reglas conflictivas, el
caso límite de googlebot frente a robots, y la cabecera X-Robots-Tag en detalle? Cambia
a la pestaña Avanzado.
Ponte a prueba: directivas meta robots
Elige el control según el resultado
Which robots control should I use?
Controles de robots que fallan en su función prevista
- Combinar
noindexcon un bloqueo en robots.txt. El bloqueo impide que el rastreador vea la directiva de eliminación. - Usar
disallowcomo garantía de desindexación. Detiene la obtención, pero una URL enlazada aún puede indexarse sin contenido de página. - Asumir que una metaetiqueta robots colocada en el cuerpo se ignora silenciosamente. Google dice que
respetará una metaetiqueta robots en el cuerpo, por lo que una plantilla que la inyecta allí
sigue funcionando para Google — pero es mejor colocarla en
<head>de todos modos, ya que es la única ubicación que otros rastreadores y validadores tienen garantizado esperar. - Usar un token de nombre de rastreador que Google no lee (p. ej.,
name="bingbot") y asumir que también limita la regla para Google. Google reconoce sologooglebotygooglebot-news; cualquier otro valor de nombre es ignorado por Google por completo. - Usar una metaetiqueta HTML para un PDF. Sirve
X-Robots-Tagen la respuesta HTTP para archivos que no son HTML. - Tratar
nofollowcomonoindex. El manejo de enlaces no elimina la página actual de los resultados. - Publicar etiquetas genéricas y específicas de rastreador sin resolver la suma. Audita
cada directiva
robots,googleboty de cabecera juntas; la regla restrictiva puede sobrevivir en una segunda ubicación. - Usar reglas de robots para el secreto. Cualquiera puede solicitar una URL pública o leer
robots.txt; el contenido confidencial necesita autenticación.
Implementar de forma segura la exclusión de los resultados
- Confirmado que la eliminación de la búsqueda —no la reducción del rastreo, la consolidación de la dirección principal o el control de acceso— es el resultado previsto.
- Usado
<meta name="robots" content="noindex">para páginas o una cabecera de respuestaX-Robots-Tag: noindexpara otros tipos de recurso. - Mantenida la dirección rastreable y accesible para el rastreador objetivo.
- Eliminadas las directivas contradictorias de plantilla, gestor de contenidos, red de distribución y específicas de rastreador.
- Comprobada la cabecera renderizada y la respuesta en vivo, no solo la plantilla fuente.
- Probadas tanto la dirección principal como variantes significativas o redirecciones.
- Registrado el conjunto de direcciones afectadas y el momento de implementación para comparaciones posteriores.
- Verificada la regla con la herramienta de inspección y supervisado el informe de Indexación de páginas después del nuevo rastreo.
- Usada autenticación en su lugar si el contenido debe ser privado.
Inspeccionar meta, cabeceras y acceso de rastreo
Reemplaza la URL en esta auditoría de shell:
url="https://example.com/page/"
curl -sSI "$url" | grep -iE '^(HTTP/|x-robots-tag:|location:)'
curl -sS "$url" | grep -oiE '<meta[^>]+name=["'"'](robots|googlebot)["'"'][^>]*>'
curl -sS "https://example.com/robots.txt"En la consola de DevTools, inventaría cada etiqueta robots analizada en lugar de detenerte en la primera coincidencia:
console.table([...document.querySelectorAll('meta[name]')]
.filter((meta) => /^(robots|googlebot|bingbot)$/i.test(meta.name))
.map((meta) => ({ crawler: meta.name, content: meta.content })));Las cabeceras no son visibles en el DOM, así que compara el resultado de la consola con la respuesta real. También sigue las redirecciones: una directiva en una respuesta intermedia no prueba que el destino sirva la misma regla.
Probar cada capa por separado
- HTTP Header Checker — inspecciona el estado, las redirecciones
y cada cabecera
X-Robots-Tagen vivo, incluso para PDFs. - Robots.txt Tester — comprueba si el rastreador objetivo tiene permitido obtener la URL y, por lo tanto, puede descubrir una directiva de robots.
Usa ambos al diagnosticar una URL indexada obstinada. Una respuesta noindex correcta no es accionable si robots.txt impide la obtención, y un rastreo permitido no prueba que la página realmente sirva noindex.
Probar que la directiva funciona después de la implementación
Prueba 1 — Entrega en vivo
- Hipótesis: Cada URL prevista sirve una regla
noindexefectiva. - Método: Muestrea el conjunto de URLs, sigue las redirecciones e inspecciona el meta renderizado más las cabeceras de respuesta.
- Condición de aprobación: La respuesta final es rastreable y expone
noindexal rastreador previsto sin ninguna ruta de entrega conflictiva. - Condición de fallo: Una redirección, cabecera de CDN o etiqueta específica de rastreador la cambia.
- Acción siguiente: Corrige la capa responsable y repite la misma muestra.
Prueba 2 — Procesamiento del motor de búsqueda
- Hipótesis: Google puede rastrear la página y ha procesado la regla de eliminación.
- Método: Ejecuta la prueba en vivo de URL Inspection y luego monitorea el informe de Page Indexing después del recrawl.
- Condición de aprobación: La prueba en vivo detecta noindex y la URL deja de estar indexada por ese motivo.
- Condición de fallo: La URL está bloqueada, la directiva está ausente o el estado anterior del índice persiste sin un nuevo rastreo.
- Acción siguiente: Restaura el acceso de rastreo o solicita un recrawl; no agregues un disallow.
Mide la intención, no un punto de referencia universal
Cobertura de noindex prevista
URLs serving the intended noindex ÷ URLs in the approved noindex set
Construye el denominador a partir de tu propio inventario de eliminación y luego compara los rastreos antes y después de la implementación. El objetivo es la cobertura completa de ese conjunto aprobado, no un porcentaje de la industria.
Conflictos no previstos de control de indexación
Registra los recuentos de URLs con noindex previsto que aún están indexadas, bloqueadas por robots.txt o que sirven reglas contradictorias de meta/encabezado. Segmenta por plantilla, regla de CDN y tipo de archivo para que un fallo de implementación no se oculte dentro de un total de todo el sitio.
Usa el informe de Page Indexing de Google Search Console y URL Inspection como evidencia de procesamiento, reconociendo que la desindexación depende del recrawl. Conserva el recuento anterior al cambio y la fecha de implementación; de lo contrario, un total decreciente no tiene una base fiable.
Evidence for this claim Google can read and follow page-level robots rules only when it is allowed to access the page. Scope: Google-supported robots meta and X-Robots-Tag rules; robots.txt blocking can prevent rule discovery. Confidence: high · Verified: Google Search Central: Robots meta tag specificationsTL;DR —
<meta name="robots" content="…">en el<head>controla cómo se indexa y sirve una sola página; sin etiqueta, el valor predeterminado esindex, follow. Es rastrear y luego obedecer: “estos ajustes solo se pueden leer y seguir si se permite a los rastreadores acceder a las páginas” — por lo que una URL bloqueada porrobots.txtnunca se obtiene y sunoindexnunca se ve (tengo datos de primera mano sobre el lado opuesto de esto). Las reglas en conflicto se resuelven a la más restrictiva; entre una etiquetagoogleboty la etiqueta genéricarobots, Googlebot toma la suma de las reglas negativas. La etiqueta es solo HTML — usa el encabezado X-Robots-Tag para contenido no HTML y a escala. Google solo lee dos tokens con nombre de rastreador —googlebotygooglebot-news— e ignora cualquier otro valor, incluidos los tokens de otros motores comobingbot.
Qué es, dónde va y el valor predeterminado
La metaetiqueta robots te permite, en palabras de Google, “usar un enfoque granular y específico
por página para controlar cómo se debe indexar y servir una página HTML individual
a los usuarios en los resultados de búsqueda de Google.” El lugar convencional y portátil para ella es
el <head>:
<meta name="robots" content="noindex, nofollow">La colocación en el <head> es la convención de autoría que todos los motores esperan, pero Google es
claro en que no es un requisito estricto específicamente para Google Search: “Google Search
no exige la colocación de meta robots en el head HTML y respetará las metaetiquetas robots
en la sección del cuerpo de un documento HTML también.” Trata eso como tolerancia
para Google, no como consejo portátil — aún así, escríbela en el <head> para que
cada rastreador y validador que espera una colocación estándar la lea correctamente.
El atributo name es la audiencia, y aquí es donde la mayoría de las guías exageran el soporte
de Google. name="robots" se dirige a todos los rastreadores que leen la etiqueta.
Más allá de eso, Google admite exactamente dos tokens con nombre de rastreador e ignora cualquier otro
valor: “Google admite dos tokens de agente de usuario en la etiqueta meta de robots;
otros valores se ignoran: googlebot para todos los resultados de texto y googlebot-news
para resultados de noticias.” Una etiqueta con name="bingbot" no es un control documentado de
Google — Bing lee su propio token en sus propios términos, pero Google omite cualquier valor de name
que no reconoce. Tanto los atributos name como content son
insensibles a mayúsculas para Google, y también lo son los nombres y valores del encabezado X-Robots-Tag.
Cuando no hay ninguna metaetiqueta robots presente, el valor predeterminado es
index, follow (la regla all, que Google señala “has no effect if explicitly listed” (traducción) «no tiene efecto si se lista explícitamente»). Evidence for this claim For Google, the default robots meta behavior is index, follow when no restrictive rule is present. Scope: Google-supported robots meta rules; other crawlers publish their own support and defaults. Confidence: high · Verified: Google Search Central: Robots meta tag specifications Solo necesitas la etiqueta para cambiar ese valor predeterminado.
Puedes combinar reglas de dos maneras: separadas por comas en una sola etiqueta (noindex, nofollow) o como múltiples etiquetas <meta>. Google: puedes “crear una instrucción de múltiples reglas combinando las reglas de la etiqueta meta de robots con comas o usando múltiples etiquetas meta.”
La regla que lo rompe todo: Google debe rastrear la página para ver la etiqueta
Este es el artículo completo. La etiqueta meta de robots es rastrear y luego obedecer. Google tiene que obtener la página para leer la etiqueta, por lo que cualquier cosa que detenga la obtención detiene la aplicación de la etiqueta. Directamente de la especificación:
Evidence for this claim Google can read and follow page-level robots rules only when it is allowed to access the page. Scope: Google-supported robots meta and X-Robots-Tag rules; robots.txt blocking can prevent rule discovery. Confidence: high · Verified: Google Search Central: Robots meta tag specifications“Ten en cuenta que estos ajustes solo se pueden leer y seguir si los rastreadores pueden acceder a las páginas que incluyen estos ajustes.”
Y la consecuencia, explicada:
“Si una página está deshabilitada para el rastreo mediante el archivo robots.txt, cualquier información sobre reglas de indexación o servicio no se encontrará y, por lo tanto, se ignorará.”
Así que el error clásico — Disallow en robots.txt más noindex en la misma URL — anula silenciosamente el noindex. Google nunca rastrea la página, nunca ve la etiqueta, y la URL puede permanecer en el índice (a menudo como un resultado desnudo, sin fragmento, si algo enlaza a ella). El documento complementario de Google sobre bloquear la indexación dice lo mismo en un lenguaje más simple: “must not be blocked by a robots.txt file… If the page is blocked by a robots.txt file or the crawler can’t access the page, the crawler will never see the noindex rule, and the page can still appear in search results.” (traducción) «No debe estar bloqueada por un archivo robots.txt… Si la página está bloqueada por un archivo robots.txt o el rastreador no puede acceder a ella, nunca verá la regla noindex y la página aún puede aparecer en los resultados».
He observado el lado opuesto de este mecanismo con datos reales. En mi experimento La historia de bloquear 2 páginas de alto ranking con Robots.txt, bloqueé deliberadamente dos de nuestras páginas con ranking en robots.txt. Debido a que Google ya no podía rastrearlas, no podía actualizar nada sobre ellas — y las páginas en su mayoría mantuvieron su ranking: “Perdimos una posición aquí o allá y todos los fragmentos destacados de las páginas.” Mi conclusión: “Bloquear accidentalmente páginas (que Google ya clasifica) para que no sean rastreadas usando robots.txt probablemente no tendrá mucho impacto en tus rankings, y es probable que sigan apareciendo en los resultados de búsqueda.” Esa es la misma moneda que el problema de noindex — una URL bloqueada está congelada. Bloquear ≠ eliminar. Si realmente quieres que una página desaparezca, necesitas un noindex rastreable, que es el punto principal de esta etiqueta.
Esta es la línea que he trazado públicamente sobre dónde pertenece cada herramienta. Preguntado si Google debería agregar soporte para noindex en robots.txt, dije: “Google fue claro en que quieren robots.txt solo para el control del rastreo.” Rastrear es el trabajo de robots.txt; indexar es el trabajo de la etiqueta meta (o del encabezado). No se superponen, y la directiva noindex en robots.txt nunca fue oficialmente compatible — Google dejó de analizarla el 1 de septiembre de 2019.
Cada directiva meta de robots (la referencia)
Los valores compatibles de Google, con las descripciones textuales de la especificación:
Indexación
all— “No hay restricciones para indexar o servir. Esta regla es el valor predeterminado y no tiene efecto si se lista explícitamente.”noindex— “No mostrar esta página, medio o recurso en los resultados de búsqueda.”none— “Equivalente anoindex, nofollow.”indexifembedded— “Google puede indexar el contenido de una página si está incrustado en otra página mediante iframes o etiquetas HTML similares, a pesar de una reglanoindex.” (La única directiva que anula unnoindex, para contenido incrustado.)
Enlaces
nofollow— “No seguir los enlaces en esta página.” Esto es a nivel de página — un alcance diferente de unrel="nofollow"por enlace, que se aplica a un solo enlace.
Servicio y fragmentos
nosnippet— “Do not show a text snippet or video preview in the search results for this page.” (traducción) «No muestres un fragmento de texto ni una vista previa de video en los resultados de búsqueda de esta página». Este ámbito es más amplio que el fragmento de texto clásico: Google dice que “applies to all forms of search results (at Google: web search, Google Images, Discover, AI Overviews, AI Mode) and will also prevent the content from being used as a direct input for AI Overviews and AI Mode.” (traducción) «se aplica a todas las formas de resultados de búsqueda (en Google: búsqueda web, Google Images, Discover, AI Overviews, AI Mode) y también evitará que el contenido se utilice como entrada directa para AI Overviews y AI Mode».max-snippet:[number]— “Use a maximum of [number] characters as a textual snippet for this search result.” (traducción) «Usa un máximo de [número] caracteres como fragmento de texto para este resultado de búsqueda». Tiene el mismo ámbito ampliado quenosnippet: “applies to all forms of search results (such as Google web search, Google Images, Discover, Assistant, AI Overviews, AI Mode) and will also limit how much of the content may be used as a direct input for AI Overviews and AI Mode.” (traducción) «se aplica a todas las formas de resultados de búsqueda (como la búsqueda web de Google, Google Images, Discover, Assistant, AI Overviews, AI Mode) y también limitará cuánto del contenido puede utilizarse como entrada directa para AI Overviews y AI Mode». Eso es un control de elegibilidad de entrada directa para las funciones de búsqueda de IA propias de Google — no es una exclusión general del entrenamiento de IA. Mantener tu contenido fuera del entrenamiento de modelos (p. ej., Google-Extended) o fuera del control separado a nivel de propiedad de IA generativa en Search Console son sistemas diferentes con ámbitos diferentes; no tratesnosnippet/max-snippetcomo si cubrieran cualquiera de ellos.max-image-preview:[setting]— “Set the maximum size of an image preview for this page in search results.” (traducción) «Establece el tamaño máximo de la vista previa de imagen para esta página en los resultados de búsqueda». Configuraciones:none,standardolarge(“A larger image preview, up to the width of the viewport, may be shown.” (traducción) «Se puede mostrar una vista previa de imagen más grande, hasta el ancho de la ventana gráfica»).max-video-preview:[number]— “Use a maximum of [number] seconds as a video snippet for videos on this page in search results.” (traducción) «Usa un máximo de [número] segundos como fragmento de video para los videos de esta página en los resultados de búsqueda».notranslate— “Don’t offer translation of this page in search results.” (traducción) «No ofrezcas traducción de esta página en los resultados de búsqueda».noimageindex— “Do not index images on this page.” (traducción) «No indexes imágenes en esta página».unavailable_after:[date/time]— “Do not show this page in search results after the specified date/time.” (traducción) «No muestres esta página en los resultados de búsqueda después de la fecha/hora especificada».
Históricos — controles de Google que ya no están activos
Algunas directivas que aún circulan en guías antiguas son aquellas que Google dice que ya no utiliza. No las añadas esperando que hagan algo:
noarchive— “Thenoarchiverule is no longer used by Google Search to control whether a cached link is shown in search results, as the cached link feature no longer exists.” (traducción) «La reglanoarchiveya no la utiliza Google Search para controlar si se muestra un enlace en caché en los resultados de búsqueda, ya que la función de enlace en caché ya no existe».nocache(un sinónimo que algunos motores usaban paranoarchive) — “Thenocacherule isn’t used by Google Search.” (traducción) «La reglanocacheno la utiliza Google Search».nositelinkssearchbox— “Thenositelinkssearchboxrule is no longer used by Google Search to control whether the sitelink search box is shown for a given page, as the feature no longer exists.” (traducción) «La reglanositelinkssearchboxya no la utiliza Google Search para controlar si se muestra el cuadro de búsqueda de enlaces de sitio para una página determinada, ya que la función ya no existe».
A nivel de párrafo (no en la metaetiqueta)
Hay un control a nivel de subpágina: el atributo data-nosnippet. Google: puedes “designate textual parts of an HTML page not to be used as a snippet… on
span, div, and section elements.” (traducción) «designar partes textuales de una página HTML para que no se utilicen como fragmento… en elementos span, div y section». Todo lo que está en la metaetiqueta es para toda la página; nosnippet / data-nosnippet es cómo mantienes un pasaje fuera del fragmento sin tocar el resto.
Combinar directivas y resolver conflictos
Dos reglas rigen lo que sucede cuando las directivas chocan.
1. La regla más restrictiva gana. “In the case of conflicting robots rules,
the more restrictive rule applies. For example, if a page has both max-snippet:50
and nosnippet rules, the nosnippet rule will apply.” (traducción) «En el caso de reglas de robots en conflicto, se aplica la regla más restrictiva. Por ejemplo, si una página tiene tanto reglas max-snippet:50 como nosnippet, se aplicará la regla nosnippet». nosnippet es más estricto que un límite de 50 caracteres, así que nosnippet es lo que obtienes.
2. googlebot vs robots — la suma de las reglas negativas. Esta es la que la mayoría de las guías se equivocan. Una etiqueta con nombre googlebot no simplemente reemplaza la etiqueta genérica robots — para la superposición, Googlebot toma la unión de las restricciones. Google: “For situations where multiple crawlers are specified
along with different rules, the search engine will use the sum of the negative
rules.” (traducción) «Para situaciones donde se especifican múltiples rastreadores junto con reglas diferentes, el motor de búsqueda usará la suma de las reglas negativas». Su ejemplo trabajado:
<meta name="robots" content="nofollow">
<meta name="googlebot" content="noindex">“The page containing these meta tags will be interpreted as having a noindex, nofollow rule when crawled by Googlebot.” (traducción) «La página que contiene estas metaetiquetas se interpretará como si tuviera una regla noindex, nofollow cuando Googlebot la rastree.» El nofollow de robots más el noindex de googlebot suman noindex, nofollow para Googlebot. (Cuando una etiqueta googlebot y una etiqueta robots establecen la misma directiva de manera diferente, la que lleva el nombre del rastreador es la que se aplica a ese rastreador).
Etiqueta meta robots vs. X-Robots-Tag (la cabecera HTTP)
La metaetiqueta robots es solo HTML: necesita un <head>. Para cualquier cosa que no sea HTML, se usa la X-Robots-Tag, que entrega el mismo vocabulario de reglas en la cabecera de respuesta HTTP. Google: “The X-Robots-Tag can be used as an element of the HTTP header response for a given URL. Any rule that can be used in a robots meta tag can also be specified as an X-Robots-Tag.” (traducción) «La X-Robots-Tag se puede usar como elemento de la respuesta de cabecera HTTP para una URL determinada. Cualquier regla que se pueda usar en una metaetiqueta robots también se puede especificar como X-Robots-Tag.» Y la razón de su existencia: “You can use the X-Robots-Tag for non-HTML files like image files where the usage of robots meta tags in HTML is not possible.” (traducción) «Puedes usar la X-Robots-Tag para archivos que no son HTML, como archivos de imagen, donde no es posible usar metaetiquetas robots en HTML.»
Entonces:
- ¿PDF, imagen u otro formato que no sea HTML? No puedes añadir una etiqueta
<meta>: usa la cabecera, p. ej.,X-Robots-Tag: noindex. - ¿Directorios completos o patrones? La cabecera se configura a nivel de servidor/CDN, por lo que escala a rutas completas en una sola regla de configuración.
- ¿Un solo motor? La cabecera también puede dirigirse a un rastreador:
X-Robots-Tag: googlebot: noindex, nofollow, y se pueden combinar varias cabeceras X-Robots-Tag en una sola respuesta.
Mismas reglas, dos mecanismos de entrega: la metaetiqueta para páginas HTML, la cabecera para todo lo demás y para escalar.
Qué directivas admiten Bing y otros motores
No asumas que el conjunto de directivas es universal: no lo es. Bing admite las reglas básicas de indexación y servicio: noindex, nofollow, noarchive (con nocache como sinónimo) y nosnippet, y respeta la X-Robots-Tag para recursos que no son HTML. Pero Bing no admite la abreviatura none, así que para seguridad entre motores, escribe noindex, nofollow explícitamente en lugar de confiar en none. La familia de control de fragmentos y vistas previas (max-snippet, max-image-preview, max-video-preview), junto con noimageindex, notranslate, indexifembedded y unavailable_after, es efectivamente solo de Google. En caso de duda, escribe las directivas explícitamente y trata los controles max-* como funciones de Google.
Errores comunes (y las soluciones)
Disallow+noindexen la misma URL. Elnoindexnunca se ve. Solución: deja la página rastreable; mantén solo elnoindex.noindexmás unrel=canonicalque apunte a otro lugar. Señales contradictorias: le estás diciendo a Google tanto “descarta esta página” como “consolídala en otra”. Elige una. (Más en canonicalización).- Un
noindexen todo el entorno de staging enviado a producción. Desindexación catastrófica en todo el sitio. Verifica antes del lanzamiento. - Un
noindexinyectado solo mediante JavaScript del lado del cliente. Google tiene que renderizar la página para verlo, y si el HTML renderizado difiere de lo que esperas, el comportamiento también difiere. Prefiere la etiqueta en el HTML sin procesar o la cabecera. (Ver renderizado). - Esperar que Bing respete directivas solo de Google (
none, la familiamax-*). - Esperar que una directiva de robots haga un trabajo que no le corresponde. Una regla
noindexonosnippetno garantiza por sí sola ahorros en el presupuesto de rastreo, confidencialidad, un cambio en el ranking, un comportamiento idéntico entre motores de búsqueda, un plazo de eliminación específico o la exclusión de todas las superficies de IA/búsqueda: cada uno de esos resultados pertenece a un control diferente (autenticación para confidencialidad,robots.txtpara rastreo, la documentación de cada motor para paridad, Search Console o Google-Extended para ámbitos específicos de IA). Google no da un plazo fijo para cuándo una página connoindexdesaparece realmente: depende de la prioridad de recrawleo y “puede llevar meses” para una página de menor importancia.
Para ver dónde encaja esto en el panorama general: robots.txt y crawling son el lado del control de rastreo; noindex e indexing son el lado del control de indexación; y nosnippet / data-nosnippet, max-snippet y max-image-preview son los controles de publicación a los que recurres cuando quieres que una página se indexe pero quieres dar forma a cómo aparece. La X-Robots-Tag es el equivalente en cabecera HTTP de esta misma etiqueta para contenido no HTML.
Resumen de IA
Una versión condensada de la versión avanzada:
- La metaetiqueta robots —
<meta name="robots" content="…">en el<head>— controla cómo se indexa y se publica una única página HTML. Sin etiqueta, el valor predeterminado esindex, follow. - Es rastrear y luego obedecer. Google debe rastrear la página para leer la etiqueta: “these
settings can be read and followed only if crawlers are allowed to access the
pages.” (traducción) «estos ajustes solo se pueden leer y seguir si se permite a los rastreadores acceder a las páginas». Así que una URL bloqueada por robots.txt nunca ve su
noindex— el error clásico. El experimento de páginas bloqueadas de Patrick demuestra el mecanismo: las páginas bloqueadas permanecieron indexadas y en su mayoría mantuvieron su posicionamiento. Bloquear ≠ eliminar. - robots.txt = control de rastreo; la metaetiqueta (o X-Robots-Tag) = control de indexación/publicación.
No son intercambiables.
noindexen robots.txt se eliminó el 1 de septiembre de 2019. - Directivas: indexación (
noindex,none,indexifembedded), enlaces (nofollow, en toda la página), publicación (nosnippet,max-snippet,max-image-preview,max-video-preview,notranslate,noimageindex,unavailable_after), además del atributo a nivel de párrafodata-nosnippet.noarchive,nocacheynositelinkssearchboxson históricos — Google dice que ya no los utiliza. nosnippet/max-snippettambién controlan AI Overviews y AI Mode — Google dice que controlan si el contenido de la página se puede usar como entrada directa para esas funciones, no solo el fragmento de texto clásico. Eso no es una exclusión general del entrenamiento de IA; Google-Extended y el control de propiedad de IA generativa separado de Search son sistemas diferentes.- Los conflictos se resuelven con la opción más restrictiva (
nosnippetgana amax-snippet:50). Entre una etiquetagoogleboty la etiqueta genéricarobots, Googlebot toma la suma de las reglas negativas —robots: nofollow+googlebot: noindex⇒noindex, nofollow. Google solo reconoce los tokens de nombregooglebot/googlebot-news; otros valores (comobingbot) son ignorados por Google. - La metaetiqueta es convencionalmente solo para
<head>(Google también tolera la colocación en el cuerpo, pero eso es específico de Google, no portable); la X-Robots-Tag lleva las mismas reglas en la cabecera HTTP para PDF, imágenes, contenido no HTML y directorios completos. - Entre motores: Bing admite
noindex/nofollow/noarchive(nocache)/nosnippetpero nonone; la familiamax-*es efectivamente solo de Google — escribe las directivas explícitamente. - Sin garantías: una directiva de robots por sí sola no promete ahorro de presupuesto de rastreo,
secreto, un cambio de posicionamiento, paridad entre motores ni un plazo de eliminación
fijo — Google no da un plazo establecido para que
noindexsurta efecto.
Documentación oficial
Documentación de fuentes primarias de los motores de búsqueda.
- Especificaciones de la metaetiqueta robots, data-nosnippet y X-Robots-Tag — la especificación autorizada: cada directiva, reglas de combinación, resolución de conflictos, la unión de
googlebotfrente arobotsy la cabecera X-Robots-Tag. Empieza aquí. - Bloquear la indexación en Search con noindex — cómo funciona
noindex, los dos mecanismos de entrega (metaetiqueta y cabecera) y la dependencia del rastreo en lenguaje sencillo. - Introducción a robots.txt — la contraparte del control de rastreo, para que no confundas las dos funciones.
- Rastreo e indexación — el centro para robots, sitemaps, canonicalización y controles de rastreo.
Bing / Microsoft
- Metaetiquetas y atributos robots compatibles con Bing — directivas compatibles de Bing (confirma la lista exacta en la página en vivo; se renderiza con JavaScript).
Referencia
- MDN —
<meta name="robots">— Referencia de directivas entre motores, incluyendo qué motores usannoarchive/nocache.
Citas de la fuente
Declaraciones públicas de Google. Cada enlace es un enlace profundo que salta al pasaje citado en la página de origen.
Google — qué es la etiqueta y el valor predeterminado
- “The robots
metatag lets you use a granular, page-specific approach to controlling how an individual HTML page should be indexed and served to users in Google Search results.” (traducción) «La etiquetametade robots te permite usar un enfoque granular y específico de página para controlar cómo se debe indexar y mostrar una página HTML individual a los usuarios en los resultados de búsqueda de Google.» — Documentación de Google Search Central. Ir a la cita
Google — la dependencia de rastrear y luego obedecer
- “Keep in mind that these settings can be read and followed only if crawlers are allowed to access the pages that include these settings.” (traducción) «Ten en cuenta que estos ajustes solo se pueden leer y seguir si se permite que los rastreadores accedan a las páginas que incluyen estos ajustes.» Ir a la cita
- “If a page is disallowed from crawling through the robots.txt file, then any information about indexing or serving rules will not be found and will therefore be ignored.” (traducción) «Si una página no está permitida para el rastreo mediante el archivo robots.txt, cualquier información sobre reglas de indexación o de publicación no se encontrará y, por lo tanto, se ignorará.» Ir a la cita
- “For the
noindexrule to be effective, the page or resource must not be blocked by a robots.txt file, and it has to be otherwise accessible to the crawler.” (traducción) «Para que la reglanoindexsea efectiva, la página o el recurso no debe estar bloqueado por un archivo robots.txt, y debe ser accesible de otro modo para el rastreador.» — Google, «Bloquear la indexación con noindex». Ir a la cita
Google — las directivas (descripciones textuales)
- “Do not show this page, media, or resource in search results.” (traducción) «No muestres esta página, medio o recurso en los resultados de búsqueda». —
noindex. Esta es la definición textual de Google para excluir un recurso de los resultados. Ir a la cita - “Equivalent to
noindex, nofollow.” (traducción) «Equivalente anoindex, nofollow». —none. La abreviatura combina ambas restricciones en una sola regla. Ir a la cita - “Do not show a text snippet or video preview in the search results for this page.” (traducción) «No muestres un fragmento de texto ni una vista previa de video en los resultados de búsqueda de esta página». —
nosnippet. La página puede seguir indexada aunque se suprima su vista previa. Ir a la cita - “Google is allowed to index the content of a page if it’s embedded in another page through iframes or similar HTML tags, in spite of a
noindexrule.” (traducción) «Google puede indexar el contenido de una página si está incrustado en otra página mediante iframes o etiquetas HTML similares, a pesar de una reglanoindex». —indexifembedded. Ir a la cita - “A larger image preview, up to the width of the viewport, may be shown.” (traducción) «Se puede mostrar una vista previa de imagen más grande, hasta el ancho de la ventana gráfica». —
max-image-preview:large. Ir a la cita - “Do not index images on this page.” (traducción) «No indexes imágenes en esta página». —
noimageindex. Ir a la cita - “You can designate textual parts of an HTML page not to be used as a snippet.” (traducción) «Puedes designar partes textuales de una página HTML para que no se usen como fragmento». —
data-nosnippet. Ir a la cita
Google — combinar y resolver conflictos
- “You can create a multi-rule instruction by combining robots
metatag rules with commas or by using multiplemetatags.” (traducción) «Puedes crear una instrucción de varias reglas combinando reglas de la etiquetametade robots con comas o usando varias etiquetasmeta.» Ir a la cita - “In the case of conflicting robots rules, the more restrictive rule applies. For example, if a page has both
max-snippet:50andnosnippetrules, thenosnippetrule will apply.” (traducción) «En caso de reglas de robots conflictivas, se aplica la regla más restrictiva. Por ejemplo, si una página tiene tanto las reglasmax-snippet:50comonosnippet, se aplicará la reglanosnippet.» Ir a la cita - “For situations where multiple crawlers are specified along with different rules, the search engine will use the sum of the negative rules.” (traducción) «Para situaciones en las que se especifican varios rastreadores con diferentes reglas, el motor de búsqueda usará la suma de las reglas negativas.» Ir a la cita
Google: ubicación, tokens de rastreador y sensibilidad a mayúsculas
- “Google Search doesn’t enforce placement of meta robots in the HTML head and will respect robots meta tags in the body section of an HTML document as well.” (traducción) «Google Search no exige la ubicación de meta robots en la cabecera HTML y también respetará las metaetiquetas de robots en la sección del cuerpo de un documento HTML.» Ir a la cita
- “Google supports two user agent tokens in the robots
metatag; other values are ignored.” (traducción) «Google admite dos tokens de agente de usuario en la etiquetametade robots; otros valores se ignoran.» Ir a la cita - “Both the
nameand thecontentattributes are case-insensitive.” (traducción) «Tanto los atributosnamecomocontentno distinguen entre mayúsculas y minúsculas.» Ir a la cita
Google: noarchive y otras directivas históricas
- “The
noarchiverule is no longer used by Google Search to control whether a cached link is shown in search results, as the cached link feature no longer exists.” (traducción) «La reglanoarchiveya no la usa Google Search para controlar si se muestra un enlace en caché en los resultados de búsqueda, ya que la función de enlace en caché ya no existe.» Ir a la cita - “The
nocacherule isn’t used by Google Search.” (traducción) «La reglanocacheno la usa Google Search.» Ir a la cita
Google: nosnippet y max-snippet llegan a AI Overviews y AI Mode
- “Google: [nosnippet] applies to all forms of search results (at Google: web search, Google Images, Discover, AI Overviews, AI Mode) and will also prevent the content from being used as a direct input for AI Overviews and AI Mode.” (traducción) «[nosnippet] se aplica a todas las formas de resultados de búsqueda (en Google: búsqueda web, Google Images, Discover, AI Overviews, AI Mode) y también evitará que el contenido se use como entrada directa para AI Overviews y AI Mode.» Ir a la cita
- “Google: [max-snippet] applies to all forms of search results (such as Google web search, Google Images, Discover, Assistant, AI Overviews, AI Mode) and will also limit how much of the content may be used as a direct input for AI Overviews and AI Mode.” (traducción) «[max-snippet] se aplica a todas las formas de resultados de búsqueda (como la búsqueda web de Google, Google Images, Discover, Assistant, AI Overviews, AI Mode) y también limitará cuánto del contenido puede usarse como entrada directa para AI Overviews y AI Mode.» Ir a la cita
Google: sin plazo fijo para que noindex surta efecto
- “If a page is still appearing in results, it’s probably because we haven’t crawled the page since you added the
noindexrule. Depending on the importance of the page on the internet, it may take months for Googlebot to revisit a page.” (traducción) «Si una página sigue apareciendo en los resultados, probablemente sea porque no la hemos rastreado desde que añadiste la reglanoindex. Dependiendo de la importancia de la página en internet, puede llevar meses que Googlebot vuelva a visitarla.» — Google, «Bloquear la indexación con noindex». Ir a la cita
Google — X-Robots-Tag
- “The
X-Robots-Tagcan be used as an element of the HTTP header response for a given URL. Any rule that can be used in a robotsmetatag can also be specified as anX-Robots-Tag.” (traducción) «LaX-Robots-Tagse puede usar como un elemento de la respuesta del encabezado HTTP para una URL determinada. Cualquier regla que se pueda usar en una etiquetametade robots también se puede especificar como unaX-Robots-Tag.» Ir a la cita - “You can use the
X-Robots-Tagfor non-HTML files like image files where the usage of robotsmetatags in HTML is not possible.” (traducción) «Puedes usar laX-Robots-Tagpara archivos que no son HTML, como archivos de imagen, donde no es posible usar etiquetasmetade robots en HTML.» Ir a la cita
Patrick Stox — robots.txt es solo para el control del rastreo
- “Google was clear they want robots.txt for crawl control only. The biggest downside will probably be all the people who accidentally take their entire site out of the index.”
(traducción) «Google dejó claro que quieren robots.txt solo para el control del rastreo. El mayor inconveniente probablemente serán todas las personas que accidentalmente saquen todo su sitio del índice.»
— Patrick Stox, sobre si Google debería añadir
noindexa robots.txt, en Search Engine Land. Ir a la cita
Patrick Stox — bloquear páginas clasificadas con robots.txt (la prueba de rastreo frente a indexación)
- “Accidentally blocking pages (that Google already ranks) from being crawled using robots.txt probably isn’t going to have much impact on your rankings, and they will likely still show in the search results.” (traducción) «Bloquear accidentalmente páginas (que Google ya clasifica) para que no se rastreen con robots.txt probablemente no tendrá mucho impacto en tus clasificaciones, y es probable que sigan apareciendo en los resultados de búsqueda.» Ir a la cita
- “We lost a position here or there and all of the featured snippets for the pages.” (traducción) «Perdimos una posición aquí o allá y todos los fragmentos destacados de las páginas.» Ir a la cita
Cada directiva meta de robots — hoja de referencia
El conjunto completo de valores content compatibles con Google, qué hace cada uno y el valor predeterminado.
| Directiva | Qué hace | ¿Por defecto? |
|---|---|---|
all | Sin restricciones de indexación o publicación: el valor predeterminado implícito | Sí (cuando no hay etiqueta) |
index | Permitir la página en los resultados de búsqueda (el valor predeterminado; rara vez se escribe) | Implícito |
noindex | Mantener esta página/medio/recurso fuera de los resultados de búsqueda | No |
follow | Seguir los enlaces de esta página (el valor predeterminado; rara vez se escribe) | Implícito |
nofollow | No seguir ningún enlace de esta página (en toda la página) | No |
none | Abreviatura de noindex, nofollow (no compatible con Bing) | No |
nosnippet | No mostrar un fragmento de texto ni una vista previa de video; también bloquea la página como entrada directa para AI Overviews/AI Mode | No |
max-snippet:[n] | Limitar el fragmento de texto a [n] caracteres (0 = ninguno, -1 = sin límite); también limita cuánto puede alimentar directamente a AI Overviews/AI Mode | No |
max-image-preview:[setting] | Limitar el tamaño de la vista previa de imagen: none / standard / large | No |
max-video-preview:[n] | Limitar la vista previa de video a [n] segundos (0 = ninguno, -1 = sin límite) | No |
notranslate | No ofrecer una traducción de esta página en los resultados | No |
noimageindex | No indexar las imágenes de esta página | No |
unavailable_after:[date/time] | Eliminar la página de los resultados después de la fecha y hora dadas | No |
indexifembedded | Permitir la indexación de contenido incrustado mediante iframe incluso con noindex | No |
Histórico: Google ya no usa estas:
| Directiva | Estado |
| --- | --- | --- |
| noarchive | Ya no se usa: la función de enlace en caché que controlaba ya no existe |
| nocache | No lo usa Google Search (algunos motores lo trataban como sinónimo de noarchive) |
| nositelinkssearchbox | Ya no se usa: la función de cuadro de búsqueda de enlaces de sitio que controlaba ya no existe |
A nivel de párrafo (un atributo HTML, no un valor de content):
| Atributo | Qué hace | Dónde |
|---|---|---|
data-nosnippet | Mantener un pasaje específico fuera del fragmento | En span, div, section |
La sintaxis
<!-- one tag, comma-separated -->
<meta name="robots" content="noindex, nofollow">
<!-- target one engine -->
<meta name="googlebot" content="noindex">
<!-- the HTTP-header equivalent, for non-HTML / at scale -->
X-Robots-Tag: noindex
X-Robots-Tag: googlebot: noindex, nofollowDatos rápidos
- Sin etiqueta → valor predeterminado
index, follow. none=noindex, nofollow— pero Bing no admitenone; escríbelo completo.max-*,noimageindex,notranslate,indexifembedded,unavailable_afterson efectivamente solo de Google.- La etiqueta es solo HTML; el encabezado
X-Robots-Taglleva las mismas reglas para PDF, imágenes y directorios completos. - Google lee exactamente dos tokens de nombre de rastreador:
googlebotygooglebot-news— e ignora todo lo demás, incluidos los tokens de otros motores comobingbot. - La colocación en la cabecera es la convención portable, pero Google también respeta
específicamente una metaetiqueta robots colocada en el
<body>. - Los valores de
name/contentyX-Robots-Tagno distinguen entre mayúsculas y minúsculas para Google.
Los modelos mentales
1. Rastrear y luego obedecer: la etiqueta solo funciona si la página se puede obtener.
Google tiene que rastrear la página para leer la etiqueta. Cualquier cosa que bloquee la obtención
(robots.txt disallow, autenticación, un error del servidor) significa que la etiqueta nunca se ve. Así que
antes de confiar en un noindex, confirma que la URL se puede rastrear. El corolario: nunca
Disallow una URL que intentas noindex.
2. Tres herramientas, tres trabajos: no las mezcles.
robots.txt= control de rastreo (si los bots obtienen la página).- Metaetiqueta robots / X-Robots-Tag = control de indexación y publicación (qué sucede una vez que se obtiene).
- Autenticación = secreto (una página
noindexsigue siendo pública). Haz coincidir el trabajo con la herramienta. El fallo más común es usarrobots.txtpara intentar eliminar de la indexación: ese es el trabajo de la metaetiqueta.
3. La regla de decisión para eliminar una página.
¿Quieres que esté fuera de la búsqueda? Déjala rastreable y añade noindex — y
no la bloquees también en robots.txt, y no la hagas canonical a una URL diferente.
¿Quieres que los bots omitan un espacio por completo (y no te importa la indexación)?
robots.txt disallow. Las dos no son intercambiables.
4. Resolución de conflictos: gana la más restrictiva.
Cuando las reglas chocan, se aplica la más estricta (nosnippet supera a max-snippet:50).
No intentes ser más listo que esto con combinaciones; asume que la regla más estricta es la que
entra en vigor.
5. googlebot vs robots: suma de los negativos, no anulación.
Para la superposición, Googlebot suma las restricciones de la etiqueta genérica robots
y la etiqueta con nombre googlebot en lugar de elegir una. robots: nofollow +
googlebot: noindex ⇒ Googlebot recibe noindex, nofollow. (Una etiqueta con nombre de rastreador
sí tiene prioridad sobre la etiqueta genérica cuando establecen la misma directiva
de manera diferente, pero la unión es la regla que hay que recordar).
6. Página HTML → etiqueta meta; todo lo demás → cabecera.
Si tiene un <head>, usa la etiqueta <meta>. Si es un PDF, una imagen, cualquier archivo
que no sea HTML, o necesitas cubrir un directorio completo, usa la cabecera X-Robots-Tag —
mismo vocabulario de reglas, diferente entrega.
Registro de cambios
Actualizado el 11 ago 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.
Actualizado el 18 jul 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.