Bloqueado por robots.txt (estado de GSC)

Qué significa el estado de Indexación de páginas «Blocked by robots.txt» de Google Search Console: una URL excluida de la indexación porque robots.txt impidió el rastreo. Normalmente es intencionado. En qué se diferencia de «Indexed, though blocked», por qué noindex y Disallow entran en conflicto y cómo corregirlo si el bloqueo fue un error.

Publicado por primera vez: 23 jun 2026 · Última actualización: 8 ago 2026 · Avanzado
Idiomas
1 señal de evidencia en esta página

«Blocked by robots.txt» es una exclusión de Indexación de páginas de Google Search Console: Google encontró la URL, pero no la rastreó porque tu robots.txt la bloquea, por lo que no se indexa en este estado. La mayoría de las veces es intencionado y correcto: robots.txt controla el rastreo, no la indexación, así que un Disallow no sirve para desindexar. Es un estado hermano de la advertencia «Indexed, though blocked by robots.txt», que produce el resultado contrario (Google indexó una URL bloqueada de todos modos, normalmente a través de enlaces). La gran trampa es el conflicto entre noindex y Disallow: Google no puede rastrear una página bloqueada, así que nunca ve el noindex. Para quitar una página, permite el rastreo y sirve noindex. Solo «corrige» este estado cuando hayas bloqueado algo que realmente querías indexar.

TL;DR — «Blocked by robots.txt» es una exclusión de Indexación de páginas: Google descubrió la URL, pero no la rastreó porque robots.txt la bloquea, así que no se indexa en este estado. Normalmente es intencionado y benigno: robots.txt rige el rastreo, no la indexación, por lo que un Disallow nunca sirve para desindexar. No lo confundas con el aviso «Indexed, though blocked by robots.txt» (Google indexó de todos modos una URL bloqueada, normalmente a través de enlaces). El error clásico es combinar disallow con noindex: Google no puede rastrear la página, así que nunca ve el noindex y la página puede permanecer indexada. Para quitar una página, permite el rastreo y sirve noindex. Trata este estado como un error solo cuando bloqueaste una URL que realmente querías indexar.

Qué informa realmente el estado

En el informe de Indexación de páginas de Search Console, «Blocked by robots.txt» es un estado excluido, no un error ni un aviso. Las palabras de Google son claras: la página «was blocked by your site’s robots.txt file,» (traducción) «fue bloqueada por el archivo robots.txt de tu sitio», y Google añade la advertencia importante de que «does not guarantee that the page won’t be indexed through some other means.» (traducción) «no garantiza que la página no se indexe por otros medios». Evidence for this claim Google reports Blocked by robots.txt when crawling is disallowed and warns that this does not guarantee the URL cannot be indexed by other means. Scope: Google Search Console report terminology and documented Search behavior; the label alone may not prove the underlying root cause. Confidence: high · Verified: Google: Page indexing report Esa advertencia resume todo el tema; a continuación la desarrollamos.

En términos mecánicos: Googlebot sabe que existe la URL (la encontró mediante un enlace, un sitemap o el historial), intentó respetar tus reglas, encontró un Disallow coincidente y se detuvo. Si no hay recuperación, no hay contenido que indexar, así que la URL queda en este grupo de exclusión. Es el resultado esperado de un Disallow: la mayoría de las URL que aparecen aquí deben estar aquí.

El rastreo no es indexación: por qué un Disallow no desindexa

Google documenta robots.txt como control de acceso al rastreo, no como un mecanismo fiable de eliminación. Evidence for this claim Google says robots.txt manages crawler access and is not a mechanism for keeping a page out of Google. Scope: Google Search Console report terminology and documented Search behavior; the label alone may not prove the underlying root cause. Confidence: high · Verified: Google: robots.txt introduction

Esta es la columna vertebral de la precisión de todo el estado. robots.txt controla el rastreo. Google dice explícitamente que «is not a mechanism for keeping a web page out of Google» (traducción) «no es un mecanismo para mantener una página web fuera de Google». Bloquear una URL impide la recuperación; no elimina la URL del índice ni es una herramienta de desindexación.

Como escribí en mi artículo de Ahrefs sobre el estado hermano: “crawling and indexing are two different things.” (traducción) «rastrear e indexar son dos cosas distintas». Una página que bloqueas aún puede acabar indexada si otras páginas enlazan con ella: Google no puede ver el contenido ni ningún noindex que intentaras poner allí. De ahí nace el error más común al llegar a este informe.

«Blocked by robots.txt» frente a «Indexed, though blocked by robots.txt»

Estos dos estados se confunden constantemente: tienen la misma causa, pero resultados opuestos:

Blocked by robots.txtIndexed, though blocked by robots.txt
Grupo del informeExcluido (no indexado)Aviso (indexado)
Qué ocurrióGoogle encontró la URL, no la rastreó y no la indexaGoogle indexó la URL a pesar de no rastrearla
Por quéDisallow funcionó y nada forzó la indexaciónDisallow funcionó, pero los enlaces o señales la indexaron de todos modos
¿Suele ser un problema?No: normalmente es intencionadoDepende: a menudo está bien para URL de utilidad

Si estás mirando la versión de aviso —una URL bloqueada que se indexó de todos modos, mostrada como una URL desnuda sin descripción—, ese es el caso indexed-though-blocked y tiene su propio artículo. Este artículo trata la exclusión simple: bloqueada y no indexada.

En las URL de utilidad, «indexed anyway» a menudo no es motivo de preocupación. John Mueller, al responder a una persona cuyas URL de WooCommerce ?add-to-cart= aparecían como indexed-though-blocked, dijo que no necesitas indexarlas, que bloquearlas con robots.txt está bien y que, aunque se «indexen» mientras están bloqueadas, es poco probable que aparezcan realmente en las búsquedas salvo que alguien haga una consulta muy específica sobre esas URL, algo que los usuarios reales no hacen.

El conflicto entre noindex y Disallow (la solución número 1 que sale mal)

Esta es la trampa. Alguien quiere eliminar una página, así que le añade Disallow en robots.txt y una metaetiqueta noindex, por si acaso. No funciona porque las dos instrucciones se contradicen.

Google formula la regla directamente: “For the noindex rule to be effective, the page or resource must not be blocked by a robots.txt file, and it has to be otherwise accessible to the crawler.” (traducción) «Para que la regla noindex sea efectiva, la página o el recurso no debe estar bloqueado por un archivo robots.txt y debe ser accesible de otro modo para el rastreador». Si la página está bloqueada, Google nunca la rastrea, nunca ve el noindex y puede permanecer indexada. Como escribí en mi artículo sobre «Indexed, though blocked by robots.txt»: si Google no puede rastrear una página, no verá la etiqueta noindex y aún puede indexarla porque tiene enlaces.

Por tanto, la secuencia de desindexación es la contraria de la que suele intentarse:

  1. Permite el rastreo de la URL (elimina el Disallow).
  2. Sirve noindex (metaetiqueta robots o cabecera X-Robots-Tag) y deja que Google vuelva a rastrearla para verlo.
  3. Deja la página rastreable con noindex una vez que desaparezca. Volver a bloquearla después no es un «paso final» seguro: si vuelves a aplicar Disallow, Google puede perder visibilidad de la regla noindex en el siguiente rastreo y una URL bloqueada pero enlazada puede indexarse otra vez por los enlaces de otras páginas, justo el resultado «indexed, though blocked» que querías evitar. Si el presupuesto de rastreo de la página eliminada es un problema real, usa autenticación o eliminación (404/410), no vuelvas a pasar por robots.txt.

Para eliminaciones urgentes, las rutas más rápidas son la herramienta Removals de Search Console, la protección con contraseña o borrar directamente la página (devolviendo 404/410).

Cómo encontrar la regla que bloquea la URL

Tres herramientas, cada una con una función distinta; no esperes que una haga el trabajo de las otras:

  • Inspección de URL (GSC). Pega la URL concreta. Te dice si está bloqueada ahora y es la comprobación más rápida por URL.
  • Informe de robots.txt (GSC). Un informe de supervisión a nivel de propiedad de dominio, no un probador editable, que muestra los archivos robots.txt encontrados por Google para tus hosts principales, la hora de la última descarga, el estado de descarga y los avisos de análisis, además de una acción de «solicitar nuevo rastreo» después de cambiar el archivo. Te dice que Google puede ver el archivo; no prueba URL individuales contra él.
  • Un validador de robots.txt o el parser de código abierto de Google. Para ver qué línea coincide con una URL, pásala por un validador: gana la regla coincidente más larga y específica (y un Allow puede imponerse a un Disallow más amplio).
Evidence for this claim The current Search Console robots.txt report shows fetched files, history, fetch status, and parsing issues and can request a file recrawl; for a specific URL Google points to URL Inspection, a validator, or its open-source robots library rather than an editable legacy GSC tester. Scope: robots.txt diagnosis Confidence: high · Verified: Unblock a page blocked by robots.txt

Cuando hayas encontrado la línea problemática, la solución depende de dónde viva tu robots.txt. Si controlas el archivo directamente, elimina o corrige la regla (y cuida la sintaxis). Si usas una plataforma alojada como Wix, Shopify o Squarespace, quizá tengas que seguir la documentación específica del proveedor, ya que algunas plataformas gestionan robots.txt por ti.

Mi experimento: qué ocurre al bloquear una página que querías indexar

La pregunta realmente útil es: si bloqueas por accidente una página que debería posicionar, ¿qué gravedad tiene? Hice esa prueba directamente. El 30 de enero de 2023 bloqueé con robots.txt dos páginas que de verdad posicionaban —«Top Bing Searches» y «Top YouTube Searches»— y seguí lo que ocurrió.

El daño fue real, pero menor de lo que esperaba. Perdimos alguna posición aquí o allá (unas palabras clave bajaron uno o dos puestos y un par incluso subieron) y perdimos todos los fragmentos destacados de esas páginas mientras estuvieron bloqueadas; volvieron después de desbloquearlas. La apariencia en la SERP también empeoró: Google mostró “no information is available for this page” (traducción) «no hay información disponible para esta página» en vez de la meta descripción y perdió nuestros títulos personalizados. Y como el resultado se veía peor, los clics bajaron más que las impresiones: el CTR recibió el golpe.

Mi resumen de entonces fue: “We lost a position here or there and all of the featured snippets for the pages. I expected a lot more impact, but the world didn’t end.” (traducción) «Perdimos alguna posición aquí o allá y todos los fragmentos destacados de las páginas. Esperaba mucho más impacto, pero el mundo no se acabó». Y la conclusión que sigo defendiendo es: no bloquees las páginas que quieres indexar. Hace daño. No tanto como podrías pensar, pero hace daño. Ese es el marco mental correcto para este informe. Si todo lo que aparece en tu grupo «Blocked by robots.txt» es algo que querías bloquear, estás bien. Si hay una página que te importa, sácala de ahí.

Nota de alcance de este experimento: las dos páginas ya posicionaban y estaban indexadas antes de bloquearlas, así que medí qué ocurre cuando una página indexada pasa al estado «indexed, though blocked», no qué ocurre con una URL que nunca se indexó y simplemente está en este grupo de exclusión. Si una URL de aquí nunca se indexó, desbloquearla solo permite que Google la rastree y la evalúe con normalidad; no hay historial de fragmentos destacados ni de CTR que perder porque nunca existió.

El árbol de decisión

  • ¿Querías bloquearla? → Déjala. Funciona como debe.
  • No: quieres indexarla. → Elimina o relaja la regla de robots.txt y solicita la indexación.
  • Quieres que desaparezca de Google. → No uses un Disallow. Permite el rastreo + noindex (o usa Removals o elimina la página) y déjala rastreable; volver a bloquearla después puede ocultar de nuevo la regla noindex.
  • Es una URL bloqueada que se indexó de todos modos. → Ese es el caso indexed-though-blocked, no este; trátalo allí.
  • La página contiene información sensible o privada. → robots.txt no es un control de acceso: es una petición que los bots pueden ignorar. Usa autenticación o protección con contraseña, no un Disallow.

Por cierto, el principio rastreo frente a indexación es universal: Bing respeta robots.txt para el rastreo de la misma forma, y para quitar una URL de Bing también se usa su herramienta Block URLs o un noindex en una página rastreable, no un Disallow aislado.

Para el archivo en sí —sintaxis, comodines, ubicación y límites— consulta la guía de robots.txt. Para saber cómo se toman las decisiones de indexación más arriba en el proceso, consulta el centro de indexación.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.