Bloqueado por robots.txt (estado de GSC)
Qué significa el estado de Indexación de páginas «Blocked by robots.txt» de Google Search Console: una URL excluida de la indexación porque robots.txt impidió el rastreo. Normalmente es intencionado. En qué se diferencia de «Indexed, though blocked», por qué noindex y Disallow entran en conflicto y cómo corregirlo si el bloqueo fue un error.
Idiomas
1 señal de evidencia en esta página
- Herramienta activa relacionadarobots.txt Tester
«Blocked by robots.txt» es una exclusión de Indexación de páginas de Google Search Console: Google encontró la URL, pero no la rastreó porque tu robots.txt la bloquea, por lo que no se indexa en este estado. La mayoría de las veces es intencionado y correcto: robots.txt controla el rastreo, no la indexación, así que un Disallow no sirve para desindexar. Es un estado hermano de la advertencia «Indexed, though blocked by robots.txt», que produce el resultado contrario (Google indexó una URL bloqueada de todos modos, normalmente a través de enlaces). La gran trampa es el conflicto entre noindex y Disallow: Google no puede rastrear una página bloqueada, así que nunca ve el noindex. Para quitar una página, permite el rastreo y sirve noindex. Solo «corrige» este estado cuando hayas bloqueado algo que realmente querías indexar.
TL;DR — «Blocked by robots.txt» en Search Console significa que Google encontró la página, pero no la leyó porque tu archivo
robots.txtindica a los rastreadores que no entren. Normalmente es intencionado y correcto: es el resultado normal de un bloqueo, no un error. Solo es un problema si bloqueaste una página que realmente querías ver en Google.
Qué significa este estado
Abre el informe de Indexación de páginas en Google Search Console, entra en
«Blocked by robots.txt,» y verás una lista de URL que Google decidió no indexar. La
razón es sencilla: Google encontró esas URL, pero el archivo robots.txt de tu sitio
dice que los rastreadores no pueden recuperarlas. Evidence for this claim Google reports Blocked by robots.txt when crawling is disallowed and warns that this does not guarantee the URL cannot be indexed by other means. Scope: Google Search Console report terminology and documented Search behavior; the label alone may not prove the underlying root cause. Confidence: high · Verified: Google: Page indexing report La etiqueta informa del bloqueo de rastreo; no garantiza que la URL nunca pueda indexarse mediante otras señales.
Lo primero que digo es: no entres en pánico. Este estado suele ser intencionado. Si tú (o tu CMS o un plugin) bloqueaste algo a propósito —resultados de búsqueda interna, URL de navegación facetada, una ruta de staging, URL de carrito y checkout—, verlo aquí es exactamente lo esperado. Google está confirmando que el bloqueo funcionó, no señalando un error.
La única idea que debes recordar
robots.txt controla el rastreo, no la indexación. Son dos cosas distintas.
Bloquear una página en robots.txt impide que Google la lea; no la elimina Evidence for this claim Google says robots.txt manages crawler access and is not a mechanism for keeping a page out of Google. Scope: Google Search Console report terminology and documented Search behavior; the label alone may not prove the underlying root cause. Confidence: high · Verified: Google: robots.txt introduction
de Google ni sirve para quitarla de los resultados. Yo mismo he probado qué ocurre al
«bloquear una página» —hablo más de ello en la pestaña Advanced—, pero la idea central
es esta: el bloqueo detiene el rastreo, punto.
¿Es un problema?
Haz una comprobación: ¿querías bloquear estas URL?
- Sí, a propósito → no la toques. Funciona como debe.
- No, esa página debería estar en Google → ese es el caso que debes corregir.
Encuentra en tu
robots.txtla regla que atrapa la URL, elimínala o relájala y solicita la indexación.
También puedes ver un estado relacionado, pero distinto: «Indexed, though blocked by robots.txt». Ese es un aviso, no una exclusión: significa que Google indexó una URL bloqueada de todos modos (normalmente porque otras páginas enlazan con ella). Misma causa, resultado contrario. Si estás viendo ese caso, se trata por separado.
Evidence for this claim Google reports Blocked by robots.txt when crawling is disallowed and warns that this does not guarantee the URL cannot be indexed by other means. Scope: Google Search Console report terminology and documented Search behavior; the label alone may not prove the underlying root cause. Confidence: high · Verified: Google: Page indexing reportHay otra cosa que robots.txt no puede hacer: mantener algo privado. Es una petición, no
un control de acceso; los bots que se comportan bien la respetan, pero nada les obliga
y nada impide que la URL aparezca en otro sitio (un enlace, una captura de pantalla o
un scraper que ignore por completo robots.txt). Si una página contiene información
sensible, protégela con un inicio de sesión o una contraseña, no con un disallow.
El error que debes evitar
Mucha gente intenta quitar una página de Google bloqueándola en robots.txt, a
veces añadiendo también una etiqueta noindex «por si acaso». No funciona y puede
salir mal. Si Google no puede rastrear la página, nunca verá el noindex, así que la
página puede permanecer en Google. Para sacar realmente una página de los resultados,
haz lo contrario: deja que Google la rastree y añade noindex.
¿Quieres la versión completa —cómo encontrar la regla exacta, por qué el conjunto
noindex + Disallow entra en conflicto y qué mostró mi experimento—? Pasa a la
pestaña Advanced.
TL;DR — «Blocked by robots.txt» es una exclusión de Indexación de páginas: Google descubrió la URL, pero no la rastreó porque
robots.txtla bloquea, así que no se indexa en este estado. Normalmente es intencionado y benigno: robots.txt rige el rastreo, no la indexación, por lo que un Disallow nunca sirve para desindexar. No lo confundas con el aviso «Indexed, though blocked by robots.txt» (Google indexó de todos modos una URL bloqueada, normalmente a través de enlaces). El error clásico es combinardisallowconnoindex: Google no puede rastrear la página, así que nunca ve elnoindexy la página puede permanecer indexada. Para quitar una página, permite el rastreo y sirvenoindex. Trata este estado como un error solo cuando bloqueaste una URL que realmente querías indexar.
Qué informa realmente el estado
En el informe de Indexación de páginas de Search Console, «Blocked by robots.txt» es un estado excluido, no un error ni un aviso. Las palabras de Google son claras: la página «was blocked by your site’s robots.txt file,» (traducción) «fue bloqueada por el archivo robots.txt de tu sitio», y Google añade la advertencia importante de que «does not guarantee that the page won’t be indexed through some other means.» (traducción) «no garantiza que la página no se indexe por otros medios». Evidence for this claim Google reports Blocked by robots.txt when crawling is disallowed and warns that this does not guarantee the URL cannot be indexed by other means. Scope: Google Search Console report terminology and documented Search behavior; the label alone may not prove the underlying root cause. Confidence: high · Verified: Google: Page indexing report Esa advertencia resume todo el tema; a continuación la desarrollamos.
En términos mecánicos: Googlebot sabe que existe la URL (la encontró mediante un
enlace, un sitemap o el historial), intentó respetar tus reglas, encontró un
Disallow coincidente y se detuvo. Si no hay recuperación, no hay contenido que
indexar, así que la URL queda en este grupo de exclusión. Es el resultado esperado
de un Disallow: la mayoría de las URL que aparecen aquí deben estar aquí.
El rastreo no es indexación: por qué un Disallow no desindexa
Google documenta robots.txt como control de acceso al rastreo, no como un mecanismo fiable de eliminación. Evidence for this claim Google says robots.txt manages crawler access and is not a mechanism for keeping a page out of Google. Scope: Google Search Console report terminology and documented Search behavior; the label alone may not prove the underlying root cause. Confidence: high · Verified: Google: robots.txt introduction
Esta es la columna vertebral de la precisión de todo el estado. robots.txt controla
el rastreo. Google dice explícitamente que «is not a mechanism for keeping a web page
out of Google» (traducción) «no es un mecanismo para mantener una página web fuera
de Google». Bloquear una URL impide la recuperación; no elimina la URL del índice ni
es una herramienta de desindexación.
Como escribí en mi artículo de Ahrefs sobre el estado hermano: “crawling and indexing are two different things.” (traducción) «rastrear e indexar son dos cosas distintas». Una página que bloqueas aún puede acabar indexada si otras páginas enlazan con ella: Google no puede ver el contenido ni ningún noindex que intentaras poner allí. De ahí nace el error más común al llegar a este informe.
«Blocked by robots.txt» frente a «Indexed, though blocked by robots.txt»
Estos dos estados se confunden constantemente: tienen la misma causa, pero resultados opuestos:
| Blocked by robots.txt | Indexed, though blocked by robots.txt | |
|---|---|---|
| Grupo del informe | Excluido (no indexado) | Aviso (indexado) |
| Qué ocurrió | Google encontró la URL, no la rastreó y no la indexa | Google indexó la URL a pesar de no rastrearla |
| Por qué | Disallow funcionó y nada forzó la indexación | Disallow funcionó, pero los enlaces o señales la indexaron de todos modos |
| ¿Suele ser un problema? | No: normalmente es intencionado | Depende: a menudo está bien para URL de utilidad |
Si estás mirando la versión de aviso —una URL bloqueada que se indexó de todos modos, mostrada como una URL desnuda sin descripción—, ese es el caso indexed-though-blocked y tiene su propio artículo. Este artículo trata la exclusión simple: bloqueada y no indexada.
En las URL de utilidad, «indexed anyway» a menudo no es motivo de preocupación. John
Mueller, al responder a una persona cuyas URL de WooCommerce ?add-to-cart= aparecían
como indexed-though-blocked, dijo que no necesitas indexarlas, que bloquearlas con
robots.txt está bien y que, aunque se «indexen» mientras están bloqueadas, es poco
probable que aparezcan realmente en las búsquedas salvo que alguien haga una consulta
muy específica sobre esas URL, algo que los usuarios reales no hacen.
El conflicto entre noindex y Disallow (la solución número 1 que sale mal)
Esta es la trampa. Alguien quiere eliminar una página, así que le añade Disallow en
robots.txt y una metaetiqueta noindex, por si acaso. No funciona porque las dos
instrucciones se contradicen.
Google formula la regla directamente: “For the noindex rule to be effective, the page or resource must not be blocked by a robots.txt file, and it has to be otherwise accessible to the crawler.” (traducción) «Para que la regla noindex sea efectiva, la página o el recurso no debe estar bloqueado por un archivo robots.txt y debe ser accesible de otro modo para el rastreador». Si la página está bloqueada, Google nunca la rastrea, nunca ve el noindex y puede permanecer indexada. Como escribí en mi artículo sobre «Indexed, though blocked by robots.txt»: si Google no puede rastrear una página, no verá la etiqueta noindex y aún puede indexarla porque tiene enlaces.
Por tanto, la secuencia de desindexación es la contraria de la que suele intentarse:
- Permite el rastreo de la URL (elimina el
Disallow). - Sirve
noindex(metaetiqueta robots o cabeceraX-Robots-Tag) y deja que Google vuelva a rastrearla para verlo. - Deja la página rastreable con
noindexuna vez que desaparezca. Volver a bloquearla después no es un «paso final» seguro: si vuelves a aplicar Disallow, Google puede perder visibilidad de la reglanoindexen el siguiente rastreo y una URL bloqueada pero enlazada puede indexarse otra vez por los enlaces de otras páginas, justo el resultado «indexed, though blocked» que querías evitar. Si el presupuesto de rastreo de la página eliminada es un problema real, usa autenticación o eliminación (404/410), no vuelvas a pasar porrobots.txt.
Para eliminaciones urgentes, las rutas más rápidas son la herramienta Removals de Search
Console, la protección con contraseña o borrar directamente la página (devolviendo
404/410).
Cómo encontrar la regla que bloquea la URL
Tres herramientas, cada una con una función distinta; no esperes que una haga el trabajo de las otras:
- Inspección de URL (GSC). Pega la URL concreta. Te dice si está bloqueada ahora y es la comprobación más rápida por URL.
- Informe de robots.txt (GSC). Un informe de supervisión a nivel de propiedad de
dominio, no un probador editable, que muestra los archivos
robots.txtencontrados por Google para tus hosts principales, la hora de la última descarga, el estado de descarga y los avisos de análisis, además de una acción de «solicitar nuevo rastreo» después de cambiar el archivo. Te dice que Google puede ver el archivo; no prueba URL individuales contra él. - Un validador de robots.txt o el parser de código abierto de Google. Para ver
qué línea coincide con una URL, pásala por un validador: gana la regla coincidente
más larga y específica (y un
Allowpuede imponerse a unDisallowmás amplio).
Cuando hayas encontrado la línea problemática, la solución depende de dónde viva tu
robots.txt. Si controlas el archivo directamente, elimina o corrige la regla (y
cuida la sintaxis). Si usas una plataforma alojada como Wix, Shopify o Squarespace,
quizá tengas que seguir la documentación específica del proveedor, ya que algunas
plataformas gestionan robots.txt por ti.
Mi experimento: qué ocurre al bloquear una página que querías indexar
La pregunta realmente útil es: si bloqueas por accidente una página que debería
posicionar, ¿qué gravedad tiene? Hice esa prueba directamente. El 30 de enero de
2023 bloqueé con robots.txt dos páginas que de verdad posicionaban —«Top Bing
Searches» y «Top YouTube Searches»— y seguí lo que ocurrió.
El daño fue real, pero menor de lo que esperaba. Perdimos alguna posición aquí o allá (unas palabras clave bajaron uno o dos puestos y un par incluso subieron) y perdimos todos los fragmentos destacados de esas páginas mientras estuvieron bloqueadas; volvieron después de desbloquearlas. La apariencia en la SERP también empeoró: Google mostró “no information is available for this page” (traducción) «no hay información disponible para esta página» en vez de la meta descripción y perdió nuestros títulos personalizados. Y como el resultado se veía peor, los clics bajaron más que las impresiones: el CTR recibió el golpe.
Mi resumen de entonces fue: “We lost a position here or there and all of the featured snippets for the pages. I expected a lot more impact, but the world didn’t end.” (traducción) «Perdimos alguna posición aquí o allá y todos los fragmentos destacados de las páginas. Esperaba mucho más impacto, pero el mundo no se acabó». Y la conclusión que sigo defendiendo es: no bloquees las páginas que quieres indexar. Hace daño. No tanto como podrías pensar, pero hace daño. Ese es el marco mental correcto para este informe. Si todo lo que aparece en tu grupo «Blocked by robots.txt» es algo que querías bloquear, estás bien. Si hay una página que te importa, sácala de ahí.
Nota de alcance de este experimento: las dos páginas ya posicionaban y estaban indexadas antes de bloquearlas, así que medí qué ocurre cuando una página indexada pasa al estado «indexed, though blocked», no qué ocurre con una URL que nunca se indexó y simplemente está en este grupo de exclusión. Si una URL de aquí nunca se indexó, desbloquearla solo permite que Google la rastree y la evalúe con normalidad; no hay historial de fragmentos destacados ni de CTR que perder porque nunca existió.
El árbol de decisión
- ¿Querías bloquearla? → Déjala. Funciona como debe.
- No: quieres indexarla. → Elimina o relaja la regla de
robots.txty solicita la indexación. - Quieres que desaparezca de Google. → No uses un Disallow. Permite el rastreo +
noindex(o usa Removals o elimina la página) y déjala rastreable; volver a bloquearla después puede ocultar de nuevo la reglanoindex. - Es una URL bloqueada que se indexó de todos modos. → Ese es el caso indexed-though-blocked, no este; trátalo allí.
- La página contiene información sensible o privada. → robots.txt no es un control de acceso: es una petición que los bots pueden ignorar. Usa autenticación o protección con contraseña, no un Disallow.
Por cierto, el principio rastreo frente a indexación es universal: Bing respeta
robots.txt para el rastreo de la misma forma, y para quitar una URL de Bing también
se usa su herramienta Block URLs o un noindex en una página rastreable, no un
Disallow aislado.
Para el archivo en sí —sintaxis, comodines, ubicación y límites— consulta la guía de robots.txt. Para saber cómo se toman las decisiones de indexación más arriba en el proceso, consulta el centro de indexación.
Resumen de IA
Una síntesis de la versión Advanced:
- «Blocked by robots.txt» = una exclusión de Indexación de páginas. Google encontró
la URL, pero no la rastreó porque
robots.txtla bloquea, así que no se indexa en este estado. Es el resultado normal de un bloqueo, normalmente intencionado y benigno. - robots.txt controla el rastreo, no la indexación. Google dice que “is not a mechanism for keeping a web page out of Google.” (traducción) «no es un mecanismo para mantener una página web fuera de Google». Un Disallow detiene la recuperación; no desindexa una página.
- No lo confundas con el aviso «Indexed, though blocked by robots.txt.» (traducción) «Indexed, aunque bloqueado por robots.txt». Misma causa, resultado contrario: esa versión significa que una URL bloqueada se indexó de todos modos, normalmente por enlaces entrantes. Para las URL de utilidad, Mueller dice que normalmente está bien: las URL bloqueadas e indexadas rara vez aparecen en consultas normales.
- El principal efecto rebote:
noindex+disallowjuntos. Google no puede rastrear una página bloqueada, así que nunca ve elnoindexy la página puede seguir indexada. Regla de Google: para quenoindexfuncione, la página no debe estar bloqueada porrobots.txt. - Para quitar realmente una página: permite el rastreo, sirve
noindex, deja que Google vuelva a rastrear y después mantén la página rastreable. Volver a bloquearla puede ocultar otra vez la reglanoindexy permitir que la URL se indexe por enlaces, lo contrario de lo que querías. En casos urgentes, usa Removals, protección con contraseña o elimina la página. - Encuentra la regla de bloqueo con Inspección de URL (por URL) y un validador de robots.txt (qué línea coincide; gana la regla más larga y específica). El informe de robots.txt de GSC supervisa el estado de descarga del archivo; no prueba URL individuales. La solución depende de dónde viva el archivo: las plataformas alojadas pueden requerir pasos específicos del proveedor.
- Experimento de Patrick: bloquear dos páginas que ya posicionaban y ya estaban indexadas costó alguna posición y todos los fragmentos destacados, empeoró el resultado de la SERP y redujo más los clics que las impresiones: “the world didn’t end” (traducción) «el mundo no se acabó», pero “don’t block pages you want indexed” (traducción) «no bloquees las páginas que quieres indexar». Muestra qué ocurre con una página indexada que pasa a «indexed, though blocked»; no predice lo que sucede con una URL que nunca se indexó.
- robots.txt no es un control de seguridad. Es una petición que los bots pueden elegir ignorar. Protege el contenido sensible con autenticación, no con un Disallow.
- Regla de decisión: querías bloquearla → déjala; quieres indexarla → desbloquea y
solicita la indexación; quieres quitarla → permite el rastreo +
noindex(y déjala rastreable).
Documentación oficial
Documentación de fuente primaria de los buscadores.
- Informe de Indexación de páginas — el informe donde aparece este estado, con las definiciones literales de «Blocked by robots.txt» e «Indexed, though blocked by robots.txt».
- Desbloquear una página bloqueada por robots.txt — pasos de Google para encontrar y corregir la regla que bloquea una URL.
- Informe de robots.txt — el informe de propiedad de dominio que muestra los archivos robots.txt encontrados por Google, el estado de descarga, los avisos y la solicitud de nuevo rastreo.
- Introducción a robots.txt — qué hace robots.txt y qué no, incluido que «is not a mechanism for keeping a web page out of Google» (traducción) «no es un mecanismo para mantener una página web fuera de Google».
- Bloquear la indexación de Search con noindex — la regla de que
noindexsolo funciona en una página que no esté bloqueada por robots.txt (el conflicto entre noindex y Disallow).
Bing / Microsoft
- Ayuda de Bing Webmaster Tools — Bing también respeta robots.txt para el rastreo; su Robots.txt Tester y su herramienta Block URLs siguen el mismo principio de rastreo frente a indexación.
Citas de la fuente
Declaraciones atribuibles de Google. Cada enlace es profundo y salta al pasaje citado en la página de origen.
Google: qué significa el estado
- “This page was blocked by your site’s robots.txt file. You can verify this using the robots.txt tester. Note that this does not guarantee that the page won’t be indexed through some other means.” (traducción) «Esta página fue bloqueada por el archivo robots.txt de tu sitio. Puedes verificarlo con el probador de robots.txt. Ten en cuenta que esto no garantiza que la página no se indexe por otros medios». — Ayuda de Google Search Console, informe de Indexación de páginas. Saltar a la cita
Google: robots.txt controla el rastreo, no la indexación
- “it is not a mechanism for keeping a web page out of Google.” (traducción) «no es un mecanismo para mantener una página web fuera de Google». — Google Search Central, Introducción a robots.txt. Saltar a la cita
Google: por qué entran en conflicto noindex y Disallow
- “For the
noindexrule to be effective, the page or resource must not be blocked by a robots.txt file, and it has to be otherwise accessible to the crawler.” (traducción) «Para que la reglanoindexsea efectiva, la página o el recurso no debe estar bloqueado por un archivo robots.txt y debe ser accesible de otro modo para el rastreador». — Google Search Central, Bloquear la indexación de Search con noindex. Saltar a la cita
Estadísticas y datos propios que merece la pena citar
- Bloquear páginas que posicionan: daño real, pero soportable. En mi experimento,
bloquear con
robots.txtdos páginas que ya posicionaban y ya estaban indexadas (comenzó el 30 de enero de 2023) hizo que perdieran alguna posición y todos sus fragmentos destacados, empeoró el resultado de la SERP a «no hay información disponible para esta página» y redujo más los clics que las impresiones. Mi resumen: “I expected a lot more impact, but the world didn’t end” (traducción) «Esperaba mucho más impacto, pero el mundo no se acabó», pero “don’t block pages you want indexed. It hurts.” (traducción) «no bloquees las páginas que quieres indexar. Hace daño». Esto prueba qué ocurre con una página indexada que pasa al estado «indexed, though blocked»; no predice lo que ocurrirá con una URL que nunca se indexó. Fuente - Las URL de utilidad bloqueadas que se indexan suelen ser inofensivas. Según John Mueller, está bien bloquear con robots.txt las URL tipo add-to-cart; aunque aparezcan como indexed-though-blocked, es poco probable que salgan en consultas normales. Cobertura
- Qué tan frecuente es el bloqueo con robots.txt en la web: datos de tasa de bloqueo sobre qué rastreadores son bloqueados por unos 140 millones de sitios, de mi estudio con Xibeijia Guan. Fuente
El error que define este estado: noindex + Disallow
Error: combinar Disallow con noindex para intentar quitar una página.
Es el error más común ligado a «Blocked by robots.txt» y conviene nombrarlo porque
parece una medida de doble seguridad, pero en realidad se derrota a sí misma.
Alguien quiere quitar una página de Google, así que le pone Disallow en robots.txt
y añade una metaetiqueta noindex por si acaso. No funciona. Google formula la
regla claramente: “For the noindex rule to be effective, the page or resource must
not be blocked by a robots.txt file, and it has to be otherwise accessible to the
crawler.” (traducción) «Para que la regla noindex sea efectiva, la página o el
recurso no debe estar bloqueado por un archivo robots.txt y debe ser accesible de otro
modo para el rastreador». Si la página está bloqueada, Google nunca la rastrea ni ve
el noindex, y puede permanecer indexada: justo lo contrario del resultado buscado.
La solución exige el instinto contrario: permite el rastreo y sirve noindex.
Mito: «Un Disallow en robots.txt sirve para desindexar».
No es así, y Google lo dice directamente: robots.txt “is not a mechanism for keeping
a web page out of Google.” (traducción) «no es un mecanismo para mantener una
página web fuera de Google». Bloquear una URL detiene la recuperación, no elimina la
URL del índice, y una página bloqueada pero enlazada aún puede aparecer (es el estado
hermano «Indexed, though blocked by robots.txt»). Usa noindex (con el rastreo
permitido) o la herramienta Removals cuando el objetivo sea quitarla de verdad.
Mito: «Todo lo que aparece en el grupo “Blocked by robots.txt” es un problema que hay que corregir». Suele ser justo lo contrario. Este estado es el resultado esperado de un Disallow intencionado: resultados de búsqueda interna, parámetros de navegación facetada o rutas de staging. La única versión que merece tratarse como un error es una URL que realmente querías indexar y que aparece en la lista por accidente.
Error: bloquear una página que quieres posicionar sin comprobar antes el coste. Bloquear una página que quieres que posicione para «limpiar» o «ahorrar presupuesto de rastreo» es más arriesgado de lo que parece. En mi experimento con dos páginas que posicionaban, perdí todos los fragmentos destacados mientras estuvieron bloqueadas y los clics bajaron más que las impresiones porque el resultado de la SERP empeoró a «no hay información disponible para esta página». Las posiciones se mantuvieron en gran parte, pero trata el bloqueo de robots.txt en una página que te importa como una decisión real, no como un ajuste de mantenimiento.
Lista de triaje de «Blocked by robots.txt»
Recorre esta lista de arriba abajo cuando abras el estado en Search Console:
- Abre el informe de Indexación de páginas y entra en «Blocked by robots.txt» para ver la lista real de URL afectadas.
- Para cada URL (o patrón de URL), pregunta: ¿quería bloquearla?
- Si sí —búsqueda interna, navegación facetada, staging, carrito o checkout—, déjala. Este estado funciona como debe para esa URL.
- Si no, o no estás seguro, pasa la URL por Inspección de URL para confirmar que está bloqueada ahora (y no es una instantánea antigua).
- Encuentra la regla concreta con el Robots.txt Tester
(u otro validador): gana la regla coincidente más larga y específica, y un
Allowpuede imponerse a unDisallowmás amplio. El informe de robots.txt de GSC controla la obtención del archivo; no verifica URL concretas. - Confirma que no dependes también de
noindexen la misma URL bloqueada: esa combinación no funciona; si quieres eliminarla, elige permitir el rastreo y servir noindex. - Elimina o relaja la regla de bloqueo (directamente si controlas
robots.txt, o siguiendo la documentación de tu plataforma si la gestiona por ti, como Wix, Shopify o Squarespace). - Solicita la indexación de la URL corregida en Search Console una vez despejado el bloqueo.
- Comprueba que no confundes este estado con «Indexed, though blocked by robots.txt»: es el resultado contrario (indexada de todos modos) y requiere otra solución.
- Vuelve a revisar el grupo en unas semanas para confirmar que el recuento tomó la dirección esperada (baja para las URL corregidas, estable para los bloqueos intencionados).
- Si alguna URL contiene información sensible, no confíes en el Disallow para mantenerla privada: añade autenticación o protección con contraseña.
Recorre el árbol de decisión
Responde una pregunta cada vez para elegir la acción correcta para una URL que está en el grupo «Blocked by robots.txt».
What should I do about a URL blocked by robots.txt?
Los modelos mentales
1. Rastreo ≠ indexación. Todo el estado se vuelve confuso si mezclas ambos conceptos. robots.txt controla el rastreo: si Googlebot recupera una página. No controla directamente la indexación: si la URL termina en el índice de Google. Una página bloqueada no se indexa mediante el rastreo, pero aún puede indexarse sin contenido si otras páginas enlazan con ella. Mantén separadas las dos ideas y la mayor parte de este estado dejará de confundir.
2. El triaje de una sola pregunta. Antes de hacer nada, pregunta: ¿quería bloquearla? Sí → déjala, funciona como debe. No → ese es el caso que merece corregirse. Esta única pregunta clasifica correctamente casi todas las URL del grupo.
3. Para quitar una página, invierte el instinto. La acción natural —Disallow más noindex, «para estar más seguro»— es justo al revés. Google no puede ver una directiva en una página que nunca recupera. La secuencia correcta es la contraria a la intuitiva: permite el rastreo y luego sirve noindex. Cada vez que alguien recurre a un Disallow para hacer desaparecer una página, esa es la señal de aplicar este modelo.
4. robots.txt sirve para el presupuesto de rastreo, no para los resultados de
búsqueda. Úsalo para mantener a los bots fuera de espacios de URL de poco valor o
infinitos (búsqueda interna, facetas, staging), de modo que el esfuerzo de rastreo vaya
a las páginas que quieres que se encuentren; no como palanca de lo que aparece en los
resultados. Ese trabajo corresponde a noindex, la protección con contraseña o la
eliminación.
Sigue el recuento del grupo, no solo su existencia
El número que merece la pena vigilar es cuántas URL aparecen con el tiempo en la fila «Blocked by robots.txt» del informe de Indexación de páginas; una sola instantánea no puede decirte si una solución funcionó o si están apareciendo nuevos bloqueos no intencionados.
Recuento del grupo «Blocked by robots.txt» a lo largo del tiempo
- Métrica: recuento de URL bajo «Blocked by robots.txt» en el informe de Indexación de páginas de GSC, seguido a lo largo del tiempo.
- Qué te dice: si el grupo se comporta como esperas. Para las URL que bloqueas
intencionadamente (búsqueda interna, facetas, staging), el recuento debería
mantenerse bastante estable mientras esos espacios de URL no cambien; un salto
repentino suele significar que una sección nueva cayó por accidente en un patrón
Disallowexistente. Para una URL que desbloqueaste deliberadamente porque querías indexarla, esa URL concreta debería salir del grupo después del siguiente rastreo. - Cómo obtenerlo: informe de Indexación de páginas de GSC, filtrado a la fila «Blocked by robots.txt»; comprueba URL concretas con Inspección de URL para confirmar el estado actual y no una instantánea antigua.
- Referencia / rango realista: no hay un objetivo universal: depende por completo de cuánto de tu sitio esté bloqueado intencionadamente. La medida honesta es cero URL en este grupo que realmente quisieras indexar y una tendencia estable para todo lo demás. Establece tu propia línea base antes de juzgar si un cambio movió el recuento en la dirección correcta.
- Cadencia: compruébalo justo después de cualquier cambio en
robots.txt; después, una revisión periódica (mensual basta para la mayoría de sitios) detecta la deriva.
Playbook: quitar realmente una página de Google
Una secuencia repetible para cuando una URL debe salir de verdad del índice de Google, no solo quedar bloqueada para futuros rastreos.
1. Confirma que el objetivo es eliminar, no solo controlar el rastreo.
Si el objetivo real es «dejar de desperdiciar presupuesto de rastreo», un Disallow
simple en robots.txt es la herramienta correcta y este playbook no se aplica: esa
página puede seguir indexada por enlaces y está bien. Usa esta secuencia solo cuando la
página deba salir realmente del índice.
2. Permite el rastreo.
Elimina o relaja la regla Disallow que bloquea la URL. Confirma con
Robots.txt Tester que ahora la URL aparece como
permitida, no bloqueada.
3. Sirve noindex.
Añade una metaetiqueta robots noindex o una cabecera HTTP X-Robots-Tag a la página
que ahora se puede rastrear. Esta es la instrucción real de eliminación: el Disallow
nunca hacía ese trabajo.
4. Deja que Google vuelva a rastrearla y la detecte.
Google tiene que recuperar la página otra vez para ver el noindex. No hay forma de
forzar una recuperación instantánea más allá de solicitar la indexación en Search
Console y esperar al siguiente rastreo.
5. Confirma la eliminación.
Comprueba Inspección de URL en Search Console para ver el estado de indexación
actual de la página. Cuando informe de que la página está excluida por noindex, la
eliminación habrá funcionado.
6. No consideres volver a bloquear como el paso final.
Cuando la página haya desaparecido, volver a añadir el Disallow tiene un coste:
Google puede perder otra vez visibilidad de la regla noindex en el siguiente rastreo
y una URL bloqueada pero enlazada puede volver a indexarse por enlaces de otras páginas,
el resultado exacto «indexed, though blocked» que intentabas evitar. Si te preocupa el
presupuesto de rastreo, sopesa ese riesgo o recurre a la autenticación o eliminación en
páginas que realmente deban permanecer fuera para siempre.
7. En casos urgentes, sáltate la espera.
Si la página debe desaparecer ahora, usa la herramienta Removals de Search
Console, protégela con contraseña o elimínala directamente (devuelve 404/410) en
vez de esperar al ciclo de rastreo y noindex.
Prompts de IA listos para usar
Copia y pega estos prompts para analizar un bloqueo de robots.txt con un LLM. Trata la salida como una hipótesis inicial: confirma cualquier dato decisivo con el robots.txt Tester o con la herramienta Inspección de URL de Search Console antes de actuar.
Averigua qué regla bloquea cada URL
Here is my robots.txt file and a list of URLs. For each URL, tell me whether it
is blocked or allowed, and quote the exact line in robots.txt responsible
(remember: the longest, most specific matching rule wins, and an Allow can
override a broader Disallow). If a URL isn't matched by any rule, say so.
ROBOTS.TXT:
[paste]
URLS:
[paste list, one per line]Comprueba si el bloqueo parece intencionado
I run a [type of site]. Here is my robots.txt file. For each Disallow rule, tell
me what kind of URLs it likely targets (e.g. internal search, faceted
navigation, staging, cart/checkout, admin) and flag any rule that looks broad
enough it might be catching content pages by accident. Don't guess about pages
you can't see — just reason from the rule pattern and ask me to confirm
anything ambiguous.
ROBOTS.TXT:
[paste]Redacta la secuencia noindex y luego rastreo para una página concreta
I need to remove [URL] from Google. It's currently blocked by this robots.txt
rule: [paste rule]. Walk me through the exact sequence of changes in order
(robots.txt edit, meta tag or header change, what to check in Search Console at
each step) so I don't accidentally leave the noindex tag unseen by Google. Prueba una URL contra tus reglas de robots.txt
Antes de cambiar nada, confirma exactamente qué regla afecta a una URL concreta. El robots.txt Tester lo hace con un comparador adaptado del analizador de robots.txt de código abierto de Google y muestra la regla ganadora para cada URL; es la forma más rápida y precisa de comprobarlo. Para una comprobación manual rápida sin herramienta, esta es la lógica central en Python:
import re
def rule_matches(path, rule):
"""Very simplified robots.txt path matcher: '*' = wildcard, '$' = end anchor."""
pattern = re.escape(rule).replace(r'\*', '.*')
if pattern.endswith(r'\$'):
pattern = pattern[:-2] + '$'
return re.match(pattern, path) is not None
def find_blocking_rule(path, disallow_rules, allow_rules):
"""Longest matching rule wins; ties go to Allow (mirrors Google's documented
precedence). Returns the winning rule string, or None if nothing matches."""
matches = [r for r in disallow_rules if rule_matches(path, r)]
matches += [r for r in allow_rules if rule_matches(path, r)]
if not matches:
return None
return max(matches, key=len)
# Example
disallow = ["/search", "/*?*sort="]
allow = ["/search/help"]
print(find_blocking_rule("/search/help", disallow, allow)) # -> "/search/help" (Allow wins, longer)
print(find_blocking_rule("/search/results", disallow, allow)) # -> "/search" (Disallow, no competing Allow)Esto simplifica el comparador real de Google (el análisis de robots.txt tiene más casos límite relacionados con el escape y la selección de grupos). Úsalo para comprobar tu modelo mental y confirma cualquier punto importante con el tester real antes de basarte en él.
Herramientas para diagnosticar y corregir este estado
- Google Index Checker — después de corregir
un bloqueo, úsalo para comprobar las señales observables de indexabilidad de la
página (código de estado, redirecciones,
noindex, canonical) antes de acudir a Search Console para conocer la respuesta real de Google. - Inspección de URL (Google Search Console) — es la fuente de verdad para saber si una URL concreta está bloqueada, cuál es su indexabilidad en la prueba en directo y, una vez corregida, si Google ha vuelto a detectarla.
- Informe de robots.txt (Google Search Console) — vista a nivel de propiedad
de dominio de los archivos
robots.txtque Google encontró para tus hosts principales, su última hora de descarga y el estado de obtención, con una acción para «solicitar un nuevo rastreo» después de cambiar el archivo.
Ponte a prueba: Blocked by robots.txt
Cinco preguntas sobre el estado «Blocked by robots.txt» y los errores habituales relacionados. Elige una respuesta para cada una y luego comprueba el resultado.
Demuestra que la eliminación funcionó
«He configurado noindex» o «he editado robots.txt» no demuestra nada por sí solo: el único resultado que cuenta es lo que el índice de Google refleja después. Estas pruebas separan el cambio que hiciste del resultado al que llegó Google.
Prueba 1: el rastreo está realmente permitido
- Prueba que debes ejecutar: pasa la URL por el robots.txt Tester después de editar el archivo.
- Resultado esperado: la URL aparece como allowed, sin ninguna regla
Disallowque coincida (o con unaAllowmás específica que gane a unaDisallowmás amplia). - Interpretación de un fallo: si sigue bloqueada, otra regla más específica está afectando a la URL o la edición no se desplegó. Comprueba el contenido real que se sirve, no solo lo que pretendías cambiar.
- Ventana de monitorización: inmediata: es una comprobación estática del archivo servido.
- Disparador de rollback: N/A: corrige la regla antes de pasar a la siguiente prueba; nada posterior funciona hasta que el rastreo esté permitido.
Prueba 2: noindex se sirve correctamente
- Prueba que debes ejecutar: URL Inspection → Live Test en Search Console (o recupera la página directamente y comprueba las cabeceras/HTML de respuesta) sobre la URL que ahora se puede rastrear.
- Resultado esperado: la prueba en directo muestra
noindex, ya sea como una etiqueta meta robots en<head>o como una cabecera HTTPX-Robots-Tag. - Interpretación de un fallo: si aquí falta
noindex, la eliminación nunca ocurrirá por mucho que esperes; permitir el rastreo por sí solo no elimina nada. - Ventana de monitorización: inmediata: la prueba en directo refleja la página que se sirve actualmente.
- Disparador de rollback: N/A: esto debe pasar antes de que Google pueda actuar.
Prueba 3: Google ya ha retirado la página
- Prueba que debes ejecutar: URL Inspection (el campo de estado de indexación, no solo Live Test) sobre la URL, de forma periódica después de que pasen las dos pruebas anteriores.
- Resultado esperado: el estado cambia a excluida debido a
noindex, y la URL deja de aparecer en una búsquedasite:o en tus datos de seguimiento de posiciones. - Interpretación de un fallo: que siga indexada después de un ciclo completo de rastreo suele indicar una demora de caché o propagación, no una configuración rota. Google tiene que volver a rastrear para detectar el cambio y eso no es instantáneo.
- Ventana de monitorización: de 1 a 3 semanas, según la frecuencia con la que Google ya rastreaba la URL; no juzgues el resultado al día siguiente de publicar el cambio.
- Disparador de rollback — la condición de aborto definida: si sigue indexada
después de un ciclo completo de rastreo y la página continúa apareciendo como
rastreada recientemente en los registros del servidor, deja de asumir que es solo
propagación y vuelve a comprobar las Pruebas 1 y 2 por si hay un error (los
culpables habituales son una caché que sirve un robots.txt obsoleto, un CDN que
elimina la cabecera
X-Robots-Tago una segunda regla en conflicto).
Registro de cambios
Actualizado el 8 ago 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.
Actualizado el 17 jul 2026.
Resumen editorial y detalles registrados del cambio.Detalles del cambio
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
-
Los detalles del cambio están disponibles actualmente en inglés.
La comparación completa no está disponible: no se archivó una instantánea anterior para esta revisión.