Bloqueado pelo robots.txt (status do GSC)

O que significa o status “Bloqueado pelo robots.txt” no relatório de indexação de páginas do Google Search Console: uma URL excluída da indexação porque o robots.txt proibiu o rastreamento. Normalmente é intencional. Veja a diferença para “Indexada, embora bloqueada”, o conflito entre noindex e Disallow e como corrigir um bloqueio acidental.

Publicado pela primeira vez: 23 de jun. de 2026 · Última atualização: 8 de ago. de 2026 · Avançado
Idiomas
1 sinal de evidência nesta página

“Bloqueado pelo robots.txt” é uma exclusão do relatório de indexação de páginas: o Google descobriu a URL, mas não a rastreou porque uma regra Disallow proibiu o rastreamento. Isso normalmente é intencional. robots.txt controla rastreamento, não indexação; portanto, bloquear uma URL não é uma forma confiável de removê-la da Busca. Se a página já era conhecida por links ou sitemaps, o Google ainda pode indexar informações sobre ela sem conseguir ler o conteúdo. O caso “Indexada, embora bloqueada pelo robots.txt” é justamente esse resultado oposto. Não combine Disallow com noindex esperando removê-la: o Google não consegue ler o noindex de uma página que não pode rastrear. Para desindexar, permita o rastreamento e sirva noindex, ou use autenticação/remoção quando a informação for privada. Corrija o status somente se você bloqueou uma URL que deveria ser rastreada e indexada.

TL;DR — “Blocked by robots.txt” (tradução) «Bloqueado pelo robots.txt» é uma exclusão de Indexação de páginas: o Google descobriu a URL, mas não a rastreou porque robots.txt a proíbe, portanto ela não é indexada neste estado. Normalmente isso é intencional e benigno — robots.txt governa o rastreamento, não a indexação, e um Disallow nunca é uma ferramenta de desindexação. Não confunda o status com o aviso “Indexed, though blocked by robots.txt” (tradução) «Indexada, embora bloqueada pelo robots.txt» (o Google indexou uma URL bloqueada mesmo assim, geralmente por links recebidos). O erro clássico é combinar disallow com noindex: o Google não consegue rastrear a página, então nunca vê o noindex e ela pode continuar indexada. Para remover uma página, permita o rastreamento e sirva noindex. Só trate este status como problema quando você bloqueou uma URL que realmente queria indexar.

O que o status realmente informa

No relatório de Indexação de páginas do Search Console, “Blocked by robots.txt” (tradução) «Bloqueado pelo robots.txt» é um estado excluído, não um erro nem um aviso. A formulação do próprio Google é direta: a página “was blocked by your site’s robots.txt file” (tradução) «foi bloqueada pelo arquivo robots.txt do seu site», e o Google acrescenta a ressalva importante de que isso “does not guarantee that the page won’t be indexed through some other means” (tradução) «não garante que a página não será indexada por algum outro meio». Evidence for this claim Google reports Blocked by robots.txt when crawling is disallowed and warns that this does not guarantee the URL cannot be indexed by other means. Scope: Google Search Console report terminology and documented Search behavior; the label alone may not prove the underlying root cause. Confidence: high · Verified: Google: Page indexing report Essa ressalva resume o assunto; veja os detalhes abaixo.

Mecanicamente, o Googlebot sabe que a URL existe (encontrou-a por um link, sitemap ou histórico), tentou respeitar suas regras, encontrou um Disallow correspondente e parou. Sem busca não há conteúdo para indexar, então a URL permanece nesta categoria excluída. Este é o resultado esperado de um Disallow — a maioria das URLs aqui deveria estar aqui.

Rastrear não é indexar — por que Disallow não desindexa

O Google documenta robots.txt como controle de acesso ao rastreamento, não como um mecanismo confiável de remoção. Evidence for this claim Google says robots.txt manages crawler access and is not a mechanism for keeping a page out of Google. Scope: Google Search Console report terminology and documented Search behavior; the label alone may not prove the underlying root cause. Confidence: high · Verified: Google: robots.txt introduction

Este é o eixo de precisão de todo o status. robots.txt é um controle de rastreamento. O Google afirma explicitamente que ele “is not a mechanism for keeping a web page out of Google” (tradução) «não é um mecanismo para manter uma página da web fora do Google». Bloquear uma URL impede a busca; não remove a URL do índice e não é uma ferramenta de desindexação.

Como escrevi no meu artigo da Ahrefs sobre o status irmão: “crawling and indexing are two different things” (tradução) «rastreamento e indexação são duas coisas diferentes». Uma página bloqueada ainda pode acabar indexada se outras páginas apontarem para ela — o Google simplesmente não consegue ver o conteúdo nem qualquer noindex que você tenha colocado ali. E isso leva ao erro mais comum de quem chega a este relatório.

”Blocked by robots.txt” vs. “Indexed, though blocked by robots.txt”

Esses dois estados são constantemente confundidos: a causa é a mesma, mas os resultados são opostos:

Bloqueado pelo robots.txtIndexada, embora bloqueada pelo robots.txt
Categoria do relatórioExcluída (não indexada)Aviso (indexada)
O que aconteceuO Google encontrou a URL, não a rastreou e não a está indexandoO Google indexou a URL apesar de não rastreá-la
Por quêO Disallow funcionou e nada forçou a indexaçãoO Disallow funcionou, mas links/sinais a indexaram mesmo assim
Normalmente é um problema?Não — geralmente é intencionalDepende — costuma ser aceitável para URLs utilitárias

Se você está olhando a versão de aviso — uma URL bloqueada que acabou indexada, aparecendo como URL simples sem descrição — esse é o caso indexado embora bloqueado, tratado em seu próprio artigo. Este artigo trata da exclusão simples: bloqueada e não indexada.

Para URLs utilitárias, “indexada mesmo assim” geralmente não é motivo de preocupação. John Mueller, ao responder a um proprietário de site cujas URLs ?add-to-cart= do WooCommerce apareceram como indexadas embora bloqueadas, disse que não é necessário indexá-las, que bloqueá-las com robots.txt é aceitável e que, mesmo se forem “indexadas” enquanto bloqueadas, provavelmente não aparecerão na Busca a menos que alguém faça uma consulta muito específica por essas URLs — algo que usuários reais não fazem.

O conflito entre noindex e Disallow (a correção nº 1 que sai pela culatra)

Aqui está a armadilha. Alguém quer que uma página desapareça, então coloca Disallow em robots.txt e adiciona uma meta tag noindex — cinto e suspensórios. Não funciona, porque as duas instruções se contradizem.

O Google declara a regra diretamente: “For the noindex rule to be effective, the page or resource must not be blocked by a robots.txt file, and it has to be otherwise accessible to the crawler” (tradução) «para que a regra noindex seja eficaz, a página ou o recurso não pode estar bloqueado por um arquivo robots.txt e deve estar acessível de outra forma ao rastreador». Se a página está proibida, o Google nunca a rastreia, nunca vê o noindex e ela pode continuar indexada. Como escrevi no meu artigo sobre “Indexed, though blocked by robots.txt”: se o Google não consegue rastrear uma página, não vê a tag noindex e ainda pode indexá-la porque existem links.

Portanto, a sequência para desindexar é o oposto do que as pessoas tentam fazer:

  1. Permita o rastreamento da URL (remova o Disallow).
  2. Sirva noindex (meta tag robots ou cabeçalho X-Robots-Tag) e deixe o Google rastrear novamente para vê-lo.
  3. Mantenha a página rastreável com noindex depois que ela sair do índice. Bloqueá-la novamente não é uma etapa final segura — se você voltar a proibir a URL, o Google pode perder visibilidade da regra noindex no próximo rastreamento, e uma URL bloqueada mas vinculada pode ser indexada novamente a partir de links de outras páginas, produzindo exatamente o estado “indexada embora bloqueada” que você queria evitar. Se o orçamento de rastreamento da página removida for uma preocupação real, use autenticação ou exclusão (404/410), não volte ao robots.txt.

Para remoções urgentes, a ferramenta Remoções do Search Console, proteção por senha ou simplesmente excluir a página (retornando 404/410) são caminhos mais rápidos.

Como descobrir qual regra está bloqueando a URL

São três ferramentas, cada uma com uma função diferente — não espere que uma faça o trabalho das outras:

  • Inspeção de URL (GSC). Cole a URL específica. Ela informa se a URL está bloqueada agora e é a verificação mais rápida por URL.
  • Relatório de robots.txt (GSC). É um relatório de monitoramento no nível da propriedade do domínio, não um testador editável. Ele mostra os arquivos robots.txt encontrados pelo Google para seus principais hosts, o horário da última busca, o status da busca e avisos de análise, além de uma ação para solicitar novo rastreamento depois que você alterar o arquivo. Ele informa que o Google consegue ver o arquivo; não testa URLs individuais contra ele.
  • Validador de robots.txt ou parser de código aberto do Google. Para saber qual linha corresponde a uma URL, use um validador — a regra correspondente mais longa e específica vence (e Allow pode substituir um Disallow mais amplo). Evidence for this claim The current Search Console robots.txt report shows fetched files, history, fetch status, and parsing issues and can request a file recrawl; for a specific URL Google points to URL Inspection, a validator, or its open-source robots library rather than an editable legacy GSC tester. Scope: robots.txt diagnosis Confidence: high · Verified: Unblock a page blocked by robots.txt

Depois de encontrar a linha ofensiva, a correção depende de onde está seu robots.txt. Se você controla o arquivo diretamente, remova ou corrija a regra (e cuide da sintaxe). Em uma plataforma hospedada como Wix, Shopify ou Squarespace, talvez seja necessário seguir a documentação específica do provedor, pois algumas plataformas gerenciam robots.txt por você.

Meu experimento: o que acontece quando você bloqueia uma página que queria indexar

A pergunta realmente útil é: se você bloqueia por acidente uma página que deveria ranquear, quão ruim é isso? Eu fiz o teste diretamente. Em 30 de janeiro de 2023, bloqueei duas páginas que já ranqueavam — “Top Bing Searches” e “Top YouTube Searches” — com robots.txt e acompanhei o que aconteceu.

O dano foi real, mas menor do que eu esperava. Perdemos uma posição aqui e ali (algumas palavras-chave caíram uma ou duas posições e algumas até subiram) e perdemos todos os snippets em destaque dessas páginas enquanto estavam bloqueadas — eles voltaram depois que removi o bloqueio. A aparência na SERP também piorou: o Google mostrou “no information is available for this page” (tradução) «não há informações disponíveis para esta página» em vez da meta description e perdeu nossos títulos personalizados. Como a listagem ficou pior, os cliques caíram mais do que as impressões — o CTR sofreu o impacto.

Meu resumo na época foi: “We lost a position here or there and all of the featured snippets for the pages. I expected a lot more impact, but the world didn’t end” (tradução) «perdemos uma posição aqui ou ali e todos os snippets em destaque das páginas. Eu esperava um impacto muito maior, mas o mundo não acabou». E a conclusão que continuo defendendo é: não bloqueie páginas que você quer indexar. Isso prejudica. Talvez não tanto quanto você imagina — mas prejudica. Essa é a forma correta de interpretar este relatório. Se tudo no seu grupo “Bloqueado pelo robots.txt” foi bloqueado de propósito, tudo bem. Se uma página importante está ali, retire-a.

Uma observação sobre o escopo deste experimento: as duas páginas já ranqueavam e estavam indexadas antes do bloqueio. Portanto, medi o que acontece quando uma página indexada é empurrada para o estado “indexada embora bloqueada” — não o que acontece com uma URL que nunca foi indexada e simplesmente está nesta categoria de exclusão. Se uma URL aqui nunca foi indexada, desbloqueá-la apenas permite que o Google a rastreie e considere normalmente; não há histórico de snippet em destaque ou CTR a perder, porque isso nunca existiu.

A árvore de decisão

  • Você pretendia bloqueá-la? → Deixe como está. Está funcionando como pretendido.
  • Não — você quer indexá-la? → Remova ou torne menos restritiva a regra de robots.txt; depois solicite a indexação.
  • Você quer que ela desapareça do Google? → Não use Disallow. Permita o rastreamento + noindex (ou use a ferramenta Remoções/exclua a página) e mantenha-a rastreável; bloqueá-la novamente pode esconder a regra noindex outra vez.
  • É uma URL bloqueada que acabou indexada? → Esse é o caso indexado embora bloqueado, não este; trate-o no artigo correspondente.
  • A página contém informação sensível ou privada?robots.txt não é controle de acesso; é uma solicitação que os bots podem ignorar. Use autenticação ou proteção por senha, não Disallow.

O princípio rastreamento versus indexação é universal: o Bing também respeita robots.txt para rastrear, e remover uma URL do Bing usa de forma semelhante a ferramenta Block URLs ou noindex em uma página rastreável — não um Disallow isolado.

Para o arquivo mais amplo em si — sintaxe, curingas, onde ele vive e o que pode ou não fazer — consulte o guia de robots.txt. Para saber como as decisões de indexação são tomadas mais acima no fluxo, consulte o hub de indexação.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.