Bloqueado pelo robots.txt (status do GSC)
O que significa o status “Bloqueado pelo robots.txt” no relatório de indexação de páginas do Google Search Console: uma URL excluída da indexação porque o robots.txt proibiu o rastreamento. Normalmente é intencional. Veja a diferença para “Indexada, embora bloqueada”, o conflito entre noindex e Disallow e como corrigir um bloqueio acidental.
Idiomas
1 sinal de evidência nesta página
- Ferramenta relacionada ativarobots.txt Tester
“Bloqueado pelo robots.txt” é uma exclusão do relatório de indexação de páginas: o Google descobriu a URL, mas não a rastreou porque uma regra Disallow proibiu o rastreamento. Isso normalmente é intencional. robots.txt controla rastreamento, não indexação; portanto, bloquear uma URL não é uma forma confiável de removê-la da Busca. Se a página já era conhecida por links ou sitemaps, o Google ainda pode indexar informações sobre ela sem conseguir ler o conteúdo. O caso “Indexada, embora bloqueada pelo robots.txt” é justamente esse resultado oposto. Não combine Disallow com noindex esperando removê-la: o Google não consegue ler o noindex de uma página que não pode rastrear. Para desindexar, permita o rastreamento e sirva noindex, ou use autenticação/remoção quando a informação for privada. Corrija o status somente se você bloqueou uma URL que deveria ser rastreada e indexada.
TL;DR — “Blocked by robots.txt” (tradução) «Bloqueado pelo robots.txt» no Search Console significa que o Google encontrou a página, mas não a leu porque o arquivo
robots.txtmanda os rastreadores ficarem fora. Normalmente isso é intencional e está tudo bem — é o resultado normal de um bloqueio, não um erro. Só é um problema se você bloqueou uma página que realmente queria no Google.
O que este status significa
Abra o relatório Indexação de páginas no Google Search Console, clique em “Blocked by robots.txt” (tradução) «Bloqueado pelo robots.txt» e você verá uma lista de URLs que o Google escolheu não indexar. O motivo é simples: o Google encontrou essas URLs, mas o arquivo robots.txt do site diz que os rastreadores não podem buscá-las. Evidence for this claim Google reports Blocked by robots.txt when crawling is disallowed and warns that this does not guarantee the URL cannot be indexed by other means. Scope: Google Search Console report terminology and documented Search behavior; the label alone may not prove the underlying root cause. Confidence: high · Verified: Google: Page indexing report O rótulo informa o bloqueio de rastreamento; não garante que a URL jamais possa ser indexada por outros sinais.
A primeira coisa que digo às pessoas é: não entre em pânico. Este status geralmente é intencional. Se você, seu CMS ou um plugin bloqueou algo de propósito — resultados de busca interna, URLs de navegação facetada, um caminho de staging ou URLs de carrinho e checkout — vê-lo aqui é exatamente o que deveria acontecer. O Google está confirmando que o bloqueio funcionou, não sinalizando um erro.
A única ideia que você precisa guardar
robots.txt controla o rastreamento, não a indexação. São duas coisas diferentes. Bloquear uma página em robots.txt impede o Google de lê-la; isso não a remove do Google Evidence for this claim Google says robots.txt manages crawler access and is not a mechanism for keeping a page out of Google. Scope: Google Search Console report terminology and documented Search behavior; the label alone may not prove the underlying root cause. Confidence: high · Verified: Google: robots.txt introduction nem é uma forma de remover uma página da Busca. Já testei pessoalmente o que acontece quando você bloqueia uma página — há mais detalhes na aba Avançado —, mas o ponto principal é: o bloqueio interrompe o rastreamento, ponto final.
Isso é um problema?
Faça uma verificação: você pretendia bloquear estas URLs?
- Sim, de propósito → deixe como está. Está funcionando como pretendido.
- Não, essa página deveria estar no Google → este é o caso a corrigir. Encontre em
robots.txta regra que está capturando a URL e remova-a ou torne-a menos restritiva; depois solicite a indexação.
Você também pode ver um status relacionado, mas diferente: “Indexed, though blocked by robots.txt” (tradução) «Indexada, embora bloqueada pelo robots.txt». Esse status é um aviso, não uma exclusão — significa que o Google indexou uma URL bloqueada mesmo assim (geralmente porque outras páginas apontam para ela). A causa é a mesma, mas o resultado é oposto. Se é esse o caso que você está vendo, ele é tratado em outro artigo. Evidence for this claim Google reports Blocked by robots.txt when crawling is disallowed and warns that this does not guarantee the URL cannot be indexed by other means. Scope: Google Search Console report terminology and documented Search behavior; the label alone may not prove the underlying root cause. Confidence: high · Verified: Google: Page indexing report
Mais uma coisa que robots.txt não pode fazer: manter algo privado. É uma solicitação, não um controle de acesso — bots bem-comportados a respeitam, mas nada os obriga a isso, e nada impede que a URL apareça em outro lugar (um link, uma captura de tela ou um scraper que ignora robots.txt completamente). Se uma página contém informação sensível, proteja-a com login ou senha, não com Disallow.
O erro a evitar
Muitas pessoas tentam remover uma página do Google bloqueando-a em robots.txt, às vezes adicionando uma tag noindex ao mesmo tempo por garantia. Isso não funciona — e pode sair pela culatra. Se o Google não consegue rastrear a página, nunca consegue ver o noindex nela, então a página pode continuar no Google. Para realmente tirar uma página da Busca, faça o oposto: permita que o Google a rastreie e adicione noindex.
Quer a versão completa — como encontrar a regra exata que bloqueia, por que a combinação noindex + disallow entra em conflito e o que meu próprio experimento mostrou? Mude para a aba Avançado.
TL;DR — “Blocked by robots.txt” (tradução) «Bloqueado pelo robots.txt» é uma exclusão de Indexação de páginas: o Google descobriu a URL, mas não a rastreou porque
robots.txta proíbe, portanto ela não é indexada neste estado. Normalmente isso é intencional e benigno —robots.txtgoverna o rastreamento, não a indexação, e um Disallow nunca é uma ferramenta de desindexação. Não confunda o status com o aviso “Indexed, though blocked by robots.txt” (tradução) «Indexada, embora bloqueada pelo robots.txt» (o Google indexou uma URL bloqueada mesmo assim, geralmente por links recebidos). O erro clássico é combinardisallowcomnoindex: o Google não consegue rastrear a página, então nunca vê onoindexe ela pode continuar indexada. Para remover uma página, permita o rastreamento e sirvanoindex. Só trate este status como problema quando você bloqueou uma URL que realmente queria indexar.
O que o status realmente informa
No relatório de Indexação de páginas do Search Console, “Blocked by robots.txt” (tradução) «Bloqueado pelo robots.txt» é um estado excluído, não um erro nem um aviso. A formulação do próprio Google é direta: a página “was blocked by your site’s robots.txt file” (tradução) «foi bloqueada pelo arquivo robots.txt do seu site», e o Google acrescenta a ressalva importante de que isso “does not guarantee that the page won’t be indexed through some other means” (tradução) «não garante que a página não será indexada por algum outro meio». Evidence for this claim Google reports Blocked by robots.txt when crawling is disallowed and warns that this does not guarantee the URL cannot be indexed by other means. Scope: Google Search Console report terminology and documented Search behavior; the label alone may not prove the underlying root cause. Confidence: high · Verified: Google: Page indexing report Essa ressalva resume o assunto; veja os detalhes abaixo.
Mecanicamente, o Googlebot sabe que a URL existe (encontrou-a por um link, sitemap ou histórico), tentou respeitar suas regras, encontrou um Disallow correspondente e parou. Sem busca não há conteúdo para indexar, então a URL permanece nesta categoria excluída. Este é o resultado esperado de um Disallow — a maioria das URLs aqui deveria estar aqui.
Rastrear não é indexar — por que Disallow não desindexa
O Google documenta robots.txt como controle de acesso ao rastreamento, não como um mecanismo confiável de remoção. Evidence for this claim Google says robots.txt manages crawler access and is not a mechanism for keeping a page out of Google. Scope: Google Search Console report terminology and documented Search behavior; the label alone may not prove the underlying root cause. Confidence: high · Verified: Google: robots.txt introduction
Este é o eixo de precisão de todo o status. robots.txt é um controle de rastreamento. O Google afirma explicitamente que ele “is not a mechanism for keeping a web page out of Google” (tradução) «não é um mecanismo para manter uma página da web fora do Google». Bloquear uma URL impede a busca; não remove a URL do índice e não é uma ferramenta de desindexação.
Como escrevi no meu artigo da Ahrefs sobre o status irmão: “crawling and indexing are two different things” (tradução) «rastreamento e indexação são duas coisas diferentes». Uma página bloqueada ainda pode acabar indexada se outras páginas apontarem para ela — o Google simplesmente não consegue ver o conteúdo nem qualquer noindex que você tenha colocado ali. E isso leva ao erro mais comum de quem chega a este relatório.
”Blocked by robots.txt” vs. “Indexed, though blocked by robots.txt”
Esses dois estados são constantemente confundidos: a causa é a mesma, mas os resultados são opostos:
| Bloqueado pelo robots.txt | Indexada, embora bloqueada pelo robots.txt | |
|---|---|---|
| Categoria do relatório | Excluída (não indexada) | Aviso (indexada) |
| O que aconteceu | O Google encontrou a URL, não a rastreou e não a está indexando | O Google indexou a URL apesar de não rastreá-la |
| Por quê | O Disallow funcionou e nada forçou a indexação | O Disallow funcionou, mas links/sinais a indexaram mesmo assim |
| Normalmente é um problema? | Não — geralmente é intencional | Depende — costuma ser aceitável para URLs utilitárias |
Se você está olhando a versão de aviso — uma URL bloqueada que acabou indexada, aparecendo como URL simples sem descrição — esse é o caso indexado embora bloqueado, tratado em seu próprio artigo. Este artigo trata da exclusão simples: bloqueada e não indexada.
Para URLs utilitárias, “indexada mesmo assim” geralmente não é motivo de preocupação. John Mueller, ao responder a um proprietário de site cujas URLs ?add-to-cart= do WooCommerce apareceram como indexadas embora bloqueadas, disse que não é necessário indexá-las, que bloqueá-las com robots.txt é aceitável e que, mesmo se forem “indexadas” enquanto bloqueadas, provavelmente não aparecerão na Busca a menos que alguém faça uma consulta muito específica por essas URLs — algo que usuários reais não fazem.
O conflito entre noindex e Disallow (a correção nº 1 que sai pela culatra)
Aqui está a armadilha. Alguém quer que uma página desapareça, então coloca Disallow em robots.txt e adiciona uma meta tag noindex — cinto e suspensórios. Não funciona, porque as duas instruções se contradizem.
O Google declara a regra diretamente: “For the noindex rule to be effective, the page or resource must not be blocked by a robots.txt file, and it has to be otherwise accessible to the crawler” (tradução) «para que a regra noindex seja eficaz, a página ou o recurso não pode estar bloqueado por um arquivo robots.txt e deve estar acessível de outra forma ao rastreador». Se a página está proibida, o Google nunca a rastreia, nunca vê o noindex e ela pode continuar indexada. Como escrevi no meu artigo sobre “Indexed, though blocked by robots.txt”: se o Google não consegue rastrear uma página, não vê a tag noindex e ainda pode indexá-la porque existem links.
Portanto, a sequência para desindexar é o oposto do que as pessoas tentam fazer:
- Permita o rastreamento da URL (remova o
Disallow). - Sirva
noindex(meta tag robots ou cabeçalhoX-Robots-Tag) e deixe o Google rastrear novamente para vê-lo. - Mantenha a página rastreável com
noindexdepois que ela sair do índice. Bloqueá-la novamente não é uma etapa final segura — se você voltar a proibir a URL, o Google pode perder visibilidade da regranoindexno próximo rastreamento, e uma URL bloqueada mas vinculada pode ser indexada novamente a partir de links de outras páginas, produzindo exatamente o estado “indexada embora bloqueada” que você queria evitar. Se o orçamento de rastreamento da página removida for uma preocupação real, use autenticação ou exclusão (404/410), não volte aorobots.txt.
Para remoções urgentes, a ferramenta Remoções do Search Console, proteção por senha ou simplesmente excluir a página (retornando 404/410) são caminhos mais rápidos.
Como descobrir qual regra está bloqueando a URL
São três ferramentas, cada uma com uma função diferente — não espere que uma faça o trabalho das outras:
- Inspeção de URL (GSC). Cole a URL específica. Ela informa se a URL está bloqueada agora e é a verificação mais rápida por URL.
- Relatório de
robots.txt(GSC). É um relatório de monitoramento no nível da propriedade do domínio, não um testador editável. Ele mostra os arquivosrobots.txtencontrados pelo Google para seus principais hosts, o horário da última busca, o status da busca e avisos de análise, além de uma ação para solicitar novo rastreamento depois que você alterar o arquivo. Ele informa que o Google consegue ver o arquivo; não testa URLs individuais contra ele. - Validador de
robots.txtou parser de código aberto do Google. Para saber qual linha corresponde a uma URL, use um validador — a regra correspondente mais longa e específica vence (eAllowpode substituir umDisallowmais amplo). Evidence for this claim The current Search Console robots.txt report shows fetched files, history, fetch status, and parsing issues and can request a file recrawl; for a specific URL Google points to URL Inspection, a validator, or its open-source robots library rather than an editable legacy GSC tester. Scope: robots.txt diagnosis Confidence: high · Verified: Unblock a page blocked by robots.txt
Depois de encontrar a linha ofensiva, a correção depende de onde está seu robots.txt. Se você controla o arquivo diretamente, remova ou corrija a regra (e cuide da sintaxe). Em uma plataforma hospedada como Wix, Shopify ou Squarespace, talvez seja necessário seguir a documentação específica do provedor, pois algumas plataformas gerenciam robots.txt por você.
Meu experimento: o que acontece quando você bloqueia uma página que queria indexar
A pergunta realmente útil é: se você bloqueia por acidente uma página que deveria ranquear, quão ruim é isso? Eu fiz o teste diretamente. Em 30 de janeiro de 2023, bloqueei duas páginas que já ranqueavam — “Top Bing Searches” e “Top YouTube Searches” — com robots.txt e acompanhei o que aconteceu.
O dano foi real, mas menor do que eu esperava. Perdemos uma posição aqui e ali (algumas palavras-chave caíram uma ou duas posições e algumas até subiram) e perdemos todos os snippets em destaque dessas páginas enquanto estavam bloqueadas — eles voltaram depois que removi o bloqueio. A aparência na SERP também piorou: o Google mostrou “no information is available for this page” (tradução) «não há informações disponíveis para esta página» em vez da meta description e perdeu nossos títulos personalizados. Como a listagem ficou pior, os cliques caíram mais do que as impressões — o CTR sofreu o impacto.
Meu resumo na época foi: “We lost a position here or there and all of the featured snippets for the pages. I expected a lot more impact, but the world didn’t end” (tradução) «perdemos uma posição aqui ou ali e todos os snippets em destaque das páginas. Eu esperava um impacto muito maior, mas o mundo não acabou». E a conclusão que continuo defendendo é: não bloqueie páginas que você quer indexar. Isso prejudica. Talvez não tanto quanto você imagina — mas prejudica. Essa é a forma correta de interpretar este relatório. Se tudo no seu grupo “Bloqueado pelo robots.txt” foi bloqueado de propósito, tudo bem. Se uma página importante está ali, retire-a.
Uma observação sobre o escopo deste experimento: as duas páginas já ranqueavam e estavam indexadas antes do bloqueio. Portanto, medi o que acontece quando uma página indexada é empurrada para o estado “indexada embora bloqueada” — não o que acontece com uma URL que nunca foi indexada e simplesmente está nesta categoria de exclusão. Se uma URL aqui nunca foi indexada, desbloqueá-la apenas permite que o Google a rastreie e considere normalmente; não há histórico de snippet em destaque ou CTR a perder, porque isso nunca existiu.
A árvore de decisão
- Você pretendia bloqueá-la? → Deixe como está. Está funcionando como pretendido.
- Não — você quer indexá-la? → Remova ou torne menos restritiva a regra de
robots.txt; depois solicite a indexação. - Você quer que ela desapareça do Google? → Não use Disallow. Permita o rastreamento +
noindex(ou use a ferramenta Remoções/exclua a página) e mantenha-a rastreável; bloqueá-la novamente pode esconder a regranoindexoutra vez. - É uma URL bloqueada que acabou indexada? → Esse é o caso indexado embora bloqueado, não este; trate-o no artigo correspondente.
- A página contém informação sensível ou privada? →
robots.txtnão é controle de acesso; é uma solicitação que os bots podem ignorar. Use autenticação ou proteção por senha, não Disallow.
O princípio rastreamento versus indexação é universal: o Bing também respeita robots.txt para rastrear, e remover uma URL do Bing usa de forma semelhante a ferramenta Block URLs ou noindex em uma página rastreável — não um Disallow isolado.
Para o arquivo mais amplo em si — sintaxe, curingas, onde ele vive e o que pode ou não fazer — consulte o guia de robots.txt. Para saber como as decisões de indexação são tomadas mais acima no fluxo, consulte o hub de indexação.
Resumo de IA
Uma versão condensada do conteúdo Avançado:
- “Blocked by robots.txt” é uma exclusão de Indexação de páginas. O Google encontrou a URL, mas não a rastreou porque
robots.txta proíbe; portanto, ela não é indexada neste estado. É o resultado normal de um bloqueio — geralmente intencional e benigno. robots.txtcontrola rastreamento, não indexação. O Google diz que não é um mecanismo para manter uma página da web fora do Google. Disallow impede a busca, mas não desindexa a página.- Não confunda com o aviso “Indexed, though blocked by robots.txt” (tradução) «Indexada, embora bloqueada pelo robots.txt». A causa é a mesma e o resultado é oposto: uma URL bloqueada acabou indexada mesmo assim, geralmente por links recebidos. Para URLs utilitárias, Mueller diz que isso costuma ser aceitável — URLs bloqueadas e indexadas raramente aparecem em consultas normais.
- O principal tiro pela culatra:
noindex+disallowjuntos. O Google não consegue rastrear uma página proibida, então nunca vê onoindexe ela pode continuar indexada. A regra do Google é que, paranoindexfuncionar, a página não pode estar bloqueada porrobots.txt. - Para realmente remover uma página: permita o rastreamento, sirva
noindex, deixe o Google rastrear novamente e mantenha a página rastreável. Bloqueá-la outra vez pode esconder a regranoindexe permitir que links indexem a URL — o oposto do que você queria. Para casos urgentes, use a ferramenta Remoções, proteção por senha ou exclua a página. - Encontre a regra de bloqueio com a Inspeção de URL (por URL) e um validador de
robots.txt(qual linha corresponde; vence a regra mais longa e específica). O relatório derobots.txtdo GSC monitora o status de busca do arquivo; não testa URLs individuais. A correção depende de onde o arquivo vive; plataformas hospedadas podem exigir instruções próprias. - Experimento de Patrick: bloquear duas páginas que já ranqueavam e já estavam indexadas custou uma posição aqui e ali e todos os snippets em destaque, piorou a listagem da SERP e reduziu cliques mais do que impressões — “o mundo não acabou”, mas “não bloqueie páginas que você quer indexar”. Isso mostra o que acontece quando uma página indexada vai para “indexada embora bloqueada”; não prevê o resultado de uma URL que nunca foi indexada.
robots.txtnão é controle de segurança. É uma solicitação que os bots podem escolher ignorar. Proteja conteúdo sensível com autenticação, não com Disallow.- Regra de decisão: pretendia bloquear → deixe; quer indexar → desbloqueie + solicite indexação; quer remover → permita o rastreamento +
noindexe mantenha a página rastreável.
Documentação oficial
Documentação de fontes primárias dos mecanismos de busca.
- Relatório de indexação de páginas — o relatório onde este status aparece, com as definições literais de “Blocked by robots.txt” (tradução) «Bloqueado pelo robots.txt» e “Indexed, though blocked by robots.txt” (tradução) «Indexada, embora bloqueada pelo robots.txt».
- Desbloquear uma página bloqueada pelo robots.txt — instruções passo a passo do Google para encontrar e corrigir a regra que bloqueia uma URL.
- Relatório do robots.txt — relatório de propriedade de domínio que mostra arquivos robots.txt encontrados, status de busca, avisos e pedido de novo rastreamento.
- Introdução ao robots.txt — o que robots.txt faz e não faz, incluindo que não é um mecanismo para manter uma página fora do Google.
- Bloquear a indexação com noindex — a regra de que
noindexfunciona apenas em uma página que não esteja bloqueada por robots.txt (o conflito noindex + disallow).
Bing / Microsoft
- Ajuda do Bing Webmaster Tools — o Bing também respeita robots.txt para rastreamento; seu Testador de robots.txt e a ferramenta Block URLs seguem o mesmo princípio rastreamento versus indexação.
Citações da fonte
Declarações registradas do Google. Cada link é um link profundo que salta para a passagem citada na página de origem.
Google — o que o status significa
- “This page was blocked by your site’s robots.txt file. You can verify this using the robots.txt tester. Note that this does not guarantee that the page won’t be indexed through some other means.” (tradução) «Esta página foi bloqueada pelo arquivo robots.txt do seu site. Você pode verificar isso usando o testador de robots.txt. Observe que isso não garante que a página não será indexada por algum outro meio.» — Ajuda do Google Search Console, relatório de Indexação de páginas. Ir para a citação
Google — robots.txt controla rastreamento, não indexação
- “it is not a mechanism for keeping a web page out of Google.” (tradução) «não é um mecanismo para manter uma página da web fora do Google.» — Google Search Central, Introdução ao robots.txt. Ir para a citação
Google — por que noindex + disallow entram em conflito
- “For the
noindexrule to be effective, the page or resource must not be blocked by a robots.txt file, and it has to be otherwise accessible to the crawler.” (tradução) «Para que a regra noindex seja eficaz, a página ou o recurso não pode estar bloqueado por um arquivo robots.txt e precisa estar acessível de outra forma ao rastreador.» — Google Search Central, Bloquear a indexação com noindex. Ir para a citação
Estatísticas e dados de primeira parte que vale citar
- Bloquear páginas que ranqueiam: dano real, mas recuperável. No meu experimento, bloquear duas páginas que já ranqueavam e já estavam indexadas com
robots.txt(iniciado em 30 de janeiro de 2023) fez as páginas perderem uma posição aqui ou ali e todos os snippets em destaque; a listagem da SERP mudou para “no information is available for this page” (tradução) «não há informações disponíveis para esta página» e os cliques caíram mais do que as impressões. Meu resumo foi: “I expected a lot more impact, but the world didn’t end” (tradução) «eu esperava um impacto muito maior, mas o mundo não acabou» — porém “don’t block pages you want indexed. It hurts” (tradução) «não bloqueie páginas que você quer indexar. Isso prejudica». O teste mede uma página indexada que foi empurrada para “indexada embora bloqueada”; não prevê o resultado de uma URL que nunca foi indexada. Fonte - URLs utilitárias bloqueadas que são indexadas costumam ser inofensivas. Segundo John Mueller, bloquear URLs no estilo add-to-cart com robots.txt é aceitável; mesmo se aparecerem como indexadas embora bloqueadas, provavelmente não surgirão em consultas normais. Cobertura
- Quão comum é o bloqueio por robots.txt na web — dados de taxa de bloqueio sobre quais rastreadores são mais proibidos em cerca de 140 milhões de sites, de um estudo meu com Xibeijia Guan. Fonte
O erro que define este status: noindex + Disallow
Erro: combinar Disallow com noindex para tentar remover uma página. Este é o erro mais comum ligado a “Blocked by robots.txt” (tradução) «Bloqueado pelo robots.txt» e vale nomeá-lo porque parece uma solução dupla, mas é autodestrutivo. Alguém quer remover uma página do Google, então coloca Disallow em robots.txt e acrescenta uma meta tag noindex por garantia. Não funciona. O Google declara a regra claramente: “For the noindex rule to be effective, the page or resource must not be blocked by a robots.txt file, and it has to be otherwise accessible to the crawler.” (tradução) «Para que noindex funcione, a página ou o recurso não pode estar bloqueado por robots.txt e precisa estar acessível ao rastreador». Se a página está proibida, o Google nunca a rastreia, nunca vê o noindex e ela pode continuar indexada — exatamente o oposto do resultado pretendido. A correção é inverter o instinto: permita o rastreamento e depois sirva noindex.
Mito: “Um Disallow em robots.txt é uma ferramenta de desindexação.” Não é, e o Google diz isso diretamente: robots.txt “is not a mechanism for keeping a web page out of Google” (tradução) «não é um mecanismo para manter uma página da web fora do Google». Bloquear uma URL interrompe a busca; não remove a URL do índice, e uma página bloqueada mas vinculada ainda pode aparecer (o status irmão “Indexed, though blocked by robots.txt” (tradução) «Indexada, embora bloqueada pelo robots.txt»). Use noindex com rastreamento permitido ou a ferramenta Remoções quando o objetivo for realmente remover.
Mito: “Tudo na categoria ‘Blocked by robots.txt’ é um problema a corrigir.” Geralmente é o oposto. Este status é o resultado esperado de um Disallow intencional — resultados de busca interna, parâmetros de navegação facetada e caminhos de staging. Só vale tratar como problema uma URL que você realmente queria indexar e que entrou na lista por acidente.
Erro: bloquear uma página que você quer ranquear sem verificar o custo primeiro. Bloquear uma página importante para “organizar as coisas” ou “economizar orçamento de rastreamento” é mais arriscado do que parece. No meu experimento com duas páginas que ranqueavam, perdi todos os snippets em destaque enquanto elas estavam bloqueadas e os cliques caíram mais do que as impressões porque a listagem da SERP passou a dizer “no information is available for this page” (tradução) «não há informações disponíveis para esta página». As posições em si permaneceram em grande parte, mas trate um bloqueio por robots.txt em uma página importante como uma decisão real, não como um pequeno ajuste de manutenção.
Lista de verificação para triagem de “Blocked by robots.txt”
Siga esta lista de cima para baixo quando abrir o status no Search Console:
- Abra o relatório de Indexação de páginas e clique em “Blocked by robots.txt” (tradução) «Bloqueado pelo robots.txt» para ver a lista real de URLs afetadas.
- Para cada URL (ou padrão de URLs), pergunte: eu pretendia bloqueá-la?
- Se sim — busca interna, navegação facetada, staging, carrinho/checkout — deixe como está. Para essa URL, o status está funcionando como pretendido.
- Se não, ou se não tiver certeza — passe a URL pela Inspeção de URL para confirmar que está bloqueada agora, não em uma fotografia antiga.
- Encontre a regra específica que captura a URL com o robots.txt Tester (ou outro validador de robots.txt) — a regra correspondente mais longa e específica vence, e
Allowpode substituir umDisallowmais amplo. O relatório de robots.txt do GSC monitora o status de busca do arquivo; não testa URLs individuais. - Confirme que você não está também dependendo de
noindexna mesma URL proibida — essa combinação não funciona; se o objetivo é remover, use permitir-rastreamento + noindex. - Remova ou torne menos restritiva a regra de bloqueio (diretamente se você controla
robots.txtou seguindo a documentação da plataforma hospedada, como Wix, Shopify ou Squarespace). - Solicite a indexação da URL corrigida no Search Console depois que o bloqueio desaparecer.
- Confira se você não está confundindo este status com “Indexed, though blocked by robots.txt” (tradução) «Indexada, embora bloqueada pelo robots.txt» — é o resultado oposto (indexada mesmo assim) e precisa de outra correção.
- Verifique a categoria novamente em algumas semanas para confirmar que a contagem evoluiu como esperado (caiu nas URLs corrigidas e ficou estável nos bloqueios intencionais).
- Se alguma dessas URLs contém informação sensível, não dependa de Disallow para mantê-la privada — adicione autenticação ou proteção por senha.
Trabalhe a árvore de decisão
Responda a uma pergunta por vez para escolher o próximo passo correto para uma URL na categoria “Blocked by robots.txt” (tradução) «Bloqueado pelo robots.txt».
What should I do about a URL blocked by robots.txt?
Os modelos mentais
1. Rastrear ≠ indexar. O status se torna confuso quando você mistura os dois conceitos. robots.txt controla rastreamento — se o Googlebot busca uma página. Ele não controla diretamente a indexação — se a URL acaba no índice do Google. Uma página proibida não é indexada por meio do rastreamento, mas ainda pode ser indexada sem conteúdo se outras páginas apontarem para ela. Mantenha as duas ideias separadas e a maior parte deste status deixa de ser confusa.
2. A triagem de uma pergunta. Antes de qualquer coisa, pergunte: eu pretendia bloquear isto? Sim → deixe; está funcionando como pretendido. Não → este é o caso que vale corrigir. Essa única pergunta classifica corretamente quase toda URL da categoria.
3. Para remover uma página, inverta o instinto. O movimento natural — Disallow mais noindex, “por segurança” — é exatamente o contrário. O Google não consegue ver uma diretiva em uma página que nunca busca. A sequência correta é: permita o rastreamento e depois sirva noindex. Sempre que alguém quiser usar Disallow para fazer uma página desaparecer, esse é o sinal para aplicar este modelo.
4. robots.txt é ferramenta de orçamento de rastreamento, não de resultados de busca. Use-o para manter bots longe de espaços de URLs de baixo valor ou infinitos (busca interna, facetas, staging), direcionando o esforço de rastreamento para páginas que você quer que sejam encontradas — não como alavanca do que aparece na Busca. Essa função pertence a noindex, proteção por senha ou exclusão.
Acompanhe a contagem da categoria, não apenas sua existência
O número que vale acompanhar é quantas URLs ficam na linha “Blocked by robots.txt” (tradução) «Bloqueado pelo robots.txt» do relatório de Indexação de páginas ao longo do tempo — uma fotografia isolada não informa se uma correção funcionou ou se novos bloqueios não intencionais estão surgindo.
Contagem da categoria “Blocked by robots.txt” ao longo do tempo
- Métrica — Contagem de URLs na linha “Blocked by robots.txt” (tradução) «Bloqueado pelo robots.txt» do relatório de Indexação de páginas do GSC, acompanhada ao longo do tempo.
- O que isso informa — Se a categoria está se comportando como esperado. Para URLs que você bloqueia intencionalmente (busca interna, facetas, staging), a contagem deve permanecer aproximadamente estável enquanto esses espaços de URL não mudarem; um salto repentino geralmente significa que uma seção nova foi capturada acidentalmente por um padrão
Disallowexistente. Para uma URL desbloqueada de propósito porque você queria indexá-la, essa URL deve sair da categoria depois do próximo rastreamento. - Como obter — Relatório de Indexação de páginas do GSC, filtrado pela linha “Blocked by robots.txt”; faça verificações pontuais com a Inspeção de URL para confirmar o status atual, não uma fotografia antiga.
- Referência/intervalo realista — Não existe meta universal — depende inteiramente de quanto do site é intencionalmente proibido. O parâmetro honesto é zero URLs nesta categoria que você realmente queria indexar e uma tendência estável para o restante. Registre sua própria contagem de base antes de julgar se uma mudança foi na direção correta.
- Periodicidade — Verifique logo depois de qualquer alteração em
robots.txt; fora isso, uma olhada periódica (mensal é suficiente para a maioria dos sites) basta para detectar desvio.
Playbook: remover uma página do Google de verdade
Uma sequência repetível para quando uma URL precisa sair do índice do Google de verdade — não apenas ser impedida de futuros rastreamentos.
1. Confirme que o objetivo é remoção, não apenas controle de rastreamento. Se o objetivo é apenas “parar de desperdiçar orçamento de rastreamento”, um Disallow simples em robots.txt é a ferramenta certa e este playbook não se aplica — a página pode continuar indexada por links, e isso é aceitável. Use esta sequência apenas quando a página realmente precisa sair do índice.
2. Permita o rastreamento. Remova ou torne menos restritiva a regra Disallow que bloqueia a URL. Confirme com o robots.txt Tester que a URL agora é permitida, não bloqueada.
3. Sirva noindex. Adicione uma meta tag robots noindex ou um cabeçalho HTTP X-Robots-Tag à página agora rastreável. Esta é a instrução real de remoção; Disallow nunca fazia esse trabalho.
4. Deixe o Google rastrear novamente. O Google precisa buscar a página outra vez para ver noindex. Não há como forçar uma busca instantânea além de solicitar a indexação no Search Console e esperar o próximo rastreamento.
5. Confirme a remoção. Confira a Inspeção de URL no Search Console para ver o status de indexação atual. Quando o relatório indicar que a página está excluída por noindex, a remoção funcionou.
6. Não trate o re-bloqueio como etapa final. Depois que a página sair, adicionar Disallow novamente tem custo: no próximo rastreamento o Google pode perder visibilidade da regra noindex, e uma URL bloqueada mas vinculada pode voltar a ser indexada pelos links de outras páginas — exatamente o estado “indexada embora bloqueada” que você queria evitar. Se orçamento de rastreamento for a preocupação, pese esse risco ou use autenticação/exclusão em páginas que precisam continuar removidas.
7. Para casos urgentes, não espere. Se a página precisa sair agora, use a ferramenta Remoções do Search Console, proteja-a com senha ou exclua-a de vez (retornando 404/410) em vez de esperar o ciclo rastrear-e-depois-noindex.
Prompts de IA prontos para uso
Prompts para copiar e colar e trabalhar um bloqueio de robots.txt com um LLM. Trate a saída como uma hipótese inicial — confirme qualquer ponto importante com o robots.txt Tester ou com a Inspeção de URL do Search Console antes de agir.
Descubra qual regra bloqueia qual URL
Here is my robots.txt file and a list of URLs. For each URL, tell me whether it
is blocked or allowed, and quote the exact line in robots.txt responsible
(remember: the longest, most specific matching rule wins, and an Allow can
override a broader Disallow). If a URL isn't matched by any rule, say so.
ROBOTS.TXT:
[paste]
URLS:
[paste list, one per line]Verifique se um bloqueio parece intencional
I run a [type of site]. Here is my robots.txt file. For each Disallow rule, tell
me what kind of URLs it likely targets (e.g. internal search, faceted
navigation, staging, cart/checkout, admin) and flag any rule that looks broad
enough it might be catching content pages by accident. Don't guess about pages
you can't see — just reason from the rule pattern and ask me to confirm
anything ambiguous.
ROBOTS.TXT:
[paste]Esboce a sequência noindex e depois rastreamento para uma página específica
I need to remove [URL] from Google. It's currently blocked by this robots.txt
rule: [paste rule]. Walk me through the exact sequence of changes in order
(robots.txt edit, meta tag or header change, what to check in Search Console at
each step) so I don't accidentally leave the noindex tag unseen by Google. Teste uma URL contra as regras do seu robots.txt
Antes de mudar qualquer coisa, confirme exatamente qual regra está capturando uma URL. O robots.txt Tester faz isso com um matcher derivado do parser de robots.txt de código aberto do Google e mostra a regra vencedora por URL — é a forma mais rápida e precisa de verificar. Para uma verificação manual rápida, sem ferramenta, esta é a lógica central em Python:
import re
def rule_matches(path, rule):
"""Very simplified robots.txt path matcher: '*' = wildcard, '$' = end anchor."""
pattern = re.escape(rule).replace(r'\*', '.*')
if pattern.endswith(r'\$'):
pattern = pattern[:-2] + '$'
return re.match(pattern, path) is not None
def find_blocking_rule(path, disallow_rules, allow_rules):
"""Longest matching rule wins; ties go to Allow (mirrors Google's documented
precedence). Returns the winning rule string, or None if nothing matches."""
matches = [r for r in disallow_rules if rule_matches(path, r)]
matches += [r for r in allow_rules if rule_matches(path, r)]
if not matches:
return None
return max(matches, key=len)
# Example
disallow = ["/search", "/*?*sort="]
allow = ["/search/help"]
print(find_blocking_rule("/search/help", disallow, allow)) # -> "/search/help" (Allow wins, longer)
print(find_blocking_rule("/search/results", disallow, allow)) # -> "/search" (Disallow, no competing Allow)Esta é uma simplificação do matcher real do Google (o parsing de robots.txt tem mais casos-limite envolvendo escape e seleção de grupo). Use-a para conferir seu modelo mental e confirme tudo que importa no testador real antes de confiar no resultado.
Ferramentas para diagnosticar e corrigir este status
- Google Index Checker — depois de corrigir um bloqueio, use-o para verificar os sinais observáveis de indexabilidade da página (código de status, redirecionamentos,
noindex, canonical) antes de encaminhar a resposta real do Google pelo Search Console. - Inspeção de URL (Google Search Console) — fonte de verdade para saber se uma URL específica está bloqueada agora, sua indexabilidade no teste ao vivo e, depois da correção, se o Google voltou a buscá-la.
- Relatório de robots.txt (Google Search Console) — visão no nível da propriedade do domínio dos arquivos
robots.txtencontrados para seus hosts principais, horário da última busca e status de busca, com ação para solicitar novo rastreamento depois da alteração.
Teste seus conhecimentos: Bloqueado pelo robots.txt
Cinco perguntas sobre o status “Blocked by robots.txt” (tradução) «Bloqueado pelo robots.txt» e os erros que as pessoas cometem em torno dele. Escolha uma resposta para cada pergunta e confira depois.
Prove que a remoção realmente funcionou
“Eu configurei noindex” ou “editei robots.txt” não prova nada por si só — o único resultado que conta é o que o índice do Google efetivamente reflete depois. Estes testes separam a mudança feita por você do resultado alcançado pelo Google.
Teste 1 — O rastreamento está realmente permitido
- Teste a executar — Passe a URL pelo robots.txt Tester depois de editar o arquivo.
- Resultado esperado — A URL volta como permitida, sem regra
Disallowcorrespondente (ou com umAllowmais específico vencendo umDisallowmais amplo). - Interpretação de falha — Continuar bloqueada significa que uma regra diferente e mais específica está capturando a URL ou que a edição não foi publicada; verifique o conteúdo real do arquivo servido, não apenas o que você pretendia alterar.
- Janela de monitoramento — Imediata: é uma verificação estática do arquivo servido.
- Gatilho de reversão — N/A — corrija a regra antes do próximo teste; nada abaixo funciona até que o rastreamento seja realmente permitido.
Teste 2 — noindex está sendo servido corretamente
- Teste a executar — Inspeção de URL → Teste ao vivo no Search Console (ou busque a página diretamente e confira os cabeçalhos/HTML da resposta) na URL agora rastreável.
- Resultado esperado — O teste ao vivo mostra
noindexpresente, como meta tag robots no<head>ou como cabeçalho HTTPX-Robots-Tag. - Interpretação de falha — A ausência de
noindexsignifica que a remoção nunca acontecerá, por mais que você espere; permitir o rastreamento sozinho não remove nada. - Janela de monitoramento — Imediata: o teste ao vivo reflete a página servida atualmente.
- Gatilho de reversão — N/A — este teste precisa passar antes que o Google tenha qualquer chance de agir.
Teste 3 — O Google realmente removeu a página
- Teste a executar — Inspeção de URL (o campo de status indexado, não apenas o Teste ao vivo) na URL, verificado periodicamente depois que os dois testes anteriores passarem.
- Resultado esperado — O status muda para excluída por
noindex, e a URL deixa de aparecer em uma buscasite:ou nos dados de acompanhamento de posições. - Interpretação de falha — Continuar indexada depois de um ciclo completo de rastreamento geralmente significa atraso de cache/propagação, não configuração quebrada — o Google precisa rastrear novamente para perceber a mudança, e isso não é instantâneo.
- Janela de monitoramento — 1–3 semanas, dependendo da frequência com que o Google já rastreava a URL; não julgue o resultado no dia seguinte à publicação.
- Gatilho de reversão — a condição de interrupção nomeada — Continuar indexada após um ciclo completo e a página continuar aparecendo como rastreada recentemente nos logs do servidor → pare de atribuir tudo à propagação e repita os Testes 1 e 2 para procurar um erro (cache servindo robots.txt antigo, CDN removendo o cabeçalho
X-Robots-Tagou uma segunda regra conflitante são causas comuns).
Registro de alterações
Atualizado em 8 de ago. de 2026.
Resumo editorial e detalhes registrados da alteração.Detalhes da alteração
-
As notas detalhadas sobre as alterações estão disponíveis atualmente em inglês.
Não é possível fazer a comparação completa — nenhum instantâneo anterior foi arquivado para esta revisão.
Atualizado em 8 de ago. de 2026.
Resumo editorial e detalhes registrados da alteração.Detalhes da alteração
-
As notas detalhadas sobre as alterações estão disponíveis atualmente em inglês.
Não é possível fazer a comparação completa — nenhum instantâneo anterior foi arquivado para esta revisão.
Atualizado em 17 de jul. de 2026.
Resumo editorial e detalhes registrados da alteração.Detalhes da alteração
-
As notas detalhadas sobre as alterações estão disponíveis atualmente em inglês.
-
As notas detalhadas sobre as alterações estão disponíveis atualmente em inglês.
-
As notas detalhadas sobre as alterações estão disponíveis atualmente em inglês.
-
As notas detalhadas sobre as alterações estão disponíveis atualmente em inglês.
Não é possível fazer a comparação completa — nenhum instantâneo anterior foi arquivado para esta revisão.