Indexação
Como os mecanismos de busca armazenam e organizam páginas para que possam ranquear — análise de conteúdo, canonicalização, por que rastreado não é indexado e leitura do relatório de indexação de páginas do GSC.
Idiomas
1 sinal de evidência nesta página
- Ferramenta relacionada ativaGoogle Index Checker
A indexação é a segunda etapa da busca (rastreamento → indexação → exibição): após uma página ser rastreada, o mecanismo a compreende, deduplica e canonicaliza e — se ela se qualificar — a armazena no índice de busca. Rastreado não é indexado; o Google seleciona o que manter, e a indexação não é garantida. Não é um fator de ranqueamento, mas uma página deve ser indexada antes de poder ranquear. Para manter uma página fora, use noindex e deixe-a rastreável — não a bloqueie no robots.txt. Este hub explica toda a etapa e direciona você para os mergulhos profundos.
TL;DR — Indexação é como um mecanismo de busca armazena sua página para que ela possa aparecer nos resultados. Depois que uma página é rastreada (baixada), o mecanismo descobre sobre o que ela é e decide se vale a pena mantê-la. Ser rastreado não significa que você está indexado — o Google escolhe o que vale a pena manter. E estar indexado não é o mesmo que ranquear; significa apenas que você é elegível para isso.
O que é indexação
A busca funciona em três etapas, em ordem:
- Rastrear — um bot como o Googlebot descobre uma URL e baixa a página.
- Indexar — o mecanismo lê essa página, descobre sobre o que ela é e a arquiva em um banco de dados gigante de tudo o que pode mostrar nos resultados.
- Servir (ranquear) — quando alguém pesquisa, o mecanismo puxa as melhores correspondências desse banco de dados e as coloca em ordem.
A indexação é a etapa dois. Se uma página não está indexada, ela não pode ranquear — ela simplesmente não está no banco de dados do qual os resultados são puxados. Mas a indexação por si só não eleva você na página; ela apenas coloca você na disputa.
Rastreado não significa indexado
Esta é a parte que as pessoas perdem. O Google não indexa todas as páginas que rastreia — ele
escolhe quais valem a pena manter. Nas palavras do próprio Google, “indexing isn’t
guaranteed; not every page that Google processes will be indexed.” Evidence for this claim Google does not guarantee that every processed page will be indexed. Scope: Google Search indexing; the source gives examples of possible causes rather than an exhaustive decision formula. Confidence: high · Verified: Google Search Central: In-depth guide to how Google Search works (tradução) «a indexação não é garantida; nem toda página que o Google processa será indexada.» As páginas ficam de fora
na maioria das vezes porque o conteúdo é fino ou de baixo valor, porque uma regra noindex
diz ao Google para ignorá-la, ou porque algo técnico torna a página difícil de
processar.
Então, se uma página está ausente da busca, “o Google não a rastreou” e “o Google a rastreou mas não a manteve” são dois problemas diferentes com correções diferentes.
Como verificar se você está indexado
- Google Search Console é a resposta real. A ferramenta URL Inspection informa se uma página específica está indexada, e o relatório Page indexing mostra por que páginas em todo o seu site foram ou não indexadas.
- Para uma URL específica, use a URL Inspection — você não pode pesquisar ou filtrar o relatório Page indexing por URL, então o relatório é para padrões em todo o site, não para uma consulta de página única. E um teste ao vivo limpo na URL Inspection não é a história completa: ele não verifica tudo o que o relatório verifica, principalmente condições de duplicidade e canônicas.
- Um atalho aproximado é o operador
site:(por exemplo,site:example.com/page) — prático, mas o Search Console é a fonte da verdade.
Como manter uma página FORA do índice
É aqui que muita gente entende errado. Se você quer que uma página suma da busca:
- Adicione uma tag
noindex(uma meta tag robots ou um cabeçalhoX-Robots-Tag), e - Certifique-se de que a página ainda seja rastreável — não a bloqueie no
robots.txt.
Por quê? Porque o Google precisa conseguir rastrear a página para ver o noindex. Se você a
bloquear no robots.txt, o Google não consegue ler a tag — e a página pode na verdade permanecer
indexada mesmo assim se outras páginas linkarem para ela. Evidence for this claim Google must be able to crawl a page to see and apply its noindex rule. Scope: Google-supported robots meta and X-Robots-Tag directives; a robots.txt block can prevent Google from seeing the rule. Confidence: high · Verified: Google Search Central: Block Search indexing with noindex
Isso cobre o caso do dia a dia. Para casos extremos de remoção — páginas que você precisa remover rapidamente, uma
página protegida por senha ou privada que vazou para o índice, ou uma decisão entre 404/410 completo vs.
noindex — consulte o guia dedicado
como desindexar uma página.
Quer a versão mais aprofundada — o que realmente acontece durante a indexação, como funciona a canonicalização e como ler cada status no relatório Page indexing do Search Console? Mude para a aba Avançado.
Evidence for this claim Google must be able to crawl a page to see and apply its noindex rule. Scope: Google-supported robots meta and X-Robots-Tag directives; a robots.txt block can prevent Google from seeing the rule. Confidence: high · Verified: Google Search Central: Block Search indexing with noindexTL;DR — Indexação é a segunda das três etapas da busca (crawl → index → serve): o Google entende uma página rastreada (texto, tags principais, imagens, vídeo; ele renderiza JS), detecta duplicatas, agrupa páginas semelhantes e escolhe a mais representativa (canonicalização —
rel=canonicalé uma dica, não uma regra), calcula sinais e armazena a canônica no índice. Rastreada ≠ indexada — “a indexação não é garantida”, e a decisão é em grande parte sobre qualidade/valor. O relatório de indexação de páginas do Search Console é seu painel de controle. Para desindexar, usenoindexe mantenha a página rastreável; nunca userobots.txtpara remover uma página, porque uma página bloqueada pode ainda ser indexada (apenas sem um snippet).
Indexação é a etapa dois de três
Three stages run left to right. Crawl discovers and downloads a URL. Index processes the page and stores eligible information. Serve or rank orders the best indexed matches for a query. The Index stage is highlighted, and a note says not every page advances through every stage.
© Patrick Stox LLC · CC BY 4.0 ·
O Google é direto sobre o pipeline: “O Google Search funciona em três etapas, e nem todas as páginas passam por cada etapa” — rastreamento, indexação e exibição. A indexação é a etapa intermediária, e o documento a define claramente: “Indexação: o Google analisa o texto, as imagens e os arquivos de vídeo na página e armazena as informações no índice do Google, que é um grande banco de dados.”
Evidence for this claim Google Search describes crawling, indexing, and serving as three distinct stages; indexing analyzes page content and stores eligible information in Google's index. Scope: web search Confidence: high · Verified: In-depth guide to how Google Search worksUma página precisa ser rastreada antes de ser indexada, e precisa ser indexada antes de poder ranquear. Mas nenhuma dessas coisas é garantida — cada etapa é um filtro. Manter as três etapas separadas na sua cabeça é o modelo mental mais útil em SEO técnico, e é por isso que sempre pergunto em qual etapa uma página está falhando antes de mudar qualquer coisa. (Para a etapa anterior a esta, veja o hub de rastreamento — crawl → index é o pipeline.)
O que realmente acontece durante a indexação
Step one analyzes a crawled page for text, title, alt text, images, and video. Step two groups duplicate URLs into a cluster and chooses the most representative page as canonical. Step three stores the canonical page and its cluster information in the Google index.
© Patrick Stox LLC · CC BY 4.0 ·
Indexação não é uma coisa só; é uma sequência:
- Entendimento do conteúdo. Google: “Depois que uma página é rastreada, o Google tenta
entender sobre o que é a página. Esta etapa é chamada de indexação.” Isso significa
“o Google analisa o conteúdo textual e as principais tags e atributos de conteúdo, como
elementos
<title>e atributos alt, imagens, vídeos e muito mais.” JavaScript é renderizado como parte disso — se o seu conteúdo só aparece depois que o JS é executado, ele ainda precisa ser renderizado antes de poder ser entendido. - Detecção de duplicatas e canonicalização. Esta é a parte que a maioria dos explicadores pula, e é onde muitos mistérios de “por que isso não está indexado?” vivem. O Google “determina se uma página é uma duplicata de outra página na internet ou canônica.” O mecanismo: “primeiro agrupamos (também conhecido como clustering) as páginas que encontramos na internet que têm conteúdo semelhante e, em seguida, selecionamos a que é mais representativa do grupo.” Essa representante é a canônica — “A canônica é a página que pode ser exibida nos resultados de pesquisa.”
- Cálculo de sinais e armazenamento. Finalmente, “As informações coletadas sobre a página canônica e seu cluster podem ser armazenadas no índice do Google, um grande banco de dados hospedado em milhares de computadores.” O sistema de indexação nomeado do Google por trás de tudo isso é o Caffeine — a camada que ingere dados de rastreamento, renderiza e extrai, calcula sinais e constrói o índice que é servido.
Canonicalização: uma dica, não um comando
Como a canonicalização acontece durante a indexação, ela merece uma nota própria. “Canonicalização é o processo de selecionar a URL representativa –canônica– de um conteúdo,” e ela existe porque “esse processo ajuda o Google a mostrar apenas uma versão do conteúdo de outra forma duplicado em seus resultados de pesquisa.”
O detalhe essencial: seu rel=canonical é uma sugestão. Palavras do Google:
“indicar uma preferência canônica é uma dica, não uma regra.” O Google pesa muitos
sinais — no meu guia de canonicalização
eu observo que, segundo Allan Scott, do Google, existem cerca de 40 sinais diferentes
de seleção canônica — e ele pode escolher uma URL diferente da que você indicou. É
exatamente isso que o status “Duplicado, o Google escolheu um canônico diferente do usuário” no
Search Console está lhe dizendo.
Rastreado ≠ indexado: por que as páginas não são indexadas
Aqui está a quebra de mito, direto da documentação: “A indexação não é garantida; nem
toda página que o Google processa será indexada.” Evidence for this claim Google does not guarantee that every processed page will be indexed. Scope: Google Search indexing; the source gives examples of possible causes rather than an exhaustive decision formula. Confidence: high · Verified: Google Search Central: In-depth guide to how Google Search works O Google lista motivos comuns para
isso falhar — “A qualidade do conteúdo da página é baixa,” “As regras meta de robots
impedem a indexação,” e “O design do site pode dificultar a indexação.”
Os representantes são ainda mais diretos ao afirmar que isso é uma decisão de seleção baseada em valor, não uma cota que você pode comprar:
- John Mueller, sobre quanto tempo “Descoberto/Rastreado – atualmente não indexado” pode persistir: “Isso pode ser para sempre. É algo em que simplesmente não rastreamos e indexamos todas as páginas.” A solução não é reenviar — é fazer os sistemas reconhecerem o valor, para “continuar trabalhando no site e garantir que nossos sistemas reconheçam que há valor em rastrear e indexar mais e, com o tempo, rastrearemos e indexaremos mais.”
- Mueller novamente: “é importante ter em mente que o Google simplesmente não indexa todas as páginas da web, mesmo que sejam enviadas diretamente.” E, sem rodeios: “Bem, muitos profissionais de SEO e sites (talvez não você/o seu!) produzem conteúdo terrível que não vale a pena indexar.”
- Gary Illyes, sobre por que é seletivo: “não temos espaço infinito, então queremos indexar coisas que achamos– bem, não nós– mas nossos algoritmos determinam que podem ser pesquisadas…”
- Martin Splitt enquadra isso como um ato de equilíbrio: “Costumo descrever como um desafio com o equilíbrio entre não sobrecarregar o site e também gastar nossos recursos onde importa.”
A conclusão prática: um sitemap ou “solicitar indexação” ajuda na descoberta, não na seleção. Enviar uma página novamente não a forçará a entrar. A alavanca é a qualidade e o valor do site.
Lendo o relatório de indexação de páginas do Google Search Console
O relatório de indexação de páginas é onde os problemas de indexação realmente aparecem. Trate cada status como um diagnóstico. Estas são as descrições verbatim do próprio Google:
- Rastreada – atualmente não indexada: “A página foi rastreada pelo Google, mas não indexada. Ela pode ou não ser indexada no futuro; não é necessário reenviar esta URL para rastreamento.” Geralmente um julgamento de qualidade/valor — melhore a página, não fique spam no botão de reenvio.
- Descoberta – atualmente não indexada: “A página foi encontrada pelo Google, mas ainda não foi rastreada. Normalmente, o Google queria rastrear a URL, mas isso poderia sobrecarregar o site; portanto, o Google reagendou o rastreamento.” Tecnicamente um status pré-rastreamento, orientado por capacidade — mas se ele persistir, os representantes o associam a valor, assim como o acima.
- Duplicada sem canônica selecionada pelo usuário: “Esta página é uma duplicata de outra página, embora não indique uma página canônica preferida. O Google escolheu a outra página como canônica para esta página e, portanto, não exibirá esta página na Pesquisa.”
- Duplicada, o Google escolheu uma canônica diferente da do usuário: “Esta página está marcada como canônica para um conjunto de páginas, mas o Google acha que outra URL é uma canônica melhor.” (O resultado “dica, não regra” na prática.)
- Página alternativa com tag canônica adequada: “Esta página está marcada como alternativa de outra página… Esta página aponta corretamente para a página canônica, que está indexada, então não há nada que você precise fazer.”
- Indexada, embora bloqueada por robots.txt: “A página foi indexada apesar de estar bloqueada pelo arquivo robots.txt do seu site. O Google sempre respeita o robots.txt, mas isso não impede necessariamente a indexação se alguém linkar para sua página.” Esta é a prova de que bloquear o rastreamento não bloqueia a indexação.
- URL bloqueada por robots.txt: “Esta página foi bloqueada pelo arquivo robots.txt do seu site.”
- URL marcada como ‘noindex’: “Quando o Google tentou indexar a página, encontrou uma diretiva ‘noindex’ e, portanto, não a indexou.” (Este é o deindex funcionando como pretendido.)
- Página com redirecionamento: “Esta é uma URL não canônica que redireciona para outra página. Como tal, esta URL não será indexada.”
- Soft 404: “A solicitação da página retorna o que achamos ser uma resposta soft 404. Isso significa que ela retorna uma mensagem ‘não encontrado’ amigável, mas não um código de resposta HTTP 404.”
Como controlar a indexação da maneira certa
Para indexar uma página: torne-a rastreável, linke-a internamente, inclua-a no seu sitemap — e, acima de tudo, faça-a valer a pena ser indexada. As ajudas de descoberta não substituem o julgamento de valor.
Para manter uma página FORA — o controle mais mal executado em SEO: use noindex, “uma regra definida
com uma <meta> tag ou cabeçalho de resposta HTTP,” e mantenha a página
rastreável. O aviso importante do Google: “Para que a regra noindex seja eficaz,
a página ou recurso não deve ser bloqueado por um arquivo robots.txt, e deve estar
acessível ao rastreador de outra forma.”
O erro que vejo constantemente é adicionar noindex e bloquear a página no
robots.txt. Isso é contraproducente. Como eu disse em
Como Remover URLs da Pesquisa do Google:
“Para que essas tags sejam vistas, um mecanismo de busca precisa ser capaz de rastrear as
páginas—então certifique-se de que elas não estejam bloqueadas no robots.txt,” e “Rastreamento não é a mesma
coisa que indexação. Mesmo que o Google esteja bloqueado de rastrear páginas, se houver
links internos ou externos para uma página, ele ainda pode indexá-la.” No meu artigo sobre o
status Indexada, embora bloqueada por robots.txt
eu digo de forma ainda mais clara: “A menos que o Google possa rastrear uma página, ele não verá
a meta tag noindex e pode ainda indexá-la porque ela tem links.” A correção: “Basta adicionar
uma meta tag robots noindex e garantir que o rastreamento seja permitido—assumindo que seja canônica.”
Para a árvore de decisão mais completa sobre remoção — 404/410 vs. noindex, o período de retenção de ~6 meses da ferramenta de Remoções e a proteção por senha — consulte
como desindexar uma página.
Indexação no Bing
O Bing executa o mesmo pipeline. Como a Microsoft descreve: “As Bingbot crawls the web,
it sends information to Bing about what it finds. These pages are then added to the
Bing index.” (tradução) «Conforme o Bingbot rastreia a web, ele envia informações ao Bing sobre o que encontra. Essas páginas são então adicionadas ao índice do Bing.» Os mesmos controles se aplicam — uma diretiva noindex mantém uma página fora, e um robots.txt excessivamente restritivo pode impedir o Bingbot de rastreá-la. O Bing também precisa de pelo menos um link apontando para o seu site para encontrá-lo em primeiro lugar.
Nem toda página pertence ao índice
Um filtro simples, não uma regra universal: uma página vale a pena ser indexada se puder aparecer para uma pesquisa com um resultado distinto e útil. Esse é o critério para verificar duplicatas, variantes de parâmetros, URLs privadas ou de staging e páginas de inventário finas ou repetitivas — não um motivo para aplicar noindex a um tipo de página inteiro por padrão. Execute a auditoria completa nas páginas criadas para dominar isso, a seguir.
Para onde ir a seguir: o cluster de indexação
Este hub é a visão geral. Duas coisas dão errado em escala, e cada uma tem seu próprio mergulho profundo:
- Inchaço do índice — quando muitas URLs de baixo valor, duplicadas ou finas acabam no índice, diluindo seu site e desperdiçando recursos de rastreamento/indexação. Como diagnosticar e podar com segurança.
- Indexação mobile-first — o Google indexa a versão mobile das suas páginas, então conteúdo, links e dados estruturados precisam alcançar paridade entre mobile e desktop. O que verificar e o que quebra.
Ambos os tópicos estão aninhados sob este hub — eles também estão na barra lateral e linkarão de volta para cá.
A etapa anterior a esta — como os bots descobrem e baixam suas páginas — vive no hub de rastreamento; rastrear → indexar é o pipeline, e uma página precisa passar pelo rastreamento antes que qualquer coisa aqui se aplique. Para uma visão mais ampla, consulte Como o Search funciona.
Resumo de IA
Uma visão condensada da versão Avançada:
- Indexação = etapa dois da pesquisa (rastrear → indexar → servir). Uma página precisa ser rastreada para ser indexada, e indexada para ranquear — mas nenhuma dessas coisas é garantida. Não é um fator de ranqueamento, apenas elegibilidade.
- O que acontece durante a indexação: o Google entende o conteúdo (texto, tags principais, imagens, vídeo; renderiza JS), detecta duplicatas, agrupa páginas semelhantes e escolhe a mais representativa (canônica), calcula sinais e armazena no índice do Google (sistema: Caffeine).
- A canonização acontece durante a indexação.
rel=canonicalé “a hint, not a rule” (tradução) «uma dica, não uma regra» — o Google pode escolher uma canônica diferente (~40 sinais de seleção). - Rastreado ≠ indexado. “Indexing isn’t guaranteed.” (tradução) «A indexação não é garantida.» É uma decisão de qualidade/valor — Mueller: “That can be forever” (tradução) «Isso pode ser para sempre»; Illyes: “we don’t have infinite space.” (tradução) «não temos espaço infinito.» Reenviar não forçará uma página a entrar; melhorar o site é a alavanca.
- O relatório de indexação de páginas do GSC é o cockpit: “Crawled/Discovered – currently not indexed” (muitas vezes valor), os status de duplicata/canônica, “Indexed, though blocked by robots.txt,” “URL marked ‘noindex’.”
- Para desindexar: use
noindex(meta ou X-Robots-Tag) e mantenha a página rastreável — o Google precisa rastreá-la para ver a tag. Nunca userobots.txtpara desindexar: uma página bloqueada ainda pode ser indexada via links (sem snippet). - O Bing espelha o pipeline. As mesmas regras de
noindexse aplicam. - Em escala, dois modos de falha: inchaço do índice (muitas URLs de baixo valor) e indexação mobile-first (qual versão o Google indexa).
Documentação oficial
Documentação de fonte primária dos mecanismos de busca.
- Guia aprofundado de como o Google Search funciona — a visão geral de rastreamento → indexação → exibição, o estágio de indexação e por que “a indexação não é garantida”.
- Canonicalização e URLs duplicadas — como o Google agrupa duplicatas e seleciona uma canônica (o documento de dica, não de regra).
- Bloquear a indexação do Search com noindex — a ferramenta correta de desindexação e por que a página deve permanecer rastreável.
- Relatório de indexação de páginas — ajuda do Search Console para cada status de indexação e o que ele significa.
- Rastreamento e indexação — o hub para robots, sitemaps, canonicalização e controles de indexação.
Bing / Microsoft
- Como o Bing entrega resultados de pesquisa — o pipeline de rastreamento → indexação do Bing nas próprias palavras da Microsoft.
- Por que meu site não está no índice? — ajuda do Bing Webmaster Tools sobre barreiras de indexação.
Citações da fonte
Declarações oficiais do Google e do Bing. Cada link é um link profundo que salta para a passagem citada na página de origem.
Google — o que é indexação
- “Google Search works in three stages, and not all pages make it through each stage.” (tradução) «O Google Search funciona em três estágios, e nem todas as páginas passam por cada um deles.» Ir para a citação
- “After a page is crawled, Google tries to understand what the page is about. This stage is called indexing.” (tradução) «Depois que uma página é rastreada, o Google tenta entender sobre o que ela trata. Esse estágio é chamado de indexação.» Ir para a citação
- “Google analyzes the textual content and key content tags and attributes, such as
<title>elements and alt attributes, images, videos, and more.” (tradução) «O Google analisa o conteúdo textual e as principais tags e atributos de conteúdo, como elementos<title>e atributos alt, imagens, vídeos e muito mais.» Ir para a citação - “The canonical is the page that may be shown in search results… we first group together (also known as clustering) the pages that we found on the internet that have similar content, and then we select the one that’s most representative of the group.” (tradução) «A canônica é a página que pode ser exibida nos resultados de pesquisa… primeiro agrupamos (também conhecido como clustering) as páginas que encontramos na internet com conteúdo semelhante e, em seguida, selecionamos a que é mais representativa do grupo.» Ir para a citação
- “The collected information about the canonical page and its cluster may be stored in the Google index, a large database hosted on thousands of computers.” (tradução) «As informações coletadas sobre a página canônica e seu cluster podem ser armazenadas no índice do Google, um grande banco de dados hospedado em milhares de computadores.» Ir para a citação
- “Indexing isn’t guaranteed; not every page that Google processes will be indexed.” (tradução) «A indexação não é garantida; nem toda página que o Google processa será indexada.» Ir para a citação
Google — canonicalização e noindex
- “Canonicalization is the process of selecting the representative –canonical– URL of a piece of content.” (tradução) «Canonicalização é o processo de selecionar a URL representativa –canônica– de um conteúdo.» — Documentação do Google Search Central. Ir para a citação
- “That is, indicating a canonical preference is a hint, not a rule.” (tradução) «Ou seja, indicar uma preferência canônica é uma dica, não uma regra.» Ir para a citação
- “For the
noindexrule to be effective, the page or resource must not be blocked by a robots.txt file, and it has to be otherwise accessible to the crawler.” (tradução) «Para que a regranoindexseja eficaz, a página ou o recurso não deve ser bloqueado por um arquivo robots.txt e deve estar acessível ao rastreador de outra forma.» — Documentação do Google Search Central. Ir para a citação
John Mueller, Google (via Search Engine Journal)
- “That can be forever. It’s something where we just don’t crawl and index all pages.” (tradução) «Isso pode ser para sempre. É algo em que simplesmente não rastreamos e indexamos todas as páginas.» Leia a cobertura
- “it’s important to keep in mind that Google just doesn’t index every page on the web, even if it’s submitted directly.” (tradução) «é importante ter em mente que o Google simplesmente não indexa todas as páginas da web, mesmo que sejam enviadas diretamente.» Leia a cobertura
Gary Illyes e Martin Splitt, Google (via Search Engine Journal)
- Illyes: “we don’t have infinite space, so we want to index stuff that we think– well, not we– but our algorithms determine that it might be searched for…” (tradução) «não temos espaço infinito, então queremos indexar coisas que achamos– bem, não nós– mas nossos algoritmos determinam que possam ser pesquisadas…» Leia a cobertura
- Splitt: “I usually describe it as a challenge with the balance between not overwhelming the website and also spending our resources where it matters.” (tradução) «Eu costumo descrever isso como um desafio com o equilíbrio entre não sobrecarregar o site e também gastar nossos recursos onde importa.» Leia a cobertura
Bing / Microsoft
- “As Bingbot crawls the web, it sends information to Bing about what it finds. These pages are then added to the Bing index.” (tradução) «À medida que o Bingbot rastreia a web, ele envia informações ao Bing sobre o que encontra. Essas páginas são então adicionadas ao índice do Bing.» — Suporte da Microsoft. Leia a fonte
Lista de verificação de saúde da indexação
Uma verificação rápida para confirmar que as páginas certas estão indexadas e as erradas não:
- As páginas que você quer indexadas são rastreáveis (não bloqueadas em
robots.txt) e alcançáveis por links internos — sem órfãs. - As páginas importantes retornam
200, não estão comnoindexpor acidente e apontam seurel=canonicalpara si mesmas (ou para a canônica correta). - O relatório de indexação de páginas do Search Console mostra seus principais modelos como “Indexadas”, e você fez a triagem de “Rastreadas/Descobertas – atualmente não indexadas”.
- Status de duplicatas/canônicas revisados — confirme se a canônica escolhida pelo Google corresponde à sua intenção.
- As páginas que você quer fora usam
noindex(meta ouX-Robots-Tag) e permanecem rastreáveis para que o Google possa ver a tag. - Você não está usando
robots.txtpara desindexar nada (bloqueado ≠ removido). - Sem surpresas de “Indexada, embora bloqueada por robots.txt” no relatório.
- O conteúdo dependente de JS é renderizado em HTML indexável (ele precisa ser renderizado antes de poder ser compreendido).
- O sitemap lista apenas URLs canônicas e indexáveis (ele auxilia a descoberta, não a seleção).
Os modelos mentais
1. O pipeline — rastreamento → indexação → exibição. Cada etapa é um filtro, e “nem todas as páginas passam por cada etapa.” Antes de mudar qualquer coisa, localize qual etapa uma página está falhando: Ela foi rastreada? Indexada? Exibida para a consulta?
2. Rastreada ≠ indexada ≠ ranqueada. Rastreada significa baixada. Indexada significa armazenada e elegível. Ranqueamento é uma competição separada entre páginas indexadas. Indexação não é um fator de ranqueamento — mas você não pode ranquear sem ela.
3. Indexação é uma decisão de seleção. O Google escolhe o que manter — “a indexação não é garantida.” Se uma página não está indexada, a pergunta raramente é “eu a enviei?” e quase sempre “vale a pena mantê-la?” Melhore o valor; não reenvie.
4. Canonicalização faz parte da indexação.
Duplicatas são agrupadas e uma URL representativa é armazenada. rel=canonical é uma
dica — o Google pode anulá-la. Se a URL errada está indexada, observe os sinais
(links internos, sitemaps, redirecionamentos), não apenas a tag.
5. A regra de decisão para manter uma página fora.
Quer que ela saia do índice? Permita o rastreamento + noindex. Quer que os bots ignorem um espaço
de URL inteiro (e não se importa se cópias soltas forem indexadas via links)?
robots.txt com disallow. Nunca use disallow para desindexar.
Controles e status de indexação — folha de referência
O que cada controle realmente faz
| Controle | Impede o rastreamento? | Impede a indexação? | Use para |
|---|---|---|---|
noindex (meta/cabeçalho) | Não (deve permanecer rastreável) | Sim | Remover uma página do índice |
robots.txt com disallow | Sim | Não | Manter bots fora de espaços de URL de baixo valor |
rel=canonical | Não | Consolida (uma dica) | Apontar para a duplicata preferida |
| Ferramenta de remoção de URL (GSC) | Não | Temporário (~6 meses) | Ocultação rápida e de curto prazo enquanto você adiciona noindex |
Lendo o relatório de indexação de páginas (status de alto valor)
| Status | O que significa | O que fazer |
|---|---|---|
| Rastreada – atualmente não indexada | Rastreada, julgada como não valendo a pena manter | Melhore a qualidade/valor — não reenvie |
| Descoberta – atualmente não indexada | Encontrada, rastreamento adiado; persistência = sinal de valor | Melhore o valor; verifique os links internos |
| Duplicata, o Google escolheu canônica diferente | Sua canônica foi anulada | Reforce os sinais para sua URL preferida |
| Indexada, embora bloqueada por robots.txt | Bloqueada, mas indexada via links | Desbloqueie + adicione noindex para remover |
| URL marcada como ‘noindex’ | noindex visto e respeitado | Nada (funcionando como pretendido) |
| Página com redirecionamento / Soft 404 | Redirecionamento não canônico / 404 falso | Corrija o redirecionamento ou retorne um 404/410 real |
Fatos rápidos
- “A indexação não é garantida” — o Google seleciona o que manter.
noindexsó funciona se a página estiver rastreável.robots.txtbloqueia o rastreamento, não a indexação — uma página bloqueada ainda pode ser indexada.rel=canonicalé uma dica, não uma diretiva (~40 sinais de seleção canônica).- Indexação não é um fator de ranqueamento — é o portão para ser elegível a ranquear.
Ferramentas para ver e gerenciar a indexação
Verifique se uma página específica está indexada com o Google Index Checker:
- Cole a URL pública exata na ferramenta.
- Execute Check signals para buscar a resposta ao vivo.
- Leia o status, redirecionamento, noindex e sinais canônicos que ela relata.
- Siga o handoff Open URL Inspection para o veredito real de indexação do Google — a ferramenta apenas relata o que é observável na página pública.
- Google Search Console — Relatório de indexação de páginas — a visão do próprio Google sobre quais páginas estão indexadas e por que outras não estão, status por status.
- URL Inspection (GSC) — verifique se uma única URL está indexada, veja a canônica escolhida pelo Google e visualize o HTML renderizado.
- Bing Webmaster Tools — cobertura de indexação, inspeção de URL e envio para o Bing.
- O operador
site:— uma verificação rápida e aproximada do que está indexado (não substitui o Search Console). - Crawlers / auditorias de site — Ahrefs Site Audit e Screaming Frog SEO Spider
revelam tags
noindex, conflitos canônicos, clusters duplicados e problemas de indexabilidade em escala. - Ahrefs Webmaster Tools — rastreamento e auditoria gratuitos para sites que você verifica, sinalizando problemas de indexabilidade.
Recursos que valem seu tempo
Meus artigos relacionados
- The Beginner’s Guide to Technical SEO — onde a indexação se encaixa no panorama geral.
- How to Remove URLs From Google Search (5 Methods) — as maneiras certas (e erradas) de desindexar.
- Indexed, though blocked by robots.txt — por que páginas bloqueadas ainda são indexadas e a solução.
- Canonicalization: A Beginner’s Guide — como o Google escolhe a URL que indexa.
- What “Crawled - Currently Not Indexed” Means in Google Search Console — diagnosticando o status “não indexado” mais comum.
De outras fontes
- Robots Meta Tag & X-Robots-Tag: Everything You Need to Know (Michal Pecánek, Ahrefs) — a referência definitiva sobre diretivas
noindex, incluindo: “Never disallow crawling of content that you’re trying to get deindexed in robots.txt.” (tradução) «Nunca bloqueie o rastreamento de conteúdo que você está tentando desindexar no robots.txt.» - r/TechSEO — a comunidade para depuração de rastreamento/indexação.
Do setor
- Google Says ‘Discovered - Currently Not Indexed’ Status Can Last Forever (Search Engine Journal) — a citação de Mueller “That can be forever” em contexto, com conclusões práticas para sites presos nesse status.
- Google Shares Insights into Indexing & Crawl Budget (Search Engine Journal) — Mueller, Illyes e Splitt sobre por que o Google não indexa tudo e como pensar na decisão de valor de rastreamento/indexação.
- Gary Illyes Talks On Information Retrieval At Google Search (Search Engine Roundtable) — Illyes sobre o espaço finito do índice e por que o Google é seletivo sobre o que armazena.
- Spilling the Beans on Caffeine (Google’s Indexing System) (Search Off the Record, Google) — a equipe de Google Search Relations explica como o Caffeine ingere dados de rastreamento, renderiza páginas, extrai sinais e constrói o índice.
Minhas palestras
- Como a Busca Funciona (SlideShare) — minha explicação sobre rastreamento, renderização, indexação e ranqueamento. (Minha ressalva padrão se aplica: “This is my understanding of systems… not going to be 100% complete or accurate.” (tradução) «Esta é a minha compreensão dos sistemas… não será 100% completa ou precisa.»)
Podcasts
- Search Off the Record (Google Search Relations) — Spilling the beans on Caffeine (Google’s indexing system) and more! A equipe do Google sobre como o sistema de indexação ingere dados de rastreamento, renderiza e extrai, calcula sinais e constrói o índice. Ouvir
Vídeos
- Google Search Central (YouTube) — a série How Google Search Works e os vídeos explicativos de indexação/renderização de Martin Splitt, incluindo os vídeos sobre canonicalização e SEO para JavaScript. Canal
Teste seus conhecimentos: Indexação
Cinco perguntas rápidas sobre como as páginas são indexadas (e por que podem não ser). Escolha uma resposta para cada uma e depois confira.
Registro de alterações
Atualizado em 18 de jul. de 2026.
Resumo editorial e detalhes registrados da alteração.Detalhes da alteração
- Iniciante
As notas detalhadas sobre as alterações estão disponíveis atualmente em inglês.
- Iniciante
As notas detalhadas sobre as alterações estão disponíveis atualmente em inglês.
- Avançado
As notas detalhadas sobre as alterações estão disponíveis atualmente em inglês.
Não é possível fazer a comparação completa — nenhum instantâneo anterior foi arquivado para esta revisão.