Navegação facetada
A navegação facetada permite que compradores filtrem uma categoria por cor, tamanho, preço e marca — e cria silenciosamente milhões de URLs quase duplicadas que desperdiçam orçamento de rastreamento e diluem sinais de ranking. Veja como decidir quais URLs de filtros indexar e quais suprimir, além da tabela de decisão entre canonical, noindex e robots.txt.
Idiomas
Navegação facetada é a maior fonte isolada de desperdício de rastreamento relatada pelos mecanismos de busca — Gary Illyes a coloca em cerca de 50% de todos os problemas de rastreamento relatados ao Google. O mecanismo: cada combinação de filtros pode criar sua própria URL rastreável, transformando um catálogo de 10 000 produtos em milhões de páginas quase duplicadas. A decisão estratégica vem antes da técnica — descubra quais combinações de filtros têm demanda de busca real (torne essas landing pages indexáveis) e quais são apenas UX (bloqueie-as ou faça com que nunca criem uma URL). Depois escolha a alavanca certa: robots.txt interrompe o rastreamento, mas não a indexação; noindex remove páginas do índice, mas não economiza orçamento de rastreamento; canonical é uma indicação que consolida sinais, mas não interrompe o rastreamento. A ferramenta Parâmetros de URL do Search Console acabou — foi descontinuada em 2022 — então controles no servidor são tudo o que resta no Google. O Bing ainda tem Normalização de URL.
TL;DR — Navegação facetada é o conjunto de filtros em uma página de categoria — cor, tamanho, preço e marca. Eles são ótimos para os compradores, mas cada filtro clicado pode criar um endereço web (URL) totalmente novo. Em uma loja grande, isso transforma silenciosamente alguns milhares de páginas de produtos em milhões de páginas filtradas quase idênticas, desperdiçando a atenção limitada que os mecanismos de busca dedicam ao seu site. A solução não é remover os filtros — é decidir quais páginas filtradas merecem aparecer no Google e manter o restante fora.
O que é navegação facetada
Em praticamente toda página de categoria de uma loja virtual existe um painel — geralmente do lado esquerdo — que permite restringir a seleção: Cor: Azul. Tamanho: Grande. Marca: Samsung. Menos de USD 500. Cada item é um faceta, e o painel como um todo é a navegação facetada (você também ouvirá “busca facetada” ou simplesmente “filtros de produto”).
É uma experiência de usuário genuinamente boa. O problema é puramente técnico e trata de endereços web.
Por que os filtros criam um problema de SEO
Quando você clica em um filtro, a maioria das lojas altera a URL da página para lembrar sua escolha. Algo como:
example.com/sofas?color=blue
example.com/sofas?color=blue&size=large
example.com/sofas?color=blue&size=large&brand=ikeaCada combinação única é uma URL diferente. E aqui está a matemática que dói: um catálogo de 10 000 produtos com 20 cores, 15 tamanhos e algumas ordens de classificação tem milhões de URLs filtradas possíveis escondidas nele. A maioria mostra praticamente o mesmo punhado de produtos que alguma outra URL.
Os mecanismos de busca tentam visitar (rastrear) e arquivar (indexar) as URLs do seu site. Eles não têm tempo ilimitado para um único site. Portanto, se gastarem esse tempo rastreando milhões de páginas de filtro quase idênticas, não estarão rastreando seus produtos novos de verdade. Gary Illyes, do Google, disse que a navegação facetada é a reclamação de rastreamento mais comum que ouvem — cerca de metade de todas as reclamações.
O que a maioria das pessoas entende errado
Você não corrige isso apagando seus filtros. Os compradores precisam deles. Você corrige informando aos mecanismos de busca quais páginas filtradas importam e quais não importam:
- Uma página filtrada que muitas pessoas realmente pesquisam — por exemplo, “sofás de veludo azul” — pode merecer um lugar no Google como landing page própria.
- Uma página filtrada que ninguém pesquisa — “blue sofas sorted by price, page 3” (tradução) «sofás azuis ordenados por preço, página 3» — é apenas um estado de UX. Os compradores podem usá-la, mas o Google não deve desperdiçar rastreamento com ela.
Há três ferramentas principais para manter as páginas inúteis fora — robots.txt, noindex e a tag canonical — e cada uma faz um trabalho diferente. As pessoas as confundem constantemente e acidentalmente pioram a situação. A aba Advanced explica exatamente qual usar e quando, com uma tabela de decisão.
Mais uma coisa para saber de início: existia uma ferramenta “URL Parameters” no Google Search Console na qual você podia dizer ao Google para ignorar seus parâmetros de filtro. Ela acabou — o Google a removeu em 2022. Muitos tutoriais antigos ainda fazem referência a ela. Não perca tempo procurando.
Qual controle deve lidar com esta URL de faceta?
Choose a treatment for a faceted URL
A quantidade de URLs de facetas explode de repente
- Confirme o padrão. Compare a amostra de URLs indexadas ou rastreadas com o tamanho real do catálogo. Agrupe as URLs excedentes por parâmetro e por combinação de parâmetros. Se não houver um padrão repetido de facetas, pare e investigue outra fonte de URLs.
- Encontre o caminho de descoberta. Rastreie os modelos de categoria e inspecione os links internos para saber quais controles emitem valores de
hrefrastreáveis. Se as URLs só aparecerem nos logs, verifique também links externos e sitemaps antigos. - Meça a exposição do rastreador. Segmente os logs do servidor pelos parâmetros suspeitos. Se o Googlebot não os solicitar, priorize a limpeza do índice; se eles consumirem uma grande parcela das solicitações, priorize a prevenção do rastreamento.
- Classifique a demanda. Separe as combinações de facetas respaldadas por demanda dos estados exclusivos de UX. Preserve o primeiro grupo como landing pages; não aplique um bloqueio abrangente antes desta etapa.
- Aplique um controle primário. Use páginas indexáveis reais para combinações respaldadas por demanda, fragmentos ou controles sem link quando nenhuma URL for necessária,
robots.txtpara prevenir o rastreamento ounoindexrastreável para desindexar. Nunca combine uma regra de bloqueio comnoindex. - Verifique e acompanhe. Teste URLs representativas e monitore logs, Crawl Stats e Page Indexing. Se landing pages valiosas desaparecerem ou parâmetros legítimos forem bloqueados, restrinja ou reverta a regra.
Erros de navegação facetada que tornam a limpeza mais difícil
Bloquear uma URL no robots.txt e adicionar noindex
O Google não consegue buscar uma página bloqueada para descobrir sua diretiva noindex. Permita o rastreamento enquanto desindexa e só considere bloquear o rastreamento depois que as URLs indesejadas saírem do índice.
Adicionar noindex e canonical à mesma página de faceta
noindex diz para não indexar a página; canonical pede ao Google que a consolide com outra URL. Escolha o sinal que corresponde ao trabalho, em vez de enviar instruções contraditórias.
Esperar que tags canonical parem o rastreamento
O Google precisa rastrear uma URL filtrada para ver sua canonical. Use canonicals para consolidar sinais, não como o único controle de um espaço de rastreamento descontrolado.
Bloquear todos os parâmetros de forma abrangente
Um parâmetro pode alimentar combinações inúteis e landing pages valiosas. Faça um inventário do que cada parâmetro faz e escreva regras restritas com exceções explícitas.
Indexar todas as combinações para a cauda longa
A maioria das combinações não tem demanda independente nem conteúdo muito distinto. Crie landing pages apenas para combinações apoiadas pela demanda e suprima o restante.
Diagnosticar falhas de navegação facetada
A quantidade de URLs indexadas é muito maior que o catálogo
Causa provável: filtros, classificações e ordem dos parâmetros estão produzindo muitas versões rastreáveis do mesmo conjunto de produtos. Correção: agrupe URLs por parâmetro, preserve apenas combinações apoiadas por demanda e aplique o controle de rastreamento ou indexação apropriado. Confirme observando a tendência de queda nos grupos afetados de Page Indexing e nos segmentos de log.
As solicitações do Googlebot sobrecarregam o servidor
Causa provável: a descoberta do rastreador entrou em um espaço de facetas quase infinito. Correção: identifique os padrões de parâmetros nos logs do servidor, remova links rastreáveis para estados inúteis e aplique regras restritas de robots.txt. Confirme que as solicitações do Googlebot voltam a se concentrar nas URLs de categorias e produtos.
Um faceta com noindex continua indexado
Causa provável: a mesma URL está proibida no robots.txt, então o Google não consegue ver a diretiva. Correção: permita o rastreamento pelo tempo necessário para o Google processar o noindex. Confirme na inspeção de URL que a página ativa pode ser buscada e expõe a diretiva.
O Google seleciona uma URL de faceta em vez da URL da categoria
Causa provável: canonicals, links internos, entradas de sitemap ou sinais de conteúdo discordam. Correção: alinhe esses sinais à canonical pretendida e remova links internos para versões duplicadas. Confirme as canonicals declarada e selecionada pelo Google na inspeção de URL.
Classificar parâmetros de facetas sem entregar a decisão ao modelo
Cole um CSV contendo o parâmetro, URLs de exemplo, contagem de produtos, demanda estimada das consultas e se o conjunto de resultados difere da categoria-base. Revise cada recomendação antes da implementação.
You are helping triage faceted-navigation URL patterns. For each CSV row, classify the pattern as one of: candidate indexable landing page, crawl-prevention candidate, deindexing candidate, canonical-to-base candidate, or needs human review.
Use these rules:
- A landing-page candidate needs verified standalone search demand and meaningfully distinct content.
- robots.txt controls crawling, not guaranteed indexing.
- noindex requires the URL to remain crawlable.
- canonical consolidates signals but does not stop crawling.
- Empty or impossible combinations should return 404.
Return a table with: parameter pattern, evidence used, recommended class, implementation precondition, representative URL to test, and risk if wrong. Do not invent keyword demand. Mark missing evidence as NEEDS DATA.
CSV:
[PASTE CSV] Medir a parcela de rastreamento de facetas a partir de um access log
Execute este script Python contra um access log padrão. Ajuste os padrões de bot e faceta para corresponderem ao seu site. Ele relata as solicitações observadas; não decide se uma URL merece ser indexada.
import re
import sys
from collections import Counter
from urllib.parse import urlsplit, parse_qsl
BOT = re.compile(r"Googlebot", re.I)
REQUEST = re.compile(r'"(?:GET|HEAD)\s+(\S+)\s+HTTP/[^\"]+"')
FACET_KEYS = {"color", "size", "brand", "price", "sort", "order"}
total = 0
faceted = 0
keys = Counter()
with open(sys.argv[1], encoding="utf-8", errors="replace") as log:
for line in log:
if not BOT.search(line):
continue
match = REQUEST.search(line)
if not match:
continue
total += 1
query_keys = {key for key, _ in parse_qsl(urlsplit(match.group(1)).query)}
matched = query_keys & FACET_KEYS
if matched:
faceted += 1
keys.update(matched)
print({"googlebot_requests": total, "facet_requests": faceted})
print(keys.most_common())Extrair links de facetas parametrizados em um rastreador
Use este XPath na extração personalizada do Screaming Frog para coletar links cuja string de consulta contenha uma das chaves nomeadas:
//a[contains(@href,'?') and (contains(@href,'color=') or contains(@href,'size=') or contains(@href,'brand=') or contains(@href,'sort='))]/@hrefA expressão regular equivalente captura a URL no grupo 1 e o primeiro nome de parâmetro reconhecido no grupo 2:
href=["']([^"']*[?&]((?:color|size|brand|price|sort|order))=[^"']*)["']Listar links de facetas na página atual
Execute isto no Console do Chrome DevTools. Altere keys para corresponder aos parâmetros reais do site.
const keys = new Set(["color", "size", "brand", "price", "sort", "order"]);
console.table(
[...document.querySelectorAll("a[href]")]
.map((a) => new URL(a.href, location.href))
.filter((u) => [...u.searchParams.keys()].some((k) => keys.has(k)))
.map((u) => ({
url: u.href,
keys: [...u.searchParams.keys()].filter((k) => keys.has(k)).join(","),
})),
); Provar que a mudança de controle de rastreamento entrou em vigor
Implemente uma mudança primeiro em uma coorte de amostra de URLs e mantenha uma coorte comparável intocada como controle. As métricas de rastreamento e indexação mudam por motivos que nada têm a ver com sua alteração — a comparação entre coortes é a única forma confiável de isolar o efeito.
Testar a regra de robots.txt
Teste a executar: use o fluxo de teste de robots.txt do Search Console ou solicite o arquivo ativo e teste URLs representativas permitidas e proibidas. Resultado esperado: amostras de facetas inúteis são bloqueadas, enquanto a categoria-base, os produtos e as landing pages aprovadas continuam permitidos. Interpretação de falha: o padrão é amplo demais, estreito demais ou não corresponde ao formato real da URL. Janela de monitoramento: a regra em si é imediata; o comportamento dos crawlers muda depois que os bots a revisitarem. Gatilho de reversão: qualquer categoria valiosa, produto ou página de faceta aprovada seja bloqueada.
Testar uma landing page respaldada por demanda
Teste a executar: inspecione a resposta, o HTML renderizado, a canonical, os links internos e a presença no sitemap. Resultado esperado: ela retorna 200, usa uma canonical autorreferente, apresenta elementos de página distintos e pode ser alcançada por links rastreáveis. Interpretação da falha: a página ainda é tratada como um estado de faceta suprimido. Janela de monitoramento: os sinais técnicos são imediatos; a canonical selecionada pelo Google e o estado de indexação exigem novo rastreamento. Gatilho de reversão: o Google consolida a página de forma consistente em outro lugar ou ela não consegue sustentar conteúdo e demanda distintos.
Testar a desindexação sem bloquear
Teste a executar: inspecione uma URL de faceta indesejada representativa depois de adicionar noindex. Resultado esperado: o Google consegue buscar a URL e vê noindex; depois a URL sai do índice. Interpretação de falha: uma regra de robots, um problema de renderização ou um conflito de cabeçalho/template está ocultando a diretiva. Janela de monitoramento: a entrega da diretiva é imediata; a remoção do índice ocorre após novo rastreamento. Gatilho de reversão: o template aplicar noindex a landing pages aprovadas.
Métricas de saúde da navegação facetada
Acompanhe a parcela de rastreamento, a presença no índice e o desempenho das landing pages como três sinais separados — não os reduza a uma única pontuação. Nenhum dos controles deste artigo garante resultado de rastreamento, indexação, ranking, tráfego ou citação de IA; eles apenas mudam o que fica disponível para mecanismos de busca (e crawlers de IA) encontrarem.
Parcela do rastreamento por bots dedicada a facetas
Métrica: porcentagem de solicitações verificadas do Googlebot que atingem padrões de facetas não indexáveis. O que ela informa: se a capacidade de rastreamento está sendo desviada para estados de URL exclusivos da UX. Como obtê-la: valide o tráfego de bots e segmente os logs do servidor pelos parâmetros de facetas conhecidos do site. Benchmark / faixa realista: estabeleça uma linha de base por template e busque uma queda sustentada após a limpeza; catálogos e demanda de rastreamento diferem demais para um alvo universal. Cadência: semanal durante a correção, depois mensal.
Presença de URLs de facetas na indexação de páginas
Métrica: contagem e parcela de URLs de facetas nos grupos indexado, duplicado, rastreado-não-indexado e soft-404. O que ela informa: se os controles de rastreamento e os sinais de canonical estão contendo o excesso de URLs no índice. Como obtê-la: exporte amostras de Indexação de páginas do Search Console e classifique as URLs pelo padrão de parâmetros. Benchmark / faixa realista: compare com a contagem de landing pages de facetas intencionalmente indexáveis e use o próprio catálogo da loja como linha de base. Cadência: mensal; mudanças no índice são sinais atrasados.
Desempenho das landing pages aprovadas
Métrica: cliques, impressões e conversões para as combinações de facetas intencionalmente mantidas como indexáveis. O que ela informa: se as exceções respaldadas por demanda justificam seu custo de rastreamento e manutenção. Como obtê-la: agrupe essas URLs exatas no Search Console e na ferramenta de analytics. Benchmark / faixa realista: compare cada página com sua própria linha de base pré-lançamento e com a categoria-base relevante, não com um limite inventado para todo o site. Cadência: mensal e após mudanças materiais no catálogo.
TL;DR — Navegação facetada é a principal fonte de excesso de rastreamento relatada ao Google (~50% das reclamações de rastreamento, segundo Gary Illyes). Cada combinação de filtros pode criar uma URL distinta e rastreável, então um catálogo pequeno esconde milhões de páginas quase duplicadas — causando conteúdo duplicado, excesso no índice, desperdício de orçamento de rastreamento e diluição do PageRank. A decisão é estratégica antes de ser técnica: quais combinações têm demanda de busca real (→ torne-as landing pages indexáveis) e quais são apenas UX (→ suprima-as). Depois escolha a alavanca certa, pois elas não são intercambiáveis: robots.txt interrompe o rastreamento, mas não a indexação; noindex remove do índice, mas exige rastreamento e não economiza orçamento; canonical é uma indicação que consolida sinais, mas não interrompe o rastreamento. Fragmentos de URL (
#) contornam todo o problema porque o Google os ignora. A ferramenta Parâmetros de URL do GSC foi descontinuada — restam apenas controles no servidor. O Bing ainda tem Normalização de URL.
O mecanismo: como os filtros explodem seu espaço de URLs
Navegação facetada se torna um problema de SEO no momento em que um filtro muda a URL de uma forma que um rastreador pode seguir. Três coisas distintas são confundidas aqui, e separá-las torna o restante deste artigo mais claro: a interação da UI (um comprador clicando em um filtro), o estado de URL buscável (se esse clique muda um endereço que um rastreador pode realmente solicitar) e a landing page indexável (se essa URL deve mesmo ficar no índice do Google). Um sistema facetado pode expor uma, duas ou as três — um filtro no lado do cliente sem mudança de URL tem apenas a primeira; um filtro por string de consulta tem as duas primeiras; uma página selecionada para “sofás de veludo azul” tem as três, deliberadamente.
As três implementações comuns:
| Padrão | Exemplo | Comportamento de rastreamento/indexação |
|---|---|---|
| Parâmetros de consulta | /sofas?color=blue&size=large | Mais comum; rastreado e indexável por padrão — precisa ser gerenciado |
| Segmentos de caminho | /sofas/blue/large/ | Aparência mais limpa, mas mais difícil de bloquear sistematicamente com robots.txt |
| Fragmentos de URL | /sofas#color=blue | O Googlebot ignora fragmentos — nenhum impacto em rastreamento/indexação |
A aritmética concentra todo o problema. 10 000 produtos × 20 cores × 15 tamanhos × 5 ordens de classificação resultam em 15 000 000+ URLs potenciais. Gary Illyes descreveu o modo de falha de forma vívida no LinkedIn: “Sometimes you might create these new fake URLs accidentally, exploding your URL space from a balmy 1000 URLs to a scorching 1 million, exciting crawlers that in turn hammer your servers unexpectedly.” (tradução) «Às vezes, você pode criar acidentalmente novas URLs falsas, fazendo o espaço de URLs saltar de agradáveis mil URLs para escaldante um milhão e atraindo rastreadores que, por sua vez, sobrecarregam seus servidores de modo inesperado.»
O Google também não pode simplesmente olhar para um espaço de URLs de filtros e decidir ignorá-lo. Illyes explicou o motivo no Search Off the Record: “Once it discovers a set of URLs, it cannot make a decision about whether that URL space is good or not unless it crawled a large chunk of that URL space.” (tradução) «Depois que descobre um conjunto de URLs, ele não consegue decidir se aquele espaço é bom ou não sem rastrear uma grande parte dele.» Por isso essa é a principal reclamação sobre rastreamento: quando o Google descobre que as URLs não têm valor, já rastreou muitas delas.
Investigação trabalhada: os filtros eram apenas metade da armadilha
A análise de rastreamento de fim de ano de 2025 do Google é uma evidência do mundo real excepcionalmente útil: Gary Illyes atribuiu cerca de 50% dos problemas de rastreamento discutidos à navegação facetada e outros 25% a parâmetros de ação. Essa segunda categoria importa porque uma auditoria de ecommerce que conta apenas color, size e brand pode deixar passar URLs criadas por controles de add-to-cart, comparação, lista de desejos, ordenação, sessão e rastreamento.
Este é o padrão de investigação, usando contagens ilustrativas em vez de afirmar que são um benchmark típico. Um varejista tem 18 000 produtos e categorias indexáveis, mas um crawl descobre 640 000 URLs. Agrupar amostras do crawl e dos logs por parâmetro mostra:
| Família de URLs | URLs observadas | O que revelou |
|---|---|---|
filtros (color, size, brand) | 290 000 | combinações e ordem duplicada de parâmetros |
ações (add, compare, wishlist) | 170 000 | links rastreáveis que executam ações do usuário |
| ordenação e paginação | 96 000 | os mesmos conjuntos em ordens e profundidades diferentes |
| sessão e rastreamento | 71 000 | duplicatas passivas anexadas a links internos |
| desconhecida | 13 000 | a fila de revisão, não uma lista automática de bloqueio |
A correção não é um único Disallow abrangente. Remova links de ação rastreáveis, pare de colocar parâmetros de sessão e campanha em links internos, normalize ordens duplicadas de filtros, retorne 404 para combinações impossíveis e preserve os poucos filtros apoiados por demanda como landing pages estáveis. Depois verifique o resultado nos logs do servidor: o sinal de sucesso é a mudança das solicitações do rastreador para URLs de categorias e produtos, não apenas uma exportação menor do rastreador.
Os quatro problemas que isso causa
- Conteúdo quase duplicado.
/washing-machines/samsung/e/washing-machines/?brand=samsungpodem servir conjuntos de produtos idênticos. Os sinais de ranking se dividem entre as duas em vez de se consolidarem. - Excesso no índice. Mesmo uma fração dessas milhões de URLs no índice pesa contra os sinais gerais de qualidade do site.
- Desperdício de orçamento de rastreamento. Cada rastreamento gasto em uma faceta de baixo valor é um rastreamento que seus produtos genuinamente novos não receberam. O efeito se acumula — ele também atrasa a descoberta de conteúdo recente. (O orçamento de rastreamento só pesa de verdade em escala; veja orçamento de rastreamento para saber quem realmente precisa se preocupar.)
- Diluição do PageRank. Uma página de categoria que cria links para 500 combinações de filtros distribui sua autoridade interna entre 501 destinos, em vez de fazê-la fluir para os produtos que deveriam ranquear.
Vale dizer claramente, porque os clientes perguntam: isso não é risco de penalidade. O Google não aplica ações manuais por duplicação de navegação facetada. É um problema de eficiência de rastreamento e indexação e de diluição de sinais — não uma penalidade por conteúdo duplicado.
A decisão estratégica vem primeiro
Antes de tocar em robots.txt ou em uma meta tag, tome a decisão por URL: essa combinação de filtros merece um lugar no índice ou não?
- Ela merece indexação se corresponder a uma demanda de busca real — uma consulta que as pessoas realmente digitam. “Calça skinny de cintura alta”, “botas de trilha impermeáveis”, “sofá de veludo azul”. Essas se tornam landing pages adequadas.
- Ela não merece se for uma combinação arbitrária, uma ordem de classificação ou uma pilha profunda de várias facetas que ninguém pesquisa. Essas devem ser suprimidas.
Como encontrar a linha: pesquisa de palavras-chave. Extraia os modificadores candidatos das facetas, verifique o volume e estabeleça um limite. Um critério razoável na prática é cerca de 300+ pesquisas mensais para justificar uma página de faceta independente indexada — tudo abaixo disso é bloqueado ou transformado em fragmento. Isso importa por causa da cauda longa: 99,84% das palavras-chave recebem menos de 1 000 pesquisas por mês, mas representam 39,33% da demanda total de busca. A maioria das combinações de facetas não tem demanda — mas a minoria que tem representa uma oportunidade real, e a única maneira de capturá-la é permitir que essas páginas específicas sejam indexadas.
A demanda sozinha não é o critério completo. Antes de promover uma combinação a landing page indexável, ela precisa de três coisas juntas: demanda verificada (a pesquisa de palavras-chave acima), valor distinto (conteúdo e conjunto de produtos que realmente diferem da categoria-base — não apenas os mesmos produtos em uma ordem diferente) e compromisso de monitoramento (sinais de rastreamento, indexação e desempenho, não uma configuração esquecida). Trate cada página promovida como um experimento que precisa justificar sua manutenção, não como uma vitória garantida de cauda longa — veja a aba Métricas para saber o que acompanhar.
As alavancas técnicas — e como elas diferem
É aqui que a maioria das implementações dá errado, porque os três controles principais parecem intercambiáveis, mas não são.
Bloqueio de robots.txt — interrompe o rastreamento, a prevenção preferida do Google. Bloquear os espaços de parâmetros de facetas enquanto permite páginas de itens e a listagem sem filtros é a alavanca mais forte de orçamento de rastreamento. O próprio exemplo do Google:
disallow: /*?*products=
disallow: /*?*color=
disallow: /*?*size=
allow: /*?products=all$O ponto crítico: robots.txt bloqueia o rastreamento, não a indexação. Uma URL bloqueada que tenha links de entrada ainda pode aparecer no índice como um resultado que contém apenas a URL (sem snippet, porque o Google nunca leu a página). Portanto, é a ferramenta certa quando seu objetivo é “parar de desperdiçar rastreamento nesse espaço”, não “tirar isso do índice”.
noindex — remove do índice, mas exige rastreamento. O Google é explícito: “Google has to crawl the page in order to find the noindex rule.” (tradução) «O Google precisa rastrear a página para encontrar a regra noindex.» Assim, noindex controla a indexação, não o rastreamento. Ele não economiza orçamento de rastreamento, porque o Googlebot ainda precisa buscar a página para ler a tag. Use-o quando o objetivo for retirar a página do índice, não aumentar a eficiência do rastreamento.
rel="canonical" — indicação para consolidar sinais. O Google afirma: “may, over time, decrease the crawl volume of non-canonical versions” (tradução) «pode, com o tempo, diminuir o volume de rastreamento das versões não canônicas». A documentação também diz que essa opção é “generally less effective in the long term” (tradução) «geralmente menos eficaz no longo prazo» do que robots.txt ou fragmentos. A indicação não interrompe o rastreamento nem reduz a carga do servidor no curto prazo.
Fragmentos de URL (#) — contornam o problema por completo. Como “Google Search generally doesn’t support URL fragments in crawling and indexing,” (tradução) «A Pesquisa Google geralmente não oferece suporte a fragmentos de URL no rastreamento e na indexação», um estado de filtro baseado em hash, como /sofas#color=blue, não cria impacto de rastreamento ou indexação. É a prevenção mais limpa para filtros sem demanda: o filtro é aplicado no cliente e nenhuma nova URL rastreável é criada.
rel="nofollow" nos links de filtros — tudo ou nada. Você pode desencorajar o Google de seguir links de filtros, mas, segundo a documentação, “every anchor pointing to a specific
URL must have the rel=‘nofollow’ attribute in order for it to be effective.” (tradução) «Toda âncora que aponta para uma URL específica precisa ter o atributo rel=‘nofollow’ para que a medida seja eficaz.» Basta existir em qualquer parte do site um link seguido sem o atributo para a abordagem falhar. Além disso, hoje esse atributo é uma indicação, não uma diretiva.
Veja a aba Guias rápidos para consultar a tabela de decisão completa.
Os nãos críticos
Estas são as combinações que quebram as coisas silenciosamente:
noindex+ bloqueio derobots.txtna mesma URL. Este é o erro clássico. Se a URL estiver bloqueada, o Googlebot não consegue buscá-la, portanto nunca vê a tagnoindex— e a página pode continuar indexada. Para desindexar, é preciso permitir o rastreamento e servirnoindex.noindex+canonicalna mesma URL. São sinais contraditórios. Como John Mueller explicou, “noindex doesn’t tell Google that you want it combined with something else and that signals should be forwarded.” (tradução) «noindex não diz ao Google que você quer combiná-lo com outra coisa nem que os sinais devem ser encaminhados.» Escolha um controle.- Apenas canonical, esperando aliviar o orçamento de rastreamento. Ela não interrompe o rastreamento. O Google continua buscando as URLs não canônicas.
Práticas recomendadas de estrutura de URL para facetas que você vai indexar
Para a minoria de páginas filtradas que você decidiu indexar, a documentação do Google traz regras claras:
- Use o separador padrão
&— não vírgulas, ponto e vírgula, barras verticais ou colchetes. - Mantenha uma ordem consistente de filtros.
/sofas/blue/fabrice/sofas/fabric/blueprecisam resolver para uma única forma canônica. - Não duplique valores de filtro —
?color=blue&color=bluedeve retornar 404, não 200. - Retorne um 404 real para combinações vazias ou impossíveis. Se
/sofas/rednão tiver resultados, envie um404; não sirva uma página genérica 200 de “sem resultados” sustentada pornoindex. - Prefira caminhos limpos a strings de consulta para facetas indexáveis —
/sofas/blue/é mais legível do que/sofas?color=blue&style=&sort=.
Navegação facetada em JavaScript/AJAX — prevenção, com uma troca
Se você construir filtros como AJAX no lado do cliente que não emitam links <a href> reais para URLs de filtros, o filtro é aplicado no navegador e nenhuma URL rastreável é criada. Isso é ótimo para o orçamento de rastreamento. A troca é simétrica: o Googlebot também não consegue alcançar esses estados filtrados, então nenhuma combinação de filtros de cauda longa valiosa será indexada.
O padrão-ouro para catálogos grandes é um híbrido: pré-renderize ou renderize no servidor as combinações de filtros de alta demanda como páginas reais, vinculadas e indexáveis, com texto introdutório exclusivo e inclusão no sitemap, e mantenha no lado do cliente todos os estados efêmeros sem demanda (AJAX, fragmentos ou parâmetros de pushState acompanhados de uma canonical para a base). O Google renderiza JavaScript, mas a renderização entra em fila e é mais lenta que o rastreamento de HTML — portanto, para páginas que você realmente quer indexar de modo confiável, não dependa apenas da renderização no lado do cliente. (Mais sobre renderização em JavaScript SEO.)
A ferramenta Parâmetros de URL acabou
Aborde isso cedo com qualquer cliente, pois muitos tutoriais ainda recomendam a ferramenta. O Google descontinuou a ferramenta Parâmetros de URL em abril de 2022. O motivo foi a melhora na detecção automática de parâmetros: “only about 1% of the
parameter configurations currently specified in the URL Parameters tool were useful
for crawling.” (tradução) «Apenas cerca de 1% das configurações de parâmetros então especificadas na ferramenta Parâmetros de URL eram úteis para o rastreamento.» Quando perguntaram se ela poderia voltar, Illyes respondeu: “In theory yes.
In practice no.” (tradução) «Em teoria, sim. Na prática, não.» Não existe mais um controle no Search Console para mandar o Google ignorar um parâmetro: restam os controles no servidor (robots.txt, noindex e fragmentos).
O Bing é diferente. O Bing Webmaster Tools ainda oferece a Normalização de URL, na qual se especificam os parâmetros que podem ser removidos. Segundo Fabrice Canel, “our crawler will not visit the URLs with extra parameters except for an occasional test.” (tradução) «Nosso rastreador não visitará as URLs com parâmetros extras, exceto em um teste ocasional.» Se o Bing importa para o projeto — e a busca por IA depende cada vez mais de seu índice —, essa configuração separada leva cerca de cinco minutos e merece ser feita.
Uma observação sobre o bloqueio abrangente de parâmetros
Tenha cuidado com regras amplas de robots.txt. Se um parâmetro servir a mais de uma finalidade — por exemplo, ?type= ser usado tanto para uma faceta inútil quanto para uma visualização paginada ou canônica legítima em outro lugar — um disallow: /*?*type= amplo também bloqueará as URLs legítimas. Audite o que cada parâmetro realmente faz antes de bloqueá-lo e prefira regras estreitas com exceções allow a uma regra abrangente que destrói páginas úteis junto com as inúteis.
Como auditar seu próprio site
- Rastreie o site. O Ahrefs Site Audit ou o Screaming Frog revelam a explosão de URLs, os padrões de parâmetros e a profundidade das páginas filtradas.
- Compare a contagem de
site:com o total real de produtos. Uma contagem de resultados parasite:example.commuito maior do que o catálogo real é um sinal característico de excesso no índice causado por facetas. - Consulte o relatório de Indexação de páginas do GSC. Procure grandes volumes de “Crawled — currently not indexed” (tradução) «Rastreada — atualmente não indexada» e “Duplicate without user-selected canonical” (tradução) «Duplicada sem canonical selecionada pelo usuário»; as facetas costumam aparecer nessas categorias.
- Analise os logs do servidor. Eles mostram exatamente quanto do rastreamento do Googlebot é direcionado a URLs com parâmetros em vez de produtos.
The worked sample contains 240 parameter occurrences: 108 filter parameters, 54 tracking parameters, 34 sort parameters, 28 pagination parameters, and 16 unknown parameters. Filter parameters account for 45 percent of the supplied inventory.
Onde isso se encaixa no pilar
Navegação facetada é o desafio técnico canônico de SEO para ecommerce — é por isso que SEO para ecommerce é mais difícil que SEO comum, não diferente dele. Ela se conecta diretamente à arquitetura de sites de ecommerce (os filtros ficam pendurados na pirâmide de categorias), ao SEO de páginas de categoria (as páginas onde os filtros vivem) e à história mais ampla de rastreamento em crawling e canonicalização. Profissionais de SEO técnico frequentemente chegam a este tema pelo ângulo da arquitetura da informação; a casa prática dele é aqui, no lado da loja.
Resumo de IA
Uma versão condensada da versão Avançada:
- O que é: o painel de filtros em páginas de categoria/arquivo (cor, tamanho, preço, marca) — também chamado de busca facetada ou filtragem de produtos. Ótima UX; só vira um problema de SEO porque cada combinação de filtros pode criar uma URL rastreável distinta.
- O problema de escala: 10 000 produtos × cores × tamanhos × ordens = milhões de URLs quase duplicadas. Gary Illyes: navegação facetada é ~50 % de todos os problemas de rastreamento relatados ao Google. O Google não pode ignorar o espaço sem antes rastrear “uma grande parte” dele.
- Quatro danos: conteúdo quase duplicado, excesso no índice, desperdício de orçamento de rastreamento e diluição do PageRank. Não é risco de penalidade — é um problema de eficiência e diluição de sinais.
- Decida a estratégia primeiro: indexe as combinações de filtros com demanda de busca real (como critério de trabalho, ~300+ pesquisas mensais); suprima o restante.
- As alavancas diferem:
robots.txtinterrompe o rastreamento, não a indexação (URLs bloqueadas ainda podem aparecer como resultados só de URL);noindexremove do índice, mas precisa de rastreamento, então não economiza orçamento;canonicalé uma indicação consolidante que não interrompe o rastreamento; fragmentos de URL (#) contornam tudo porque o Google os ignora. - Nunca: combine
noindex+ bloqueio derobots.txt(o Google não consegue ver a tag); nemnoindex+canonical(contraditórios — Mueller diz para escolher um). - Ferramentas: a ferramenta Parâmetros de URL do Google foi descontinuada em 2022 — apenas controles no servidor. O Bing ainda tem Normalização de URL.
- Filtros em JS/AJAX evitam desperdício de rastreamento, mas também bloqueiam a indexação de facetas valiosas de cauda longa — pré-renderize as de alta demanda.
Documentação oficial
Orientação de fonte primária sobre navegação facetada e tratamento de parâmetros.
- Gerenciar o rastreamento de URLs de navegação facetada — documento de ajuda permanente que o Google elevou de uma publicação de blog de 2014 em dezembro de 2024.
- Navegação facetada — versão da infraestrutura de rastreamento — a mesma orientação, com exemplos de
robots.txte do separador&. - Dezembro do rastreamento: navegação facetada (2024) — publicação que classificou esse problema como, de longe, a fonte mais comum de excesso de rastreamento.
- Práticas recomendadas — e cinco das piores — para navegação facetada (2014) — referência original, hoje substituída, mas útil para o histórico.
- Limpeza de primavera: a ferramenta Parâmetros de URL (2022) — anúncio da descontinuação.
- Otimize seu orçamento de rastreamento — contexto para entender por que o desperdício provocado por facetas importa.
Bing / Microsoft
- Better than canonical; URL Normalization — Fabrice Canel sobre a ferramenta do Bing para tratamento de parâmetros (ainda ativa, ao contrário da do Google).
Citações da fonte
Declarações registradas do Google e do Bing. Links profundos levam à passagem citada onde a página de origem oferece suporte a fragmentos de texto.
Google — a escala do problema (Gary Illyes)
- “Once it discovers a set of URLs, it cannot make a decision about whether that URL space is good or not unless it crawled a large chunk of that URL space.” (tradução) «Depois que descobre um conjunto de URLs, ele não consegue decidir se aquele espaço é bom ou não sem rastrear uma grande parte dele.» — Gary Illyes, no programa Search Off the Record (retrospectiva de rastreamento de 2025). Reproduzido pela cobertura textual do Search Engine Land; confirme no episódio antes de tratá-lo como definitivo. Cobertura
- “An interesting quirk of URLs is that you can add an infinite (I call BS) number of URL parameters to the URL path, and by that essentially forming new resources.” (tradução) «Uma peculiaridade das URLs é que você pode acrescentar ao caminho um número infinito — eu diria absurdo — de parâmetros e, assim, formar novos recursos.» — Gary Illyes, LinkedIn, agosto de 2024. Reproduzido pelo Search Engine Journal. Cobertura
- “Sometimes you might create these new fake URLs accidentally, exploding your URL space from a balmy 1000 URLs to a scorching 1 million, exciting crawlers that in turn hammer your servers unexpectedly.” (tradução) «Às vezes, você pode criar acidentalmente novas URLs falsas, fazendo o espaço de URLs saltar de agradáveis mil URLs para escaldante um milhão e atraindo rastreadores que sobrecarregam seus servidores de modo inesperado.» — Gary Illyes, LinkedIn, agosto de 2024. Reproduzido pelo Search Engine Journal. Cobertura
- Sobre a possível volta da ferramenta Parâmetros de URL: “In theory yes. In practice no.” (tradução) «Em teoria, sim. Na prática, não.» — Gary Illyes, LinkedIn, 2024. Reproduzido pelo Search Engine Journal. Cobertura
Google — a documentação
- “Google has to crawl the page in order to find the noindex rule.” (tradução) «O Google precisa rastrear a página para encontrar a regra noindex.» — Google Search Central, documentação sobre navegação facetada. Ir para a citação
- “Google Search generally doesn’t support URL fragments in crawling and indexing.” (tradução) «A Pesquisa Google geralmente não oferece suporte a fragmentos de URL no rastreamento e na indexação.» Ir para a citação
- Sobre
rel="nofollow": “every anchor pointing to a specific URL must have the rel=‘nofollow’ attribute in order for it to be effective.” (tradução) «Toda âncora que aponta para uma URL específica precisa ter o atributo rel=‘nofollow’ para que a medida seja eficaz.» Ir para a citação - Sobre a ferramenta descontinuada: “only about 1% of the parameter configurations currently specified in the URL Parameters tool were useful for crawling.” (tradução) «Apenas cerca de 1% das configurações de parâmetros então especificadas na ferramenta Parâmetros de URL eram úteis para o rastreamento.» Ir para a citação
Google — John Mueller
- “noindex doesn’t tell Google that you want it combined with something else and that signals should be forwarded.” (tradução) «noindex não diz ao Google que você quer combiná-lo com outra coisa nem que os sinais devem ser encaminhados.» (sobre por que não combinar
noindexcomcanonical) — John Mueller, Google. Reproduzido pelo Search Engine Journal. Cobertura
Bing — Fabrice Canel
- Sobre a Normalização de URL: “our crawler will not visit the URLs with extra parameters except for an occasional test.” (tradução) «Nosso rastreador não visitará as URLs com parâmetros extras, exceto em um teste ocasional.» Ir para a citação
- “relying on canonical tag is not necessarily the perfect solution to fix all your duplicate content problems.” (tradução) «Confiar na tag canonical não é necessariamente a solução perfeita para corrigir todos os problemas de conteúdo duplicado.» Ir para a citação
lista de verificação de auditoria da navegação facetada
Uma passada para encontrar e corrigir o desperdício de rastreamento/indexação provocado por facetas:
- Rastreie o site (Ahrefs Site Audit ou Screaming Frog) e quantifique a explosão de URLs com parâmetros em relação à contagem real de produtos.
- Compare a contagem indexada por
site:yourdomain.comcom o tamanho real do catálogo; uma diferença grande indica excesso no índice. - Em Indexação de páginas do GSC, examine “Crawled — currently not indexed” (tradução) «Rastreada — atualmente não indexada» e “Duplicate without user-selected canonical” (tradução) «Duplicada sem canonical selecionada pelo usuário» nas URLs de facetas.
- Verifique nos logs do servidor quanto do rastreamento do Googlebot atinge URLs com parâmetros em vez de produtos.
- Liste cada parâmetro de filtro e sua função; confirme que nenhum tem dupla finalidade antes de escrever regras de bloqueio.
- Pesquise os modificadores das facetas; marque combinações com demanda real (~300+/mês) como candidatas à indexação.
- Para facetas de baixa demanda, escolha um único método de supressão por URL; nunca combine
noindexcom bloqueio derobots.txt. - Para facetas indexáveis, verifique ordem consistente dos filtros, separadores
&, canonical autorreferente, introdução exclusiva e inclusão no sitemap. - Confirme que combinações vazias ou impossíveis retornam
404, não uma página 200 de “sem resultados”. - Configure a Normalização de URL no Bing Webmaster Tools, separadamente do Google.
Os modelos mentais
1. Estratégia antes de tática — indexar ou suprimir? Cada URL de faceta é uma decisão binária: ela corresponde a uma demanda de busca real (→ landing page indexável) ou é apenas UX (→ suprimir)? Tome essa decisão antes de tocar em uma única tag. Ferramentas não corrigem uma estratégia ausente.
2. As três alavancas fazem três trabalhos diferentes. Mantenha isto claro e a maior parte da confusão sobre facetas desaparece:
robots.txt→ controla o rastreamento (não a indexação)noindex→ controla a indexação (não o rastreamento — exige rastreamento)canonical→ consolida sinais (uma indicação; não interrompe o rastreamento)
3. A regra de decisão da supressão.
- Quer que os bots ignorem completamente um espaço e não se importa com a indexação? → bloqueio de
robots.txt. - Quer uma página fora do índice? → permita o rastreamento +
noindex(nunca a bloqueie). - Quer que um filtro sem demanda nunca crie uma URL? → fragmento de URL (
#) ou AJAX sem<a href>.
4. Prevenir é melhor que remediar. A navegação facetada mais limpa é aquela em que URLs inúteis nunca nascem — fragmentos e filtragem no lado do cliente para estados sem demanda, páginas reais apenas para os respaldados por demanda. Limpar um milhão de URLs já rastreadas dá muito mais trabalho do que nunca criá-las.
5. A troca da cauda longa. A filtragem em JavaScript/AJAX suprime o desperdício de rastreamento e a indexação em um só movimento. Isso é uma vantagem para facetas inúteis e um problema para as valiosas. Pré-renderize as combinações respaldadas por demanda; deixe o restante no lado do cliente.
Controle da navegação facetada — guia rápido
O que cada controle realmente faz
| Controle | Interrompe o rastreamento? | Interrompe a indexação? | Melhor para | Atenção |
|---|---|---|---|---|
robots.txt disallow | Sim | Não | Alívio do orçamento de rastreamento em espaços de facetas de baixo valor | URLs bloqueadas com links ainda podem aparecer como resultados só de URL |
noindex (meta/cabeçalho) | Não (precisa ser rastreável) | Sim | Remover páginas de facetas do índice | Não economiza orçamento; nunca combine com um bloqueio de robots.txt |
rel="canonical" | Não | Consolida (indicação) | Apontar páginas filtradas para a categoria-pai | Indicação, não diretiva; o Google continua rastreando as URLs não canônicas |
Fragmento de URL (#) | Sim (ignorado) | Sim (ignorado) | Filtros sem demanda dos quais você quer impacto zero | Não é compartilhável sem pushState em JavaScript |
rel="nofollow" nos links | Desencoraja | Não | Reduzir o fluxo de autoridade para URLs de filtros | Precisa estar em todo link para essa URL; agora é uma indicação |
| Tornar indexável | Não | Não | facetas respaldadas por demanda (~300+/mês) | Precisa de texto exclusivo + canonical autorreferente + sitemap |
Nunca combine
noindex+ bloqueio derobots.txt→ o Google não consegue ver onoindex→ continua indexada.noindex+canonical→ sinais contraditórios (Mueller: escolha um).- Apenas
canonicalpara orçamento de rastreamento → não interrompe o rastreamento.
Regras de URL para facetas que você indexa
- Use apenas o separador
&, sem vírgulas, ponto e vírgula ou colchetes. - Mantenha uma ordem consistente dos filtros para obter uma única forma canônica.
- Não repita valores de filtro.
- Retorne
404para combinações vazias ou impossíveis, não uma página 200 de “sem resultados”. - Prefira caminhos limpos a strings de consulta:
/sofas/blue/em vez de/sofas?color=blue&sort=.
Fatos rápidos
- Navegação facetada ≈ 50% dos problemas de rastreamento relatados ao Google (Illyes).
- Ferramenta de Parâmetros de URL do GSC: removida (abril de 2022) — apenas controles no servidor.
- Equivalente do Bing: Normalização de URL no Bing Webmaster Tools — ainda ativa.
- O Google ignora fragmentos de URL (
#) para rastreamento e indexação. - Limite de demanda de trabalho para uma página de faceta indexável: ~300+ pesquisas/mês.
Ferramentas para diagnosticar e gerenciar a navegação facetada
- Ahrefs Site Audit — revela a explosão de URLs com parâmetros, grupos quase duplicados e a profundidade de rastreamento das páginas filtradas.
- Screaming Frog SEO Spider — rastreie o site com extração personalizada para mapear cada parâmetro de filtro e as conexões entre URLs de facetas.
- Google Search Console — relatório de Indexação de páginas — “Crawled — currently not indexed” (tradução) «Rastreada — atualmente não indexada» e “Duplicate without user-selected canonical” (tradução) «Duplicada sem canonical selecionada pelo usuário» são categorias em que o excesso de facetas aparece.
- Inspeção de URL do GSC — confirme como uma URL de filtro é rastreada, renderizada e indexada, além da canonical escolhida pelo Google.
- Análise dos arquivos de log do servidor (Screaming Frog Log File Analyser ou logs enviados ao BigQuery) — mostra quanto do rastreamento é gasto em URLs com parâmetros.
- Bing Webmaster Tools — Normalização de URL — controle de parâmetros ainda disponível no Bing, com detecção prévia de parâmetros duplicados comuns para revisão.
- Pesquisa de palavras-chave (Ahrefs Keywords Explorer) — identifica quais modificadores de facetas têm demanda suficiente para justificar uma landing page indexável.
Teste seus conhecimentos: navegação facetada
Cinco perguntas sobre como decidir quais URLs de facetas indexar e qual controle usar.
Registro de alterações
Atualizado em 22 de ago. de 2026.
Resumo editorial e detalhes registrados da alteração.Detalhes da alteração
-
As notas detalhadas sobre as alterações estão disponíveis atualmente em inglês.
Não é possível fazer a comparação completa — nenhum instantâneo anterior foi arquivado para esta revisão.
Atualizado em 21 de ago. de 2026.
Resumo editorial e detalhes registrados da alteração.Detalhes da alteração
-
As notas detalhadas sobre as alterações estão disponíveis atualmente em inglês.
Não é possível fazer a comparação completa — nenhum instantâneo anterior foi arquivado para esta revisão.
Atualizado em 28 de jul. de 2026.
Resumo editorial e detalhes registrados da alteração.Detalhes da alteração
-
As notas detalhadas sobre as alterações estão disponíveis atualmente em inglês.
Não é possível fazer a comparação completa — nenhum instantâneo anterior foi arquivado para esta revisão.
Atualizado em 27 de jul. de 2026.
Resumo editorial e detalhes registrados da alteração.Detalhes da alteração
-
As notas detalhadas sobre as alterações estão disponíveis atualmente em inglês.
Não é possível fazer a comparação completa — nenhum instantâneo anterior foi arquivado para esta revisão.
Atualizado em 18 de jul. de 2026.
Resumo editorial e detalhes registrados da alteração.Detalhes da alteração
-
As notas detalhadas sobre as alterações estão disponíveis atualmente em inglês.
-
As notas detalhadas sobre as alterações estão disponíveis atualmente em inglês.
-
As notas detalhadas sobre as alterações estão disponíveis atualmente em inglês.
-
As notas detalhadas sobre as alterações estão disponíveis atualmente em inglês.
Não é possível fazer a comparação completa — nenhum instantâneo anterior foi arquivado para esta revisão.