SEO para busca interna em e-commerce

A caixa de busca da sua loja pode impulsionar conversões e, ao mesmo tempo, criar um risco de rastreamento. Veja como manter páginas de resultados internos fora do índice do Google sem desperdiçar orçamento de rastreamento, quando transformar uma consulta real em uma página de destino indexável e como extrair ideias de palavras-chave e conteúdo dos registros de busca do site.

1 sinal de evidência nesta página

A busca interna em e-commerce reúne dois temas. A caixa de busca é uma ferramenta de conversão com alta intenção, e seus registros revelam palavras-chave e oportunidades de conteúdo. Já as páginas que ela gera (/search?q=...) formam um espaço quase infinito de URLs rasas, quase duplicadas e muitas vezes vazias. Para mantê-las fora do índice e da fila de rastreamento, prefira bloquear o caminho no robots.txt a usar noindex: como diz o Google, *“don't use noindex, as Google will still request, but then drop the page… wasting crawling time”* _(tradução)_ «não use noindex, pois o Google ainda solicitará a página e só depois a descartará… desperdiçando tempo de rastreamento». Nunca combine disallow e noindex na mesma URL, pois um robô bloqueado não consegue ler a tag. Retorne 404 reais para conjuntos vazios, não soft 404s. Quando uma consulta tiver demanda genuína e recorrente, não indexe a URL bruta da busca; crie uma página adequada de categoria ou de destino.

TL;DR — A busca interna de um e-commerce reúne dois temas sob o mesmo nome, e o segredo é não confundi-los. O recurso é um ponto de conversão com alta intenção, e seus registros de consulta estão entre as melhores fontes próprias para pesquisa de palavras-chave. Já as páginas de resultados (/search?q=...) formam um espaço quase infinito de URLs com pouco conteúdo, quase duplicadas e muitas vezes vazias — o Google as inclui, ao lado da navegação facetada e dos identificadores de sessão, entre as principais categorias de URLs de baixo valor que “drain crawl activity from pages that do actually have value” (tradução): “drenam a atividade de rastreamento das páginas que realmente têm valor”. O ponto central: para mantê-las fora do índice, robots.txt é melhor que noindex — o Google afirma “don’t use noindex, as Google will still request, but then drop the page… wasting crawling time” (tradução): “não use noindex, pois o Google ainda solicitará a página e só depois a descartará… desperdiçando tempo de rastreamento”. Portanto, bloqueie o caminho da busca para que os bots nunca gastem orçamento nele. Nunca combine um disallow no robots.txt com noindex na mesma URL: uma página bloqueada não pode ser lida, a tag noindex não é vista e a URL pode permanecer no índice se receber links. Para conjuntos vazios, retorne 404 reais, não soft 404s (“soft 404 pages will continue to be crawled, and waste your budget” (tradução): “páginas soft 404 continuarão sendo rastreadas e desperdiçarão seu orçamento”). Quando uma consulta tiver demanda genuína e recorrente, não indexe a URL bruta da busca; crie uma página adequada de categoria ou de destino.

Dois trabalhos que não se sobrepõem

A busca interna costuma confundir as pessoas porque “SEO para busca interna em e-commerce” reúne dois trabalhos que quase não têm relação entre si:

  1. Oferecer uma boa experiência de busca. Relevância, velocidade, tolerância a erros, sinônimos, merchandising, tratamento de resultados vazios e — sobretudo — análise dos registros de consulta em busca de sinais de demanda. É um trabalho de UX e CRO que também beneficia o SEO.
  2. Impedir que as URLs de resultados prejudiquem a busca orgânica. Evite que desperdicem orçamento de rastreamento, inchem o índice e criem páginas quase duplicadas.

Otimize o primeiro trabalho com afinco. No segundo, a postura padrão é a contenção, com uma exceção deliberada explicada mais adiante. A maior parte da confusão nasce quando o entusiasmo do primeiro trabalho (“vamos fazer nossas páginas de busca ranquearem!”) é aplicado a um espaço de URLs que quase nunca merece isso.

Por que as páginas de resultados prejudicam o rastreamento

As URLs de busca interna são um exemplo clássico do espaço de baixo valor contra o qual o Google alerta. Na publicação de referência sobre orçamento de rastreamento, Gary Illyes enumera, “in order of significance” (tradução): «em ordem de importância», as categorias que desperdiçam esse orçamento. “Navegação facetada e identificadores de sessão” aparece em primeiro lugar — no original, “Faceted navigation and session identifiers” (tradução): «Navegação facetada e identificadores de sessão» —, seguida por “On-site duplicate content” (tradução): «Conteúdo duplicado no site» e “Soft error pages” (tradução): «Páginas com erros soft». As páginas de resultados da busca interna se enquadram nas três categorias ao mesmo tempo:

  • Espaço infinito e gerado dinamicamente. Cada consulta diferente — inclusive erros de digitação, bots e lixo na string de consulta — pode gerar uma nova URL. É a mesma explosão de parâmetros que torna a navegação facetada perigosa.
  • Conteúdo raso e quase duplicado. Uma busca ?q=running-shoes e sua categoria /shoes/running/ podem exibir quase os mesmos produtos; assim, a página de busca compete com uma página que você realmente quer ranquear — e ainda a duplica.
  • Páginas vazias ou com erro flexível. Páginas “sem resultados” têm baixo valor por definição. Se retornarem 200 OK, serão soft 404s, que o Google aponta especificamente como desperdício de rastreamento.

O custo é exatamente o descrito por Illyes: “Wasting server resources on pages like these will drain crawl activity from pages that do actually have value, which may cause a significant delay in discovering great content on a site.” (tradução): “Desperdiçar recursos do servidor em páginas como essas drenará a atividade de rastreamento das páginas que realmente têm valor, o que pode causar um atraso significativo na descoberta de ótimo conteúdo em um site.” Em uma loja grande, URLs de busca sem controle podem se tornar silenciosamente um dos maiores sorvedouros do seu orçamento de rastreamento.

Uma ressalva sobre escala, porque é fácil se preocupar demais: o Google deixa claro que orçamento de rastreamento é sobretudo uma questão para sites grandes — “if your pages seem to be crawled the same day that they are published, you don’t need to read this guide.” (tradução): “se suas páginas parecem ser rastreadas no mesmo dia em que são publicadas, você não precisa ler este guia”. Uma loja Shopify com 500 produtos não será limitada por causa de algumas URLs de busca. Mesmo em sites pequenos, porém, permitir que essas páginas entrem no índice cria conteúdo duplicado ou raso e inchaço do índice, problemas que vale prevenir independentemente do orçamento. A contenção é barata em qualquer escala.

robots.txt versus noindex — faça do jeito certo

Este é o ponto de precisão central do tema — e aquele que a maioria das lojas entende ao contrário. Você tem dois controles, com funções diferentes:

  • Uma regra de bloqueio no robots.txt interrompe o rastreamento. Os bots não solicitam a URL e, portanto, não gastam orçamento nela. É o controle adequado para resultados da busca interna, pois essas URLs não merecem ser acessadas em primeiro lugar.
  • noindex impede a indexação, mas somente depois que a página é rastreada: o Googlebot precisa solicitá-la para encontrar a tag. Logo, noindex não economiza orçamento de rastreamento. O guia do Google é direto: “Não use noindex, pois o Google ainda solicitará a página e só a descartará quando encontrar uma metatag ou um cabeçalho noindex na resposta HTTP, desperdiçando tempo de rastreamento.” No original: “Don’t use noindex, as Google will still request, but then drop the page when it sees a noindex meta tag or header in the HTTP response, wasting crawling time.” (tradução): «Não use noindex, pois o Google ainda solicitará a página e só a descartará quando encontrar uma metatag ou um cabeçalho noindex na resposta HTTP, desperdiçando tempo de rastreamento.»

Portanto, para o objetivo padrão de “manter as páginas de busca fora do Google e da fila de rastreamento”, aplique disallow ao caminho de busca no robots.txt:

User-agent: *
Disallow: /search
Disallow: /*?q=
Disallow: /*?s=

(Ajuste o caminho ao usado pela sua plataforma — /search, ?q=, ?s=, /catalogsearch/ no Magento etc.)

O erro crítico: nunca use disallow e noindex na mesma URL. Quando uma URL é bloqueada no robots.txt, o Googlebot não consegue acessá-la e, portanto, não vê a tag noindex nela. Evidência desta afirmação Google must crawl a page to see noindex, so a robots.txt block prevents Google from processing that page's noindex rule. Escopo: Robots.txt controls crawling, while noindex controls indexing after retrieval. Confiança: alta · Verificado: Google: Block indexing with noindex O bloqueio prevalece; a tag fica invisível. Além disso, uma URL bloqueada por robots ainda pode acabar indexada (apenas como URL, sem snippet) se receber algum link, pois robots.txt controla o rastreamento, não a indexação. Assim:

  • Objetivo: não desperdiçar rastreamento nem ranquear essas URLs → disallow no robots.txt (o caso normal para páginas de busca).
  • Objetivo: elas já estão indexadas e precisam ser removidas → permita temporariamente o rastreamento e sirva noindex até que saiam do índice; depois, você poderá aplicar disallow. Não use ambos ao mesmo tempo.

Resultados vazios: 404 reais, não soft 404s

Quando uma busca não retorna nada, a escolha errada é servir uma página “sem resultados” com 200 OK: isso é um soft 404, e o Google alerta que “soft 404 pages will continue to be crawled, and waste your budget” (tradução): “páginas soft 404 continuarão sendo rastreadas e desperdiçarão seu orçamento”. Evidência desta afirmação Soft-404 pages can continue to consume crawl resources because they return a success response for missing content. Escopo: Google may classify pages algorithmically based on content and response behavior. Confiança: alta · Verificado: Google: Large-site crawl budget Há opções melhores para uma página sem resultados:

  • Retorne um status 404 verdadeiro (ou 410) para que o Google receba “a strong signal not to crawl that URL again” (tradução): “um forte sinal para não rastrear essa URL novamente”.
  • Ou ofereça uma experiência útil de “nenhum resultado” em uma URL já bloqueada no robots.txt. Se os bots nunca rastreiam /search, o código de status da página vazia deixa de importar para o orçamento, e você pode concentrar a página em recuperar o comprador (categorias sugeridas, produtos populares e sugestões ortográficas).

A experiência do usuário e a correção de rastreamento não entram em conflito: bloqueie o caminho de busca para bots e projete a página de resultados vazios para recuperar a conversão dos usuários.

A única situação em que você quer uma página indexável

A contenção é o padrão, mas seus registros de busca escondem uma oportunidade real de cauda longa. O erro é tentar aproveitá-la indexando URLs brutas /search?q=. Não faça isso. Em vez disso:

  1. Analise os registros de consulta. As buscas internas formam uma lista própria de demanda nas palavras dos clientes — incluindo lacunas de produtos (“eles procuram algo que eu não vendo?”) e expressões ausentes nos nomes de suas categorias.
  2. Valide a demanda externa. Compare as consultas internas de maior volume com a demanda real em mecanismos de busca usando uma ferramenta de palavras-chave. Uma expressão popular no seu site e com volume de busca orgânica é uma candidata.
  3. Crie uma página adequada — não use a URL de busca. Desenvolva uma página de categoria ou coleção (ou uma página de destino selecionada) em uma URL estática e limpa (/collections/gluten-free-protein-bars/), com título descritivo, H1, BreadcrumbList, uma ou duas frases realmente úteis e links internos. Essa página merece ser indexada e ranquear; a URL bruta de resultados, não.

É a mesma lógica de “bloquear o ruído e indexar o sinal” da navegação facetada — com a diferença de que, na busca interna, o sinal quase nunca justifica indexar a própria URL de busca. Transforme a demanda em uma página criada para esse fim.

Como este tema se relaciona com os demais

A busca interna em e-commerce se sobrepõe bastante a alguns temas próximos. Navegação facetada é o parente mais próximo: filtros e busca são duas versões do mesmo problema de explosão de parâmetros, e a orientação do Google para facetas (robots.txt para bloquear, 404 para combinações vazias e canonical como ferramenta mais fraca) se aplica quase diretamente às URLs de busca. SEO para páginas de categoria é o destino correto da demanda de cauda longa encontrada nos registros. Já o enquadramento de eficiência — capacidade mais demanda, com URLs de baixo valor drenando o orçamento das páginas reais — pertence ao tema orçamento de rastreamento. A busca interna é o elemento que transforma a caixa de busca da loja de risco oculto para o rastreamento em fonte de pesquisa de palavras-chave.

Adicionar uma nota de especialista

Fixar uma citação de especialista

É uma pessoa nova? Crie o perfil não reivindicado dela em /admin/experts/ → Fixar uma citação de especialista primeiro.