Orçamento de rastreamento

O que o crawl budget realmente é — capacidade de rastreamento mais demanda de rastreamento — o que o desperdiça e o teste honesto para saber se seu site é grande o bastante para precisar se importar.

Publicado pela primeira vez: 22 de jun. de 2026 · Última atualização: 3 de ago. de 2026 · Avançado
Idiomas
1 sinal de evidência nesta página

Crawl budget é quanto um mecanismo de busca pode e quer rastrear do seu site — capacidade de rastreamento (o que seu servidor suporta) vezes demanda de rastreamento (popularidade e desatualização). Não é um fator de ranqueamento: rastrear mais não melhora as posições. A maioria dos sites nunca precisa gerenciá-lo — Mueller diz que 100k URLs geralmente não farão diferença, e o próprio guia do Google orienta sites pequenos ou rastreados no mesmo dia a não se preocupar. Ele importa principalmente em 1M+ páginas, 10k+ páginas que mudam diariamente ou quando muitas URLs ficam em "Discovered – currently not indexed". A maior alavanca é remover desperdício (navegação facetada, duplicatas, soft 404s e espaços infinitos) para que o budget se concentre nas URLs que importam.

TL;DR — Crawl budget = limite de capacidade de rastreamento (o que seu servidor suporta) × demanda de rastreamento (popularidade + desatualização + inventário percebido). É uma questão de eficiência, não um sinal de classificação. Internamente, é um agendamento por importância limitado pela carga do host, não uma cota fixa por site. A maioria dos sites pode ignorá-lo — Mueller considera 100 mil URLs “geralmente insuficientes”, e o Google diz que sites rastreados no mesmo dia devem ignorar o guia. Ele começa a doer em cerca de 1 milhão ou mais de páginas (mudança semanal), 10 mil ou mais de páginas (mudança diária) ou quando “Discovered – currently not indexed” cresce muito. A medida de maior impacto é cortar o desperdício — navegação facetada, duplicatas, soft 404s e espaços infinitos — para que o budget se consolide nas URLs que importam. Evidence for this claim Google defines crawl budget using crawl capacity limit and crawl demand. Scope: Google Search crawling for larger sites. Confidence: high · Verified: Google: Large site crawl budget guide

O modelo de dois fatores

O Google define isso de forma clara: “The amount of time and resources that Google devotes to crawling a site is commonly called the site’s crawl budget and it’s determined by two main elements: crawl capacity limit and crawl demand.” A formulação de 2017 de Gary Illyes é a frase curta à qual ainda recorro: crawl budget é “the number of URLs Googlebot can and wants to crawl.” Evidence for this claim Google defines crawl budget using crawl capacity limit and crawl demand. Scope: Google Search crawling for larger sites. Confidence: high · Verified: Google: Large site crawl budget guide Mantenha o escopo: crawl budget governa a busca, não a indexação. Uma URL rastreada ainda passa por uma decisão de indexação separada — juntar as duas coisas exagera o que o crawl budget controla.

Limite de capacidade de rastreamento (o lado da oferta). Este é “the maximum number of simultaneous parallel connections that Google can use to crawl a site, as well as the time delay between fetches.” Ele varia conforme a saúde do seu servidor. Responda de forma rápida e limpa e o limite sobe; forneça respostas lentas, erros 5xx ou 429 e o Googlebot recua. No meu deck How Search Works, listo os mesmos gatilhos do limite de taxa: estabilidade do servidor, respostas lentas, erros de servidor 5xx e 429 (muitas solicitações). Esse é o “consegue”.

Demanda de rastreamento (o lado da demanda). Ela é impulsionada pela popularidade (quantos links apontam para uma URL / quão importante ela é) e pela desatualização (há quanto tempo foi rastreada pela última vez e com que frequência muda). O mesmo deck divide a demanda em PageRank, frequência de mudança da página, tempo desde o último rastreamento e grandes alterações no site. É importante que o Google aponte o inventário percebido como a alavanca que você mais controla: “Without guidance from you, Google tries to crawl all or most of the URLs that it knows about on your site. If many of these URLs are duplicates, or you don’t want them crawled for some other reason… this wastes a lot of Google crawling time on your site. This is the factor that you can positively control the most.”

Demand sets the priority order; capacity determines how much of that ordered queue Googlebot can actually crawl. Fonte: Google Search Central

Crawl demand comes from popularity, genuine change, and the value of the URL inventory. It orders URLs in a priority queue. Crawl capacity comes from server response speed, stability, and error behavior. It limits how far Googlebot proceeds through that queue. Their interaction is the site's realized crawl budget, not a fixed daily URL quota.

© Patrick Stox LLC · CC BY 4.0 ·

Alguns fatos estruturais pegam as pessoas de surpresa:

  • O budget é por hostname. https://www.example.com/ and https://code.example.com/ are two different hostnames, and therefore have separate crawl budgets.” Subdomínios não compartilham o budget.
  • Os diferentes tipos de Googlebot provavelmente usam um único pool. Nos meus próprios relatórios, imagem, notícias, vídeo, anúncios e os demais parecem consumir o mesmo budget por site — não tenho uma fonte primária atual do Google que determine isso com precisão, então trate como uma observação de profissional, não como uma política documentada. De qualquer forma, vale verificar a divisão por tipo de crawler no relatório de estatísticas de rastreamento se você suspeitar que um tipo está tomando espaço dos outros.

O que ele realmente é internamente: agendamento por importância

“Crawl budget” é um termo abrangente criado pelo setor de SEO. Internamente, ele se aproxima mais de agendamento limitado pela carga do host. Como Illyes descreveu, o agendador do Google “sets a bucket of URLs in importance order and GoogleBot will crawl in that order based on the schedule the host load decided. If Google thinks your server can handle it, it will crawl the whole bucket, if not, it will stop.”

Isso reformula todo o assunto. Não é uma cota fixa de “você recebe N páginas por dia” — é uma fila priorizada, e o rastreamento acompanha a demanda de pesquisa. Illyes novamente: “If search demand goes down, then that also correlates to the crawl limit going down,” e “if you want to increase how much we crawl, then you somehow have to convince search that your stuff is worth fetching, which is basically what the scheduler is listening to.” A equipe de Search Relations chamou explicitamente de equívoco a ideia de uma “cota fixa diária de páginas”.

Seu site realmente tem um problema de crawl budget?

Esta é a seção mais valiosa, então vou ser direto: a maioria dos sites não precisa se preocupar com crawl budget. O próprio guia do Google começa reduzindo a urgência: “If your site doesn’t have a large number of pages that change rapidly, or if your pages seem to be crawled the same day that they are published, you don’t need to read this guide. For Google Search specifically, merely keeping your sitemap up to date and checking your index coverage regularly is adequate.” Evidence for this claim Google says sites without many rapidly changing pages, or whose pages are crawled the day they publish, generally do not need crawl-budget guidance. Scope: Google's rough applicability guidance, not a guarantee for every site. Confidence: high · Verified: Google: Large site crawl budget guide

John Mueller deu o número concreto: “100k URLs is usually not enough to affect crawl budget (it’s <1/minute over 3 months).” Se você está abaixo de seis dígitos de URLs e as páginas são rastreadas prontamente, siga em frente.

Quando ele importa, os limites aproximados do Google são:

  • Sites grandes — 1 milhão ou mais de páginas únicas com conteúdo que muda com frequência moderada (aproximadamente semanalmente).
  • Sites médios ou maiores — 10 mil ou mais de páginas únicas com conteúdo que muda muito rapidamente (diariamente).
  • Sites com uma grande parcela de URLs classificadas como “Discovered – currently not indexed” no Search Console — essa é a luz de alerta de que o Google conhece as URLs, mas não está conseguindo chegar até elas.

O Google acrescenta o aviso de que “the numbers given here are a rough estimate… not exact thresholds.” Mesmo em sites grandes, a nuance do meu próprio trabalho continua válida: geralmente são páginas novas, com poucos links ou estáticas que ficam para trás — não as populares.

Crawl budget afeta as classificações? Não.

Rastrear é necessário para ranquear, mas não é um sinal de classificação. O Google disse em 2017: “An increased crawl rate will not necessarily lead to better positions in Search results. Google uses hundreds of signals to rank the results, and while crawling is necessary for being in the results, it’s not a ranking signal.” Eu digo isso da mesma forma no meu guia da Ahrefs: “More crawling doesn’t mean you’ll rank better, but if your pages aren’t crawled and indexed they aren’t going to rank at all.” Trate crawl budget como um problema de eficiência, ponto final.

O que desperdiça crawl budget

Illyes publicou a lista canônica de URLs de baixo valor agregado “in order of significance”:

  1. Navegação facetada e identificadores de sessão — o principal culpado, especialmente combinações de filtro e ordenação de comércio eletrônico que multiplicam URLs de forma combinatória.
  2. Conteúdo duplicado no site — as variantes técnicas clássicas: HTTP versus HTTPS, não-www versus www, barra final versus ausência dela, maiúsculas versus minúsculas, páginas padrão/index e parâmetros de URL. (Cerca de 60% da web é conteúdo duplicado, segundo a própria estimativa interna do Google.)
  3. Páginas de erro leves — soft 404s que retornam 200 continuam sendo rastreados.
  4. Páginas invadidas.
  5. Espaços infinitos e proxies — calendários, paginação com rolagem infinita que duplica conteúdo, combinações facetadas; os padrões clássicos de armadilhas para spiders.
  6. Conteúdo de baixa qualidade e spam.

O custo é concreto: “Wasting server resources on pages like these will drain crawl activity from pages that do actually have value, which may cause a significant delay in discovering great content on a site.” Além da lista, cadeias longas de redirecionamento “have a negative effect on crawling,” e páginas lentas e pesadas tornam cada busca mais cara.

Como otimizar

Todo o jogo consiste em consolidar o budget nas URLs que importam:

  • Consolide duplicatas. O Google diz: “Consolidate duplicate content to focus crawling on unique content rather than unique URLs.” Escolha um host, um protocolo e uma convenção de barra final; use canônicas; trate os parâmetros.
  • Bloqueie caminhos realmente inúteis com robots.txt — mas apenas caminhos que você nunca quer que sejam rastreados. Para navegação facetada, as opções usuais são bloquear os caminhos com parâmetros no robots.txt ou usar # em vez de ? para que as URLs não sejam rastreáveis.
  • Não use noindex para economizar budget. O Google diz: “Don’t use noindex, as Google will still request, but then drop the page when it sees a noindex meta tag or header in the HTTP response, wasting crawling time.” A solicitação ainda custa para você. Bloqueie no robots.txt se nunca quiser que a URL seja buscada.
  • Não espere que o robots.txt realocará o budget. “Google won’t shift this newly available crawl budget to other pages unless Google is already hitting your site’s serving limit.” Bloquear lixo é uma boa prática, mas não entrega os rastreamentos liberados às páginas boas a menos que você já esteja limitado pela capacidade.
  • Corrija soft 404s; retorne 404/410 reais para páginas removidas. “A 404 status code is a strong signal not to crawl that URL again.”
  • Encurte cadeias de redirecionamento, mantenha sitemaps atuais (lastmod honesto) e melhore a velocidade do servidor.
  • Fortaleça links internos para páginas importantes e novas — é mais fácil que qualquer outra coisa porque está totalmente sob seu controle.

E existem apenas duas formas — somente duas — de o Google dizer que você pode realmente aumentar o budget: “Add more server resources… [and] optimize your content’s quality.” Observe a armadilha: um servidor mais rápido eleva o teto de capacidade, mas, se a demanda for baixa, o Google ainda rastreará menos. Você precisa dos dois.

Como medir

  • Relatório de estatísticas de rastreamento do GSC > Configurações — total de solicitações de rastreamento ao longo do tempo, tempo médio de resposta, status do host e divisões por código de resposta, tipo de arquivo e tipo de Googlebot. Esta é a visão do próprio Google de como ele rastreia você.
  • Análise de arquivos de log do servidor — a fonte da verdade. Solicitações reais do Googlebot por padrão de URL, para que você veja desperdício de rastreamento e páginas importantes não rastreadas. Verifique se o bot é realmente o Googlebot por DNS reverso + direto ou pelos intervalos de IP publicados pelo Google (muitos bots falsos imitam o user-agent).
  • “Discovered – currently not indexed” no GSC — trate um acúmulo crescente aqui como uma luz de alerta do crawl budget: o Google conhece as URLs, mas não está chegando até elas.
Crawl waste appears in the mismatch: facet URLs occupy 45% of the inventory and 61% of requests, but only 8% of useful 200 responses.

In a synthetic cohort, product pages are 28 percent of the URL inventory, 24 percent of Googlebot requests, and 52 percent of useful 200 responses. Category pages are 7, 10, and 21 percent. Facet URLs are 45, 61, and 8 percent. Gone URLs are 20, 5, and 0 percent. The figures illustrate comparison logic, not a live log sample.

Bing e outros mecanismos: “eficiência de rastreamento”

O Bing reformula o assunto como eficiência de rastreamento, em vez de budget. A definição de Fabrice Canel: “The crawl efficiency is how often we crawl and discover new and fresh content per page crawled.” O objetivo é “crawl an URL only when the content has been added (URL not crawled before), updated (fresh on-page context or useful outbound links).” A filosofia direta do Bing: “Less is more for SEO. Never forget that. Less URLs to crawl, better for SEO.”

A correção preferida do Bing é o IndexNow — envie URLs alteradas para que o bingbot não precise fazer rastreamentos exploratórios — e o Crawl Control no Bing Webmaster Tools, que permite agendar por hora quando o bingbot rastreia para proteger a carga do servidor. Esta é uma divergência real entre Google e Bing: o Google descontinuou seu antigo limitador de taxa de rastreamento no Search Console, enquanto o Bing ainda permite moldar ativamente o cronograma de rastreamento.

Mitos sobre crawl budget, corrigidos

  • “Todo site deve otimizar o crawl budget.” Não — a maioria não deve. Rastreamento no mesmo dia e menos de 100 mil URLs significam que você está bem.
  • “Mais rastreamento = melhores classificações.” Não. Rastrear é necessário, mas não é um sinal de classificação.
  • “É uma cota fixa diária de páginas.” Não — é agendamento orientado pela importância e limitado pela carga do host.
  • “Use noindex para economizar budget.” Não — o Google ainda solicita a página primeiro.
  • “Bloqueie páginas no robots.txt para dar mais budget a outras páginas.” Em geral, não, a menos que você já esteja no limite de capacidade de atendimento.
  • “Um servidor mais rápido sozinho aumenta seu budget.” Ele eleva apenas o teto de capacidade; demanda baixa ainda significa menos rastreamentos.

Para o pipeline mais amplo em que isso se encaixa — descoberta, o agendador de rastreamento, renderização e a diferença entre rastreamento e indexação — consulte o hub de crawling. Os tópicos relacionados (taxa de rastreamento, frequência de rastreamento, armadilhas para spiders e análise de arquivos de log) aprofundam cada parte.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.