Orçamento de rastreamento
O que o crawl budget realmente é — capacidade de rastreamento mais demanda de rastreamento — o que o desperdiça e o teste honesto para saber se seu site é grande o bastante para precisar se importar.
Idiomas
1 sinal de evidência nesta página
- Ferramenta relacionada ativaLog File Analyzer
Crawl budget é quanto um mecanismo de busca pode e quer rastrear do seu site — capacidade de rastreamento (o que seu servidor suporta) vezes demanda de rastreamento (popularidade e desatualização). Não é um fator de ranqueamento: rastrear mais não melhora as posições. A maioria dos sites nunca precisa gerenciá-lo — Mueller diz que 100k URLs geralmente não farão diferença, e o próprio guia do Google orienta sites pequenos ou rastreados no mesmo dia a não se preocupar. Ele importa principalmente em 1M+ páginas, 10k+ páginas que mudam diariamente ou quando muitas URLs ficam em "Discovered – currently not indexed". A maior alavanca é remover desperdício (navegação facetada, duplicatas, soft 404s e espaços infinitos) para que o budget se concentre nas URLs que importam.
TL;DR — O crawl budget é o quanto um mecanismo de busca está disposto a rastrear do seu site. Ele é o resultado de duas coisas multiplicadas: quanto o seu servidor consegue suportar e quanto o Google quer rastrear. Rastrear mais não faz você ranquear melhor — e, para a maioria dos sites, isso nem é um problema. Se suas páginas são rastreadas no mesmo dia em que você as publica, você não tem um problema de crawl budget.
O que é crawl budget
Quando um mecanismo de busca rastreia seu site, ele não rastreia para sempre. Ele rastreia uma certa quantidade de URLs em uma determinada janela de tempo e depois segue em frente. Essa quantidade é o que profissionais de SEO chamam de crawl budget.
Tudo se resume a duas perguntas que o mecanismo de busca responde constantemente:
- Quanto eu consigo rastrear? Seu servidor só suporta uma determinada carga antes de ficar lento ou começar a gerar erros. O Google observa isso e recua. Essa é a capacidade de rastreamento (documentos antigos a chamavam de limite de taxa de rastreamento).
- Quanto eu quero rastrear? Páginas populares e páginas que mudam com frequência são rastreadas mais vezes. Páginas para as quais ninguém cria links, ou que nunca mudam, são rastreadas raramente. Isso é a demanda de rastreamento.
Multiplique os dois e você terá seu crawl budget: aproximadamente, o número de URLs que o Google pode e quer rastrear. Evidence for this claim Google defines crawl budget using crawl capacity limit and crawl demand. Scope: Google Search crawling for larger sites. Confidence: high · Verified: Google: Large site crawl budget guide
Vale fazer uma distinção desde o início: crawl budget diz respeito a saber se o Google busca uma URL. A decisão de indexar o que ele encontra vem depois e é separada. Uma página pode ser rastreada e ainda assim não ser indexada — o rastreamento não garante a indexação; é apenas a porta pela qual você precisa passar primeiro.
A primeira coisa a entender: provavelmente você não precisa se preocupar com isso
Esta é a parte que a maioria dos artigos esconde. A maioria dos sites não tem um problema de crawl budget. O Google diz isso diretamente — se suas páginas são rastreadas no mesmo dia em que são publicadas, ou se seu site não é enorme e não muda rapidamente, você pode ignorar o assunto todo. Evidence for this claim Google says sites without many rapidly changing pages, or whose pages are crawled the day they publish, generally do not need crawl-budget guidance. Scope: Google's rough applicability guidance, not a guarantee for every site. Confidence: high · Verified: Google: Large site crawl budget guide
Uma verificação simples: pesquise algumas das suas URLs no Google ou use a ferramenta de inspeção de URL no Search Console. Se suas páginas novas aparecerem em um ou dois dias, seu crawl budget está bom. Dedique seu tempo a conteúdo e links.
Crawl budget começa a importar quando um site tem centenas de milhares ou milhões de páginas, especialmente se muitas delas mudam o tempo todo (pense em uma grande loja de comércio eletrônico ou em um grande site de notícias).
Rastrear mais não significa melhores classificações
Vale acabar cedo com este mito: rastrear uma página com mais frequência não a faz subir nos resultados. Rastrear é apenas a forma como o mecanismo encontra e baixa sua página. É uma porta pela qual você precisa passar para poder ranquear — mas, depois que passou, a frequência com que você é rastreado novamente não é um fator de classificação.
Portanto, o objetivo não é “ser rastreado mais vezes”. O objetivo é garantir que as páginas com as quais você se importa sejam rastreadas e que o mecanismo não desperdice tempo com URLs inúteis.
O que desperdiça crawl budget
Se você tem um site grande, o budget é drenado por:
- URLs de filtro e ordenação (navegação facetada) — cada combinação de filtros em uma loja de comércio eletrônico pode gerar milhares de URLs quase idênticas.
- Páginas duplicadas — o mesmo conteúdo acessível em várias URLs (com e sem
www, com parâmetros anexados etc.). - Soft 404s — páginas de “não encontrado” que retornam um status
200 OK, fazendo o mecanismo continuar a rastreá-las. - Cadeias de redirecionamento quebradas e páginas lentas — elas tornam cada rastreamento mais caro.
A correção quase sempre é remover desperdício para que o budget se concentre em páginas reais — não tentar convencer o Google a rastrear “mais”.
Quer o modelo completo — capacidade versus demanda de rastreamento, os limites exatos de tamanho, o que fazer com navegação facetada, como o Bing trata isso de forma diferente e como medir — mude para a aba Avançado.
TL;DR — Crawl budget = limite de capacidade de rastreamento (o que seu servidor suporta) × demanda de rastreamento (popularidade + desatualização + inventário percebido). É uma questão de eficiência, não um sinal de classificação. Internamente, é um agendamento por importância limitado pela carga do host, não uma cota fixa por site. A maioria dos sites pode ignorá-lo — Mueller considera 100 mil URLs “geralmente insuficientes”, e o Google diz que sites rastreados no mesmo dia devem ignorar o guia. Ele começa a doer em cerca de 1 milhão ou mais de páginas (mudança semanal), 10 mil ou mais de páginas (mudança diária) ou quando “Discovered – currently not indexed” cresce muito. A medida de maior impacto é cortar o desperdício — navegação facetada, duplicatas, soft 404s e espaços infinitos — para que o budget se consolide nas URLs que importam. Evidence for this claim Google defines crawl budget using crawl capacity limit and crawl demand. Scope: Google Search crawling for larger sites. Confidence: high · Verified: Google: Large site crawl budget guide
O modelo de dois fatores
O Google define isso de forma clara: “The amount of time and resources that Google devotes to crawling a site is commonly called the site’s crawl budget and it’s determined by two main elements: crawl capacity limit and crawl demand.” A formulação de 2017 de Gary Illyes é a frase curta à qual ainda recorro: crawl budget é “the number of URLs Googlebot can and wants to crawl.” Evidence for this claim Google defines crawl budget using crawl capacity limit and crawl demand. Scope: Google Search crawling for larger sites. Confidence: high · Verified: Google: Large site crawl budget guide Mantenha o escopo: crawl budget governa a busca, não a indexação. Uma URL rastreada ainda passa por uma decisão de indexação separada — juntar as duas coisas exagera o que o crawl budget controla.
Limite de capacidade de rastreamento (o lado da oferta). Este é “the maximum number of simultaneous parallel connections that Google can use to crawl a site, as well as the time delay between fetches.” Ele varia conforme a saúde do seu servidor. Responda de forma rápida e limpa e o limite sobe; forneça respostas lentas, erros 5xx ou 429 e o Googlebot recua. No meu deck How Search Works, listo os mesmos gatilhos do limite de taxa: estabilidade do servidor, respostas lentas, erros de servidor 5xx e 429 (muitas solicitações). Esse é o “consegue”.
Demanda de rastreamento (o lado da demanda). Ela é impulsionada pela popularidade (quantos links apontam para uma URL / quão importante ela é) e pela desatualização (há quanto tempo foi rastreada pela última vez e com que frequência muda). O mesmo deck divide a demanda em PageRank, frequência de mudança da página, tempo desde o último rastreamento e grandes alterações no site. É importante que o Google aponte o inventário percebido como a alavanca que você mais controla: “Without guidance from you, Google tries to crawl all or most of the URLs that it knows about on your site. If many of these URLs are duplicates, or you don’t want them crawled for some other reason… this wastes a lot of Google crawling time on your site. This is the factor that you can positively control the most.”
Crawl demand comes from popularity, genuine change, and the value of the URL inventory. It orders URLs in a priority queue. Crawl capacity comes from server response speed, stability, and error behavior. It limits how far Googlebot proceeds through that queue. Their interaction is the site's realized crawl budget, not a fixed daily URL quota.
© Patrick Stox LLC · CC BY 4.0 ·
Alguns fatos estruturais pegam as pessoas de surpresa:
- O budget é por hostname. “
https://www.example.com/andhttps://code.example.com/are two different hostnames, and therefore have separate crawl budgets.” Subdomínios não compartilham o budget. - Os diferentes tipos de Googlebot provavelmente usam um único pool. Nos meus próprios relatórios, imagem, notícias, vídeo, anúncios e os demais parecem consumir o mesmo budget por site — não tenho uma fonte primária atual do Google que determine isso com precisão, então trate como uma observação de profissional, não como uma política documentada. De qualquer forma, vale verificar a divisão por tipo de crawler no relatório de estatísticas de rastreamento se você suspeitar que um tipo está tomando espaço dos outros.
O que ele realmente é internamente: agendamento por importância
“Crawl budget” é um termo abrangente criado pelo setor de SEO. Internamente, ele se aproxima mais de agendamento limitado pela carga do host. Como Illyes descreveu, o agendador do Google “sets a bucket of URLs in importance order and GoogleBot will crawl in that order based on the schedule the host load decided. If Google thinks your server can handle it, it will crawl the whole bucket, if not, it will stop.”
Isso reformula todo o assunto. Não é uma cota fixa de “você recebe N páginas por dia” — é uma fila priorizada, e o rastreamento acompanha a demanda de pesquisa. Illyes novamente: “If search demand goes down, then that also correlates to the crawl limit going down,” e “if you want to increase how much we crawl, then you somehow have to convince search that your stuff is worth fetching, which is basically what the scheduler is listening to.” A equipe de Search Relations chamou explicitamente de equívoco a ideia de uma “cota fixa diária de páginas”.
Seu site realmente tem um problema de crawl budget?
Esta é a seção mais valiosa, então vou ser direto: a maioria dos sites não precisa se preocupar com crawl budget. O próprio guia do Google começa reduzindo a urgência: “If your site doesn’t have a large number of pages that change rapidly, or if your pages seem to be crawled the same day that they are published, you don’t need to read this guide. For Google Search specifically, merely keeping your sitemap up to date and checking your index coverage regularly is adequate.” Evidence for this claim Google says sites without many rapidly changing pages, or whose pages are crawled the day they publish, generally do not need crawl-budget guidance. Scope: Google's rough applicability guidance, not a guarantee for every site. Confidence: high · Verified: Google: Large site crawl budget guide
John Mueller deu o número concreto: “100k URLs is usually not enough to affect crawl budget (it’s <1/minute over 3 months).” Se você está abaixo de seis dígitos de URLs e as páginas são rastreadas prontamente, siga em frente.
Quando ele importa, os limites aproximados do Google são:
- Sites grandes — 1 milhão ou mais de páginas únicas com conteúdo que muda com frequência moderada (aproximadamente semanalmente).
- Sites médios ou maiores — 10 mil ou mais de páginas únicas com conteúdo que muda muito rapidamente (diariamente).
- Sites com uma grande parcela de URLs classificadas como “Discovered – currently not indexed” no Search Console — essa é a luz de alerta de que o Google conhece as URLs, mas não está conseguindo chegar até elas.
O Google acrescenta o aviso de que “the numbers given here are a rough estimate… not exact thresholds.” Mesmo em sites grandes, a nuance do meu próprio trabalho continua válida: geralmente são páginas novas, com poucos links ou estáticas que ficam para trás — não as populares.
Crawl budget afeta as classificações? Não.
Rastrear é necessário para ranquear, mas não é um sinal de classificação. O Google disse em 2017: “An increased crawl rate will not necessarily lead to better positions in Search results. Google uses hundreds of signals to rank the results, and while crawling is necessary for being in the results, it’s not a ranking signal.” Eu digo isso da mesma forma no meu guia da Ahrefs: “More crawling doesn’t mean you’ll rank better, but if your pages aren’t crawled and indexed they aren’t going to rank at all.” Trate crawl budget como um problema de eficiência, ponto final.
O que desperdiça crawl budget
Illyes publicou a lista canônica de URLs de baixo valor agregado “in order of significance”:
- Navegação facetada e identificadores de sessão — o principal culpado, especialmente combinações de filtro e ordenação de comércio eletrônico que multiplicam URLs de forma combinatória.
- Conteúdo duplicado no site — as variantes técnicas clássicas: HTTP versus HTTPS, não-www versus www, barra final versus ausência dela, maiúsculas versus minúsculas, páginas padrão/index e parâmetros de URL. (Cerca de 60% da web é conteúdo duplicado, segundo a própria estimativa interna do Google.)
- Páginas de erro leves — soft 404s que retornam
200continuam sendo rastreados. - Páginas invadidas.
- Espaços infinitos e proxies — calendários, paginação com rolagem infinita que duplica conteúdo, combinações facetadas; os padrões clássicos de armadilhas para spiders.
- Conteúdo de baixa qualidade e spam.
O custo é concreto: “Wasting server resources on pages like these will drain crawl activity from pages that do actually have value, which may cause a significant delay in discovering great content on a site.” Além da lista, cadeias longas de redirecionamento “have a negative effect on crawling,” e páginas lentas e pesadas tornam cada busca mais cara.
Como otimizar
Todo o jogo consiste em consolidar o budget nas URLs que importam:
- Consolide duplicatas. O Google diz: “Consolidate duplicate content to focus crawling on unique content rather than unique URLs.” Escolha um host, um protocolo e uma convenção de barra final; use canônicas; trate os parâmetros.
- Bloqueie caminhos realmente inúteis com
robots.txt— mas apenas caminhos que você nunca quer que sejam rastreados. Para navegação facetada, as opções usuais são bloquear os caminhos com parâmetros norobots.txtou usar#em vez de?para que as URLs não sejam rastreáveis. - Não use
noindexpara economizar budget. O Google diz: “Don’t use noindex, as Google will still request, but then drop the page when it sees a noindex meta tag or header in the HTTP response, wasting crawling time.” A solicitação ainda custa para você. Bloqueie norobots.txtse nunca quiser que a URL seja buscada. - Não espere que o
robots.txtrealocará o budget. “Google won’t shift this newly available crawl budget to other pages unless Google is already hitting your site’s serving limit.” Bloquear lixo é uma boa prática, mas não entrega os rastreamentos liberados às páginas boas a menos que você já esteja limitado pela capacidade. - Corrija soft 404s; retorne 404/410 reais para páginas removidas. “A 404 status code is a strong signal not to crawl that URL again.”
- Encurte cadeias de redirecionamento, mantenha sitemaps atuais (
lastmodhonesto) e melhore a velocidade do servidor. - Fortaleça links internos para páginas importantes e novas — é mais fácil que qualquer outra coisa porque está totalmente sob seu controle.
E existem apenas duas formas — somente duas — de o Google dizer que você pode realmente aumentar o budget: “Add more server resources… [and] optimize your content’s quality.” Observe a armadilha: um servidor mais rápido eleva o teto de capacidade, mas, se a demanda for baixa, o Google ainda rastreará menos. Você precisa dos dois.
Como medir
- Relatório de estatísticas de rastreamento do GSC > Configurações — total de solicitações de rastreamento ao longo do tempo, tempo médio de resposta, status do host e divisões por código de resposta, tipo de arquivo e tipo de Googlebot. Esta é a visão do próprio Google de como ele rastreia você.
- Análise de arquivos de log do servidor — a fonte da verdade. Solicitações reais do Googlebot por padrão de URL, para que você veja desperdício de rastreamento e páginas importantes não rastreadas. Verifique se o bot é realmente o Googlebot por DNS reverso + direto ou pelos intervalos de IP publicados pelo Google (muitos bots falsos imitam o user-agent).
- “Discovered – currently not indexed” no GSC — trate um acúmulo crescente aqui como uma luz de alerta do crawl budget: o Google conhece as URLs, mas não está chegando até elas.
In a synthetic cohort, product pages are 28 percent of the URL inventory, 24 percent of Googlebot requests, and 52 percent of useful 200 responses. Category pages are 7, 10, and 21 percent. Facet URLs are 45, 61, and 8 percent. Gone URLs are 20, 5, and 0 percent. The figures illustrate comparison logic, not a live log sample.
Bing e outros mecanismos: “eficiência de rastreamento”
O Bing reformula o assunto como eficiência de rastreamento, em vez de budget. A definição de Fabrice Canel: “The crawl efficiency is how often we crawl and discover new and fresh content per page crawled.” O objetivo é “crawl an URL only when the content has been added (URL not crawled before), updated (fresh on-page context or useful outbound links).” A filosofia direta do Bing: “Less is more for SEO. Never forget that. Less URLs to crawl, better for SEO.”
A correção preferida do Bing é o IndexNow — envie URLs alteradas para que o bingbot não precise fazer rastreamentos exploratórios — e o Crawl Control no Bing Webmaster Tools, que permite agendar por hora quando o bingbot rastreia para proteger a carga do servidor. Esta é uma divergência real entre Google e Bing: o Google descontinuou seu antigo limitador de taxa de rastreamento no Search Console, enquanto o Bing ainda permite moldar ativamente o cronograma de rastreamento.
Mitos sobre crawl budget, corrigidos
- “Todo site deve otimizar o crawl budget.” Não — a maioria não deve. Rastreamento no mesmo dia e menos de 100 mil URLs significam que você está bem.
- “Mais rastreamento = melhores classificações.” Não. Rastrear é necessário, mas não é um sinal de classificação.
- “É uma cota fixa diária de páginas.” Não — é agendamento orientado pela importância e limitado pela carga do host.
- “Use
noindexpara economizar budget.” Não — o Google ainda solicita a página primeiro. - “Bloqueie páginas no
robots.txtpara dar mais budget a outras páginas.” Em geral, não, a menos que você já esteja no limite de capacidade de atendimento. - “Um servidor mais rápido sozinho aumenta seu budget.” Ele eleva apenas o teto de capacidade; demanda baixa ainda significa menos rastreamentos.
Para o pipeline mais amplo em que isso se encaixa — descoberta, o agendador de rastreamento, renderização e a diferença entre rastreamento e indexação — consulte o hub de crawling. Os tópicos relacionados (taxa de rastreamento, frequência de rastreamento, armadilhas para spiders e análise de arquivos de log) aprofundam cada parte.
Resumo de IA
Uma versão condensada do conteúdo avançado:
- Crawl budget = limite de capacidade de rastreamento × demanda de rastreamento. A capacidade é o que seu servidor suporta (sobe com respostas rápidas e limpas, cai com
5xx/429); a demanda é popularidade + desatualização + inventário percebido. A frase curta do Google: “the number of URLs Googlebot can and wants to crawl.” - Não é um fator de classificação. Rastrear é necessário para ranquear, mas rastrear mais não melhora as posições — é apenas uma questão de eficiência.
- Internamente, é agendamento por importância, limitado pela carga do host — uma fila priorizada, não uma cota fixa diária de páginas. O rastreamento acompanha a demanda de pesquisa.
- A maioria dos sites não precisa gerenciá-lo. Mueller: 100 mil URLs geralmente não são suficientes para importar. Google: se as páginas são rastreadas no mesmo dia, ignore o guia. O problema aparece em cerca de 1 milhão ou mais de páginas (mudança semanal), 10 mil ou mais (mudança diária) ou em um grande acúmulo de “Discovered – currently not indexed”.
- O que o desperdiça (na ordem do Google): navegação facetada / IDs de sessão, conteúdo duplicado, soft 404s, páginas invadidas, espaços infinitos, conteúdo de baixa qualidade — além de cadeias de redirecionamento e páginas lentas.
- Otimize removendo desperdício: consolide duplicatas, bloqueie caminhos inúteis no
robots.txt(nãonoindex— o Google solicita primeiro), corrija soft 404s, encurte redirecionamentos, mantenha sitemaps limpos e fortaleça links internos. Só há duas formas de realmente aumentar o budget: mais capacidade de servidor e maior qualidade de conteúdo. - Meça com as estatísticas de rastreamento do GSC, análise de logs do servidor e o relatório “Discovered – currently not indexed”.
- O Bing chama isso de eficiência de rastreamento (“less is more”) e incentiva IndexNow + Crawl Control, em vez da abordagem mais discreta do Google.
Documentação oficial
Documentação de fontes primárias dos mecanismos de busca.
- Otimize seu crawl budget — o documento canônico (movido da antiga URL do “guia do proprietário de site grande” nos documentos de infraestrutura de rastreamento do Google, atualizado pela última vez em dezembro de 2025): capacidade + demanda de rastreamento, quem precisa disso, a lista de desperdícios e como otimizar. Comece aqui.
- O que Crawl Budget significa para o Googlebot (Gary Illyes, 2017) — a formulação original: limite de taxa de rastreamento + demanda de rastreamento e as categorias de URLs de baixo valor agregado.
- Rastreamento e indexação — o hub de robots, sitemaps, canonicalização e controles de rastreamento.
- Série Crawling December (2024) — Googlebot, cache HTTP, navegação facetada e CDNs.
Bing / Microsoft
- Série bingbot: maximizando a eficiência de rastreamento — a reformulação do Bing como “eficiência de rastreamento” e seu norte.
- Série bingbot: otimizando a frequência de rastreamento — como o Bing decide a frequência de novo rastreamento.
- Bing Webmaster Tools — Crawl Control — agende por hora quando o bingbot rastreia.
- IndexNow / indexnow.org — envie URLs alteradas para que os mecanismos não precisem fazer rastreamentos exploratórios.
Citações da fonte
Declarações registradas do Google e do Bing. Cada link é um link profundo que salta para a passagem citada na página de origem.
Google — a definição
- “The amount of time and resources that Google devotes to crawling a site is commonly called the site’s crawl budget and it’s determined by two main elements: crawl capacity limit and crawl demand.” (Tradução: A quantidade de tempo e recursos que o Google dedica ao rastreamento de um site é comumente chamada de crawl budget do site e é determinada por dois elementos principais: limite de capacidade de rastreamento e demanda de rastreamento.) — Google Search Central docs. Ir para a citação
- “Google’s crawlers calculate a crawl capacity limit, which is the maximum number of simultaneous parallel connections that Google can use to crawl a site, as well as the time delay between fetches.” (Tradução: Os rastreadores do Google calculam um limite de capacidade de rastreamento, que é o número máximo de conexões paralelas simultâneas que o Google pode usar para rastrear um site, além do intervalo entre as buscas.) Ir para a citação
- “Taking crawl rate and crawl demand together we define crawl budget as the number of URLs Googlebot can and wants to crawl.” (Tradução: Considerando a taxa de rastreamento e a demanda de rastreamento em conjunto, definimos crawl budget como o número de URLs que o Googlebot pode e quer rastrear.) — Gary Illyes, Google (2017). Ir para a citação
Google — quando você não precisa se preocupar
- “If your site doesn’t have a large number of pages that change rapidly, or if your pages seem to be crawled the same day that they are published, you don’t need to read this guide.” (Tradução: Se seu site não tem um grande número de páginas que mudam rapidamente, ou se suas páginas parecem ser rastreadas no mesmo dia em que são publicadas, você não precisa ler este guia.) Ir para a citação
- “100k URLs is usually not enough to affect crawl budget (it’s <1/minute over 3 months).” (Tradução: 100k URLs geralmente não são suficientes para afetar o crawl budget (isso representa <1 por minuto ao longo de 3 meses).) — John Mueller, Google (2021). Leia a cobertura
Google — o que você controla, e rastreamento versus ranqueamento
- “If many of these URLs are duplicates, or you don’t want them crawled for some other reason (removed, unimportant, and so on), this wastes a lot of Google crawling time on your site. This is the factor that you can positively control the most.” (Tradução: Se muitas dessas URLs são duplicadas, ou se você não quer que sejam rastreadas por algum outro motivo (foram removidas, são sem importância e assim por diante), isso desperdiça muito tempo de rastreamento do Google no seu site. Este é o fator que você consegue controlar positivamente mais do que qualquer outro.) Ir para a citação
- “An increased crawl rate will not necessarily lead to better positions in Search results. Google uses hundreds of signals to rank the results, and while crawling is necessary for being in the results, it’s not a ranking signal.” (Tradução: Uma taxa de rastreamento maior não levará necessariamente a posições melhores nos resultados da Pesquisa. O Google usa centenas de sinais para ranquear os resultados e, embora o rastreamento seja necessário para aparecer nos resultados, ele não é um sinal de ranqueamento.) — Gary Illyes, Google (2017). Ir para a citação
Google — a lista de desperdícios e o que não fazer
- “Faceted navigation and session identifiers / On-site duplicate content / Soft error pages / Hacked pages / Infinite spaces and proxies / Low quality and spam content” — as categorias de baixo valor agregado, em ordem de importância. (Tradução: Navegação facetada e identificadores de sessão / Conteúdo duplicado no site / Páginas de erro leves / Páginas invadidas / Espaços infinitos e proxies / Conteúdo de baixa qualidade e spam.) — Gary Illyes, Google (2017). Ir para a citação
- “Consolidate duplicate content to focus crawling on unique content rather than unique URLs.” (Tradução: Consolide o conteúdo duplicado para concentrar o rastreamento em conteúdo único, em vez de URLs únicas.) Ir para a citação
- “Don’t use noindex, as Google will still request, but then drop the page when it sees a noindex meta tag or header in the HTTP response, wasting crawling time.” (Tradução: Não use noindex, pois o Google ainda fará a solicitação, mas depois descartará a página ao ver uma meta tag noindex ou um cabeçalho na resposta HTTP, desperdiçando tempo de rastreamento.) Ir para a citação
- “Google won’t shift this newly available crawl budget to other pages unless Google is already hitting your site’s serving limit.” (Tradução: O Google não transferirá esse crawl budget recém-disponível para outras páginas, a menos que já esteja atingindo o limite de atendimento do seu site.) Ir para a citação
Gary Illyes, Google — agendamento e carga do host (via cobertura do Search Engine Roundtable sobre uma sessão de perguntas e respostas do Stone Temple)
- “Host load kind of sets a bucket of URLs in importance order and GoogleBot will crawl in that order based on the schedule the host load decided. If Google thinks your server can handle it, it will crawl the whole bucket, if not, it will stop.” (Tradução: A carga do host define, de certa forma, um conjunto de URLs em ordem de importância, e o GoogleBot as rastreará nessa ordem com base no agendamento decidido pela carga do host. Se o Google achar que seu servidor consegue lidar com isso, rastreará todo o conjunto; caso contrário, parará.) Ir para a citação
Fabrice Canel, Microsoft Bing
- “The crawl efficiency is how often we crawl and discover new and fresh content per page crawled.” (Tradução: A eficiência de rastreamento é a frequência com que rastreamos e descobrimos conteúdo novo e atualizado por página rastreada.) Ir para a citação
- “Less is more for SEO. Never forget that. Less URLs to crawl, better for SEO.” (Tradução: Menos é mais para SEO. Nunca se esqueça disso. Menos URLs para rastrear, melhor para SEO.) Ir para a citação
Checklist de otimização do crawl budget
Só vale a pena seguir isto se você confirmou que realmente tem um problema de budget (site grande, rastreamento lento no mesmo dia ou um acúmulo crescente de “Discovered – currently not indexed”). Depois:
- Confirmei que o problema é real — verifiquei o GSC Crawl Stats e “Discovered – currently not indexed” antes de otimizar qualquer coisa.
- Escolhi uma convenção canônica (host, protocolo, barra final, maiúsculas/minúsculas) e consolidei as duplicatas nela.
- Tratei os parâmetros de URL — usei canônicas ou bloqueei os que criam apenas variantes duplicadas/de baixo valor.
- Dominei a navegação facetada — bloqueei combinações inúteis de filtros/ordenação no
robots.txtou movi-as para trás de um#para que não fossem rastreáveis. - Corrigi soft 404s; retorno
404/410reais para páginas removidas permanentemente. - Removi ou encurtei cadeias de redirecionamento.
- Os sitemaps listam apenas URLs canônicas e indexáveis com um
lastmodpreciso. - Não usei
noindexpara “economizar” budget (o Google solicita mesmo assim) e não esperei que bloqueios norobots.txtrealocassem o budget para outras páginas. - Fortaleci links internos para páginas importantes e recém-publicadas.
- Melhorei o tempo de resposta do servidor e a eficiência de carregamento da página.
- (Bing) Adotei o IndexNow para enviar atualizações; usei o Crawl Control se a carga do servidor for a restrição.
Os modelos mentais
1. Budget = capacidade × demanda. A capacidade de rastreamento é o que seu servidor suporta; a demanda de rastreamento é popularidade + desatualização + inventário percebido. Ambos precisam existir: um servidor rápido com baixa demanda ainda é rastreado menos, e uma demanda alta é limitada por um servidor sobrecarregado. Para aumentar o budget efetivo, quase sempre remova desperdício, em vez de “pedir mais”.
2. A barreira “eu sequer tenho um problema?”. Execute isto antes de mexer em qualquer coisa:
- Páginas rastreadas no mesmo dia em que são publicadas? → Nenhum problema. Pare aqui.
- Menos de ~100k URLs (regra prática de Mueller)? → Quase certamente nenhum problema.
- 1M+ páginas mudando semanalmente, ou 10k+ mudando diariamente, ou um grande acúmulo de “Discovered – currently not indexed”? → Agora vale a pena investir seu tempo.
3. Remova desperdício antes de pedir ao Google para rastrear mais. A ideia de maior impacto desta página. O Google tenta rastrear tudo o que conhece; se metade disso são duplicatas, facetas e soft 404s, ele gasta seu budget com lixo. Corte o lixo e o budget se concentra nas URLs que importam — esse é “o fator que você consegue controlar positivamente mais do que qualquer outro”.
4. Rastreamento ≠ ranqueamento. O rastreamento é uma porta, não um placar. Rastrear mais não melhora as posições. Portanto, o objetivo é a cobertura das URLs certas, nunca o volume bruto de rastreamento.
5. É uma fila de prioridades, não uma cota. Internamente, é um agendamento por importância limitado pela carga do host — um conjunto priorizado de URLs, não uma cota fixa de “N páginas por dia”. Você sobe na fila ao ser mais importante (links, demanda) e ao não desperdiçar buscas.
Crawl budget — resumo rápido
O que o desperdiça (ordem de importância do Google)
| # | Categoria | Causa típica |
|---|---|---|
| 1 | Navegação facetada e IDs de sessão | Combinações de filtro/ordenação de comércio eletrônico multiplicando URLs |
| 2 | Conteúdo duplicado no site | www/não-www, HTTP/HTTPS, barra, maiúsculas/minúsculas, índice, parâmetros |
| 3 | Páginas de erro leves | Páginas “não encontradas” que retornam 200 |
| 4 | Páginas invadidas | URLs de spam injetadas |
| 5 | Espaços infinitos e proxies | Calendários, rolagem infinita, combinações facetadas |
| 6 | Conteúdo de baixa qualidade e spam | Páginas superficiais/geradas automaticamente |
Além disso: cadeias longas de redirecionamento e páginas lentas/pesadas tornam cada busca mais cara.
Você sequer precisa se preocupar?
- Rastreamento no mesmo dia → não.
- < ~100k URLs (Mueller) → quase certamente não.
- Mudança semanal em 1M+ páginas, ou mudança diária em 10k+, ou um grande acúmulo de “Discovered – currently not indexed” → sim.
Correções que funcionam
- Consolide duplicatas / use canônicas.
- Bloqueie caminhos inúteis no
robots.txt(facetas, parâmetros) — nunca usenoindexpara “economizar” budget. - Corrija soft 404s; retorne
404/410reais. - Encurte cadeias de redirecionamento; acelere o servidor.
- Limpe os sitemaps; fortaleça os links internos.
Apenas duas formas de aumentar o budget (Google): mais capacidade de servidor e maior qualidade de conteúdo. Uma sem a outra não basta.
Bing: chama isso de “eficiência de rastreamento” — envie com o IndexNow e agende com o Crawl Control.
Ferramentas para medir e gerenciar o crawl budget
- Google Search Console — relatório Crawl Stats (Configurações → Crawl Stats) — a visão do próprio Google: total de solicitações ao longo do tempo, tempo médio de resposta, status do host e divisão por código de resposta, tipo de arquivo e tipo de Googlebot. Comece aqui.
- GSC “Discovered – currently not indexed” (relatório de páginas) — a luz de alerta para URLs que o Google conhece, mas não está rastreando.
- Análise dos arquivos de log do servidor — a fonte da verdade sobre quais URLs os bots realmente acessam e com que frequência. Ferramentas: Screaming Frog Log File Analyser ou envie os logs para BigQuery/uma plataforma de logs. (Consulte análise de arquivos de log.)
- Ahrefs Site Audit / Screaming Frog SEO Spider — simule um rastreamento para encontrar URLs duplicadas, cadeias de redirecionamento, soft 404s, URLs bloqueadas e espaços facetados que parecem armadilhas.
- Ahrefs Webmaster Tools — rastreamento e auditoria gratuitos para sites que você verifica.
- Inspeção de URL (GSC) — verificação rápida do rastreamento no mesmo dia para uma única URL.
- Bing Webmaster Tools — Crawl Control — agende o rastreamento do bingbot por hora se a carga do servidor for a restrição.
Você tem um problema de crawl budget?
Should you work on crawl budget now?
Verificação mensal da saúde do crawl budget
- Exporte as solicitações de rastreadores de busca dos logs do servidor para o mesmo período de análise todos os meses.
- Divida as solicitações por código de status, diretório, tipo de página e se a URL é indexável.
- Revise padrões de parâmetros de alto volume, caminhos duplicados, redirecionamentos, soft 404s e erros do servidor.
- Compare a parcela de rastreamento dos modelos valiosos com o período anterior e anote lançamentos ou migrações.
- Atribua a cada novo padrão de desperdício um responsável e um controle: links, parâmetros, redirecionamentos, canonicalização, remoção ou reparo do servidor.
- Verifique novamente o padrão afetado na próxima janela de logs; o SOP termina quando as URLs valiosas mantêm acesso e o desperdício diminui em relação à linha de base do próprio site.
Erros de crawl budget
- Perseguir uma contagem maior de solicitações. Rastrear mais não melhora o ranqueamento. Em vez disso, acompanhe se as URLs importantes são rastreadas quando necessário.
- Bloquear o desperdício apenas no robots.txt. Isso pode interromper a busca sem remover as URLs descobertas ou corrigir os links que as criam. Remova os caminhos de rastreamento e consolide o inventário quando apropriado.
- Atualizar o
lastmodde todos os sitemaps em toda build. A falsa atualização ensina os rastreadores a não confiar no sinal. Altere-o apenas para atualizações significativas de página. - Ignorar erros do servidor ao ajustar padrões de URL. Um problema de capacidade limita o rastreamento útil. Repare primeiro os timeouts e as respostas 5xx.
- Tratar toda URL excluída como desperdício. Alguns recursos não indexados ajudam na renderização ou na descoberta. Classifique a finalidade antes de bloquear qualquer coisa.
Prompt: classificar desperdício em logs de rastreamento
Cole um CSV derivado de logs com URL, modelo, status, bot, acessos, bytes e indexabilidade. Remova valores de consulta ou dados de usuário antes.
Act as a technical SEO analyst. Classify each URL pattern as valuable crawling, necessary support crawling, redirect/error waste, duplicate/parameter waste, or unclear. Do not infer intent from the URL alone: list the evidence needed for every unclear row. Rank patterns by crawler requests and bytes, propose the safest control, and state what could break if that control is wrong. Return a table plus a short validation plan.Prompt: contestar um diagnóstico de crawl budget
Review the crawl-budget diagnosis below. Separate evidence of capacity, demand, discovery, and URL-inventory problems. Flag claims that confuse crawling with indexing or rankings. Then give the three smallest tests that would confirm or reject the diagnosis. Do not invent thresholds; use changes against the site's own baseline.
[PASTE DIAGNOSIS AND OBSERVATIONS] Resumir códigos de status de rastreadores a partir de um log de acesso
Execute isto em um log no estilo nginx/Apache depois de ajustar o padrão do bot para o tráfego de rastreadores verificado:
awk 'BEGIN{IGNORECASE=1} /Googlebot|bingbot/ {print $9}' access.log | sort | uniq -c | sort -nrNo PowerShell:
Select-String -Path .\access.log -Pattern 'Googlebot|bingbot' | ForEach-Object { if ($_.Line -match '"\s(\d{3})\s') { $Matches[1] } } | Group-Object | Sort-Object Count -DescendingExtrair famílias de parâmetros de consulta
Use esta expressão regular em uma exportação de rastreador ou editor de texto para capturar o primeiro nome de parâmetro de consulta:
\?([^=&]+)(?:=[^&]*)?O Grupo 1 é o nome do parâmetro. Contagens altas de solicitações identificam padrões para investigar, não URLs para bloquear automaticamente.
Teste seus conhecimentos: Crawl budget
Recursos que valem seu tempo
Minha produção relacionada
- Quando você deve se preocupar com crawl budget? — meu guia completo da Ahrefs, com os detalhes de otimização e decisões sobre navegação facetada.
- Como corrigir “Discovered – currently not indexed” — o sinal do GSC que também funciona como luz de alerta do crawl budget.
- O guia para iniciantes de SEO técnico — onde o crawl budget se encaixa no panorama maior.
- Estratégias de SEO empresarial — para a minoria de sites grandes que realmente precisa disso.
Minhas palestras
- How Search Works (SlideShare) — minha explicação do modelo de demanda de rastreamento versus limite de taxa de rastreamento. (Aplica-se a ressalva permanente: “Esta é a minha compreensão dos sistemas… não será 100% completa nem precisa.”)
Do setor
- Série Crawling December do Google (oficial, mas o melhor conjunto concentrado de explicações sobre rastreamento, incluindo navegação facetada).
- Google explica o que significa “crawl budget” para webmasters (Barry Schwartz, Search Engine Land, 2017) — resumo em linguagem simples da publicação original do Google sobre crawl budget; bom para o contexto de que a maioria dos sites não precisa se preocupar.
- Gary Illyes explica a diferença entre Crawl Budget, agendamento e carga do host (Search Engine Roundtable) — a fonte da ideia do conjunto em ordem de importância/carga do host, que mostra que é uma fila de prioridades, não uma cota fixa.
- Google: 100.000 URLs geralmente não afetarão o crawl budget (Search Engine Roundtable, 2021) — a referência concreta de 100k de Mueller e o contexto de <1 por minuto ao longo de 3 meses.
- Prioridades de rastreamento do Google: insights do analista Gary Illyes (Search Engine Journal) — aborda o desmentido da “cota fixa diária de páginas” e a ideia de convencer a busca de que seu conteúdo vale a pena ser buscado.
- Os cinco portões de infraestrutura por trás de rastrear, renderizar e indexar (Search Engine Land) — fonte da citação de Fabrice Canel “Menos é mais para SEO” e da filosofia de eficiência de rastreamento do Bing.
- Série bingbot: otimizando a frequência de rastreamento (Bing Webmaster Blog, Fabrice Canel) — como o Bing decide a cadência de novo rastreamento; é o complemento da série sobre maximizar a eficiência de rastreamento.
- r/TechSEO — a comunidade para depuração de rastreamento e indexação.
Estatísticas que vale a pena citar
- 100k URLs geralmente não são suficientes para importar. A referência concreta de John Mueller: “100k URLs is usually not enough to affect crawl budget (it’s <1/minute over 3 months).” A informação numérica mais útil para reduzir a preocupação com crawl budget. Fonte
- Os limites em que ele começa a importar: 1 milhão ou mais de páginas mudando aproximadamente semanalmente, ou 10 000 ou mais páginas mudando diariamente (estimativas aproximadas do Google, não limites exatos). _(Âncora da fonte: “Large sites (1 million+ unique pages)” — “Sites grandes (1 milhão+ de páginas únicas)”.) Fonte
- ~60% da web é conteúdo duplicado — estimativa interna do Google, razão pela qual URLs duplicadas são um dreno tão confiável do crawl budget. _(Âncora da fonte: “duplicate content” — “conteúdo duplicado”.) Fonte
O KPI permanente da eficiência de rastreamento
Crawl budget não é um número que o Google entrega a você — você o infere a partir de onde o Googlebot realmente gasta suas solicitações. O KPI é a divisão: quanto do rastreamento chega às páginas que você quer indexar versus páginas que são puro desperdício. (Primeiro, a verificação de honestidade: isso só importa em escala — o Google diz que crawl budget é uma preocupação principalmente para sites com cerca de 1M+ páginas, ou sites médios que geram muitas URLs automaticamente. Um site estático pequeno pode ignorar essa métrica por completo.)
Alocação de rastreamento — solicitações valiosas versus desperdiçadas
- Métrica — A parcela de solicitações de Googlebot verificado que atinge URLs importantes e indexáveis versus URLs desperdiçadas (duplicatas, URLs de parâmetros/facetadas, variantes não canônicas, saltos de redirecionamento, 4xx/5xx).
- O que ela informa — Se sua capacidade de rastreamento está sendo gasta em páginas que podem ranquear. Uma parcela desperdiçada crescente é um indicador antecedente de atraso na descoberta/indexação antes que isso apareça como um problema de ranqueamento.
- Como obtê-la — Execute os logs do servidor pelo Log File Analyzer e segmente os acessos de Googlebot verificado por classe de URL; confirme com o relatório Crawl Stats do GSC (total de solicitações, por resposta, por finalidade do arquivo e status do host).
- Benchmark / faixa realista — Situacional — não existe uma “porcentagem de desperdício” universal honesta, pois ela depende da arquitetura das suas URLs. Estabeleça sua própria linha de base e reduza a parcela desperdiçada ao longo do tempo; a tendência é o sinal, não um absoluto inventado.
- Periodicidade — Mensalmente e com mais frequência logo após uma mudança estrutural (novas facetas, uma migração) ou quando o Crawl Stats mostra um pico repentino nas solicitações ou nas respostas 4xx/5xx. O rastreamento desperdiçado é uma métrica antecedente; as contagens de páginas indexadas ficam para trás.
Registro de alterações
Atualizado em 27 de jul. de 2026.
Resumo editorial e detalhes registrados da alteração.Detalhes da alteração
-
As notas detalhadas sobre as alterações estão disponíveis atualmente em inglês.
Não é possível fazer a comparação completa — nenhum instantâneo anterior foi arquivado para esta revisão.
Atualizado em 17 de jul. de 2026.
Resumo editorial e detalhes registrados da alteração.Detalhes da alteração
-
As notas detalhadas sobre as alterações estão disponíveis atualmente em inglês.
-
As notas detalhadas sobre as alterações estão disponíveis atualmente em inglês.
-
As notas detalhadas sobre as alterações estão disponíveis atualmente em inglês.
Não é possível fazer a comparação completa — nenhum instantâneo anterior foi arquivado para esta revisão.