Demanda de rastreamento
O lado do "querer" do crawl budget — o que faz o Google querer rastrear suas páginas (popularidade, desatualização e inventário percebido), como a demanda encontra a capacidade do host e por que você não pode forçá-la.
Idiomas
A demanda de rastreamento é o lado do "querer" do crawl budget — quanto um mecanismo de busca quer rastrear um site ou uma URL, em oposição à velocidade com que consegue fazer isso (a taxa/capacidade de rastreamento). O Google cita popularidade (links/PageRank), desatualização (com que frequência uma página muda) e inventário percebido (quantas URLs o Google acha que existem, incluindo lixo — "the factor you can positively control the most") como fatores gerais significativos de demanda, não como uma fórmula fechada de três itens; o Google também aponta tamanho do site, frequência de atualização, qualidade da página e comparação com sites semelhantes. Mudanças de site aumentam a demanda temporariamente. Minha síntese: a demanda define a ordem de prioridade das URLs, e a capacidade da carga do host decide até onde o Googlebot chega nessa fila. Você não pode definir a demanda diretamente — mova seus insumos conquistando links, mantendo o conteúdo genuinamente atualizado e reduzindo o inventário de URLs inúteis para que os sinais de qualidade retroalimentem o agendador. O Google está tentando rastrear menos no total e encaminhar a demanda com mais precisão, então o objetivo real nunca foi volume — é priorização correta. A maioria dos sites nunca precisa gerenciar isso.
TL;DR — O crawl budget tem dois lados: a velocidade com que um mecanismo de busca consegue buscar suas páginas (taxa de rastreamento) e o quanto ele quer buscá-las (demanda de rastreamento). A demanda é o lado do “quer”. O Google quer rastrear mais uma página quando ela é popular (muitos links), quando muda com frequência e quando o Google considera que vale seu tempo. Você não pode apertar um botão para aumentar a demanda — você a conquista com links, atualização genuína e evitando enterrar suas páginas boas sob um monte de URLs inúteis.
O que é demanda de rastreamento
Quando as pessoas dizem “crawl budget”, na verdade estão juntando duas coisas separadas. Uma é a capacidade do seu servidor de suportar o rastreamento — quão rápido e quantas páginas ao mesmo tempo. Isso é a taxa de rastreamento e tem sua própria página. A outra é o quanto o mecanismo de busca realmente quer rastrear você. Isso é a demanda de rastreamento — o tema desta página.
Pense em oferta e demanda. A taxa de rastreamento é a oferta: quanto seu site consegue suportar. A demanda de rastreamento é a demanda: quanto o Google está disposto a fazer. Evidence for this claim Google describes crawl demand as one of the two main elements of crawl budget, alongside crawl capacity limit. Scope: Google Search crawling. Confidence: high · Verified: Google: Large site crawl budget guide
O que faz o Google querer rastrear uma página
O Google aponta alguns fatores significativos, não um checklist exaustivo. Os três que explica com mais profundidade são:
- Popularidade. Páginas com mais links apontando para elas são rastreadas com mais frequência, para que o Google mantenha sua cópia atualizada.
- Desatualização / frescor. Se uma página muda muito, o Google quer verificá-la com mais frequência. Se nunca muda, o Google aprende a verificá-la menos.
- Quantas URLs o Google acha que você tem. Se seu site está cheio de URLs inúteis, duplicadas ou de baixo valor, o Google gasta o rastreamento nelas em vez de nas suas páginas reais. Esta é a alavanca que você mais controla. Evidence for this claim Google's crawl-demand guidance discusses perceived inventory, popularity, and staleness. Scope: These inputs influence crawling but do not provide a user-controlled demand setting. Confidence: high · Verified: Google: Large site crawl budget guide
O Google também cita alguns fatores no nível do site que moldam a demanda junto com esses três: o tamanho do site, a frequência de atualização, a qualidade das páginas e como o site se compara a outros que cobrem temas semelhantes. Não trate “popularidade, desatualização, inventário percebido” como uma fórmula completa — são as maiores alavancas acionáveis, não a lista inteira.
Há também um fator temporário: se você mover seu site para um novo domínio, o Google precisa rastrear tudo novamente para processá-lo sob as novas URLs, então a demanda aumenta por algum tempo.
Por que você não pode simplesmente “aumentar a demanda de rastreamento”
Não há um controle para isso — assim como não há um botão para fazer o Google rastrear mais rápido. Publicar dez posts por dia não resolve se ninguém cria links para eles e se eles não são genuinamente úteis. O que realmente funciona é lento e real: conquiste links, mantenha o conteúdo genuinamente atualizado e elimine as URLs inúteis para que o rastreamento do Google chegue às páginas que importam.
E aqui está a surpresa: rastrear mais nem sequer é o objetivo. Ser rastreado muitas vezes não faz você ranquear melhor. O que você quer não é mais demanda — é a demanda que você tem apontada para as páginas certas.
Quer a versão mais profunda — como a demanda e a capacidade do seu servidor interagem, como a qualidade do site retroalimenta o agendador de rastreamento e como diferenciar um problema de demanda de um problema de capacidade? Mude para a aba Avançado.
TL;DR — A demanda de rastreamento é o lado do querer do crawl budget; taxa/capacidade de rastreamento é o lado do conseguir. O Google cita popularidade (links / PageRank), desatualização (com que frequência uma página muda) e inventário percebido (quantas URLs o Google acha que existem, incluindo lixo — “the factor you can positively control the most”) como fatores gerais significativos de demanda — não uma fórmula fechada; tamanho do site, frequência de atualização, qualidade das páginas e relevância comparativa também entram. Mudanças de site aumentam a demanda temporariamente. Minha síntese para ligar os pontos é: a demanda define a ordem de prioridade das URLs; a capacidade limitada pela carga do host decide até onde o Googlebot chega nessa fila — o Google não documenta isso como um algoritmo literal, mas é o modelo que se ajusta às evidências. Um servidor saudável não fabrica demanda, e uma demanda alta ainda pode ser limitada pela capacidade. Você não pode definir a demanda diretamente — as únicas alavancas são seus insumos, e o agendador aumenta a demanda quando os sinais de qualidade da indexação melhoram. Enquanto isso, o Google tenta rastrear menos no total e encaminhar a demanda com mais precisão, então o objetivo real nunca foi volume — é priorização correta. A maioria dos sites nunca precisa gerenciar nada disso. Evidence for this claim Google says Googlebot demand varies by site size, update frequency, page quality, and relevance compared with other sites; significant general demand factors are perceived inventory, popularity, and staleness. Scope: large or rapidly changing websites Confidence: high · Verified: Optimize your crawl budget
A demanda de rastreamento é o “querer”; a taxa de rastreamento é o “conseguir”
O Google é explícito: crawl budget tem duas metades; a quantidade de tempo e recursos que o Google dedica ao rastreamento de um site “is determined by two main elements: crawl capacity limit and crawl demand.” A forma como explico isso no meu guia de crawl budget da Ahrefs é: crawl budget é “made up crawl demand which is how many pages a search engine wants to crawl on your site and crawl rate which is how fast they can crawl.” Demanda é o querer; taxa é o conseguir. Evidence for this claim Google describes crawl demand as one of the two main elements of crawl budget, alongside crawl capacity limit. Scope: Google Search crawling. Confidence: high · Verified: Google: Large site crawl budget guide
Esta página trata apenas do querer. O lado do conseguir — o limite de capacidade de rastreamento, o controle deslizante de taxa do GSC removido em janeiro de 2024, como respostas 5xx/429 deixam o Googlebot mais lento e a grade manual do Crawl Control do Bing — está todo na página de taxa de rastreamento. Não vou rederivá-lo aqui; quando os dois interagem, farei o link entre as páginas.
Os três insumos da demanda
A orientação atual do Google chama inventário percebido, popularidade e desatualização de fatores gerais significativos que impulsionam o quanto ele quer rastrear — não os apresenta como uma fórmula fechada e exaustiva. A mesma orientação também cita tamanho do site, frequência de atualização, qualidade da página e comparação com sites semelhantes como fatores que o Googlebot pondera. Os três abaixo são os que o Google explica com mais profundidade e os que você pode trabalhar diretamente. Evidence for this claim Google's crawl-demand guidance discusses perceived inventory, popularity, and staleness. Scope: These inputs influence crawling but do not provide a user-controlled demand setting. Confidence: high · Verified: Google: Large site crawl budget guide
Crawl demand orders URLs using popularity, genuine change, and the perceived value of the site's URL inventory. Crawl capacity, based on server response speed, stability, and errors, determines how far Googlebot can proceed through that ordered queue. Faster infrastructure raises the capacity ceiling but does not create demand for low-priority URLs.
© Patrick Stox LLC · CC BY 4.0 ·
Popularidade
“URLs that are more popular on the Internet tend to be crawled more often to keep them fresher in our systems.” Mais links e mais PageRank apontando para uma URL são sinais de demanda — é por isso que sua página inicial é rastreada constantemente e uma página profunda sem links quase não é rastreada. Como digo no meu guia de crawl budget, “Popular pages, or those with more links and PageRank, will generally receive priority over other pages.” Links internos também contam: uma página para a qual ninguém cria links (uma órfã) quase não tem demanda trabalhando a seu favor.
Desatualização
“Our systems want to recrawl documents frequently enough to pick up any changes.” O Google aprende o ritmo de cada página. Uma página que muda constantemente conquista novos rastreamentos frequentes; uma página que nunca muda é verificada cada vez menos. No meu guia de crawl budget, descrevo o recuo que o Google aplica a uma página estática: “if they crawl a page and see no changes after a day, they may wait three days before crawling again, ten days the next time, 30 days, 100 days, etc.” Essa cadência de novo rastreamento por URL é realmente uma questão de frequência de rastreamento — explico a mecânica lá —, mas a força subjacente é a demanda, especificamente a desatualização.
Inventário percebido (a alavanca que você mais controla)
Esta é a principal alavanca. O Google diz: “Without guidance from you, Google tries to crawl all or most of the URLs that it knows about on your site. If many of these URLs are duplicates, or you don’t want them crawled for some other reason (removed, unimportant, and so on), this wastes a lot of Google crawling time on your site. This is the factor that you can positively control the most.”
Evidence for this claim Google calls perceived inventory the crawl-demand factor site owners can positively control the most; duplicate, removed, and unimportant known URLs can waste crawling time. Scope: large or rapidly changing websites Confidence: high · Verified: Optimize your crawl budgetA parte sutil é o efeito sobre a demanda, não apenas sobre a capacidade. É fácil pensar em URLs inúteis como “desperdício de crawl budget” — gastar buscas em cópias em vez de conteúdo novo. Isso é verdade. Mas há também um efeito do lado da demanda: um site cujo inventário conhecível é formado principalmente por duplicatas de baixo valor e uma profusão de parâmetros parece, para o Google, um site de menor valor para rastrear. Reduzir o inventário percebido não apenas libera capacidade; com o tempo, concentra a demanda nas URLs que merecem isso. Navegação facetada, IDs de sessão, espaços infinitos de calendários e outras armadilhas para spiders são os infladores clássicos do inventário — e os supressores clássicos da demanda.
Mudanças de site e outros picos de demanda
Um dos fatores de demanda não diz respeito a uma URL específica: “Additionally, site-wide events like site moves may trigger an increase in crawl demand in order to reprocess the content under the new URLs.” Se você fizer uma migração de domínio ou uma grande replatform e notar o Googlebot acessando seu site com muito mais intensidade que o normal por algumas semanas, isso é esperado — o Google precisa buscar e processar tudo novamente nos novos endereços. É um pico temporário, não uma nova linha de base, e é um evento de demanda que os guias concorrentes quase nunca mencionam, apesar de estar literalmente na documentação do próprio Google. Evidence for this claim Google says site-wide events such as site moves may temporarily increase crawl demand so content can be reprocessed under new URLs. Scope: large or rapidly changing websites Confidence: high · Verified: Optimize your crawl budget
Como a demanda e a carga do host interagem: ordem da fila versus barreira de capacidade
Aqui está um modelo mental que faz todo o assunto se encaixar — e quero deixar claro que é minha síntese, não algo que o Google documenta como um algoritmo literal. Ele se baseia em uma sessão de perguntas e respostas de Gary Illyes, citada aqui pela cobertura do Search Engine Roundtable: a carga do host “sets a bucket of URLs in importance order and GoogleBot will crawl in that order based on the schedule the host load decided. If Google thinks your server can handle it, it will crawl the whole bucket, if not, it will stop.” É importante notar que, de acordo com a mesma sessão, a carga do host acompanha a importância das páginas — não o número bruto de URLs que você tem nem quantas você quer que sejam rastreadas. Essa página bloqueia buscas automatizadas, então não consegui reconfirmar a formulação exata diretamente na fonte ativa nesta rodada — trate-a como uma paráfrase bem corroborada, não como uma citação literal de fonte primária.
Leia com atenção e surge uma relação — novamente, esta é a forma como conecto as peças, não um mecanismo que o Google detalhou de ponta a ponta:
- A demanda define a ordem. O “bucket de URLs em ordem de importância” é a demanda de rastreamento — popularidade e desatualização decidem quais URLs ficam no topo da fila.
- A capacidade define até onde o Google chega. A carga do host / taxa de rastreamento decide até que profundidade o Googlebot realmente rastreia nesse bucket ordenado em um determinado dia. “If your server can handle it, it crawls the whole bucket; if not, it stops.”
Portanto, os dois não são apenas multiplicados — desempenham papéis diferentes. Um servidor saudável e rápido não fabrica demanda (ele apenas eleva o teto de quanto da sua demanda existente é realizado), e uma demanda alta ainda pode ser limitada pela capacidade (um servidor lento ou cheio de erros faz o Googlebot parar no meio da fila, não importa o quanto ele queira rastrear). É por isso que “comprei um servidor mais rápido e o Google ainda não está rastreando minhas páginas novas” é um resultado tão comum e frustrante: a capacidade nunca foi a restrição — a demanda era.
Você não pode definir a demanda diretamente — mas o agendador escuta
Resposta curta: você não define a demanda diretamente. Você a conquista, indiretamente, por meio de links reais e melhorias reais de qualidade que aparecem nos sinais de indexação — nada mais a move.
Não existe uma solicitação de “rastrear mais” para a demanda, assim como não existe para a taxa. Mas a demanda é dinâmica, e o Google tem sido incomumente franco sobre como ela se move. Gary Illyes: “If you want to increase how much we crawl, then you somehow have to convince search that your stuff is worth fetching, which is basically what the scheduler is listening to.” E o ciclo de feedback é quase em tempo real: “Scheduling is very dynamic. As soon as we get the signals back from search indexing that the quality of the content has increased across this many URLs, we would just start turning up demand.” O outro lado também existe: “If search demand goes down, then that also correlates to the crawl limit going down.” (Conferi novamente estas três linhas na cobertura do Search Engine Journal nesta rodada e elas correspondem literalmente; ainda não localizei o áudio/transcrição do podcast do Google para confirmá-las como fonte primária, então trate-as como citações secundárias bem corroboradas.)
Isso reformula “como aumento a demanda de rastreamento” e afasta a ideia de truques. Timestamps lastmod falsos, pings de sitemap e volume de publicação não convencem o agendador. As duas coisas que convencem são as duas difíceis: popularidade real (links) e melhorias reais de qualidade que aparecem nos sinais de indexação e retroalimentam o agendador. Todo o resto é teatro.
O Google está tentando rastrear menos, não mais
O ângulo mais atual aqui, que os guias antigos deixam completamente de lado: o objetivo declarado do próprio Google é reduzir o volume total de rastreamento, não aumentá-lo. Em uma publicação do LinkedIn de abril de 2024, Illyes escreveu: “My mission this year is to figure out how to crawl even less, and have fewer bytes on wire.” Ele rebateu a ideia de que o Google havia reduzido o rastreamento — “we’re crawling roughly as much as before, however scheduling got more intelligent” — e apresentou o objetivo como uma vitória compartilhada: “Decreasing crawling without sacrificing crawl-quality would benefit everyone.” Os mecanismos que apontou foram cache melhor, compartilhamento de cache entre user-agents e menos bytes transferidos — não “rastrear mais meu site”.
A conclusão: a demanda de rastreamento nunca foi algo a maximizar. O Google está otimizando ativamente para menos rastreamento total com qualidade de rastreamento igual ou melhor, encaminhando a demanda que tem para URLs mais propensas a merecê-la. Seu objetivo não é mais demanda — é priorização correta da demanda que você conquistou.
Você sequer tem um problema de demanda?
A maioria não tem e não deveria gastar um minuto nisso. A redução de urgência do próprio Google se aplica diretamente à demanda: “If your site doesn’t have a large number of pages that change rapidly, or if your pages seem to be crawled the same day that they are published, you don’t need to read this guide.” John Mueller foi igualmente direto sobre escala — segundo a cobertura do Search Engine Roundtable sobre seu tuíte, 100 mil URLs geralmente não são suficientes para afetar o crawl budget, pois isso equivale a bem menos de um rastreamento por minuto ao longo de três meses.
Se você é grande o bastante para se importar, este é o diagnóstico que separa um problema de demanda de um de capacidade — com uma ressalva inicial: ele produz uma hipótese para testar, não um diagnóstico. Abra o relatório de estatísticas de rastreamento do GSC e os logs do servidor. Se o status do host estiver saudável e o tempo médio de resposta estiver bom, mas um conjunto de URLs quase não estiver sendo rastreado — e estiver preso em “Discovered – currently not indexed” — esse padrão é evidência que aponta para demanda, não prova. As estatísticas de rastreamento mostram atividade de rastreamento (uma visão do lado da capacidade), não uma pontuação de demanda — não há nenhuma “pontuação de demanda de rastreamento” pública por site, então você sempre infere a demanda a partir da atividade e do status de indexação, nunca a lê em um painel.
Antes de agir com base em “é um problema de demanda”, descarte as outras coisas que produzem o mesmo sintoma de servidor saudável, mas sem rastreamento: o Google pode ainda não ter descoberto as URLs (nenhum caminho de entrada, nenhuma entrada no sitemap), a renderização pode estar ocultando o conteúdo que o Googlebot precisa ver, a canonicalização pode apontar o Google para outro lugar, problemas reais de qualidade (conteúdo raso, duplicado ou de baixo valor) podem fazer uma página ser rastreada, mas deixada deliberadamente fora do índice, e a própria seleção de indexação do Google pode deixar uma página de fora mesmo quando rastreamento e qualidade estão bons. Só depois de verificar tudo isso e confirmar que não explica o problema é que “demanda” vira a hipótese principal.
Para dados de rastreamento por URL que representem a realidade, a resposta é analisar logs. Vou destacar uma ferramenta atual sobre a qual posso falar em primeira mão na aba Ferramentas.
Demanda, taxa, budget e frequência de rastreamento
Mantenha a família de conceitos em ordem:
- Demanda de rastreamento — quanto o Google quer rastrear (popularidade + desatualização + inventário percebido). Esta página.
- Taxa de rastreamento — quão rápido ele consegue (capacidade / carga do host). Sua própria página.
- Crawl budget — os dois juntos: “the number of URLs Googlebot can and wants to crawl.”
- Frequência de rastreamento — com que frequência uma determinada URL é rastreada novamente; é um resultado da demanda (principalmente da desatualização). Evidence for this claim Google's crawl-demand guidance discusses perceived inventory, popularity, and staleness. Scope: These inputs influence crawling but do not provide a user-controlled demand setting. Confidence: high · Verified: Google: Large site crawl budget guide
O Bing não usa o termo “crawl demand” — reformula tudo como eficiência de rastreamento: Fabrice Canel a define como “how often we crawl and discover new and fresh content per page crawled”, e a filosofia do Bing prioriza a redução do inventário, o equivalente do lado da demanda ao inventário percebido. O IndexNow é a forma de o Bing sinalizar eventos de mudança relevantes para a demanda, em vez de esperar que o agendador infira a desatualização — mas observe que o Google não usa IndexNow, então isso não moverá a demanda do Google. Evidence for this claim Google's crawl-demand guidance discusses perceived inventory, popularity, and staleness. Scope: These inputs influence crawling but do not provide a user-controlled demand setting. Confidence: high · Verified: Google: Large site crawl budget guide
Resumo de IA
Uma versão condensada do conteúdo avançado:
- Demanda de rastreamento = o lado do “querer” do crawl budget; taxa/capacidade de rastreamento é o lado do “conseguir”. Budget é “the number of URLs Googlebot can and wants to crawl.”
- Fatores significativos de demanda — não uma fórmula fechada: popularidade (links / PageRank), desatualização (com que frequência uma página muda) e inventário percebido (quantas URLs o Google acha que existem — incluindo lixo; “the factor you can positively control the most”), além de tamanho do site, frequência de atualização, qualidade da página e relevância comparativa.
- Mudanças de site aumentam a demanda temporariamente enquanto o Google reprocessa o conteúdo sob novas URLs.
- Modelo de demanda versus capacidade (minha síntese, não um algoritmo documentado do Google): a demanda define a ordem de prioridade das URLs; a capacidade limitada pela carga do host decide até onde o Googlebot chega nessa fila. Um servidor rápido não cria demanda; uma demanda alta ainda pode ser limitada pela capacidade.
- Você não pode definir a demanda diretamente. O agendador “aumenta a demanda” quando os sinais de qualidade da indexação melhoram — portanto, as únicas alavancas reais são conquistar links e fazer melhorias genuínas de qualidade/frescor.
lastmodfalso, pings de sitemap e volume de publicação não a movem. - O Google está tentando rastrear menos, não mais (Illyes: “crawl even less… fewer bytes on wire”), encaminhando a demanda com mais precisão. O objetivo é priorização correta, não volume.
- Diagnóstico de demanda versus capacidade: status do host saudável + baixo volume de rastreamento + preso em “Discovered – currently not indexed” é uma hipótese de demanda, não prova — descarte primeiro causas de descoberta, renderização, canonicalização e seleção de indexação. Não existe “pontuação de demanda de rastreamento” pública.
- Bing reformula isso como eficiência de rastreamento; IndexNow sinaliza mudanças para o Bing (não para o Google). A maioria dos sites nunca precisa gerenciar isso.
Documentação oficial
Documentação de fontes primárias dos mecanismos de busca.
- Otimize seu crawl budget — a fonte que define a demanda de rastreamento, seus três insumos (popularidade, desatualização, inventário percebido) e os picos de demanda causados por mudanças de site.
- Gestão de Crawl Budget — a divisão entre capacidade e demanda, com a mecânica de capacidade contra a qual a demanda esbarra.
- O que crawl budget significa para o Googlebot (2017) — a publicação original de Gary Illyes que define crawl budget como aquilo que o Googlebot “can and wants to crawl” e as categorias de URLs de baixo valor que reduzem a demanda efetiva.
- Mitos e fatos sobre crawling — confirma que a taxa de rastreamento não é um sinal de classificação e que a saúde do servidor, não o desejo, define o teto de capacidade.
- Série Crawling December (2024) — Googlebot, cache HTTP, navegação facetada e o raciocínio de eficiência por trás de rastrear menos.
Bing / Microsoft
- Série bingbot: maximizando a eficiência de rastreamento — a formulação do Bing como “eficiência de rastreamento”, seu equivalente do lado da demanda.
- Série bingbot: otimizando a frequência de rastreamento — a visão do Bing sobre a cadência de novo rastreamento, impulsionada pela frequência com que o conteúdo muda (seu equivalente de “desatualização”).
- IndexNow / indexnow.org — sinalize URLs alteradas ao Bing e a outros mecanismos (não ao Google), em vez de esperar a desatualização ser inferida.
Citações das fontes
Declarações registradas do Google e do Bing. Cada link é profundo e leva diretamente ao trecho citado na página de origem.
Google — a definição da demanda e seus insumos
- “The amount of time and resources that Google devotes to crawling a site is commonly called the site’s crawl budget and it’s determined by two main elements: crawl capacity limit and crawl demand.” — Guia do proprietário de site grande para gerenciar o Crawl Budget. Ir para a citação
- “Each crawler has its own ‘demand’ when it comes to crawling the web.” (Tradução: Cada rastreador tem sua própria “demanda” ao rastrear a web.) (Âncora da fonte: Each crawler has its own “demand” when it comes to crawling the web — Cada rastreador tem sua própria “demanda” ao rastrear a web.) Ir para a citação
- “URLs that are more popular on the Internet tend to be crawled more often to keep them fresher in our systems.” (popularidade) Ir para a citação
- “Our systems want to recrawl documents frequently enough to pick up any changes.” (desatualização) Ir para a citação
Google — inventário percebido e mudanças de site
- “If many of these URLs are duplicates, or you don’t want them crawled for some other reason (removed, unimportant, and so on), this wastes a lot of Google crawling time on your site. This is the factor that you can positively control the most.” Ir para a citação
- “Additionally, site-wide events like site moves may trigger an increase in crawl demand in order to reprocess the content under the new URLs.” Ir para a citação
- “If your site doesn’t have a large number of pages that change rapidly, or if your pages seem to be crawled the same day that they are published, you don’t need to read this guide.” Ir para a citação
Gary Illyes, Google — como a demanda realmente se move (via cobertura do Search Engine Journal sobre sua participação em um podcast)
- “If you want to increase how much we crawl, then you somehow have to convince search that your stuff is worth fetching, which is basically what the scheduler is listening to.” Leia a cobertura
- “Scheduling is very dynamic. As soon as we get the signals back from search indexing that the quality of the content has increased across this many URLs, we would just start turning up demand.” Leia a cobertura
- “If search demand goes down, then that also correlates to the crawl limit going down.” Leia a cobertura
Gary Illyes, Google — a missão de “rastrear ainda menos” (LinkedIn, abril de 2024 — fonte primária, verificada literalmente)
- “My mission this year is to figure out how to crawl even less, and have fewer bytes on wire.” Leia a publicação
- “we’re crawling roughly as much as before, however scheduling got more intelligent” e “Decreasing crawling without sacrificing crawl-quality would benefit everyone.” Leia a publicação
Bing / Microsoft — eficiência de rastreamento (o equivalente do lado da demanda)
- “The crawl efficiency is how often we crawl and discover new and fresh content per page crawled.” — Fabrice Canel. Ir para a citação
É um problema de demanda de rastreamento — e você deveria se importar?
Trabalhe de cima para baixo. A maioria dos sites sai cedo com “deixe como está”.
Mitos e erros sobre demanda de rastreamento
As confusões que levam as pessoas pelo caminho errado.
“Demanda de rastreamento e crawl budget são a mesma coisa.” Por que está errado: demanda é um dos dois componentes; budget é capacidade × demanda juntas — “the number of URLs Googlebot can and wants to crawl.” Faça isto: mantenha o vocabulário correto. Budget é o resultado; demanda e capacidade são seus dois insumos. Um problema de budget é sempre, na verdade, um problema de demanda, um problema de capacidade ou os dois.
“Um servidor mais rápido aumenta a demanda de rastreamento.” Por que está errado: a velocidade do servidor eleva apenas o teto de capacidade. Ela permite que o Google realize mais da demanda que você já tem; não faz o Google querer rastrear mais. A demanda é definida por popularidade, desatualização e inventário percebido — nada disso é afetado pelo seu hardware. Faça isto: se um servidor saudável ainda não está fazendo suas páginas serem rastreadas, pare de comprar hardware e trabalhe os insumos da demanda (links, frescor e menos inventário inútil).
“Publicar com mais frequência aumenta a demanda.” Por que está errado: volume de publicação sem importância ou mudança genuína não convence o agendador. Dez posts rasos por dia aos quais ninguém cria links não mudam nada. Faça isto: publique coisas que conquistem links e realmente mudem/melhorem — é isso que alimenta os sinais de qualidade aos quais o agendador escuta. (Este também é um ponto de frequência de rastreamento; mais detalhes estão na página correspondente.)
“Bloquear URLs inúteis no robots.txt redireciona instantaneamente essa demanda para minhas páginas boas.” Por que está errado: reduzir o inventário percebido ajuda a demanda a se concentrar ao longo do tempo, enquanto o Google reavalia o site — mas não é uma realocação instantânea. O Google não despeja automaticamente o rastreamento liberado nas suas páginas boas no momento em que você bloqueia o lixo. Faça isto: reduza o inventário inútil para obter o benefício de concentração no longo prazo e tenha paciência. É uma tendência, não um interruptor.
“Existe uma pontuação de demanda de rastreamento que posso consultar no Search Console.” Por que está errado: não existe uma pontuação pública de demanda por site. As estatísticas de rastreamento mostram atividade de rastreamento — um relatório do lado da capacidade —, não uma métrica de demanda. Faça isto: infira a demanda a partir da atividade e do status de indexação (por exemplo, host saudável + baixo volume de rastreamento + “Discovered – currently not indexed” = um sinal de demanda). Use dados de log para obter a realidade por URL.
“IndexNow ou pings de sitemap aumentam a demanda de rastreamento do Google.”
Por que está errado: o Google não usa IndexNow e ignora changefreq/priority nos sitemaps. Fazer ping para o Google não faz ele querer rastrear você mais.
Faça isto: use IndexNow para o Bing e outros mecanismos participantes. Para o Google, um lastmod preciso ajuda no agendamento, mas as alavancas da demanda continuam sendo links, frescor e inventário.
“Mais rastreamento é sempre melhor — para mim e para o Google.” Por que está errado: ser rastreado mais não aumenta as classificações, e o próprio Google está tentando rastrear menos (“My mission this year is to figure out how to crawl even less, and have fewer bytes on wire”) enquanto encaminha a demanda com mais precisão. Faça isto: busque a priorização correta, não o volume bruto. O objetivo é fazer a demanda que você tem chegar às URLs certas.
Runbook: “O Google não está rastreando minhas páginas importantes, e meu servidor está normal”
Um caminho linear para o proprietário de um site grande que suspeita de um problema de demanda. Pare assim que uma etapa resolver o problema.
-
Confirme que você é grande o bastante para se importar. Se as páginas costumam ser rastreadas no dia em que são publicadas, ou se o site tem tamanho normal, pare — você não tem um problema de demanda de rastreamento. Este runbook é para sites com 1 milhão ou mais de páginas ou que mudam rapidamente, ou para sites com um grande acúmulo de “Discovered – currently not indexed”.
-
Descarte a capacidade primeiro. Abra as estatísticas de rastreamento do GSC. Verifique o status do host e o tempo médio de resposta nos últimos 90 dias. Se você vir picos de
5xx/timeout ou tempos de resposta crescentes, este é um problema de capacidade — corrija a saúde do servidor (veja a página de taxa de rastreamento) e execute este runbook novamente depois. Se o servidor parecer saudável, continue. -
Obtenha a realidade por URL a partir dos logs. Obtenha logs do servidor (ou um feed de análise de bots) para o conjunto de URLs afetado. Confirme o padrão: acessos reais do Googlebot são escassos ou inexistentes nas páginas importantes para você, enquanto URLs inúteis/de parâmetros consomem acessos. Acessos escassos em páginas com servidor saudável são uma hipótese de demanda, não uma causa confirmada — antes de decidir por “demanda”, descarte as situações parecidas: o Google não ter descoberto a URL, uma falha de renderização ocultando o conteúdo, canonicalização apontando para longe da página, problemas reais de qualidade/duplicação e as escolhas de seleção de indexação do próprio Google. Verifique a inspeção de URL do Search Console e a visualização do HTML renderizado para cada uma.
-
Verifique a inflação do inventário percebido. Conte quantas URLs de baixo valor o Google poderia descobrir: combinações de navegação facetada, IDs de sessão, parâmetros de ordenação/filtro, espaços de calendário/infinito e duplicatas no site. Se elas superarem em muito suas páginas reais, é provável que a demanda esteja espalhada pelo lixo.
-
Corte o inventário inútil. Reduza o espaço de URLs de baixo valor na origem (tratamento de parâmetros, bloqueio de espaços infinitos no
robots.txt, correção de armadilhas para spiders e consolidação de duplicatas por canonicalização). Espere concentração ao longo do tempo, não uma realocação instantânea. -
Trabalhe o insumo da popularidade. Adicione links internos de páginas fortes para as páginas pouco rastreadas (elimine órfãs) e busque links externos. Popularidade é um impulsionador primário da demanda.
-
Trabalhe os insumos de qualidade/frescor. Melhore e atualize genuinamente as páginas para que os sinais que voltam da indexação digam ao agendador para “aumentar a demanda”.
lastmodpreciso ajuda o Google a agendar; frescor falso não ajuda. -
Dê tempo e meça novamente. Verifique de novo as estatísticas de rastreamento e os logs depois que o Google tiver tempo de reavaliar. Mudanças de demanda são graduais. Se as páginas agora são rastreadas e indexadas, terminou. Se não, reavalie se as páginas realmente valem ser rastreadas — às vezes a resposta honesta é que não valem, e páginas finas não devem ser forçadas para o índice.
Checklist de demanda de rastreamento
Diagnóstico: é demanda ou capacidade?
- Confirmei que o site é realmente grande ou muda rapidamente o bastante para isso importar (caso contrário, pare).
- Estatísticas de rastreamento do GSC: status do host saudável, tempo médio de resposta estável, sem picos de
5xx/timeout. - Logs do servidor (ou análise de bots) revisados em busca de acessos reais do Googlebot por URL.
- Padrão identificado: servidor saudável + baixo volume de rastreamento nas páginas boas + “Discovered – currently not indexed” = uma hipótese de demanda, não prova — e não um problema de capacidade.
- Descartei as situações parecidas antes de culpar a demanda: descoberta, renderização, canonicalização, problemas de qualidade/duplicação e seleção de indexação.
Trabalhe os insumos da demanda (não há um controle direto)
- Popularidade: páginas importantes têm links internos apontando para elas (sem órfãs); a criação de links externos está em andamento onde importa.
- Desatualização/frescor: páginas que deveriam ser rastreadas novamente com frequência são realmente atualizadas;
lastmodé preciso (não falsificado). - Inventário percebido: espaços facetados, de parâmetros, IDs de sessão e URLs infinitas são controlados; armadilhas para spiders corrigidas; duplicatas consolidadas.
Verificações de realidade
- Não espero que um servidor mais rápido aumente a demanda (ele apenas eleva o teto da capacidade).
- Não espero que o bloqueio de lixo no robots.txt redirecione instantaneamente a demanda para páginas boas (ela se concentra ao longo do tempo).
- Não dependo de pings de IndexNow/sitemap para mover a demanda do Google (o Google ignora IndexNow e
changefreq/priority). - Depois de uma mudança de site, trato o pico temporário de rastreamento como esperado, não como um problema.
- Lembro que rastrear mais não é o objetivo — priorização correta é; volume de rastreamento não é um fator de classificação.
Demanda de rastreamento — resumo rápido
Os dois lados do crawl budget
| Demanda de rastreamento (esta página) | Taxa / capacidade de rastreamento | |
|---|---|---|
| O que é | Quanto o Google quer rastrear | Quão rápido ele consegue |
| Impulsionadores | Popularidade, desatualização, inventário percebido (+ mudanças de site) | Saúde do servidor / carga do host |
| Papel na fila | Define a ordem das URLs (importância) | Define até onde o Google chega |
| Sua alavanca | Links, frescor real, corte do inventário inútil | Servidor mais rápido/saudável |
| Controle direto? | Não | Não |
Os três insumos de demanda mais acionáveis (o Google cita estes, além de tamanho do site, frequência de atualização, qualidade da página e relevância comparativa, como fatores gerais significativos — não uma fórmula fechada)
| Insumo | O que o aumenta | O que ele não é |
|---|---|---|
| Popularidade | Mais links / PageRank (internos + externos) | Não é volume de publicação |
| Desatualização | Mudança de conteúdo genuína e frequente | Não é lastmod falso |
| Inventário percebido | Menos URLs inúteis/duplicadas (reduzi-lo ajuda) | Não é um servidor mais rápido |
Fatos rápidos
- Crawl budget = “the number of URLs Googlebot can and wants to crawl.”
- Inventário percebido é “the factor you can positively control the most.”
- Mudanças de site aumentam temporariamente a demanda (reprocessamento sob novas URLs).
- A demanda define a ordem de prioridade; a capacidade da carga do host decide até que profundidade o Google rastreia — um servidor saudável não cria demanda.
- O agendador “aumenta a demanda” quando os sinais de qualidade da indexação melhoram — essa é a única alavanca real além dos links.
- O objetivo do Google é rastrear menos no total, não mais (Illyes, 2024). Volume de rastreamento não é um fator de classificação.
- Não existe uma “pontuação de demanda de rastreamento” pública — as estatísticas de rastreamento mostram atividade (lado da capacidade).
- Bing não usa o termo “crawl demand” — usa eficiência de rastreamento; o IndexNow sinaliza mudanças ao Bing, não ao Google.
Ferramentas para diagnosticar a demanda de rastreamento
Não existe um “medidor de demanda”, então diagnosticar a demanda significa ler a atividade de rastreamento e compará-la com o que você sabe sobre as páginas.
- Google Search Console — relatório de estatísticas de rastreamento — total de solicitações de rastreamento ao longo do tempo, status do host, tempo médio de resposta e divisões por código de resposta, tipo de arquivo, finalidade e tipo de Googlebot. Leia-o como uma visão de capacidade: status do host saudável + baixo volume de rastreamento nas páginas boas é o seu sinal de demanda.
- GSC — relatório de indexação de páginas — o grupo “Discovered – currently not indexed” é a marca clássica de uma insuficiência de demanda (o Google conhece as URLs, mas ainda não se importa o bastante para rastreá-las).
- Inspeção de URL (GSC) — verifique quando uma URL específica foi rastreada pela última vez e se está indexada; útil para confirmar a história de demanda de uma única página.
- Análise de arquivos de log do servidor — a fonte da verdade para acessos reais do Googlebot por URL: quais URLs os bots realmente buscam, com que frequência e onde o rastreamento é desperdiçado em inventário inútil. (Veja análise de arquivos de log.)
- Ahrefs Bot Analytics — uma ferramenta sobre a qual posso falar em primeira mão. Como descrevi quando a lançamos, “Have y’all checked out Bot Analytics in Ahrefs yet? We released a new tool that shows how bots crawl your website. Bot Analytics collects data server-side via Cloudflare integration.” Ela mostra todos os bots que rastreiam seu site e as páginas que acessam em 12 categorias — exatamente a realidade por URL e por bot necessária para comparar a história de “inventário percebido” e “popularidade” do Google com a realidade. A própria formulação da Ahrefs para o problema que resolve é: “uncontrolled bot traffic wastes crawl budget — bots crawling 404 pages or low-value URLs aren’t crawling the pages you need indexed,” e ela cita a estimativa de que mais da metade de todo o tráfego de crawlers é esforço desperdiçado.
- Ahrefs Site Audit / Screaming Frog SEO Spider — simule um rastreamento para encontrar a profusão de parâmetros, duplicatas e padrões semelhantes a armadilhas que inflam o inventário percebido e suprimem a demanda.
A estrutura importância × mudança × inventário
Use três perguntas para explicar mudanças na demanda de rastreamento:
- Importância: sinais internos ou externos tornaram a URL mais ou menos importante?
- Mudança: a página mudou de forma significativa e sinais verdadeiros do sitemap comunicaram isso?
- Inventário: o conjunto conhecido pelo crawler de duplicatas, parâmetros ou URLs de baixo valor aumentou?
A saúde do host é o teto, não um quarto insumo da demanda. Se os logs mostram erros ou timeouts, diagnostique a capacidade de rastreamento separadamente. Se o servidor está saudável, mas URLs valiosas perdem parcela de rastreamento, trabalhe importância, mudança e inventário nessa ordem.
Comparar a parcela de rastreamento por diretório
Este pipeline de shell resume as solicitações de crawlers verificados pelo primeiro diretório do caminho da URL em um log de acesso comum:
awk 'BEGIN{IGNORECASE=1} /Googlebot/ {split($7,p,"/"); print "/" p[2] "/"}' access.log | sort | uniq -c | sort -nrNo PowerShell:
Select-String .\access.log -Pattern 'Googlebot' | ForEach-Object { if ($_.Line -match '"(?:GET|HEAD)\s+https?://[^/]+/([^/?\s]*)|"(?:GET|HEAD)\s+/([^/?\s]*)') { '/' + (($Matches[1],$Matches[2] | Where-Object { $_ })[0]) + '/' } } | Group-Object | Sort-Object Count -DescendingCompare janelas do mesmo tamanho antes e depois de uma mudança. Um diretório que ganha parcela é uma pista sobre a alocação do agendador, não prova de maior qualidade ou de melhores classificações.
Métricas de demanda de rastreamento
Parcela de rastreamento de modelos valiosos
Métrica: solicitações de crawler para modelos importantes divididas pelas solicitações de crawlers verificados. O que informa: se a demanda está chegando ao inventário com o qual você se importa. Como obtê-la: classifique URLs dos logs de acesso por modelo. Referência / faixa realista: defina a mistura desejada a partir do seu próprio inventário valioso e da periodicidade de atualização; não existe um percentual universal. Periodicidade: semanalmente para sites grandes que mudam, mensalmente nos demais.
Atraso de novo rastreamento após mudanças significativas
Métrica: tempo entre uma atualização real de página e a próxima busca de crawler verificado. O que informa: se o agendador reconhece a importância e o padrão de mudança da página. Como obtê-la: relacione timestamps de deploy ou de conteúdo aos logs de acesso. Referência / faixa realista: estabeleça uma linha de base por modelo; páginas de notícias e páginas de referência estáveis não devem compartilhar um alvo. Periodicidade: mensalmente.
Parcela de inventário de baixo valor
Métrica: URLs conhecidas e rastreadas de parâmetros, duplicadas, vazias ou soft-404 em relação às URLs úteis. O que informa: se o inventário percebido está diluindo a atenção. Como obtê-la: combine exportações de rastreamento, sitemaps, regras de indexabilidade e logs. Referência / faixa realista: faça a tendência cair a partir da linha de base do site sem bloquear recursos necessários. Periodicidade: mensalmente e após mudanças na navegação facetada ou na plataforma.
Recursos que valem seu tempo
Meus textos relacionados
- Quando você deve se preocupar com crawl budget? — onde apresento crawl budget como demanda (“how many pages a search engine wants to crawl”) mais taxa, e cubro popularidade, o recuo causado pela desatualização e quem realmente precisa se importar.
- O que é o Googlebot e como ele funciona? — como o Googlebot decide o que e quanto rastrear.
- Guia para iniciantes de SEO técnico — onde crawling e crawl budget se encaixam no quadro maior.
Minhas palestras
- How Search Works (SlideShare) — minha explicação do rastreamento, incluindo os fatores de demanda (PageRank, frescor, tempo desde o último rastreamento, grandes mudanças no site) e o slide separado sobre capacidade/carga do host. (Aviso padrão: “This is my understanding of systems… not going to be 100% complete or accurate.”)
Do setor em geral
- Prioridades de rastreamento do Google: insights de Gary Illyes (Search Engine Journal) — as citações “convince search your stuff is worth fetching”, “turning up demand” e “search demand goes down” sobre como a demanda realmente se move.
- Gary Illyes sobre rastrear ainda menos (LinkedIn, abril de 2024) — a fonte primária de “crawl even less… fewer bytes on wire” e “scheduling got more intelligent.”
- O Google tem dois tipos de rastreamento: descoberta e atualização (Search Engine Journal) — John Mueller sobre rastreamentos de descoberta versus atualização; a cadência de atualização é um resultado puro da demanda.
- Gary Illyes, do Google, sobre Crawl Budget, agendamento e carga do host (Search Engine Roundtable) — a formulação de carga do host como “bucket of URLs in importance order” (parafraseada neste artigo; a página bloqueia buscas automatizadas — confirme na página ativa).
- Google: 100 mil URLs não afetam o Crawl Budget (Search Engine Roundtable) — verificação de escala de John Mueller (parafraseada aqui; confirme na página ativa).
- O que é Crawl Budget? Como funciona + dicas de otimização (Search Engine Land) — um guia amplo e sólido sobre crawl budget; contexto útil sobre os três fatores de demanda.
- Ahrefs Bot Analytics — a página do produto com as formulações “uncontrolled bot traffic wastes crawl budget” e “over half… wasted effort” para diagnosticar demanda versus capacidade a partir de dados reais de bots.
Teste seus conhecimentos: Demanda de rastreamento
Cinco perguntas rápidas sobre o lado do “querer” do crawl budget. Escolha uma resposta para cada uma e depois confira.
Registro de alterações
Atualizado em 17 de jul. de 2026.
Resumo editorial e detalhes registrados da alteração.Detalhes da alteração
-
As notas detalhadas sobre as alterações estão disponíveis atualmente em inglês.
-
As notas detalhadas sobre as alterações estão disponíveis atualmente em inglês.
-
As notas detalhadas sobre as alterações estão disponíveis atualmente em inglês.
Não é possível fazer a comparação completa — nenhum instantâneo anterior foi arquivado para esta revisão.