Velocidade de rastreamento
Quão rápido os mecanismos de busca buscam suas páginas — o que é crawl rate, por que o Google aposentou o slider de rate do Search Console, como desacelerar o Googlebot com segurança hoje, por que você não pode forçar um aumento e como o Crawl Control manual do Bing é diferente.
Idiomas
Crawl rate é a velocidade com que um crawler busca páginas do seu servidor — o lado da oferta do crawl budget (o lado da demanda é quanto o mecanismo quer rastrear). Hoje, o Google o define automaticamente com base na saúde do seu servidor: o slider manual de rate do Search Console foi removido em 8 de janeiro de 2024. Para desacelerar o Googlebot hoje, sinalize por meio de códigos de status HTTP — retorne 500/503/429 por um ou dois dias, nunca 403/404, e crawl-delay é ignorado pelo Google. Você não pode solicitar um aumento permanente; melhore-o indiretamente com um servidor mais rápido, sitemaps limpos e menos URLs desperdiçadas. O Bing ainda oferece uma grade manual do Crawl Control. Crawl rate não é fator de ranking, e a maioria dos sites nunca precisa gerenciá-lo.
TL;DR — Crawl rate é a velocidade com que um mecanismo de busca busca páginas do seu site. O Google a define automaticamente com base na saúde do seu servidor — não existe mais um botão para aumentá-la ou diminuí-la. Se o servidor estiver sendo sobrecarregado, a correção é torná-lo mais rápido (ou, por apenas um ou dois dias, fazê-lo retornar um erro de “diminua o ritmo”). Rastrear mais rápido não melhora seu ranking.
O que é crawl rate
Quando um mecanismo de busca rastreia seu site, ele não captura todas as páginas de uma vez — ele controla o ritmo. Crawl rate é esse ritmo: quantas páginas um crawler busca por momento e quanto tempo espera entre as buscas. Googlebot para o Google, Bingbot para o Bing. Evidence for this claim Google defines crawl capacity using simultaneous connections and the delay between fetches, adjusted according to site responses. Scope: Google crawler capacity, not a ranking factor. Confidence: high · Verified: Google: Large site crawl budget guide
O objetivo de controlar o ritmo é ser educado. Um crawler poderia facilmente sobrecarregar um servidor pequeno se solicitasse centenas de páginas por segundo, então observa como seu site responde e recua quando o servidor começa a ter dificuldades. Responda rapidamente e ele buscará um pouco mais rápido; desacelere ou retorne erros e ele rastreará menos.
A grande mudança
Durante anos, o conselho era “entrar no Search Console e diminuir o slider de crawl rate”. Esse slider acabou — o Google o removeu em 8 de janeiro de 2024. Portanto, se você encontrar um tutorial dizendo para ajustá-lo, ele está desatualizado. Evidence for this claim Google deprecated the Search Console crawl-rate limiter and removed it on January 8, 2024. Scope: Google Search Console's legacy crawl-rate limiter. Confidence: high · Verified: Google: Crawl rate limiter deprecation
Hoje, o rate é automático. Você não o ajusta; o Google lê as respostas do seu servidor e decide.
Como desacelerar o Googlebot
Se o seu servidor estiver realmente sendo sobrecarregado, em ordem de preferência:
- Deixe o servidor mais rápido ou dê mais recursos a ele. Essa é a correção real. O Googlebot naturalmente rastreará um servidor saudável e rápido com mais conforto.
- Somente em uma emergência verdadeira: faça seu servidor retornar um erro
500,503ou429em vez da página normal. O Google interpreta isso como “diminua o ritmo” quase imediatamente. Mas faça isso por no máximo um ou dois dias — deixe ativo por mais tempo e o Google poderá começar a remover suas páginas da busca.
O que não fazer: não bloqueie o Googlebot com erros 403/404 (isso não desacelera o rastreamento e pode fazer você perder páginas) e não dependa de crawl-delay no seu robots.txt — o Google o ignora (o Bing o respeita).
É possível fazer o Google rastrear mais rápido?
Não sob demanda — não há um botão de “rastrear mais” e você não pode solicitar um aumento. Você pode incentivá-lo indiretamente: um servidor mais rápido, um sitemap limpo, bons links internos e a remoção de URLs duplicadas ou inúteis ajudam. Mas rastrear mais não é um objetivo em si — isso não fará você obter um ranking melhor.
Quer os detalhes dos códigos de status, o histórico de descontinuação e as diferenças do Bing? Mude para a aba Avançado.
TL;DR — Crawl rate é o lado da oferta do crawl budget — a velocidade com que um crawler busca páginas, definida pelo que o Google chama de limite de capacidade de rastreamento (conexões paralelas + intervalo entre buscas). É automático e reage à saúde do servidor; o slider manual do GSC foi removido em 8 de janeiro de 2024. Para desacelerar o Googlebot agora, sinalize por HTTP:
500/503/429por no máximo 1–2 dias, nunca401/403/404, ecrawl-delayé ignorado pelo Google (respeitado pelo Bing). Você não pode solicitar um aumento — melhore-o indiretamente. O Bing ainda tem uma grade manual do Crawl Control. Crawl rate não é fator de ranking, e a maioria dos sites nunca precisa mexer nele.
O que crawl rate realmente é
Crawl rate é a velocidade com que um crawler busca páginas do seu servidor — o número de solicitações simultâneas que faz e o intervalo entre elas. O nome do Google para isso é limite de capacidade de rastreamento: “the maximum number of simultaneous parallel connections that Google can use to crawl a site, as well as the time delay between fetches.” Evidence for this claim Google defines crawl capacity using simultaneous connections and the delay between fetches, adjusted according to site responses. Scope: Google crawler capacity, not a ranking factor. Confidence: high · Verified: Google: Large site crawl budget guide
É uma metade do crawl budget. Como explico no meu guia de crawl budget da Ahrefs, crawl budget se divide em “crawl demand which is how many pages a search engine wants to crawl on your site and crawl rate which is how fast they can crawl.” Crawl rate é o lado da oferta (a velocidade que você permite); crawl demand é o lado da demanda (quanto eles querem). Crawl budget é onde os dois se encontram — e os rankings ficam completamente fora desse ciclo.
Na minha apresentação How Search Works, descrevo o limite de crawl rate simplesmente como o que seu site consegue suportar — ele é impulsionado pela estabilidade do servidor e pela saúde do rastreamento, por respostas lentas, erros 5xx (servidor) e respostas 429 (solicitações demais). O Google recua quando seu servidor começa a ter dificuldades porque não quer derrubar seu site. Um detalhe que as pessoas deixam passar: todos os Googlebots compartilham um único pool de rastreamento — os bots de busca, imagens, anúncios e assim por diante usam a mesma taxa. Portanto, um rastreamento descontrolado de um tipo de recurso consome o rastreamento de todo o resto.
Crawl demand orders URLs using popularity, genuine change, and useful inventory. Crawl capacity is shaped by server response speed, stability, and errors. The capacity gate determines how far Googlebot proceeds through the ordered queue. A faster, healthier server can raise the ceiling, but it does not create crawl demand and is not a ranking signal.
© Patrick Stox LLC · CC BY 4.0 ·
O que define o crawl rate
O limite de capacidade é automático e reage ao seu servidor em tempo real. Google: “If the site responds quickly for a while, the limit goes up, meaning more connections can be used to crawl. If the site slows down or responds with server errors, the limit goes down and Google crawls less.”
Há uma segunda alavanca que você não controla: os próprios recursos do Google. “Google has a lot of machines, but not infinite machines. We still need to make choices with the resources that we have.” Portanto, a saúde do seu servidor define o teto que o Google está disposto a usar, mas a própria capacidade do Google e a demanda de rastreamento do seu site decidem quanto desse teto é efetivamente usado.
O documento de mitos confirma que a relação com a saúde do servidor funciona nos dois sentidos: “A speedy site is a sign of healthy servers, so it can get more content over the same number of connections,” enquanto “a significant number of 5xx HTTP response status codes (server errors) or connection timeouts signal the opposite, and crawling slows down.”
Crawl rate afeta rankings? Não.
Desfaça este mito primeiro, porque ele impulsiona muito esforço equivocado. Rastrear é necessário para aparecer na busca, mas não é um sinal de ranking. O Google é explícito: “Improving your crawl rate won’t necessarily lead to better positions in Google Search results.” Rastrear mais rápido ou com mais frequência proporciona descoberta e indexação mais recentes, não posições mais altas. Crawl rate é uma questão de eficiência e saúde do servidor — ponto final. Evidence for this claim Improving crawl rate does not itself improve ranking positions; crawling is necessary for eligibility but is not a ranking signal. Scope: websites Confidence: high · Verified: Myths and facts about crawling
Como reduzir o crawl rate do Googlebot
Em ordem, da correção real à alavanca de emergência:
1. Corrija o servidor (a correção real). Acelere-o ou adicione recursos. Como o limite de capacidade acompanha o tempo de resposta e os erros, um servidor mais saudável é a maneira duradoura de manter o rastreamento em uma faixa confortável — e é a única que não coloca sua indexação em risco.
2. A alavanca de emergência — 500/503/429. Google: “return 500, 503, or 429 HTTP response status code instead of 200 to the crawl requests.” Seus crawlers “treat the 429 status code as a signal that the server is overloaded,” e “5xx and 429 server errors prompt Google’s crawlers to temporarily slow down with crawling.” Gary Illyes concretizou a velocidade disso: “if the server persistently returns HTTP 500 status codes for a range of URLs, Googlebot will automatically, and almost immediately slow down crawling.” Prefira 429 quando puder — ele significa explicitamente “too many requests” e pode carregar um cabeçalho Retry-After.
A ressalva é que isso é estritamente temporário. Google: “We don’t recommend that you do this for a long period of time (meaning, longer than 1-2 days).” Deixe ativo e o custo será real — se esses códigos persistirem na mesma URL por vários dias, “the URL may be dropped from Google’s index” e, para o Google Ads, “your campaigns may be cancelled or paused, and your ads may not serve.”
3. O que NÃO fazer. Não use 4xx para limitar o ritmo. “The 4xx status codes, except 429, have no effect on crawl rate,” e o Google diz claramente “Don’t use 401 and 403 status codes for limiting the crawl rate.” Em uma publicação específica de 2023 sobre pessoas fazendo exatamente isso, o Google escreveu: “Over the last few months we noticed an uptick in website owners and some content delivery networks (CDNs) attempting to use 404 and other 4xx client errors (but not 429) to attempt to reduce Googlebot’s crawl rate. The short version of this blog post is: please don’t do that…” E não recorra a robots.txt crawl-delay: “The non-standard ‘crawl-delay’ robots.txt rule is not processed by Google’s crawlers.” Evidence for this claim Google's crawlers do not process the non-standard crawl-delay robots.txt rule. Scope: websites Confidence: high · Verified: Myths and facts about crawling
4. A solicitação não emergencial. Para um problema contínuo que não é um incêndio, você pode “file a special request to report a problem with unusually high crawl rate, mentioning the optimal rate for your site.” É lento e só funciona em uma direção (veja abaixo).
É possível aumentar o crawl rate? Não — não diretamente.
Não existe aumento manual. Google: “You cannot request an increase in crawl rate, and it may take several days for the request to be evaluated and fulfilled.” O que você pode fazer é melhorá-lo indiretamente. Do meu guia de crawl budget, as alavancas que realmente movem a eficiência do rastreamento: acelere seu servidor / adicione recursos; mantenha páginas importantes em sitemaps limpos; elimine conteúdo duplicado; conquiste mais links (externos e internos); corrija links redirecionados; use GET em vez de POST quando possível; e use a Indexing API quando for elegível. Observe que “a speedy site… can get more content over the same number of connections” — portanto, a saúde do servidor é a alavanca que aparece tanto no lado da redução quanto no do aumento.
Como controlar o crawl rate do Bingbot
Aqui está o contraste nítido entre mecanismos. Enquanto o Google aposentou o controle manual, o Bing o manteve. O Bing Webmaster Tools tem o Crawl Control (em Configuration): uma grade hora a hora em que cada hora mostra blocos que representam a velocidade de rastreamento — mais blocos significa rastreamento mais rápido, menos significa mais lento. Você pode escolher uma predefinição baseada no seu horário de pico de negócios ou selecionar “Custom” e desenhar seu próprio padrão ao longo do dia. O Bing também ainda respeita crawl-delay em robots.txt — a diretiva exata que o Google ignora. Portanto, a regra prática para os dois mecanismos: para o Google, sinalize por meio das respostas do servidor; para o Bing, você tem um controle de verdade.
O que aconteceu com a ferramenta de crawl rate do Search Console?
A linha do tempo, porque muitos conselhos ainda fazem referência a uma ferramenta que não existe mais:
- Dez. de 2008 — o Google introduz o controle de crawl rate do usuário no Webmaster Tools.
- Fev. de 2023 — o Google publica “don’t use 403s or 404s for rate limiting.”
- 24 de nov. de 2023 — o Google anuncia a descontinuação da ferramenta Crawl Rate Limiter. O raciocínio de Illyes: “with the improvements we’ve made to our crawling logic and other tools available to publishers, its usefulness has dissipated.” A ferramenta antiga era lenta e pouco usada — tinha “a much slower effect” e “would have taken over a day for the new limits to be applied on crawling,” e era usada “rarely,” com aqueles que *“in many cases set the crawling speed to the bare minimum.”
- 8 de jan. de 2024 — a ferramenta é removida. Evidence for this claim Google deprecated the Search Console crawl-rate limiter and removed it on January 8, 2024. Scope: Google Search Console's legacy crawl-rate limiter. Confidence: high · Verified: Google: Crawl rate limiter deprecation O Google também reduziu o piso: “With the deprecation of the crawl limiter tool, we’re also setting the minimum crawling speed to a lower rate, comparable to the old crawl rate limits.”
O resultado prático: o slider manual antigo já tinha um atraso de mais de 24 horas; a abordagem atual baseada em sinais do servidor (5xx/429) desacelera o Googlebot quase imediatamente, o que é estritamente melhor para uma emergência de verdade.
Como monitorar o crawl rate
O relatório de estatísticas de rastreamento do GSC é sua janela para saber o que o Google está realmente fazendo: total de solicitações de rastreamento ao longo do tempo, tamanho total do download, tempo médio de resposta e uma visão do status do host sobre a disponibilidade do seu site para o Google nos últimos ~90 dias, além de uma divisão por código de resposta, tipo de arquivo, finalidade do rastreamento e tipo de Googlebot. Observe o tempo médio de resposta e os sinais de status do host — um tempo de resposta crescente ou uma onda de 5xx é exatamente o que faz o Googlebot limitar você, então é nesse relatório que você verá uma desaceleração causada por você mesmo antes de procurar outra explicação. No Bing, o Crawl Control e as informações de rastreamento no Bing Webmaster Tools são os equivalentes.
Crawl rate versus crawl budget versus crawl frequency
Mantenha estas diferenças claras:
- Crawl rate = quão rápido (oferta / capacidade).
- Crawl demand = quanto eles querem rastrear (popularidade + desatualização).
- Crawl budget = a interação dos dois — “the amount of time and resources a search engine allows for crawling a website.”
- Crawl frequency = com que frequência uma determinada página é rastreada novamente, o que é principalmente uma questão de crawl demand (popularidade e o quanto a página está atualizada/desatualizada).
E a parte tranquilizadora, que é minha posição constante: a maioria dos sites não precisa se preocupar com nada disso. “Most sites don’t need to worry about crawl budget, but there are few cases where you may want to take a look” — sites novos com muitas páginas, sites muito grandes ou que mudam rapidamente e sites com um acúmulo de URLs “Discovered – currently not indexed” no GSC. Se não é o seu caso, deixe o crawl rate em paz e permita que a automação do Google faça seu trabalho.
Resumo de IA
Uma versão condensada da versão Advanced:
- Crawl rate = a velocidade com que um crawler busca páginas — o “crawl capacity limit” (limite de capacidade de rastreamento; conexões paralelas + intervalo entre buscas). É o lado da oferta do crawl budget; crawl demand é o lado da demanda.
- É automático e reage à saúde do servidor: servidor rápido/saudável → limite maior; respostas lentas ou
5xx/429→ o Google rastreia menos. A própria capacidade do Google é um segundo teto que você não controla. Todos os Googlebots compartilham um pool de rastreamento. - O slider manual de rate do GSC foi removido em 8 de janeiro de 2024. Conselhos dizendo para “adjust the slider” (ajustar o slider) estão desatualizados.
- Para desacelerar o Googlebot hoje: corrija o servidor (melhor opção) ou retorne
500/503/429por no máximo 1–2 dias (mais tempo pode remover páginas do índice e pausar anúncios). Prefira429(carregaRetry-After). Nunca use401/403/404, ecrawl-delayé ignorado pelo Google. - Você não pode solicitar um aumento. Melhore-o indiretamente: servidor mais rápido, sitemaps limpos, menos URLs duplicadas/inúteis, mais links internos + externos e Indexing API quando elegível.
- O Bing manteve o controle manual: grade horária do Crawl Control +
crawl-delayrespeitado. - Crawl rate não é fator de ranking — “improving your crawl rate won’t necessarily lead to better positions.” (melhorar seu crawl rate não necessariamente levará a posições melhores.) A maioria dos sites nunca precisa gerenciá-lo.
Documentação oficial
Documentação de fontes primárias dos mecanismos de busca.
- Reduza o crawl rate do Googlebot — o guia principal:
500/503/429, o limite de 1–2 dias e o formulário de solicitação (você pode reduzir, não aumentar). - Gerenciamento do crawl budget — define o limite de capacidade de rastreamento e como ele reage à saúde do servidor.
- Como os códigos de status HTTP afetam os crawlers do Google — exatamente quais códigos limitam o rastreamento (
5xx/429) e quais não (4xx, exceto429). - Mitos e fatos sobre rastreamento —
crawl-delaynão é processado; crawl rate ≠ rankings; a saúde do servidor afeta o rastreamento. - Próxima descontinuação da ferramenta Crawl Rate Limiter (nov. de 2023) — o anúncio da descontinuação.
- Não use 403s ou 404s para limitar o rate (fev. de 2023) — por que
4xxé a alavanca errada. - Estatísticas de rastreamento novas e aprimoradas para seu site (nov. de 2020) — como ler o relatório de estatísticas de rastreamento.
- Otimize seu crawl budget — capacidade + demanda e quem realmente precisa disso.
Bing / Microsoft
- Bing Webmaster Tools — Crawl Control — a grade manual de crawl rate, hora a hora, que o Google aposentou.
- Orientação para o Bingbot — a orientação atual do Bing Webmaster documenta valores de
crawl-delayde 1 a 20 segundos. - Série bingbot: otimizando a frequência de rastreamento (out. de 2018) — a visão do Bing sobre quando buscar novamente.
Citações da fonte
Declarações registradas do Google. Cada link é um link profundo que salta para o trecho citado na página de origem.
Google — o que é crawl rate e o que o define
- “If the site responds quickly for a while, the limit goes up, meaning more connections can be used to crawl. If the site slows down or responds with server errors, the limit goes down and Google crawls less.” (Tradução: Se o site responder rapidamente por algum tempo, o limite aumenta, permitindo usar mais conexões para rastrear. Se o site ficar lento ou responder com erros do servidor, o limite diminui e o Google rastreia menos.) — Gerenciamento do crawl budget. Ir para a citação
- “Google has a lot of machines, but not infinite machines. We still need to make choices with the resources that we have.” (Tradução: O Google tem muitas máquinas, mas não máquinas infinitas. Ainda precisamos fazer escolhas com os recursos que temos.) Ir para a citação
Google — como reduzir o crawl rate
- “return
500,503, or429HTTP response status code instead of200to the crawl requests.” (Tradução: retorne o código de status de resposta HTTP500,503ou429em vez de200para as solicitações de rastreamento.) (Âncora da fonte: return 500, 503, or 429 HTTP response status code instead of 200 to the crawl requests — retorne os códigos de status HTTP 500, 503 ou 429 em vez de 200 para as solicitações de rastreamento.) — Reduza o crawl rate do Googlebot. Ir para a citação - “We don’t recommend that you do this for a long period of time (meaning, longer than 1-2 days).” (Tradução: Não recomendamos que você faça isso por um período longo (ou seja, por mais de 1–2 dias).) Ir para a citação
- “You cannot request an increase in crawl rate, and it may take several days for the request to be evaluated and fulfilled.” (Tradução: Você não pode solicitar um aumento na taxa de rastreamento, e pode levar vários dias para a solicitação ser avaliada e atendida.) Ir para a citação
Google — quais códigos de status limitam o rastreamento
- “Google’s crawlers treat the
429status code as a signal that the server is overloaded, and it’s considered a server error.” (Tradução: os rastreadores do Google tratam o código de status429como um sinal de que o servidor está sobrecarregado, e ele é considerado um erro do servidor.) (Âncora da fonte: Google’s crawlers treat the 429 status code as a signal that the server is overloaded — os rastreadores do Google tratam o status 429 como um sinal de que o servidor está sobrecarregado.) — Como os códigos de status HTTP afetam os crawlers do Google. Ir para a citação - “The
4xxstatus codes, except429, have no effect on crawl rate.” / “Don’t use401and403status codes for limiting the crawl rate.” (Tradução: Os códigos de status4xx, exceto429, não têm efeito sobre a taxa de rastreamento. / Não use os códigos de status401e403para limitar a taxa de rastreamento.) (Âncora da fonte: The 4xx status codes, except 429, have no effect on crawl rate — os códigos de status 4xx, exceto 429, não têm efeito sobre a taxa de rastreamento.) Ir para a citação
Google — crawl-delay e rankings
- “The non-standard ‘crawl-delay’ robots.txt rule is not processed by Google’s crawlers.” (Tradução: A regra não padrão ‘crawl-delay’ do robots.txt não é processada pelos rastreadores do Google.) (Âncora da fonte: The non-standard ‘crawl-delay’ robots.txt rule is not processed by Google’s crawlers — a regra não padrão ‘crawl-delay’ do robots.txt não é processada pelos rastreadores do Google.) (Âncora da fonte: The non-standard crawl-delay robots.txt rule is not processed by Google’s crawlers — a regra não padrão crawl-delay do robots.txt não é processada pelos rastreadores do Google.) — Mitos e fatos sobre rastreamento. Ir para a citação
- “Improving your crawl rate won’t necessarily lead to better positions in Google Search results.” (Tradução: Melhorar sua taxa de rastreamento não necessariamente levará a posições melhores nos resultados da Pesquisa Google.) Ir para a citação
Gary Illyes, Google (sobre a descontinuação da ferramenta de crawl rate)
- “if the server persistently returns HTTP 500 status codes for a range of URLs, Googlebot will automatically, and almost immediately slow down crawling.” (Tradução: se o servidor retornar persistentemente códigos de status HTTP 500 para um conjunto de URLs, o Googlebot desacelerará o rastreamento automática e quase imediatamente.) Ler a cobertura
- “with the improvements we’ve made to our crawling logic and other tools available to publishers, its usefulness has dissipated.” (Tradução: com as melhorias que fizemos na nossa lógica de rastreamento e em outras ferramentas disponíveis para os editores, sua utilidade se dissipou.) Ler a cobertura
Checklists de crawl rate
Reduza o crawl rate do Googlebot com segurança (em ordem)
- Primeiro, confirme que o crawler é realmente o problema — verifique as estatísticas de rastreamento do GSC (tempo médio de resposta, status do host) e os logs do servidor, não apenas uma impressão.
- Corrija a causa raiz: acelere o servidor ou adicione recursos. Essa é a correção duradoura e a única que não coloca a indexação em risco.
- Se for uma emergência verdadeira, retorne
500/503/429às solicitações de rastreamento (prefira429comRetry-After). O Googlebot desacelera quase imediatamente. - Mantenha a resposta de emergência ativa por no máximo 1–2 dias — mais tempo pode fazer páginas serem removidas do índice e os anúncios serem pausados.
- Para um problema contínuo (não emergencial), envie a solicitação especial de crawl rate do Google, informando o rate ideal para seu site.
- Para o Bing, defina a velocidade no Crawl Control e/ou adicione
crawl-delayaorobots.txt.
NÃO faça isto
- Não use
401/403/404para limitar o ritmo — não há efeito sobre o rate e você pode perder páginas. - Não dependa de
crawl-delaynorobots.txtpara o Google — ele é ignorado (o Bing o respeita). - Não procure o antigo slider de crawl rate do GSC — ele foi removido em 8 de janeiro de 2024.
Quando você quer mais rastreamento (não pode forçá-lo — melhore-o indiretamente)
- Acelere / adicione recursos ao servidor.
- Mantenha URLs canônicas e indexáveis em sitemaps limpos, com
lastmodpreciso. - Remova URLs duplicadas e de baixo valor que desperdiçam rastreamento.
- Fortaleça links internos e conquiste mais links externos.
- Use
GETem vez dePOSTquando possível; use a Indexing API quando for elegível.
Crawl rate — folha de consulta rápida
Códigos de status e o que fazem com o crawl rate do Google
| Código de status | Efeito no crawl rate | Usar para limitar? |
|---|---|---|
200 | Normal — buscado sem problemas | n/a |
429 | Desacelera o rastreamento (tratado como servidor sobrecarregado; pode carregar Retry-After) | Sim — emergência, ≤1–2 dias |
500 | Desacelera o rastreamento (erro do servidor) | Sim — emergência, ≤1–2 dias |
503 | Desacelera o rastreamento (serviço indisponível) | Sim — emergência, ≤1–2 dias |
401 | Nenhum efeito sobre o rate | Não — o Google diz para não usar |
403 | Nenhum efeito sobre o rate | Não — o Google diz para não usar |
404 | Nenhum efeito sobre o rate | Não — há risco de perder páginas |
robots.txt crawl-delay | Ignorado pelo Google (respeitado pelo Bing) | Não (Google) / Sim (Bing) |
Fatos rápidos
- Crawl rate = quão rápido (oferta); crawl demand = quanto eles querem (demanda); crawl budget = os dois juntos.
- Termo do Google: crawl capacity limit — conexões paralelas + intervalo entre buscas. Automático, acompanha a saúde do servidor.
- Janela de emergência
5xx/429: no máximo 1–2 dias — mais tempo pode remover páginas do índice e pausar anúncios. - Nenhum aumento manual — você só pode pedir ao Google para reduzir, nunca aumentar.
- Slider manual de crawl rate do GSC: removido em 8 de janeiro de 2024 (anunciado em 24 de novembro de 2023).
- Todos os Googlebots compartilham um pool de rastreamento (busca, imagens, anúncios etc.).
- Crawl rate não é fator de ranking.
- Equivalente no Bing: grade do Crawl Control +
crawl-delayrespeitado.
Diga temporariamente ao Googlebot para desacelerar
Esta é somente a alavanca de emergência — retorne 503 (ou 429) com um
cabeçalho Retry-After ao rastreador em vez de 200. O Google interpreta isso como “desacelere” quase
imediatamente. Mantenha-o ativo por no máximo um ou dois dias: se deixá-lo por mais tempo,
as URLs afetadas poderão ser removidas do índice (e quaisquer anúncios do Google que apontem para elas poderão ser pausados). A correção de longo prazo é um servidor mais rápido e saudável, não uma resposta de erro permanente.
Apache (.htaccess) — retorne 503 com Retry-After
# Emergency only — remove within 1–2 days.
# Sends Googlebot a "slow down / try later" signal.
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} (Googlebot|bingbot) [NC]
RewriteRule ^ - [R=503,L]
Header always set Retry-After "3600"
ErrorDocument 503 "Server temporarily overloaded — please retry later."Nginx — retorne 503 com Retry-After para rastreadores
# Emergency only — remove within 1–2 days.
if ($http_user_agent ~* (Googlebot|bingbot)) {
return 503;
}
# Send a Retry-After hint with the 503 response.
add_header Retry-After 3600 always;Express / Node.js — 429 Too Many Requests com Retry-After
// Emergency only — remove within 1–2 days.
// 429 explicitly means "too many requests" and carries a Retry-After.
app.use((req, res, next) => {
const ua = req.get("user-agent") || "";
if (/Googlebot|bingbot/i.test(ua)) {
res.set("Retry-After", "3600"); // seconds
return res.status(429).send("Too many requests — please retry later.");
}
next();
});Lembrete: isto apenas desacelera o rastreamento temporariamente. Não é uma forma de pausar ou bloquear a indexação e não substitui a correção da capacidade do servidor.
Ferramentas para ver e controlar o crawl rate
- Relatório Crawl Stats do Google Search Console — a visão do próprio Google: total de solicitações de rastreamento ao longo do tempo, tamanho total baixado, tempo médio de resposta, status do host (disponibilidade do site para o Google ao longo de ~90 dias) e divisão por código de resposta, tipo de arquivo, finalidade do rastreamento e tipo de Googlebot. É aqui que você verá a limitação.
- Bing Webmaster Tools — Crawl Control — a grade manual hora a hora (predefinições ou desenho personalizado) para definir a velocidade do Bingbot por horário do dia. A alavanca manual que o Google aposentou.
robots.txtcrawl-delay— respeitado pelo Bing (e por alguns outros mecanismos), ignorado pelo Google. Útil para o Bing, inútil para o Google.- Análise de arquivos de log do servidor — a fonte verdadeira da velocidade com que os bots realmente acessam seu site e dos códigos de status que recebem. (Consulte análise de arquivos de log.)
- Auditorias / rastreadores de sites — Ahrefs Site Audit e Screaming Frog SEO Spider para encontrar URLs duplicadas, parametrizadas e semelhantes a armadilhas que desperdiçam rastreamento.
O que você deve fazer com o crawl rate?
Choose the crawl-rate response
Manual de incidentes: o tráfego do rastreador está sobrecarregando a origem
- Verifique o bot. Confirme que o IP de origem pertence ao rastreador alegado. Se não pertencer, bloqueie ou limite a taxa do impostor pelos controles de segurança normais.
- Meça o impacto. Correlacione as solicitações do rastreador com latência, saturação, timeouts e respostas 5xx. Se não houver correlação, investigue a fonte real da carga.
- Proteja a disponibilidade. Elimine somente o tráfego necessário; em uma emergência temporária do Googlebot, use
429ou503, não403ou404. - Encontre os padrões problemáticos. Agrupe as solicitações por diretório, parâmetros, código de resposta e bytes. Se um espaço de URLs descontrolado dominar, corrija seus links ou regras de geração.
- Corrija a causa. Aumente a capacidade, armazene respostas seguras em cache, remova armadilhas de rastreamento ou use os controles compatíveis específicos do rastreador.
- Restaure e verifique. Remova a limitação temporária e confirme que a latência dos usuários e as taxas de erro do rastreador voltaram à linha de base do site.
Erros de crawl rate
- Usar
crawl-delaypara o Googlebot. O Google o ignora. Use respostas temporárias 429/503 somente em uma emergência e corrija a carga subjacente. - Retornar 403 ou 404 para desacelerar o Googlebot. Esses status comunicam acesso ou ausência, não sobrecarga temporária. Use o sinal temporário correto.
- Tentar forçar um aumento permanente. O controle deslizante aposentado do Search Console desapareceu, e rastrear mais não melhora os rankings. Melhore a saúde do servidor e os sinais de demanda.
- Confiar na string do user-agent. Falsificadores podem alegar ser o Googlebot. Verifique o IP antes de mudar o comportamento do site.
- Deixar a limitação emergencial ativa. Erros prolongados podem prejudicar o rastreamento e a indexação. Defina um responsável e uma condição de remoção antes da implantação.
A estrutura verifique → proteja → corrija
- Verifique: prove que o tráfego é de um rastreador real e que se correlaciona com danos ao servidor.
- Proteja: use o controle temporário mais restrito que preserve a disponibilidade dos usuários e comunique o significado HTTP correto.
- Corrija: remova o gargalo de capacidade ou o espaço de URLs descontrolado e então retire o controle temporário.
Mantenha rate separado de demand: um servidor saudável pode elevar o teto de capacidade, mas não pode obrigar um mecanismo de busca a querer mais URLs.
Prove que uma intervenção de crawl rate funcionou
Resposta de limitação temporária
Teste a executar: solicite uma URL de teste limitada com curl -I. Resultado esperado: o 429 ou 503 planejado aparece somente durante o incidente e as URLs normais continuam disponíveis. Interpretação da falha: a regra tem escopo incorreto ou o status errado está sendo retornado. Janela de monitoramento: imediata. Gatilho de rollback: usuários ou bots não relacionados recebem a limitação inesperadamente.
Recuperação após remover a limitação
Teste a executar: repita as verificações de cabeçalho e monitore o servidor e os logs de acesso. Resultado esperado: respostas 200 normais retornam, os erros do rastreador diminuem e a latência dos usuários permanece na linha de base. Interpretação da falha: a regra temporária continua ativa ou o problema de capacidade persiste. Janela de monitoramento: imediata para o comportamento HTTP; continue até a próxima janela normal de rastreamento. Gatilho de rollback: uma nova saturação ou erros 5xx exigem retornar ao plano de incidentes.
Reparo do espaço de URLs
Teste a executar: rastreie e verifique nos logs o padrão de parâmetro ou caminho que causou solicitações excessivas. Resultado esperado: novas URLs armadilha deixam de ser geradas ou vinculadas, enquanto URLs valiosas continuam acessíveis. Interpretação da falha: outro caminho de descoberta ainda expõe o padrão. Janela de monitoramento: compare janelas equivalentes de logs. Gatilho de rollback: páginas valiosas ou recursos necessários tornam-se inacessíveis.
Métricas para a saúde do crawl rate
Taxa de solicitações do rastreador verificado
Métrica: solicitações por unidade de tempo de IPs de rastreadores verificados. O que ela informa: o ritmo real do rastreador. Como obtê-la: logs de acesso após a verificação do bot. Referência / faixa realista: estabeleça uma linha de base por rastreador e período de tráfego; não existe uma taxa segura universal. Periodicidade: diariamente durante incidentes, mensalmente caso contrário.
Taxa de erros e latência correlacionadas ao rastreador
Métrica: 5xx/timeouts e latência da origem durante a atividade do rastreador. O que ela informa: se a taxa excede a capacidade. Como obtê-la: alinhe a telemetria do servidor aos horários dos logs do rastreador. Referência / faixa realista: use a linha de base normal do site fora de incidentes e os objetivos de capacidade. Periodicidade: alertas contínuos para sites críticos.
Participação de solicitações úteis
Métrica: solicitações verificadas do rastreador para páginas 200 valiosas versus redirecionamentos, erros e URLs armadilha conhecidas. O que ela informa: se a capacidade é usada produtivamente. Como obtê-la: classifique as URLs e os status dos logs. Referência / faixa realista: compare a tendência com o inventário do próprio site; evite uma meta universal. Periodicidade: mensalmente.
Teste seus conhecimentos: Crawl rate
Recursos que valem seu tempo
Meus textos relacionados
- Quando você deve se preocupar com crawl budget? — crawl rate como uma metade do crawl budget, além das alavancas para reduzir e aumentar.
- O que é o Googlebot e como ele funciona? — como o Googlebot decide com que velocidade e o que rastrear (e por que “change crawl rate” agora está descontinuado).
- Guia para iniciantes de SEO técnico — onde rastreamento e crawl rate se encaixam no quadro maior.
Minhas palestras
- How Search Works (SlideShare) — onde descrevo o limite de crawl rate como “what your site can support” e observo que todos os Googlebots compartilham um pool de rastreamento. (Aviso permanente: “This is my understanding of systems… not going to be 100% complete or accurate.”)
De outras fontes
- Search Engine Land — A ferramenta de crawl rate do Googlebot vai acabar e a ferramenta agora acabou — a descontinuação, com o raciocínio de Illyes.
- Série Crawling December do Google — o melhor conjunto concentrado de explicações oficiais sobre rastreamento.
- Search Engine Journal — Google remove a ferramenta Crawl Rate Limiter do Search Console — a retransmissão de Roger Montti sobre a descontinuação de nov. de 2023 e o novo piso de crawl rate definido automaticamente.
- Search Engine Journal — Não use respostas de erro 403/400 para limitar o Googlebot — cobre a publicação do Google de fev. de 2023 que alerta contra o uso de
4xxpara limitar o rastreamento. - Bing Webmaster Blog — Série bingbot: otimizando a frequência de rastreamento — a explicação do próprio Bing sobre quando e como o Bingbot decide buscar novamente; um contraponto útil à abordagem automática do Google.
- Bing Webmaster Blog — Obtendo o máximo do Bingbot com o Bing Webmaster Tools — como usar o Crawl Control e outras configurações do BWT para gerenciar o crawl rate do Bingbot.