Rastreamento
Como os mecanismos de busca descobrem e baixam a web — Googlebot e Bingbot, descoberta de URLs, o agendador de rastreamento, renderização e como crawling difere de indexação e ranking. O hub para tudo relacionado a rastreamento.
Idiomas
1 sinal de evidência nesta página
- Dados de origem vinculadosgooglebot.json
Crawling é a primeira etapa da busca (crawl → index → serve): bots como Googlebot e Bingbot descobrem URLs e baixam páginas para que possam ser renderizadas, indexadas e ranqueadas. É necessário para aparecer na busca, mas não é fator de ranking — e é diferente tanto de indexação quanto de renderização. A maioria dos sites nunca precisa gerenciar crawl budget; quando o crawling falha, os logs do servidor são a fonte verdadeira. Este hub explica todo o pipeline e aponta para os aprofundamentos.
TL;DR — Crawling é como os mecanismos de busca encontram e baixam suas páginas. Um bot (Googlebot para o Google, Bingbot para o Bing) segue links e lê sitemaps para descobrir URLs e depois buscá-las. Uma página precisa ser rastreada antes de aparecer na busca — mas ser rastreada muitas vezes não faz você ranquear melhor.
O que é crawling
Os mecanismos de busca não navegam na web como você. Eles enviam programas automatizados — chamados de crawlers, bots ou spiders — que visitam páginas, baixam o que está nelas e seguem links para encontrar mais páginas. O crawler do Google é o Googlebot; o do Bing é o Bingbot.
Pense nisso como três etapas, nesta ordem:
- Crawl — o bot descobre uma URL e baixa a página.
- Index — o mecanismo processa a página e a arquiva em um banco de dados gigante com tudo o que ele pode exibir nos resultados.
- Serve (rank) — quando alguém pesquisa, o mecanismo retira as melhores correspondências do índice e as coloca em ordem.
Crawling é a primeira etapa. Se uma página nunca for rastreada, não poderá ser indexada e, se não for indexada, não poderá ranquear. Portanto, crawling importa — mas é um portão, não um placar.
Como os crawlers encontram suas páginas
Duas maneiras principais:
- Seguindo links. Quando um bot rastreia uma página, ele coleta os links e adiciona essas URLs à lista para rastrear em seguida. Bons links internos são como páginas novas são encontradas.
- Sitemaps. Um sitemap XML é uma lista de suas URLs que você entrega diretamente aos mecanismos de busca para que não precisem descobrir tudo por meio de links.
Também existem opções de “push”, nas quais você informa ativamente a um mecanismo que uma página mudou — falaremos mais delas abaixo —, mas links e sitemaps fazem a maior parte do trabalho.
Como ajudar os mecanismos de busca a rastrear seu site
- Crie links para suas páginas importantes a partir de outras páginas (especialmente da home e da navegação principal).
- Envie um sitemap XML no Google Search Console e no Bing Webmaster Tools.
- Não bloqueie acidentalmente páginas que você quer que sejam encontradas (verifique seu
robots.txt). - Mantenha o servidor rápido e saudável — se ele estiver lento ou lançando erros, os bots recuam e rastreiam menos.
O erro que a maioria das pessoas comete
Crawling não é ranking. Ser rastreado com mais frequência não fará você subir nos resultados. E
bloquear uma página em robots.txt não a remove do Google — apenas impede o Google de lê-la.
Evidence for this claim robots.txt controls crawler access and is not a reliable way to keep a URL out of Google. Scope: Google Search behavior for URLs blocked by robots.txt; blocked URLs may still be indexed when discovered elsewhere. Confidence: high · Verified: Google Search Central: Introduction to robots.txt Se você realmente quer remover uma página, deixe que ela seja rastreada e
adicione uma tag noindex. (Eu mesmo testei o lado do bloqueio — veja a versão Advanced.)
Quer a versão mais aprofundada, com o funcionamento do agendador de rastreamento, limites de bytes e a distinção entre crawl, index e rank? Mude para a aba Avançado.
TL;DR — Crawling é a primeira das três etapas da busca (crawl → index → serve). Os bots descobrem URLs por pull (links + sitemaps) e push (IndexNow, Indexing API) e depois as buscam em um cronograma algorítmico que limita a velocidade conforme a saúde do seu servidor. Renderizar JavaScript é uma etapa separada. Crawling é necessário para ranquear, mas não é um sinal de ranking e é diferente de indexação — uma página bloqueada por robots ainda pode ser indexada. A maioria dos sites não precisa gerenciar o crawl budget; os logs mostram o que realmente aconteceu.
Crawling é a primeira de três etapas
Three stages run left to right. Crawl: a bot discovers a URL and downloads the page. Index: the engine processes the page and stores eligible information. Serve or rank: the best indexed matches are ordered for a query. The Crawl stage is highlighted, and a note says not every page advances through every stage.
© Patrick Stox LLC · CC BY 4.0 ·
O Google é direto sobre o pipeline: “Google Search works in three stages, and not all pages make it through each stage” — rastreamento, indexação e exibição. (Tradução: a Pesquisa Google funciona em três etapas, e nem todas as páginas passam por cada etapa.) Evidence for this claim Google describes Search as three stages: crawling, indexing, and serving results. Scope: Google Search's documented processing model; it does not guarantee that a page reaches every stage. Confidence: high · Verified: Google Search Central: In-depth guide to how Google Search works A parte de “nem todas as páginas passam” é o ponto central do SEO técnico. Uma página pode ser rastreada mas não indexada, ou indexada mas nunca ser exibida para uma consulta. Manter as etapas separadas na cabeça é o modelo mental mais útil aqui.
Quem realmente faz o crawling
“Googlebot” parece ser um único programa. Não é. No meu deck How Search Works, descrevo-o como 1 000+ sistemas executando uma família de crawlers especializados — desktop, mobile, imagens, notícias, vídeo e anúncios — com as solicitações em sua maioria originadas de Mountain View. Todos extraem dados do mesmo pool de crawl budget, por isso um rastreamento descontrolado de imagens ou parâmetros pode consumir o rastreamento do seu conteúdo real.
E não são mais apenas os mecanismos de busca. Na minha análise de dados do Cloudflare Radar (Conheça os novos crawlers da web), os bots de mecanismos de busca ainda rastreiam mais — mas os bots de IA estão firmemente em segundo lugar e a caminho de ultrapassá-los nos próximos anos. Se você estiver lendo seus logs, o elenco de personagens mudou.
Como os crawlers descobrem URLs
Two discovery routes feed one crawl queue. Pull discovery includes following links and sitemaps. Push discovery includes IndexNow for Bing, Yandex, and other participating engines but not Google for general pages; the Google Indexing API for JobPosting and BroadcastEvent pages; and change notifications through sitemap lastmod, RSS, and WebSub.
© Patrick Stox LLC · CC BY 4.0 ·
A descoberta é tanto pull quanto push:
- Pull — links. Google: “Other pages are discovered when Google extracts a link from a known page to a new page.” (Tradução: outras páginas são descobertas quando o Google extrai um link de uma página conhecida para uma página nova.) É por isso que páginas órfãs (sem links apontando para elas) têm dificuldade para ser encontradas.
- Pull — sitemaps. “Still other pages are discovered when you submit a list of pages (a sitemap) for Google to crawl.” (Tradução: outras páginas ainda são descobertas quando você envia uma lista de páginas (um sitemap) para o Google rastrear.)
- Push — notificações de mudança. Em vez de esperar um novo rastreamento, informe ao mecanismo que algo mudou: IndexNow (Bing, Yandex e outros — o Google não o usa para páginas gerais) e a Indexing API do Google (oficialmente apenas para páginas
JobPostingeBroadcastEvent).lastmodde sitemaps, RSS e WebSub completam as opções de push.
O Google chama o conjunto inteiro de “URL discovery.” (Tradução: descoberta de URLs.)
Como os crawlers buscam páginas
- O agendamento é algorítmico. “Googlebot uses an algorithmic process to determine which sites to crawl, how often, and how many pages to fetch from each site.” (Tradução: o Googlebot usa um processo algorítmico para determinar quais sites rastrear, com que frequência e quantas páginas buscar de cada site.) Você influencia o processo; não o define.
- O crawling é educado. Os bots reduzem a velocidade para não derrubar seu site: “they try not to crawl the site too fast to avoid overloading it… HTTP 500 errors mean ‘slow down.’” (Tradução: eles tentam não rastrear o site rápido demais para evitar sobrecarregá-lo… erros HTTP 500 significam “desacelere”.) Esta é a alavanca por trás da redução temporária — retorne
503/429e o Googlebot recua (por um ou dois dias, não para sempre). - Há um limite de bytes. Desde a atualização Inside Googlebot de março de 2026 do Google, o Googlebot busca aproximadamente 2 MB por URL (abaixo do antigo valor de 15 MB), com PDFs permitidos até 64 MB. Se você ultrapassar o limite, a busca é truncada, não rejeitada — somente a parte baixada é encaminhada para indexação. Se seu conteúdo crítico estiver abaixo de 2 MB de excesso, isso importa.
- O cache reduz o custo de novos rastreamentos. Os crawlers do Google usam solicitações condicionais e cache para que recursos inalterados não sejam buscados novamente todas as vezes. O Google não publica uma duração exata de cache para recursos de renderização, portanto não presuma uma janela fixa de atualização para uma mudança de código — espere algum atraso, não um reflexo instantâneo.
Renderização não é crawling
Isso confunde as pessoas constantemente. “During the crawl, Google renders the page and runs any JavaScript it finds using a recent version of Chrome.” (Tradução: durante o rastreamento, o Google renderiza a página e executa qualquer JavaScript que encontra usando uma versão recente do Chrome.) A renderização é uma etapa distinta da busca do HTML. O renderizador (Web Rendering Service) é stateless — armazenamento e cookies são apagados entre os carregamentos, ele nega solicitações de permissão e rejeita service workers. Se seu conteúdo só aparecer depois de um clique ou de uma navegação controlada por JS que não seja um link real <a href>, espere problemas de descoberta e renderização. (Tratamento completo em JavaScript SEO.)
Crawling versus indexação versus ranking
As distinções mais importantes desta página:
- Crawling ≠ ranking. Crawling é necessário para estar nos resultados, mas não é um sinal de ranking. Uma taxa de rastreamento maior não elevará suas posições. Crawl budget é uma questão de eficiência, ponto final.
- Crawling ≠ indexação. Uma página bloqueada em
robots.txtainda pode ser indexada se outras páginas apontarem para ela — o Google apenas não consegue ver o conteúdo nem qualquer tagnoindexque você tenha colocado ali. Como escrevi em Indexada mesmo bloqueada por robots.txt: “crawling and indexing are two different things.” (Tradução: crawling e indexação são duas coisas diferentes.) Para remover uma página de verdade, permita o crawling e adicionenoindex— não a bloqueie. - Crawling ≠ renderização. JavaScript é executado em uma etapa separada e armazenável em cache.
Testei diretamente o lado do bloqueio. Em A história de bloquear duas páginas de alto ranking com Robots.txt, bloqueei duas de nossas páginas que ranqueavam. O resultado: “We lost a position here or there and all of the featured snippets for the pages… I expected a lot more impact, but the world didn’t end.” (Tradução: perdemos uma posição aqui ou ali e todos os featured snippets das páginas… eu esperava um impacto muito maior, mas o mundo não acabou.) Minha conclusão continua: “Don’t block pages you want indexed. It hurts. Not as bad as you might think it does — but it still hurts.” (Tradução: não bloqueie páginas que você quer indexar. Isso prejudica. Não tanto quanto você pode imaginar — mas ainda prejudica.)
Como controlar o crawling
robots.txtcontrola o crawling, não a indexação. “A robots.txt file tells search engine crawlers which URLs the crawler can access on your site.” (Tradução: um arquivo robots.txt informa aos crawlers dos mecanismos de busca quais URLs o crawler pode acessar no seu site.) Evidence for this claim robots.txt controls crawler access and is not a reliable way to keep a URL out of Google. Scope: Google Search behavior for URLs blocked by robots.txt; blocked URLs may still be indexed when discovered elsewhere. Confidence: high · Verified: Google Search Central: Introduction to robots.txt Use-o para manter bots fora de espaços de baixo valor — não como ferramenta de desindexação.- Arquitetura do site e links internos determinam a profundidade das páginas e se elas serão descobertas (veja crawl depth).
- Controles de crawl rate. O Google aposentou o controle deslizante manual de crawl rate no Search Console (início de 2024) — agora depende das respostas do seu servidor e de um piso automático menor. O Bing ainda oferece uma grade manual de Crawl Control no Bing Webmaster Tools (veja crawl rate).
Eficiência de crawling e crawl budget
Os dois mecanismos tratam o crawling como uma questão de eficiência. Gary Illyes descreve o lado do Google como limite de crawl rate + crawl demand (popularidade e desatualização). Fabrice Canel, do Bing, chama isso de “crawl efficiency north star … to crawl a URL only when the content has been added … updated.” (Tradução: estrela-guia da eficiência de rastreamento… rastrear uma URL somente quando o conteúdo foi adicionado… atualizado.)
A parte tranquilizadora: a maioria dos sites não precisa se preocupar com isso. O Google diz claramente — se seu site não tiver um grande número de páginas que mudam rapidamente ou se suas páginas forem rastreadas no mesmo dia em que são publicadas, “you don’t need to read this guide.” (Tradução: você não precisa ler este guia.) Isso começa a importar por volta de mais de 1 milhão de páginas mudando semanalmente ou mais de 10 mil mudando diariamente (veja crawl budget e crawl frequency).
Evidence for this claim Sites without many rapidly changing pages, or whose new pages are crawled the day they are published, generally do not need crawl-budget management. Scope: large websites Confidence: high · Verified: Optimize your crawl budgetQuando o crawling dá errado — como perceber
Antes de procurar uma correção, descubra qual etapa está realmente quebrada — os sintomas e remédios são diferentes em cada uma:
-
Não foi descoberta? Nada aponta para a página e ela não está no sitemap. Corrija os links internos e a cobertura do sitemap — veja crawl depth e crawl frequency.
-
Foi descoberta, mas nunca buscada? Erros de servidor, timeouts ou um bloqueio em
robots.txtestão afastando os bots. Consulte o GSC Crawl Stats e seus logs — veja crawl budget e crawl rate. -
Foi buscada, mas a renderização está errada? O conteúdo depende de um clique ou de uma navegação somente em JS que o Googlebot não fará, ou o WRS esgota o tempo. Veja JavaScript SEO para os modos de falha específicos de renderização.
-
Foi buscada e renderizada, mas ainda não foi indexada? Essa é uma decisão separada do índice — veja o hub de Indexação em vez de tratá-la como um problema de crawling.
-
A análise de arquivos de log é a fonte verdadeira. Os logs do servidor mostram exatamente quais URLs os bots acessaram, com que frequência e quais códigos de status receberam — a melhor forma de identificar crawling desperdiçado e encontrar páginas que os bots nunca alcançam (veja análise de arquivos de log).
-
Armadilhas de spider — espaços infinitos de URLs gerados por calendários, navegação facetada, IDs de sessão ou explosões de links relativos — consomem silenciosamente seu crawl budget em URLs inúteis (veja spider traps).
Para onde ir agora: o cluster de crawling
Este hub é o mapa. Cada tópico abaixo é um aprofundamento próprio:
Eficiência do crawling — quanto e com que frequência
- Crawl budget — o que é (capacidade + demanda), o que o desperdiça e quem realmente precisa se preocupar.
- Crawl rate — com que velocidade os bots buscam, por que o controle deslizante do GSC desapareceu e como acelerar ou desacelerar um rastreamento hoje.
- Crawl frequency — o que faz o Google rastrear uma página novamente mais cedo (popularidade,
desatualização,
lastmodpreciso) e o que não faz. - Crawl depth — profundidade de cliques versus profundidade de travessia do rastreamento e por que páginas importantes devem ficar perto da home.
Conheça os crawlers — quem realmente busca suas páginas
- Crawler — o que é um crawler da web (bot, spider) e o ciclo buscar → analisar → seguir que todos executam.
- User agent — a string de user-agent e o token de robots.txt com que um bot se identifica e por que você não pode confiar apenas na string.
- Googlebot — o crawler do Google: Smartphone versus Desktop, renderização e como verificá-lo.
- Bingbot — o crawler da Microsoft, como ele difere e as superfícies além do Bing que ele alimenta.
- Crawlers de IA — bots de empresas de IA (treinamento versus busca por IA versus buscadores acionados pelo usuário) e como controlá-los.
Diagnóstico de problemas de crawling
- Análise de arquivos de log — verificar bots reais e ler o que eles rastrearam.
- Armadilhas de spider (crawler traps) — os padrões que geram URLs infinitas e como corrigi-los.
Cada tópico acima é um aprofundamento próprio dentro deste hub — eles também estão na barra lateral.
Qualificar seus links externos é um controle relacionado da página que se sobrepõe ao crawling — estas diretivas informam ao Google como tratar um link, não se ele deve ser rastreado: nofollow (o antigo curinga, agora uma dica), além de rel=sponsored e rel=ugc para links pagos/publicitários e gerados por usuários. Os três vivem no cluster de meta tags da página.
Ser encontrado em primeiro lugar é uma etapa relacionada, mas separada. Como os mecanismos de busca descobrem suas URLs — links internos, sitemaps (XML, índice de sitemap, imagens e vídeo) e os protocolos de push IndexNow e a Google Indexing API (para que cada um realmente serve e por que o Google não usa IndexNow) — agora está no seu próprio hub de Discovery. Para o tema mais amplo, veja How Search Works.
Resumo de IA
Uma síntese da versão Advanced:
- Crawling = primeira etapa da busca (crawl → index → serve). É necessário para ranquear, mas não é um sinal de ranking, e é distinto da indexação e da renderização.
- A descoberta é pull + push: links e sitemaps (pull); IndexNow e a Indexing API (push). O Google chama isso de “URL discovery”.
- A busca é algorítmica e educada: o Google decide o que buscar, com que frequência e quantas páginas,
e reduz a velocidade com
5xx/429(“slow down”). O Googlebot busca aproximadamente 2 MB por URL (PDFs de até 64 MB) a partir de 2026, truncando o que ultrapassar esse limite. - A renderização é separada: JS roda em um Chrome headless sem estado; o Google armazena recursos em cache para reduzir o custo de novos rastreamentos, mas não publica uma duração exata, então mudanças podem demorar.
- Crawl ≠ indexação: uma página bloqueada por robots ainda pode ser indexada por meio de links; use
noindex(com o crawling permitido) para removê-la. O experimento de bloqueio de Patrick mostrou que as páginas bloqueadas mantiveram em grande parte seus rankings — “but it still hurts.” (Tradução: mas ainda prejudica.) - Crawl budget = capacidade + demanda (popularidade + desatualização). A maioria dos sites não precisa gerenciá-lo.
- Diagnostique com logs; observe spider traps que desperdiçam o budget. Os bots de IA agora são uma parcela importante e crescente do tráfego de crawling.
Documentação oficial
Documentação de fonte primária dos mecanismos de busca.
- Guia detalhado de como funciona a Pesquisa Google — a visão geral de rastrear → indexar → exibir, a descoberta de URLs e o agendador de rastreamento.
- Crawling e indexação — o hub de robots, sitemaps, canonização e controles de rastreamento.
- Introdução ao robots.txt — o que o robots.txt faz (e não faz).
- Otimize seu crawl budget — capacidade + demanda de rastreamento; quem precisa disso.
- Visão geral dos crawlers e fetchers do Google — cada user-agent do Google e os intervalos de IP publicados.
- Inside Googlebot (março de 2026) — os limites atuais de bytes e a arquitetura de rastreamento.
- Googlebot e a questão dos 15 MB (2022) — o limite antigo, útil para mostrar a mudança.
- Série Crawling December (2024) — Googlebot, cache HTTP, navegação facetada e CDNs.
Bing / Microsoft
- Série bingbot: maximizando a eficiência de rastreamento — a definição de crawling do Bing e sua “estrela-guia da eficiência de rastreamento”.
- Bing Webmaster Tools — Crawl Control — defina a velocidade e o momento do bingbot.
- IndexNow / indexnow.org — o protocolo push para sinalizar instantaneamente URLs alteradas.
Citações da fonte
Declarações registradas do Google e do Bing. Cada link é um deep link que salta diretamente para a passagem citada na página de origem.
Google — como funciona o crawling
- “Google Search works in three stages, and not all pages make it through each stage.” — documentação do Google Search Central. (Tradução: a Pesquisa Google funciona em três etapas, e nem todas as páginas passam por cada etapa.) Ir para a citação
- “Other pages are discovered when Google extracts a link from a known page to a new page… Still other pages are discovered when you submit a list of pages (a sitemap) for Google to crawl. This process is called ‘URL discovery’.” (Tradução: outras páginas são descobertas quando o Google extrai um link de uma página conhecida para uma página nova… outras páginas ainda são descobertas quando você envia uma lista de páginas (um sitemap) para o Google rastrear. Esse processo é chamado de “descoberta de URLs”.) Ir para a citação
- “Googlebot uses an algorithmic process to determine which sites to crawl, how often, and how many pages to fetch from each site.” (Tradução: o Googlebot usa um processo algorítmico para determinar quais sites rastrear, com que frequência e quantas páginas buscar de cada site.) Ir para a citação
- “They try not to crawl the site too fast to avoid overloading it. This mechanism is based on the responses of the site (for example, HTTP 500 errors mean ‘slow down’).” (Tradução: eles tentam não rastrear o site rápido demais para evitar sobrecarregá-lo. Esse mecanismo se baseia nas respostas do site (por exemplo, erros HTTP 500 significam “desacelere”).) Ir para a citação
- “During the crawl, Google renders the page and runs any JavaScript it finds using a recent version of Chrome.” (Tradução: durante o rastreamento, o Google renderiza a página e executa qualquer JavaScript que encontra usando uma versão recente do Chrome.) Ir para a citação
Google — robots.txt, orçamento de rastreamento
- “A robots.txt file tells search engine crawlers which URLs the crawler can access on your site.” — documentação do Google Search Central. (Tradução: um arquivo robots.txt informa aos crawlers dos mecanismos de busca quais URLs o crawler pode acessar no seu site.) Ir para a citação
- “Taking crawl capacity and crawl demand together, Google defines a site’s crawl budget as the set of URLs that Google can and wants to crawl.” (Tradução: considerando juntos a capacidade e a demanda de rastreamento, o Google define o crawl budget de um site como o conjunto de URLs que o Google pode e quer rastrear.) Ir para a citação
- “If your site doesn’t have a large number of pages that change rapidly, or if your pages seem to be crawled the same day that they are published, you don’t need to read this guide.” (Tradução: se seu site não tiver um grande número de páginas que mudam rapidamente ou se suas páginas parecerem ser rastreadas no mesmo dia em que são publicadas, você não precisa ler este guia.) Ir para a citação
Gary Illyes, Google (via reprodução literal, pelo Search Engine Land, da publicação de 2017 do Google sobre crawl budget)
- O limite de crawl rate é “the number of simultaneous parallel connections Googlebot may use to crawl the site, as well as the time it has to wait between the fetches.” (Tradução: o número de conexões paralelas simultâneas que o Googlebot pode usar para rastrear o site, assim como o tempo que ele precisa esperar entre as buscas.) A demanda de rastreamento é impulsionada por popularidade e desatualização. Leia a cobertura
Fabrice Canel, do Microsoft Bing
- “Crawling is the process by which bingbot discovers new and updated documents or content to be added to Bing’s searchable index.” (Tradução: crawling é o processo pelo qual o bingbot descobre documentos ou conteúdo novos e atualizados para adicionar ao índice pesquisável do Bing.) Ir para a citação
- “Our crawl efficiency north star is to crawl a URL only when the content has been added (URL not crawled before), updated (fresh on-page context or useful outbound links).” (Tradução: nossa estrela-guia da eficiência de rastreamento é rastrear uma URL somente quando o conteúdo foi adicionado (URL nunca rastreada antes) ou atualizado (contexto novo na página ou links externos úteis).) Ir para a citação
Checklist de saúde do crawling
Uma verificação rápida para confirmar que os mecanismos de busca conseguem encontrar e buscar o que importa:
- Páginas importantes têm links a partir de algum lugar rastreável (não são órfãs).
- O
robots.txtnão bloqueia nada que você queira indexar (e bloqueia, sim, espaços de baixo valor, como resultados de busca interna). - O sitemap XML foi enviado ao Google Search Console e ao Bing Webmaster
Tools, lista apenas URLs canônicas e indexáveis e tem um
lastmodpreciso. - O servidor retorna respostas rápidas e estáveis — o mínimo de
5xx/timeouts (os bots desaceleram quando seu servidor tem problemas). - Você não está usando
robots.txtpara tentar desindexar — essa é a função denoindex(com o crawling permitido). - Não há spider traps gerando URLs infinitas (calendários, facetas, IDs de sessão).
- As estatísticas de crawling do GSC foram revisadas quanto a picos de códigos de resposta e tempo médio de resposta.
- Os logs do servidor foram verificados quanto a desperdício de crawling e URLs importantes não rastreadas.
- Conteúdo dependente de JS pode ser alcançado por links
<a href>reais, não por navegação que funciona apenas ao clicar.
Os modelos mentais
1. O pipeline — crawl → render → index → serve. Cada etapa é um filtro, e “not all pages make it through each stage” (nem todas as páginas passam por cada etapa). Quando uma página não tem bom desempenho, localize em qual etapa ela está falhando antes de mudar qualquer coisa: ela foi rastreada? Renderizada? Indexada? Exibida para a consulta?
2. Os três “não é igual”. Mantenha estas distinções separadas e a maior parte da confusão sobre crawling desaparece:
- Crawling ≠ indexação (páginas bloqueadas ainda podem ser indexadas por links)
- Crawling ≠ ranking (a taxa de rastreamento não é um sinal de ranking)
- Crawling ≠ renderização (JS roda em uma etapa separada, que pode usar cache)
3. Descoberta = pull + push.
Pull: links + sitemaps. Push: IndexNow / Indexing API / lastmod. Se uma página não está
sendo encontrada, pergunte qual canal deveria carregá-la — e se existe algum link apontando para ela.
4. Crawl budget = capacidade + demanda. A capacidade é o que seu servidor suporta; a demanda é popularidade + desatualização. Você aumenta o orçamento efetivo muito mais ao remover desperdício (armadilhas, duplicatas, parâmetros inúteis) do que tentando fazer o Google rastrear “mais”.
5. A regra de decisão para remover uma página.
Quer que ela desapareça da busca? Permita o crawling + noindex. Quer que os bots ignorem
um espaço por completo (e não se importa com a indexação)? robots.txt disallow. Nunca
use disallow para desindexar.
Controle do crawling — resumo
O que cada controle realmente faz
| Controle | Impede o crawling? | Impede a indexação? | Use para |
|---|---|---|---|
robots.txt disallow | Sim | Não | Manter bots fora de espaços de URLs de baixo valor |
noindex (meta/header) | Não (precisa ser rastreável) | Sim | Remover uma página do índice |
rel=canonical | Não | Consolida, não força | Apontar para a duplicata preferida |
nofollow em links | Desencoraja o seguimento | Não | Não endossar / não rastrear um link |
rel="sponsored" / rel="ugc" | Dica (como nofollow) | Não | Marcar links pagos/publicitários e gerados por usuários |
5xx / 503 / 429 | Desacelera temporariamente | Não | Sinal de curto prazo de “desacelere” para o Googlebot |
Códigos de status importantes para os bots
200— buscado sem problemas.301/308— redirecionamento permanente (consolida).404/410— ausente; sai do índice ao longo do tempo (410um pouco mais rápido).429/500/503— “desacelere” / tente novamente mais tarde; se persistir = o crawling diminui.
Fatos rápidos
- Limite de busca do Googlebot: ~2 MB por URL (PDFs 64 MB), truncado além disso.
- Controle deslizante manual de crawl rate no GSC: removido (jan. de 2024) — agora valem os sinais do servidor.
- Equivalente do Bing: grade de Crawl Control no Bing Webmaster Tools.
- IndexNow: Bing/Yandex/outros — não o Google. Indexing API: Google, **somente JobPosting
- BroadcastEvent**.
Verifique se um bot é realmente o Googlebot
Há muito tráfego que afirma ser do Googlebot. Confirme com uma verificação de DNS reverso + direto (o Google não publica um atalho — user-agents falsos são comuns).
Ou faça a mesma verificação manualmente:
macOS / Linux — verificação manual
# 1) Reverse DNS the IP from your logs — it should end in googlebot.com or google.com
host 66.249.66.1
# → 1.66.249.66.in-addr.arpa domain name pointer crawl-66-249-66-1.googlebot.com
# 2) Forward DNS that hostname back — it must resolve to the same IP
host crawl-66-249-66-1.googlebot.com
# → crawl-66-249-66-1.googlebot.com has address 66.249.66.1Windows — verificação manual
nslookup 66.249.66.1
nslookup crawl-66-249-66-1.googlebot.comSe a busca reversa não terminar em um domínio do Google ou a busca direta não corresponder ao IP original, não é Googlebot. Você também pode comparar com os intervalos de IP publicados pelo Google (googlebot.json).
Um ponto de partida seguro para robots.txt
User-agent: *
Disallow: /search # internal search result pages
Disallow: /*?*sort= # sort-order parameter spaces
Allow: /
Sitemap: https://example.com/sitemap.xmlLembre-se: Disallow bloqueia o crawling, não a indexação — não o use para remover
uma página dos resultados.
Ferramentas para visualizar e gerenciar o crawling
- Google Search Console — relatório de estatísticas de crawling — a própria visão do Google sobre como ele rastreia seu site: solicitações ao longo do tempo, códigos de resposta, tempo médio de resposta, por tipo de arquivo e tipo de Googlebot.
- Bing Webmaster Tools — informações de crawling, Crawl Control e Site Scan.
- Análise de arquivos de log do servidor — a fonte verdadeira. Ferramentas: Screaming Frog Log File Analyser ou envie os logs para o BigQuery / uma plataforma de logs. (Veja análise de arquivos de log.)
- Crawlers / auditorias de sites — Ahrefs Site Audit e Screaming Frog SEO Spider simulam um crawling, revelam profundidade, cadeias de redirecionamento, URLs bloqueadas e padrões semelhantes a armadilhas.
- Ahrefs Webmaster Tools — crawling + auditoria gratuitos para sites que você verificar.
- Inspeção de URL (GSC) — confira como uma única URL foi rastreada, renderizada e indexada.
Recursos que valem seu tempo
Meus textos relacionados
- Guia para iniciantes de SEO técnico — onde o crawling se encaixa no quadro maior.
- A história de bloquear duas páginas de alto ranking com Robots.txt — meu experimento de primeira parte sobre crawling versus ranking.
- Indexada mesmo bloqueada por robots.txt — por que páginas bloqueadas ainda são indexadas.
- Robots.txt e SEO: tudo o que você precisa saber.
- Problemas e boas práticas de JavaScript SEO — o lado da renderização.
- Conheça os novos crawlers da web: bots de IA estão se aproximando dos bots de mecanismos de busca.
Minhas palestras
- How Search Works (SlideShare) — minha explicação de crawling, renderização, indexação e ranking. (Aplica-se meu aviso permanente: “This is my understanding of systems… not going to be 100% complete or accurate.”)
De outras fontes
- r/TechSEO — a comunidade para depuração de crawl/index.
- Série Crawling December do Google (oficial, mas o melhor conjunto concentrado de explicações sobre crawling).
- Google explica o crawl budget para webmasters (Search Engine Land) — reprodução literal da publicação original de Gary Illyes sobre crawl budget, com as definições de limite de crawl rate + crawl demand.
- Crawl budget do Googlebot explicado (Search Engine Journal) — explicação em linguagem simples do modelo de capacidade e demanda de rastreamento.
- Google explica os limites de bytes do Googlebot e a arquitetura de crawling (Search Engine Journal) — cobertura da atualização de março de 2026 “Inside Googlebot”; 2 MB por URL, PDFs de 64 MB e comportamento de truncamento.
- Como o Bingbot funciona: descobrindo, rastreando, extraindo e indexando (Search Engine Journal) — o lado do Bing no pipeline de crawling, com contexto de Fabrice Canel.
- Limite de tamanho de arquivo do Googlebot (DebugBear) — explica o que acontece quando uma página excede o limite de busca do Googlebot (truncamento, não rejeição).
Podcasts de crawling
- Search Off the Record (Google Search Relations) — Como o Googlebot rastreia a web. Gary Illyes e Martin Splitt sobre o passado, o presente e o futuro do Googlebot: infraestrutura de crawling unificada, HTTP/1.1 versus HTTP/2, solicitações condicionais e limites de bytes. Ouça
Vídeos
- Google Search Central (YouTube) — a série How Google Search Works e os explicadores de crawling/renderização de Martin Splitt, incluindo os vídeos de JavaScript SEO. Canal
Estatísticas que vale citar
- Bots de IA estão se aproximando dos bots de busca. Da minha análise do Cloudflare Radar, os crawlers de mecanismos de busca ainda rastreiam mais, mas os bots de IA são um segundo lugar claro e estão a caminho de ultrapassá-los em alguns anos. Fonte
- Dezenas de bilhões de URLs normalizadas nunca vistas antes são descobertas pelo Bing todos os dias — a escala do problema de descoberta que os mecanismos filtram agressivamente (Fabrice Canel, Microsoft Bing, 2022). Cobertura
- Quais crawlers mais bloqueiam em ~140 milhões de sites — dados de taxa de bloqueio no robots.txt do meu estudo com Xibeijia Guan; úteis para entender como a web aberta controla os bots. Fonte
- Limite de bytes: ~2 MB por URL (PDFs de 64 MB) — limite documentado de busca do Googlebot em março de 2026 (abaixo dos 15 MB). Fonte
Teste seus conhecimentos: Crawling
Cinco perguntas rápidas sobre como os mecanismos de busca descobrem e buscam páginas. Escolha uma resposta para cada uma e depois confira.
Registro de alterações
Atualizado em 17 de jul. de 2026.
Resumo editorial e detalhes registrados da alteração.Detalhes da alteração
-
As notas detalhadas sobre as alterações estão disponíveis atualmente em inglês.
-
As notas detalhadas sobre as alterações estão disponíveis atualmente em inglês.
-
As notas detalhadas sobre as alterações estão disponíveis atualmente em inglês.
Não é possível fazer a comparação completa — nenhum instantâneo anterior foi arquivado para esta revisão.