Crawlers de IA: tipos, bots e controle

Os três tipos de crawler de IA — bots de treinamento, indexadores de pesquisa com IA e buscadores acionados pelo usuário —, os principais nomes e como controlar cada um sem prejudicar o SEO.

Publicado pela primeira vez: 24 de jun. de 2026 · Última atualização: 9 de ago. de 2026 · Avançado
Idiomas
2 sinais de evidência nesta página

Crawlers de IA vêm em três tipos, e misturá-los é o erro mais comum: bots de treinamento e melhoria de modelos como GPTBot, ClaudeBot e CCBot; indexadores de pesquisa com IA como OAI-SearchBot, PerplexityBot e Applebot; e buscadores acionados pelo usuário como ChatGPT-User, Perplexity-User e Claude-User. Cada categoria tem controles independentes no robots.txt: bloquear treinamento não afeta classificações do Google, mas bloquear pesquisa com IA reduz a visibilidade nas respostas. A política depende da finalidade, da verificação de identidade e da prontidão real de extração, renderização, operação e comércio.

A OpenAI afirma que as configurações de GPTBot, OAI-SearchBot e ChatGPT-User são independentes. Evidence for this claim OpenAI publishes separate controls for GPTBot, OAI-SearchBot, and ChatGPT-User, and says each setting is independent. Scope: OpenAI-declared crawlers and user agents; their purposes and robots behavior are platform-specific. Confidence: high · Verified: OpenAI: Crawlers A Anthropic identifica separadamente ClaudeBot, Claude-SearchBot e Claude-User e documenta o tratamento do robots.txt. Evidence for this claim Anthropic documents ClaudeBot, Claude-SearchBot, and Claude-User separately and says its bots honor robots.txt directives. Scope: Anthropic-declared bots; user-initiated retrieval has additional product-specific conditions. Confidence: high · Verified: Anthropic: Bot information

TL;DR — Os crawlers de IA se dividem em três categorias, e misturá-las é o erro que quase todo mundo comete. Bots de treinamento (GPTBot, ClaudeBot, CCBot, Bytespider, Amazonbot, Meta-ExternalAgent) raspam para criar corpora de modelos. Bots de pesquisa com IA (OAI-SearchBot, PerplexityBot, Applebot, Amzn-SearchBot) criam um índice de citações. Buscadores acionados pelo usuário (ChatGPT-User, Perplexity-User, Claude-User) capturam uma página ao vivo quando uma pessoa pergunta. Cada um tem seu próprio user agent e sua própria regra no robots.txt, então bloquear GPTBot não afeta OAI-SearchBot. Google-Extended e Applebot-Extended são tokens, não bots — não rastreiam; apenas fazem você optar por não participar de treinamento/fundamentação. Bloquear bots de treinamento não tem efeito nas classificações do Google (o Google diz isso, e os dados empíricos concordam); bloquear bots de pesquisa com IA reduz sua visibilidade nas respostas de IA. O debate sobre robots.txt é real para buscadores de usuário (os operadores dizem que “pode não se aplicar”) e para a Perplexity (há relatos de rastreamento furtivo). llms.txt é uma proposta, em grande parte não lida e não adotada pelos principais provedores.

As três categorias — a espinha dorsal de todo este tema

Classify the purpose before writing the rule: training, AI-search visibility, and live user fetching are separate decisions. Fonte: /technical-seo/how-search-works/crawling/crawler/ai-crawlers/

Training crawlers such as GPTBot, ClaudeBot, and CCBot collect data for model corpora. AI-search crawlers such as OAI-SearchBot and PerplexityBot build indexes used for answers and citations. User-triggered agents such as ChatGPT-User and Claude-User fetch a page for a live request. Blocking one category does not automatically block the others.

© Patrick Stox LLC · CC BY 4.0 ·

Todo bot de IA nomeado pertence a um dos três grupos. Acerte o grupo e todas as decisões posteriores (bloqueá-lo? permiti-lo? o que acontece com meu SEO?) se resolvem a partir daí.

1. Crawlers de treinamento/coleta de dados. Eles rastreiam em escala para criar corpora de treinamento e ajuste fino de LLMs. São os bots que a maioria dos editores quer bloquear, e desativá-los não tem efeito nas classificações de pesquisa. Membros: GPTBot (OpenAI), ClaudeBot (Anthropic), CCBot (Common Crawl), Bytespider (ByteDance), Amazonbot (Amazon), Meta-ExternalAgent (Meta), AI2Bot (Allen Institute), cohere-training-data-crawler (Cohere), Diffbot, Timpibot (Timpi), webzio-extended (Webz.io). Além deles, há dois tokens de controle que NÃO são crawlers separados — Google-Extended e Applebot-Extended — tratados abaixo.

2. Crawlers de pesquisa com IA/indexação. Eles criam um índice ao vivo usado para responder consultas com citações e links de volta para você. Bloqueá-los pode remover você dos resultados de pesquisa com IA. Membros: OAI-SearchBot (OpenAI — distinto do GPTBot), PerplexityBot (Perplexity), Applebot (Apple — alimenta sugestões do Spotlight/Siri/Safari), Amzn-SearchBot (Amazon).

3. Buscadores acionados pelo usuário/sob demanda. Eles buscam uma página específica ao vivo porque um usuário fez uma pergunta, não porque um bot está percorrendo a web. Os operadores normalmente afirmam que o robots.txt não vincula uma busca iniciada pelo usuário — território contestado. Membros: ChatGPT-User (OpenAI), Perplexity-User (Perplexity), Claude-User e Claude-SearchBot (Anthropic), Amzn-User (Amazon, para Alexa), Meta-ExternalFetcher (Meta).

A tabela completa com tokens de user agent e conformidade com robots.txt está na aba Cheat Sheets — essa tabela é o centro deste artigo.

A armadilha “token, não bot” (Google-Extended e Applebot-Extended)

Este é o fato mais incompreendido do tema, então serei preciso. Google-Extended e Applebot-Extended não rastreiam nada. Eles não têm user agent independente e não geram tráfego de rastreamento. São tokens de controle do robots.txt que mudam o que rastreamentos existentes podem fazer com seu conteúdo.

  • Google-Extended controla o uso para melhorar os aplicativos Gemini e os modelos generativos do Vertex AI, inclusive a fundamentação fora da Pesquisa Google. Ele não controla as AI Overviews ou o AI Mode da Pesquisa Google; eles usam o acesso do Googlebot. O Google é explícito: “Google-Extended does not impact a site’s inclusion in Google Search nor is it used as a ranking signal in Google Search.” (tradução) «Google-Extended não afeta a inclusão de um site na Pesquisa Google nem é usado como sinal de classificação na Pesquisa Google.» Desativá-lo não faz nada contra o Googlebot nem contra suas classificações.
  • Applebot-Extended é a mesma ideia para a Apple. A Apple afirma: “Applebot-Extended does not crawl webpages. Webpages that disallow Applebot-Extended can still be included in search results.” (tradução) «Applebot-Extended não rastreia páginas da web. Páginas que impedem Applebot-Extended ainda podem ser incluídas nos resultados de pesquisa.» Ele faz você deixar de participar do treinamento dos modelos fundamentais da Apple (Apple Intelligence) — suas páginas continuam aparecendo no Spotlight/Siri por meio do crawler real, Applebot.

Assim, Disallow: Google-Extended e Disallow: Applebot-Extended são controles de uso do produto, não bloqueios de rastreamento independentes. Os escopos publicados não removem páginas do índice de pesquisa correspondente, mas não são intercambiáveis e não devem ser reduzidos ambos a “bot de treinamento”.

Os grandes operadores, bot a bot

A OpenAI opera quatro bots declarados, cada um independente: GPTBot (treinamento — “used to make our generative AI foundation models more useful and safe” (tradução) «usado para tornar nossos modelos fundamentais de IA generativa mais úteis e seguros»), OAI-SearchBot (pesquisa — “used to surface websites in search results in ChatGPT’s search features” (tradução) «usado para exibir sites nos resultados de pesquisa dos recursos de pesquisa do ChatGPT»), ChatGPT-User (buscador do usuário — “used for certain user actions in ChatGPT” (tradução) «usado para determinadas ações do usuário no ChatGPT») e OAI-AdsBot (um escopo independente de anúncios, não de treinamento nem do crawler de índice de pesquisa). A linha de política da OpenAI é o modelo para todo o setor: “Each bot setting is independent, allowing webmasters granular control over how their content interacts with different OpenAI systems.” (tradução) «Cada configuração de bot é independente, permitindo que webmasters controlem granularmente como seu conteúdo interage com diferentes sistemas da OpenAI.» Desativar GPTBot “signals that future data from these materials should be excluded from model training datasets” (tradução) «sinaliza que dados futuros desses materiais devem ser excluídos dos conjuntos de dados de treinamento do modelo»; desativar OAI-SearchBot significa que seu site “won’t appear in ChatGPT search results” (tradução) «não aparecerá nos resultados de pesquisa do ChatGPT».

A Anthropic opera três: ClaudeBot (treinamento), Claude-SearchBot (indexação de pesquisa) e Claude-User (busca do usuário). A Anthropic afirma que seus bots “respect ‘do not crawl’ signals by honoring industry standard directives in robots.txt” (tradução) «respeitam os sinais de “não rastrear” ao obedecer às diretivas padrão do setor no robots.txt». Sua página de suporte atual também aponta para uma lista de IPs publicada compartilhada para verificação específica da Anthropic. Essa lista específica do provedor é evidência de identidade, não uma regra universal de IP ou DNS reverso para todo bot.

O Google — o fato principal é o mencionado acima: Google-Extended é um token, não um bot. O Google também opera Google-CloudVertexBot (rastreia para Agentes do Vertex AI solicitados pelo proprietário do site; não afeta a classificação) e agentes acionados pelo usuário como Gemini-Deep-Research e Google-NotebookLM.

A Apple opera Applebot (o crawler real que alimenta sugestões do Spotlight/Siri/Safari e que “may also be used to help train Apple foundation models” (tradução) «também pode ser usado para ajudar a treinar os modelos fundamentais da Apple») e o token Applebot-Extended. Bloquear Applebot remove você da pesquisa da Apple; bloquear Applebot-Extended apenas faz você deixar de participar do treinamento.

A Perplexity declara dois bots: PerplexityBot (pesquisa/citações — explicitamente “not used to crawl content for AI foundation models” (tradução) «não usado para rastrear conteúdo de modelos fundamentais de IA», portanto a Perplexity não tem crawler de treinamento declarado) e Perplexity-User (busca do usuário). A documentação afirma que Perplexity-User “generally ignores robots.txt rules” (tradução) «geralmente ignora as regras do robots.txt» porque a busca é iniciada pelo usuário. A Perplexity também é objeto de relatos de rastreamento furtivo — veja a controvérsia abaixo.

A Amazon opera três, e esta é uma exceção útil: Amazonbot (melhora produtos e “may be used to train Amazon AI models” (tradução) «pode ser usado para treinar modelos de IA da Amazon»), Amzn-SearchBot (pesquisa) e Amzn-User (buscas do usuário pela Alexa). Segundo a documentação da Amazon, Amzn-SearchBot e Amzn-User explicitamente NÃO rastreiam para treinamento de modelos generativos de IA — portanto, “todas as empresas de IA raspam para treinamento” é um mito. A Amazon também reconhece uma tag meta noarchive com significado especial: não use a página para treinamento de modelos — uma rara opção de não participação por página.

O tratamento de robots.txt da Amazon tem duas particularidades operacionais: seus crawlers podem usar uma cópia do robots.txt armazenada em cache nos 30 dias anteriores, e a Amazon afirma que, se o arquivo não puder ser obtido, seus crawlers se comportam como se ele não existisse. Isso não significa que uma busca de auditoria que falhou prove que a Amazon viu um estado de permitir tudo; a auditoria e a Amazon podem estar chegando ao host em momentos diferentes ou por caminhos de rede diferentes. Evidence for this claim Amazon says its crawlers may use a robots.txt copy cached within the previous 30 days. Scope: Amazon crawler behavior only; a current audit fetch cannot identify which cached copy Amazon used. Confidence: high · Verified: Amazon: Amazonbot Evidence for this claim Amazon says its crawlers behave as if robots.txt does not exist when they cannot fetch it. Scope: Amazon crawler behavior only; a tool-side fetch failure is not proof that Amazon observed the same failure. Confidence: high · Verified: Amazon: Amazonbot

A Meta opera Meta-ExternalAgent (treinamento/indexação para Llama e Meta AI), Meta-ExternalFetcher (busca do usuário) e, separadamente, Facebookbot (pré-visualizações de links — não é um crawler de IA). Bloquear Meta-ExternalAgent não afeta as prévias de links do Facebook.

O Common Crawl (CCBot) é operado por uma fundação sem fins lucrativos que mantém um arquivo aberto da web. É a camada oculta: o conjunto de dados Common Crawl foi usado para treinar ChatGPT, Claude, LLaMA e muitos outros — portanto, bloquear CCBot tem efeitos posteriores em modelos que nunca rastreiam você diretamente. O Common Crawl também alerta que impostores falsificam a identidade de CCBot.

ByteDance (Bytespider) é o mais agressivo: declarado como obediente ao robots.txt, mas amplamente relatado como infrator, com volumes de solicitações muito altos. Outros que vale conhecer: AI2Bot (Allen Institute, modelos abertos/conjunto de dados Dolma), Cohere, Diffbot (extração de dados estruturados cuja saída alimenta muitos pipelines de IA) e Timpibot/webzio-extended.

Os bots de IA realmente obedecem ao robots.txt?

Para crawlers de treinamento e pesquisa, os grandes operadores (OpenAI, Anthropic, Google, Apple e Amazon) afirmam em sua documentação que respeitam o robots.txt. A zona contestada são os buscadores acionados pelo usuário, em que vários operadores dizem explicitamente que o robots.txt pode não se aplicar porque uma pessoa iniciou a solicitação — a OpenAI afirma que “these actions are initiated by a user, robots.txt rules may not apply” (tradução) «essas ações são iniciadas por um usuário; as regras de robots.txt podem não se aplicar»; a Perplexity diz que Perplexity-User “generally ignores robots.txt rules” (tradução) «geralmente ignora as regras do robots.txt». Essa é uma política declarada, não uma violação.

A controvérsia da Perplexity é a principal disputa, e vou marcá-la como relatada, não resolvida. Em junho de 2024, a Wired e o desenvolvedor Robb Knight relataram que a Perplexity acessou conteúdo de sites que a haviam bloqueado, aparentemente usando IPs não listados. Em agosto de 2025, a Cloudflare informou que a Perplexity usou um user agent furtivo que se passava pelo Chrome no macOS, alternou IPs e ASNs para contornar bloqueios e buscou conteúdo de domínios de teste recém-criados que traziam um Disallow: / completo — e depois a Cloudflare removeu a Perplexity da lista de bots verificados. Apresente isso como relato documentado dessas fontes; a própria documentação da Perplexity sustenta que PerplexityBot respeita o robots.txt.

Como alguns bots ignoram o robots.txt em algum nível, a Cloudflare se tornou a camada prática de aplicação — bloqueio em nível de rede, um botão de “AI Scrapers and Crawlers”, robots.txt gerenciado, acompanhamento de violações do robots.txt e um beta de pagamento por rastreamento. Em julho de 2025, novos domínios da Cloudflare passaram a bloquear crawlers de IA conhecidos por padrão.

Como controlar crawlers de IA

  • robots.txt por user agent é a alavanca principal e é granular: bloquear GPTBot não bloqueia OAI-SearchBot nem ChatGPT-User. As receitas de robots.txt (bloquear todos os bots de treinamento, bloquear bots de pesquisa com IA) estão na aba Scripts.
  • Os tokens de treinamentoGoogle-Extended e Applebot-Extended — fazem você deixar de participar do treinamento do Gemini/Apple sem custo de pesquisa.
  • A tag meta noarchive da Amazon é uma opção de não participação no treinamento da Amazon por página.
  • Cloudflare AI Crawl Control — bloquear/permitir/cobrar no nível de rede, além de robots.txt gerenciado e diretivas Content Signals (search, ai-input, ai-train); o padrão é search=yes, ai-train=no.
  • llms.txt é uma proposta (Jeremy Howard/Answer.AI, setembro de 2024), não um padrão adotado — e não é respeitado pelos principais crawlers. É um mapa em Markdown selecionado para ser lido no momento da inferência, mas um estudo do Ahrefs com 137 000 sites constatou que 97 % dos arquivos llms.txt publicados recebem zero solicitações, e nenhum grande provedor de LLM o adotou formalmente. Trate-o como ferramenta de documentação, não de pesquisa com IA.
  • O projeto comunitário ai.robots.txt mantém um arquivo abrangente de Disallow: / com mais de 150 user agents de bots de IA — uma referência útil para bloqueio abrangente.

Uma política de crawler orientada à visibilidade

Para um site público educacional ou comercial que quer visibilidade em pesquisa com IA, minha política padrão é:

  1. Permita crawlers de pesquisa convencionais que alimentam as superfícies de pesquisa desejadas, incluindo Googlebot e Bingbot.
  2. Permita crawlers documentados de pesquisa/indexação com IA como OAI-SearchBot, Claude-SearchBot e PerplexityBot no conteúdo público.
  3. Permita buscadores direcionados pelo usuário como ChatGPT-User, Claude-User e Perplexity-User, reconhecendo que o comportamento dos provedores em relação ao robots.txt varia. Evidence for this claim OpenAI publishes separate controls for GPTBot, OAI-SearchBot, and ChatGPT-User, and says each setting is independent. Scope: OpenAI-declared crawlers and user agents; their purposes and robots behavior are platform-specific. Confidence: high · Verified: OpenAI: Crawlers Evidence for this claim Anthropic documents ClaudeBot, Claude-SearchBot, and Claude-User separately and says its bots honor robots.txt directives. Scope: Anthropic-declared bots; user-initiated retrieval has additional product-specific conditions. Confidence: high · Verified: Anthropic: Bot information Evidence for this claim Perplexity documents PerplexityBot for search indexing separately from Perplexity-User for user-requested fetches, with different robots behavior. Scope: Perplexity-declared crawlers and published IP ranges; a user-agent string alone does not verify identity. Confidence: high · Verified: Perplexity: Crawlers
  4. Tome uma decisão de direitos separada para acesso de treinamento/desenvolvimento de modelos. GPTBot, ClaudeBot, Google-Extended e outros controles de treinamento não precisam compartilhar a política de pesquisa. Permita-os somente se esse uso corresponder à sua política editorial.
  5. Proteja rotas privadas e operacionais com autenticação. Mantenha /admin/, prévias, dados de conta e APIs não públicas atrás de autorização no servidor; um Disallow é apenas uma preferência do crawler.
  6. Verifique a identidade antes de ignorar controles do WAF. Combine o user agent documentado com faixas de IP atuais do provedor, verificação de DNS reverso ou autenticação de bot compatível. Nunca crie uma regra ampla de permissão no WAF a partir de um user agent falsificável sozinho.

Não adicione um grupo de user agent específico apenas para dizer Allow: / se não repetir todas as restrições que ainda devem se aplicar a esse crawler. Pelas regras de correspondência do robots, um grupo específico pode substituir o grupo curinga em vez de herdar suas exclusões de caminhos privados na interpretação de robots específica do provedor. O arquivo seguro mais simples costuma ser um único grupo curinga independentemente seguro, com exclusões de treinamento delimitadas.

Para este site especificamente, a política pública atual é uma postura explícita de permissão para pesquisa, entrada de IA e treinamento de IA, excluindo rotas de administração, prévia, API, armadilha e gateway. Eu manteria permitidas a pesquisa e a recuperação direcionada pelo usuário. Só mudaria ai-train=yes como decisão de direitos editoriais — não como tática de visibilidade em IA — porque o acesso para treinamento não tem benefício demonstrado para citações.

Acesso de crawler de IA não é prontidão para IA

Uma regra de permissão prova, no máximo, que a política declarada de robots permite que um agente nomeado solicite uma URL. Ela não prova que o operador obedeceu à política, buscou a página, a renderizou, extraiu as informações importantes, colocou-as no contexto do modelo, citou a página ou concluiu uma ação.

Mantenha cinco camadas separadas:

CamadaPerguntaEvidência
PermissãoEste agente nomeado pode solicitar a URL segundo a política declarada?Teste efetivo de robots e acesso de rede
ExtraibilidadeO conteúdo importante está presente em texto, links, metadados ou dados estruturados estáveis?Captura bruta e renderizada com extração de campos
RenderizaçãoO conteúdo sobrevive à capacidade real de navegador/JavaScript do agente?Evidência de busca específica do provedor quando disponível; caso contrário, uma limitação de teste declarada
OperabilidadeUm agente consegue identificar e invocar com segurança a ação pretendida?Contrato documentado da ferramenta/interface e teste controlado de ponta a ponta
Prontidão comercialIdentidade, preço, disponibilidade, política, atendimento, carrinho e checkout estão de acordo?Reconciliação de feed/página/backend/pedido

Um verificador de acesso de crawler deve, portanto, informar permitido, bloqueado ou indeterminado para a política — não “pronto para IA”. Uma solicitação de log bem-sucedida prova que aquela solicitação ocorreu; não é evidência de que a página foi usada em uma resposta. Uma declaração válida de feed ou ferramenta tampouco prova que uma página pública é renderizada corretamente ou que o checkout pode atender à oferta representada.

Use How AI Search Works para as camadas de recuperação e citação e AI Shopping Optimization para prontidão de catálogo e transação. Manter as camadas separadas torna o remédio específico: corrija a política de acesso para um bloqueio, a saída da página para extraibilidade, a renderização para um estado ausente, o contrato de interface para operabilidade ou os dados comerciais para uma compra que falhou.

Para páginas de comércio eletrônico, o teste de extraibilidade deve verificar que a identidade central do produto e a oferta selecionada — SKU, ID do grupo, preço, moeda e disponibilidade — existem na resposta inicial e continuam de acordo após a renderização. O padrão de página de produto bruta versus renderizada define o que deve estar visível no servidor; a permissão do crawler, sozinha, não diz nada sobre esse contrato.

O mito que custa tráfego: treinamento ≠ pesquisa com IA

Este é o ponto que você precisa acertar. Bloquear bots de treinamento não é o mesmo que bloquear bots de pesquisa com IA. São regras separadas de robots.txt, com consequências opostas:

  • Bloquear bots de treinamento (GPTBot, ClaudeBot, CCBot, Bytespider, além dos tokens Google-Extended/Applebot-Extended) → nenhum efeito nas classificações do Google, confirmado pelo Google e por dados empíricos de editores. Você está simplesmente deixando de participar do treinamento de modelos.
  • Bloquear bots de pesquisa com IA (OAI-SearchBot, PerplexityBot) → você perde visibilidade nas respostas do ChatGPT e da Perplexity. É uma troca real, não uma vantagem sem custo.

Se você bloquear de forma ampla demais — por exemplo, um bloqueio geral que capture OAI-SearchBot quando sua intenção era apenas parar o treinamento — pode remover silenciosamente sua presença da pesquisa com IA. Seja preciso sobre qual categoria cada regra atinge.

Por que os editores bloqueiam: o contrato social

O motivo de esse debate existir se resume a tráfego. Como escrevi na minha análise de bots de IA, “there’s a cost to bots crawling your websites and there’s a social contract between search engines and website owners, where search engines add value by sending referral traffic to websites. Google sends traffic (for now), so they don’t get blocked.” (tradução) «Bots consomem recursos ao rastrear sites, e existe um contrato social: mecanismos de busca devolvem valor ao enviar visitas. O Google ainda envia tráfego e, por enquanto, evita ser bloqueado.» Até agora, os crawlers de IA em sua maioria não devolvem tráfego — e os dados sustentam esse desconforto. Na minha análise do Cloudflare Radar, os bots de IA já são firmemente o segundo maior crawler, atrás dos mecanismos de pesquisa, e estão a caminho de ultrapassá-los. Veja mais na aba Stats.

Divulgação: fui funcionário da Ahrefs e recebo acesso complementar à Ahrefs. A análise de crawlers vinculada é um trabalho meu publicado durante essa função; a Ahrefs não revisa nem aprova as conclusões editoriais atuais deste site.

Para o pipeline mais amplo em que isso se encaixa — descoberta, agendamento do rastreamento, renderização e como rastreamento difere de indexação — veja o hub de rastreamento e os temas irmãos sobre crawler em geral, user agent, Googlebot, Bingbot e robots.txt.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.