Crawlers de IA: tipos, bots e controle
Os três tipos de crawler de IA — bots de treinamento, indexadores de pesquisa com IA e buscadores acionados pelo usuário —, os principais nomes e como controlar cada um sem prejudicar o SEO.
Idiomas
2 sinais de evidência nesta página
- Dados de origem vinculadoslista de IPs publicada
- Ferramenta relacionada ativaLog File Analyzer
Crawlers de IA vêm em três tipos, e misturá-los é o erro mais comum: bots de treinamento e melhoria de modelos como GPTBot, ClaudeBot e CCBot; indexadores de pesquisa com IA como OAI-SearchBot, PerplexityBot e Applebot; e buscadores acionados pelo usuário como ChatGPT-User, Perplexity-User e Claude-User. Cada categoria tem controles independentes no robots.txt: bloquear treinamento não afeta classificações do Google, mas bloquear pesquisa com IA reduz a visibilidade nas respostas. A política depende da finalidade, da verificação de identidade e da prontidão real de extração, renderização, operação e comércio.
A OpenAI publica controles separados para seus bots de treinamento, pesquisa e ações do usuário. Evidence for this claim OpenAI publishes separate controls for GPTBot, OAI-SearchBot, and ChatGPT-User, and says each setting is independent. Scope: OpenAI-declared crawlers and user agents; their purposes and robots behavior are platform-specific. Confidence: high · Verified: OpenAI: Crawlers A Anthropic também documenta agentes distintos de treinamento, pesquisa e solicitações do usuário. Evidence for this claim Anthropic documents ClaudeBot, Claude-SearchBot, and Claude-User separately and says its bots honor robots.txt directives. Scope: Anthropic-declared bots; user-initiated retrieval has additional product-specific conditions. Confidence: high · Verified: Anthropic: Bot information
Evidence for this claim Cloudflare Radar reports worldwide Cloudflare-observed HTTP request trends for the five most active AI bots during the 28 days ending 2026-07-30. Scope: A dated Cloudflare Radar context chart; it is not site-specific traffic and is not a census of all web requests. Confidence: high · Verified: Cloudflare Radar: HTTP traffic by AI botThe chart compares request trends for the five most active AI bots observed by Cloudflare during the selected four-week period, including Googlebot, ClaudeBot, Meta-ExternalAgent, GPTBot, and Bingbot.
TL;DR — “Crawlers de IA” não são uma coisa só — são três. Alguns bots raspam seu site para treinar modelos de IA (como GPTBot e ClaudeBot). Outros criam um índice para que a pesquisa com IA possa citar você (como OAI-SearchBot e PerplexityBot). E alguns buscam uma página ao vivo porque alguém acabou de fazer uma pergunta (como ChatGPT-User). Cada um tem seu próprio nome no seu
robots.txt, então você pode permiti-los ou bloqueá-los separadamente. Bloquear bots de treinamento não prejudica suas classificações no Google — bloquear bots de pesquisa com IA pode esconder você das respostas de IA. “don’t use my content to train your AI.” (tradução) «não use meu conteúdo para treinar sua IA».
O que são crawlers de IA
Você já conhece os crawlers de pesquisa — um crawler como Googlebot ou Bingbot visita suas páginas para que elas possam aparecer na pesquisa. Crawlers de IA são o grupo mais novo: bots operados por empresas de IA (OpenAI, Anthropic, Google, Apple, Perplexity e outras) que buscam suas páginas para suas próprias finalidades.
O ponto principal a entender antes de bloquear qualquer coisa: eles não fazem todos o mesmo trabalho. Existem três tipos.
- Bots de treinamento leem suas páginas para ajudar a criar e melhorar modelos de IA. GPTBot (OpenAI) e ClaudeBot (Anthropic) são os mais conhecidos.
- Bots de pesquisa com IA leem suas páginas para criar um índice pesquisável, para que, quando alguém faça uma pergunta ao ChatGPT ou à Perplexity, o sistema possa responder e criar um link para você. OAI-SearchBot e PerplexityBot fazem isso.
- Buscadores acionados pelo usuário capturam uma página específica em tempo real porque uma pessoa fez uma pergunta. ChatGPT-User é um exemplo — ele não percorre a web por conta própria; está cumprindo uma tarefa para um usuário.
Por que a diferença importa
Cada bot tem seu próprio nome (seu user agent), e seu arquivo robots.txt pode permitir ou bloquear cada um pelo nome. Assim, você decide separadamente:
- Eu me importo que empresas de IA treinem com meu conteúdo? → esses são os bots de treinamento.
- Quero aparecer nas respostas do ChatGPT e da Perplexity? → esses são os bots de pesquisa com IA. A maioria das pessoas quer mantê-los.
Este é o grande mito a eliminar: bloquear bots de IA não prejudica suas classificações no Google. O Google afirmou isso diretamente, e editores que bloqueiam bots de treinamento de IA continuam se classificando bem. Mas, se você bloquear os bots de pesquisa com IA, pode desaparecer das respostas de IA — portanto, não bloqueie a categoria errada por acidente.
Os nomes que você verá nos logs
- GPTBot — OpenAI, treinamento.
- OAI-SearchBot — OpenAI, o bot que alimenta a pesquisa do ChatGPT.
- ChatGPT-User — OpenAI, busca ao vivo quando um usuário pergunta.
- ClaudeBot — Anthropic, treinamento.
- PerplexityBot — Perplexity, pesquisa/citações.
- CCBot — Common Crawl, uma organização sem fins lucrativos cujos dados treinam muitos modelos de IA.
- Bytespider — ByteDance (controladora do TikTok), treinamento.
- Applebot — Apple, alimenta Siri/Spotlight e Apple Intelligence.
Você verá mais dois — Google-Extended e Applebot-Extended — que não são crawlers reais. São apenas interruptores no robots.txt que dizem “não use meu conteúdo para treinar sua IA”. Eles não buscam nada.
Quer a tabela completa bot a bot, as receitas de robots.txt, o debate sobre “eles realmente obedecem ao robots.txt?” e saber se deve bloqueá-los? Mude para a aba Advanced.
A OpenAI afirma que as configurações de GPTBot, OAI-SearchBot e ChatGPT-User são independentes. Evidence for this claim OpenAI publishes separate controls for GPTBot, OAI-SearchBot, and ChatGPT-User, and says each setting is independent. Scope: OpenAI-declared crawlers and user agents; their purposes and robots behavior are platform-specific. Confidence: high · Verified: OpenAI: Crawlers A Anthropic identifica separadamente ClaudeBot, Claude-SearchBot e Claude-User e documenta o tratamento do robots.txt. Evidence for this claim Anthropic documents ClaudeBot, Claude-SearchBot, and Claude-User separately and says its bots honor robots.txt directives. Scope: Anthropic-declared bots; user-initiated retrieval has additional product-specific conditions. Confidence: high · Verified: Anthropic: Bot information
TL;DR — Os crawlers de IA se dividem em três categorias, e misturá-las é o erro que quase todo mundo comete. Bots de treinamento (GPTBot, ClaudeBot, CCBot, Bytespider, Amazonbot, Meta-ExternalAgent) raspam para criar corpora de modelos. Bots de pesquisa com IA (OAI-SearchBot, PerplexityBot, Applebot, Amzn-SearchBot) criam um índice de citações. Buscadores acionados pelo usuário (ChatGPT-User, Perplexity-User, Claude-User) capturam uma página ao vivo quando uma pessoa pergunta. Cada um tem seu próprio user agent e sua própria regra no
robots.txt, então bloquear GPTBot não afeta OAI-SearchBot. Google-Extended e Applebot-Extended são tokens, não bots — não rastreiam; apenas fazem você optar por não participar de treinamento/fundamentação. Bloquear bots de treinamento não tem efeito nas classificações do Google (o Google diz isso, e os dados empíricos concordam); bloquear bots de pesquisa com IA reduz sua visibilidade nas respostas de IA. O debate sobrerobots.txté real para buscadores de usuário (os operadores dizem que “pode não se aplicar”) e para a Perplexity (há relatos de rastreamento furtivo). llms.txt é uma proposta, em grande parte não lida e não adotada pelos principais provedores.
As três categorias — a espinha dorsal de todo este tema
Training crawlers such as GPTBot, ClaudeBot, and CCBot collect data for model corpora. AI-search crawlers such as OAI-SearchBot and PerplexityBot build indexes used for answers and citations. User-triggered agents such as ChatGPT-User and Claude-User fetch a page for a live request. Blocking one category does not automatically block the others.
© Patrick Stox LLC · CC BY 4.0 ·
Todo bot de IA nomeado pertence a um dos três grupos. Acerte o grupo e todas as decisões posteriores (bloqueá-lo? permiti-lo? o que acontece com meu SEO?) se resolvem a partir daí.
1. Crawlers de treinamento/coleta de dados. Eles rastreiam em escala para criar corpora de treinamento e ajuste fino de LLMs. São os bots que a maioria dos editores quer bloquear, e desativá-los não tem efeito nas classificações de pesquisa. Membros: GPTBot (OpenAI), ClaudeBot (Anthropic), CCBot (Common Crawl), Bytespider (ByteDance), Amazonbot (Amazon), Meta-ExternalAgent (Meta), AI2Bot (Allen Institute), cohere-training-data-crawler (Cohere), Diffbot, Timpibot (Timpi), webzio-extended (Webz.io). Além deles, há dois tokens de controle que NÃO são crawlers separados — Google-Extended e Applebot-Extended — tratados abaixo.
2. Crawlers de pesquisa com IA/indexação. Eles criam um índice ao vivo usado para responder consultas com citações e links de volta para você. Bloqueá-los pode remover você dos resultados de pesquisa com IA. Membros: OAI-SearchBot (OpenAI — distinto do GPTBot), PerplexityBot (Perplexity), Applebot (Apple — alimenta sugestões do Spotlight/Siri/Safari), Amzn-SearchBot (Amazon).
3. Buscadores acionados pelo usuário/sob demanda. Eles buscam uma página específica ao vivo porque um usuário fez uma pergunta, não porque um bot está percorrendo a web. Os operadores normalmente afirmam que o robots.txt não vincula uma busca iniciada pelo usuário — território contestado. Membros: ChatGPT-User (OpenAI), Perplexity-User (Perplexity), Claude-User e Claude-SearchBot (Anthropic), Amzn-User (Amazon, para Alexa), Meta-ExternalFetcher (Meta).
A tabela completa com tokens de user agent e conformidade com robots.txt está na aba Cheat Sheets — essa tabela é o centro deste artigo.
A armadilha “token, não bot” (Google-Extended e Applebot-Extended)
Este é o fato mais incompreendido do tema, então serei preciso. Google-Extended e Applebot-Extended não rastreiam nada. Eles não têm user agent independente e não geram tráfego de rastreamento. São tokens de controle do robots.txt que mudam o que rastreamentos existentes podem fazer com seu conteúdo.
- Google-Extended controla o uso para melhorar os aplicativos Gemini e os modelos generativos do Vertex AI, inclusive a fundamentação fora da Pesquisa Google. Ele não controla as AI Overviews ou o AI Mode da Pesquisa Google; eles usam o acesso do Googlebot. O Google é explícito: “Google-Extended does not impact a site’s inclusion in Google Search nor is it used as a ranking signal in Google Search.” (tradução) «Google-Extended não afeta a inclusão de um site na Pesquisa Google nem é usado como sinal de classificação na Pesquisa Google.» Desativá-lo não faz nada contra o Googlebot nem contra suas classificações.
- Applebot-Extended é a mesma ideia para a Apple. A Apple afirma: “Applebot-Extended does not crawl webpages. Webpages that disallow Applebot-Extended can still be included in search results.” (tradução) «Applebot-Extended não rastreia páginas da web. Páginas que impedem Applebot-Extended ainda podem ser incluídas nos resultados de pesquisa.» Ele faz você deixar de participar do treinamento dos modelos fundamentais da Apple (Apple Intelligence) — suas páginas continuam aparecendo no Spotlight/Siri por meio do crawler real, Applebot.
Assim, Disallow: Google-Extended e Disallow: Applebot-Extended são controles de uso do produto, não bloqueios de rastreamento independentes. Os escopos publicados não removem páginas do índice de pesquisa correspondente, mas não são intercambiáveis e não devem ser reduzidos ambos a “bot de treinamento”.
Os grandes operadores, bot a bot
A OpenAI opera quatro bots declarados, cada um independente: GPTBot (treinamento — “used to make our generative AI foundation models more useful and safe” (tradução) «usado para tornar nossos modelos fundamentais de IA generativa mais úteis e seguros»), OAI-SearchBot (pesquisa — “used to surface websites in search results in ChatGPT’s search features” (tradução) «usado para exibir sites nos resultados de pesquisa dos recursos de pesquisa do ChatGPT»), ChatGPT-User (buscador do usuário — “used for certain user actions in ChatGPT” (tradução) «usado para determinadas ações do usuário no ChatGPT») e OAI-AdsBot (um escopo independente de anúncios, não de treinamento nem do crawler de índice de pesquisa). A linha de política da OpenAI é o modelo para todo o setor: “Each bot setting is independent, allowing webmasters granular control over how their content interacts with different OpenAI systems.” (tradução) «Cada configuração de bot é independente, permitindo que webmasters controlem granularmente como seu conteúdo interage com diferentes sistemas da OpenAI.» Desativar GPTBot “signals that future data from these materials should be excluded from model training datasets” (tradução) «sinaliza que dados futuros desses materiais devem ser excluídos dos conjuntos de dados de treinamento do modelo»; desativar OAI-SearchBot significa que seu site “won’t appear in ChatGPT search results” (tradução) «não aparecerá nos resultados de pesquisa do ChatGPT».
A Anthropic opera três: ClaudeBot (treinamento), Claude-SearchBot (indexação de pesquisa) e Claude-User (busca do usuário). A Anthropic afirma que seus bots “respect ‘do not crawl’ signals by honoring industry standard directives in robots.txt” (tradução) «respeitam os sinais de “não rastrear” ao obedecer às diretivas padrão do setor no robots.txt». Sua página de suporte atual também aponta para uma lista de IPs publicada compartilhada para verificação específica da Anthropic. Essa lista específica do provedor é evidência de identidade, não uma regra universal de IP ou DNS reverso para todo bot.
O Google — o fato principal é o mencionado acima: Google-Extended é um token, não um bot. O Google também opera Google-CloudVertexBot (rastreia para Agentes do Vertex AI solicitados pelo proprietário do site; não afeta a classificação) e agentes acionados pelo usuário como Gemini-Deep-Research e Google-NotebookLM.
A Apple opera Applebot (o crawler real que alimenta sugestões do Spotlight/Siri/Safari e que “may also be used to help train Apple foundation models” (tradução) «também pode ser usado para ajudar a treinar os modelos fundamentais da Apple») e o token Applebot-Extended. Bloquear Applebot remove você da pesquisa da Apple; bloquear Applebot-Extended apenas faz você deixar de participar do treinamento.
A Perplexity declara dois bots: PerplexityBot (pesquisa/citações — explicitamente “not used to crawl content for AI foundation models” (tradução) «não usado para rastrear conteúdo de modelos fundamentais de IA», portanto a Perplexity não tem crawler de treinamento declarado) e Perplexity-User (busca do usuário). A documentação afirma que Perplexity-User “generally ignores robots.txt rules” (tradução) «geralmente ignora as regras do robots.txt» porque a busca é iniciada pelo usuário. A Perplexity também é objeto de relatos de rastreamento furtivo — veja a controvérsia abaixo.
A Amazon opera três, e esta é uma exceção útil: Amazonbot (melhora produtos e “may be used to train Amazon AI models” (tradução) «pode ser usado para treinar modelos de IA da Amazon»), Amzn-SearchBot (pesquisa) e Amzn-User (buscas do usuário pela Alexa). Segundo a documentação da Amazon, Amzn-SearchBot e Amzn-User explicitamente NÃO rastreiam para treinamento de modelos generativos de IA — portanto, “todas as empresas de IA raspam para treinamento” é um mito. A Amazon também reconhece uma tag meta noarchive com significado especial: não use a página para treinamento de modelos — uma rara opção de não participação por página.
O tratamento de robots.txt da Amazon tem duas particularidades operacionais: seus crawlers podem usar uma cópia do robots.txt armazenada em cache nos 30 dias anteriores, e a Amazon afirma que, se o arquivo não puder ser obtido, seus crawlers se comportam como se ele não existisse. Isso não significa que uma busca de auditoria que falhou prove que a Amazon viu um estado de permitir tudo; a auditoria e a Amazon podem estar chegando ao host em momentos diferentes ou por caminhos de rede diferentes. Evidence for this claim Amazon says its crawlers may use a robots.txt copy cached within the previous 30 days. Scope: Amazon crawler behavior only; a current audit fetch cannot identify which cached copy Amazon used. Confidence: high · Verified: Amazon: Amazonbot Evidence for this claim Amazon says its crawlers behave as if robots.txt does not exist when they cannot fetch it. Scope: Amazon crawler behavior only; a tool-side fetch failure is not proof that Amazon observed the same failure. Confidence: high · Verified: Amazon: Amazonbot
A Meta opera Meta-ExternalAgent (treinamento/indexação para Llama e Meta AI), Meta-ExternalFetcher (busca do usuário) e, separadamente, Facebookbot (pré-visualizações de links — não é um crawler de IA). Bloquear Meta-ExternalAgent não afeta as prévias de links do Facebook.
O Common Crawl (CCBot) é operado por uma fundação sem fins lucrativos que mantém um arquivo aberto da web. É a camada oculta: o conjunto de dados Common Crawl foi usado para treinar ChatGPT, Claude, LLaMA e muitos outros — portanto, bloquear CCBot tem efeitos posteriores em modelos que nunca rastreiam você diretamente. O Common Crawl também alerta que impostores falsificam a identidade de CCBot.
ByteDance (Bytespider) é o mais agressivo: declarado como obediente ao robots.txt, mas amplamente relatado como infrator, com volumes de solicitações muito altos. Outros que vale conhecer: AI2Bot (Allen Institute, modelos abertos/conjunto de dados Dolma), Cohere, Diffbot (extração de dados estruturados cuja saída alimenta muitos pipelines de IA) e Timpibot/webzio-extended.
Os bots de IA realmente obedecem ao robots.txt?
Para crawlers de treinamento e pesquisa, os grandes operadores (OpenAI, Anthropic, Google, Apple e Amazon) afirmam em sua documentação que respeitam o robots.txt. A zona contestada são os buscadores acionados pelo usuário, em que vários operadores dizem explicitamente que o robots.txt pode não se aplicar porque uma pessoa iniciou a solicitação — a OpenAI afirma que “these actions are initiated by a user, robots.txt rules may not apply” (tradução) «essas ações são iniciadas por um usuário; as regras de robots.txt podem não se aplicar»; a Perplexity diz que Perplexity-User “generally ignores robots.txt rules” (tradução) «geralmente ignora as regras do robots.txt». Essa é uma política declarada, não uma violação.
A controvérsia da Perplexity é a principal disputa, e vou marcá-la como relatada, não resolvida. Em junho de 2024, a Wired e o desenvolvedor Robb Knight relataram que a Perplexity acessou conteúdo de sites que a haviam bloqueado, aparentemente usando IPs não listados. Em agosto de 2025, a Cloudflare informou que a Perplexity usou um user agent furtivo que se passava pelo Chrome no macOS, alternou IPs e ASNs para contornar bloqueios e buscou conteúdo de domínios de teste recém-criados que traziam um Disallow: / completo — e depois a Cloudflare removeu a Perplexity da lista de bots verificados. Apresente isso como relato documentado dessas fontes; a própria documentação da Perplexity sustenta que PerplexityBot respeita o robots.txt.
Como alguns bots ignoram o robots.txt em algum nível, a Cloudflare se tornou a camada prática de aplicação — bloqueio em nível de rede, um botão de “AI Scrapers and Crawlers”, robots.txt gerenciado, acompanhamento de violações do robots.txt e um beta de pagamento por rastreamento. Em julho de 2025, novos domínios da Cloudflare passaram a bloquear crawlers de IA conhecidos por padrão.
Como controlar crawlers de IA
robots.txtpor user agent é a alavanca principal e é granular: bloquearGPTBotnão bloqueiaOAI-SearchBotnemChatGPT-User. As receitas derobots.txt(bloquear todos os bots de treinamento, bloquear bots de pesquisa com IA) estão na aba Scripts.- Os tokens de treinamento —
Google-ExtendedeApplebot-Extended— fazem você deixar de participar do treinamento do Gemini/Apple sem custo de pesquisa. - A tag meta
noarchiveda Amazon é uma opção de não participação no treinamento da Amazon por página. - Cloudflare AI Crawl Control — bloquear/permitir/cobrar no nível de rede, além de
robots.txtgerenciado e diretivas Content Signals (search,ai-input,ai-train); o padrão ésearch=yes, ai-train=no. - llms.txt é uma proposta (Jeremy Howard/Answer.AI, setembro de 2024), não um padrão adotado — e não é respeitado pelos principais crawlers. É um mapa em Markdown selecionado para ser lido no momento da inferência, mas um estudo do Ahrefs com 137 000 sites constatou que 97 % dos arquivos llms.txt publicados recebem zero solicitações, e nenhum grande provedor de LLM o adotou formalmente. Trate-o como ferramenta de documentação, não de pesquisa com IA.
- O projeto comunitário ai.robots.txt mantém um arquivo abrangente de
Disallow: /com mais de 150 user agents de bots de IA — uma referência útil para bloqueio abrangente.
Uma política de crawler orientada à visibilidade
Para um site público educacional ou comercial que quer visibilidade em pesquisa com IA, minha política padrão é:
- Permita crawlers de pesquisa convencionais que alimentam as superfícies de pesquisa desejadas, incluindo Googlebot e Bingbot.
- Permita crawlers documentados de pesquisa/indexação com IA como
OAI-SearchBot,Claude-SearchBotePerplexityBotno conteúdo público. - Permita buscadores direcionados pelo usuário como
ChatGPT-User,Claude-UserePerplexity-User, reconhecendo que o comportamento dos provedores em relação aorobots.txtvaria. Evidence for this claim OpenAI publishes separate controls for GPTBot, OAI-SearchBot, and ChatGPT-User, and says each setting is independent. Scope: OpenAI-declared crawlers and user agents; their purposes and robots behavior are platform-specific. Confidence: high · Verified: OpenAI: Crawlers Evidence for this claim Anthropic documents ClaudeBot, Claude-SearchBot, and Claude-User separately and says its bots honor robots.txt directives. Scope: Anthropic-declared bots; user-initiated retrieval has additional product-specific conditions. Confidence: high · Verified: Anthropic: Bot information Evidence for this claim Perplexity documents PerplexityBot for search indexing separately from Perplexity-User for user-requested fetches, with different robots behavior. Scope: Perplexity-declared crawlers and published IP ranges; a user-agent string alone does not verify identity. Confidence: high · Verified: Perplexity: Crawlers - Tome uma decisão de direitos separada para acesso de treinamento/desenvolvimento de modelos.
GPTBot,ClaudeBot,Google-Extendede outros controles de treinamento não precisam compartilhar a política de pesquisa. Permita-os somente se esse uso corresponder à sua política editorial. - Proteja rotas privadas e operacionais com autenticação. Mantenha
/admin/, prévias, dados de conta e APIs não públicas atrás de autorização no servidor; umDisallowé apenas uma preferência do crawler. - Verifique a identidade antes de ignorar controles do WAF. Combine o user agent documentado com faixas de IP atuais do provedor, verificação de DNS reverso ou autenticação de bot compatível. Nunca crie uma regra ampla de permissão no WAF a partir de um user agent falsificável sozinho.
Não adicione um grupo de user agent específico apenas para dizer Allow: / se não repetir todas as restrições que ainda devem se aplicar a esse crawler. Pelas regras de correspondência do robots, um grupo específico pode substituir o grupo curinga em vez de herdar suas exclusões de caminhos privados na interpretação de robots específica do provedor. O arquivo seguro mais simples costuma ser um único grupo curinga independentemente seguro, com exclusões de treinamento delimitadas.
Para este site especificamente, a política pública atual é uma postura explícita de permissão para pesquisa, entrada de IA e treinamento de IA, excluindo rotas de administração, prévia, API, armadilha e gateway. Eu manteria permitidas a pesquisa e a recuperação direcionada pelo usuário. Só mudaria ai-train=yes como decisão de direitos editoriais — não como tática de visibilidade em IA — porque o acesso para treinamento não tem benefício demonstrado para citações.
Acesso de crawler de IA não é prontidão para IA
Uma regra de permissão prova, no máximo, que a política declarada de robots permite que um agente nomeado solicite uma URL. Ela não prova que o operador obedeceu à política, buscou a página, a renderizou, extraiu as informações importantes, colocou-as no contexto do modelo, citou a página ou concluiu uma ação.
Mantenha cinco camadas separadas:
| Camada | Pergunta | Evidência |
|---|---|---|
| Permissão | Este agente nomeado pode solicitar a URL segundo a política declarada? | Teste efetivo de robots e acesso de rede |
| Extraibilidade | O conteúdo importante está presente em texto, links, metadados ou dados estruturados estáveis? | Captura bruta e renderizada com extração de campos |
| Renderização | O conteúdo sobrevive à capacidade real de navegador/JavaScript do agente? | Evidência de busca específica do provedor quando disponível; caso contrário, uma limitação de teste declarada |
| Operabilidade | Um agente consegue identificar e invocar com segurança a ação pretendida? | Contrato documentado da ferramenta/interface e teste controlado de ponta a ponta |
| Prontidão comercial | Identidade, preço, disponibilidade, política, atendimento, carrinho e checkout estão de acordo? | Reconciliação de feed/página/backend/pedido |
Um verificador de acesso de crawler deve, portanto, informar permitido, bloqueado ou indeterminado para a política — não “pronto para IA”. Uma solicitação de log bem-sucedida prova que aquela solicitação ocorreu; não é evidência de que a página foi usada em uma resposta. Uma declaração válida de feed ou ferramenta tampouco prova que uma página pública é renderizada corretamente ou que o checkout pode atender à oferta representada.
Use How AI Search Works para as camadas de recuperação e citação e AI Shopping Optimization para prontidão de catálogo e transação. Manter as camadas separadas torna o remédio específico: corrija a política de acesso para um bloqueio, a saída da página para extraibilidade, a renderização para um estado ausente, o contrato de interface para operabilidade ou os dados comerciais para uma compra que falhou.
Para páginas de comércio eletrônico, o teste de extraibilidade deve verificar que a identidade central do produto e a oferta selecionada — SKU, ID do grupo, preço, moeda e disponibilidade — existem na resposta inicial e continuam de acordo após a renderização. O padrão de página de produto bruta versus renderizada define o que deve estar visível no servidor; a permissão do crawler, sozinha, não diz nada sobre esse contrato.
O mito que custa tráfego: treinamento ≠ pesquisa com IA
Este é o ponto que você precisa acertar. Bloquear bots de treinamento não é o mesmo que bloquear bots de pesquisa com IA. São regras separadas de robots.txt, com consequências opostas:
- Bloquear bots de treinamento (GPTBot, ClaudeBot, CCBot, Bytespider, além dos tokens Google-Extended/Applebot-Extended) → nenhum efeito nas classificações do Google, confirmado pelo Google e por dados empíricos de editores. Você está simplesmente deixando de participar do treinamento de modelos.
- Bloquear bots de pesquisa com IA (OAI-SearchBot, PerplexityBot) → você perde visibilidade nas respostas do ChatGPT e da Perplexity. É uma troca real, não uma vantagem sem custo.
Se você bloquear de forma ampla demais — por exemplo, um bloqueio geral que capture OAI-SearchBot quando sua intenção era apenas parar o treinamento — pode remover silenciosamente sua presença da pesquisa com IA. Seja preciso sobre qual categoria cada regra atinge.
Por que os editores bloqueiam: o contrato social
O motivo de esse debate existir se resume a tráfego. Como escrevi na minha análise de bots de IA, “there’s a cost to bots crawling your websites and there’s a social contract between search engines and website owners, where search engines add value by sending referral traffic to websites. Google sends traffic (for now), so they don’t get blocked.” (tradução) «Bots consomem recursos ao rastrear sites, e existe um contrato social: mecanismos de busca devolvem valor ao enviar visitas. O Google ainda envia tráfego e, por enquanto, evita ser bloqueado.» Até agora, os crawlers de IA em sua maioria não devolvem tráfego — e os dados sustentam esse desconforto. Na minha análise do Cloudflare Radar, os bots de IA já são firmemente o segundo maior crawler, atrás dos mecanismos de pesquisa, e estão a caminho de ultrapassá-los. Veja mais na aba Stats.
Divulgação: fui funcionário da Ahrefs e recebo acesso complementar à Ahrefs. A análise de crawlers vinculada é um trabalho meu publicado durante essa função; a Ahrefs não revisa nem aprova as conclusões editoriais atuais deste site.Para o pipeline mais amplo em que isso se encaixa — descoberta, agendamento do rastreamento, renderização e como rastreamento difere de indexação — veja o hub de rastreamento e os temas irmãos sobre crawler em geral, user agent, Googlebot, Bingbot e robots.txt.
Resumo de IA
Uma versão condensada da versão Advanced:
- Crawlers de IA são três categorias, não uma — e misturá-las é o erro central.
- Treinamento: GPTBot, ClaudeBot, CCBot, Bytespider, Amazonbot, Meta-ExternalAgent, AI2Bot, Cohere, Diffbot — raspam para criar corpora de modelos.
- Pesquisa com IA/indexação: OAI-SearchBot, PerplexityBot, Applebot, Amzn-SearchBot — criam um índice de citações.
- Buscadores acionados pelo usuário: ChatGPT-User, Perplexity-User, Claude-User — buscam uma página ao vivo quando uma pessoa pergunta.
- Cada bot tem seu próprio user agent e sua própria regra de robots.txt. Bloquear GPTBot não bloqueia OAI-SearchBot nem ChatGPT-User.
- Google-Extended e Applebot-Extended são tokens, não bots — não rastreiam; apenas fazem você deixar de participar do treinamento/fundamentação. Desativá-los não tem custo de pesquisa.
- Bloquear bots de treinamento ≠ prejudicar o SEO. O Google afirma que Google-Extended “does not impact a site’s inclusion in Google Search.” (tradução) «não afeta a inclusão de um site na Pesquisa Google». Os dados empíricos de editores concordam.
- Bloquear bots de pesquisa com IA reduz a visibilidade em IA no ChatGPT/Perplexity — uma troca real.
- Amzn-SearchBot e Amzn-User da Amazon NÃO treinam com conteúdo rastreado (segundo a Amazon). “Todos os bots de IA treinam” é um mito.
- Debate sobre robots.txt: buscadores acionados pelo usuário abrem uma exceção (“pode não se aplicar”); há relatos de que a Perplexity (Wired/Robb Knight 2024; Cloudflare 2025) usa crawlers furtivos — apresente como relato, não como fato resolvido.
- llms.txt é uma proposta, não adotada — 97 % dos arquivos não são lidos; nenhum LLM importante a suporta. A Cloudflare é a camada prática de aplicação.
Documentação oficial
Documentação de fonte primária dos operadores de IA e das propostas relevantes.
OpenAI
- Bots e crawlers da OpenAI — GPTBot, OAI-SearchBot, ChatGPT-User, OAI-AdsBot e a política de que “cada configuração de bot é independente”.
Anthropic
- A Anthropic rastreia dados da web? — ClaudeBot, Claude-SearchBot, Claude-User, controles de robots e verificação atual da lista de IPs.
- Lista de IPs de crawlers da Anthropic — dados de verificação específicos do provedor.
- Crawlers comuns do Google (incluindo Google-Extended) — os tokens de produto e user agents.
- Recursos de IA e seu site — o Googlebot, não Google-Extended, controla a inclusão nas Visões gerais da IA e no Modo IA.
Apple
- Sobre o Applebot — Applebot versus Applebot-Extended e a distinção de que “Applebot-Extended não rastreia páginas da web”.
Amazon
- Amazonbot — Amazonbot, Amzn-SearchBot, Amzn-User, a opção de não treinamento por página com a tag
noarchivee quais bots não treinam.
Perplexity
- Crawlers da Perplexity — PerplexityBot e Perplexity-User, incluindo a afirmação de que “geralmente ignora as regras do robots.txt”.
Common Crawl
- CCBot — o crawler sem fins lucrativos por trás de muitos dados de treinamento de LLMs, além do alerta sobre falsificação de identidade.
Allen Institute for AI
- Aviso sobre o crawler AI2 — AI2Bot e como filtrá-lo.
Cloudflare (controles de crawlers de IA)
- AI Crawl Control — bloquear/permitir/cobrar, monitoramento e acompanhamento de violações do robots.txt.
- Managed robots.txt — diretivas de crawlers de IA mantidas automaticamente.
- Control content use for AI training — robots.txt gerenciado, Content Signals e pagamento por rastreamento.
A proposta
- llms.txt specification — a proposta de mapa para o momento da inferência (uma proposta, não um padrão adotado).
- ai.robots.txt project — lista mantida pela comunidade de user agents de bots de IA.
Citações da fonte
Afirmações registradas pelos operadores e pelas propostas. Cada link é um link profundo que salta para o trecho citado quando verificado.
OpenAI — bots independentes, finalidades independentes
- “Each bot setting is independent, allowing webmasters granular control over how their content interacts with different OpenAI systems.” (tradução) «Cada configuração de bot é independente, permitindo que webmasters controlem granularmente como seu conteúdo interage com diferentes sistemas da OpenAI.» — documentação de bots da OpenAI. Ir para a citação
- GPTBot é “used to make our generative AI foundation models more useful and safe.” (tradução) «usado para tornar nossos modelos fundamentais de IA generativa mais úteis e seguros». OAI-SearchBot é “used to surface websites in search results in ChatGPT’s search features.” (tradução) «usado para exibir sites nos resultados de pesquisa dos recursos de pesquisa do ChatGPT». ChatGPT-User: porque “these actions are initiated by a user, robots.txt rules may not apply.” (tradução) «essas ações são iniciadas por um usuário; as regras de robots.txt podem não se aplicar». Ir para a citação
Anthropic — controles de robots e escopo da verificação
- A Anthropic documenta ClaudeBot, Claude-SearchBot e Claude-User, seus controles de robots e um método de verificação por lista de IPs compartilhada. Fonte
Google — o token, não um bot
- “Google-Extended does not impact a site’s inclusion in Google Search nor is it used as a ranking signal in Google Search.” (tradução) «Google-Extended não afeta a inclusão de um site na Pesquisa Google nem é usado como sinal de classificação na Pesquisa Google.» Ir para a citação
Apple — Applebot-Extended não rastreia
- “Applebot-Extended does not crawl webpages. Webpages that disallow Applebot-Extended can still be included in search results.” (tradução) «Applebot-Extended não rastreia páginas da web. Páginas que impedem Applebot-Extended ainda podem ser incluídas nos resultados de pesquisa.» Ir para a citação
Perplexity — a exceção do buscador do usuário
- PerplexityBot é “designed to surface and link websites in search results on Perplexity. It is not used to crawl content for AI foundation models.” (tradução) «projetado para exibir e vincular sites nos resultados de pesquisa da Perplexity. Não é usado para rastrear conteúdo para modelos fundamentais de IA.» Perplexity-User: “Since a user requested the fetch, this fetcher generally ignores robots.txt rules.” (tradução) «Como um usuário solicitou a busca, este buscador geralmente ignora as regras do robots.txt.» Ir para a citação
Common Crawl — a camada oculta de treinamento
- O CCBot existe para “democratizing access to web information by producing and maintaining an open repository of web crawl data.” (tradução) «democratizar o acesso a informações da web produzindo e mantendo um repositório aberto de dados de rastreamento da web.» Observação: “we are aware of crawlers falsely identifying themselves as CCBot.” (tradução) «sabemos que há crawlers que se identificam falsamente como CCBot.» Ir para a citação
llms.txt — uma proposta, segundo a própria descrição
- “A proposal to standardise on using an /llms.txt file to provide information to help LLMs use a website at inference time.” (tradução) «Uma proposta para padronizar o uso de um arquivo
/llms.txtque forneça informações para ajudar LLMs a usar um site no momento da inferência.» — especificação do llms.txt. Ir para a citação
Eu — o contrato social
- “There’s a cost to bots crawling your websites and there’s a social contract between search engines and website owners, where search engines add value by sending referral traffic to websites. Google sends traffic (for now), so they don’t get blocked.” (tradução) «Há um custo para bots rastrearem seus sites e existe um contrato social entre mecanismos de pesquisa e proprietários de sites, no qual os mecanismos agregam valor ao enviar tráfego de referência aos sites. O Google envia tráfego (por enquanto), então não é bloqueado.» — Patrick Stox, Ahrefs. Leia o artigo
A tabela principal de crawlers de IA
O centro do artigo. Cada bot de IA importante, seu token de user agent, operador, categoria e conformidade declarada com o robots.txt. Copie os tokens exatamente — ortografia e maiúsculas importam em robots.txt.
| Bot | Token de UA | Operador | Categoria | Obedece ao robots.txt? |
|---|---|---|---|---|
| GPTBot | GPTBot | OpenAI | Treinamento | Sim (declarado) |
| OAI-SearchBot | OAI-SearchBot | OpenAI | Pesquisa com IA | Sim (declarado) |
| ChatGPT-User | ChatGPT-User | OpenAI | Busca do usuário | “Pode não se aplicar” (iniciada pelo usuário) |
| OAI-AdsBot | OAI-AdsBot | OpenAI | Anúncios (não treinamento) | Sim (declarado) |
| ClaudeBot | ClaudeBot | Anthropic | Treinamento | Sim (declarado) |
| Claude-SearchBot | Claude-SearchBot | Anthropic | Pesquisa com IA | Sim para indexação |
| Claude-User | Claude-User | Anthropic | Busca do usuário | Sim (a Anthropic afirma que todos os seus bots respeitam o robots.txt) |
| Google-Extended | Google-Extended (apenas token — sem UA separado) | Controle de treinamento/fundamentação | Sim (token de não participação) | |
| Google-CloudVertexBot | Google-CloudVertexBot | Vertex AI solicitado pelo proprietário | Sim | |
| PerplexityBot | PerplexityBot | Perplexity | Pesquisa com IA | Sim para indexação (mas veja as disputas) |
| Perplexity-User | Perplexity-User | Perplexity | Busca do usuário | “Geralmente ignora” (declarado) |
| Applebot | Applebot | Apple | Pesquisa com IA (+ treinamento) | Sim |
| Applebot-Extended | Applebot-Extended (apenas token — não rastreia) | Apple | Controle de treinamento | Sim (token de não participação) |
| Amazonbot | Amazonbot | Amazon | Treinamento | Sim (declarado) |
| Amzn-SearchBot | Amzn-SearchBot | Amazon | Pesquisa com IA (sem treinamento) | Sim (declarado) |
| Amzn-User | Amzn-User | Amazon | Busca do usuário (Alexa; sem treinamento) | Sim (declarado) |
| Meta-ExternalAgent | meta-externalagent | Meta | Treinamento/indexação | Sim (declarado) |
| Meta-ExternalFetcher | meta-externalfetcher | Meta | Busca do usuário | Declarado |
| CCBot | CCBot | Common Crawl | Treinamento (dados abertos) | Sim; existem impostores |
| Bytespider | Bytespider | ByteDance | Treinamento | Contestado — veja as disputas |
| AI2Bot | AI2Bot | Allen Institute | Treinamento | Sim (declarado) |
| cohere-training-data-crawler | cohere-training-data-crawler | Cohere | Treinamento | Sim (declarado) |
| Diffbot | Diffbot | Diffbot | Treinamento/extração | Sim por padrão |
| Timpibot | Timpibot | Timpi | Treinamento | Sim (declarado) |
| webzio-extended | webzio-extended | Webz.io | Treinamento | Declarado |
As três regras que saem da tabela
- Bloquear um bot de treinamento (GPTBot, ClaudeBot, CCBot…) → nenhum efeito na classificação.
- Bloquear um bot de pesquisa com IA (OAI-SearchBot, PerplexityBot) → perder visibilidade nas respostas de IA.
- Google-Extended e Applebot-Extended são tokens, não crawlers — simples opções de não participação no treinamento sem custo de pesquisa.
Fatos rápidos
- GPTBot ≠ OAI-SearchBot ≠ ChatGPT-User — três regras independentes da OpenAI.
Amzn-SearchBoteAmzn-Userda Amazon não treinam com conteúdo rastreado.- A Amazon reconhece a meta
noarchivecomo sinal de não treinamento por página. - llms.txt é uma proposta, não um padrão adotado; os principais crawlers não a respeitam.
- Bloqueie por user agent no robots.txt, não por IP (bloqueios de IP podem impedir que um bot leia seu robots.txt).
Como auditar e decidir o que permitir
Uma passagem prática para decidir quais crawlers de IA permitir, bloquear ou apenas observar.
- Extraia seus logs de servidor e liste quais user agents de IA realmente estão acessando você (GPTBot, ClaudeBot, CCBot, Bytespider, OAI-SearchBot, PerplexityBot, Applebot etc.) e com que frequência. Os logs são a fonte de verdade.
- Classifique cada um em sua categoria — treinamento, pesquisa com IA ou busca do usuário. As decisões vêm da categoria, não da marca.
- Decida sua posição sobre treinamento. Você se sente confortável em permitir treinamento? Permita os bots de treinamento. Não se sente? Bloqueie GPTBot, ClaudeBot, CCBot, Bytespider, Amazonbot e Meta-ExternalAgent — e adicione os tokens
Google-ExtendedeApplebot-Extended. Nada disso afeta as classificações do Google. - Decida sua posição sobre pesquisa com IA — com cuidado. Se quiser aparecer nas respostas do ChatGPT e da Perplexity, mantenha OAI-SearchBot e PerplexityBot permitidos. Só os bloqueie se realmente quiser sair da pesquisa com IA.
- Não capture o bot errado. Confirme que uma regra de “bloquear treinamento” também não está atingindo um bot de pesquisa com IA. GPTBot ≠ OAI-SearchBot.
- Bloqueie por user agent, não por IP — bloqueios de IP podem impedir que um bot leia seu robots.txt (alerta explícito da Anthropic).
- Verifique bots suspeitos. CCBot e outros são falsificados; confira faixas de IP publicadas/DNS reverso antes de confiar em uma string de user agent.
- Considere aplicação em nível de rede (Cloudflare AI Crawl Control) para bots que não obedecem ao robots.txt de maneira confiável.
- Ignore llms.txt como medida de SEO — é uma proposta, em grande parte não lida e não respeitada pelos principais crawlers. Não espere visibilidade em pesquisa com IA com ela.
- Verifique trimestralmente. Novos bots surgem o tempo todo (a lista ai.robots.txt é uma boa referência) e os operadores mudam de comportamento.
O erro que custa tráfego de pesquisa com IA
Confundir bots de treinamento com bots de pesquisa com IA é o erro mais caro neste espaço, e é o mito que mencionei acima para eliminar. Uma regra destinada a interromper o treinamento de modelos e uma regra destinada a interromper citações na pesquisa com IA não são a mesma — misturá-las tem consequências opostas.
- Errado: bloquear “bots de IA” como um bloco único (uma regra
Disallowque por acaso capture GPTBot e OAI-SearchBot). Por que está errado: isso remove você silenciosamente das respostas do ChatGPT e da Perplexity enquanto você pensava estar apenas deixando de participar do treinamento. Faça assim: escreva regras separadas e nomeadas por bot — bloqueie GPTBot/ClaudeBot/CCBot/Bytespider para treinamento e deixe OAI-SearchBot/PerplexityBot permitidos, a menos que deliberadamente queira sair da pesquisa com IA.
Confundir verificação de identidade com política de acesso
Uma lista de IP publicada pelo provedor pode ajudar a verificar quem enviou uma solicitação. Ela não diz qual deve ser sua política e não transforma um bloqueio de rede em uma regra de robots.
- Errado: tratar uma faixa verificada como decisão automática de permitir/bloquear.
Por que está errado: identidade, preferência declarada de rastreamento e acesso de rede aplicado são fatos separados.
Faça assim: expresse a política de rastreamento com o token
User-agentdocumentado; acrescente aplicação em nível de rede (Cloudflare AI Crawl Control) para bots que não respeitam o arquivo de modo confiável.
Tratar llms.txt como alavanca de pesquisa com IA
llms.txt é constantemente apresentado como “o robots.txt para pesquisa com IA”, e esse enquadramento está errado segundo as próprias fontes do artigo.
- Errado: publicar um arquivo
llms.txtesperando que ele aumente a visibilidade ou as citações na pesquisa com IA. Por que está errado: é uma proposta, não um padrão adotado — um estudo do Ahrefs com 137 000 sites constatou que 97 % dos arquivos llms.txt publicados recebem zero solicitações, e nenhum grande provedor de LLM o adotou formalmente. Faça assim: trate llms.txt como ferramenta de documentação, no máximo, e concentre o esforço nas regrasrobots.txte nos bots de pesquisa com IA que realmente controlam a visibilidade.
Confiar em uma string de user agent sem verificá-la
O CCBot, em particular, é falsificado, segundo a própria declaração do Common Crawl, e é amplamente relatado que o Bytespider ignora as regras que afirma respeitar.
- Errado: presumir que uma string de
User-agentnos seus logs é quem afirma ser. Por que está errado: um bot falsificado ou não compatível pode acessá-lo em volume total enquanto uma regra derobots.txtpermanece sem aplicação. Faça assim: confirme acessos de alto volume ou suspeitos nas faixas de IP publicadas pelo operador ou via DNS reverso antes de confiar na string — a aba Tools tem uma ferramenta criada exatamente para essa verificação.
A decisão: permitir, bloquear ou monitorar
1. Classifique primeiro — isso decide tudo. Treinamento versus pesquisa com IA versus busca do usuário. Acerte a categoria e a consequência fica evidente: bloqueios de treinamento são seguros para SEO; bloqueios de pesquisa com IA custam visibilidade em IA; busca do usuário é contestada.
2. A regra permitir/bloquear/monitorar.
- Permita bots de pesquisa com IA (OAI-SearchBot, PerplexityBot, Applebot) se quiser visibilidade de referência em IA — a maioria dos sites deveria fazê-lo.
- Bloqueie bots de treinamento (GPTBot, ClaudeBot, CCBot, Bytespider) se não quiser que treinem com seus dados — custo de classificação zero. Adicione os tokens Google-Extended/Applebot-Extended para o treinamento da Gemini/Apple.
- Monitore buscadores acionados pelo usuário e agentes reconhecidamente problemáticos (Bytespider, tráfego não declarado da Perplexity). O robots.txt pode não detê-los; logs e regras de rede são como você realmente os enxerga e controla.
3. A verificação “token, não bot”. Antes de raciocinar sobre tráfego de rastreamento, pergunte: este é um crawler real ou um token de controle? Google-Extended e Applebot-Extended geram zero tráfego — apenas alteram uma permissão no tráfego que já ocorreu.
4. Treinamento ≠ pesquisa com IA (o erro caro). São duas regras de robots.txt separadas, com consequências opostas. Nunca bloqueie “bots de IA” como um bloco único — você deixará de interromper o treinamento ou apagará acidentalmente sua presença nas respostas de IA.
5. robots.txt é uma solicitação; aplicação é outra coisa. O protocolo funciona para bots compatíveis. Para aqueles que abrem uma exceção (buscadores do usuário) ou que são relatados como ignorando o arquivo (crawlers furtivos da Perplexity, Bytespider), a aplicação real é em nível de rede (Cloudflare) — robots.txt sozinho não resolve.
Devo bloquear este bot de IA?
Esta árvore de decisão percorre passo a passo a regra permitir/bloquear/monitorar da aba Frameworks. Comece identificando a qual das três categorias o bot pertence e responda à pergunta que decide seu destino.
Should I block this AI bot?
Auditoria trimestral do robots.txt para bots de IA
Uma verificação recorrente mantém suas regras de robots.txt alinhadas à realidade enquanto novos bots surgem e os operadores mudam de comportamento — a aba Checklists já sinaliza “verifique trimestralmente”, e este é o passo a passo dessa verificação.
- Extraia os acessos de bots de IA do trimestre. Execute seus logs de servidor no Log File Analyzer do site ou use grep na lista conhecida de user agents (a aba Scripts tem o comando exato) para ver quais bots de IA realmente acessaram você e com que frequência.
- Verifique novamente a categoria de cada bot. Compare cada user agent com a tabela principal na aba Cheat Sheets para confirmar se ele ainda é de treinamento, pesquisa com IA ou busca do usuário — e sinalize qualquer bot novo e não reconhecido contra a lista do projeto ai.robots.txt.
- Teste suas regras atuais. Execute o
robots.txtativo no robots.txt Tester contra o user agent de cada bot para confirmar que as regras de treinamento não estão capturando acidentalmente um bot de pesquisa com IA. - Verifique acessos suspeitos ou de alto volume. Confirme bots como CCBot ou Bytespider nas faixas de IP publicadas pelo operador ou via DNS reverso com o Googlebot Verifier antes de confiar na string de user agent — falsificações acontecem.
- Registre a participação de rastreamento de bots de IA do trimestre. Anote a divisão do tráfego de treinamento versus pesquisa com IA versus busca do usuário (veja a aba How to Measure) para que a próxima verificação trimestral tenha uma tendência para comparar, não apenas um retrato.
Confirme que sua edição do robots.txt fez o que você pretendia
Depois de editar o robots.txt para bloquear bots de treinamento, execute estas verificações antes de considerar a mudança concluída — o objetivo é provar que os bots de pesquisa com IA ainda alcançam suas páginas enquanto os bots de treinamento são realmente desativados.
Teste 1: bots de pesquisa com IA continuam permitidos
- Teste a executar: confira a URL contra os user agents
OAI-SearchBotePerplexityBotcom o robots.txt Tester ou confirme acessos reais com o Googlebot Verifier. - Resultado esperado: “Allowed” (permitido) para ambos em qualquer página que você queira ver citada nas respostas de IA.
- Interpretação da falha: um resultado “Disallowed” (desativado) significa que sua regra de bloqueio de treinamento é ampla demais e capturou o user agent errado.
- Janela de monitoramento: imediata para o tester; aguarde alguns dias para a cópia em cache do robots.txt do próprio bot ser atualizada.
- Gatilho de rollback: um bot de pesquisa com IA que você pretendia permitir aparece como Disallowed, ou citações/referências desse mecanismo caem após a mudança.
Teste 2: bots de treinamento realmente desativados
- Teste a executar: confira a mesma URL contra
GPTBot,ClaudeBot,CCBoteBytespidercom o robots.txt Tester. - Resultado esperado: “Disallowed” (desativado) para cada um.
- Interpretação da falha: um resultado “Allowed” (permitido) normalmente significa um erro de digitação no token — ortografia e maiúsculas importam no robots.txt.
- Janela de monitoramento: imediata.
- Gatilho de rollback: nenhum necessário — um bloqueio de treinamento não precisa de caminho de rollback, a menos que você decida que aceita treinamento afinal.
Teste 3: classificações do Google não são afetadas
- Teste a executar: verifique Performance/Cobertura de índice no Search Console para as URLs afetadas algumas semanas depois de bloquear bots de treinamento ou o token
Google-Extended. - Resultado esperado: nenhuma mudança material em impressões ou classificação — o Google afirma que
Google-Extended“does not impact a site’s inclusion in Google Search.” (tradução) «não afeta a inclusão de um site na Pesquisa Google». - Interpretação da falha: uma queda ampla de impressões que coincida com a mudança normalmente significa que o próprio Googlebot foi capturado por uma regra ampla demais.
- Janela de monitoramento: 2–4 semanas (atraso de relatório do Search Console).
- Gatilho de rollback: impressões ou classificações caem e o Googlebot aparece como Disallowed em uma URL que deveria ser rastreável.
Os KPIs contínuos do tráfego de bots de IA
Acompanhar trimestre a trimestre mostra se sua postura em relação aos bots de IA está realmente fazendo o que você pretende — separadamente de qualquer edição única do robots.txt.
| Métrica | O que informa | Como obter | Benchmark/faixa realista | Cadência |
|---|---|---|---|---|
| Participação de bots de IA no tráfego total de rastreamento, por categoria (treinamento/pesquisa com IA/busca do usuário) | Se os bots de IA estão se tornando uma parcela maior da sua carga total de rastreamento e qual categoria está impulsionando isso | Logs de servidor pelo Log File Analyzer ou Cloudflare AI Crawl Control se você usa Cloudflare | Nenhuma meta universal — o Cloudflare Radar colocou bots de IA em aproximadamente 18,9 % de todas as solicitações de bots no setor (2025), mas a mistura do seu próprio site é o que importa; estabeleça sua própria linha de base no primeiro trimestre e acompanhe a tendência | Trimestral |
| Relação rastreamento/referência por bot de pesquisa com IA | Quanto de “aluguel” de rastreamento você paga por cada unidade de tráfego de referência de pesquisa com IA | Cruze as contagens de rastreamento do log de servidor para esse user agent com as visitas de referência reais na análise | Nenhuma meta fixa — a aba Stats do artigo cita aproximadamente 14 rastreamentos do Google por referência contra proporções muito maiores para crawlers de IA; espere uma relação pior que a do Google e acompanhe a tendência, não o número absoluto | Trimestral |
| Precisão do bloqueio de treinamento | Se alguma regra Disallow de bot de treinamento também está capturando involuntariamente um bot de pesquisa com IA ou de busca do usuário | Audite o robots.txt contra a tabela principal na aba Cheat Sheets; confirme com o robots.txt Tester | Deve ser zero — nenhum bot de pesquisa com IA deve aparecer bloqueado por uma regra destinada a bots de treinamento | Toda mudança no robots.txt, mais uma auditoria trimestral |
robots.txt — bloqueie os bots principais
Bloqueie crawlers de treinamento e mantenha a pesquisa com IA. Isso faz você deixar de participar do treinamento de modelos enquanto mantém sua visibilidade nas respostas do ChatGPT/Perplexity. Copie os tokens exatamente.
# --- AI training crawlers ---
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Bytespider
Disallow: /
User-agent: meta-externalagent
Disallow: /
User-agent: Amazonbot
Disallow: /
# --- Training control tokens (not crawlers) ---
# Opt out of Gemini/Vertex training; search unaffected
User-agent: Google-Extended
Disallow: /
# Opt out of Apple Intelligence training; Applebot search unaffected
User-agent: Applebot-Extended
Disallow: /Bloqueie indexadores de pesquisa com IA (isso REDUZ a visibilidade nas respostas de IA). Só faça isso se você realmente quiser sair das respostas do ChatGPT/Perplexity.
User-agent: OAI-SearchBot
Disallow: /
User-agent: PerplexityBot
Disallow: /O princípio central: bloquear GPTBot não bloqueia OAI-SearchBot nem ChatGPT-User — cada um é uma regra independente.
Identifique bots de IA nos seus logs de acesso
Descubra quais user agents de IA estão acessando você e com que frequência.
macOS / Linux
# Count hits per known AI bot in an Apache/Nginx access log
grep -iE 'GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|Claude-User|Claude-SearchBot|PerplexityBot|Perplexity-User|CCBot|Bytespider|Amazonbot|Amzn-SearchBot|meta-externalagent|Applebot|AI2Bot|Diffbot' access.log \
| grep -oiE 'GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|Claude-User|Claude-SearchBot|PerplexityBot|Perplexity-User|CCBot|Bytespider|Amazonbot|Amzn-SearchBot|meta-externalagent|Applebot|AI2Bot|Diffbot' \
| sort | uniq -c | sort -rnWindows (PowerShell)
# Count hits per known AI bot in an access log
$bots = 'GPTBot','OAI-SearchBot','ChatGPT-User','ClaudeBot','Claude-User','Claude-SearchBot','PerplexityBot','Perplexity-User','CCBot','Bytespider','Amazonbot','Amzn-SearchBot','meta-externalagent','Applebot','AI2Bot','Diffbot'
Select-String -Path .\access.log -Pattern ($bots -join '|') |
ForEach-Object { ($_ -split '"')[5] } |
ForEach-Object { foreach ($b in $bots) { if ($_ -match $b) { $b } } } |
Group-Object | Sort-Object Count -Descending | Select-Object Count, NameUma string de user agent pode ser falsificada (especialmente CCBot) — confirme bots importantes nas faixas de IP publicadas pelo operador ou via DNS reverso + direto antes de agir sobre eles.
Classifique seus acessos de log por categoria de bot de IA
Cole linhas brutas de log de servidor ou uma lista de strings de user agent e peça a uma IA que classifique cada uma usando a tabela principal da aba Cheat Sheets — útil quando você está diante de um log cheio de nomes de bots desconhecidos.
I have a list of user-agent strings from my server logs. Using this
classification (paste the Cheat Sheets table from this article, or the list
below), classify each user-agent as one of: Training, AI-search, User fetch,
or Control token (not a crawler). Flag any user-agent you don't recognize as
"unknown — verify."
Categories:
- Training: GPTBot, ClaudeBot, CCBot, Bytespider, Amazonbot, Meta-ExternalAgent,
AI2Bot, cohere-training-data-crawler, Diffbot, Timpibot, webzio-extended
- AI-search: OAI-SearchBot, PerplexityBot, Applebot, Amzn-SearchBot
- User fetch: ChatGPT-User, Perplexity-User, Claude-User, Claude-SearchBot,
Amzn-User, Meta-ExternalFetcher
- Control token (no crawl traffic): Google-Extended, Applebot-Extended
My user-agent list:
<paste your list here>Crie uma lista de bloqueio de robots.txt a partir da sua posição
Descreva sua posição sobre treinamento e pesquisa com IA em linguagem simples e peça à IA que crie as regras correspondentes de robots.txt; depois, verifique a saída no robots.txt Tester antes de publicá-la.
Draft a robots.txt block that does the following, using exact, correctly-cased
user-agent tokens for each rule (one User-agent/Disallow pair per bot, don't
combine bots under one User-agent line):
1. Block all training bots: GPTBot, ClaudeBot, CCBot, Bytespider,
Meta-ExternalAgent, Amazonbot.
2. Also disallow the Google-Extended and Applebot-Extended control tokens
(training/grounding opt-out only — not real crawlers).
3. Leave OAI-SearchBot and PerplexityBot allowed so AI-search visibility is
unaffected.
Output only the robots.txt block, no explanation. Ferramentas para verificar e controlar bots de IA
-
Googlebot Verifier — cole acessos do log de servidor e confirme se uma solicitação “GPTBot” ou “ClaudeBot” realmente vem da faixa de IP publicada pelo operador ou de um impostor. É a correção direta para o erro de “confiar em uma string de user agent” na aba What Not to Do.
-
robots.txt Tester — verifique se uma URL específica é permitida ou bloqueada para o user agent de um bot específico, para confirmar que uma regra de bloqueio de treinamento não também está capturando um bot de pesquisa com IA.
-
robots.txt Generator — crie as regras de bloqueio de treinamento/permissão de pesquisa com IA da aba Scripts sem digitar tokens de user agent à mão (um erro de digitação quebra a regra silenciosamente).
-
Gerador e validador de llms.txt — se ainda quiser um arquivo llms.txt para fins de documentação, gere e valide um aqui — apenas não espere que ele mude a visibilidade da pesquisa com IA (veja What Not to Do).
Recursos que valem seu tempo
Textos relacionados meus
- Conheça os novos rastreadores da web: bots de IA se aproximam dos bots de mecanismos de busca — minha análise do Cloudflare Radar; bots de IA como o segundo crawler mais claro e o enquadramento do contrato social.
- Os bots de IA que cerca de 140 milhões de sites mais bloqueiam — dados de taxa de bloqueio de robots.txt na web aberta e a correlação entre volume de solicitações e taxa de bloqueio.
- O ChatGPT tem 12% do volume de busca do Google, mas o Google envia 190 vezes mais tráfego — a lacuna de referência entre IA e pesquisa que impulsiona o debate sobre bloqueio.
- O que realmente sabemos sobre otimização para busca em LLMs — o contexto mais amplo de GEO.
De outras fontes
- Cloudflare: a Perplexity usa crawlers furtivos e não declarados — a investigação de agosto de 2025 (achados relatados).
- Robb Knight: a IA da Perplexity mente sobre seu user agent — a investigação original de junho de 2024.
- Projeto ai.robots.txt — lista mantida pela comunidade com mais de 150 user agents de bots de IA.
- Known Agents (antigo Dark Visitors) — diretório abrangente de bots de IA.
- Cloudflare: declare sua independência da IA (bloqueio de bots de IA com um clique) — anúncio do botão “Rastreadores e extratores de IA” da Cloudflare para bloqueio de bots com um clique.
- Cloudflare: controle o uso de conteúdo para treinamento de IA — robots.txt gerenciado, diretivas Content Signals e beta de pagamento por rastreamento.
- Heise Online: crawler sem limites — Perplexity ignora robots.txt — relato de junho de 2024 sobre a evasão de robots.txt pela Perplexity.
- Gizmodo: a IA da Perplexity ignorou as regras da internet — cobertura adicional da controvérsia de conformidade com robots.txt.
Estatísticas que vale citar
- Bots de IA são o segundo crawler com clareza. Segundo minha análise do Cloudflare Radar, bots de mecanismos de pesquisa ainda rastreiam mais, mas bots de IA estão firmemente em segundo lugar e a caminho de ultrapassá-los — já representam aproximadamente 18,9 % de todas as solicitações de bots. Fonte
- A lacuna de referências impulsiona o bloqueio. O Google envia cerca de 190× mais tráfego aos sites que o ChatGPT, apesar de o ChatGPT ter uma participação relevante no volume de pesquisa do Google — o desequilíbrio por trás do argumento do “contrato social”. Fonte
- Relações rastreamento/referência (Cloudflare, 2025). Aproximadamente 14 rastreamentos do Google por visita de referência, contra proporções muito maiores para crawlers de IA — da ordem de milhares de rastreamentos da OpenAI e dezenas de milhares da Anthropic por referência. Os números explicam por que os editores questionam a troca.
- Verificação da realidade do llms.txt. Em um estudo do Ahrefs com 137 000 sites, cerca de 28 % publicaram um arquivo llms.txt, mas 97 % desses arquivos receberam zero solicitações, e nenhum grande provedor de LLM o adotou formalmente. Fonte
- Taxas de bloqueio na web aberta. No meu estudo com cerca de 140 milhões de sites, os bots de IA mais bloqueados se concentram em GPTBot, CCBot, ClaudeBot, Amazonbot e Bytespider — as taxas de bloqueio acompanham o volume de solicitações. Fonte
- Alcance e aplicação do Bytespider. O Bytespider acessou 40,40 % de todos os sites protegidos pela Cloudflare antes de a Cloudflare começar a bloqueá-lo em julho de 2024; o tráfego caiu 71,45 % depois. Meta-ExternalAgent acessou 22,16 % dos sites protegidos — segundo apenas ao GPTBot (28,97 %). Fonte
- Crescimento do tráfego de bots de IA. Dados do Cloudflare Radar mostram que o tráfego de bots de IA cresceu 65 % em seis meses (2025), com as solicitações do GPTBot subindo 305 % entre maio de 2024 e maio de 2025. Em julho de 2025, novos domínios da Cloudflare passaram a bloquear crawlers de IA conhecidos por padrão, e mais de 1 milhão de clientes da Cloudflare ativaram o recurso de bloqueio de bots de IA. Fonte
Teste seus conhecimentos: crawlers de IA
Cinco perguntas rápidas sobre as três categorias de crawlers de IA e as armadilhas relacionadas. Escolha uma resposta para cada pergunta e confira depois.
Registro de alterações
Atualizado em 9 de ago. de 2026.
Resumo editorial e detalhes registrados da alteração.Detalhes da alteração
-
As notas detalhadas sobre as alterações estão disponíveis atualmente em inglês.
Não é possível fazer a comparação completa — nenhum instantâneo anterior foi arquivado para esta revisão.
Atualizado em 8 de ago. de 2026.
Resumo editorial e detalhes registrados da alteração.Detalhes da alteração
-
As notas detalhadas sobre as alterações estão disponíveis atualmente em inglês.
Não é possível fazer a comparação completa — nenhum instantâneo anterior foi arquivado para esta revisão.
Atualizado em 30 de jul. de 2026.
Resumo editorial e detalhes registrados da alteração.Detalhes da alteração
-
As notas detalhadas sobre as alterações estão disponíveis atualmente em inglês.
Não é possível fazer a comparação completa — nenhum instantâneo anterior foi arquivado para esta revisão.
Atualizado em 29 de jul. de 2026.
Resumo editorial e detalhes registrados da alteração.Detalhes da alteração
-
As notas detalhadas sobre as alterações estão disponíveis atualmente em inglês.
Não é possível fazer a comparação completa — nenhum instantâneo anterior foi arquivado para esta revisão.
Atualizado em 29 de jul. de 2026.
Resumo editorial e detalhes registrados da alteração.Detalhes da alteração
-
As notas detalhadas sobre as alterações estão disponíveis atualmente em inglês.
Não é possível fazer a comparação completa — nenhum instantâneo anterior foi arquivado para esta revisão.
Atualizado em 28 de jul. de 2026.
Resumo editorial e detalhes registrados da alteração.Detalhes da alteração
-
As notas detalhadas sobre as alterações estão disponíveis atualmente em inglês.
-
As notas detalhadas sobre as alterações estão disponíveis atualmente em inglês.
-
As notas detalhadas sobre as alterações estão disponíveis atualmente em inglês.
Não é possível fazer a comparação completa — nenhum instantâneo anterior foi arquivado para esta revisão.
Atualizado em 19 de jul. de 2026.
Resumo editorial e detalhes registrados da alteração.Detalhes da alteração
-
As notas detalhadas sobre as alterações estão disponíveis atualmente em inglês.
Não é possível fazer a comparação completa — nenhum instantâneo anterior foi arquivado para esta revisão.
Atualizado em 16 de jul. de 2026.
Resumo editorial e detalhes registrados da alteração.Detalhes da alteração
- Avançado
As notas detalhadas sobre as alterações estão disponíveis atualmente em inglês.
Não é possível fazer a comparação completa — nenhum instantâneo anterior foi arquivado para esta revisão.