AI crawler
three jenis dari AI crawler — training bot, AI-penelusuran indexers, dan pengguna-triggered fetchers — major named ones, dan cara control setiap tanpa hurting SEO.
Bahasa
2 sinyal bukti di halaman ini
- Data sumber tertautpublished IP list
- Alat aktif terkaitLog File Analyzer
AI crawler come di three jenis, dan conflating them adalah #1 mistake: (1) training/model-improvement bot such sebagai GPTBot, ClaudeBot, dan CCBot; (2) AI-penelusuran indexers such sebagai OAI-SearchBot, PerplexityBot, dan Applebot; dan (3) pengguna-triggered fetchers such sebagai ChatGPT-pengguna, Perplexity-pengguna, dan Claude-pengguna. Controls adalah provider- dan agent-spesifik: blocking GPTBot melakukan tidak block OAI-SearchBot, dan OAI-AdsBot memiliki sebuah terpisah ads cakupan. Google-Extended dan Applebot-Extended adalah product/control tokens, tidak independent crawler. Google-Extended covers Gemini/Vertex model improvement dan grounding tetapi tidak Google Search inclusion, peringkat, AI Overviews, atau AI Mode; Applebot-Extended controls Apple foundation-model gunakan tanpa menghapus halaman dari Apple penelusuran. llms.txt tetap sebuah proposal, tidak sebuah broadly adopted control standard.
OpenAI publishes terpisah controls untuk -nya training, penelusuran, dan pengguna-tindakan bot. Evidence for this claim OpenAI publishes separate controls for GPTBot, OAI-SearchBot, and ChatGPT-User, and says each setting is independent. Scope: OpenAI-declared crawlers and user agents; their purposes and robots behavior are platform-specific. Confidence: high · Verified: OpenAI: Crawlers Anthropic likewise documents distinct training, penelusuran, dan pengguna-permintaan agents. Evidence for this claim Anthropic documents ClaudeBot, Claude-SearchBot, and Claude-User separately and says its bots honor robots.txt directives. Scope: Anthropic-declared bots; user-initiated retrieval has additional product-specific conditions. Confidence: high · Verified: Anthropic: Bot information
Evidence for this claim Cloudflare Radar reports worldwide Cloudflare-observed HTTP request trends for the five most active AI bots during the 28 days ending 2026-07-30. Scope: A dated Cloudflare Radar context chart; it is not site-specific traffic and is not a census of all web requests. Confidence: high · Verified: Cloudflare Radar: HTTP traffic by AI botThe chart compares request trends for the five most active AI bots observed by Cloudflare during the selected four-week period, including Googlebot, ClaudeBot, Meta-ExternalAgent, GPTBot, and Bingbot.
TL;DR — “AI crawlers” (terjemahan) “AI crawler” tidak satu hal — ini adalah three. beberapa bot scrape Anda situs untuk train AI models (like GPTBot dan ClaudeBot). beberapa bangun sebuah indeks so AI penelusuran dapat cite Anda (like OAI-SearchBot dan PerplexityBot). dan beberapa fetch sebuah halaman langsung karena sebuah person hanya ditanyakan sebuah pertanyaan (like ChatGPT-pengguna). setiap satu memiliki -nya own name di Anda
robots.txt, so Anda dapat izinkan atau block them secara terpisah. Blocking training bot tidak akan hurt Anda Google rankings — blocking AI-penelusuran bot dapat hide Anda dari AI jawaban.
Apa AI crawler adalah
Anda sudah know tentang penelusuran crawler — sebuah crawler like Googlebot atau Bingbot itu visits Anda halaman so mereka dapat tampilkan up di penelusuran. AI crawler adalah newer crowd: bot jalankan oleh AI companies (OpenAI, Anthropic, Google, Apple, Perplexity, dan others) itu fetch Anda halaman untuk mereka purposes.
key hal untuk memahami sebelum Anda block apa pun: mereka jangan semua melakukan sama job. ada three jenis.
- Training bot baca Anda halaman untuk help bangun dan meningkatkan AI models. GPTBot (OpenAI) dan ClaudeBot (Anthropic) adalah famous ones.
- AI-penelusuran bot baca Anda halaman untuk bangun searchable indeks, so ketika seseorang menanyakan ChatGPT atau Perplexity sebuah pertanyaan, ini dapat jawaban dan tautan untuk Anda. OAI-SearchBot dan PerplexityBot melakukan ini.
- pengguna-triggered fetchers grab satu spesifik halaman di nyata time karena sebuah person ditanyakan sesuatu. ChatGPT-pengguna adalah sebuah contoh — ini adalah tidak roaming web pada -nya own, ini adalah berjalan sebuah errand untuk sebuah pengguna.
Mengapa perbedaan penting
setiap bot memiliki -nya own name (-nya pengguna-agent), dan Anda robots.txt file dapat
izinkan atau block setiap satu oleh name. So Anda mendapatkan untuk decide, secara terpisah:
- melakukan I mind AI companies training pada my konten? → itu’s training bot.
- melakukan I ingin untuk tampilkan up di ChatGPT dan Perplexity jawaban? → itu’s AI-penelusuran bot. sebagian besar orang ingin untuk pertahankan ini.
Di sini’s big myth untuk kill: blocking AI bot melakukan tidak hurt Anda Google rankings. Google memiliki mengatakan so secara langsung, dan publishers siapa block AI training bot pertahankan peringkat fine. tetapi jika Anda block AI-penelusuran bot, Anda dapat disappear dari AI jawaban — so jangan block wrong category oleh accident.
names Anda’ll see di Anda logs
- GPTBot — OpenAI, training.
- OAI-SearchBot — OpenAI, satu itu powers ChatGPT penelusuran.
- ChatGPT-pengguna — OpenAI, langsung fetch ketika sebuah pengguna menanyakan.
- ClaudeBot — Anthropic, training.
- PerplexityBot — Perplexity, penelusuran/citations.
- CCBot — umum crawl, sebuah non-profit milik siapa data trains lots dari AI models.
- Bytespider — ByteDance (TikTok’s parent), training.
- Applebot — Apple, powers Siri/Spotlight dan Apple Intelligence.
Dua lebih Anda’ll see — Google-Extended dan Applebot-Extended — adalah tidak
sebenarnya crawler. mereka’re hanya switches di robots.txt itu say “don’t use my
content to train your AI.” (terjemahan) “jangan gunakan my
konten untuk train Anda AI.” mereka jangan fetch apa pun.
ingin penuh bot-oleh-bot table, robots.txt recipes, “do they actually obey robots.txt?” (terjemahan) “melakukan mereka sebenarnya obey robots.txt?” debate, dan apakah untuk block them di semua? Switch untuk Advanced tab.
OpenAI says settings untuk GPTBot, OAI-SearchBot, dan ChatGPT-pengguna adalah independent. Evidence for this claim OpenAI publishes separate controls for GPTBot, OAI-SearchBot, and ChatGPT-User, and says each setting is independent. Scope: OpenAI-declared crawlers and user agents; their purposes and robots behavior are platform-specific. Confidence: high · Verified: OpenAI: Crawlers Anthropic secara terpisah identifies ClaudeBot, Claude-SearchBot, dan Claude-pengguna dan documents robots.txt menangani. Evidence for this claim Anthropic documents ClaudeBot, Claude-SearchBot, and Claude-User separately and says its bots honor robots.txt directives. Scope: Anthropic-declared bots; user-initiated retrieval has additional product-specific conditions. Confidence: high · Verified: Anthropic: Bot information
TL;DR — AI crawler split ke three categories, dan conflating them adalah mistake hampir everyone membuat. Training bot (GPTBot, ClaudeBot, CCBot, Bytespider, Amazonbot, Meta-ExternalAgent) scrape untuk bangun model corpora. AI-penelusuran bot (OAI-SearchBot, PerplexityBot, Applebot, Amzn-SearchBot) bangun citing indeks. pengguna-triggered fetchers (ChatGPT-pengguna, Perplexity-pengguna, Claude-pengguna) grab sebuah halaman langsung ketika sebuah person menanyakan. setiap memiliki -nya own pengguna-agent dan -nya own
robots.txtaturan, so blocking GPTBot tidak touch OAI-SearchBot. Google-Extended dan Applebot-Extended adalah tokens, tidak bot — mereka jangan crawl, mereka hanya opt Anda out dari training/grounding. Blocking training bot memiliki Tidak effect pada Google rankings (Google says so, dan empirical data agrees); blocking AI-penelusuran bot melakukan reduce Anda visibilitas di AI jawaban. robots.txt debate adalah nyata untuk pengguna fetchers (operators say ini “may not apply” (terjemahan) “dapat tidak apply”) dan untuk Perplexity (reported stealth crawling). llms.txt adalah sebuah proposal, largely unread, tidak adopted oleh majors.
three categories — spine dari ini seluruh topic
Training crawlers such as GPTBot, ClaudeBot, and CCBot collect data for model corpora. AI-search crawlers such as OAI-SearchBot and PerplexityBot build indexes used for answers and citations. User-triggered agents such as ChatGPT-User and Claude-User fetch a page for a live request. Blocking one category does not automatically block the others.
© Patrick Stox LLC · CC BY 4.0 ·
setiap named AI bot belongs di satu dari three buckets. Mendapatkan bucket right dan setiap downstream decision (block ini? izinkan ini? apa happens untuk my SEO?) falls out dari ini.
1. Training / data-collection crawler. ini crawl di scale untuk bangun corpora untuk training dan fine-tuning LLMs. mereka’re bot sebagian besar publishers ingin untuk block, dan disallowing them memiliki Tidak effect pada penelusuran rankings. Members: GPTBot (OpenAI), ClaudeBot (Anthropic), CCBot (umum crawl), Bytespider (ByteDance), Amazonbot (Amazon), Meta-ExternalAgent (Meta), AI2Bot (Allen Institute), cohere-training-data-crawler (Cohere), Diffbot, Timpibot (Timpi), webzio-extended (Webz.io). Plus dua control tokens itu adalah Tidak terpisah crawler — Google-Extended dan Applebot-Extended — covered di bawah.
2. AI-penelusuran / pengindeksan crawler. ini bangun langsung indeks digunakan untuk jawaban kueri dengan citations dan tautan back untuk Anda. Blocking ini dapat hapus Anda dari AI hasil pencarian. Members: OAI-SearchBot (OpenAI — distinct dari GPTBot), PerplexityBot (Perplexity), Applebot (Apple — powers Spotlight/Siri/Safari suggestions), Amzn-SearchBot (Amazon).
3. pengguna-triggered / pada-demand fetchers. ini fetch sebuah spesifik halaman langsung karena sebuah pengguna ditanyakan sebuah pertanyaan, tidak karena sebuah bot adalah roaming. Operators typically claim robots.txt tidak bind sebuah pengguna-initiated fetch — contested territory. Members: ChatGPT-pengguna (OpenAI), Perplexity-pengguna (Perplexity), Claude-pengguna dan Claude-SearchBot (Anthropic), Amzn-pengguna (Amazon, untuk Alexa), Meta-ExternalFetcher (Meta).
penuh table dengan pengguna-agent tokens dan robots.txt compliance adalah di Cheat Sheets tab — itu table adalah centerpiece dari ini artikel.
”token, not bot” (terjemahan) “token, tidak bot” trap (Google-Extended dan Applebot-Extended)
ini adalah single sebagian besar misunderstood fact di space, so I’ll menjadi precise. Google-Extended dan Applebot-Extended melakukan tidak crawl apa pun. mereka memiliki Tidak independent pengguna-agent dan generate Tidak crawl traffic. mereka adalah robots.txt control tokens itu perubahan apa existing melakukan crawl adalah diizinkan untuk melakukan dengan Anda konten.
- Google-Extended controls gunakan untuk improving Gemini Apps dan Vertex AI generative models, including grounding di luar Google Search. ini melakukan tidak control Google Penelusuran’s AI Overviews atau AI Mode; itu gunakan Googlebot access. Google adalah jelas: “Google-Extended does not impact a site’s inclusion in Google Search nor is it used as a ranking signal in Google Search.” (terjemahan) “Google-Extended tidak memengaruhi penyertaan situs dalam Google Search dan tidak digunakan sebagai sinyal peringkat di Google Search.” Disallowing ini melakukan tidak ada apa pun untuk Googlebot atau Anda rankings.
- Applebot-Extended adalah ide yang sama untuk Apple. Apple menyatakan: “Applebot-Extended does not crawl webpages. Webpages that disallow Applebot-Extended can still be included in search results.” (terjemahan) “Applebot-Extended tidak melakukan crawling pada halaman web; halaman yang menolaknya tetap dapat muncul dalam hasil penelusuran.” Ini mengeluarkan Anda dari penggunaan untuk melatih model fondasi Apple models (Apple Intelligence) — Anda halaman masih muncul di Spotlight/Siri melalui nyata crawler, Applebot.
So Disallow: Google-Extended dan Disallow: Applebot-Extended adalah product-gunakan
controls alih-alih independent crawl blocks. mereka published scopes jangan hapus
halaman dari corresponding penelusuran indeks, tetapi mereka adalah tidak interchangeable dan
seharusnya tidak menyederhanakan keduanya menjadi satu kategori bot pelatihan.
major operators, bot oleh bot
OpenAI berjalan four declared bot, setiap independent: GPTBot (training — “used to make our generative AI foundation models more useful and safe” (terjemahan) “digunakan untuk membuat kami generative AI foundation models lebih berguna dan safe”), OAI-SearchBot (penelusuran — “digunakan untuk surface websites di penelusuran hasil di ChatGPT’s penelusuran features” (terjemahan) “digunakan untuk surface situs web di hasil pencarian di ChatGPT’s penelusuran fitur”), ChatGPT-pengguna (pengguna fetcher — “digunakan untuk certain user actions di ChatGPT” (terjemahan) “digunakan untuk certain pengguna tindakan di ChatGPT”), dan OAI-AdsBot (sebuah independent ads cakupan, tidak training dan tidak penelusuran-indeks crawler). OpenAI’s policy line adalah model untuk seluruh space: “Setiap bot setting adalah independent, allowing webmasters granular control over bagaimana mereka konten interacts dengan berbeda OpenAI sistem.” (terjemahan) “setiap bot setting adalah independent, allowing webmasters granular control di atas bagaimana mereka konten interacts dengan berbeda OpenAI sistem.” Disallowing GPTBot “signals that future data from these materials should be excluded from model training datasets” (terjemahan) “sinyal itu future data dari ini materials seharusnya menjadi excluded dari model training datasets”; disallowing OAI-SearchBot berarti Anda situs “tidak akan muncul di ChatGPT penelusuran hasil.” (terjemahan) “tidak akan muncul di ChatGPT hasil pencarian.”
Anthropic berjalan three: ClaudeBot (training), Claude-SearchBot (penelusuran pengindeksan), dan Claude-pengguna (pengguna fetch). Anthropic status -nya bot “respect ‘do not crawl’ signals by honoring industry standard directives in robots.txt” (terjemahan) “respect ‘melakukan tidak crawl’ sinyal oleh honoring industry standard directives di robots.txt”. -nya saat ini mendukung halaman juga poin untuk sebuah shared published IP list untuk Anthropic-spesifik verification. itu provider-spesifik list adalah evidence dari identity, tidak sebuah universal IP atau reverse-DNS verification aturan untuk setiap bot.
Google — key fact adalah satu di atas: Google-Extended adalah sebuah token, tidak sebuah
bot. Google juga berjalan Google-CloudVertexBot (melakukan crawl untuk situs-owner-requested
Vertex AI Agents; tidak memengaruhi peringkat) dan pengguna-triggered agents like
Gemini-Deep-Research dan Google-NotebookLM.
Apple berjalan Applebot ( nyata crawler powering Spotlight/Siri/Safari suggestions, dan “may also be used to help train Apple foundation models” (terjemahan) “dapat juga menjadi digunakan untuk help train Apple foundation models”) dan Applebot-Extended token. Blocking Applebot menghapus Anda dari Apple penelusuran; blocking Applebot-Extended hanya opts out dari training.
Perplexity declares dua bot: PerplexityBot (penelusuran/citations — explicitly “not used to crawl content for AI foundation models” (terjemahan) “tidak digunakan untuk crawl konten untuk AI foundation models”, so Perplexity memiliki Tidak declared training crawler) dan Perplexity-pengguna (pengguna fetch). -nya docs state Perplexity-pengguna “generally ignores robots.txt rules” (terjemahan) “umumnya ignores robots.txt aturan” karena fetch adalah pengguna-initiated. Perplexity adalah juga subject dari reported stealth-crawling — see controversy di bawah.
Amazon berjalan three, dan ini adalah sebuah berguna exception: Amazonbot (improves
products dan “may be used to train Amazon AI models” (terjemahan) “dapat menjadi digunakan untuk train Amazon AI models”), Amzn-SearchBot
(penelusuran), dan Amzn-pengguna (Alexa pengguna fetches). Per Amazon’s docs, Amzn-SearchBot
dan Amzn-pengguna explicitly melakukan Tidak crawl untuk generative AI model training — so “all
AI companies scrape for training” (terjemahan) “semua
AI companies scrape untuk training” adalah sebuah myth. Amazon juga honors sebuah noarchive meta
tag dengan sebuah special meaning: jangan gunakan halaman untuk model training — sebuah rare
per-halaman training opt-out.
Amazon’s robots menangani memiliki dua unusual operational edges: -nya crawler dapat gunakan sebuah robots.txt copy cached di dalam sebelumnya 30 days, dan Amazon says itu jika file cannot menjadi fetched, -nya crawler behave sebagai though ini melakukan tidak exist. itu melakukan tidak berarti sebuah failed audit fetch proves Amazon saw sebuah izinkan-semua state; audit dan Amazon dapat menjadi reaching host di berbeda times atau melalui berbeda network paths. Evidence for this claim Amazon says its crawlers may use a robots.txt copy cached within the previous 30 days. Scope: Amazon crawler behavior only; a current audit fetch cannot identify which cached copy Amazon used. Confidence: high · Verified: Amazon: Amazonbot Evidence for this claim Amazon says its crawlers behave as if robots.txt does not exist when they cannot fetch it. Scope: Amazon crawler behavior only; a tool-side fetch failure is not proof that Amazon observed the same failure. Confidence: high · Verified: Amazon: Amazonbot
Meta berjalan Meta-ExternalAgent (training/pengindeksan untuk Llama dan Meta AI), Meta-ExternalFetcher (pengguna fetch), dan secara terpisah Facebookbot (tautan previews — tidak sebuah AI crawler). Blocking Meta-ExternalAgent tidak memengaruhi Anda Facebook tautan previews.
umum crawl (CCBot) adalah jalankan oleh sebuah non-profit foundation itu maintains sebuah open web archive. ini adalah hidden layer: umum crawl dataset memiliki telah digunakan untuk train ChatGPT, Claude, LLaMA, dan banyak others — so blocking CCBot memiliki downstream effects pada models itu tidak pernah crawl Anda secara langsung. umum crawl juga warns itu impostors spoof CCBot.
ByteDance (Bytespider) adalah aggressive satu: declared sebagai respecting robots.txt, tetapi widely reported violating ini, dengan very tinggi permintaan volumes. Others worth knowing: AI2Bot (Allen Institute, open models / Dolma dataset), Cohere, Diffbot (structured-data extraction milik siapa output feeds banyak downstream AI pipelines), dan Timpibot / webzio-extended.
melakukan AI bot sebenarnya obey robots.txt?
untuk training dan penelusuran crawler, major operators (OpenAI, Anthropic, Google, Apple, Amazon) semua state di mereka docs itu mereka respect robots.txt. contested zone adalah pengguna-triggered fetchers, di mana several operators explicitly say robots.txt dapat tidak apply karena sebuah person initiated permintaan — OpenAI says “these actions are initiated by a user, robots.txt rules may not apply” (terjemahan) “ini tindakan adalah initiated oleh sebuah pengguna, robots.txt aturan dapat tidak apply”; Perplexity says Perplexity-pengguna “generally ignores robots.txt rules.” (terjemahan) “umumnya ignores robots.txt aturan.” itu’s stated policy, tidak sebuah violation.
** Perplexity controversy** adalah headline dispute, dan I’ll flag ini sebagai
reported, tidak settled. di June 2024, Wired dan developer Robb Knight reported itu
Perplexity accessed konten dari situs itu memiliki blocked ini, apparently menggunakan
unlisted IPs. di August 2025, Cloudflare reported itu Perplexity digunakan sebuah stealth
pengguna-agent impersonating Chrome pada macOS, rotated IPs dan ASNs untuk evade blocks, dan
fetched konten dari newly dibuat test domains itu carried sebuah penuh Disallow: / —
dan Cloudflare subsequently delisted Perplexity sebagai sebuah verified bot. Present ini sebagai
terdokumentasi reporting dari itu sources; Perplexity’s own docs maintain itu
PerplexityBot respects robots.txt.
Karena beberapa bot ignore robots.txt di beberapa tingkat, Cloudflare memiliki become practical enforcement layer — network-tingkat blocking, sebuah satu-click “AI Scrapers and Crawlers” (terjemahan) “AI Scrapers dan crawler” toggle, managed robots.txt, robots.txt-violation tracking, dan sebuah pay-per-crawl beta. sebagai dari July 2025, baru Cloudflare domains block known AI crawler oleh default.
cara control AI crawler
- Per-pengguna-agent robots.txt adalah utama lever, dan ini adalah granular: blocking
GPTBotmelakukan tidak blockOAI-SearchBotatauChatGPT-User. robots.txt recipes (block semua training bot, block AI-penelusuran bot) adalah di Scripts tab. - ** training tokens** —
Google-ExtendeddanApplebot-Extended— opt Anda out dari Gemini/Apple-Intelligence training dengan Tidak penelusuran cost. - Amazon’s
noarchivemeta tag adalah sebuah per-halaman training opt-out untuk Amazon. - Cloudflare AI crawl Control — block/izinkan/charge di network tingkat, plus
managed robots.txt dan konten Sinyal directives (
search,ai-input,ai-train); default adalahsearch=yes, ai-train=no. - llms.txt adalah sebuah proposal (Jeremy Howard / jawaban.AI, Sept 2024), tidak sebuah adopted standard — dan tidak honored oleh major crawler. ini adalah sebuah curated markdown map dimaksudkan untuk menjadi baca di inference time, tetapi sebuah Ahrefs study dari 137K situs ditemukan 97% dari published llms.txt files mendapatkan zero permintaan, dan Tidak major LLM provider memiliki formally adopted ini. Treat ini sebagai documentation tooling, tidak AI-penelusuran tooling.
- ** ai.robots.txt community project** maintains sebuah comprehensive
Disallow: /file listing 150+ AI bot pengguna-agents — sebuah berguna reference untuk blanket blocking.
sebuah visibilitas-pertama crawler policy
untuk sebuah publik educational atau commercial situs itu ingin AI-penelusuran visibilitas, my default policy adalah:
- Izinkan conventional penelusuran crawler itu feed penelusuran surfaces Anda ingin, including Googlebot dan Bingbot.
- Izinkan terdokumentasi AI-penelusuran/pengindeksan crawler such sebagai
OAI-SearchBot,Claude-SearchBot, danPerplexityBotpada publik konten. - Izinkan yang dimaksud pengguna-directed fetchers such sebagai
ChatGPT-User,Claude-User, danPerplexity-User, sementara recognizing itu provider robots perilaku differs.
- membuat sebuah terpisah rights decision untuk training/model-development access.
GPTBot,ClaudeBot,Google-Extended, dan lainnya training controls melakukan tidak perlu untuk share penelusuran policy. Izinkan them hanya jika itu gunakan matches Anda penerbitan policy. - Lindungi privat dan operational routes dengan authentication. pertahankan
/admin/, previews, account data, dan non-publik APIs behind server-side authorization; sebuahDisallowadalah hanya sebuah crawler preference. - Verify identity sebelum bypassing WAF controls. Combine terdokumentasi pengguna-agent dengan saat ini provider IP ranges, reverse-DNS verification, atau didukung bot authentication. tidak pernah buat broad WAF izinkan aturan dari sebuah spoofable pengguna-agent alone.
jangan tambahkan sebuah spesifik pengguna-agent group merely untuk say Allow: / unless Anda repeat
setiap restriction itu harus masih apply untuk itu crawler. di bawah robots matching
aturan, sebuah spesifik group dapat supersede wildcard group alih-alih inherit -nya
privat-path exclusions di bawah provider-spesifik robots parsing. simplest safe
file adalah sering satu independently safe wildcard group plus narrowly scoped training
opt-outs.
untuk ini situs secara khusus, saat ini publik policy adalah sebuah jelas izinkan posture
untuk penelusuran, AI input, dan AI training sementara excluding admin, preview, API, trap,
dan gateway routes. I akan pertahankan penelusuran dan pengguna-directed retrieval diizinkan. I
akan perubahan ai-train=yes hanya sebagai sebuah editorial-rights decision—tidak sebagai sebuah AI
visibilitas tactic—karena training access memiliki Tidak demonstrated citation benefit.
AI crawler access adalah tidak AI readiness
sebuah izinkan aturan proves, di sebagian besar, itu declared robots policy permits sebuah named agent untuk permintaan sebuah URL. ini melakukan tidak prove operator obeyed policy, fetched halaman, dirender ini, extracted penting informasi, placed ini di model context, cited ini, atau selesai sebuah tindakan.
pertahankan five layers terpisah:
| Layer | pertanyaan | Evidence |
|---|---|---|
| Permission | dapat ini named agent permintaan URL di bawah declared policy? | Effective robots dan network-access test |
| Extractability | adalah penting konten present di stable text, tautan, metadata, atau data terstruktur? | Mentah dan dirender capture dengan field extraction |
| rendering | melakukan konten survive agent’s sebenarnya browser/JavaScript kemampuan? | Provider-spesifik fetch evidence di mana tersedia; jika tidak sebuah stated test limitation |
| Operability | dapat sebuah agent identify dan safely invoke yang dimaksud tindakan? | Terdokumentasi alat/interface contract dan controlled end-untuk-end test |
| Commerce readiness | melakukan identity, price, availability, policy, fulfillment, cart, dan checkout agree? | Feed/halaman/backend/order reconciliation |
sebuah crawler-access checker seharusnya karena itu report diizinkan, blocked, atau indeterminate untuk policy—tidak “AI ready.” sebuah successful log permintaan proves itu permintaan occurred; ini adalah tidak evidence itu halaman adalah digunakan di sebuah jawaban. sebuah valid feed atau alat declaration likewise melakukan tidak prove itu sebuah publik halaman renders correctly atau itu checkout dapat fulfill represented offer.
gunakan Bagaimana AI Penelusuran berfungsi untuk retrieval dan citation layers, dan AI Shopping Optimization untuk catalog dan transaction readiness. Mempertahankan layers terpisah membuat remedy spesifik: perbaiki access policy untuk sebuah block, halaman output untuk extraction, rendering untuk sebuah missing state, sebuah interface contract untuk operability, atau commerce data untuk sebuah failed purchase.
untuk ecommerce halaman, extractability test seharusnya verify itu core product identity dan dipilih offer—SKU, group ID, price, currency, dan availability—exist di awal respons dan masih agree setelah rendering. mentah-versus-dirender product-halaman standard defines apa seharusnya menjadi server-terlihat; crawler permission alone says tidak ada apa pun tentang itu contract.
myth itu costs Anda traffic: training ≠ AI-penelusuran
Di sini’s satu untuk mendapatkan right. Blocking training bot adalah tidak yang sama sebagai blocking AI-penelusuran bot. mereka’re terpisah robots.txt aturan dengan opposite consequences:
- Block training bot (GPTBot, ClaudeBot, CCBot, Bytespider, plus Google-Extended/Applebot-Extended tokens) → Tidak effect pada Google rankings, confirmed oleh Google dan oleh empirical publisher data. Anda’re opting out dari model training, penuh berhenti.
- Block AI-penelusuran bot (OAI-SearchBot, PerplexityBot) → Anda lose visibilitas di ChatGPT dan Perplexity jawaban. itu’s sebuah nyata trade-off, tidak sebuah free lunch.
jika Anda block too broadly — say, sebuah blanket block itu catches OAI-SearchBot sementara Anda hanya dimaksudkan untuk berhenti training — Anda dapat diam-diam hapus yourself dari AI penelusuran. menjadi precise tentang yang category setiap aturan hits.
Mengapa publishers block di semua: social contract
alasan ini adalah bahkan sebuah debate muncul down untuk traffic. sebagai I’ve put ini di my AI bot analysis, “there’s a cost to bots crawling your websites and there’s a social contract between search engines and website owners, where search engines add value by sending referral traffic to websites. Google sends traffic (for now), so they don’t get blocked.” (terjemahan) “ada sebuah cost untuk bot crawling Anda situs web dan ada sebuah social contract antara penelusuran mesin dan situs web owners, di mana mesin pencari tambahkan nilai oleh sending referral traffic untuk situs web. Google mengirim traffic (untuk now), so mereka jangan mendapatkan blocked.” AI crawler, so far, mostly jangan kirim traffic back — dan data backs unease. di my Cloudflare Radar analysis, AI bot adalah sudah firmly #2 crawler behind mesin pencari dan pada track untuk overtake them. Lebih di Stats tab.
Disclosure: I am sebuah former Ahrefs employee dan menerima complimentary Ahrefs access. ditautkan crawler analysis adalah my published berfungsi dari itu role; Ahrefs melakukan tidak review atau approve ini situs’s saat ini editorial conclusions.untuk lebih luas pipeline ini sits di dalam — penemuan, crawl scheduler, rendering, dan bagaimana crawling differs dari pengindeksan — see crawling hub, dan sibling topics pada sebuah crawler di umum, pengguna-agent, Googlebot, Bingbot, dan robots.txt.
AI summary
sebuah condensed take pada Advanced versi:
- AI crawler adalah three categories, tidak satu — dan conflating them adalah core mistake.
- Training: GPTBot, ClaudeBot, CCBot, Bytespider, Amazonbot, Meta-ExternalAgent, AI2Bot, Cohere, Diffbot — scrape untuk bangun model corpora.
- AI-penelusuran/pengindeksan: OAI-SearchBot, PerplexityBot, Applebot, Amzn-SearchBot — bangun citing indeks.
- pengguna-triggered fetchers: ChatGPT-pengguna, Perplexity-pengguna, Claude-pengguna — fetch sebuah halaman langsung ketika sebuah person menanyakan.
- setiap bot memiliki -nya own pengguna-agent dan -nya own robots.txt aturan. Blocking GPTBot melakukan tidak block OAI-SearchBot atau ChatGPT-pengguna.
- Google-Extended dan Applebot-Extended adalah tokens, tidak bot — mereka jangan crawl; mereka hanya opt Anda out dari training/grounding. Disallowing them memiliki zero penelusuran cost.
- Blocking training bot ≠ hurting SEO. Google: Google-Extended “melakukan tidak impact a site’s inclusion di Google Search.” (terjemahan) “melakukan tidak impact sebuah situs’s inclusion di Google Search.” Empirical publisher data agrees.
- Blocking AI-penelusuran bot melakukan cut AI visibilitas di ChatGPT/Perplexity — sebuah nyata trade-off.
- Amazon’s Amzn-SearchBot dan Amzn-pengguna melakukan Tidak train pada di-crawl konten (per Amazon). “All AI bots train” (terjemahan) “semua AI bot train” adalah sebuah myth.
- robots.txt debate: pengguna-triggered fetchers carve themselves out (“mungkin tidak apply” (terjemahan) “dapat tidak apply”); Perplexity adalah reported (Wired/Robb Knight 2024; Cloudflare 2025) untuk gunakan stealth crawler — present sebagai reported, tidak settled.
- llms.txt adalah sebuah proposal, tidak adopted — 97% dari files unread; Tidak major LLM mendukung ini. Cloudflare adalah practical enforcement layer.
Dokumentasi resmi
Utama-sumber documentation dari AI operators dan relevant proposals.
OpenAI
- OpenAI bot / crawler — GPTBot, OAI-SearchBot, ChatGPT-pengguna, OAI-AdsBot, dan “each bot setting is independent” (terjemahan) “setiap bot setting adalah independent” policy.
Anthropic
- melakukan Anthropic crawl data dari web? — ClaudeBot, Claude-SearchBot, Claude-pengguna, robots controls, dan saat ini IP-list verification.
- Anthropic crawler IP list — provider-spesifik verification data.
- Google umum crawler (incl. Google-Extended) — product tokens dan pengguna-agents.
- AI fitur dan Anda situs web — Googlebot, tidak Google-Extended, controls inclusion di AI Overviews dan AI Mode.
Apple
- tentang Applebot — Applebot vs Applebot-Extended, dan “Applebot-Extended does not crawl webpages” (terjemahan) “Applebot-Extended melakukan tidak crawl webpages” pembedaan.
Amazon
- Amazonbot — Amazonbot, Amzn-SearchBot, Amzn-pengguna,
noarchivetraining opt-out, dan yang bot melakukan tidak train.
Perplexity
- Perplexity crawler — PerplexityBot dan Perplexity-pengguna, including “generally ignores robots.txt rules” (terjemahan) “umumnya ignores robots.txt aturan” statement.
umum crawl
- CCBot — non-profit crawler behind banyak LLM training data, plus impersonation warning.
Allen Institute untuk AI
- AI2 crawler notice — AI2Bot dan cara filter ini.
Cloudflare (AI crawler controls)
- AI crawl Control — block/izinkan/charge, monitoring, dan robots.txt violation tracking.
- Managed robots.txt — auto-maintained AI-crawler directives.
- Control konten gunakan untuk AI training — managed robots.txt, konten Sinyal, dan pay-per-crawl.
** proposal**
- llms.txt specification — inference-time map proposal (sebuah proposal, tidak sebuah adopted standard).
- ai.robots.txt project — community-maintained list dari AI bot pengguna-agents.
Quotes dari sumber
pada—record statements dari operators dan proposals. setiap tautan adalah sebuah deep tautan itu jumps untuk quoted passage di mana verified.
OpenAI — independent bot, independent purposes
- “Setiap bot setting adalah independent, allowing webmasters granular control over bagaimana mereka konten interacts dengan berbeda OpenAI sistem.” (terjemahan) “setiap bot setting adalah independent, allowing webmasters granular control di atas bagaimana mereka konten interacts dengan berbeda OpenAI sistem.” — OpenAI bot documentation. Jump untuk quote
- GPTBot adalah “used to make our generative AI foundation models more useful and safe.” (terjemahan) “digunakan untuk membuat kami generative AI foundation models lebih berguna dan safe.” OAI-SearchBot adalah “digunakan untuk surface websites di penelusuran hasil di ChatGPT’s penelusuran features.” (terjemahan) “digunakan untuk surface situs web di hasil pencarian di ChatGPT’s penelusuran fitur.” ChatGPT-pengguna: karena “these actions are initiated by a user, robots.txt rules may not apply.” (terjemahan) “ini tindakan adalah initiated oleh sebuah pengguna, robots.txt aturan dapat tidak apply.” Jump untuk quote
Anthropic — robots controls dan verification cakupan
- Anthropic documents ClaudeBot, Claude-SearchBot, dan Claude-pengguna, mereka robots controls, dan sebuah shared IP-list verification metode. Sumber
Google — token, tidak sebuah bot
- “Google-Extended does not impact a site’s inclusion in Google Search nor is it used as a ranking signal in Google Search.” (terjemahan) “Google-Extended tidak memengaruhi penyertaan situs dalam Google Search dan tidak digunakan sebagai sinyal peringkat di Google Search.” Jump untuk quote
Apple — Applebot-Extended tidak crawl
- “Applebot-Extended does not crawl webpages. Webpages that disallow Applebot-Extended can still be included in search results.” (terjemahan) “Applebot-Extended tidak melakukan crawling pada halaman web. Halaman yang melarang Applebot-Extended tetap dapat disertakan dalam hasil pencarian.” Jump untuk quote
Perplexity — pengguna fetcher’s carve-out
- PerplexityBot adalah “designed to surface and link websites in search results on Perplexity. It is not used to crawl content for AI foundation models.” (terjemahan) “designed untuk surface dan tautan situs web di hasil pencarian pada Perplexity. ini adalah tidak digunakan untuk crawl konten untuk AI foundation models.” Perplexity-pengguna: “Since a user requested the fetch, this fetcher generally ignores robots.txt rules.” (terjemahan) “Since sebuah pengguna requested fetch, ini fetcher umumnya ignores robots.txt aturan.” Jump untuk quote
umum crawl — hidden training layer
- CCBot ada untuk “democratizing access to web information by producing and maintaining an open repository of web crawl data.” (terjemahan) “democratizing access untuk web informasi oleh producing dan maintaining sebuah open repository dari web crawl data.” Note: “we are aware of crawlers falsely identifying themselves as CCBot.” (terjemahan) “kami adalah aware dari crawler falsely identifying themselves sebagai CCBot.” Jump untuk quote
llms.txt — sebuah proposal, oleh -nya own deskripsi
- “A proposal to standardise on using an
/llms.txtfile to provide information to help LLMs use a website at inference time.” (terjemahan) “Sebuah proposal untuk menstandardisasi penggunaan file/llms.txtguna menyediakan informasi agar LLM dapat menggunakan situs web saat inferensi.” — llms.txt specification. Jump untuk quote
Me — social contract
- “There’s a cost to bots crawling your websites and there’s a social contract between search engines and website owners, where search engines add value by sending referral traffic to websites. Google sends traffic (for now), so they don’t get blocked.” (terjemahan) “ada sebuah cost untuk bot crawling Anda situs web dan ada sebuah social contract antara mesin pencari dan situs web owners, di mana mesin pencari tambahkan nilai oleh sending referral traffic untuk situs web. Google mengirim traffic (untuk now), so mereka jangan mendapatkan blocked.” — Patrick Stox, Ahrefs. Baca piece
master AI-crawler table
centerpiece. setiap major AI bot, -nya pengguna-agent token, operator, category, dan
stated robots.txt compliance. Copy tokens persis — spelling dan case penting di
robots.txt.
| bot | UA token | Operator | Category | Obeys robots.txt? |
|---|---|---|---|---|
| GPTBot | GPTBot | OpenAI | Training | Ya (stated) |
| OAI-SearchBot | OAI-SearchBot | OpenAI | AI-penelusuran | Ya (stated) |
| ChatGPT-pengguna | ChatGPT-User | OpenAI | pengguna fetch | ”May not apply” (terjemahan) “dapat tidak apply” (pengguna-initiated) |
| OAI-AdsBot | OAI-AdsBot | OpenAI | Ads (tidak training) | Ya (stated) |
| ClaudeBot | ClaudeBot | Anthropic | Training | Ya (stated) |
| Claude-SearchBot | Claude-SearchBot | Anthropic | AI-penelusuran | Ya untuk pengindeksan |
| Claude-pengguna | Claude-User | Anthropic | pengguna fetch | Ya (Anthropic status semua -nya bot honor robots.txt) |
| Google-Extended | Google-Extended (token hanya — Tidak terpisah UA) | Training/grounding control | Ya (opt-out token) | |
| Google-CloudVertexBot | Google-CloudVertexBot | Owner-requested Vertex AI | Ya | |
| PerplexityBot | PerplexityBot | Perplexity | AI-penelusuran | Ya untuk pengindeksan (tetapi see disputes) |
| Perplexity-pengguna | Perplexity-User | Perplexity | pengguna fetch | ”Generally ignores” (terjemahan) “umumnya ignores” (stated) |
| Applebot | Applebot | Apple | AI-penelusuran (+ training) | Ya |
| Applebot-Extended | Applebot-Extended (token hanya — melakukan tidak crawl) | Apple | Training control | Ya (opt-out token) |
| Amazonbot | Amazonbot | Amazon | Training | Ya (stated) |
| Amzn-SearchBot | Amzn-SearchBot | Amazon | AI-penelusuran (Tidak training) | Ya (stated) |
| Amzn-pengguna | Amzn-User | Amazon | pengguna fetch (Alexa; Tidak training) | Ya (stated) |
| Meta-ExternalAgent | meta-externalagent | Meta | Training/pengindeksan | Ya (stated) |
| Meta-ExternalFetcher | meta-externalfetcher | Meta | pengguna fetch | Stated |
| CCBot | CCBot | umum crawl | Training (open data) | Ya; impersonators exist |
| Bytespider | Bytespider | ByteDance | Training | Contested — see disputes |
| AI2Bot | AI2Bot | Allen Institute | Training | Ya (stated) |
| cohere-training-data-crawler | cohere-training-data-crawler | Cohere | Training | Ya (stated) |
| Diffbot | Diffbot | Diffbot | Training/extraction | Ya oleh default |
| Timpibot | Timpibot | Timpi | Training | Ya (stated) |
| webzio-extended | webzio-extended | Webz.io | Training | Stated |
** three aturan itu fall out dari table**
- Blocking sebuah training bot (GPTBot, ClaudeBot, CCBot…) → Tidak peringkat effect.
- Blocking sebuah AI-penelusuran bot (OAI-SearchBot, PerplexityBot) → lose AI-jawaban visibilitas.
- Google-Extended dan Applebot-Extended adalah tokens, tidak crawler — pure training opt-outs dengan Tidak penelusuran cost.
Fast facts
- GPTBot ≠ OAI-SearchBot ≠ ChatGPT-pengguna — three independent OpenAI aturan.
- Amazon’s
Amzn-SearchBotdanAmzn-Usermelakukan tidak train pada di-crawl konten. - Amazon honors
noarchivemeta sebagai sebuah Tidak-training per-halaman sinyal. - llms.txt adalah sebuah proposal, tidak sebuah adopted standard; major crawler jangan honor ini.
- Block oleh pengguna-agent di robots.txt, tidak oleh IP (IP blocks dapat berhenti sebuah bot reading Anda robots.txt di semua).
cara audit dan decide apa untuk izinkan
sebuah practical lulus untuk deciding yang AI crawler untuk izinkan, block, atau hanya watch.
- Pull Anda server logs dan list yang AI pengguna-agents adalah sebenarnya hitting Anda (GPTBot, ClaudeBot, CCBot, Bytespider, OAI-SearchBot, PerplexityBot, Applebot, dan seterusnya.) dan bagaimana sering. Logs adalah ground truth.
- Sort setiap satu ke -nya category — training, AI-penelusuran, atau pengguna fetch. Decisions ikuti dari category, tidak brand.
- Decide Anda training stance. Comfortable menjadi trained pada? memungkinkan
training bot. Tidak comfortable? Block GPTBot, ClaudeBot, CCBot, Bytespider,
Amazonbot, Meta-ExternalAgent — dan tambahkan
Google-ExtendeddanApplebot-Extendedtokens. None dari ini memengaruhi Google rankings. - Decide Anda AI-penelusuran stance — dengan hati-hati. jika Anda ingin muncul di ChatGPT dan Perplexity jawaban, pertahankan OAI-SearchBot dan PerplexityBot diizinkan. hanya block ini jika Anda genuinely ingin out dari AI penelusuran.
- jangan catch wrong bot. Konfirmasi sebuah “block training” (terjemahan) “block training” aturan tidak juga hitting sebuah AI-penelusuran bot. GPTBot ≠ OAI-SearchBot.
- Block oleh pengguna-agent, tidak oleh IP — IP blocks dapat mencegah sebuah bot dari reading Anda robots.txt (Anthropic’s jelas warning).
- Verify suspicious bot. CCBot dan others mendapatkan impersonated; periksa published IP ranges / reverse DNS sebelum trusting sebuah pengguna-agent string.
- pertimbangkan network-tingkat enforcement (Cloudflare AI crawl Control) untuk bot itu jangan reliably honor robots.txt.
- Skip llms.txt sebagai sebuah SEO move — ini adalah sebuah proposal, largely unread, dan tidak honored oleh major crawler. jangan expect AI-penelusuran visibilitas dari ini.
- Re-periksa quarterly. baru bot muncul constantly ( ai.robots.txt list adalah sebuah baik reference) dan operators perubahan perilaku.
mistake itu costs Anda AI-penelusuran traffic
Conflating training bot dengan AI-penelusuran bot adalah single sebagian besar expensive mistake di ini space, dan ini adalah satu I called out di atas sebagai myth untuk kill. sebuah aturan dimaksudkan untuk berhenti model training dan sebuah aturan dimaksudkan untuk berhenti AI-penelusuran citation adalah tidak yang sama aturan — mixing them up memiliki opposite consequences.
- Wrong: blocking “AI bots” (terjemahan) “AI bot” sebagai satu blob (sebuah single
Disallowaturan itu happens untuk catch GPTBot dan OAI-SearchBot). Mengapa ini adalah wrong: ini silently menghapus Anda dari ChatGPT dan Perplexity jawaban sementara Anda thought Anda adalah hanya opting out dari training. melakukan alih-alih: tulis terpisah, named aturan per bot — block GPTBot/ClaudeBot/CCBot/Bytespider untuk training, dan leave OAI-SearchBot/PerplexityBot diizinkan unless Anda dengan sengaja ingin out dari AI penelusuran.
Confusing identity verification dengan access policy
sebuah provider-published IP list dapat help verify siapa dikirim sebuah permintaan. ini melakukan tidak tell Anda apa Anda policy seharusnya menjadi, dan ini melakukan tidak turn sebuah network block ke sebuah robots aturan.
- Wrong: treating sebuah verified range sebagai sebuah automatic izinkan/block decision.
Mengapa ini adalah wrong: identity, declared crawl preference, dan enforced network access
adalah terpisah facts.
melakukan alih-alih: express crawl policy dengan terdokumentasi
User-agenttoken; tambahkan network-tingkat enforcement (Cloudflare AI crawl Control) pada top untuk bot itu jangan reliably respect file.
Treating llms.txt sebagai sebuah AI-penelusuran lever
llms.txt mendapatkan pitched constantly sebagai “itu robots.txt untuk AI penelusuran,” (terjemahan) “ robots.txt untuk AI penelusuran,” dan itu framing adalah wrong per artikel’s own sourcing.
- Wrong: penerbitan sebuah
llms.txtfile expecting ini untuk boost AI-penelusuran visibilitas atau citations. Mengapa ini adalah wrong: ini adalah sebuah proposal, tidak sebuah adopted standard — sebuah Ahrefs study dari 137K situs ditemukan 97% dari published llms.txt files mendapatkan zero permintaan, dan Tidak major LLM provider memiliki formally adopted ini. melakukan alih-alih: treat llms.txt sebagai documentation tooling di best, dan put effort kerobots.txtaturan dan AI-penelusuran bot itu sebenarnya control visibilitas.
Trusting sebuah pengguna-agent string tanpa verifying ini
CCBot di particular mendapatkan impersonated, oleh umum crawl’s own admission, dan Bytespider adalah widely reported untuk ignore aturan ini claims untuk respect.
- Wrong: assuming sebuah
User-agentstring di Anda logs adalah siapa ini claims untuk menjadi. Mengapa ini adalah wrong: sebuah spoofed atau non-compliant bot dapat hit Anda di penuh volume sementara sebuahrobots.txtaturan sits di sana unenforced. melakukan alih-alih: konfirmasi tinggi-volume atau suspicious hits terhadap operator’s published IP ranges atau reverse DNS sebelum trusting string — alat tab memiliki sebuah alat dibangun untuk persis ini periksa.
decision: izinkan, block, atau monitor
1. Categorize pertama — ini decides semuanya. Training vs AI-penelusuran vs pengguna-fetch. Mendapatkan category right dan consequence adalah obvious: training blocks adalah SEO-safe; AI-penelusuran blocks cost Anda AI visibilitas; pengguna-fetch adalah contested.
2. izinkan / block / monitor aturan.
- Izinkan AI-penelusuran bot (OAI-SearchBot, PerplexityBot, Applebot) jika Anda ingin AI referral visibilitas — sebagian besar situs seharusnya.
- Block training bot (GPTBot, ClaudeBot, CCBot, Bytespider) jika Anda tidak ingin untuk menjadi trained pada — zero peringkat cost. tambahkan Google-Extended/Applebot-Extended tokens untuk Gemini/Apple training.
- Monitor pengguna-triggered fetchers dan known buruk actors (Bytespider, undeclared Perplexity traffic). robots.txt dapat tidak berhenti them; logs dan network-tingkat aturan adalah bagaimana Anda sebenarnya see dan gate them.
3. “token, not bot” (terjemahan) “token, tidak bot” periksa. sebelum Anda alasan tentang crawl traffic, tanyakan: adalah ini sebuah sebenarnya crawler atau sebuah control token? Google-Extended dan Applebot-Extended generate Tidak traffic — mereka hanya flip sebuah permission pada traffic itu sudah happened.
4. Training ≠ AI-penelusuran ( expensive mistake). Dua terpisah robots.txt aturan, opposite consequences. tidak pernah block “AI bots” (terjemahan) “AI bot” sebagai satu blob — Anda’ll either fail untuk berhenti training atau accidentally delete yourself dari AI jawaban.
5. robots.txt adalah sebuah permintaan; enforcement adalah terpisah. protocol berfungsi untuk compliant bot. untuk ones itu carve themselves out (pengguna fetchers) atau adalah reported untuk ignore ini (Perplexity stealth crawler, Bytespider), nyata enforcement adalah network-tingkat (Cloudflare) — robots.txt alone tidak akan melakukan ini.
seharusnya I block ini AI bot?
ini decision tree walks izinkan/block/monitor aturan dari Kerangka kerja tab langkah oleh langkah. Mulai oleh identifying yang dari three categories bot belongs untuk, lalu jawaban satu pertanyaan itu decides -nya fate.
Should I block this AI bot?
Quarterly AI-bot robots.txt audit
sebuah recurring periksa mempertahankan Anda robots.txt aturan cocok untuk reality sebagai baru AI bot muncul dan operators perubahan perilaku — Checklists tab sudah flags “re-periksa quarterly,” (terjemahan) “re-periksa quarterly,” dan ini adalah langkah-oleh-langkah versi dari itu flag.
- Pull quarter’s AI-bot hits. Jalankan Anda server logs melalui situs’s Log File Analyzer atau grep untuk known pengguna-agent list ( Scripts tab memiliki tepat command) untuk see yang AI bot sebenarnya hit Anda dan bagaimana sering.
- Re-periksa setiap bot’s category. Cross-reference setiap pengguna-agent terhadap master table di Cheat Sheets tab untuk konfirmasi ini adalah masih training, AI-penelusuran, atau pengguna-fetch — dan flag apa pun baru, unrecognized bot terhadap ai.robots.txt project list.
- Test Anda saat ini aturan. Jalankan langsung
robots.txtmelalui robots.txt Tester terhadap setiap bot’s pengguna-agent untuk konfirmasi training aturan tidak accidentally catching sebuah AI-penelusuran bot. - Verify suspicious atau tinggi-volume hits. Konfirmasi bot like CCBot atau Bytespider terhadap operator’s published IP ranges atau reverse DNS dengan Googlebot Verifier sebelum trusting pengguna-agent string — impersonation happens.
- Log quarter’s AI-bot crawl share. Note split dari training vs AI-penelusuran vs pengguna-fetch traffic (see cara mengukur tab) so berikutnya quarterly periksa memiliki sebuah trend untuk bandingkan terhadap, tidak hanya sebuah snapshot.
Konfirmasi Anda robots.txt edit melakukan apa Anda dimaksudkan
setelah editing robots.txt untuk block training bot, jalankan ini memeriksa sebelum Anda pertimbangkan perubahan selesai — goal adalah proving AI-penelusuran bot masih reach Anda halaman sementara training bot adalah sebenarnya disallowed.
Test 1: AI-penelusuran bot masih diizinkan
- Test untuk jalankan: periksa URL terhadap
OAI-SearchBotdanPerplexityBotpengguna-agents dengan robots.txt Tester, atau konfirmasi nyata hits dengan Googlebot Verifier. - Yang diharapkan hasil: “Diizinkan” (terjemahan) “Diizinkan” untuk keduanya pada apa pun halaman Anda ingin cited di AI jawaban.
- Failure interpretation: sebuah “Disallowed” (terjemahan) “Disallowed” hasil berarti Anda training-block aturan adalah too broad dan caught wrong pengguna-agent.
- Monitoring window: immediate untuk tester; izinkan sebuah sedikit days untuk bot’s own cached copy dari robots.txt untuk refresh.
- Rollback trigger: sebuah AI-penelusuran bot Anda dimaksudkan untuk izinkan menampilkan Disallowed, atau citations/referrals dari itu mesin drop setelah perubahan.
Test 2: Training bot sebenarnya disallowed
- Test untuk jalankan: periksa yang sama URL terhadap
GPTBot,ClaudeBot,CCBot, danBytespiderdengan robots.txt Tester. - Yang diharapkan hasil: “Disallowed” (terjemahan) “Disallowed” untuk setiap.
- Failure interpretation: sebuah “Diizinkan” (terjemahan) “Diizinkan” hasil biasanya berarti sebuah typo di token — spelling dan case penting di robots.txt.
- Monitoring window: immediate.
- Rollback trigger: none diperlukan — sebuah training block tidak perlu sebuah rollback path unless Anda decide Anda’re fine dengan training setelah semua.
Test 3: Google rankings unaffected
- Test untuk jalankan: periksa Search Console performa/indeks Coverage untuk
affected URLs sebuah sedikit weeks setelah blocking training bot atau
Google-Extendedtoken. - Yang diharapkan hasil: Tidak ada perubahan material pada tayangan atau peringkat—Google menyatakan
Google-Extended“does not impact a site’s inclusion in Google Search.” (terjemahan) “tidak memengaruhi penyertaan situs dalam Google Search.” - Failure interpretation: sebuah wide impressions drop coinciding dengan perubahan biasanya berarti Googlebot itself mendapat caught oleh sebuah too-broad aturan.
- Monitoring window: 2-4 weeks (Search Console reporting lag).
- Rollback trigger: impressions atau rankings drop dan Googlebot menampilkan Disallowed pada sebuah URL itu seharusnya menjadi dapat di-crawl.
standing KPIs untuk AI-bot traffic
Tracking ini quarter di atas quarter tells Anda apakah Anda AI-bot posture adalah sebenarnya melakukan apa Anda intend — terpisah dari apa pun single robots.txt edit.
| Metric | Apa ini tells Anda | cara pull ini | Benchmark / realistic range | Cadence |
|---|---|---|---|---|
| AI-bot share dari total crawl traffic, oleh category (training / AI-penelusuran / pengguna-fetch) | Apakah AI bot adalah becoming sebuah bigger share dari Anda total crawl muat, dan yang category adalah driving ini | server logs melalui Log File Analyzer, atau Cloudflare AI crawl Control jika Anda’re pada Cloudflare | Tidak universal target — Cloudflare Radar put AI bot di roughly 18,9% dari semua bot permintaan industry-wide (2025), tetapi Anda own situs’s mix adalah apa penting; establish Anda own baseline pertama quarter, lalu track trend | Quarterly |
| crawl-untuk-referral ratio per AI-penelusuran bot | Bagaimana banyak crawl “rent” (terjemahan) “rent” Anda’re paying untuk setiap unit dari AI-penelusuran referral traffic | Cross-reference server-log crawl counts untuk itu pengguna-agent terhadap sebenarnya referral visits di analytics | Tidak fixed target — artikel’s own Stats tab cites roughly 14 Google melakukan crawl per referral versus far lebih tinggi ratios untuk AI crawler; expect Anda ratio untuk menjadi worse daripada Google’s dan watch trend, tidak absolute angka | Quarterly |
| Training-block accuracy | Apakah apa pun training-bot Disallow aturan adalah unintentionally juga catching sebuah AI-penelusuran atau pengguna-fetch bot | Audit robots.txt terhadap master table di Cheat Sheets tab; konfirmasi dengan robots.txt Tester | seharusnya menjadi zero — Tidak AI-penelusuran bot seharusnya ever tampilkan up blocked oleh sebuah aturan dimaksudkan untuk training bot | setiap robots.txt perubahan, plus sebuah quarterly audit |
robots.txt — block major bot
Block training crawler, pertahankan AI penelusuran. ini opts Anda out dari model training sementara staying terlihat di ChatGPT/Perplexity jawaban. Copy tokens persis.
# --- AI training crawlers ---
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Bytespider
Disallow: /
User-agent: meta-externalagent
Disallow: /
User-agent: Amazonbot
Disallow: /
# --- Training control tokens (not crawlers) ---
# Opt out of Gemini/Vertex training; search unaffected
User-agent: Google-Extended
Disallow: /
# Opt out of Apple Intelligence training; Applebot search unaffected
User-agent: Applebot-Extended
Disallow: /Block AI-penelusuran indexers (ini REDUCES AI-jawaban visibilitas). hanya melakukan ini jika Anda genuinely ingin out dari ChatGPT/Perplexity jawaban.
User-agent: OAI-SearchBot
Disallow: /
User-agent: PerplexityBot
Disallow: /key principle: blocking GPTBot melakukan tidak block OAI-SearchBot atau
ChatGPT-User — setiap adalah sebuah independent aturan.
Spot AI bot di Anda access logs
temukan yang AI pengguna-agents adalah hitting Anda dan bagaimana sering.
macOS / Linux
# Count hits per known AI bot in an Apache/Nginx access log
grep -iE 'GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|Claude-User|Claude-SearchBot|PerplexityBot|Perplexity-User|CCBot|Bytespider|Amazonbot|Amzn-SearchBot|meta-externalagent|Applebot|AI2Bot|Diffbot' access.log \
| grep -oiE 'GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|Claude-User|Claude-SearchBot|PerplexityBot|Perplexity-User|CCBot|Bytespider|Amazonbot|Amzn-SearchBot|meta-externalagent|Applebot|AI2Bot|Diffbot' \
| sort | uniq -c | sort -rnWindows (PowerShell)
# Count hits per known AI bot in an access log
$bots = 'GPTBot','OAI-SearchBot','ChatGPT-User','ClaudeBot','Claude-User','Claude-SearchBot','PerplexityBot','Perplexity-User','CCBot','Bytespider','Amazonbot','Amzn-SearchBot','meta-externalagent','Applebot','AI2Bot','Diffbot'
Select-String -Path .\access.log -Pattern ($bots -join '|') |
ForEach-Object { ($_ -split '"')[5] } |
ForEach-Object { foreach ($b in $bots) { if ($_ -match $b) { $b } } } |
Group-Object | Sort-Object Count -Descending | Select-Object Count, Namesebuah pengguna-agent string dapat menjadi spoofed (CCBot terutama) — konfirmasi penting bot terhadap operator’s published IP ranges atau melalui reverse + forward DNS sebelum acting pada them.
Classify Anda log hits oleh AI-bot category
Paste mentah server-log lines atau sebuah list dari pengguna-agent strings dan memiliki sebuah AI classify setiap satu menggunakan master table dari Cheat Sheets tab — berguna ketika Anda’re staring di sebuah log file penuh dari unfamiliar bot names.
I have a list of user-agent strings from my server logs. Using this
classification (paste the Cheat Sheets table from this article, or the list
below), classify each user-agent as one of: Training, AI-search, User fetch,
or Control token (not a crawler). Flag any user-agent you don't recognize as
"unknown — verify."
Categories:
- Training: GPTBot, ClaudeBot, CCBot, Bytespider, Amazonbot, Meta-ExternalAgent,
AI2Bot, cohere-training-data-crawler, Diffbot, Timpibot, webzio-extended
- AI-search: OAI-SearchBot, PerplexityBot, Applebot, Amzn-SearchBot
- User fetch: ChatGPT-User, Perplexity-User, Claude-User, Claude-SearchBot,
Amzn-User, Meta-ExternalFetcher
- Control token (no crawl traffic): Google-Extended, Applebot-Extended
My user-agent list:
<paste your list here>Draft sebuah robots.txt block list dari Anda stance
Deskripsikan Anda training dan AI-penelusuran stance di plain language dan memiliki AI draft corresponding robots.txt aturan, lalu verify output terhadap robots.txt Tester sebelum penerbitan ini.
Draft a robots.txt block that does the following, using exact, correctly-cased
user-agent tokens for each rule (one User-agent/Disallow pair per bot, don't
combine bots under one User-agent line):
1. Block all training bots: GPTBot, ClaudeBot, CCBot, Bytespider,
Meta-ExternalAgent, Amazonbot.
2. Also disallow the Google-Extended and Applebot-Extended control tokens
(training/grounding opt-out only — not real crawlers).
3. Leave OAI-SearchBot and PerplexityBot allowed so AI-search visibility is
unaffected.
Output only the robots.txt block, no explanation. alat untuk verifying dan controlling AI bot
-
Googlebot Verifier — paste server-log hits dan konfirmasi apakah sebuah “GPTBot” (terjemahan) “GPTBot” atau “ClaudeBot” (terjemahan) “ClaudeBot” permintaan adalah sebenarnya dari itu operator’s published IP range, atau sebuah impersonator. direct perbaiki untuk “trusting a user-agent string” (terjemahan) “trusting sebuah pengguna-agent string” mistake di Apa Tidak untuk melakukan tab.
-
robots.txt Tester — periksa apakah sebuah spesifik URL adalah diizinkan atau blocked untuk sebuah spesifik bot’s pengguna-agent, so Anda dapat konfirmasi sebuah training-block aturan tidak juga catching sebuah AI-penelusuran bot.
-
robots.txt Generator — bangun training-block / AI-penelusuran-izinkan aturan dari Scripts tab tanpa hand-typing pengguna-agent tokens (di mana sebuah typo silently breaks aturan).
-
llms.txt Generator + Validator — jika Anda masih ingin sebuah llms.txt file untuk documentation purposes, generate dan validate satu di sini — hanya jangan expect ini untuk move AI-penelusuran visibilitas (see Apa Tidak untuk melakukan).
Resources worth Anda time
My related writing
- Memenuhi baru Web crawler: AI bot adalah Closing di pada mesin pencari bot — my Cloudflare Radar analysis; AI bot sebagai jelas #2 crawler dan social-contract framing.
- AI bot itu ~140 Million situs web Block paling — robots.txt block-rate data di seluruh open web, dan permintaan-volume / block-rate correlation.
- ChatGPT memiliki 12% dari Google’s Penelusuran Volume tetapi Google mengirim 190x Lebih Traffic — AI-vs-penelusuran referral kesenjangan itu drives blocking debate.
- Apa kami Sebenarnya Know tentang Optimizing untuk LLM Penelusuran — lebih luas GEO context.
dari others
- Cloudflare: Perplexity adalah menggunakan stealth, undeclared crawler — August 2025 investigation (reported findings).
- Robb Knight: Perplexity AI adalah lying tentang -nya pengguna agent — original June 2024 investigation.
- ai.robots.txt project — community-maintained list dari 150+ AI bot pengguna-agents.
- Known Agents (formerly Dark pengunjung) — comprehensive AI bot directory.
- Cloudflare: Declaring Anda AI independence (satu-click AI bot blocking) — announcement dari Cloudflare’s satu-click “AI Scrapers dan Crawlers” (terjemahan) “AI Scrapers dan crawler” toggle.
- Cloudflare: Control konten gunakan untuk AI training — managed robots.txt, konten Sinyal directives, dan pay-per-crawl beta dijelaskan.
- Heise Online: crawler tanpa limits — Perplexity ignores robots.txt — June 2024 reporting pada Perplexity’s robots.txt evasion.
- Gizmodo: Perplexity AI ignored internet’s aturan — further coverage dari robots.txt compliance controversy.
Stats worth citing
- AI bot adalah jelas #2 crawler. dari my Cloudflare Radar analysis, penelusuran-mesin bot masih crawl paling, tetapi AI bot adalah firmly kedua dan pada pace untuk overtake them — AI bot sudah mewakili roughly 18,9% dari semua bot permintaan. Sumber
- ** referral kesenjangan itu drives blocking.** Google mengirim ~190x lebih traffic untuk situs web daripada ChatGPT, despite ChatGPT memiliki sebuah bermakna share dari Google’s penelusuran volume — imbalance behind “social contract” (terjemahan) “social contract” argument. Sumber
- crawl-untuk-referral ratios (Cloudflare, 2025). Roughly 14 Google melakukan crawl per referral visit, versus far lebih tinggi ratios untuk AI crawler — pada order dari thousands dari OpenAI melakukan crawl dan tens dari thousands dari Anthropic melakukan crawl per referral. angka adalah mengapa publishers pertanyaan trade.
- llms.txt reality periksa. di sebuah Ahrefs study dari 137K situs, ~28% published sebuah llms.txt file tetapi 97% dari itu files diterima zero permintaan, dan Tidak major LLM provider memiliki formally adopted ini. Sumber
- Block rates di seluruh open web. dari my study dari ~140M situs, paling-blocked AI bot cluster sekitar GPTBot, CCBot, ClaudeBot, Amazonbot, dan Bytespider — block rates track permintaan volume. Sumber
- Bytespider reach dan enforcement. Bytespider accessed 40,40% dari semua Cloudflare-protected situs web sebelum Cloudflare began blocking ini di July 2024; traffic declined 71,45% afterward. Meta-ExternalAgent accessed 22,16% dari protected situs — kedua hanya untuk GPTBot (28,97%). Sumber
- AI bot traffic growth. Cloudflare Radar data menampilkan AI bot traffic grew 65% di six months (2025), dengan GPTBot permintaan up 305% antara dapat 2024 dan dapat 2025. sebagai dari July 2025, baru Cloudflare domains block known AI crawler oleh default, dan di atas 1 million Cloudflare customers memiliki enabled AI bot blocking fitur. Sumber
Uji pemahaman Anda: AI crawler
Five quick pertanyaan pada three AI-crawler categories dan traps sekitar them. Pick sebuah jawaban untuk setiap, lalu periksa.
Log perubahan
Diperbarui 8 Agu 2026.
Ringkasan editorial dan detail perubahan yang tercatat.Detail perubahan
-
Catatan perubahan terperinci saat ini tersedia dalam bahasa Inggris.
Perbandingan lengkap tidak tersedia — tidak ada cuplikan sebelumnya yang diarsipkan untuk revisi ini.
Diperbarui 30 Jul 2026.
Ringkasan editorial dan detail perubahan yang tercatat.Detail perubahan
-
Catatan perubahan terperinci saat ini tersedia dalam bahasa Inggris.
Perbandingan lengkap tidak tersedia — tidak ada cuplikan sebelumnya yang diarsipkan untuk revisi ini.
Diperbarui 29 Jul 2026.
Ringkasan editorial dan detail perubahan yang tercatat.Detail perubahan
-
Catatan perubahan terperinci saat ini tersedia dalam bahasa Inggris.
Perbandingan lengkap tidak tersedia — tidak ada cuplikan sebelumnya yang diarsipkan untuk revisi ini.
Diperbarui 29 Jul 2026.
Ringkasan editorial dan detail perubahan yang tercatat.Detail perubahan
-
Catatan perubahan terperinci saat ini tersedia dalam bahasa Inggris.
Perbandingan lengkap tidak tersedia — tidak ada cuplikan sebelumnya yang diarsipkan untuk revisi ini.
Diperbarui 28 Jul 2026.
Ringkasan editorial dan detail perubahan yang tercatat.Detail perubahan
-
Catatan perubahan terperinci saat ini tersedia dalam bahasa Inggris.
-
Catatan perubahan terperinci saat ini tersedia dalam bahasa Inggris.
-
Catatan perubahan terperinci saat ini tersedia dalam bahasa Inggris.
Perbandingan lengkap tidak tersedia — tidak ada cuplikan sebelumnya yang diarsipkan untuk revisi ini.
Diperbarui 19 Jul 2026.
Ringkasan editorial dan detail perubahan yang tercatat.Detail perubahan
-
Catatan perubahan terperinci saat ini tersedia dalam bahasa Inggris.
Perbandingan lengkap tidak tersedia — tidak ada cuplikan sebelumnya yang diarsipkan untuk revisi ini.
Diperbarui 16 Jul 2026.
Ringkasan editorial dan detail perubahan yang tercatat.Detail perubahan
- Advanced
Catatan perubahan terperinci saat ini tersedia dalam bahasa Inggris.
Perbandingan lengkap tidak tersedia — tidak ada cuplikan sebelumnya yang diarsipkan untuk revisi ini.