AI 크롤러
AI 크롤러의 세 가지 유형인 학습 봇, AI 검색 인덱서, 사용자 요청형 가져오기 도구와 주요 봇 이름, SEO에 피해를 주지 않고 각 유형을 제어하는 방법을 설명합니다.
언어
이 페이지의 근거 신호 2개
- 연결된 원본 데이터공개 IP 목록
- 관련 라이브 도구Log File Analyzer
AI 크롤러는 세 종류이며 이를 혼동하는 것이 가장 흔한 실수입니다. (1) GPTBot, ClaudeBot, CCBot 같은 학습·모델 개선 봇, (2) OAI-SearchBot, PerplexityBot, Applebot 같은 AI 검색 인덱서, (3) ChatGPT-User, Perplexity-User, Claude-User 같은 사용자 요청형 가져오기 도구입니다. 제어 방식은 제공업체와 에이전트별로 다릅니다. GPTBot을 차단해도 OAI-SearchBot은 차단되지 않으며 OAI-AdsBot에는 별도의 광고 범위가 있습니다. Google-Extended와 Applebot-Extended는 독립 크롤러가 아니라 제품·제어 토큰입니다. Google-Extended는 Gemini/Vertex 모델 개선과 그라운딩을 제어하지만 Google 검색 포함, 순위, AI 오버뷰, AI 모드는 제어하지 않습니다. Applebot-Extended는 Apple 검색에서 페이지를 제거하지 않고 Apple 파운데이션 모델의 사용을 제어합니다. llms.txt는 여전히 제안 단계이며 널리 채택된 제어 표준이 아닙니다.
OpenAI는 학습, 검색, 사용자 동작 봇을 각각 제어하는 별도 설정을 공개합니다. Evidence for this claim OpenAI publishes separate controls for GPTBot, OAI-SearchBot, and ChatGPT-User, and says each setting is independent. Scope: OpenAI-declared crawlers and user agents; their purposes and robots behavior are platform-specific. Confidence: high · Verified: OpenAI: Crawlers Anthropic도 학습, 검색, 사용자 요청 에이전트를 구분해 문서화합니다. Evidence for this claim Anthropic documents ClaudeBot, Claude-SearchBot, and Claude-User separately and says its bots honor robots.txt directives. Scope: Anthropic-declared bots; user-initiated retrieval has additional product-specific conditions. Confidence: high · Verified: Anthropic: Bot information
Evidence for this claim Cloudflare Radar reports worldwide Cloudflare-observed HTTP request trends for the five most active AI bots during the 28 days ending 2026-07-30. Scope: A dated Cloudflare Radar context chart; it is not site-specific traffic and is not a census of all web requests. Confidence: high · Verified: Cloudflare Radar: HTTP traffic by AI botThe chart compares request trends for the five most active AI bots observed by Cloudflare during the selected four-week period, including Googlebot, ClaudeBot, Meta-ExternalAgent, GPTBot, and Bingbot.
요약 — “AI 크롤러”는 하나가 아니라 세 종류입니다. GPTBot과 ClaudeBot처럼 AI 모델을 학습시키기 위해 사이트를 수집하는 봇, OAI-SearchBot과 PerplexityBot처럼 AI 검색이 사이트를 인용할 수 있도록 인덱스를 만드는 봇, ChatGPT-User처럼 사용자가 방금 질문했기 때문에 특정 페이지를 실시간으로 가져오는 봇이 있습니다. 각 봇은
robots.txt에서 고유한 이름을 사용하므로 따로 허용하거나 차단할 수 있습니다. 학습 봇을 차단해도 Google 순위에는 영향이 없지만, AI 검색 봇을 차단하면 AI 답변에서 보이지 않을 수 있습니다.
AI 크롤러란
검색 크롤러는 이미 익숙할 것입니다. Googlebot이나 Bingbot 같은 크롤러가 페이지를 방문해야 검색 결과에 표시될 수 있습니다. AI 크롤러는 그보다 새로운 종류로, OpenAI, Anthropic, Google, Apple, Perplexity 같은 AI 기업이 각자의 목적을 위해 페이지를 가져오는 봇입니다.
무언가를 차단하기 전에 이해해야 할 핵심은 모든 봇이 같은 일을 하지 않는다는 것입니다. 세 가지 유형이 있습니다.
- 학습 봇은 AI 모델을 만들고 개선하는 데 활용하려고 페이지를 읽습니다. 대표적으로 OpenAI의 GPTBot과 Anthropic의 ClaudeBot이 있습니다.
- AI 검색 봇은 검색 가능한 인덱스를 만들기 위해 페이지를 읽습니다. 사용자가 ChatGPT나 Perplexity에 질문하면 답변과 함께 사이트 링크를 제시할 수 있게 합니다. OAI-SearchBot과 PerplexityBot이 여기에 해당합니다.
- 사용자 요청형 가져오기 도구는 사용자가 무언가를 요청했기 때문에 특정 페이지 하나를 실시간으로 가져옵니다. ChatGPT-User가 예입니다. 웹을 스스로 돌아다니는 것이 아니라 사용자의 요청을 수행합니다.
이 차이가 중요한 이유
각 봇에는 고유한 이름인 user-agent가 있으며, robots.txt 파일에서 이름별로 허용하거나 차단할 수 있습니다. 따라서 다음을 별도로 결정할 수 있습니다.
- AI 기업이 내 콘텐츠로 모델을 학습해도 괜찮은가? → 학습 봇에 관한 결정입니다.
- ChatGPT와 Perplexity 답변에 내 사이트가 나오길 원하는가? → AI 검색 봇에 관한 결정이며, 대부분은 이 봇을 허용하려고 합니다.
반드시 없애야 할 큰 오해가 있습니다. AI 봇을 차단해도 Google 순위는 떨어지지 않습니다. Google이 직접 밝힌 내용이며 AI 학습 봇을 차단한 퍼블리셔도 순위를 유지합니다. 그러나 AI 검색 봇을 차단하면 AI 답변에서 사라질 수 있으므로 잘못된 범주를 실수로 차단하지 마세요.
로그에서 볼 수 있는 이름
- GPTBot — OpenAI의 학습 봇.
- OAI-SearchBot — ChatGPT 검색을 지원하는 OpenAI 봇.
- ChatGPT-User — 사용자가 요청할 때 실시간으로 가져오는 OpenAI 도구.
- ClaudeBot — Anthropic의 학습 봇.
- PerplexityBot — Perplexity의 검색·인용 봇.
- CCBot — 많은 AI 모델의 학습 데이터가 되는 비영리 Common Crawl의 봇.
- Bytespider — TikTok 모회사 ByteDance의 학습 봇.
- Applebot — Siri, Spotlight, Apple Intelligence를 지원하는 Apple 봇.
로그에서 볼 수 있는 Google-Extended와 Applebot-Extended는 실제 크롤러가 아닙니다. “don’t use my content to train your AI.” (번역) 「내 콘텐츠를 AI 학습에 사용하지 말라」는 뜻을 전달하는 robots.txt 제어 토큰일 뿐이며 직접 페이지를 가져오지 않습니다.
봇별 전체 표, robots.txt 작성법, “실제로 robots.txt를 준수하는가?”라는 논쟁, 차단 여부에 관한 판단은 고급 탭에서 확인하세요.
OpenAI는 GPTBot, OAI-SearchBot, ChatGPT-User의 설정이 서로 독립적이라고 설명합니다. Evidence for this claim OpenAI publishes separate controls for GPTBot, OAI-SearchBot, and ChatGPT-User, and says each setting is independent. Scope: OpenAI-declared crawlers and user agents; their purposes and robots behavior are platform-specific. Confidence: high · Verified: OpenAI: Crawlers Anthropic도 ClaudeBot, Claude-SearchBot, Claude-User를 별도로 구분하고 robots.txt 처리 방식을 문서화합니다. Evidence for this claim Anthropic documents ClaudeBot, Claude-SearchBot, and Claude-User separately and says its bots honor robots.txt directives. Scope: Anthropic-declared bots; user-initiated retrieval has additional product-specific conditions. Confidence: high · Verified: Anthropic: Bot information
요약 — AI 크롤러는 세 범주로 나뉘며 이를 혼동하는 것이 거의 모두가 범하는 실수입니다. 학습 봇(GPTBot, ClaudeBot, CCBot, Bytespider, Amazonbot, Meta-ExternalAgent)은 모델 말뭉치를 만들기 위해 수집합니다. AI 검색 봇(OAI-SearchBot, PerplexityBot, Applebot, Amzn-SearchBot)은 인용 가능한 인덱스를 만듭니다. 사용자 요청형 가져오기 도구(ChatGPT-User, Perplexity-User, Claude-User)는 사용자가 질문할 때 페이지를 실시간으로 가져옵니다. 각 봇은 고유한 user-agent와
robots.txt규칙을 사용하므로 GPTBot 차단은 OAI-SearchBot에 영향을 주지 않습니다. Google-Extended와 Applebot-Extended는 봇이 아니라 토큰입니다. 직접 크롤링하지 않고 학습·그라운딩 사용만 거부합니다. 학습 봇 차단은 Google 순위에 영향을 주지 않지만(Google의 설명과 경험적 데이터가 일치), AI 검색 봇 차단은 AI 답변 가시성을 낮춥니다. 사용자 요청형 가져오기 도구의 robots.txt 적용 여부와 Perplexity의 비공개 크롤링 보도를 둘러싼 논쟁은 실제로 존재합니다. llms.txt는 대부분 읽히지 않고 주요 업체가 채택하지 않은 제안입니다.
전체 주제를 관통하는 세 범주
Training crawlers such as GPTBot, ClaudeBot, and CCBot collect data for model corpora. AI-search crawlers such as OAI-SearchBot and PerplexityBot build indexes used for answers and citations. User-triggered agents such as ChatGPT-User and Claude-User fetch a page for a live request. Blocking one category does not automatically block the others.
© Patrick Stox LLC · CC BY 4.0 ·
이름이 알려진 모든 AI 봇은 세 범주 중 하나에 속합니다. 범주를 올바르게 정하면 차단할지, 허용할지, SEO에 어떤 영향이 있는지 같은 후속 판단이 자연스럽게 정리됩니다.
1. 학습/데이터 수집 크롤러. LLM 학습과 미세 조정을 위한 말뭉치를 만들려고 대규모로 크롤링합니다. 퍼블리셔가 가장 많이 차단하려는 봇이며 차단해도 검색 순위에는 영향이 없습니다. GPTBot(OpenAI), ClaudeBot(Anthropic), CCBot(Common Crawl), Bytespider(ByteDance), Amazonbot(Amazon), Meta-ExternalAgent(Meta), AI2Bot(Allen Institute), cohere-training-data-crawler(Cohere), Diffbot, Timpibot(Timpi), webzio-extended(Webz.io)가 있습니다. 아래에서 설명할 Google-Extended와 Applebot-Extended는 별도 크롤러가 아닌 제어 토큰입니다.
2. AI 검색/인덱싱 크롤러. 인용과 사이트 링크를 포함해 질문에 답하는 데 사용할 실시간 인덱스를 만듭니다. 차단하면 AI 검색 결과에서 사라질 수 있습니다. OAI-SearchBot(OpenAI, GPTBot과 별개), PerplexityBot(Perplexity), Applebot(Apple, Spotlight/Siri/Safari 제안 지원), Amzn-SearchBot(Amazon)이 있습니다.
3. 사용자 요청형/온디맨드 가져오기 도구. 봇이 돌아다녀서가 아니라 사용자가 질문했기 때문에 특정 페이지를 실시간으로 가져옵니다. 운영자는 대개 사용자 요청으로 시작된 가져오기에는 robots.txt가 구속력을 갖지 않는다고 주장하며 논쟁이 있는 영역입니다. ChatGPT-User(OpenAI), Perplexity-User(Perplexity), Claude-User와 Claude-SearchBot(Anthropic), Amzn-User(Amazon, Alexa용), Meta-ExternalFetcher(Meta)가 있습니다.
user-agent 토큰과 robots.txt 준수 여부를 담은 전체 표는 치트 시트 탭에 있습니다. 이 표가 글의 중심입니다.
“봇이 아니라 토큰”이라는 함정(Google-Extended와 Applebot-Extended)
가장 많이 오해하는 사실이므로 정확히 설명하겠습니다. Google-Extended와 Applebot-Extended는 아무것도 크롤링하지 않습니다. 독립 user-agent가 없고 크롤 트래픽도 만들지 않습니다. 기존 크롤이 콘텐츠를 어떻게 사용할 수 있는지를 바꾸는 robots.txt 제어 토큰입니다.
- Google-Extended는 Google 검색 밖의 그라운딩을 포함해 Gemini Apps와 Vertex AI 생성형 모델 개선에 콘텐츠를 사용할지 제어합니다. Google 검색의 AI 오버뷰나 AI Mode는 제어하지 않으며, 이 기능들은 Googlebot 접근을 사용합니다. Google은 “Google-Extended does not impact a site’s inclusion in Google Search nor is it used as a ranking signal in Google Search.” (번역) 「Google-Extended는 사이트의 Google 검색 포함 여부에 영향을 주지 않으며 Google 검색의 순위 신호로도 사용되지 않습니다.」라고 명시합니다. 이를 차단해도 Googlebot이나 순위에는 영향이 없습니다.
- Applebot-Extended도 Apple에서 같은 역할을 합니다. Apple은 “Applebot-Extended does not crawl webpages. Webpages that disallow Applebot-Extended can still be included in search results.” (번역) 「Applebot-Extended는 웹페이지를 크롤링하지 않습니다. Applebot-Extended를 허용하지 않는 페이지도 검색 결과에 포함될 수 있습니다.」라고 설명합니다. Apple 파운데이션 모델(Apple Intelligence)의 학습 사용을 거부하는 것이며, 페이지는 실제 크롤러인 Applebot을 통해 Spotlight/Siri에 계속 표시됩니다.
따라서 Disallow: Google-Extended와 Disallow: Applebot-Extended는 독립 크롤 차단이 아니라 제품 사용 제어입니다. 공개된 범위상 해당 검색 인덱스에서 페이지를 제거하지 않지만 서로 바꿔 쓸 수 없으며 둘 다 단순히 “학습 봇”이라고 줄여 부르면 안 됩니다.
주요 운영업체별 봇
OpenAI는 서로 독립적인 네 가지 공개 봇을 운영합니다. GPTBot은 학습용이며 “used to make our generative AI foundation models more useful and safe” (번역) 「생성형 AI 파운데이션 모델을 더 유용하고 안전하게 만드는 데 사용」됩니다. OAI-SearchBot은 검색용이며 “used to surface websites in search results in ChatGPT’s search features” (번역) 「ChatGPT 검색 기능의 검색 결과에 웹사이트를 표시하는 데 사용」됩니다. ChatGPT-User는 “used for certain user actions in ChatGPT” (번역) 「ChatGPT의 특정 사용자 동작에 사용」되는 사용자 가져오기 도구입니다. OAI-AdsBot은 학습이나 검색 인덱싱이 아닌 독립된 광고 범위입니다. OpenAI의 정책 문구는 업계 전체의 모범입니다. “Each bot setting is independent, allowing webmasters granular control over how their content interacts with different OpenAI systems.” (번역) 「각 봇 설정은 독립적이므로 웹마스터가 콘텐츠와 OpenAI의 여러 시스템 간 상호 작용을 세밀하게 제어할 수 있습니다.」 GPTBot 차단은 “signals that future data from these materials should be excluded from model training datasets” (번역) 「해당 자료의 향후 데이터를 모델 학습 데이터세트에서 제외해야 한다는 신호」이며, OAI-SearchBot을 차단하면 사이트가 “won’t appear in ChatGPT search results” (번역) 「ChatGPT 검색 결과에 나타나지 않습니다.」
Anthropic은 학습용 ClaudeBot, 검색 인덱싱용 Claude-SearchBot, 사용자 가져오기용 Claude-User 세 가지를 운영합니다. Anthropic은 봇이 “respect ‘do not crawl’ signals by honoring industry standard directives in robots.txt” (번역) 「robots.txt의 업계 표준 지시문을 준수해 ‘크롤링 금지’ 신호를 존중」한다고 설명합니다. 현재 지원 페이지는 Anthropic 전용 검증을 위한 공유 공개 IP 목록도 제공합니다. 이 업체별 목록은 신원 근거이지 모든 봇에 적용되는 보편적 IP 또는 역방향 DNS 검증 규칙은 아닙니다.
Google — 핵심은 앞서 설명한 대로 Google-Extended가 봇이 아니라 토큰이라는 점입니다. Google은 사이트 소유자가 요청한 Vertex AI Agents를 위해 크롤링하며 순위에는 영향을 주지 않는 Google-CloudVertexBot과 Gemini-Deep-Research, Google-NotebookLM 같은 사용자 요청형 에이전트도 운영합니다.
Apple은 Spotlight/Siri/Safari 제안을 지원하며 “may also be used to help train Apple foundation models” (번역) 「Apple 파운데이션 모델 학습에 사용될 수도 있는」 실제 크롤러 Applebot과 Applebot-Extended 토큰을 운영합니다. Applebot을 차단하면 Apple 검색에서 사라지지만 Applebot-Extended 차단은 학습 사용만 거부합니다.
Perplexity는 검색·인용용 PerplexityBot과 사용자 가져오기용 Perplexity-User를 공개합니다. PerplexityBot은 “not used to crawl content for AI foundation models” (번역) 「AI 파운데이션 모델용 콘텐츠 크롤링에는 사용되지 않으므로」 Perplexity는 공개된 학습 크롤러가 없습니다. 문서에는 사용자 요청으로 시작된 가져오기이므로 Perplexity-User가 “generally ignores robots.txt rules” (번역) 「일반적으로 robots.txt 규칙을 무시한다」고 나옵니다. Perplexity는 비공개 방식 크롤링 보도의 대상이기도 하며 아래 논쟁 절에서 설명합니다.
Amazon은 세 가지 봇을 운영하며 유용한 예외를 보여 줍니다. Amazonbot은 제품 개선에 사용되며 “may be used to train Amazon AI models” (번역) 「Amazon AI 모델 학습에 사용될 수 있습니다.」 Amzn-SearchBot은 검색용이고 Amzn-User는 Alexa 사용자 가져오기용입니다. Amazon 문서에 따르면 Amzn-SearchBot과 Amzn-User는 생성형 AI 모델 학습을 위해 크롤링하지 않습니다. 따라서 “모든 AI 기업이 학습을 위해 수집한다”는 주장은 잘못되었습니다. Amazon은 noarchive 메타 태그에 페이지를 모델 학습에 사용하지 말라는 특수한 의미를 부여하며, 드문 페이지 단위 학습 거부 수단입니다.
Amazon의 robots 처리에는 특이한 운영 예외가 두 가지 있습니다. 크롤러가 이전 30일 안에 캐시한 robots.txt 사본을 사용할 수 있고, 파일을 가져올 수 없으면 존재하지 않는 것처럼 동작한다고 Amazon은 설명합니다. 그러나 감사 도구의 가져오기 실패가 Amazon도 전체 허용 상태를 봤다는 증거는 아닙니다. 감사 도구와 Amazon이 서로 다른 시간이나 네트워크 경로로 호스트에 접근했을 수 있습니다. Evidence for this claim Amazon says its crawlers may use a robots.txt copy cached within the previous 30 days. Scope: Amazon crawler behavior only; a current audit fetch cannot identify which cached copy Amazon used. Confidence: high · Verified: Amazon: Amazonbot Evidence for this claim Amazon says its crawlers behave as if robots.txt does not exist when they cannot fetch it. Scope: Amazon crawler behavior only; a tool-side fetch failure is not proof that Amazon observed the same failure. Confidence: high · Verified: Amazon: Amazonbot
Meta는 Llama와 Meta AI의 학습·인덱싱용 Meta-ExternalAgent, 사용자 가져오기용 Meta-ExternalFetcher, 링크 미리보기용으로 AI 크롤러가 아닌 Facebookbot을 별도로 운영합니다. Meta-ExternalAgent 차단은 Facebook 링크 미리보기에 영향을 주지 않습니다.
**Common Crawl(CCBot)**은 공개 웹 아카이브를 유지하는 비영리 재단이 운영합니다. 숨은 기반 계층입니다. Common Crawl 데이터세트는 ChatGPT, Claude, LLaMA 등 많은 모델 학습에 사용되었으므로 CCBot 차단은 사이트를 직접 크롤링하지 않는 모델에도 후속 영향을 줍니다. Common Crawl은 CCBot을 사칭하는 봇도 있다고 경고합니다.
**ByteDance(Bytespider)**는 공격적인 쪽입니다. robots.txt를 준수한다고 밝히지만 이를 위반하고 매우 많은 요청을 보낸다는 보도가 널리 나왔습니다. 그 밖에 알아둘 봇은 AI2Bot(Allen Institute, 오픈 모델/Dolma 데이터세트), Cohere, Diffbot(여러 후속 AI 파이프라인에 공급되는 구조화 데이터 추출), Timpibot/webzio-extended입니다.
AI 봇은 실제로 robots.txt를 준수하나요?
주요 운영업체인 OpenAI, Anthropic, Google, Apple, Amazon은 학습 및 검색 크롤러가 robots.txt를 준수한다고 문서에 밝힙니다. 논쟁 영역은 사용자 요청형 가져오기 도구입니다. 여러 운영업체는 사용자가 요청을 시작했으므로 robots.txt가 적용되지 않을 수 있다고 명시합니다. OpenAI는 “these actions are initiated by a user, robots.txt rules may not apply” (번역) 「이러한 동작은 사용자가 시작하므로 robots.txt 규칙이 적용되지 않을 수 있습니다」라고 하며 Perplexity는 Perplexity-User가 “generally ignores robots.txt rules” (번역) 「일반적으로 robots.txt 규칙을 무시한다」고 설명합니다. 이는 공개된 정책이지 위반 사례가 아닙니다.
Perplexity 논쟁은 대표적인 분쟁이며 확정된 사실이 아니라 보도된 내용으로 표시합니다. 2024년 6월 Wired와 개발자 Robb Knight는 Perplexity가 차단된 사이트의 콘텐츠에 비공개 IP로 접근한 것으로 보인다고 보도했습니다. 2025년 8월 Cloudflare는 Perplexity가 macOS Chrome을 사칭한 은폐 user-agent를 사용하고, 차단을 피하려 IP와 ASN을 순환하며, 전체 Disallow: /가 있는 새 테스트 도메인의 콘텐츠도 가져왔다고 보고했습니다. 이후 Cloudflare는 검증된 봇 목록에서 Perplexity를 제외했습니다. 이는 해당 출처가 문서화한 보도로 제시해야 합니다. Perplexity 자체 문서는 PerplexityBot이 robots.txt를 준수한다고 계속 설명합니다.
일부 봇이 어떤 수준에서는 robots.txt를 무시하기 때문에 Cloudflare가 실질적인 집행 계층이 되었습니다. 네트워크 수준 차단, 원클릭 “AI Scrapers and Crawlers” 토글, 관리형 robots.txt, robots.txt 위반 추적, 크롤당 과금 베타를 제공합니다. 2025년 7월부터 새 Cloudflare 도메인은 알려진 AI 크롤러를 기본으로 차단합니다.
AI 크롤러 제어 방법
- user-agent별 robots.txt가 기본 수단이며 세밀하게 제어할 수 있습니다.
GPTBot차단은OAI-SearchBot이나ChatGPT-User를 차단하지 않습니다. 모든 학습 봇 또는 AI 검색 봇을 차단하는 robots.txt 예시는 스크립트 탭에 있습니다. - 학습 토큰인
Google-Extended와Applebot-Extended를 사용하면 검색 비용 없이 Gemini/Apple Intelligence 학습 사용을 거부할 수 있습니다. - Amazon의
noarchive메타 태그는 Amazon에 대한 페이지별 학습 거부 수단입니다. - Cloudflare AI Crawl Control은 네트워크 수준에서 차단·허용·과금하고 관리형 robots.txt와 Content Signals 지시문(
search,ai-input,ai-train)을 제공합니다. 기본값은search=yes, ai-train=no입니다. - llms.txt는 Jeremy Howard/Answer.AI가 2024년 9월 제안한 방식이며 채택된 표준이 아니고 주요 크롤러도 준수하지 않습니다. 추론 시점에 읽히도록 만든 큐레이션 마크다운 지도이지만 Ahrefs가 13만 7천 개 사이트를 조사한 결과 공개된 llms.txt 파일의 97 %는 요청을 한 번도 받지 않았고 주요 LLM 제공업체도 공식 채택하지 않았습니다. AI 검색 도구가 아니라 문서화 도구로 취급하세요.
- ai.robots.txt 커뮤니티 프로젝트는 150개가 넘는 AI 봇 user-agent에
Disallow: /를 적용한 포괄적 파일을 유지합니다. 일괄 차단용 참고 자료입니다.
가시성 우선 크롤러 정책
AI 검색 가시성을 원하는 공개 교육·상업 사이트라면 제 기본 정책은 다음과 같습니다.
- Googlebot과 Bingbot을 포함해 원하는 검색 화면에 데이터를 공급하는 일반 검색 크롤러를 허용합니다.
- 공개 콘텐츠에는
OAI-SearchBot,Claude-SearchBot,PerplexityBot같은 문서화된 AI 검색·인덱싱 크롤러를 허용합니다. - 제공업체별 robots 동작이 다르다는 점을 인정하면서
ChatGPT-User,Claude-User,Perplexity-User같은 의도된 사용자 요청형 가져오기 도구를 허용합니다. Evidence for this claim OpenAI publishes separate controls for GPTBot, OAI-SearchBot, and ChatGPT-User, and says each setting is independent. Scope: OpenAI-declared crawlers and user agents; their purposes and robots behavior are platform-specific. Confidence: high · Verified: OpenAI: Crawlers Evidence for this claim Anthropic documents ClaudeBot, Claude-SearchBot, and Claude-User separately and says its bots honor robots.txt directives. Scope: Anthropic-declared bots; user-initiated retrieval has additional product-specific conditions. Confidence: high · Verified: Anthropic: Bot information Evidence for this claim Perplexity documents PerplexityBot for search indexing separately from Perplexity-User for user-requested fetches, with different robots behavior. Scope: Perplexity-declared crawlers and published IP ranges; a user-agent string alone does not verify identity. Confidence: high · Verified: Perplexity: Crawlers - 학습·모델 개발 접근은 별도의 권리 결정으로 다룹니다.
GPTBot,ClaudeBot,Google-Extended등 학습 제어는 검색 정책과 같을 필요가 없습니다. 해당 사용이 게시 정책에 맞을 때만 허용하세요. - 비공개 및 운영 경로는 인증으로 보호합니다.
/admin/, 미리보기, 계정 데이터, 비공개 API는 서버 측 권한 검사 뒤에 두세요.Disallow는 크롤러에 대한 선호 표현일 뿐입니다. - WAF 제어를 우회시키기 전에 신원을 검증합니다. 문서화된 user-agent와 현재 제공업체 IP 범위, 역방향 DNS 검증, 지원되는 봇 인증을 결합하세요. 위조 가능한 user-agent 하나만 보고 넓은 WAF 허용 규칙을 만들지 마세요.
특정 크롤러에 계속 적용해야 할 모든 제한을 반복하지 않는다면 단지 Allow: /를 쓰려고 별도 user-agent 그룹을 추가하지 마세요. 제공업체별 robots 파싱에서 특정 그룹은 와일드카드 그룹의 비공개 경로 제외 규칙을 상속하지 않고 이를 대체할 수 있습니다. 가장 단순하고 안전한 파일은 그 자체로 안전한 와일드카드 그룹 하나와 범위가 좁은 학습 거부 규칙인 경우가 많습니다.
이 사이트의 현재 공개 정책은 검색, AI 입력, AI 학습을 명시적으로 허용하면서 관리자, 미리보기, API, 트랩, 게이트웨이 경로를 제외합니다. 저는 검색과 사용자 요청형 가져오기를 계속 허용할 것입니다. ai-train=yes는 AI 가시성 전략이 아니라 편집 권리 결정으로만 바꿀 것입니다. 학습 접근이 인용 혜택을 준다는 증거는 없기 때문입니다.
AI 크롤러 접근 허용은 AI 준비 상태가 아님
허용 규칙으로 증명할 수 있는 최대치는 선언된 robots 정책에서 이름이 지정된 에이전트가 URL을 요청할 수 있다는 사실입니다. 운영자가 정책을 준수했는지, 페이지를 가져왔는지, 렌더링했는지, 중요한 정보를 추출했는지, 모델 컨텍스트에 넣었는지, 인용했는지, 작업을 완료했는지는 증명하지 못합니다.
다섯 계층을 분리하세요.
| 계층 | 질문 | 근거 |
|---|---|---|
| 허용 | 선언된 정책에서 이 에이전트가 URL을 요청할 수 있는가? | 유효 robots 및 네트워크 접근 테스트 |
| 추출 가능성 | 중요한 콘텐츠가 안정적인 텍스트, 링크, 메타데이터, 구조화 데이터에 존재하는가? | 필드 추출을 포함한 원시·렌더링 캡처 |
| 렌더링 | 에이전트의 실제 브라우저·JavaScript 기능에서도 콘텐츠가 남는가? | 가능한 경우 제공업체별 가져오기 근거, 그렇지 않으면 명시된 테스트 한계 |
| 운영 가능성 | 에이전트가 의도된 작업을 식별하고 안전하게 호출할 수 있는가? | 문서화된 도구·인터페이스 계약 및 통제된 종단 간 테스트 |
| 커머스 준비 | 신원, 가격, 재고, 정책, 이행, 장바구니, 체크아웃이 일치하는가? | 피드·페이지·백엔드·주문 대조 |
따라서 크롤러 접근 검사기는 정책에 대해 허용, 차단, 판단 불가를 보고해야 하며 “AI 준비 완료”라고 말하면 안 됩니다. 성공한 로그 요청은 해당 요청이 발생했다는 증거일 뿐 페이지가 답변에 사용되었다는 증거가 아닙니다. 유효한 피드나 도구 선언도 공개 페이지가 올바르게 렌더링되거나 체크아웃이 표시된 오퍼를 이행할 수 있다는 증거가 아닙니다.
검색 및 인용 계층은 AI 검색의 작동 방식을, 카탈로그와 거래 준비 상태는 AI 쇼핑 최적화를 참고하세요. 계층을 분리하면 해결책이 구체적이 됩니다. 차단에는 접근 정책을, 추출 문제에는 페이지 출력을, 누락 상태에는 렌더링을, 운영 문제에는 인터페이스 계약을, 구매 실패에는 커머스 데이터를 수정합니다.
이커머스 페이지의 추출 가능성 테스트는 핵심 상품 신원과 선택된 오퍼인 SKU, 그룹 ID, 가격, 통화, 재고가 초기 응답에 존재하고 렌더링 후에도 일치하는지 검증해야 합니다. 원시·렌더링 상품 페이지 표준은 서버에 노출되어야 할 내용을 정의합니다. 크롤러 허용만으로 이 계약은 알 수 없습니다.
트래픽을 잃게 하는 오해: 학습 ≠ AI 검색
반드시 올바르게 이해해야 할 한 가지입니다. 학습 봇 차단은 AI 검색 봇 차단과 다릅니다. 서로 다른 robots.txt 규칙이며 결과도 반대입니다.
- 학습 봇(GPTBot, ClaudeBot, CCBot, Bytespider 및 Google-Extended/Applebot-Extended 토큰)을 차단하면 → Google이 확인했고 퍼블리셔 경험 데이터도 보여 주듯 Google 순위에는 영향이 없습니다. 모델 학습만 거부합니다.
- AI 검색 봇(OAI-SearchBot, PerplexityBot)을 차단하면 → ChatGPT와 Perplexity 답변의 가시성을 잃습니다. 비용 없는 선택이 아니라 실제 상충 관계입니다.
학습만 막으려다 OAI-SearchBot까지 포함하는 일괄 차단처럼 너무 넓게 차단하면 AI 검색에서 조용히 사라질 수 있습니다. 각 규칙이 어떤 범주에 적용되는지 정확히 구분하세요.
퍼블리셔가 차단하는 이유: 사회적 계약
이 논쟁의 이유는 결국 트래픽입니다. 제가 AI 봇 분석에서 썼듯이 “there’s a cost to bots crawling your websites and there’s a social contract between search engines and website owners, where search engines add value by sending referral traffic to websites. Google sends traffic (for now), so they don’t get blocked.” (번역) 「봇이 웹사이트를 크롤링하는 데는 비용이 들며, 검색 엔진이 사이트로 추천 트래픽을 보내 가치를 제공한다는 검색 엔진과 사이트 소유자 사이의 사회적 계약이 있습니다. Google은 현재 트래픽을 보내므로 차단되지 않습니다.」 AI 크롤러는 지금까지 대체로 트래픽을 돌려주지 않았고 데이터도 이러한 불안을 뒷받침합니다. 제 Cloudflare Radar 분석에서 AI 봇은 이미 검색 엔진에 이어 확고한 2위 크롤러이며 추월할 추세입니다. 자세한 내용은 통계 탭에 있습니다.
공개: 저는 Ahrefs 전 직원이며 무료 Ahrefs 이용 권한을 제공받습니다. 링크한 크롤러 분석은 재직 당시 공개한 제 작업입니다. Ahrefs는 이 사이트의 현재 편집 결론을 검토하거나 승인하지 않습니다.이 주제가 포함되는 더 넓은 파이프라인인 검색 발견, 크롤 스케줄러, 렌더링, 크롤링과 색인의 차이는 크롤링 허브와 일반 크롤러, user-agent, Googlebot, Bingbot, robots.txt 관련 글을 참고하세요.
AI 요약
고급 버전을 압축하면 다음과 같습니다.
- AI 크롤러는 하나가 아니라 세 범주이며 이를 혼동하는 것이 핵심 실수입니다.
- 학습: GPTBot, ClaudeBot, CCBot, Bytespider, Amazonbot, Meta-ExternalAgent, AI2Bot, Cohere, Diffbot은 모델 말뭉치를 만들기 위해 수집합니다.
- AI 검색/인덱싱: OAI-SearchBot, PerplexityBot, Applebot, Amzn-SearchBot은 인용 가능한 인덱스를 만듭니다.
- 사용자 요청형 가져오기: ChatGPT-User, Perplexity-User, Claude-User는 사용자가 질문할 때 페이지를 실시간으로 가져옵니다.
- 각 봇은 고유한 user-agent와 robots.txt 규칙을 사용합니다. GPTBot 차단은 OAI-SearchBot이나 ChatGPT-User를 차단하지 않습니다.
- Google-Extended와 Applebot-Extended는 봇이 아니라 토큰입니다. 직접 크롤링하지 않고 학습·그라운딩 사용만 거부하며, 차단해도 검색 비용은 없습니다.
- 학습 봇 차단은 SEO 저하와 다릅니다. Google은 Google-Extended가 사이트의 Google 검색 포함 여부에 영향을 주지 않는다고 설명하며 퍼블리셔 경험 데이터도 일치합니다.
- AI 검색 봇 차단은 ChatGPT/Perplexity에서 AI 가시성을 실제로 낮춥니다. 명확한 상충 관계입니다.
- Amazon에 따르면 Amzn-SearchBot과 Amzn-User는 크롤링한 콘텐츠로 학습하지 않습니다. “모든 AI 봇이 학습한다”는 주장은 잘못되었습니다.
- robots.txt 논쟁: 사용자 요청형 가져오기 도구는 “적용되지 않을 수 있다”고 예외를 주장합니다. Perplexity는 은폐 크롤러를 사용했다는 보도(Wired/Robb Knight 2024, Cloudflare 2025)가 있으므로 확정이 아니라 보도로 제시하세요.
- llms.txt는 채택된 표준이 아니라 제안입니다. 파일의 97 %가 읽히지 않았고 주요 LLM이 지원하지 않습니다. 실질적 집행 계층은 Cloudflare입니다.
공식 문서
AI 운영업체와 관련 제안의 1차 출처 문서입니다.
OpenAI
- OpenAI 봇/크롤러 — GPTBot, OAI-SearchBot, ChatGPT-User, OAI-AdsBot과 “각 봇 설정은 독립적”이라는 정책입니다.
Anthropic
- Anthropic은 웹 데이터를 크롤링하나요? — ClaudeBot, Claude-SearchBot, Claude-User, robots 제어, 현재 IP 목록 검증 방법입니다.
- Anthropic 크롤러 IP 목록 — 제공업체별 검증 데이터입니다.
- Google 일반 크롤러(Google-Extended 포함) — 제품 토큰과 user-agent입니다.
- AI 기능과 웹사이트 — AI 오버뷰와 AI Mode 포함 여부는 Google-Extended가 아니라 Googlebot이 제어합니다.
Apple
- Applebot 소개 — Applebot과 Applebot-Extended의 차이 및 “Applebot-Extended는 웹페이지를 크롤링하지 않는다”는 설명입니다.
Amazon
- Amazonbot — Amazonbot, Amzn-SearchBot, Amzn-User,
noarchive학습 거부, 학습에 사용되지 않는 봇을 설명합니다.
Perplexity
- Perplexity 크롤러 — PerplexityBot과 Perplexity-User 및 “일반적으로 robots.txt 규칙을 무시한다”는 문구입니다.
Common Crawl
- CCBot — 많은 LLM 학습 데이터의 기반이 된 비영리 크롤러와 사칭 경고입니다.
Allen Institute for AI
- AI2 크롤러 고지 — AI2Bot과 필터링 방법입니다.
Cloudflare(AI 크롤러 제어)
- AI Crawl Control — 차단·허용·과금, 모니터링, robots.txt 위반 추적입니다.
- 관리형 robots.txt — 자동 유지되는 AI 크롤러 지시문입니다.
- AI 학습용 콘텐츠 사용 제어 — 관리형 robots.txt, Content Signals, 크롤당 과금입니다.
제안
- llms.txt 명세 — 추론 시점 지도 제안이며 채택된 표준이 아닙니다.
- ai.robots.txt 프로젝트 — 커뮤니티가 유지하는 AI 봇 user-agent 목록입니다.
출처의 인용문
운영업체와 제안 문서의 공식 발언입니다. 검증된 경우 각 링크는 인용된 구절로 바로 이동합니다.
OpenAI — 독립된 봇과 목적
- “Each bot setting is independent, allowing webmasters granular control over how their content interacts with different OpenAI systems.” (번역) 「각 봇 설정은 독립적이므로 웹마스터가 콘텐츠와 OpenAI의 여러 시스템 간 상호 작용을 세밀하게 제어할 수 있습니다.」 — OpenAI 봇 문서. 인용문으로 이동
- GPTBot은 “used to make our generative AI foundation models more useful and safe.” (번역) 「생성형 AI 파운데이션 모델을 더 유용하고 안전하게 만드는 데 사용됩니다.」 OAI-SearchBot은 “used to surface websites in search results in ChatGPT’s search features.” (번역) 「ChatGPT 검색 기능의 검색 결과에 웹사이트를 표시하는 데 사용됩니다.」 ChatGPT-User는 “these actions are initiated by a user, robots.txt rules may not apply.” (번역) 「이러한 동작은 사용자가 시작하므로 robots.txt 규칙이 적용되지 않을 수 있습니다.」 인용문으로 이동
Anthropic — robots 제어와 검증 범위
- Anthropic은 ClaudeBot, Claude-SearchBot, Claude-User, 각 robots 제어, 공유 IP 목록 검증 방법을 문서화합니다. 출처
Google — 봇이 아닌 토큰
- “Google-Extended does not impact a site’s inclusion in Google Search nor is it used as a ranking signal in Google Search.” (번역) 「Google-Extended는 사이트의 Google 검색 포함 여부에 영향을 주지 않으며 Google 검색의 순위 신호로도 사용되지 않습니다.」 인용문으로 이동
Apple — Applebot-Extended는 크롤링하지 않음
- “Applebot-Extended does not crawl webpages. Webpages that disallow Applebot-Extended can still be included in search results.” (번역) 「Applebot-Extended는 웹페이지를 크롤링하지 않습니다. Applebot-Extended를 허용하지 않는 페이지도 검색 결과에 포함될 수 있습니다.」 인용문으로 이동
Perplexity — 사용자 가져오기 예외
- PerplexityBot은 “designed to surface and link websites in search results on Perplexity. It is not used to crawl content for AI foundation models.” (번역) 「Perplexity 검색 결과에 웹사이트를 표시하고 연결하도록 설계되었으며 AI 파운데이션 모델용 콘텐츠 크롤링에는 사용되지 않습니다.」 Perplexity-User는 “Since a user requested the fetch, this fetcher generally ignores robots.txt rules.” (번역) 「사용자가 가져오기를 요청했으므로 이 가져오기 도구는 일반적으로 robots.txt 규칙을 무시합니다.」 인용문으로 이동
Common Crawl — 숨은 학습 계층
- CCBot은 “democratizing access to web information by producing and maintaining an open repository of web crawl data” (번역) 「웹 크롤 데이터의 공개 저장소를 만들고 유지하여 웹 정보 접근을 민주화」하기 위해 존재합니다. 참고: “we are aware of crawlers falsely identifying themselves as CCBot.” (번역) 「CCBot으로 허위 식별하는 크롤러가 있음을 알고 있습니다.」 인용문으로 이동
llms.txt — 자체 설명상 제안
- “A proposal to standardise on using an
/llms.txtfile to provide information to help LLMs use a website at inference time.” (번역) 「추론 시점에 LLM이 웹사이트를 사용하도록 돕는 정보를 제공하기 위해/llms.txt파일 사용을 표준화하자는 제안입니다.」 — llms.txt 명세. 인용문으로 이동
저의 설명 — 사회적 계약
- “There’s a cost to bots crawling your websites and there’s a social contract between search engines and website owners, where search engines add value by sending referral traffic to websites. Google sends traffic (for now), so they don’t get blocked.” (번역) 「웹사이트를 크롤링하는 봇에는 비용이 따릅니다. 검색 엔진이 웹사이트에 추천 방문을 보내 가치를 돌려준다는 검색 엔진과 사이트 소유자 간의 사회적 계약도 있습니다. Google은 지금은 트래픽을 보내기 때문에 차단되지 않습니다.」 — Patrick Stox, Ahrefs. 글 읽기
AI 크롤러 종합 표
핵심 표입니다. 주요 AI 봇의 user-agent 토큰, 운영업체, 범주, 공개된 robots.txt 준수 여부를 모두 정리했습니다. robots.txt에서는 철자와 대소문자가 중요하므로 토큰을 정확히 복사하세요.
| 봇 | UA 토큰 | 운영업체 | 범주 | robots.txt 준수? |
|---|---|---|---|---|
| GPTBot | GPTBot | OpenAI | 학습 | 예(공개 설명) |
| OAI-SearchBot | OAI-SearchBot | OpenAI | AI 검색 | 예(공개 설명) |
| ChatGPT-User | ChatGPT-User | OpenAI | 사용자 가져오기 | “적용되지 않을 수 있음”(사용자 요청) |
| OAI-AdsBot | OAI-AdsBot | OpenAI | 광고(학습 아님) | 예(공개 설명) |
| ClaudeBot | ClaudeBot | Anthropic | 학습 | 예(공개 설명) |
| Claude-SearchBot | Claude-SearchBot | Anthropic | AI 검색 | 인덱싱에는 예 |
| Claude-User | Claude-User | Anthropic | 사용자 가져오기 | 예(Anthropic은 모든 봇이 robots.txt를 준수한다고 설명) |
| Google-Extended | Google-Extended (토큰만 존재, 별도 UA 없음) | 학습/그라운딩 제어 | 예(거부 토큰) | |
| Google-CloudVertexBot | Google-CloudVertexBot | 소유자 요청형 Vertex AI | 예 | |
| PerplexityBot | PerplexityBot | Perplexity | AI 검색 | 인덱싱에는 예(논쟁 참조) |
| Perplexity-User | Perplexity-User | Perplexity | 사용자 가져오기 | “일반적으로 무시”(공개 설명) |
| Applebot | Applebot | Apple | AI 검색(+학습) | 예 |
| Applebot-Extended | Applebot-Extended (토큰만 존재, 크롤링 안 함) | Apple | 학습 제어 | 예(거부 토큰) |
| Amazonbot | Amazonbot | Amazon | 학습 | 예(공개 설명) |
| Amzn-SearchBot | Amzn-SearchBot | Amazon | AI 검색(학습 안 함) | 예(공개 설명) |
| Amzn-User | Amzn-User | Amazon | 사용자 가져오기(Alexa, 학습 안 함) | 예(공개 설명) |
| Meta-ExternalAgent | meta-externalagent | Meta | 학습/인덱싱 | 예(공개 설명) |
| Meta-ExternalFetcher | meta-externalfetcher | Meta | 사용자 가져오기 | 준수한다고 설명 |
| CCBot | CCBot | Common Crawl | 학습(공개 데이터) | 예, 사칭 존재 |
| Bytespider | Bytespider | ByteDance | 학습 | 논쟁 중 — 분쟁 참조 |
| AI2Bot | AI2Bot | Allen Institute | 학습 | 예(공개 설명) |
| cohere-training-data-crawler | cohere-training-data-crawler | Cohere | 학습 | 예(공개 설명) |
| Diffbot | Diffbot | Diffbot | 학습/추출 | 기본적으로 예 |
| Timpibot | Timpibot | Timpi | 학습 | 예(공개 설명) |
| webzio-extended | webzio-extended | Webz.io | 학습 | 준수한다고 설명 |
표에서 도출되는 세 가지 규칙
- GPTBot, ClaudeBot, CCBot 같은 학습 봇 차단 → 순위 영향 없음.
- OAI-SearchBot, PerplexityBot 같은 AI 검색 봇 차단 → AI 답변 가시성 상실.
- Google-Extended와 Applebot-Extended는 크롤러가 아니라 토큰 → 검색 비용 없이 학습만 거부.
빠른 사실 확인
- GPTBot ≠ OAI-SearchBot ≠ ChatGPT-User — 서로 독립적인 OpenAI 규칙 세 가지입니다.
- Amazon의
Amzn-SearchBot과Amzn-User는 크롤링한 콘텐츠로 학습하지 않습니다. - Amazon은
noarchive메타를 페이지별 학습 거부 신호로 준수합니다. - llms.txt는 채택된 표준이 아니라 제안이며 주요 크롤러는 준수하지 않습니다.
- IP가 아니라 robots.txt의 user-agent로 차단하세요. IP 차단은 봇이 robots.txt 자체를 읽지 못하게 할 수 있습니다.
무엇을 허용할지 감사하고 결정하는 방법
어떤 AI 크롤러를 허용·차단·관찰할지 결정하는 실용적인 절차입니다.
- 서버 로그를 가져와 GPTBot, ClaudeBot, CCBot, Bytespider, OAI-SearchBot, PerplexityBot, Applebot 등 실제로 접근하는 AI user-agent와 빈도를 나열합니다. 로그가 실제 근거입니다.
- 각 봇을 학습, AI 검색, 사용자 가져오기 범주로 분류합니다. 판단은 브랜드가 아니라 범주에서 나옵니다.
- 학습 정책을 결정합니다. 학습 사용을 허용한다면 학습 봇을 허용하세요. 원하지 않는다면 GPTBot, ClaudeBot, CCBot, Bytespider, Amazonbot, Meta-ExternalAgent를 차단하고
Google-Extended와Applebot-Extended토큰을 추가하세요. 어느 것도 Google 순위에는 영향을 주지 않습니다. - AI 검색 정책은 신중히 결정합니다. ChatGPT와 Perplexity 답변에 나타나고 싶다면 OAI-SearchBot과 PerplexityBot을 허용한 상태로 두세요. AI 검색에서 정말 빠지고 싶을 때만 차단합니다.
- 잘못된 봇까지 포함하지 마세요. “학습 차단” 규칙이 AI 검색 봇도 막는지 확인합니다. GPTBot ≠ OAI-SearchBot입니다.
- IP가 아니라 user-agent로 차단하세요. IP 차단은 봇이 robots.txt를 읽지 못하게 할 수 있습니다(Anthropic의 명시적 경고).
- 의심스러운 봇을 검증하세요. CCBot 등은 사칭됩니다. user-agent 문자열을 신뢰하기 전에 공개된 IP 범위와 역방향 DNS를 확인합니다.
- robots.txt를 안정적으로 준수하지 않는 봇에는 네트워크 수준 집행(Cloudflare AI Crawl Control)을 고려합니다.
- SEO 수단으로 llms.txt를 사용하지 마세요. 제안 단계이고 대부분 읽히지 않으며 주요 크롤러가 준수하지 않습니다. AI 검색 가시성을 기대하지 마세요.
- 분기마다 다시 확인하세요. 새 봇이 계속 등장하고 운영업체의 동작도 바뀝니다. ai.robots.txt 목록이 유용한 참고 자료입니다.
AI 검색 트래픽을 잃게 하는 실수
학습 봇과 AI 검색 봇을 혼동하는 것은 이 분야에서 가장 비용이 큰 실수이며 앞에서 반드시 없애야 할 오해로 지적했습니다. 모델 학습을 막는 규칙과 AI 검색 인용을 막는 규칙은 다릅니다. 혼동하면 반대 결과가 납니다.
- 잘못된 방식: “AI 봇”을 한 덩어리로 차단해 단일
Disallow규칙이 GPTBot과 OAI-SearchBot을 모두 포함하게 합니다. 잘못된 이유: 학습만 거부한다고 생각했지만 ChatGPT와 Perplexity 답변에서 조용히 사라집니다. 대안: 봇별로 이름이 지정된 규칙을 작성하세요. 학습용 GPTBot/ClaudeBot/CCBot/Bytespider는 차단하고, AI 검색에서 의도적으로 빠지려는 것이 아니라면 OAI-SearchBot/PerplexityBot은 허용합니다.
신원 검증과 접근 정책을 혼동함
제공업체가 공개한 IP 목록은 누가 요청을 보냈는지 확인하는 데 도움이 됩니다. 어떤 정책을 선택해야 하는지는 알려 주지 않으며 네트워크 차단을 robots 규칙으로 바꾸지도 않습니다.
- 잘못된 방식: 검증된 범위를 자동 허용·차단 결정으로 취급합니다.
잘못된 이유: 신원, 선언된 크롤 선호, 강제되는 네트워크 접근은 서로 다른 사실입니다.
대안: 문서화된
User-agent토큰으로 크롤 정책을 표현하고 파일을 안정적으로 준수하지 않는 봇에는 Cloudflare AI Crawl Control 같은 네트워크 집행을 추가하세요.
llms.txt를 AI 검색 수단으로 취급함
llms.txt는 흔히 “AI 검색용 robots.txt”라고 홍보되지만 이 글의 자체 출처에 따르면 그 설명은 틀렸습니다.
- 잘못된 방식: AI 검색 가시성이나 인용이 늘 것이라고 기대하며
llms.txt파일을 공개합니다. 잘못된 이유: 채택된 표준이 아니라 제안입니다. Ahrefs가 13만 7천 개 사이트를 조사한 결과 공개된 llms.txt 파일의 97 %는 요청을 한 번도 받지 않았고 주요 LLM 제공업체도 공식 채택하지 않았습니다. 대안: llms.txt는 기껏해야 문서화 도구로 취급하고 실제 가시성을 제어하는robots.txt규칙과 AI 검색 봇에 노력을 쓰세요.
user-agent 문자열을 검증 없이 신뢰함
Common Crawl이 직접 인정했듯 특히 CCBot은 사칭되고, Bytespider는 준수한다고 주장한 규칙을 무시한다는 보도가 널리 나왔습니다.
- 잘못된 방식: 로그의
User-agent문자열이 주장한 주체와 같다고 가정합니다. 잘못된 이유: 위조되었거나 규칙을 준수하지 않는 봇은robots.txt규칙이 집행되지 않는 동안에도 많은 요청을 보낼 수 있습니다. 대안: 처리량이 많거나 의심스러운 요청은 문자열을 신뢰하기 전에 운영업체의 공개 IP 범위 또는 역방향 DNS로 확인하세요. 도구 탭에는 이 검사용 도구가 있습니다.
결정: 허용, 차단, 관찰
1. 먼저 분류하세요. 이 결정이 모든 것을 좌우합니다. 학습, AI 검색, 사용자 가져오기를 구분합니다. 범주가 맞으면 결과가 분명합니다. 학습 차단은 SEO에 안전하고, AI 검색 차단은 AI 가시성을 잃게 하며, 사용자 가져오기는 논쟁 중입니다.
2. 허용/차단/관찰 규칙.
- AI 추천 가시성을 원한다면 OAI-SearchBot, PerplexityBot, Applebot 같은 AI 검색 봇을 허용하세요. 대부분의 사이트에 적합합니다.
- 학습 사용을 원하지 않는다면 GPTBot, ClaudeBot, CCBot, Bytespider 같은 학습 봇을 차단하세요. 순위 비용은 없습니다. Gemini/Apple 학습에는 Google-Extended/Applebot-Extended 토큰도 추가합니다.
- 사용자 요청형 가져오기 도구와 알려진 문제 봇(Bytespider, 공개되지 않은 Perplexity 트래픽)은 관찰하세요. robots.txt로 막히지 않을 수 있으므로 로그와 네트워크 수준 규칙으로 확인하고 제어합니다.
3. “봇이 아니라 토큰” 확인. 크롤 트래픽을 추론하기 전에 실제 크롤러인지 제어 토큰인지 물어보세요. Google-Extended와 Applebot-Extended는 트래픽을 만들지 않으며 이미 발생한 크롤의 사용 권한만 바꿉니다.
4. 학습 ≠ AI 검색(비용이 큰 실수). 서로 다른 robots.txt 규칙이며 결과도 반대입니다. “AI 봇”을 한 덩어리로 차단하지 마세요. 학습 차단에 실패하거나 AI 답변에서 실수로 사라질 수 있습니다.
5. robots.txt는 요청이며 집행은 별개입니다. 프로토콜은 준수하는 봇에 작동합니다. 스스로 예외라고 주장하는 사용자 가져오기 도구나 무시한다는 보도가 있는 Perplexity 은폐 크롤러·Bytespider에는 Cloudflare 같은 네트워크 수준 집행이 필요합니다. robots.txt만으로는 막을 수 없습니다.
이 AI 봇을 차단해야 하나요?
이 의사결정 트리는 프레임워크 탭의 허용·차단·관찰 규칙을 단계별로 안내합니다. 먼저 봇이 세 범주 중 어디에 속하는지 확인한 뒤 운명을 결정하는 한 가지 질문에 답하세요.
Should I block this AI bot?
분기별 AI 봇 robots.txt 감사
새 AI 봇이 등장하고 운영업체의 동작이 바뀔 때 반복 검사를 수행하면 robots.txt 규칙을 현실과 맞게 유지할 수 있습니다. 체크리스트 탭의 “분기마다 다시 확인” 항목을 단계별로 풀어 쓴 절차입니다.
- 분기의 AI 봇 요청을 가져옵니다. 서버 로그를 사이트의 로그 파일 분석기에 넣거나 스크립트 탭의 정확한 명령으로 알려진 user-agent 목록을 검색해 실제로 접근한 AI 봇과 빈도를 확인합니다.
- 각 봇의 범주를 다시 확인합니다. 모든 user-agent를 치트 시트 탭의 종합 표와 대조해 여전히 학습, AI 검색, 사용자 가져오기인지 확인하고 새로 등장한 미확인 봇은 ai.robots.txt 프로젝트 목록에서 찾습니다.
- 현재 규칙을 시험합니다. 실제
robots.txt를 robots.txt 테스터에 넣고 각 봇의 user-agent로 검사해 학습 규칙이 AI 검색 봇까지 실수로 차단하지 않는지 확인합니다. - 의심스럽거나 처리량이 많은 요청을 검증합니다. user-agent 문자열을 신뢰하기 전에 CCBot이나 Bytespider 같은 봇을 운영업체의 공개 IP 범위 또는 역방향 DNS와 Googlebot 검증기로 확인하세요. 사칭은 실제로 일어납니다.
- 분기의 AI 봇 크롤 점유율을 기록합니다. 학습, AI 검색, 사용자 가져오기 트래픽 비중을 기록해(측정 방법 탭 참조) 다음 분기 검사에서 단일 시점이 아니라 추세와 비교할 수 있게 합니다.
robots.txt 수정이 의도대로 작동하는지 확인
학습 봇을 차단하도록 robots.txt를 수정한 뒤 작업이 끝났다고 판단하기 전에 다음 검사를 실행하세요. 학습 봇은 실제로 차단하면서 AI 검색 봇은 페이지에 계속 접근할 수 있음을 증명하는 것이 목표입니다.
테스트 1: AI 검색 봇이 계속 허용됨
- 실행할 테스트: robots.txt 테스터에서
OAI-SearchBot과PerplexityBotuser-agent로 URL을 검사하거나 Googlebot 검증기에서 실제 요청을 확인합니다. - 예상 결과: AI 답변에 인용되길 원하는 모든 페이지에서 둘 다 “허용”입니다.
- 실패 해석: “차단” 결과는 학습 차단 규칙이 너무 넓어 잘못된 user-agent까지 포함했다는 뜻입니다.
- 모니터링 기간: 테스터는 즉시 확인할 수 있고, 봇이 캐시한 robots.txt 사본이 갱신되려면 며칠이 필요할 수 있습니다.
- 롤백 조건: 허용하려던 AI 검색 봇이 차단으로 표시되거나 변경 후 해당 엔진의 인용·추천 트래픽이 감소합니다.
테스트 2: 학습 봇이 실제로 차단됨
- 실행할 테스트: robots.txt 테스터에서 같은 URL을
GPTBot,ClaudeBot,CCBot,Bytespider로 검사합니다. - 예상 결과: 모두 “차단”입니다.
- 실패 해석: “허용” 결과는 보통 토큰 철자 오류를 뜻합니다. robots.txt에서는 철자와 대소문자가 중요합니다.
- 모니터링 기간: 즉시 확인합니다.
- 롤백 조건: 별도로 필요하지 않습니다. 나중에 학습 사용을 허용하기로 결정하지 않는 한 학습 차단에는 롤백 경로가 필요하지 않습니다.
테스트 3: Google 순위에 영향 없음
- 실행할 테스트: 학습 봇 또는
Google-Extended토큰을 차단하고 몇 주 뒤 영향을 받은 URL의 Search Console 실적·색인 범위를 확인합니다. - 예상 결과: 노출수나 순위에 실질적인 변화가 없습니다. Google은
Google-Extended가 “does not impact a site’s inclusion in Google Search.” (번역) 「사이트의 Google 검색 포함 여부에 영향을 주지 않는다」고 설명합니다. - 실패 해석: 변경과 동시에 광범위한 노출수 감소가 발생하면 너무 넓은 규칙이 Googlebot 자체를 차단했을 가능성이 큽니다.
- 모니터링 기간: 2~4주(Search Console 보고 지연).
- 롤백 조건: 노출수나 순위가 떨어지고 크롤링되어야 할 URL에서 Googlebot이 차단으로 표시됩니다.
AI 봇 트래픽 상시 KPI
분기별로 다음 지표를 추적하면 개별 robots.txt 수정과 별개로 AI 봇 정책이 의도대로 작동하는지 알 수 있습니다.
| 지표 | 알 수 있는 것 | 수집 방법 | 벤치마크/현실적 범위 | 주기 |
|---|---|---|---|---|
| 범주별 전체 크롤 트래픽 중 AI 봇 비중(학습/AI 검색/사용자 가져오기) | AI 봇이 전체 크롤 부하에서 차지하는 비중이 커지는지와 어떤 범주가 증가를 주도하는지 | 로그 파일 분석기로 서버 로그 분석, Cloudflare 사용 시 AI Crawl Control | 보편적 목표 없음. Cloudflare Radar는 2025년 업계 전체 봇 요청의 약 18,9 %가 AI 봇이라고 추정했지만 중요한 것은 자체 사이트의 구성입니다. 첫 분기에 기준선을 만들고 추세를 추적하세요. | 분기별 |
| AI 검색 봇별 크롤 대비 추천 비율 | AI 검색 추천 트래픽 한 단위당 얼마나 많은 크롤 “임대료”를 내는지 | 해당 user-agent의 서버 로그 크롤 수와 분석 도구의 실제 추천 방문을 교차 확인 | 고정 목표 없음. 이 글의 통계 탭은 Google 추천 1회당 약 14회 크롤인 반면 AI 크롤러는 훨씬 높다고 설명합니다. Google보다 나쁠 것으로 예상하고 절대값보다 추세를 보세요. | 분기별 |
| 학습 차단 정확도 | 학습 봇용 Disallow 규칙이 AI 검색·사용자 가져오기 봇까지 실수로 차단하는지 | 치트 시트 종합 표와 robots.txt를 대조하고 robots.txt 테스터로 확인 | 0이어야 합니다. 학습 봇용 규칙 때문에 AI 검색 봇이 차단되어서는 안 됩니다. | robots.txt 변경 때마다, 추가로 분기별 감사 |
robots.txt — 주요 봇 차단
학습 크롤러는 차단하고 AI 검색은 유지합니다. 모델 학습 사용을 거부하면서 ChatGPT/Perplexity 답변에는 계속 표시됩니다. 토큰을 정확히 복사하세요.
# --- AI training crawlers ---
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Bytespider
Disallow: /
User-agent: meta-externalagent
Disallow: /
User-agent: Amazonbot
Disallow: /
# --- Training control tokens (not crawlers) ---
# Opt out of Gemini/Vertex training; search unaffected
User-agent: Google-Extended
Disallow: /
# Opt out of Apple Intelligence training; Applebot search unaffected
User-agent: Applebot-Extended
Disallow: /AI 검색 인덱서를 차단합니다(AI 답변 가시성이 감소합니다). ChatGPT/Perplexity 답변에서 정말 빠지고 싶을 때만 사용하세요.
User-agent: OAI-SearchBot
Disallow: /
User-agent: PerplexityBot
Disallow: /핵심 원칙: GPTBot 차단은 OAI-SearchBot이나 ChatGPT-User를 차단하지 않습니다. 각각 독립된 규칙입니다.
액세스 로그에서 AI 봇 찾기
어떤 AI user-agent가 얼마나 자주 접근하는지 확인합니다.
macOS / Linux
# Count hits per known AI bot in an Apache/Nginx access log
grep -iE 'GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|Claude-User|Claude-SearchBot|PerplexityBot|Perplexity-User|CCBot|Bytespider|Amazonbot|Amzn-SearchBot|meta-externalagent|Applebot|AI2Bot|Diffbot' access.log \
| grep -oiE 'GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|Claude-User|Claude-SearchBot|PerplexityBot|Perplexity-User|CCBot|Bytespider|Amazonbot|Amzn-SearchBot|meta-externalagent|Applebot|AI2Bot|Diffbot' \
| sort | uniq -c | sort -rnWindows (PowerShell)
# Count hits per known AI bot in an access log
$bots = 'GPTBot','OAI-SearchBot','ChatGPT-User','ClaudeBot','Claude-User','Claude-SearchBot','PerplexityBot','Perplexity-User','CCBot','Bytespider','Amazonbot','Amzn-SearchBot','meta-externalagent','Applebot','AI2Bot','Diffbot'
Select-String -Path .\access.log -Pattern ($bots -join '|') |
ForEach-Object { ($_ -split '"')[5] } |
ForEach-Object { foreach ($b in $bots) { if ($_ -match $b) { $b } } } |
Group-Object | Sort-Object Count -Descending | Select-Object Count, Nameuser-agent 문자열은 위조할 수 있으며 특히 CCBot 사칭이 많습니다. 조치하기 전에 중요한 봇을 운영업체의 공개 IP 범위 또는 역방향·정방향 DNS로 확인하세요.
로그 요청을 AI 봇 범주로 분류
원시 서버 로그 줄이나 user-agent 문자열 목록을 붙여 넣고 AI가 치트 시트 탭의 종합 표를 기준으로 각각을 분류하게 합니다. 익숙하지 않은 봇 이름이 가득한 로그 파일을 볼 때 유용합니다.
I have a list of user-agent strings from my server logs. Using this
classification (paste the Cheat Sheets table from this article, or the list
below), classify each user-agent as one of: Training, AI-search, User fetch,
or Control token (not a crawler). Flag any user-agent you don't recognize as
"unknown — verify."
Categories:
- Training: GPTBot, ClaudeBot, CCBot, Bytespider, Amazonbot, Meta-ExternalAgent,
AI2Bot, cohere-training-data-crawler, Diffbot, Timpibot, webzio-extended
- AI-search: OAI-SearchBot, PerplexityBot, Applebot, Amzn-SearchBot
- User fetch: ChatGPT-User, Perplexity-User, Claude-User, Claude-SearchBot,
Amzn-User, Meta-ExternalFetcher
- Control token (no crawl traffic): Google-Extended, Applebot-Extended
My user-agent list:
<paste your list here>정책에 맞는 robots.txt 차단 목록 초안 작성
학습 및 AI 검색 정책을 일반 언어로 설명하고 AI가 해당 robots.txt 규칙 초안을 작성하게 한 뒤, 공개하기 전에 robots.txt 테스터로 결과를 검증합니다.
Draft a robots.txt block that does the following, using exact, correctly-cased
user-agent tokens for each rule (one User-agent/Disallow pair per bot, don't
combine bots under one User-agent line):
1. Block all training bots: GPTBot, ClaudeBot, CCBot, Bytespider,
Meta-ExternalAgent, Amazonbot.
2. Also disallow the Google-Extended and Applebot-Extended control tokens
(training/grounding opt-out only — not real crawlers).
3. Leave OAI-SearchBot and PerplexityBot allowed so AI-search visibility is
unaffected.
Output only the robots.txt block, no explanation. AI 봇 검증 및 제어 도구
-
Googlebot 검증기 — 서버 로그 요청을 붙여 넣어 “GPTBot”이나 “ClaudeBot” 요청이 실제 운영업체의 공개 IP 범위에서 왔는지, 사칭인지 확인합니다. 하지 말아야 할 것 탭의 “user-agent 문자열 신뢰” 실수를 직접 해결합니다.
-
robots.txt 테스터 — 특정 URL이 특정 봇의 user-agent에 허용되는지 차단되는지 확인해 학습 차단 규칙이 AI 검색 봇까지 막지 않는지 검증합니다.
-
robots.txt 생성기 — user-agent 토큰을 직접 입력하다 오타로 규칙을 무력화하지 않고 스크립트 탭의 학습 차단·AI 검색 허용 규칙을 만듭니다.
-
llms.txt 생성기 + 검증기 — 문서화 목적으로 llms.txt 파일을 여전히 원한다면 여기서 생성하고 검증하세요. 다만 하지 말아야 할 것 탭에서 설명하듯 AI 검색 가시성이 달라질 것이라고 기대하지 마세요.
시간을 들일 가치가 있는 자료
관련해서 제가 쓴 글
- 새로운 웹 크롤러를 만나보세요: AI 봇이 검색 엔진 봇을 따라잡고 있습니다 — Cloudflare Radar를 분석해 AI 봇이 확고한 2위 크롤러라는 사실과 사회적 계약을 설명한 글입니다.
- 약 1억 4천만 개 웹사이트가 가장 많이 차단하는 AI 봇 — 공개 웹의 robots.txt 차단률과 요청량·차단률 상관관계 데이터입니다.
- ChatGPT 검색량은 Google의 12 %지만 Google은 190배 더 많은 트래픽을 보냅니다 — 차단 논쟁을 만드는 AI와 검색의 추천 트래픽 격차입니다.
- LLM 검색 최적화에 관해 실제로 아는 것 — 더 넓은 GEO 맥락입니다.
다른 출처
- Cloudflare: Perplexity는 차단 지시를 피하려 비공개 은폐 크롤러를 사용합니다 — 2025년 8월 조사이며 보도된 결과입니다.
- Robb Knight: Perplexity AI는 user agent를 속이고 있습니다 — 2024년 6월 최초 조사입니다.
- ai.robots.txt 프로젝트 — 커뮤니티가 유지하는 150개 이상 AI 봇 user-agent 목록입니다.
- Known Agents(이전 Dark Visitors) — 포괄적인 AI 봇 디렉터리입니다.
- Cloudflare: AI 독립 선언(원클릭 AI 봇 차단) — Cloudflare의 원클릭 “AI Scrapers and Crawlers” 토글 발표입니다.
- Cloudflare: AI 학습용 콘텐츠 사용 제어 — 관리형 robots.txt, Content Signals 지시문, 크롤당 과금 베타를 설명합니다.
- Heise Online: 제한 없는 크롤러 — Perplexity가 robots.txt를 무시함 — Perplexity의 robots.txt 회피에 관한 2024년 6월 보도입니다.
- Gizmodo: Perplexity AI가 인터넷 규칙을 무시함 — robots.txt 준수 논쟁에 관한 추가 보도입니다.
인용할 만한 통계
- AI 봇은 확고한 2위 크롤러입니다. 제 Cloudflare Radar 분석에서 검색 엔진 봇이 여전히 가장 많이 크롤링하지만 AI 봇은 확고한 2위이며 추월할 추세입니다. AI 봇은 전체 봇 요청의 약 18,9 %를 이미 차지합니다. 출처
- 차단을 부르는 추천 격차. ChatGPT 검색량이 Google 대비 의미 있는 비중인데도 Google은 ChatGPT보다 웹사이트에 약 190배 많은 트래픽을 보냅니다. “사회적 계약” 주장의 배경인 불균형입니다. 출처
- 크롤 대비 추천 비율(Cloudflare, 2025). Google은 추천 방문 1회당 약 14회 크롤인 반면 AI 크롤러는 훨씬 높습니다. OpenAI는 추천당 수천 회, Anthropic은 수만 회 수준입니다. 퍼블리셔가 교환 가치를 의심하는 이유입니다.
- llms.txt 현실 점검. Ahrefs가 13만 7천 개 사이트를 조사한 결과 약 28 %가 llms.txt 파일을 공개했지만 그중 97 %는 요청을 한 번도 받지 않았고 주요 LLM 제공업체도 공식 채택하지 않았습니다. 출처
- 공개 웹 차단률. 약 1억 4천만 개 사이트를 조사한 제 연구에서 가장 많이 차단된 AI 봇은 GPTBot, CCBot, ClaudeBot, Amazonbot, Bytespider에 집중되었고 차단률은 요청량과 함께 움직였습니다. 출처
- Bytespider 도달 범위와 집행. Cloudflare가 2024년 7월 차단하기 전 Bytespider는 Cloudflare 보호 웹사이트의 40,40 %에 접근했고 이후 트래픽은 71,45 % 감소했습니다. Meta-ExternalAgent는 보호 사이트의 22,16 %에 접근해 GPTBot(28,97 %) 다음이었습니다. 출처
- AI 봇 트래픽 성장. Cloudflare Radar 데이터에서 AI 봇 트래픽은 2025년 6개월 동안 65 % 증가했고 GPTBot 요청은 2024년 5월부터 2025년 5월까지 305 % 늘었습니다. 2025년 7월부터 새 Cloudflare 도메인은 알려진 AI 크롤러를 기본 차단하며 백만 명이 넘는 Cloudflare 고객이 AI 봇 차단 기능을 활성화했습니다. 출처
AI 크롤러 퀴즈
AI 크롤러의 세 범주와 관련 함정에 관한 짧은 질문 다섯 개입니다. 각 답을 고른 뒤 확인하세요.
변경 내역
2026년 8월 9일에 업데이트됨.
편집 요약 및 기록된 변경 세부 정보입니다.변경 세부 정보
-
변경 세부 정보는 현재 영어로 제공됩니다.
전체 비교를 사용할 수 없음 — 이 수정에 대한 이전 스냅샷이 보관되지 않았습니다.
2026년 7월 30일에 업데이트됨.
편집 요약 및 기록된 변경 세부 정보입니다.변경 세부 정보
-
변경 세부 정보는 현재 영어로 제공됩니다.
전체 비교를 사용할 수 없음 — 이 수정에 대한 이전 스냅샷이 보관되지 않았습니다.
2026년 7월 29일에 업데이트됨.
편집 요약 및 기록된 변경 세부 정보입니다.변경 세부 정보
-
변경 세부 정보는 현재 영어로 제공됩니다.
전체 비교를 사용할 수 없음 — 이 수정에 대한 이전 스냅샷이 보관되지 않았습니다.
2026년 7월 29일에 업데이트됨.
편집 요약 및 기록된 변경 세부 정보입니다.변경 세부 정보
-
변경 세부 정보는 현재 영어로 제공됩니다.
전체 비교를 사용할 수 없음 — 이 수정에 대한 이전 스냅샷이 보관되지 않았습니다.
2026년 7월 28일에 업데이트됨.
편집 요약 및 기록된 변경 세부 정보입니다.변경 세부 정보
-
변경 세부 정보는 현재 영어로 제공됩니다.
-
변경 세부 정보는 현재 영어로 제공됩니다.
-
변경 세부 정보는 현재 영어로 제공됩니다.
전체 비교를 사용할 수 없음 — 이 수정에 대한 이전 스냅샷이 보관되지 않았습니다.
2026년 7월 19일에 업데이트됨.
편집 요약 및 기록된 변경 세부 정보입니다.변경 세부 정보
-
변경 세부 정보는 현재 영어로 제공됩니다.
전체 비교를 사용할 수 없음 — 이 수정에 대한 이전 스냅샷이 보관되지 않았습니다.
2026년 7월 16일에 업데이트됨.
편집 요약 및 기록된 변경 세부 정보입니다.변경 세부 정보
- Advanced
변경 세부 정보는 현재 영어로 제공됩니다.
전체 비교를 사용할 수 없음 — 이 수정에 대한 이전 스냅샷이 보관되지 않았습니다.