AI 크롤러

AI 크롤러의 세 가지 유형인 학습 봇, AI 검색 인덱서, 사용자 요청형 가져오기 도구와 주요 봇 이름, SEO에 피해를 주지 않고 각 유형을 제어하는 방법을 설명합니다.

최초 게시: 2026년 6월 24일 · 최근 업데이트: 2026년 8월 9일 · Advanced
언어
이 페이지의 근거 신호 2개

AI 크롤러는 세 종류이며 이를 혼동하는 것이 가장 흔한 실수입니다. (1) GPTBot, ClaudeBot, CCBot 같은 학습·모델 개선 봇, (2) OAI-SearchBot, PerplexityBot, Applebot 같은 AI 검색 인덱서, (3) ChatGPT-User, Perplexity-User, Claude-User 같은 사용자 요청형 가져오기 도구입니다. 제어 방식은 제공업체와 에이전트별로 다릅니다. GPTBot을 차단해도 OAI-SearchBot은 차단되지 않으며 OAI-AdsBot에는 별도의 광고 범위가 있습니다. Google-Extended와 Applebot-Extended는 독립 크롤러가 아니라 제품·제어 토큰입니다. Google-Extended는 Gemini/Vertex 모델 개선과 그라운딩을 제어하지만 Google 검색 포함, 순위, AI 오버뷰, AI 모드는 제어하지 않습니다. Applebot-Extended는 Apple 검색에서 페이지를 제거하지 않고 Apple 파운데이션 모델의 사용을 제어합니다. llms.txt는 여전히 제안 단계이며 널리 채택된 제어 표준이 아닙니다.

OpenAI는 GPTBot, OAI-SearchBot, ChatGPT-User의 설정이 서로 독립적이라고 설명합니다. Evidence for this claim OpenAI publishes separate controls for GPTBot, OAI-SearchBot, and ChatGPT-User, and says each setting is independent. Scope: OpenAI-declared crawlers and user agents; their purposes and robots behavior are platform-specific. Confidence: high · Verified: OpenAI: Crawlers Anthropic도 ClaudeBot, Claude-SearchBot, Claude-User를 별도로 구분하고 robots.txt 처리 방식을 문서화합니다. Evidence for this claim Anthropic documents ClaudeBot, Claude-SearchBot, and Claude-User separately and says its bots honor robots.txt directives. Scope: Anthropic-declared bots; user-initiated retrieval has additional product-specific conditions. Confidence: high · Verified: Anthropic: Bot information

요약 — AI 크롤러는 세 범주로 나뉘며 이를 혼동하는 것이 거의 모두가 범하는 실수입니다. 학습 봇(GPTBot, ClaudeBot, CCBot, Bytespider, Amazonbot, Meta-ExternalAgent)은 모델 말뭉치를 만들기 위해 수집합니다. AI 검색 봇(OAI-SearchBot, PerplexityBot, Applebot, Amzn-SearchBot)은 인용 가능한 인덱스를 만듭니다. 사용자 요청형 가져오기 도구(ChatGPT-User, Perplexity-User, Claude-User)는 사용자가 질문할 때 페이지를 실시간으로 가져옵니다. 각 봇은 고유한 user-agent와 robots.txt 규칙을 사용하므로 GPTBot 차단은 OAI-SearchBot에 영향을 주지 않습니다. Google-Extended와 Applebot-Extended는 봇이 아니라 토큰입니다. 직접 크롤링하지 않고 학습·그라운딩 사용만 거부합니다. 학습 봇 차단은 Google 순위에 영향을 주지 않지만(Google의 설명과 경험적 데이터가 일치), AI 검색 봇 차단은 AI 답변 가시성을 낮춥니다. 사용자 요청형 가져오기 도구의 robots.txt 적용 여부와 Perplexity의 비공개 크롤링 보도를 둘러싼 논쟁은 실제로 존재합니다. llms.txt는 대부분 읽히지 않고 주요 업체가 채택하지 않은 제안입니다.

전체 주제를 관통하는 세 범주

Classify the purpose before writing the rule: training, AI-search visibility, and live user fetching are separate decisions. 출처: /technical-seo/how-search-works/crawling/crawler/ai-crawlers/

Training crawlers such as GPTBot, ClaudeBot, and CCBot collect data for model corpora. AI-search crawlers such as OAI-SearchBot and PerplexityBot build indexes used for answers and citations. User-triggered agents such as ChatGPT-User and Claude-User fetch a page for a live request. Blocking one category does not automatically block the others.

© Patrick Stox LLC · CC BY 4.0 ·

이름이 알려진 모든 AI 봇은 세 범주 중 하나에 속합니다. 범주를 올바르게 정하면 차단할지, 허용할지, SEO에 어떤 영향이 있는지 같은 후속 판단이 자연스럽게 정리됩니다.

1. 학습/데이터 수집 크롤러. LLM 학습과 미세 조정을 위한 말뭉치를 만들려고 대규모로 크롤링합니다. 퍼블리셔가 가장 많이 차단하려는 봇이며 차단해도 검색 순위에는 영향이 없습니다. GPTBot(OpenAI), ClaudeBot(Anthropic), CCBot(Common Crawl), Bytespider(ByteDance), Amazonbot(Amazon), Meta-ExternalAgent(Meta), AI2Bot(Allen Institute), cohere-training-data-crawler(Cohere), Diffbot, Timpibot(Timpi), webzio-extended(Webz.io)가 있습니다. 아래에서 설명할 Google-ExtendedApplebot-Extended는 별도 크롤러가 아닌 제어 토큰입니다.

2. AI 검색/인덱싱 크롤러. 인용과 사이트 링크를 포함해 질문에 답하는 데 사용할 실시간 인덱스를 만듭니다. 차단하면 AI 검색 결과에서 사라질 수 있습니다. OAI-SearchBot(OpenAI, GPTBot과 별개), PerplexityBot(Perplexity), Applebot(Apple, Spotlight/Siri/Safari 제안 지원), Amzn-SearchBot(Amazon)이 있습니다.

3. 사용자 요청형/온디맨드 가져오기 도구. 봇이 돌아다녀서가 아니라 사용자가 질문했기 때문에 특정 페이지를 실시간으로 가져옵니다. 운영자는 대개 사용자 요청으로 시작된 가져오기에는 robots.txt가 구속력을 갖지 않는다고 주장하며 논쟁이 있는 영역입니다. ChatGPT-User(OpenAI), Perplexity-User(Perplexity), Claude-UserClaude-SearchBot(Anthropic), Amzn-User(Amazon, Alexa용), Meta-ExternalFetcher(Meta)가 있습니다.

user-agent 토큰과 robots.txt 준수 여부를 담은 전체 표는 치트 시트 탭에 있습니다. 이 표가 글의 중심입니다.

“봇이 아니라 토큰”이라는 함정(Google-Extended와 Applebot-Extended)

가장 많이 오해하는 사실이므로 정확히 설명하겠습니다. Google-Extended와 Applebot-Extended는 아무것도 크롤링하지 않습니다. 독립 user-agent가 없고 크롤 트래픽도 만들지 않습니다. 기존 크롤이 콘텐츠를 어떻게 사용할 수 있는지를 바꾸는 robots.txt 제어 토큰입니다.

  • Google-Extended는 Google 검색 밖의 그라운딩을 포함해 Gemini Apps와 Vertex AI 생성형 모델 개선에 콘텐츠를 사용할지 제어합니다. Google 검색의 AI 오버뷰나 AI Mode는 제어하지 않으며, 이 기능들은 Googlebot 접근을 사용합니다. Google은 “Google-Extended does not impact a site’s inclusion in Google Search nor is it used as a ranking signal in Google Search.” (번역) 「Google-Extended는 사이트의 Google 검색 포함 여부에 영향을 주지 않으며 Google 검색의 순위 신호로도 사용되지 않습니다.」라고 명시합니다. 이를 차단해도 Googlebot이나 순위에는 영향이 없습니다.
  • Applebot-Extended도 Apple에서 같은 역할을 합니다. Apple은 “Applebot-Extended does not crawl webpages. Webpages that disallow Applebot-Extended can still be included in search results.” (번역) 「Applebot-Extended는 웹페이지를 크롤링하지 않습니다. Applebot-Extended를 허용하지 않는 페이지도 검색 결과에 포함될 수 있습니다.」라고 설명합니다. Apple 파운데이션 모델(Apple Intelligence)의 학습 사용을 거부하는 것이며, 페이지는 실제 크롤러인 Applebot을 통해 Spotlight/Siri에 계속 표시됩니다.

따라서 Disallow: Google-ExtendedDisallow: Applebot-Extended는 독립 크롤 차단이 아니라 제품 사용 제어입니다. 공개된 범위상 해당 검색 인덱스에서 페이지를 제거하지 않지만 서로 바꿔 쓸 수 없으며 둘 다 단순히 “학습 봇”이라고 줄여 부르면 안 됩니다.

주요 운영업체별 봇

OpenAI는 서로 독립적인 네 가지 공개 봇을 운영합니다. GPTBot은 학습용이며 “used to make our generative AI foundation models more useful and safe” (번역) 「생성형 AI 파운데이션 모델을 더 유용하고 안전하게 만드는 데 사용」됩니다. OAI-SearchBot은 검색용이며 “used to surface websites in search results in ChatGPT’s search features” (번역) 「ChatGPT 검색 기능의 검색 결과에 웹사이트를 표시하는 데 사용」됩니다. ChatGPT-User“used for certain user actions in ChatGPT” (번역) 「ChatGPT의 특정 사용자 동작에 사용」되는 사용자 가져오기 도구입니다. OAI-AdsBot은 학습이나 검색 인덱싱이 아닌 독립된 광고 범위입니다. OpenAI의 정책 문구는 업계 전체의 모범입니다. “Each bot setting is independent, allowing webmasters granular control over how their content interacts with different OpenAI systems.” (번역) 「각 봇 설정은 독립적이므로 웹마스터가 콘텐츠와 OpenAI의 여러 시스템 간 상호 작용을 세밀하게 제어할 수 있습니다.」 GPTBot 차단은 “signals that future data from these materials should be excluded from model training datasets” (번역) 「해당 자료의 향후 데이터를 모델 학습 데이터세트에서 제외해야 한다는 신호」이며, OAI-SearchBot을 차단하면 사이트가 “won’t appear in ChatGPT search results” (번역) 「ChatGPT 검색 결과에 나타나지 않습니다.」

Anthropic은 학습용 ClaudeBot, 검색 인덱싱용 Claude-SearchBot, 사용자 가져오기용 Claude-User 세 가지를 운영합니다. Anthropic은 봇이 “respect ‘do not crawl’ signals by honoring industry standard directives in robots.txt” (번역) 「robots.txt의 업계 표준 지시문을 준수해 ‘크롤링 금지’ 신호를 존중」한다고 설명합니다. 현재 지원 페이지는 Anthropic 전용 검증을 위한 공유 공개 IP 목록도 제공합니다. 이 업체별 목록은 신원 근거이지 모든 봇에 적용되는 보편적 IP 또는 역방향 DNS 검증 규칙은 아닙니다.

Google — 핵심은 앞서 설명한 대로 Google-Extended가 봇이 아니라 토큰이라는 점입니다. Google은 사이트 소유자가 요청한 Vertex AI Agents를 위해 크롤링하며 순위에는 영향을 주지 않는 Google-CloudVertexBotGemini-Deep-Research, Google-NotebookLM 같은 사용자 요청형 에이전트도 운영합니다.

Apple은 Spotlight/Siri/Safari 제안을 지원하며 “may also be used to help train Apple foundation models” (번역) 「Apple 파운데이션 모델 학습에 사용될 수도 있는」 실제 크롤러 ApplebotApplebot-Extended 토큰을 운영합니다. Applebot을 차단하면 Apple 검색에서 사라지지만 Applebot-Extended 차단은 학습 사용만 거부합니다.

Perplexity는 검색·인용용 PerplexityBot과 사용자 가져오기용 Perplexity-User를 공개합니다. PerplexityBot은 “not used to crawl content for AI foundation models” (번역) 「AI 파운데이션 모델용 콘텐츠 크롤링에는 사용되지 않으므로」 Perplexity는 공개된 학습 크롤러가 없습니다. 문서에는 사용자 요청으로 시작된 가져오기이므로 Perplexity-User가 “generally ignores robots.txt rules” (번역) 「일반적으로 robots.txt 규칙을 무시한다」고 나옵니다. Perplexity는 비공개 방식 크롤링 보도의 대상이기도 하며 아래 논쟁 절에서 설명합니다.

Amazon은 세 가지 봇을 운영하며 유용한 예외를 보여 줍니다. Amazonbot은 제품 개선에 사용되며 “may be used to train Amazon AI models” (번역) 「Amazon AI 모델 학습에 사용될 수 있습니다.」 Amzn-SearchBot은 검색용이고 Amzn-User는 Alexa 사용자 가져오기용입니다. Amazon 문서에 따르면 Amzn-SearchBot과 Amzn-User는 생성형 AI 모델 학습을 위해 크롤링하지 않습니다. 따라서 “모든 AI 기업이 학습을 위해 수집한다”는 주장은 잘못되었습니다. Amazon은 noarchive 메타 태그에 페이지를 모델 학습에 사용하지 말라는 특수한 의미를 부여하며, 드문 페이지 단위 학습 거부 수단입니다.

Amazon의 robots 처리에는 특이한 운영 예외가 두 가지 있습니다. 크롤러가 이전 30일 안에 캐시한 robots.txt 사본을 사용할 수 있고, 파일을 가져올 수 없으면 존재하지 않는 것처럼 동작한다고 Amazon은 설명합니다. 그러나 감사 도구의 가져오기 실패가 Amazon도 전체 허용 상태를 봤다는 증거는 아닙니다. 감사 도구와 Amazon이 서로 다른 시간이나 네트워크 경로로 호스트에 접근했을 수 있습니다. Evidence for this claim Amazon says its crawlers may use a robots.txt copy cached within the previous 30 days. Scope: Amazon crawler behavior only; a current audit fetch cannot identify which cached copy Amazon used. Confidence: high · Verified: Amazon: Amazonbot Evidence for this claim Amazon says its crawlers behave as if robots.txt does not exist when they cannot fetch it. Scope: Amazon crawler behavior only; a tool-side fetch failure is not proof that Amazon observed the same failure. Confidence: high · Verified: Amazon: Amazonbot

Meta는 Llama와 Meta AI의 학습·인덱싱용 Meta-ExternalAgent, 사용자 가져오기용 Meta-ExternalFetcher, 링크 미리보기용으로 AI 크롤러가 아닌 Facebookbot을 별도로 운영합니다. Meta-ExternalAgent 차단은 Facebook 링크 미리보기에 영향을 주지 않습니다.

**Common Crawl(CCBot)**은 공개 웹 아카이브를 유지하는 비영리 재단이 운영합니다. 숨은 기반 계층입니다. Common Crawl 데이터세트는 ChatGPT, Claude, LLaMA 등 많은 모델 학습에 사용되었으므로 CCBot 차단은 사이트를 직접 크롤링하지 않는 모델에도 후속 영향을 줍니다. Common Crawl은 CCBot을 사칭하는 봇도 있다고 경고합니다.

**ByteDance(Bytespider)**는 공격적인 쪽입니다. robots.txt를 준수한다고 밝히지만 이를 위반하고 매우 많은 요청을 보낸다는 보도가 널리 나왔습니다. 그 밖에 알아둘 봇은 AI2Bot(Allen Institute, 오픈 모델/Dolma 데이터세트), Cohere, Diffbot(여러 후속 AI 파이프라인에 공급되는 구조화 데이터 추출), Timpibot/webzio-extended입니다.

AI 봇은 실제로 robots.txt를 준수하나요?

주요 운영업체인 OpenAI, Anthropic, Google, Apple, Amazon은 학습 및 검색 크롤러가 robots.txt를 준수한다고 문서에 밝힙니다. 논쟁 영역은 사용자 요청형 가져오기 도구입니다. 여러 운영업체는 사용자가 요청을 시작했으므로 robots.txt가 적용되지 않을 수 있다고 명시합니다. OpenAI는 “these actions are initiated by a user, robots.txt rules may not apply” (번역) 「이러한 동작은 사용자가 시작하므로 robots.txt 규칙이 적용되지 않을 수 있습니다」라고 하며 Perplexity는 Perplexity-User가 “generally ignores robots.txt rules” (번역) 「일반적으로 robots.txt 규칙을 무시한다」고 설명합니다. 이는 공개된 정책이지 위반 사례가 아닙니다.

Perplexity 논쟁은 대표적인 분쟁이며 확정된 사실이 아니라 보도된 내용으로 표시합니다. 2024년 6월 Wired와 개발자 Robb Knight는 Perplexity가 차단된 사이트의 콘텐츠에 비공개 IP로 접근한 것으로 보인다고 보도했습니다. 2025년 8월 Cloudflare는 Perplexity가 macOS Chrome을 사칭한 은폐 user-agent를 사용하고, 차단을 피하려 IP와 ASN을 순환하며, 전체 Disallow: /가 있는 새 테스트 도메인의 콘텐츠도 가져왔다고 보고했습니다. 이후 Cloudflare는 검증된 봇 목록에서 Perplexity를 제외했습니다. 이는 해당 출처가 문서화한 보도로 제시해야 합니다. Perplexity 자체 문서는 PerplexityBot이 robots.txt를 준수한다고 계속 설명합니다.

일부 봇이 어떤 수준에서는 robots.txt를 무시하기 때문에 Cloudflare가 실질적인 집행 계층이 되었습니다. 네트워크 수준 차단, 원클릭 “AI Scrapers and Crawlers” 토글, 관리형 robots.txt, robots.txt 위반 추적, 크롤당 과금 베타를 제공합니다. 2025년 7월부터 새 Cloudflare 도메인은 알려진 AI 크롤러를 기본으로 차단합니다.

AI 크롤러 제어 방법

  • user-agent별 robots.txt가 기본 수단이며 세밀하게 제어할 수 있습니다. GPTBot 차단은 OAI-SearchBot이나 ChatGPT-User를 차단하지 않습니다. 모든 학습 봇 또는 AI 검색 봇을 차단하는 robots.txt 예시는 스크립트 탭에 있습니다.
  • 학습 토큰Google-ExtendedApplebot-Extended를 사용하면 검색 비용 없이 Gemini/Apple Intelligence 학습 사용을 거부할 수 있습니다.
  • Amazon의 noarchive 메타 태그는 Amazon에 대한 페이지별 학습 거부 수단입니다.
  • Cloudflare AI Crawl Control은 네트워크 수준에서 차단·허용·과금하고 관리형 robots.txt와 Content Signals 지시문(search, ai-input, ai-train)을 제공합니다. 기본값은 search=yes, ai-train=no입니다.
  • llms.txt는 Jeremy Howard/Answer.AI가 2024년 9월 제안한 방식이며 채택된 표준이 아니고 주요 크롤러도 준수하지 않습니다. 추론 시점에 읽히도록 만든 큐레이션 마크다운 지도이지만 Ahrefs가 13만 7천 개 사이트를 조사한 결과 공개된 llms.txt 파일의 97 %는 요청을 한 번도 받지 않았고 주요 LLM 제공업체도 공식 채택하지 않았습니다. AI 검색 도구가 아니라 문서화 도구로 취급하세요.
  • ai.robots.txt 커뮤니티 프로젝트는 150개가 넘는 AI 봇 user-agent에 Disallow: /를 적용한 포괄적 파일을 유지합니다. 일괄 차단용 참고 자료입니다.

가시성 우선 크롤러 정책

AI 검색 가시성을 원하는 공개 교육·상업 사이트라면 제 기본 정책은 다음과 같습니다.

  1. Googlebot과 Bingbot을 포함해 원하는 검색 화면에 데이터를 공급하는 일반 검색 크롤러를 허용합니다.
  2. 공개 콘텐츠에는 OAI-SearchBot, Claude-SearchBot, PerplexityBot 같은 문서화된 AI 검색·인덱싱 크롤러를 허용합니다.
  3. 제공업체별 robots 동작이 다르다는 점을 인정하면서 ChatGPT-User, Claude-User, Perplexity-User 같은 의도된 사용자 요청형 가져오기 도구를 허용합니다. Evidence for this claim OpenAI publishes separate controls for GPTBot, OAI-SearchBot, and ChatGPT-User, and says each setting is independent. Scope: OpenAI-declared crawlers and user agents; their purposes and robots behavior are platform-specific. Confidence: high · Verified: OpenAI: Crawlers Evidence for this claim Anthropic documents ClaudeBot, Claude-SearchBot, and Claude-User separately and says its bots honor robots.txt directives. Scope: Anthropic-declared bots; user-initiated retrieval has additional product-specific conditions. Confidence: high · Verified: Anthropic: Bot information Evidence for this claim Perplexity documents PerplexityBot for search indexing separately from Perplexity-User for user-requested fetches, with different robots behavior. Scope: Perplexity-declared crawlers and published IP ranges; a user-agent string alone does not verify identity. Confidence: high · Verified: Perplexity: Crawlers
  4. 학습·모델 개발 접근은 별도의 권리 결정으로 다룹니다. GPTBot, ClaudeBot, Google-Extended 등 학습 제어는 검색 정책과 같을 필요가 없습니다. 해당 사용이 게시 정책에 맞을 때만 허용하세요.
  5. 비공개 및 운영 경로는 인증으로 보호합니다. /admin/, 미리보기, 계정 데이터, 비공개 API는 서버 측 권한 검사 뒤에 두세요. Disallow는 크롤러에 대한 선호 표현일 뿐입니다.
  6. WAF 제어를 우회시키기 전에 신원을 검증합니다. 문서화된 user-agent와 현재 제공업체 IP 범위, 역방향 DNS 검증, 지원되는 봇 인증을 결합하세요. 위조 가능한 user-agent 하나만 보고 넓은 WAF 허용 규칙을 만들지 마세요.

특정 크롤러에 계속 적용해야 할 모든 제한을 반복하지 않는다면 단지 Allow: /를 쓰려고 별도 user-agent 그룹을 추가하지 마세요. 제공업체별 robots 파싱에서 특정 그룹은 와일드카드 그룹의 비공개 경로 제외 규칙을 상속하지 않고 이를 대체할 수 있습니다. 가장 단순하고 안전한 파일은 그 자체로 안전한 와일드카드 그룹 하나와 범위가 좁은 학습 거부 규칙인 경우가 많습니다.

이 사이트의 현재 공개 정책은 검색, AI 입력, AI 학습을 명시적으로 허용하면서 관리자, 미리보기, API, 트랩, 게이트웨이 경로를 제외합니다. 저는 검색과 사용자 요청형 가져오기를 계속 허용할 것입니다. ai-train=yes는 AI 가시성 전략이 아니라 편집 권리 결정으로만 바꿀 것입니다. 학습 접근이 인용 혜택을 준다는 증거는 없기 때문입니다.

AI 크롤러 접근 허용은 AI 준비 상태가 아님

허용 규칙으로 증명할 수 있는 최대치는 선언된 robots 정책에서 이름이 지정된 에이전트가 URL을 요청할 수 있다는 사실입니다. 운영자가 정책을 준수했는지, 페이지를 가져왔는지, 렌더링했는지, 중요한 정보를 추출했는지, 모델 컨텍스트에 넣었는지, 인용했는지, 작업을 완료했는지는 증명하지 못합니다.

다섯 계층을 분리하세요.

계층질문근거
허용선언된 정책에서 이 에이전트가 URL을 요청할 수 있는가?유효 robots 및 네트워크 접근 테스트
추출 가능성중요한 콘텐츠가 안정적인 텍스트, 링크, 메타데이터, 구조화 데이터에 존재하는가?필드 추출을 포함한 원시·렌더링 캡처
렌더링에이전트의 실제 브라우저·JavaScript 기능에서도 콘텐츠가 남는가?가능한 경우 제공업체별 가져오기 근거, 그렇지 않으면 명시된 테스트 한계
운영 가능성에이전트가 의도된 작업을 식별하고 안전하게 호출할 수 있는가?문서화된 도구·인터페이스 계약 및 통제된 종단 간 테스트
커머스 준비신원, 가격, 재고, 정책, 이행, 장바구니, 체크아웃이 일치하는가?피드·페이지·백엔드·주문 대조

따라서 크롤러 접근 검사기는 정책에 대해 허용, 차단, 판단 불가를 보고해야 하며 “AI 준비 완료”라고 말하면 안 됩니다. 성공한 로그 요청은 해당 요청이 발생했다는 증거일 뿐 페이지가 답변에 사용되었다는 증거가 아닙니다. 유효한 피드나 도구 선언도 공개 페이지가 올바르게 렌더링되거나 체크아웃이 표시된 오퍼를 이행할 수 있다는 증거가 아닙니다.

검색 및 인용 계층은 AI 검색의 작동 방식을, 카탈로그와 거래 준비 상태는 AI 쇼핑 최적화를 참고하세요. 계층을 분리하면 해결책이 구체적이 됩니다. 차단에는 접근 정책을, 추출 문제에는 페이지 출력을, 누락 상태에는 렌더링을, 운영 문제에는 인터페이스 계약을, 구매 실패에는 커머스 데이터를 수정합니다.

이커머스 페이지의 추출 가능성 테스트는 핵심 상품 신원과 선택된 오퍼인 SKU, 그룹 ID, 가격, 통화, 재고가 초기 응답에 존재하고 렌더링 후에도 일치하는지 검증해야 합니다. 원시·렌더링 상품 페이지 표준은 서버에 노출되어야 할 내용을 정의합니다. 크롤러 허용만으로 이 계약은 알 수 없습니다.

트래픽을 잃게 하는 오해: 학습 ≠ AI 검색

반드시 올바르게 이해해야 할 한 가지입니다. 학습 봇 차단은 AI 검색 봇 차단과 다릅니다. 서로 다른 robots.txt 규칙이며 결과도 반대입니다.

  • 학습 봇(GPTBot, ClaudeBot, CCBot, Bytespider 및 Google-Extended/Applebot-Extended 토큰)을 차단하면 → Google이 확인했고 퍼블리셔 경험 데이터도 보여 주듯 Google 순위에는 영향이 없습니다. 모델 학습만 거부합니다.
  • AI 검색 봇(OAI-SearchBot, PerplexityBot)을 차단하면 → ChatGPT와 Perplexity 답변의 가시성을 잃습니다. 비용 없는 선택이 아니라 실제 상충 관계입니다.

학습만 막으려다 OAI-SearchBot까지 포함하는 일괄 차단처럼 너무 넓게 차단하면 AI 검색에서 조용히 사라질 수 있습니다. 각 규칙이 어떤 범주에 적용되는지 정확히 구분하세요.

퍼블리셔가 차단하는 이유: 사회적 계약

이 논쟁의 이유는 결국 트래픽입니다. 제가 AI 봇 분석에서 썼듯이 “there’s a cost to bots crawling your websites and there’s a social contract between search engines and website owners, where search engines add value by sending referral traffic to websites. Google sends traffic (for now), so they don’t get blocked.” (번역) 「봇이 웹사이트를 크롤링하는 데는 비용이 들며, 검색 엔진이 사이트로 추천 트래픽을 보내 가치를 제공한다는 검색 엔진과 사이트 소유자 사이의 사회적 계약이 있습니다. Google은 현재 트래픽을 보내므로 차단되지 않습니다.」 AI 크롤러는 지금까지 대체로 트래픽을 돌려주지 않았고 데이터도 이러한 불안을 뒷받침합니다. 제 Cloudflare Radar 분석에서 AI 봇은 이미 검색 엔진에 이어 확고한 2위 크롤러이며 추월할 추세입니다. 자세한 내용은 통계 탭에 있습니다.

공개: 저는 Ahrefs 전 직원이며 무료 Ahrefs 이용 권한을 제공받습니다. 링크한 크롤러 분석은 재직 당시 공개한 제 작업입니다. Ahrefs는 이 사이트의 현재 편집 결론을 검토하거나 승인하지 않습니다.

이 주제가 포함되는 더 넓은 파이프라인인 검색 발견, 크롤 스케줄러, 렌더링, 크롤링과 색인의 차이는 크롤링 허브와 일반 크롤러, user-agent, Googlebot, Bingbot, robots.txt 관련 글을 참고하세요.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.