AI 크롤러 접근 검사기

Free, no signup. “Am I letting ChatGPT, Claude, Perplexity, and Google’s AI read this page — and did I mean to?” Enter a URL and get the answer for every major AI crawler, with the exact robots.txt rule that decided it.

Five separate tests · registry 2026-07-29

Crawler access is only the first layer

Permission

Is the crawler allowed?

Extractability

Are useful facts present in raw HTML?

Renderability

Does JavaScript successfully expose them?

Operability

Can an agent identify and use semantic controls?

Commerce readiness

Do page, schema, feed and checkout facts agree?

HTML remains primary. llms.txt, UCP, and other protocol files are optional distribution layers and cannot compensate for inaccessible or unextractable HTML.

Validate a protocol response

Upload verified-bot log evidence

Expected columns: crawler, timestamp, url, status, verification. A user-agent string alone is never treated as verified identity.

No log evidence uploaded.

robots.txt is advisory, not a lock. It tells cooperating crawlers what you prefer — it does not enforce anything. Some crawlers below are reported to ignore it (flagged ⚠). To actually stop a crawler, block it at your CDN/WAF and verify it's genuine by IP.

검사는 당사 서버에서 실행됩니다. 입력한 URL을 가져오지만 결과는 보관하지 않습니다. 익명 실행별 결과 계수는 종합 연구에 사용될 수 있습니다. URL, 도메인, IP 및 식별자는 절대 포함되지 않으며 100회 미만의 실행에 대한 통계는 공개하지 않습니다.

피드백
버그 신고

AI 크롤러 접근 검사기에서 문제가 발생했나요? 무슨 일이 있었는지 알려 주세요. 신고는 공개 목록이 아니라 비공개 분류 대기열로 바로 전송됩니다.

전송될 정보
 도구 입력, 업로드, 붙여넣은 소스, 전체 결과, 쿼리 매개변수 또는 URL 조각은 자동으로 첨부되지 않습니다. 위에서 선택한 구절을 수정하거나 삭제할 수 있습니다. 브라우저 및 악용 방지 메타데이터는 스팸 방지를 위해 처리됩니다. 
Set your posture → robots.txt block

Pick what to block; copy the generated rules into your robots.txt.

  

Blocking here means “documented posture,” not enforcement — a cooperating crawler will honor it; a hostile one may not.

Crawler roster last reviewed . Data is hand-maintained and editable (src/data/ai-crawlers.json).

이 도구 정보

공개 URL의 robots.txt가 GPTBot, ClaudeBot, PerplexityBot, Google-Extended 등 주요 AI crawler를 허용하거나 차단하는지 확인합니다. Google의 오픈 소스 parser 방식으로 승리 규칙과 줄 번호를 보여 주고 llms.txt 존재 여부도 별도로 검사합니다.

robots.txt는 협력 신호이지 강제 차단이 아니며 Allowed·Blocked는 문서화된 접근 방침을 나타낼 뿐 실제 집행을 증명하지 않습니다.

기능

  • 각 AI crawler의 Allowed·Blocked 판정과 승리한 robots.txt rule 및 line number
  • Live retrieval & answer citation과 Model training 목적을 분리한 grouping
  • 공개 IP range 또는 FCrDNS 기반 Verifiable·Unverifiable 상태와 Bot Verifier 연결
  • Googlebot을 실수로 막지 않는 training·retrieval path별 복사 가능한 robots.txt posture generator

작동 방식

URL을 입력하고 Turnstile을 통과하면 server가 robots.txt와 llms.txt를 가져옵니다. 브라우저가 유지 관리되는 crawler 목록에 구체성 우선 parser를 적용해 rule과 line을 표시합니다. generator에서는 training·retrieval posture와 path를 선택해 규칙을 만들되 Googlebot 전체 차단을 피합니다.

제한사항

  • crawler가 robots.txt를 무시할 수 있으며 강제 차단에는 CDN 또는 WAF와 IP 검증이 필요합니다.
  • user-agent는 spoof될 수 있습니다. Unverifiable은 공개된 검증 방법이 없다는 뜻이며 진짜 또는 가짜 판정이 아닙니다.
  • llms.txt는 verdict를 바꾸지 않으며 주요 AI crawler가 이를 읽는다고 공식 문서화되어 있지 않습니다.

자주 묻는 질문

GPTBot을 차단하면 대화형 AI가 내 사이트를 인용하지 못하나요?

그것만으로는 안 됩니다. GPTBot은 학습용 크롤러이므로 차단하면 향후 모델 학습에서 콘텐츠를 제외할 수 있지만, 답변과 출처 인용을 위해 페이지를 가져오는 실시간 검색 봇은 막지 못합니다. 검색 결과와 인용을 위한 봇 및 사용자가 링크를 열 때 작동하는 봇도 별도로 차단해야 답변에서 제외될 수 있으며, 검사기는 이를 실시간 검색 및 답변 인용 항목에 따로 표시합니다.

robots.txt로 Google AI Overviews에서 제외할 수 있나요?

별도의 AI 요약 크롤러는 없으며 Google은 일반 검색에서 페이지를 그대로 유지하면서 AI 요약만 완전히 제외하는 기능을 제공하지 않습니다. Googlebot 차단은 크롤링을 막지만 이미 알려진 URL이 검색에서 사라진다고 보장하지 않습니다. 검색 결과 설명 제어도 일반 검색 설명에 영향을 줍니다. 별도의 확장 제어 신호는 검색이나 AI 요약이 아니라 다른 생성형 서비스의 학습과 근거 사용을 제어합니다.

robots.txt가 실제로 AI 크롤러를 막나요?

robots.txt는 잠금 장치가 아니라 권고입니다. 협조하는 크롤러에 선호를 알릴 뿐 강제하지 않습니다. 신뢰할 만한 운영자는 따르지만 무시한다고 알려진 크롤러도 있어 검사기가 경고 태그로 표시합니다. 실제 차단은 CDN이나 WAF에서 수행하고 사용자 에이전트 문자열을 믿지 말고 IP로 요청의 진위를 확인해야 합니다.

크롤러가 검증 불가로 표시되는 이유는 무엇인가요?

운영자가 현재 IP 범위 또는 순방향 확인을 포함한 역방향 이름 조회처럼 크롤러 주장을 확인할 방법을 공개하는지에 따른 표시입니다. 사용자 에이전트만으로는 언제든 위조할 수 있습니다. Anthropic은 claude.com/crawling/bots.json에 공식 크롤러 IP 목록을 공개하므로 공개 범위 일치는 확인할 수 있지만, 이는 역방향 이름 확인과는 다릅니다.

언어 모델용 안내 파일이 판정에 영향을 주나요?

아니요. 해당 파일은 제안된 커뮤니티 관행이며 주요 AI 크롤러가 읽는다고 문서화되지 않았습니다. 존재 여부는 허용 또는 차단 판정에 영향을 주지 않습니다. 검사기는 정보 제공 목적으로만 파일 존재 여부를 보고하며 모든 접근 판정은 robots.txt만으로 결정합니다.

다음 단계robots.txt 생성기 — generate the corrected version. 안내는 영어로 제공됩니다.