Permission
Is the crawler allowed?
Free, no signup. “Am I letting ChatGPT, Claude, Perplexity, and Google’s AI read this page — and did I mean to?” Enter a URL and get the answer for every major AI crawler, with the exact robots.txt rule that decided it.
Is the crawler allowed?
Are useful facts present in raw HTML?
Does JavaScript successfully expose them?
Can an agent identify and use semantic controls?
Do page, schema, feed and checkout facts agree?
HTML remains primary. llms.txt, UCP, and other protocol files are optional distribution layers and cannot compensate for inaccessible or unextractable HTML.
Expected columns: crawler, timestamp, url, status, verification. A user-agent string alone is never treated as verified identity.
No log evidence uploaded.
검사는 당사 서버에서 실행됩니다. 입력한 URL을 가져오지만 결과는 보관하지 않습니다. 익명 실행별 결과 계수는 종합 연구에 사용될 수 있습니다. URL, 도메인, IP 및 식별자는 절대 포함되지 않으며 100회 미만의 실행에 대한 통계는 공개하지 않습니다.
+를 눌러 현재 사이트 또는 페이지를 저장합니다. 저장된 사이트, 페이지 또는 목록 옆의 ☆를 사용해 즐겨찾기에 추가하세요. 최근 검사 기록은 아래에 표시됩니다.
로컬 선택에서 대상을 입력했습니다.
저장된 대상, 이름 있는 목록 및 최근 검사 요약은 이 브라우저에만 남습니다.
nosnippet, max-snippet, and data-nosnippet can limit preview/use but also affect normal Search snippets. Google-Extended only controls Gemini/Vertex training and grounding, not Search or Overviews.
nosnippet can block content from generative-model context without preventing title-based discovery, while Bing documents AI-answer/training effects for noarchive and noindex. Use the page audit or extension to inspect those meta and HTTP-header directives.
These fetch pages to answer questions and cite sources. Blocking a cooperating crawler can prevent that crawler from accessing the page, but it does not guarantee absence from every answer or citation.
These collect pages for model training. A provider's documented robots control governs future crawling; it does not remove content already collected or guarantee deletion from an existing training dataset.
Pick what to block; copy the generated rules into your robots.txt.
Blocking here means “documented posture,” not enforcement — a cooperating crawler will honor it; a hostile one may not.
Crawler roster last reviewed . Data is hand-maintained and editable (src/data/ai-crawlers.json).
공개 URL의 robots.txt가 GPTBot, ClaudeBot, PerplexityBot, Google-Extended 등 주요 AI crawler를 허용하거나 차단하는지 확인합니다. Google의 오픈 소스 parser 방식으로 승리 규칙과 줄 번호를 보여 주고 llms.txt 존재 여부도 별도로 검사합니다.
robots.txt는 협력 신호이지 강제 차단이 아니며 Allowed·Blocked는 문서화된 접근 방침을 나타낼 뿐 실제 집행을 증명하지 않습니다.
URL을 입력하고 Turnstile을 통과하면 server가 robots.txt와 llms.txt를 가져옵니다. 브라우저가 유지 관리되는 crawler 목록에 구체성 우선 parser를 적용해 rule과 line을 표시합니다. generator에서는 training·retrieval posture와 path를 선택해 규칙을 만들되 Googlebot 전체 차단을 피합니다.
그것만으로는 안 됩니다. GPTBot은 학습용 크롤러이므로 차단하면 향후 모델 학습에서 콘텐츠를 제외할 수 있지만, 답변과 출처 인용을 위해 페이지를 가져오는 실시간 검색 봇은 막지 못합니다. 검색 결과와 인용을 위한 봇 및 사용자가 링크를 열 때 작동하는 봇도 별도로 차단해야 답변에서 제외될 수 있으며, 검사기는 이를 실시간 검색 및 답변 인용 항목에 따로 표시합니다.
별도의 AI 요약 크롤러는 없으며 Google은 일반 검색에서 페이지를 그대로 유지하면서 AI 요약만 완전히 제외하는 기능을 제공하지 않습니다. Googlebot 차단은 크롤링을 막지만 이미 알려진 URL이 검색에서 사라진다고 보장하지 않습니다. 검색 결과 설명 제어도 일반 검색 설명에 영향을 줍니다. 별도의 확장 제어 신호는 검색이나 AI 요약이 아니라 다른 생성형 서비스의 학습과 근거 사용을 제어합니다.
robots.txt는 잠금 장치가 아니라 권고입니다. 협조하는 크롤러에 선호를 알릴 뿐 강제하지 않습니다. 신뢰할 만한 운영자는 따르지만 무시한다고 알려진 크롤러도 있어 검사기가 경고 태그로 표시합니다. 실제 차단은 CDN이나 WAF에서 수행하고 사용자 에이전트 문자열을 믿지 말고 IP로 요청의 진위를 확인해야 합니다.
운영자가 현재 IP 범위 또는 순방향 확인을 포함한 역방향 이름 조회처럼 크롤러 주장을 확인할 방법을 공개하는지에 따른 표시입니다. 사용자 에이전트만으로는 언제든 위조할 수 있습니다. Anthropic은 claude.com/crawling/bots.json에 공식 크롤러 IP 목록을 공개하므로 공개 범위 일치는 확인할 수 있지만, 이는 역방향 이름 확인과는 다릅니다.
아니요. 해당 파일은 제안된 커뮤니티 관행이며 주요 AI 크롤러가 읽는다고 문서화되지 않았습니다. 존재 여부는 허용 또는 차단 판정에 영향을 주지 않습니다. 검사기는 정보 제공 목적으로만 파일 존재 여부를 보고하며 모든 접근 판정은 robots.txt만으로 결정합니다.