Trình kiểm tra quyền truy cập của trình thu thập AI

Free, no signup. “Am I letting ChatGPT, Claude, Perplexity, and Google’s AI read this page — and did I mean to?” Enter a URL and get the answer for every major AI crawler, with the exact robots.txt rule that decided it.

Five separate tests · registry 2026-07-29

Crawler access is only the first layer

Permission

Is the crawler allowed?

Extractability

Are useful facts present in raw HTML?

Renderability

Does JavaScript successfully expose them?

Operability

Can an agent identify and use semantic controls?

Commerce readiness

Do page, schema, feed and checkout facts agree?

HTML remains primary. llms.txt, UCP, and other protocol files are optional distribution layers and cannot compensate for inaccessible or unextractable HTML.

Validate a protocol response

Upload verified-bot log evidence

Expected columns: crawler, timestamp, url, status, verification. A user-agent string alone is never treated as verified identity.

No log evidence uploaded.

robots.txt is advisory, not a lock. It tells cooperating crawlers what you prefer — it does not enforce anything. Some crawlers below are reported to ignore it (flagged ⚠). To actually stop a crawler, block it at your CDN/WAF and verify it's genuine by IP.

Các lần kiểm tra chạy từ máy chủ của chúng tôi; chúng tôi tải URL bạn nhập và không lưu kết quả. Số đếm kết quả ẩn danh theo từng lần chạy có thể được dùng cho nghiên cứu tổng hợp; URL, tên miền, IP và mã định danh không bao giờ được bao gồm, và không công bố số liệu thống kê khi có dưới 100 lần chạy.

Phản hồi
Báo lỗi

Có gì đó không hoạt động trong Trình kiểm tra quyền truy cập của trình thu thập AI? Hãy cho chúng tôi biết điều gì đã xảy ra — báo cáo được gửi thẳng đến hàng đợi phân loại riêng tư, không phải danh sách công khai.

Thông tin sẽ được gửi
 Dữ liệu nhập vào công cụ, tệp tải lên, nguồn đã dán, kết quả đầy đủ, tham số truy vấn và đoạn URL không được tự động đính kèm. Bạn có thể sửa hoặc xóa đoạn đã chọn ở trên. Siêu dữ liệu trình duyệt và chống lạm dụng được xử lý để ngăn spam. 
Set your posture → robots.txt block

Pick what to block; copy the generated rules into your robots.txt.

  

Blocking here means “documented posture,” not enforcement — a cooperating crawler will honor it; a hostile one may not.

Crawler roster last reviewed . Data is hand-maintained and editable (src/data/ai-crawlers.json).

Giới thiệu công cụ

Kiểm tra robots.txt để biết trình thu thập AI nào được phép truy cập cho tìm kiếm, trích dẫn, trợ lý hoặc huấn luyện.

Tính năng

  • Hiển thị quy tắc thắng cho từng trình thu thập.
  • Phân biệt huấn luyện với tìm kiếm và trích dẫn.
  • Tạo khối robots.txt theo tư thế đã chọn.
  • Nêu rõ trường hợp không thể đánh giá.

Cách hoạt động

Công cụ tải robots.txt qua điểm cuối cùng nguồn rồi áp dụng bộ so khớp theo độ cụ thể của Google cho danh sách trình thu thập được bảo trì, trả quyền truy cập và quy tắc quyết định.

Giới hạn

  • robots.txt là tín hiệu hợp tác, không phải cưỡng chế.
  • Nhà cung cấp có thể dùng bản tệp lưu đệm.
  • Kiểm soát meta và tiêu đề HTTP cần kiểm tra riêng.

Câu hỏi thường gặp

Chặn GPTBot có ngăn ChatGPT trích dẫn trang web của tôi không?

Không chỉ bằng cách đó. GPTBot là trình thu thập phục vụ huấn luyện của OpenAI; chặn nó giúp nội dung của bạn không được dùng để huấn luyện mô hình trong tương lai, nhưng không ngăn các bot truy xuất trực tiếp lấy trang để trả lời câu hỏi và trích dẫn nguồn. Các bot đó là OAI-SearchBot (kết quả tìm kiếm và trích dẫn trong ChatGPT) và ChatGPT-người dùng (lấy trang khi người dùng mở một liên kết). Muốn không xuất hiện trong câu trả lời ChatGPT, bạn cũng phải chặn các bot này; trình kiểm tra liệt kê riêng chúng dưới mục "Truy xuất trực tiếp và trích dẫn trong câu trả lời".

Tôi có thể từ chối Google AI Overviews bằng robots.txt không?

Không có trình thu thập riêng cho AI Overviews, và Google không cung cấp cách từ chối hoàn toàn chỉ dành cho AI Overviews mà vẫn giữ nguyên trang trong tìm kiếm. Chặn Googlebot sẽ ngăn thu thập dữ liệu nhưng riêng hành động đó không bảo đảm một URL đã biết sẽ biến mất khỏi tìm kiếm. Các chế độ kiểm soát đoạn trích cũng ảnh hưởng đến đoạn trích tìm kiếm thông thường. Google-Extended kiểm soát riêng việc huấn luyện và căn cứ dữ liệu cho Gemini/Vertex, không kiểm soát tìm kiếm hoặc AI Overviews.

robots.txt có thật sự ngăn được trình thu thập AI không?

robots.txt là hướng dẫn tự nguyện, không phải khóa chặn. Tệp cho các trình thu thập hợp tác biết lựa chọn của bạn nhưng không cưỡng chế điều gì. Các đơn vị vận hành đúng chuẩn sẽ tuân thủ, song một số trình thu thập được báo cáo là phớt lờ tệp; trình kiểm tra gắn cho chúng nhãn "⚠ bỏ qua robots". Để thật sự ngăn trình thu thập, bạn phải chặn tại CDN hoặc WAF và xác minh yêu cầu là thật bằng IP thay vì tin vào chuỗi người dùng-tác nhân.

Tại sao một trình thu thập được hiển thị là "không thể xác minh"?

Nhãn "có thể xác minh" / "không thể xác minh" phản ánh việc đơn vị vận hành có công bố cách kiểm tra tuyên bố về trình thu thập hay không: dải IP hiện hành hoặc DNS ngược kèm xác nhận chuyển tiếp (FCrDNS), được đối chiếu với danh sách của Bot Verifier. Chỉ người dùng-tác nhân thì luôn có thể bị giả mạo. Anthropic hiện công bố danh sách IP trình thu thập chính thức tại claude.com/crawling/bots.json, nên lưu lượng Claude có thể được kiểm tra xem có khớp dải đã công bố hay không; điều đó không đồng nghĩa với xác nhận DNS ngược.

Tệp llms.txt có thay đổi bất kỳ kết luận nào trong số này không?

Không. llms.txt là một quy ước cộng đồng được đề xuất, và chưa có tài liệu cho thấy trình thu thập AI lớn nào đọc tệp này, nên việc có hay không có tệp không ảnh hưởng đến việc trình thu thập được phép hay bị chặn. Trình kiểm tra chỉ báo cáo vì mục đích thông tin liệu tên miền có llms.txt hay không; mọi kết luận về quyền truy cập đều chỉ do robots.txt quyết định.

Bước tiếp theoTrình tạo robots.txt — generate the corrected version. Hướng dẫn có bằng tiếng Anh.