Permission
Is the crawler allowed?
Free, no signup. “Am I letting ChatGPT, Claude, Perplexity, and Google’s AI read this page — and did I mean to?” Enter a URL and get the answer for every major AI crawler, with the exact robots.txt rule that decided it.
Is the crawler allowed?
Are useful facts present in raw HTML?
Does JavaScript successfully expose them?
Can an agent identify and use semantic controls?
Do page, schema, feed and checkout facts agree?
HTML remains primary. llms.txt, UCP, and other protocol files are optional distribution layers and cannot compensate for inaccessible or unextractable HTML.
Expected columns: crawler, timestamp, url, status, verification. A user-agent string alone is never treated as verified identity.
No log evidence uploaded.
Các lần kiểm tra chạy từ máy chủ của chúng tôi; chúng tôi tải URL bạn nhập và không lưu kết quả. Số đếm kết quả ẩn danh theo từng lần chạy có thể được dùng cho nghiên cứu tổng hợp; URL, tên miền, IP và mã định danh không bao giờ được bao gồm, và không công bố số liệu thống kê khi có dưới 100 lần chạy.
+ lưu trang web hoặc trang hiện tại. Dùng ☆ bên cạnh trang web, trang hoặc danh sách đã lưu để thêm vào mục yêu thích. Lịch sử kiểm tra gần đây hiển thị bên dưới.
Đã điền mục tiêu từ các lựa chọn cục bộ của bạn.
Các mục tiêu đã lưu, danh sách có tên và bản tóm tắt kiểm tra gần đây chỉ được giữ trong trình duyệt này.
nosnippet, max-snippet, and data-nosnippet can limit preview/use but also affect normal Search snippets. Google-Extended only controls Gemini/Vertex training and grounding, not Search or Overviews.
nosnippet can block content from generative-model context without preventing title-based discovery, while Bing documents AI-answer/training effects for noarchive and noindex. Use the page audit or extension to inspect those meta and HTTP-header directives.
These fetch pages to answer questions and cite sources. Blocking a cooperating crawler can prevent that crawler from accessing the page, but it does not guarantee absence from every answer or citation.
These collect pages for model training. A provider's documented robots control governs future crawling; it does not remove content already collected or guarantee deletion from an existing training dataset.
Pick what to block; copy the generated rules into your robots.txt.
Blocking here means “documented posture,” not enforcement — a cooperating crawler will honor it; a hostile one may not.
Crawler roster last reviewed . Data is hand-maintained and editable (src/data/ai-crawlers.json).
Kiểm tra robots.txt để biết trình thu thập AI nào được phép truy cập cho tìm kiếm, trích dẫn, trợ lý hoặc huấn luyện.
Công cụ tải robots.txt qua điểm cuối cùng nguồn rồi áp dụng bộ so khớp theo độ cụ thể của Google cho danh sách trình thu thập được bảo trì, trả quyền truy cập và quy tắc quyết định.
Không chỉ bằng cách đó. GPTBot là trình thu thập phục vụ huấn luyện của OpenAI; chặn nó giúp nội dung của bạn không được dùng để huấn luyện mô hình trong tương lai, nhưng không ngăn các bot truy xuất trực tiếp lấy trang để trả lời câu hỏi và trích dẫn nguồn. Các bot đó là OAI-SearchBot (kết quả tìm kiếm và trích dẫn trong ChatGPT) và ChatGPT-người dùng (lấy trang khi người dùng mở một liên kết). Muốn không xuất hiện trong câu trả lời ChatGPT, bạn cũng phải chặn các bot này; trình kiểm tra liệt kê riêng chúng dưới mục "Truy xuất trực tiếp và trích dẫn trong câu trả lời".
Không có trình thu thập riêng cho AI Overviews, và Google không cung cấp cách từ chối hoàn toàn chỉ dành cho AI Overviews mà vẫn giữ nguyên trang trong tìm kiếm. Chặn Googlebot sẽ ngăn thu thập dữ liệu nhưng riêng hành động đó không bảo đảm một URL đã biết sẽ biến mất khỏi tìm kiếm. Các chế độ kiểm soát đoạn trích cũng ảnh hưởng đến đoạn trích tìm kiếm thông thường. Google-Extended kiểm soát riêng việc huấn luyện và căn cứ dữ liệu cho Gemini/Vertex, không kiểm soát tìm kiếm hoặc AI Overviews.
robots.txt là hướng dẫn tự nguyện, không phải khóa chặn. Tệp cho các trình thu thập hợp tác biết lựa chọn của bạn nhưng không cưỡng chế điều gì. Các đơn vị vận hành đúng chuẩn sẽ tuân thủ, song một số trình thu thập được báo cáo là phớt lờ tệp; trình kiểm tra gắn cho chúng nhãn "⚠ bỏ qua robots". Để thật sự ngăn trình thu thập, bạn phải chặn tại CDN hoặc WAF và xác minh yêu cầu là thật bằng IP thay vì tin vào chuỗi người dùng-tác nhân.
Nhãn "có thể xác minh" / "không thể xác minh" phản ánh việc đơn vị vận hành có công bố cách kiểm tra tuyên bố về trình thu thập hay không: dải IP hiện hành hoặc DNS ngược kèm xác nhận chuyển tiếp (FCrDNS), được đối chiếu với danh sách của Bot Verifier. Chỉ người dùng-tác nhân thì luôn có thể bị giả mạo. Anthropic hiện công bố danh sách IP trình thu thập chính thức tại claude.com/crawling/bots.json, nên lưu lượng Claude có thể được kiểm tra xem có khớp dải đã công bố hay không; điều đó không đồng nghĩa với xác nhận DNS ngược.
Không. llms.txt là một quy ước cộng đồng được đề xuất, và chưa có tài liệu cho thấy trình thu thập AI lớn nào đọc tệp này, nên việc có hay không có tệp không ảnh hưởng đến việc trình thu thập được phép hay bị chặn. Trình kiểm tra chỉ báo cáo vì mục đích thông tin liệu tên miền có llms.txt hay không; mọi kết luận về quyền truy cập đều chỉ do robots.txt quyết định.