Trình kiểm tra robots.txt

1. robots.txt
2. Pages to test
3. Bots

Chạy hoàn toàn trong trình duyệt của bạn — nội dung bạn dán không được tải lên hay lưu trữ. The server is only used to fetch a site's robots.txt or sitemap (browsers can't — no CORS). Số đếm kết quả ẩn danh theo từng lần chạy có thể được dùng cho nghiên cứu tổng hợp; URL, tên miền, IP và mã định danh không bao giờ được bao gồm, và không công bố số liệu thống kê khi có dưới 100 lần chạy.

Phản hồi
Báo lỗi

Có gì đó không hoạt động trong Trình kiểm tra robots.txt? Hãy cho chúng tôi biết điều gì đã xảy ra — báo cáo được gửi thẳng đến hàng đợi phân loại riêng tư, không phải danh sách công khai.

Thông tin sẽ được gửi
 Dữ liệu nhập vào công cụ, tệp tải lên, nguồn đã dán, kết quả đầy đủ, tham số truy vấn và đoạn URL không được tự động đính kèm. Bạn có thể sửa hoặc xóa đoạn đã chọn ở trên. Siêu dữ liệu trình duyệt và chống lạm dụng được xử lý để ngăn spam. 

Giới thiệu công cụ

Kiểm tra quy tắc robots.txt cho nhiều URL và tác nhân, xem chính xác quy tắc quyết định rồi so sánh với tệp đề xuất.

Tính năng

  • Kiểm tra ma trận URL và tác nhân.
  • Hiển thị quy tắc Allow/Disallow thắng.
  • Mô hình hóa ý nghĩa mã trạng thái.
  • So sánh tệp hiện tại với đề xuất.

Cách hoạt động

Công cụ phân tích nhóm tác nhân và quy tắc theo độ cụ thể, áp dụng ý nghĩa mã trạng thái rồi trả bằng chứng dòng quyết định cho từng URL.

Giới hạn

  • Bị chặn thu thập không đồng nghĩa bị loại chỉ mục.
  • Trình duyệt không thể tải robots.txt khác nguồn trực tiếp.
  • Google có thể tạm dùng bản hợp lệ gần nhất.

Câu hỏi thường gặp

robots.txt có ngăn một trang được lập chỉ mục không?

Không. `Disallow` chặn thu thập chứ không chặn lập chỉ mục. Nếu các trang khác liên kết đến URL bị cấm, Google vẫn có thể lập chỉ mục URL đó, thường không có đoạn trích. Để loại trang khỏi chỉ mục, hãy cho phép thu thập rồi thêm thẻ meta noindex hoặc header X-Robots-Tag; nghĩa là bạn không được đồng thời cấm trang, nếu không Google sẽ không bao giờ thấy noindex.

Thứ tự quy tắc trong robots.txt có quan trọng không?

Không đối với Google. Google áp dụng quy tắc cụ thể nhất—đường dẫn khớp dài nhất—bất kể vị trí trong tệp, nên `Allow` có thể ghi đè một `Disallow` đứng trước. Công cụ này cũng khớp theo cách đó. Một số trình thu thập khác dùng quy tắc khớp đầu tiên, vì vậy hãy giữ quy tắc rõ ràng.

`Disallow` khác noindex như thế nào?

`Disallow` trong robots.txt yêu cầu trình thu thập không truy xuất URL. noindex, dưới dạng thẻ meta hoặc header HTTP trên trang, yêu cầu không giữ URL trong chỉ mục. Chúng giải quyết các vấn đề khác nhau và việc kết hợp gây phản tác dụng: trang bị cấm không được truy xuất nên noindex không bao giờ được nhìn thấy.

Chặn CSS hoặc JavaScript trong robots.txt có ảnh hưởng xấu đến SEO không?

Có thể. Google kết xuất trang để hiểu nội dung, nên nếu không thể truy xuất CSS và JS cần thiết, Google có thể đánh giá sai bố cục, nội dung hoặc độ thân thiện với thiết bị di động. Hãy cho phép các tài nguyên cần để kết xuất trang và chỉ chặn những đường dẫn thực sự không thiết yếu.

Làm cách nào để chặn trình thu thập AI bằng robots.txt?

Thêm một nhóm `user-agent` cho từng trình thu thập AI—như `GPTBot`, `Google-Extended`, `ClaudeBot`, `CCBot` và `PerplexityBot`—với `Disallow: /`. Dùng nút kiểm tra trình thu thập AI để tải chúng và xác nhận quy tắc khớp. Lưu ý rằng tuân thủ robots.txt là tự nguyện; các trình thu thập uy tín sẽ tôn trọng nhưng đây không phải biện pháp kiểm soát truy cập.

Bước tiếp theoTrình tạo robots.txt — generate a replacement robots.txt with the directives you meant to ship. Hướng dẫn có bằng tiếng Anh.