Trình kiểm tra robots.txt
Chạy hoàn toàn trong trình duyệt của bạn — nội dung bạn dán không được tải lên hay lưu trữ. The server is only used to fetch a site's robots.txt or sitemap (browsers can't — no CORS). Số đếm kết quả ẩn danh theo từng lần chạy có thể được dùng cho nghiên cứu tổng hợp; URL, tên miền, IP và mã định danh không bao giờ được bao gồm, và không công bố số liệu thống kê khi có dưới 100 lần chạy.
+ lưu trang web hoặc trang hiện tại. Dùng ☆ bên cạnh trang web, trang hoặc danh sách đã lưu để thêm vào mục yêu thích. Lịch sử kiểm tra gần đây hiển thị bên dưới.
Tạo danh sách có tên
Đã điền mục tiêu từ các lựa chọn cục bộ của bạn.
Hộ chiếu trang web Ngữ cảnh cục bộ cho trang đã lưu này
Dữ liệu cục bộ
Các mục tiêu đã lưu, danh sách có tên và bản tóm tắt kiểm tra gần đây chỉ được giữ trong trình duyệt này.
Identical rows are grouped — click a row's count to expand. Click any cell to see the exact rule that decided it. On mobile, scroll the table sideways.
Why this verdict and how to verify it
Đánh giá công cụ này
Giới thiệu công cụ
Kiểm tra quy tắc robots.txt cho nhiều URL và tác nhân, xem chính xác quy tắc quyết định rồi so sánh với tệp đề xuất.
Tính năng
- Kiểm tra ma trận URL và tác nhân.
- Hiển thị quy tắc Allow/Disallow thắng.
- Mô hình hóa ý nghĩa mã trạng thái.
- So sánh tệp hiện tại với đề xuất.
Cách hoạt động
Công cụ phân tích nhóm tác nhân và quy tắc theo độ cụ thể, áp dụng ý nghĩa mã trạng thái rồi trả bằng chứng dòng quyết định cho từng URL.
Giới hạn
- Bị chặn thu thập không đồng nghĩa bị loại chỉ mục.
- Trình duyệt không thể tải robots.txt khác nguồn trực tiếp.
- Google có thể tạm dùng bản hợp lệ gần nhất.
Câu hỏi thường gặp
robots.txt có ngăn một trang được lập chỉ mục không?
Không. `Disallow` chặn thu thập chứ không chặn lập chỉ mục. Nếu các trang khác liên kết đến URL bị cấm, Google vẫn có thể lập chỉ mục URL đó, thường không có đoạn trích. Để loại trang khỏi chỉ mục, hãy cho phép thu thập rồi thêm thẻ meta noindex hoặc header X-Robots-Tag; nghĩa là bạn không được đồng thời cấm trang, nếu không Google sẽ không bao giờ thấy noindex.
Thứ tự quy tắc trong robots.txt có quan trọng không?
Không đối với Google. Google áp dụng quy tắc cụ thể nhất—đường dẫn khớp dài nhất—bất kể vị trí trong tệp, nên `Allow` có thể ghi đè một `Disallow` đứng trước. Công cụ này cũng khớp theo cách đó. Một số trình thu thập khác dùng quy tắc khớp đầu tiên, vì vậy hãy giữ quy tắc rõ ràng.
`Disallow` khác noindex như thế nào?
`Disallow` trong robots.txt yêu cầu trình thu thập không truy xuất URL. noindex, dưới dạng thẻ meta hoặc header HTTP trên trang, yêu cầu không giữ URL trong chỉ mục. Chúng giải quyết các vấn đề khác nhau và việc kết hợp gây phản tác dụng: trang bị cấm không được truy xuất nên noindex không bao giờ được nhìn thấy.
Chặn CSS hoặc JavaScript trong robots.txt có ảnh hưởng xấu đến SEO không?
Có thể. Google kết xuất trang để hiểu nội dung, nên nếu không thể truy xuất CSS và JS cần thiết, Google có thể đánh giá sai bố cục, nội dung hoặc độ thân thiện với thiết bị di động. Hãy cho phép các tài nguyên cần để kết xuất trang và chỉ chặn những đường dẫn thực sự không thiết yếu.
Làm cách nào để chặn trình thu thập AI bằng robots.txt?
Thêm một nhóm `user-agent` cho từng trình thu thập AI—như `GPTBot`, `Google-Extended`, `ClaudeBot`, `CCBot` và `PerplexityBot`—với `Disallow: /`. Dùng nút kiểm tra trình thu thập AI để tải chúng và xác nhận quy tắc khớp. Lưu ý rằng tuân thủ robots.txt là tự nguyện; các trình thu thập uy tín sẽ tôn trọng nhưng đây không phải biện pháp kiểm soát truy cập.
Các vấn đề thường gặp và cách khắc phục
- Cảnh báo Chỉ thị bị viết sai Cách khắc phục: Sửa chính tả chỉ thị thành tên được hỗ trợ để trình thu thập không bỏ qua.
- Cảnh báo Đang dùng chỉ thị noindex không được hỗ trợ Cách khắc phục: Xóa noindex khỏi robots.txt và dùng thẻ meta robots hoặc X-Robots-Tag trên các URL có thể thu thập dữ liệu.
- Thông tin Google bỏ qua Crawl-delay Cách khắc phục: Xóa Crawl-delay đối với Google và quản lý tốc độ thu thập của Googlebot qua Search Console hoặc các biện pháp kiểm soát năng lực máy chủ.
- Lỗi Quy tắc xuất hiện trước mọi nhóm user-agent Cách khắc phục: Chuyển quy tắc xuống dưới dòng User-agent của nhóm trình thu thập cần áp dụng.
- Cảnh báo Dòng không có dấu hai chấm phân tách Cách khắc phục: Thêm dấu hai chấm còn thiếu giữa tên chỉ thị và giá trị để trình phân tích có thể đọc dòng.
- Thông tin Chỉ thị không xác định bị bỏ qua Cách khắc phục: Xóa chỉ thị không chuẩn hoặc thay bằng chỉ thị robots.txt được hỗ trợ thể hiện đúng quy tắc thu thập mong muốn.
- Thông tin Nhóm trình thu thập không có quy tắc Cách khắc phục: Thêm quy tắc Allow hoặc Disallow mong muốn vào nhóm này, hoặc xóa nhóm để trình thu thập chuyển sang nhóm ký tự đại diện.
- Lỗi Mẫu quy tắc không thể khớp Cách khắc phục: Bắt đầu mẫu đường dẫn bằng / hoặc * để việc khớp có thể bắt đầu từ đầu đường dẫn URL.
- Cảnh báo Dấu neo đô la nằm bên trong mẫu Cách khắc phục: Chuyển $ xuống cuối mẫu nếu cần neo cuối đường dẫn, hoặc xóa nếu không chủ ý dùng ký hiệu đô la theo nghĩa đen.
- Thông tin User-agent bị chia thành nhiều nhóm Cách khắc phục: Gộp các quy tắc của cùng user-agent vào một nhóm để chính sách hiệu lực rõ ràng và dễ bảo trì.
- Lỗi URL sơ đồ trang không phải địa chỉ tuyệt đối Cách khắc phục: Thay vị trí sơ đồ trang tương đối bằng URL đầy đủ gồm https:// và tên máy chủ.
- Lỗi Tệp robots vượt quá 500 KiB Cách khắc phục: Giảm robots.txt xuống dưới 500 KiB bằng cách hợp nhất mẫu và xóa quy tắc thừa trước điểm Google cắt bỏ.
- Thông tin Tệp robots trống Cách khắc phục: Giữ tệp trống nếu chủ ý cho phép mọi hoạt động thu thập; nếu không, hãy thêm các nhóm user-agent rõ ràng và số quy tắc tối thiểu cần thiết.
- Lỗi URL thử nghiệm bị chặn đối với trình thu thập đã chọn Cách khắc phục: Xóa hoặc thu hẹp quy tắc Disallow đang thắng, hoặc thêm quy tắc Allow cụ thể hơn khi URL thử nghiệm cần được thu thập.