Trình phân tích tệp nhật ký
Free, no signup. Server logs answer a question your analytics can't: what are crawlers actually doing on your site. Drop one in and see crawl budget by bot and by section, how much is wasted on 404s and redirects, how AI crawlers compare to search engines, and which requests are impostors faking a crawler user-agent.
Handles nginx / Apache (combined & common), IIS / W3C Extended, and JSON logs (incl. Cloudflare Logpush) — format auto-detected. Crawler ranges updated 24 days ago.
Chạy hoàn toàn trong trình duyệt của bạn — nội dung bạn dán không được tải lên hay lưu trữ. Spot-checking a suspicious IP against the Googlebot Verifier sends only that IP to our server. Số đếm kết quả ẩn danh theo từng lần chạy có thể được dùng cho nghiên cứu tổng hợp; URL, tên miền, IP và mã định danh không bao giờ được bao gồm, và không công bố số liệu thống kê khi có dưới 100 lần chạy.
Hộ chiếu trang web Ngữ cảnh cục bộ cho trang đã lưu này
Dữ liệu cục bộ
Các mục tiêu đã lưu, danh sách có tên và bản tóm tắt kiểm tra gần đây chỉ được giữ trong trình duyệt này.
Who's crawling you
Requests grouped by crawler type. AI crawlers and search engines want different things from your site. "Other / unclassified" is everything with no known crawler user-agent — human browsers and untracked tools.
Crawl over time
Daily crawl requests by crawler type across the log's date range.
Crawl budget by bot
Each crawler seen in the log: how many requests, how it was verified, and how much of its crawl hit redirects or errors (excluding 304 revalidation).
Spoofer report
Requests that sent a crawler's user-agent from an IP outside that operator's published ranges — likely impostors. robots.txt won't stop these (impostors ignore it); block by IP or ASN. Spot-check any IP for the real network owner via forward-confirmed reverse DNS — this is the one action that leaves your browser (a single lookup to our verifier API).
Crawler × page-type matrix
Where each recognized crawler concentrates requests across inferred page cohorts. Cell intensity represents request count; the label also shows wasted requests.
Crawl budget by section
Where crawlers spend their time on your site (bot traffic only). High waste in a section means crawlers are burning budget on broken or redirecting URLs there.
Most-wasted URLs
Individual URLs where crawlers hit redirects or errors most often (excluding 304 revalidation) — the highest-leverage fixes for crawl budget.
AI-invented URL candidates
Observed 404/410 requests with an AI crawler or known AI-assistant referrer. This is the primary evidence mode: a row is a candidate, not proof that a model invented it — it may be a deleted or migrated URL. Suggested destinations compare only against the sitemap/URL list you supplied above.
Optional URL probe simulation
Ask the site’s open-model simulator for plausible paths, then check their live status. This is explicitly a simulation, never observed assistant output; log evidence above is stronger.
Expected URLs vs crawler requests
Recommendations
Đánh giá công cụ này
Giới thiệu công cụ
Nhật ký truy cập máy chủ là nguồn dữ liệu thực tế cho biết các trình thu thập hoạt động thế nào trên trang của bạn. Hãy xem ngân sách thu thập theo bot và khu vực, phần lãng phí do lỗi 404 và chuyển hướng, so sánh trình thu thập AI với công cụ tìm kiếm, cũng như các yêu cầu giả mạo danh trình thu thập.
Các định dạng nginx, Apache, IIS/W3C và JSON được phân tích ngay trong trình duyệt; không có tệp nào được tải lên, và kết quả phản ánh hoạt động thu thập chứ không phải trạng thái lập chỉ mục.
Tính năng
- Ngân sách thu thập theo bot với số lượng đã xác minh, giả mạo và không thể xác minh, bảng trạng thái và tỷ lệ lãng phí.
- Phân tách trình thu thập tìm kiếm, AI và huấn luyện theo khu vực cùng biểu đồ xu hướng hằng ngày.
- Báo cáo giả mạo kèm kiểm tra DNS ngược và ASN theo từng IP đáng ngờ, bao gồm xác minh Googlebot.
- Đề xuất xếp hạng với các dòng robots.txt có thể sao chép, cùng tệp CSV xuất danh sách bot và URL lãng phí.
Cách hoạt động
Kéo một hoặc nhiều tệp nhật ký vào vùng tải lên hoặc nạp dữ liệu mẫu. Định dạng được nhận diện tự động, tệp lớn được truyền theo từng phần và mỗi dòng được gắn các thuộc tính về bot, IP, trạng thái và đường dẫn. Sau đó công cụ tính ngân sách, mức lãng phí và xu hướng, kiểm tra trực tiếp các IP đáng ngờ rồi đưa ra các cách khắc phục cụ thể.
Giới hạn
- Công cụ chỉ thấy các yêu cầu được máy chủ ghi lại; công cụ không biết vì sao trình thu thập chọn URL đó hoặc URL có được lập chỉ mục hay không.
- Trình thu thập của nhà vận hành không công bố dải IP sẽ được đánh dấu là không thể xác minh, thay vì kết luận là thật hay giả.
- Khu vực được suy ra từ đường dẫn URL, vì vậy độ rõ ràng của nhóm phụ thuộc cấu trúc trang; báo cáo mô tả hoạt động thu thập chứ không phải kết quả lập chỉ mục.
Câu hỏi thường gặp
Tệp nhật ký của tôi có được tải lên đâu không?
Không. Việc phân tích cú pháp và phân tích dữ liệu diễn ra hoàn toàn trong trình duyệt qua Web Worker; tệp được đọc từ ổ đĩa và truyền cục bộ theo từng phần, không có nội dung nào được gửi đến máy chủ. Ngoại lệ duy nhất là lượt kiểm tra từng IP tùy chọn trong báo cáo giả mạo, khi một địa chỉ IP duy nhất (không phải nhật ký của bạn) được gửi đến API xác minh để chạy tra cứu DNS ngược có xác nhận chuyển tiếp và ASN. Khi bạn đóng thẻ, toàn bộ dữ liệu đã phân tích sẽ biến mất.
Công cụ hỗ trợ những định dạng nhật ký nào?
Định dạng được tự động phát hiện. Công cụ đọc định dạng combined và common của nginx và Apache, IIS / W3C Extended (định dạng mở rộng), cùng nhật ký JSON bao gồm Cloudflare Logpush. Bạn có thể thả nhiều tệp cùng lúc, và nhật ký lớn được truyền theo từng phần để một tệp nhật ký truy cập nhiều GB không làm treo thẻ trình duyệt.
Công cụ phân biệt trình thu thập thật với trình giả mạo như thế nào?
Mỗi yêu cầu trước hết được đối chiếu với trình thu thập đã biết qua chuỗi nhận diện, sau đó IP nguồn được kiểm tra với các dải IP do đơn vị vận hành công bố, cùng những danh sách cập nhật hằng tuần mà Trình xác minh Googlebot sử dụng. Một yêu cầu tự nhận là Googlebot nhưng đến từ IP ngoài dải của Google sẽ bị gắn cờ là có khả năng giả mạo. Một số đơn vị vận hành như ByteDance với Bytespider không công bố dải IP, nên các lượt truy cập đó được đánh dấu là không thể xác minh thay vì giả mạo.
Thế nào được xem là lãng phí ngân sách thu thập dữ liệu?
Đó là mọi yêu cầu của trình thu thập nhận chuyển hướng (trừ lượt xác thực lại 304 hữu ích), lỗi 4xx như 404 hoặc 410, hay lỗi máy chủ 5xx. Công cụ tổng hợp mức lãng phí theo trình thu thập, theo phần và theo từng URL để bạn nhận ra nơi có những cách khắc phục mang lại tác động lớn nhất.
Tôi có thể chặn trình giả mạo bằng robots.txt không?
Không. Kẻ giả mạo dùng chuỗi nhận diện trình thu thập chính là để có thể phớt lờ robots.txt, nên dòng Disallow không có tác dụng với chúng; thay vào đó, hãy chặn theo IP hoặc ASN ở biên mạng hay tường lửa. robots.txt là công cụ phù hợp với trình thu thập thật đang lãng phí ngân sách ở những phần bạn không muốn được thu thập, và bảng Đề xuất tạo sẵn các dòng Disallow để bạn sao chép cho đúng những trường hợp đó.
Các vấn đề thường gặp và cách khắc phục
- Cảnh báo Tuyên bố của trình thu thập nằm ngoài dải do nhà vận hành công bố Cách khắc phục: Coi trình thu thập là chưa được xác minh và chặn hoặc điều tra cho đến khi IP của nó khớp dải do nhà vận hành công bố.
- Cảnh báo Trình thu thập dành yêu cầu cho các URL không hữu ích Cách khắc phục: Chặn thu thập hoặc đặt URL chính tắc cho các URL tham số, bộ lọc, tìm kiếm và trùng lặp có giá trị thấp, rồi tăng cường liên kết đến các URL cần được trình thu thập ưu tiên.
- Cảnh báo Trình thu thập liên tục nhận phản hồi lỗi Cách khắc phục: Sửa hoặc chuyển hướng các URL được trình thu thập yêu cầu nhiều nhất đang trả về phản hồi 4xx/5xx, và xóa liên kết nội bộ đến các URL cần tiếp tục không còn tồn tại.
- Cần xem xét Trình thu thập gặp quá nhiều chuyển hướng Cách khắc phục: Cập nhật liên kết nội bộ và mục sơ đồ trang để trỏ thẳng đến URL cuối, đồng thời rút gọn chuỗi chuyển hướng còn một bước.
- Cần xem xét Trình thu thập truy cập URL ngoài tập URL dự kiến Cách khắc phục: Thêm URL do trình thu thập phát hiện vào tập liên kết nội bộ và sơ đồ trang chính tắc, hoặc chuyển hướng hay xóa URL nếu đó là URL ngoài ý muốn.
- Cần xem xét URL quan trọng dự kiến không có lượt truy cập của trình thu thập Cách khắc phục: Thêm liên kết nội bộ có thể thu thập và một mục sơ đồ trang chính tắc cho URL dự kiến, rồi kiểm tra các rào cản robots và xác thực.
- Cảnh báo Hoạt động của trình thu thập giảm đáng kể Cách khắc phục: So sánh ngày giảm với các thay đổi về robots, trạng thái, sơ đồ trang, triển khai và năng lực máy chủ, rồi khôi phục đường thu thập bị ảnh hưởng.
- Cần xem xét Hoạt động của trình thu thập tăng đột biến đáng kể Cách khắc phục: Xác định mẫu URL gây ra mức tăng đột biến và kiểm soát các tham số, bẫy, chuyển hướng hoặc đường thu thập trùng lặp mới bị lộ.
- Cần xem xét Thời gian phản hồi cho trình thu thập chậm Cách khắc phục: Lưu vào bộ nhớ đệm hoặc tối ưu các điểm cuối chậm nhất đối với trình thu thập và giảm độ trễ máy chủ gốc trước khi yêu cầu thu thập lại.