Trình phân tích tệp nhật ký

Free, no signup. Server logs answer a question your analytics can't: what are crawlers actually doing on your site. Drop one in and see crawl budget by bot and by section, how much is wasted on 404s and redirects, how AI crawlers compare to search engines, and which requests are impostors faking a crawler user-agent.

Handles nginx / Apache (combined & common), IIS / W3C Extended, and JSON logs (incl. Cloudflare Logpush) — format auto-detected. Crawler ranges updated 24 days ago.

Drop your access log here
or ·
Multiple files allowed. Big logs stream in chunks.

Chạy hoàn toàn trong trình duyệt của bạn — nội dung bạn dán không được tải lên hay lưu trữ. Spot-checking a suspicious IP against the Googlebot Verifier sends only that IP to our server. Số đếm kết quả ẩn danh theo từng lần chạy có thể được dùng cho nghiên cứu tổng hợp; URL, tên miền, IP và mã định danh không bao giờ được bao gồm, và không công bố số liệu thống kê khi có dưới 100 lần chạy.

Phản hồi
Báo lỗi

Có gì đó không hoạt động trong Trình phân tích tệp nhật ký? Hãy cho chúng tôi biết điều gì đã xảy ra — báo cáo được gửi thẳng đến hàng đợi phân loại riêng tư, không phải danh sách công khai.

Thông tin sẽ được gửi
 Dữ liệu nhập vào công cụ, tệp tải lên, nguồn đã dán, kết quả đầy đủ, tham số truy vấn và đoạn URL không được tự động đính kèm. Bạn có thể sửa hoặc xóa đoạn đã chọn ở trên. Siêu dữ liệu trình duyệt và chống lạm dụng được xử lý để ngăn spam. 

Giới thiệu công cụ

Nhật ký truy cập máy chủ là nguồn dữ liệu thực tế cho biết các trình thu thập hoạt động thế nào trên trang của bạn. Hãy xem ngân sách thu thập theo bot và khu vực, phần lãng phí do lỗi 404 và chuyển hướng, so sánh trình thu thập AI với công cụ tìm kiếm, cũng như các yêu cầu giả mạo danh trình thu thập.

Các định dạng nginx, Apache, IIS/W3C và JSON được phân tích ngay trong trình duyệt; không có tệp nào được tải lên, và kết quả phản ánh hoạt động thu thập chứ không phải trạng thái lập chỉ mục.

Tính năng

  • Ngân sách thu thập theo bot với số lượng đã xác minh, giả mạo và không thể xác minh, bảng trạng thái và tỷ lệ lãng phí.
  • Phân tách trình thu thập tìm kiếm, AI và huấn luyện theo khu vực cùng biểu đồ xu hướng hằng ngày.
  • Báo cáo giả mạo kèm kiểm tra DNS ngược và ASN theo từng IP đáng ngờ, bao gồm xác minh Googlebot.
  • Đề xuất xếp hạng với các dòng robots.txt có thể sao chép, cùng tệp CSV xuất danh sách bot và URL lãng phí.

Cách hoạt động

Kéo một hoặc nhiều tệp nhật ký vào vùng tải lên hoặc nạp dữ liệu mẫu. Định dạng được nhận diện tự động, tệp lớn được truyền theo từng phần và mỗi dòng được gắn các thuộc tính về bot, IP, trạng thái và đường dẫn. Sau đó công cụ tính ngân sách, mức lãng phí và xu hướng, kiểm tra trực tiếp các IP đáng ngờ rồi đưa ra các cách khắc phục cụ thể.

Giới hạn

  • Công cụ chỉ thấy các yêu cầu được máy chủ ghi lại; công cụ không biết vì sao trình thu thập chọn URL đó hoặc URL có được lập chỉ mục hay không.
  • Trình thu thập của nhà vận hành không công bố dải IP sẽ được đánh dấu là không thể xác minh, thay vì kết luận là thật hay giả.
  • Khu vực được suy ra từ đường dẫn URL, vì vậy độ rõ ràng của nhóm phụ thuộc cấu trúc trang; báo cáo mô tả hoạt động thu thập chứ không phải kết quả lập chỉ mục.

Câu hỏi thường gặp

Tệp nhật ký của tôi có được tải lên đâu không?

Không. Việc phân tích cú pháp và phân tích dữ liệu diễn ra hoàn toàn trong trình duyệt qua Web Worker; tệp được đọc từ ổ đĩa và truyền cục bộ theo từng phần, không có nội dung nào được gửi đến máy chủ. Ngoại lệ duy nhất là lượt kiểm tra từng IP tùy chọn trong báo cáo giả mạo, khi một địa chỉ IP duy nhất (không phải nhật ký của bạn) được gửi đến API xác minh để chạy tra cứu DNS ngược có xác nhận chuyển tiếp và ASN. Khi bạn đóng thẻ, toàn bộ dữ liệu đã phân tích sẽ biến mất.

Công cụ hỗ trợ những định dạng nhật ký nào?

Định dạng được tự động phát hiện. Công cụ đọc định dạng combined và common của nginx và Apache, IIS / W3C Extended (định dạng mở rộng), cùng nhật ký JSON bao gồm Cloudflare Logpush. Bạn có thể thả nhiều tệp cùng lúc, và nhật ký lớn được truyền theo từng phần để một tệp nhật ký truy cập nhiều GB không làm treo thẻ trình duyệt.

Công cụ phân biệt trình thu thập thật với trình giả mạo như thế nào?

Mỗi yêu cầu trước hết được đối chiếu với trình thu thập đã biết qua chuỗi nhận diện, sau đó IP nguồn được kiểm tra với các dải IP do đơn vị vận hành công bố, cùng những danh sách cập nhật hằng tuần mà Trình xác minh Googlebot sử dụng. Một yêu cầu tự nhận là Googlebot nhưng đến từ IP ngoài dải của Google sẽ bị gắn cờ là có khả năng giả mạo. Một số đơn vị vận hành như ByteDance với Bytespider không công bố dải IP, nên các lượt truy cập đó được đánh dấu là không thể xác minh thay vì giả mạo.

Thế nào được xem là lãng phí ngân sách thu thập dữ liệu?

Đó là mọi yêu cầu của trình thu thập nhận chuyển hướng (trừ lượt xác thực lại 304 hữu ích), lỗi 4xx như 404 hoặc 410, hay lỗi máy chủ 5xx. Công cụ tổng hợp mức lãng phí theo trình thu thập, theo phần và theo từng URL để bạn nhận ra nơi có những cách khắc phục mang lại tác động lớn nhất.

Tôi có thể chặn trình giả mạo bằng robots.txt không?

Không. Kẻ giả mạo dùng chuỗi nhận diện trình thu thập chính là để có thể phớt lờ robots.txt, nên dòng Disallow không có tác dụng với chúng; thay vào đó, hãy chặn theo IP hoặc ASN ở biên mạng hay tường lửa. robots.txt là công cụ phù hợp với trình thu thập thật đang lãng phí ngân sách ở những phần bạn không muốn được thu thập, và bảng Đề xuất tạo sẵn các dòng Disallow để bạn sao chép cho đúng những trường hợp đó.

Bước tiếp theoTrình tạo robots.txt — generate the corrected version. Hướng dẫn có bằng tiếng Anh.