So sánh trang theo lịch sử

Các lần kiểm tra chạy từ máy chủ của chúng tôi; chúng tôi tải URL bạn nhập và không lưu kết quả. The exact URL is sent in a POST body to this site, then used for bounded Common Crawl index/WARC lookup and a safe current-page fetch. Results may be cached; raw archived HTML is not returned. Số đếm kết quả ẩn danh theo từng lần chạy có thể được dùng cho nghiên cứu tổng hợp; URL, tên miền, IP và mã định danh không bao giờ được bao gồm, và không công bố số liệu thống kê khi có dưới 100 lần chạy.

Phản hồi
Báo lỗi

Có gì đó không hoạt động trong So sánh trang theo lịch sử? Hãy cho chúng tôi biết điều gì đã xảy ra — báo cáo được gửi thẳng đến hàng đợi phân loại riêng tư, không phải danh sách công khai.

Thông tin sẽ được gửi
 Dữ liệu nhập vào công cụ, tệp tải lên, nguồn đã dán, kết quả đầy đủ, tham số truy vấn và đoạn URL không được tự động đính kèm. Bạn có thể sửa hoặc xóa đoạn đã chọn ở trên. Siêu dữ liệu trình duyệt và chống lạm dụng được xử lý để ngăn spam. 

Giới thiệu công cụ

So sánh một ảnh chụp Common Crawl có giới hạn với trang hiện tại để xem xét siêu dữ liệu, canonical, chỉ thị robots, loại dữ liệu có cấu trúc và thay đổi trong văn bản trích xuất.

Tính năng

  • So sánh các tín hiệu title, H1, meta description và canonical.
  • Tách riêng phát hiện về trạng thái HTTP và mức bao phủ của kho lưu trữ.
  • Đoạn văn bản có giới hạn kèm điểm tương đồng.
  • Xử lý cục bộ các dữ kiện đã dẫn xuất mà không chạy lại script được lưu trữ.

Cách hoạt động

Dịch vụ chọn một chỉ mục Common Crawl phù hợp, đọc một phạm vi WARC có giới hạn và tải trang công khai hiện tại qua endpoint được bảo vệ. Công cụ trích xuất các dữ kiện HTML có thể so sánh cùng các đoạn văn bản bị giới hạn mà không thực thi tài nguyên con đã lưu trữ.

Giới hạn

  • Common Crawl có thể bỏ sót, cắt ngắn hoặc lập chỉ mục lại một ảnh chụp không có payload.
  • Một khác biệt là bằng chứng cần xem xét, không tự động là lỗi SEO.
  • Quyền sử dụng nội dung lưu trữ vẫn phải được xác minh với nguồn.

Câu hỏi thường gặp

Công cụ so sánh những gì?

Công cụ so sánh bản chụp Common Crawl đã chọn của một URL chính xác với trang công khai hiện tại: tiêu đề, H1, mô tả meta, canonical, chỉ thị robots, số từ, loại dữ liệu có cấu trúc, độ tương đồng văn bản có giới hạn và các đoạn trích được thêm hoặc xóa có giới hạn. Trạng thái HTTP của bản chụp và trang hiện tại được hiển thị riêng dưới dạng quan sát nguồn, không phải phép so sánh lịch sử trạng thái.

Không có bản chụp có nghĩa là trang chưa từng tồn tại không?

Không. Common Crawl lấy mẫu mạng và không chụp mọi URL trong mỗi lần thu thập. Các bản ghi bị thiếu, không đầy đủ, chỉ chứa lượt truy cập lại hoặc bị cắt ngắn được báo cáo là giới hạn phạm vi thay vì bị chuyển thành trạng thái đạt hoặc không đạt.

Tôi có thể xem hoặc tải xuống toàn bộ trang đã lưu trữ không?

Không. Dịch vụ truy xuất một phạm vi dữ liệu WARC chính xác và chỉ trả về các dữ kiện suy ra cùng những đoạn văn bản có giới hạn. Dịch vụ không cung cấp trình xem lưu trữ toàn trang, không thực thi JavaScript đã lưu trữ và không tải tài nguyên phụ đã lưu trữ.

Tôi có thể sử dụng kết quả cho mục đích thương mại không?

Công cụ này báo cáo các quan sát suy ra và không cấp quyền đối với nội dung lưu trữ của bên thứ ba. Hãy xem xét các điều khoản hiện hành của Common Crawl và quyền của trang nguồn trước khi dựa vào tài liệu lưu trữ trong một sản phẩm thương mại.

Bước tiếp theoTrình tạo XML Sitemap — generate the corrected version. Hướng dẫn có bằng tiếng Anh.