Trình tạo XML Sitemap
Bounded and polite: at most three page requests run at once; each request is capped at 900 KB/10 seconds, and the server also rate-limits each target host. This is a sitemap seed, not a full-site crawler.
Các lần kiểm tra chạy từ máy chủ của chúng tôi; chúng tôi tải URL bạn nhập và không lưu kết quả. The start site, its robots.txt, and eligible same-host HTML pages are sent through this site's bounded fetch endpoints. Crawl decisions and XML generation run in your browser. Số đếm kết quả ẩn danh theo từng lần chạy có thể được dùng cho nghiên cứu tổng hợp; URL, tên miền, IP và mã định danh không bao giờ được bao gồm, và không công bố số liệu thống kê khi có dưới 100 lần chạy.
+ lưu trang web hoặc trang hiện tại. Dùng ☆ bên cạnh trang web, trang hoặc danh sách đã lưu để thêm vào mục yêu thích. Lịch sử kiểm tra gần đây hiển thị bên dưới.
Tạo danh sách có tên
Đã điền mục tiêu từ các lựa chọn cục bộ của bạn.
Hộ chiếu trang web Ngữ cảnh cục bộ cho trang đã lưu này
Dữ liệu cục bộ
Các mục tiêu đã lưu, danh sách có tên và bản tóm tắt kiểm tra gần đây chỉ được giữ trong trình duyệt này.
Sitemap output
Excluded
Unknown / not included
Đánh giá công cụ này
Giới thiệu công cụ
Thu thập một tập hợp giới hạn các trang cùng trang web, tôn trọng robots.txt, loại trừ URL noindex và URL có canonical sang nơi khác, rồi tải xuống sơ đồ trang XML minh bạch.
Tính năng
- Thu thập cùng nguồn với giới hạn cứng có thể chọn.
- Tôn trọng quy tắc robots.txt dành cho Googlebot.
- Loại trừ trang noindex và trang canonical sang URL khác.
- Chỉ xuất lastmod khi có ngày có thể xác minh.
Cách hoạt động
Công cụ bắt đầu từ URL đã nhập, theo liên kết cùng nguồn với tối đa ba yêu cầu đồng thời, áp dụng robots.txt và chỉ đưa vào các phản hồi HTML thành công không bị noindex hay canonical sang nơi khác.
Giới hạn
- Tối đa 200 trang nên đây không phải trình thu thập toàn bộ trang web.
- Phản hồi lỗi, không phải HTML hoặc bị cắt ngắn được giữ ở trạng thái không xác định.
- priority và changefreq được bỏ qua vì Google không sử dụng các gợi ý này.
Câu hỏi thường gặp
Công cụ này có thu thập toàn bộ trang web của tôi không?
Không. Bạn chọn một giới hạn cứng tối đa 200 trang. Công cụ cho biết khi hàng đợi vẫn chưa trống ở mức giới hạn đó, vì vậy một lần thu thập bị giới hạn sẽ không bao giờ được trình bày là đã hoàn tất.
Những trang nào bị loại trừ?
Các trang có tiêu đề phản hồi hoặc thẻ meta noindex, các trang có canonical trỏ sang nơi khác và các URL bị robots.txt cấm Googlebot đều bị loại trừ. Phản hồi lỗi, không phải HTML, bị cắt ngắn và không thuộc nhóm 2xx được giữ ở trạng thái chưa xác định riêng.
lastmod được chọn như thế nào?
Công cụ chỉ xuất một giá trị hợp lệ từ tiêu đề HTTP Last-Modified, thuộc tính datetime của phần tử time hiển thị hoặc giá trị JSON-LD dateModified/datePublished. Công cụ không bao giờ gắn ngày hôm nay cho mọi trang.
Các vấn đề thường gặp và cách khắc phục
- Cảnh báo Trang noindex bị loại khỏi sơ đồ trang Cách khắc phục: Xóa noindex nếu trang cần được lập chỉ mục; nếu không, tiếp tục loại trang khỏi sơ đồ trang.
- Cảnh báo Trang không trả về mã 200 bị loại khỏi sơ đồ trang Cách khắc phục: Khôi phục phản hồi 200 trực tiếp cho trang chính tắc hoặc tiếp tục loại URL không trả về mã 200 khỏi sơ đồ trang.
- Cảnh báo Trang có canonical trỏ sang nơi khác bị loại Cách khắc phục: Chỉ đưa đích chính tắc vào và tiếp tục loại URL có canonical trỏ sang nơi khác khỏi sơ đồ trang.
- Thông tin URL trùng lặp đã bị loại bỏ Cách khắc phục: Giữ lại một mục URL chính tắc đã chuẩn hóa và loại bỏ các cách viết trùng lặp hoặc biến thể tham số.
- Cảnh báo URL không hợp lệ bị loại Cách khắc phục: Sửa URL tuyệt đối sai định dạng trước khi thêm vào sơ đồ trang.
- Cảnh báo URL thuộc máy chủ khác bị loại Cách khắc phục: Tạo một sơ đồ trang riêng cho máy chủ đã xác minh còn lại và giữ sơ đồ trang này dành riêng cho máy chủ hiện tại.