Hướng dẫn về tần suất thu thập dữ liệu

Các công cụ tìm kiếm thu thập lại một trang đã biết thường xuyên đến mức nào — yếu tố nào chi phối việc này (mức độ phổ biến, độ cũ, lastmod trung thực), yếu tố nào không (changefreq, priority, xuất bản hằng ngày), và vì sao bạn không thể ép buộc.

Tần suất thu thập dữ liệu là mức độ thường xuyên một công cụ tìm kiếm tìm nạp lại trang mà nó đã biết. Yếu tố chi phối chính là tầm quan trọng của trang (mức độ phổ biến, PageRank, liên kết) và mức độ thường xuyên trang thực sự thay đổi (độ cũ); Google cũng nêu thêm các đầu vào khác của nhu cầu thu thập. Google học nhịp cập nhật của từng trang rồi điều chỉnh. Bạn chỉ có thể tác động gián tiếp thông qua tầm quan trọng, thay đổi thực, lastmod chính xác và máy chủ khỏe mạnh, chứ không thể tự đặt tần suất. Google bỏ qua changefreq và priority; sửa lastmod chỉ để làm mới ngày tháng sẽ phản tác dụng; và được thu thập thường xuyên hơn không giúp cải thiện thứ hạng.

Tóm tắt — Tần suất thu thập dữ liệu là nhịp thu thập lại của một URL đã biết, do bộ lập lịch quyết định chủ yếu từ hai đầu vào: tầm quan trọng (mức độ phổ biến / PageRank / liên kết) và độ cũ (trang thực sự thay đổi thường xuyên đến mức nào). Tài liệu của Google còn nêu những đầu vào nhu cầu khác như số lượng URL ước tính và các sự kiện trên toàn trang web. Google học quy luật cập nhật của từng trang rồi thích nghi, thậm chí giãn dần đối với trang ổn định (3 → 10 → 30 → 100 ngày). Google bỏ qua changefreq và priority; chỉ lastmod có thể kiểm chứng, gắn với một thay đổi đáng kể, mới được coi trọng. Bạn không thể đặt trực tiếp tần suất — bạn cải thiện các đầu vào (tầm quan trọng, thay đổi thực, lastmod chính xác, sức khỏe máy chủ) và có thể yêu cầu thu thập lại một URL cụ thể. Được thu thập nhiều hơn không cải thiện thứ hạng. Khái niệm này khác với tốc độ thu thập (tốc độ) và ngân sách thu thập (nhu cầu + năng lực).

Bản chất của tần suất thu thập dữ liệu

Tần suất thu thập dữ liệu là mức độ thường xuyên một công cụ tìm kiếm tìm nạp lại URL mà nó đã biết để kiểm tra xem URL đó có thay đổi hay không. Đây là nhịp thu thập lại, được bộ lập lịch thu thập quyết định riêng cho từng URL. Hai đầu vào lớn là mức độ quan trọng của trang và mức độ thường xuyên trang thực sự thay đổi — tài liệu của Google gọi chúng là mức độ phổ biến (popularity) và độ cũ (staleness). Bằng chứng cho nhận định này Google's crawl-demand guidance says popular URLs tend to be crawled more often and systems seek to recrawl often enough to detect changes. Phạm vi: Adaptive Google recrawling; no fixed per-page cadence is promised. Độ tin cậy: cao · Đã xác minh: Google: Large site crawl budget guide

Đây là phần trong câu chuyện thu thập dữ liệu dễ bị lẫn nhất với các khái niệm gần kề, vì vậy cần phân định thật rõ.

Tần suất thu thập, ngân sách thu thập và tốc độ thu thập

Ba khái niệm này thường bị dùng thay thế cho nhau, nhưng không nên như vậy:

Thuật ngữĐo lường điều gìDo đâu quyết định
Tần suất thu thậpMột URL đã biết được tìm nạp lại thường xuyên đến mức nào (nhịp)Bộ lập lịch — mức độ phổ biến + độ cũ
Tốc độ thu thập (năng lực)Thu thập nhanh đến mức nào / có bao nhiêu kết nối đồng thờiSức khỏe máy chủ của bạn (nhanh = nhiều hơn, lỗi = ít hơn)
Ngân sách thu thậpNhu cầu + năng lực — “tập hợp các URL mà Google có thể và muốn thu thập”Kết hợp cả hai yếu tố trên

Định nghĩa của Google gắn các khái niệm này lại với nhau: “Google defines a site’s crawl budget as the set of URLs that Google can and wants to crawl.” (bản dịch) «Google định nghĩa ngân sách thu thập dữ liệu của một trang web là tập hợp các URL mà Google có thể và muốn thu thập.» Tần suất là nhịp theo từng URL nằm bên trong ngân sách đó. Tốc độ là van điều tiết trên đường ống. Như tôi đã viết trong hướng dẫn về ngân sách thu thập: “Crawl budget is the amount of time and resources a search engine allows for crawling a website. It is made up [of] crawl demand which is how many pages a search engine wants to crawl on your site and crawl rate which is how fast they can crawl.” (bản dịch) «Ngân sách thu thập dữ liệu là lượng thời gian và tài nguyên mà một công cụ tìm kiếm dành cho việc thu thập một trang web. Ngân sách này gồm nhu cầu thu thập — số trang mà công cụ tìm kiếm muốn thu thập trên trang web — và tốc độ thu thập — tốc độ mà công cụ đó có thể thu thập.»

Thu thập để khám phá và thu thập để làm mới

Tần suất thực chất liên quan đến việc thu thập để làm mới. John Mueller đã phân tách rất rõ: “One is a discovery crawl where we try to discover new pages on your website. And the other is a refresh crawl where we update existing pages that we know about.” (bản dịch) «Một loại là lượt thu thập để khám phá, khi chúng tôi cố gắng tìm các trang mới trên trang web của bạn. Loại còn lại là lượt thu thập để làm mới, khi chúng tôi cập nhật những trang hiện có mà mình đã biết.»

Nhịp làm mới khác nhau rất nhiều tùy trang. Mueller nói thêm: “We would refresh crawl the homepage, I don’t know, once a day, or every couple of hours, or something like that.” (bản dịch) «Chúng tôi có thể thu thập lại trang chủ để làm mới, có lẽ mỗi ngày một lần, vài giờ một lần, hoặc đại loại như vậy.» Ở đầu kia của phổ tần suất: “If we recognize that individual pages change very rarely, then we realize we don’t have to crawl them all the time.” (bản dịch) «Nếu nhận thấy một số trang riêng lẻ rất hiếm khi thay đổi, chúng tôi hiểu rằng không cần phải thu thập chúng liên tục.»

Điểm mấu chốt là Google học quy luật của từng trang: “If you have a news website and you update it hourly, then we should learn that we need to crawl it hourly. Whereas if it’s a news website that updates once a month, then we should learn that we don’t need to crawl every hour.” (bản dịch) «Nếu bạn có một trang tin và cập nhật theo giờ, chúng tôi nên học được rằng cần thu thập trang đó theo giờ. Ngược lại, nếu đó là một trang tin chỉ cập nhật mỗi tháng một lần, chúng tôi nên học được rằng không cần thu thập mỗi giờ.»

Điều gì quyết định mức độ thường xuyên Google thu thập lại một trang

Trong bộ slide How Search Works, tôi liệt kê các yếu tố của nhu cầu thu thập chi phối việc thu thập lại: PageRank, mức độ thường xuyên trang thay đổi, thời gian kể từ lần thu thập gần nhất và các thay đổi lớn trên trang web. Đây cũng là mô hình mức độ phổ biến + độ cũ mà Google ghi trong tài liệu, chỉ được diễn đạt theo cách của tôi — và danh sách này cũng không hoàn toàn đầy đủ. Tài liệu của Google còn nêu số lượng URL ước tính (hệ thống cho rằng trang web của bạn có bao nhiêu URL) và các sự kiện trên toàn trang web, chẳng hạn việc di chuyển tên miền hoặc cấu trúc URL, là những yếu tố có thể làm nhu cầu thu thập tăng hoặc giảm. Mức độ phổ biến và độ cũ là hai yếu tố bạn có thể tác động trực tiếp nhất, nên đáng được chú ý nhất. Cụ thể:

Mức độ phổ biến, PageRank và liên kết

“URLs that are more popular on the Internet tend to be crawled more often to keep them fresher in our systems.” (bản dịch) «Các URL phổ biến hơn trên Internet thường được thu thập thường xuyên hơn để giữ chúng mới hơn trong hệ thống của chúng tôi.» Một trang có nhiều liên kết nội bộ và liên kết bên ngoài hơn → được cảm nhận là quan trọng hơn → được thu thập lại thường xuyên hơn. Trong bài viết về ngân sách thu thập, tôi cũng diễn đạt như vậy: “Popular pages, or those with more links and PageRank, will generally receive priority over other pages.” (bản dịch) «Các trang phổ biến, hoặc những trang có nhiều liên kết và PageRank hơn, nhìn chung sẽ được ưu tiên hơn các trang khác.»

Độ cũ — và cơ chế giãn dần

Hệ thống của Google “want to recrawl documents frequently enough to pick up any changes.” (bản dịch) «muốn thu thập lại tài liệu đủ thường xuyên để phát hiện mọi thay đổi.» Mặt ngược lại là các trang không thay đổi sẽ được thu thập ngày càng ít. Từ hướng dẫn về ngân sách thu thập của tôi: “If Google sees that a page isn’t changing, they will crawl the page less frequently.” (bản dịch) «Nếu Google thấy một trang không thay đổi, họ sẽ thu thập trang đó ít thường xuyên hơn.» Không có khoảng thời gian cố định — đây là cơ chế giãn dần: “if they crawl a page and see no changes after a day, they may wait three days before crawling again, ten days the next time, 30 days, 100 days, etc.” (bản dịch) «nếu họ thu thập một trang và sau một ngày không thấy thay đổi, họ có thể đợi ba ngày mới thu thập lại, lần sau là mười ngày, rồi 30 ngày, 100 ngày, v.v.»

Chất lượng và nhu cầu tìm kiếm

Gary Illyes mô tả bộ lập lịch như một hệ thống mà bạn phải thuyết phục: “If you want to increase how much we crawl, then you somehow have to convince search that your stuff is worth fetching, which is basically what the scheduler is listening to.” (bản dịch) «Nếu muốn tăng lượng nội dung chúng tôi thu thập, bằng cách nào đó bạn phải thuyết phục hệ thống tìm kiếm rằng nội dung của bạn đáng được tìm nạp; về cơ bản, đó là tín hiệu mà bộ lập lịch lắng nghe.» Hệ thống này vận hành linh hoạt: “Scheduling is very dynamic. As soon as we get the signals back from search indexing that the quality of the content has increased across this many URLs, we would just start turning up demand.” (bản dịch) «Việc lập lịch rất linh hoạt. Ngay khi nhận được tín hiệu từ hệ thống lập chỉ mục tìm kiếm rằng chất lượng nội dung đã tăng trên số lượng URL này, chúng tôi sẽ bắt đầu tăng nhu cầu.» Điều đó cũng có thể diễn ra theo chiều ngược lại — “If search demand goes down, then that also correlates to the crawl limit going down.” (bản dịch) «Nếu nhu cầu tìm kiếm giảm thì giới hạn thu thập cũng có xu hướng giảm theo.»

Một điều đáng biết: Google đang chủ động cố gắng thu thập các trang ổn định ít hơn để tăng hiệu quả. Illyes từng công khai nói về mong muốn “crawl even less” (bản dịch) «thu thập còn ít hơn nữa» và giảm số byte truyền trên mạng. Vì vậy, đừng kỳ vọng bộ lập lịch sẽ thiên về việc thu thập quá mức các trang không thay đổi của bạn.

Sức khỏe máy chủ (tốc độ tạo điều kiện cho tần suất)

Tần suất chỉ có thể cao đến mức tốc độ cho phép. Giới hạn năng lực thu thập gần tương ứng với số kết nối đồng thời tối đa mà Google sẽ dùng; máy chủ nhanh, không lỗi sẽ nâng trần đó, trong khi trang web chậm hoặc trả về 5xx/429 sẽ được thu thập ít hơn. Sức khỏe máy chủ không tự tăng tần suất — nó chỉ giúp máy chủ không trở thành nút thắt.

Vai trò của sitemap và lastmod

Đây là hiểu lầm lớn nhất cần loại bỏ. Nhiều người nghĩ rằng các thiết lập trong sitemap kiểm soát nhịp thu thập. Phần lớn chúng không làm được điều đó.

Google bỏ qua changefreq và priority

Tài liệu sitemap của Google nói thẳng: “Google ignores <priority> and <changefreq> values.” (bản dịch) «Google bỏ qua các giá trị priority và changefreq.» Việc đặt <changefreq>hourly</changefreq> không có tác dụng. Bằng chứng cho nhận định này Google ignores sitemap priority and changefreq values and may use accurate lastmod values. Phạm vi: Google sitemap processing. Độ tin cậy: cao · Đã xác minh: Google: Build and submit a sitemap Hãy ngừng tối ưu các trường này.

lastmod là tín hiệu duy nhất — nếu nó trung thực

Tín hiệu duy nhất về độ mới trong sitemap mà Google coi trọng là lastmod, và chỉ khi đáp ứng điều kiện: “Google uses the <lastmod> value if it’s consistently and verifiably (for example by comparing to the last modification of the page) accurate.” (bản dịch) «Google sử dụng giá trị lastmod nếu giá trị đó luôn chính xác và có thể kiểm chứng (ví dụ bằng cách so với lần sửa đổi gần nhất của trang).» Nếu bạn khai sai, Google sẽ nhận ra và ngừng tin tín hiệu này.

Giá trị đó cũng phải phản ánh một thay đổi thực: “The <lastmod> value should reflect the date and time of the last significant update to the page. For example, an update to the main content, the structured data, or links on the page is generally considered significant, however an update to the copyright date is not.” (bản dịch) «Giá trị lastmod phải phản ánh ngày và giờ của lần cập nhật đáng kể gần nhất đối với trang. Ví dụ, cập nhật nội dung chính, dữ liệu có cấu trúc hoặc liên kết trên trang thường được coi là đáng kể; còn cập nhật ngày bản quyền thì không.» Tăng lastmod chỉ vì bạn đổi năm trong chân trang sẽ không có ích — và còn làm xói mòn sự tin cậy vốn khiến lastmod có tác dụng.

Bạn có thể ép buộc hoặc tăng tốc việc thu thập không?

Câu trả lời thẳng thắn: không có núm chỉnh tần suất. Những lựa chọn thực sự của bạn gồm:

  • Cải thiện các đầu vào — tầm quan trọng (liên kết, liên kết nội bộ), thay đổi nội dung thực, lastmod chính xác và máy chủ nhanh, khỏe mạnh.
  • Gửi yêu cầu cho một URL — URL Inspection trong Google Search Console có thao tác “Request indexing” cho từng trang. Đây là yêu cầu, không phải bảo đảm, và không thay đổi nhịp thu thập lâu dài. Google cũng nói rõ rằng bấm nút liên tục không giúp ích: gửi yêu cầu nhiều lần cho cùng một URL sẽ không khiến URL đó được thu thập nhanh hơn.
  • Đẩy thông báo thay đổi (trên Bing và các công cụ khác) — xem phần dưới.
Bằng chứng cho nhận định này Requesting a recrawl repeatedly for the same URL does not make Google crawl it faster. Phạm vi: owned URLs Độ tin cậy: cao · Đã xác minh: Ask Google to recrawl your URLs

Những điều bạn không thể làm: đặt một tần suất, ép thu thập hằng ngày bằng cách xuất bản hằng ngày, hoặc dùng thanh trượt tốc độ thu thập cũ trong GSC (tính năng này đã bị ngừng). Bing có lưới Crawl Control, nhưng lưới đó kiểm soát tốc độ, không phải tần suất.

Bing: thu thập thích ứng và IndexNow

Bing xem tần suất thu thập như một bài toán chi phí. Theo bài viết của họ về tần suất thu thập, nhịp này “depends on the frequency of which the content is edited and updated,” (bản dịch) «phụ thuộc vào tần suất nội dung được chỉnh sửa và cập nhật», và “Defining when to fetch the web page next is the hard problem we are looking to optimize.” (bản dịch) «Xác định thời điểm tìm nạp trang web lần tiếp theo là bài toán khó mà chúng tôi muốn tối ưu.» Câu trả lời thích ứng của họ là: “What we learned was that we could optimize our system to avoid fetching the same content over and over, and instead check periodically for major changes” (bản dịch) «Chúng tôi nhận ra có thể tối ưu hệ thống để tránh tìm nạp đi tìm nạp lại cùng một nội dung, thay vào đó kiểm tra định kỳ các thay đổi lớn» — trong một trường hợp, cách này mang lại “about 40% crawl saving on this site!” (bản dịch) «tiết kiệm khoảng 40% lượng thu thập trên trang web này!»

Cơ chế để bạn “tác động nhẹ” của Bing là IndexNow: thay vì chờ bộ lập lịch, bạn gửi tín hiệu về thay đổi. “Whether you’re adding, updating, or deleting content, IndexNow notifies multiple search engines of your content changes as soon as they happen,” (bản dịch) «Dù bạn thêm, cập nhật hay xóa nội dung, IndexNow sẽ thông báo cho nhiều công cụ tìm kiếm về thay đổi ngay khi chúng xảy ra», qua đó “limiting the need for costly exploratory crawls.” (bản dịch) «hạn chế nhu cầu thực hiện các lượt thu thập khám phá tốn kém.» Lưu ý sự khác biệt: Google không sử dụng IndexNow cho hoạt động thu thập lại nói chung.

Cách kiểm tra tần suất thu thập của bạn

  • GSC → Crawl Stats — tổng số yêu cầu theo thời gian, được phân tách theo mã phản hồi, loại tệp và loại Googlebot. Đây là cách quan sát nhịp thu thập ở cấp trang web; không phải báo cáo lần thu thập gần nhất của từng URL.
  • GSC → URL Inspection — ngày “last crawl” của một URL cụ thể. Đây mới là nơi kiểm tra lần gần nhất một trang cụ thể được tìm nạp, chứ không phải Crawl Stats.
  • Bing Webmaster Tools — Crawl Control (tốc độ) và IndexNow Insights.
  • Phân tích nhật ký máy chủ — dữ liệu thực tế cho biết chính xác bot truy cập những URL nào và thường xuyên đến mức nào.

Những hiểu lầm phổ biến về tần suất thu thập

  • “Xuất bản hằng ngày sẽ ép Google thu thập nhanh hơn.” Không — Google học quy luật của bạn và thu thập nhiều hơn dựa trên tầm quan trọng cùng thay đổi thực sự, chứ không dựa riêng vào số lần xuất bản.
  • “changefreq/priority kiểm soát nhịp thu thập.” Không — Google bỏ qua cả hai.
  • “Chỉ cần tăng lastmod là trang sẽ được thu thập lại.” Cách này chỉ có tác dụng nếu giá trị có thể kiểm chứng và gắn với một thay đổi đáng kể; cố tình thao túng sẽ khiến Google mất niềm tin vào tín hiệu đó.
  • “Được thu thập nhiều hơn đồng nghĩa với thứ hạng tốt hơn.” Không. Như tôi đã viết trong hướng dẫn về ngân sách thu thập, “The rate of crawling isn’t going to impact your rankings.” (bản dịch) «Tốc độ thu thập sẽ không ảnh hưởng đến thứ hạng của bạn.» Thu thập dữ liệu là điều kiện cần, không phải yếu tố thúc đẩy — “More crawling doesn’t mean you’ll rank better, but if your pages aren’t crawled and indexed they aren’t going to rank at all.” (bản dịch) «Được thu thập nhiều hơn không có nghĩa là bạn sẽ xếp hạng tốt hơn, nhưng nếu các trang không được thu thập và lập chỉ mục thì chúng hoàn toàn không thể xếp hạng.»
  • “Có một lịch cố định.” Không — hệ thống vận hành linh hoạt, thích ứng và riêng cho từng URL.
  • “Tôi có thể đặt tần suất thu thập trong Search Console.” Không — thanh trượt tốc độ đã bị loại bỏ và không có chế độ kiểm soát tần suất.

Thêm ghi chú chuyên gia

Ghim trích dẫn chuyên gia

Người mới? Hãy tạo hồ sơ chưa có người xác nhận cho họ tại /admin/experts/ → Ghim trích dẫn chuyên gia trước.