Hướng dẫn về tần suất thu thập dữ liệu
Các công cụ tìm kiếm thu thập lại một trang đã biết thường xuyên đến mức nào — yếu tố nào chi phối việc này (mức độ phổ biến, độ cũ, lastmod trung thực), yếu tố nào không (changefreq, priority, xuất bản hằng ngày), và vì sao bạn không thể ép buộc.
Tần suất thu thập dữ liệu là mức độ thường xuyên một công cụ tìm kiếm tìm nạp lại trang mà nó đã biết. Yếu tố chi phối chính là tầm quan trọng của trang (mức độ phổ biến, PageRank, liên kết) và mức độ thường xuyên trang thực sự thay đổi (độ cũ); Google cũng nêu thêm các đầu vào khác của nhu cầu thu thập. Google học nhịp cập nhật của từng trang rồi điều chỉnh. Bạn chỉ có thể tác động gián tiếp thông qua tầm quan trọng, thay đổi thực, lastmod chính xác và máy chủ khỏe mạnh, chứ không thể tự đặt tần suất. Google bỏ qua changefreq và priority; sửa lastmod chỉ để làm mới ngày tháng sẽ phản tác dụng; và được thu thập thường xuyên hơn không giúp cải thiện thứ hạng.
Tóm tắt — Tần suất thu thập dữ liệu là mức độ thường xuyên một công cụ tìm kiếm quay lại kiểm tra một trang mà nó đã biết. Trang phổ biến và thay đổi nhiều được kiểm tra lại liên tục; trang không bao giờ thay đổi chỉ được kiểm tra lại rất ít — đây là hai yếu tố lớn nhất, dù không phải là tất cả. Bạn không thể tự đặt tần suất này; bạn chỉ có thể tác động bằng cách làm cho trang quan trọng hơn và thực sự cập nhật nó.
Tần suất thu thập dữ liệu là gì
Khi Google hoặc Bing tìm thấy một trang lần đầu tiên, đó là lượt thu thập để khám phá (discovery crawl). Nhưng web luôn thay đổi, nên công cụ tìm kiếm sẽ quay lại sau để xem trang có khác đi không — đó là lượt thu thập để làm mới (refresh crawl). Tần suất thu thập dữ liệu là mức độ thường xuyên việc kiểm tra lại ấy diễn ra. Bằng chứng cho nhận định này Google's crawl-demand guidance says popular URLs tend to be crawled more often and systems seek to recrawl often enough to detect changes. Phạm vi: Adaptive Google recrawling; no fixed per-page cadence is promised. Độ tin cậy: cao · Đã xác minh: Google: Large site crawl budget guide
Tần suất này không giống nhau với mọi trang. Trang chủ của một trang tin sôi động có thể được thu thập lại vài giờ một lần. Trang “Giới thiệu” của một doanh nghiệp nhỏ không thay đổi trong hai năm có thể cách nhiều tháng mới được thu thập lại. Đây chỉ là những ví dụ minh họa, không phải lịch đã được công bố — Google không công bố khoảng thời gian cố định theo giờ, ngày hay tuần cho từng loại trang. Công cụ tìm kiếm quyết định linh hoạt đối với từng trang.
Điều gì khiến một trang được thu thập thường xuyên hơn
Hai yếu tố quan trọng nhất:
- Mức độ quan trọng của trang. Các trang phổ biến — tức những trang có nhiều liên kết trỏ đến — được thu thập lại thường xuyên hơn để Google giữ phiên bản trong hệ thống luôn mới.
- Mức độ thường xuyên trang thực sự thay đổi. Công cụ tìm kiếm học quy luật của bạn. Nếu một trang được cập nhật hằng ngày, chúng sẽ bắt đầu kiểm tra hằng ngày. Nếu trang không bao giờ thay đổi, chúng sẽ giãn dần và kiểm tra ngày càng ít.
Đó là hai đòn bẩy lớn nhất, nhưng chưa phải toàn bộ danh sách. Tài liệu của Google còn nêu các yếu tố như số lượng URL mà hệ thống cho rằng trang web của bạn có (perceived inventory) và các sự kiện trên toàn trang web — chẳng hạn một đợt di chuyển trang web — là những đầu vào có thể làm nhu cầu thu thập tăng hoặc giảm.
Điều gì không khiến Google thu thập nhiều hơn
Đây là chỗ nhiều người dễ hiểu nhầm:
- Tự thân việc xuất bản hằng ngày không ép Google thu thập nhanh hơn. Google thu thập nhiều hơn khi trang của bạn quan trọng và thực sự thay đổi — không chỉ vì bạn bấm nút xuất bản nhiều lần.
- Các thẻ trong sitemap không kiểm soát tần suất này. Có hai thiết lập cũ là
changefreqvàpriority— Google hoàn toàn bỏ qua cả hai. Bằng chứng cho nhận định này Google ignores sitemap priority and changefreq values and may use accurate lastmod values. Phạm vi: Google sitemap processing. Độ tin cậy: cao · Đã xác minh: Google: Build and submit a sitemap - Được thu thập thường xuyên hơn không giúp tăng thứ hạng. Một trang phải được thu thập thì mới có cơ hội xếp hạng, nhưng việc được thu thập nhiều hơn không đẩy trang lên cao hơn.
Câu trả lời thẳng thắn cho “làm sao để trang được thu thập nhiều hơn?”
Không có nút bấm nào cho việc đó. Những điều thực sự có ích là: liên kết đến trang từ các trang quan trọng của bạn, giữ trang web nhanh và không có lỗi, đồng thời thực hiện những cập nhật thật sự có ý nghĩa (không chỉ đổi năm trong chân trang). Nếu bạn vừa thay đổi một nội dung quan trọng và muốn Google xem lại một trang cụ thể, bạn có thể gửi yêu cầu trong công cụ URL Inspection của Google Search Console.
Muốn xem phiên bản có trích dẫn của Google và Bing, thông tin chi tiết về lastmod, cùng cách phân biệt với ngân sách thu thập dữ liệu và tốc độ thu thập dữ liệu? Hãy chuyển sang thẻ Nâng cao.
Tóm tắt — Tần suất thu thập dữ liệu là nhịp thu thập lại của một URL đã biết, do bộ lập lịch quyết định chủ yếu từ hai đầu vào: tầm quan trọng (mức độ phổ biến / PageRank / liên kết) và độ cũ (trang thực sự thay đổi thường xuyên đến mức nào). Tài liệu của Google còn nêu những đầu vào nhu cầu khác như số lượng URL ước tính và các sự kiện trên toàn trang web. Google học quy luật cập nhật của từng trang rồi thích nghi, thậm chí giãn dần đối với trang ổn định (3 → 10 → 30 → 100 ngày). Google bỏ qua
changefreqvàpriority; chỉlastmodcó thể kiểm chứng, gắn với một thay đổi đáng kể, mới được coi trọng. Bạn không thể đặt trực tiếp tần suất — bạn cải thiện các đầu vào (tầm quan trọng, thay đổi thực,lastmodchính xác, sức khỏe máy chủ) và có thể yêu cầu thu thập lại một URL cụ thể. Được thu thập nhiều hơn không cải thiện thứ hạng. Khái niệm này khác với tốc độ thu thập (tốc độ) và ngân sách thu thập (nhu cầu + năng lực).
Bản chất của tần suất thu thập dữ liệu
Tần suất thu thập dữ liệu là mức độ thường xuyên một công cụ tìm kiếm tìm nạp lại URL mà nó đã biết để kiểm tra xem URL đó có thay đổi hay không. Đây là nhịp thu thập lại, được bộ lập lịch thu thập quyết định riêng cho từng URL. Hai đầu vào lớn là mức độ quan trọng của trang và mức độ thường xuyên trang thực sự thay đổi — tài liệu của Google gọi chúng là mức độ phổ biến (popularity) và độ cũ (staleness). Bằng chứng cho nhận định này Google's crawl-demand guidance says popular URLs tend to be crawled more often and systems seek to recrawl often enough to detect changes. Phạm vi: Adaptive Google recrawling; no fixed per-page cadence is promised. Độ tin cậy: cao · Đã xác minh: Google: Large site crawl budget guide
Đây là phần trong câu chuyện thu thập dữ liệu dễ bị lẫn nhất với các khái niệm gần kề, vì vậy cần phân định thật rõ.
Tần suất thu thập, ngân sách thu thập và tốc độ thu thập
Ba khái niệm này thường bị dùng thay thế cho nhau, nhưng không nên như vậy:
| Thuật ngữ | Đo lường điều gì | Do đâu quyết định |
|---|---|---|
| Tần suất thu thập | Một URL đã biết được tìm nạp lại thường xuyên đến mức nào (nhịp) | Bộ lập lịch — mức độ phổ biến + độ cũ |
| Tốc độ thu thập (năng lực) | Thu thập nhanh đến mức nào / có bao nhiêu kết nối đồng thời | Sức khỏe máy chủ của bạn (nhanh = nhiều hơn, lỗi = ít hơn) |
| Ngân sách thu thập | Nhu cầu + năng lực — “tập hợp các URL mà Google có thể và muốn thu thập” | Kết hợp cả hai yếu tố trên |
Định nghĩa của Google gắn các khái niệm này lại với nhau: “Google defines a site’s crawl budget as the set of URLs that Google can and wants to crawl.” (bản dịch) «Google định nghĩa ngân sách thu thập dữ liệu của một trang web là tập hợp các URL mà Google có thể và muốn thu thập.» Tần suất là nhịp theo từng URL nằm bên trong ngân sách đó. Tốc độ là van điều tiết trên đường ống. Như tôi đã viết trong hướng dẫn về ngân sách thu thập: “Crawl budget is the amount of time and resources a search engine allows for crawling a website. It is made up [of] crawl demand which is how many pages a search engine wants to crawl on your site and crawl rate which is how fast they can crawl.” (bản dịch) «Ngân sách thu thập dữ liệu là lượng thời gian và tài nguyên mà một công cụ tìm kiếm dành cho việc thu thập một trang web. Ngân sách này gồm nhu cầu thu thập — số trang mà công cụ tìm kiếm muốn thu thập trên trang web — và tốc độ thu thập — tốc độ mà công cụ đó có thể thu thập.»
Thu thập để khám phá và thu thập để làm mới
Tần suất thực chất liên quan đến việc thu thập để làm mới. John Mueller đã phân tách rất rõ: “One is a discovery crawl where we try to discover new pages on your website. And the other is a refresh crawl where we update existing pages that we know about.” (bản dịch) «Một loại là lượt thu thập để khám phá, khi chúng tôi cố gắng tìm các trang mới trên trang web của bạn. Loại còn lại là lượt thu thập để làm mới, khi chúng tôi cập nhật những trang hiện có mà mình đã biết.»
Nhịp làm mới khác nhau rất nhiều tùy trang. Mueller nói thêm: “We would refresh crawl the homepage, I don’t know, once a day, or every couple of hours, or something like that.” (bản dịch) «Chúng tôi có thể thu thập lại trang chủ để làm mới, có lẽ mỗi ngày một lần, vài giờ một lần, hoặc đại loại như vậy.» Ở đầu kia của phổ tần suất: “If we recognize that individual pages change very rarely, then we realize we don’t have to crawl them all the time.” (bản dịch) «Nếu nhận thấy một số trang riêng lẻ rất hiếm khi thay đổi, chúng tôi hiểu rằng không cần phải thu thập chúng liên tục.»
Điểm mấu chốt là Google học quy luật của từng trang: “If you have a news website and you update it hourly, then we should learn that we need to crawl it hourly. Whereas if it’s a news website that updates once a month, then we should learn that we don’t need to crawl every hour.” (bản dịch) «Nếu bạn có một trang tin và cập nhật theo giờ, chúng tôi nên học được rằng cần thu thập trang đó theo giờ. Ngược lại, nếu đó là một trang tin chỉ cập nhật mỗi tháng một lần, chúng tôi nên học được rằng không cần thu thập mỗi giờ.»
Điều gì quyết định mức độ thường xuyên Google thu thập lại một trang
Trong bộ slide How Search Works, tôi liệt kê các yếu tố của nhu cầu thu thập chi phối việc thu thập lại: PageRank, mức độ thường xuyên trang thay đổi, thời gian kể từ lần thu thập gần nhất và các thay đổi lớn trên trang web. Đây cũng là mô hình mức độ phổ biến + độ cũ mà Google ghi trong tài liệu, chỉ được diễn đạt theo cách của tôi — và danh sách này cũng không hoàn toàn đầy đủ. Tài liệu của Google còn nêu số lượng URL ước tính (hệ thống cho rằng trang web của bạn có bao nhiêu URL) và các sự kiện trên toàn trang web, chẳng hạn việc di chuyển tên miền hoặc cấu trúc URL, là những yếu tố có thể làm nhu cầu thu thập tăng hoặc giảm. Mức độ phổ biến và độ cũ là hai yếu tố bạn có thể tác động trực tiếp nhất, nên đáng được chú ý nhất. Cụ thể:
Mức độ phổ biến, PageRank và liên kết
“URLs that are more popular on the Internet tend to be crawled more often to keep them fresher in our systems.” (bản dịch) «Các URL phổ biến hơn trên Internet thường được thu thập thường xuyên hơn để giữ chúng mới hơn trong hệ thống của chúng tôi.» Một trang có nhiều liên kết nội bộ và liên kết bên ngoài hơn → được cảm nhận là quan trọng hơn → được thu thập lại thường xuyên hơn. Trong bài viết về ngân sách thu thập, tôi cũng diễn đạt như vậy: “Popular pages, or those with more links and PageRank, will generally receive priority over other pages.” (bản dịch) «Các trang phổ biến, hoặc những trang có nhiều liên kết và PageRank hơn, nhìn chung sẽ được ưu tiên hơn các trang khác.»
Độ cũ — và cơ chế giãn dần
Hệ thống của Google “want to recrawl documents frequently enough to pick up any changes.” (bản dịch) «muốn thu thập lại tài liệu đủ thường xuyên để phát hiện mọi thay đổi.» Mặt ngược lại là các trang không thay đổi sẽ được thu thập ngày càng ít. Từ hướng dẫn về ngân sách thu thập của tôi: “If Google sees that a page isn’t changing, they will crawl the page less frequently.” (bản dịch) «Nếu Google thấy một trang không thay đổi, họ sẽ thu thập trang đó ít thường xuyên hơn.» Không có khoảng thời gian cố định — đây là cơ chế giãn dần: “if they crawl a page and see no changes after a day, they may wait three days before crawling again, ten days the next time, 30 days, 100 days, etc.” (bản dịch) «nếu họ thu thập một trang và sau một ngày không thấy thay đổi, họ có thể đợi ba ngày mới thu thập lại, lần sau là mười ngày, rồi 30 ngày, 100 ngày, v.v.»
Chất lượng và nhu cầu tìm kiếm
Gary Illyes mô tả bộ lập lịch như một hệ thống mà bạn phải thuyết phục: “If you want to increase how much we crawl, then you somehow have to convince search that your stuff is worth fetching, which is basically what the scheduler is listening to.” (bản dịch) «Nếu muốn tăng lượng nội dung chúng tôi thu thập, bằng cách nào đó bạn phải thuyết phục hệ thống tìm kiếm rằng nội dung của bạn đáng được tìm nạp; về cơ bản, đó là tín hiệu mà bộ lập lịch lắng nghe.» Hệ thống này vận hành linh hoạt: “Scheduling is very dynamic. As soon as we get the signals back from search indexing that the quality of the content has increased across this many URLs, we would just start turning up demand.” (bản dịch) «Việc lập lịch rất linh hoạt. Ngay khi nhận được tín hiệu từ hệ thống lập chỉ mục tìm kiếm rằng chất lượng nội dung đã tăng trên số lượng URL này, chúng tôi sẽ bắt đầu tăng nhu cầu.» Điều đó cũng có thể diễn ra theo chiều ngược lại — “If search demand goes down, then that also correlates to the crawl limit going down.” (bản dịch) «Nếu nhu cầu tìm kiếm giảm thì giới hạn thu thập cũng có xu hướng giảm theo.»
Một điều đáng biết: Google đang chủ động cố gắng thu thập các trang ổn định ít hơn để tăng hiệu quả. Illyes từng công khai nói về mong muốn “crawl even less” (bản dịch) «thu thập còn ít hơn nữa» và giảm số byte truyền trên mạng. Vì vậy, đừng kỳ vọng bộ lập lịch sẽ thiên về việc thu thập quá mức các trang không thay đổi của bạn.
Sức khỏe máy chủ (tốc độ tạo điều kiện cho tần suất)
Tần suất chỉ có thể cao đến mức tốc độ cho phép. Giới hạn năng lực thu thập gần tương ứng với số kết nối đồng thời tối đa mà Google sẽ dùng; máy chủ nhanh, không lỗi sẽ nâng trần đó, trong khi trang web chậm hoặc trả về 5xx/429 sẽ được thu thập ít hơn. Sức khỏe máy chủ không tự tăng tần suất — nó chỉ giúp máy chủ không trở thành nút thắt.
Vai trò của sitemap và lastmod
Đây là hiểu lầm lớn nhất cần loại bỏ. Nhiều người nghĩ rằng các thiết lập trong sitemap kiểm soát nhịp thu thập. Phần lớn chúng không làm được điều đó.
Google bỏ qua changefreq và priority
Tài liệu sitemap của Google nói thẳng: “Google ignores <priority> and <changefreq> values.” (bản dịch) «Google bỏ qua các giá trị priority và changefreq.» Việc đặt <changefreq>hourly</changefreq> không có tác dụng.
Bằng chứng cho nhận định này
Google ignores sitemap priority and changefreq values and may use accurate lastmod values.
Phạm vi: Google sitemap processing.
Độ tin cậy: cao · Đã xác minh:
Google: Build and submit a sitemap
Hãy ngừng tối ưu các trường này.
lastmod là tín hiệu duy nhất — nếu nó trung thực
Tín hiệu duy nhất về độ mới trong sitemap mà Google coi trọng là lastmod, và chỉ khi đáp ứng điều kiện: “Google uses the <lastmod> value if it’s consistently and verifiably (for example by comparing to the last modification of the page) accurate.” (bản dịch) «Google sử dụng giá trị lastmod nếu giá trị đó luôn chính xác và có thể kiểm chứng (ví dụ bằng cách so với lần sửa đổi gần nhất của trang).» Nếu bạn khai sai, Google sẽ nhận ra và ngừng tin tín hiệu này.
Giá trị đó cũng phải phản ánh một thay đổi thực: “The <lastmod> value should reflect the date and time of the last significant update to the page. For example, an update to the main content, the structured data, or links on the page is generally considered significant, however an update to the copyright date is not.” (bản dịch) «Giá trị lastmod phải phản ánh ngày và giờ của lần cập nhật đáng kể gần nhất đối với trang. Ví dụ, cập nhật nội dung chính, dữ liệu có cấu trúc hoặc liên kết trên trang thường được coi là đáng kể; còn cập nhật ngày bản quyền thì không.» Tăng lastmod chỉ vì bạn đổi năm trong chân trang sẽ không có ích — và còn làm xói mòn sự tin cậy vốn khiến lastmod có tác dụng.
Bạn có thể ép buộc hoặc tăng tốc việc thu thập không?
Câu trả lời thẳng thắn: không có núm chỉnh tần suất. Những lựa chọn thực sự của bạn gồm:
- Cải thiện các đầu vào — tầm quan trọng (liên kết, liên kết nội bộ), thay đổi nội dung thực,
lastmodchính xác và máy chủ nhanh, khỏe mạnh. - Gửi yêu cầu cho một URL — URL Inspection trong Google Search Console có thao tác “Request indexing” cho từng trang. Đây là yêu cầu, không phải bảo đảm, và không thay đổi nhịp thu thập lâu dài. Google cũng nói rõ rằng bấm nút liên tục không giúp ích: gửi yêu cầu nhiều lần cho cùng một URL sẽ không khiến URL đó được thu thập nhanh hơn.
- Đẩy thông báo thay đổi (trên Bing và các công cụ khác) — xem phần dưới.
Những điều bạn không thể làm: đặt một tần suất, ép thu thập hằng ngày bằng cách xuất bản hằng ngày, hoặc dùng thanh trượt tốc độ thu thập cũ trong GSC (tính năng này đã bị ngừng). Bing có lưới Crawl Control, nhưng lưới đó kiểm soát tốc độ, không phải tần suất.
Bing: thu thập thích ứng và IndexNow
Bing xem tần suất thu thập như một bài toán chi phí. Theo bài viết của họ về tần suất thu thập, nhịp này “depends on the frequency of which the content is edited and updated,” (bản dịch) «phụ thuộc vào tần suất nội dung được chỉnh sửa và cập nhật», và “Defining when to fetch the web page next is the hard problem we are looking to optimize.” (bản dịch) «Xác định thời điểm tìm nạp trang web lần tiếp theo là bài toán khó mà chúng tôi muốn tối ưu.» Câu trả lời thích ứng của họ là: “What we learned was that we could optimize our system to avoid fetching the same content over and over, and instead check periodically for major changes” (bản dịch) «Chúng tôi nhận ra có thể tối ưu hệ thống để tránh tìm nạp đi tìm nạp lại cùng một nội dung, thay vào đó kiểm tra định kỳ các thay đổi lớn» — trong một trường hợp, cách này mang lại “about 40% crawl saving on this site!” (bản dịch) «tiết kiệm khoảng 40% lượng thu thập trên trang web này!»
Cơ chế để bạn “tác động nhẹ” của Bing là IndexNow: thay vì chờ bộ lập lịch, bạn gửi tín hiệu về thay đổi. “Whether you’re adding, updating, or deleting content, IndexNow notifies multiple search engines of your content changes as soon as they happen,” (bản dịch) «Dù bạn thêm, cập nhật hay xóa nội dung, IndexNow sẽ thông báo cho nhiều công cụ tìm kiếm về thay đổi ngay khi chúng xảy ra», qua đó “limiting the need for costly exploratory crawls.” (bản dịch) «hạn chế nhu cầu thực hiện các lượt thu thập khám phá tốn kém.» Lưu ý sự khác biệt: Google không sử dụng IndexNow cho hoạt động thu thập lại nói chung.
Cách kiểm tra tần suất thu thập của bạn
- GSC → Crawl Stats — tổng số yêu cầu theo thời gian, được phân tách theo mã phản hồi, loại tệp và loại Googlebot. Đây là cách quan sát nhịp thu thập ở cấp trang web; không phải báo cáo lần thu thập gần nhất của từng URL.
- GSC → URL Inspection — ngày “last crawl” của một URL cụ thể. Đây mới là nơi kiểm tra lần gần nhất một trang cụ thể được tìm nạp, chứ không phải Crawl Stats.
- Bing Webmaster Tools — Crawl Control (tốc độ) và IndexNow Insights.
- Phân tích nhật ký máy chủ — dữ liệu thực tế cho biết chính xác bot truy cập những URL nào và thường xuyên đến mức nào.
Những hiểu lầm phổ biến về tần suất thu thập
- “Xuất bản hằng ngày sẽ ép Google thu thập nhanh hơn.” Không — Google học quy luật của bạn và thu thập nhiều hơn dựa trên tầm quan trọng cùng thay đổi thực sự, chứ không dựa riêng vào số lần xuất bản.
- “
changefreq/prioritykiểm soát nhịp thu thập.” Không — Google bỏ qua cả hai. - “Chỉ cần tăng
lastmodlà trang sẽ được thu thập lại.” Cách này chỉ có tác dụng nếu giá trị có thể kiểm chứng và gắn với một thay đổi đáng kể; cố tình thao túng sẽ khiến Google mất niềm tin vào tín hiệu đó. - “Được thu thập nhiều hơn đồng nghĩa với thứ hạng tốt hơn.” Không. Như tôi đã viết trong hướng dẫn về ngân sách thu thập, “The rate of crawling isn’t going to impact your rankings.” (bản dịch) «Tốc độ thu thập sẽ không ảnh hưởng đến thứ hạng của bạn.» Thu thập dữ liệu là điều kiện cần, không phải yếu tố thúc đẩy — “More crawling doesn’t mean you’ll rank better, but if your pages aren’t crawled and indexed they aren’t going to rank at all.” (bản dịch) «Được thu thập nhiều hơn không có nghĩa là bạn sẽ xếp hạng tốt hơn, nhưng nếu các trang không được thu thập và lập chỉ mục thì chúng hoàn toàn không thể xếp hạng.»
- “Có một lịch cố định.” Không — hệ thống vận hành linh hoạt, thích ứng và riêng cho từng URL.
- “Tôi có thể đặt tần suất thu thập trong Search Console.” Không — thanh trượt tốc độ đã bị loại bỏ và không có chế độ kiểm soát tần suất.
Tóm tắt bằng AI
Bản rút gọn của phần Nâng cao:
- Tần suất thu thập = nhịp thu thập lại của một URL mà Google đã biết. Yếu tố chi phối chính là mức độ phổ biến (liên kết / PageRank) và độ cũ (trang thực sự thay đổi thường xuyên đến mức nào); tài liệu Google còn nêu số lượng URL ước tính và các sự kiện trên toàn trang web là đầu vào của nhu cầu thu thập.
- Google học quy luật của từng trang rồi thích nghi — theo giờ với trang chủ sôi động, rất thưa với trang tĩnh, và giãn dần (3 → 10 → 30 → 100 ngày) đối với các trang không thay đổi.
- Khác với các khái niệm gần kề: tốc độ = nhanh đến mức nào (bị giới hạn bởi máy chủ), ngân sách = nhu cầu + năng lực (“các URL mà Google có thể và muốn thu thập”). Tần suất nằm trong ngân sách.
- Thực tế về sitemap: Google bỏ qua
changefreqvàpriority; chỉlastmodcó thể kiểm chứng, gắn với một thay đổi đáng kể, mới được coi trọng. - Bạn không thể đặt tần suất. Hãy cải thiện các đầu vào (tầm quan trọng, thay đổi thực,
lastmodtrung thực, sức khỏe máy chủ); yêu cầu một URL cụ thể qua URL Inspection của GSC; và đẩy thông báo thay đổi bằng IndexNow trên Bing (không phải Google). - Được thu thập nhiều hơn ≠ thứ hạng tốt hơn. Thu thập dữ liệu là điều kiện cần để xếp hạng, không phải tín hiệu xếp hạng.
- Quan sát tần suất trong GSC Crawl Stats (yêu cầu ở cấp trang web theo thời gian — không phải nhật ký theo từng URL), ngày thu thập gần nhất trong URL Inspection (kiểm tra theo URL), Bing Webmaster Tools hoặc nhật ký máy chủ.
Tài liệu chính thức
Tài liệu nguồn sơ cấp về nhịp thu thập lại.
- Tối ưu ngân sách thu thập dữ liệu — nhu cầu thu thập (số lượng URL ước tính, mức độ phổ biến, độ cũ) và năng lực thu thập; đây là mô hình nền tảng của tần suất thu thập lại.
- Tạo và gửi sitemap — lý do
changefreq/prioritybị bỏ qua và cáchlastmodthực sự được sử dụng. - Hướng dẫn chuyên sâu về cách Google Search hoạt động — bộ lập lịch thu thập theo thuật toán (“thu thập trang web nào, thường xuyên đến mức nào và bao nhiêu trang”).
Bing / Microsoft
- Loạt bài bingbot: Tối ưu tần suất thu thập — cách Bing xem tần suất như một bài toán lập lịch dựa trên thay đổi nội dung.
- Bing Webmaster Tools — Crawl Control — đặt tốc độ theo giờ của Bingbot (tốc độ, không phải tần suất).
- IndexNow — giao thức đẩy để báo hiệu URL đã thay đổi thay vì chờ lượt thu thập lại.
Trích dẫn từ nguồn
Các phát biểu công khai của Google và Bing. Mỗi liên kết sâu sẽ chuyển thẳng đến đoạn được trích trên trang nguồn.
Google — yếu tố chi phối nhịp thu thập lại
- “URLs that are more popular on the Internet tend to be crawled more often to keep them fresher in our systems.” (bản dịch) «Các URL phổ biến hơn trên Internet thường được thu thập thường xuyên hơn để giữ chúng mới hơn trong hệ thống của chúng tôi.» — Tài liệu Google Search Central. Đi đến trích dẫn
- “Our systems want to recrawl documents frequently enough to pick up any changes.” (bản dịch) «Hệ thống của chúng tôi muốn thu thập lại tài liệu đủ thường xuyên để phát hiện mọi thay đổi.» Đi đến trích dẫn
- “Google defines a site’s crawl budget as the set of URLs that Google can and wants to crawl.” (bản dịch) «Google định nghĩa ngân sách thu thập dữ liệu của một trang web là tập hợp các URL mà Google có thể và muốn thu thập.» Đi đến trích dẫn
Google — sitemap, changefreq, lastmod
- “Google ignores
<priority>and<changefreq>values.” (bản dịch) «Google bỏ qua các giá trị priority và changefreq.» Đi đến trích dẫn - “Google uses the
<lastmod>value if it’s consistently and verifiably (for example by comparing to the last modification of the page) accurate.” (bản dịch) «Google sử dụng giá trị lastmod nếu giá trị đó luôn chính xác và có thể kiểm chứng (ví dụ bằng cách so với lần sửa đổi gần nhất của trang).» Đi đến trích dẫn - “The
<lastmod>value should reflect the date and time of the last significant update to the page. For example, an update to the main content, the structured data, or links on the page is generally considered significant, however an update to the copyright date is not.” (bản dịch) «Giá trị lastmod nên thể hiện thời điểm trang được cập nhật đáng kể gần nhất. Chẳng hạn, việc sửa nội dung chính, dữ liệu có cấu trúc hoặc các liên kết trên trang thường được xem là đáng kể; việc chỉ đổi ngày bản quyền thì không.» Đi đến trích dẫn
John Mueller, Google (giờ tư vấn SEO, tháng 1/2022)
- “One is a discovery crawl where we try to discover new pages on your website. And the other is a refresh crawl where we update existing pages that we know about.” (bản dịch) «Một bên là hoạt động thu thập khám phá nhằm tìm các trang mới trên trang web của bạn. Bên kia là hoạt động thu thập làm mới nhằm cập nhật những trang hiện có mà chúng tôi đã biết.» Đi đến trích dẫn
- “We would refresh crawl the homepage, I don’t know, once a day, or every couple of hours, or something like that.” (bản dịch) «Chúng tôi có thể thu thập lại trang chủ để làm mới, có lẽ mỗi ngày một lần, vài giờ một lần, hoặc đại loại như vậy.» Đi đến trích dẫn
- “If you have a news website and you update it hourly, then we should learn that we need to crawl it hourly. Whereas if it’s a news website that updates once a month, then we should learn that we don’t need to crawl every hour.” (bản dịch) «Nếu trang tin của bạn được cập nhật mỗi giờ, hệ thống nên học rằng nó cần được thu thập theo giờ. Nếu trang tin chỉ cập nhật mỗi tháng, hệ thống nên hiểu rằng không cần quay lại hằng giờ.» Đi đến trích dẫn
Gary Illyes, Google (mức độ ưu tiên thu thập)
- “If you want to increase how much we crawl, then you somehow have to convince search that your stuff is worth fetching, which is basically what the scheduler is listening to.” (bản dịch) «Nếu muốn tăng lượng nội dung chúng tôi thu thập, bằng cách nào đó bạn phải thuyết phục hệ thống tìm kiếm rằng nội dung của bạn đáng được tìm nạp; về cơ bản, đó là tín hiệu mà bộ lập lịch lắng nghe.» Đi đến trích dẫn
- “Scheduling is very dynamic. As soon as we get the signals back from search indexing that the quality of the content has increased across this many URLs, we would just start turning up demand.” (bản dịch) «Lịch thu thập thay đổi rất linh hoạt. Khi hệ thống lập chỉ mục tìm kiếm gửi tín hiệu rằng chất lượng nội dung đã tăng trên một nhóm URL, chúng tôi sẽ nâng nhu cầu thu thập.» Đi đến trích dẫn
Microsoft Bing — Tối ưu tần suất thu thập
- “The answer depends on the frequency of which the content is edited and updated.” (bản dịch) «Câu trả lời phụ thuộc vào tần suất nội dung được chỉnh sửa và cập nhật.» Đi đến trích dẫn
- “Defining when to fetch the web page next is the hard problem we are looking to optimize with your help.” (bản dịch) «Xác định thời điểm tìm nạp trang web lần tiếp theo là bài toán khó mà chúng tôi muốn tối ưu với sự trợ giúp của bạn.» Đi đến trích dẫn
- “Whether you’re adding, updating, or deleting content, IndexNow notifies multiple search engines of your content changes as soon as they happen.” (bản dịch) «Dù bạn thêm, cập nhật hay xóa nội dung, IndexNow sẽ thông báo cho nhiều công cụ tìm kiếm về thay đổi ngay khi chúng xảy ra.» — IndexNow. Đi đến trích dẫn
Các mô hình tư duy
1. Tần suất = mức độ phổ biến × độ cũ. Hai đầu vào chi phối mức độ thường xuyên một URL đã biết được làm mới: tầm quan trọng của URL đó (mức độ phổ biến / PageRank / liên kết) và mức độ thường xuyên nó thực sự thay đổi (độ cũ). Trang vừa quan trọng vừa thay đổi thường xuyên sẽ được thu thập nhiều nhất; trang không có cả hai đặc điểm sẽ được thu thập ít nhất. Mọi yếu tố khác đều là đòn bẩy tác động xuống hai đầu vào này.
2. Thu thập để khám phá và thu thập để làm mới. Lượt thu thập để khám phá tìm thấy một URL mới. Lượt thu thập để làm mới kiểm tra lại một URL đã biết — và tần suất hoàn toàn nói về việc làm mới. Nếu một trang không được thu thập lại, hãy hỏi liệu nguyên nhân là trang chưa đủ quan trọng hay “Google cho rằng ở đây không có gì thay đổi”; mỗi nguyên nhân cần một cách xử lý khác nhau.
3. Tần suất ≠ tốc độ ≠ ngân sách. Tần suất là nhịp (thường xuyên đến mức nào). Tốc độ là vận tốc (nhanh đến mức nào, chịu giới hạn của máy chủ). Ngân sách là nhu cầu + năng lực (tập hợp URL mà Google có thể và muốn thu thập). Tần suất nằm trong ngân sách; tốc độ giới hạn mức tần suất khả thi.
4. Bộ lập lịch học quy luật của bạn. Google thích nghi theo nhịp cập nhật thực của từng trang và giãn dần đối với trang ổn định (3 → 10 → 30 → 100 ngày). Bạn không thể thắng bộ lập lịch bằng cách xuất bản nhiều hơn — bạn thay đổi điều nó học được bằng cách làm cho trang thực sự quan trọng và thực sự thay đổi.
5. Tín hiệu sitemap trung thực duy nhất.
changefreq và priority không có tác dụng. lastmod có thể kiểm chứng, gắn với một thay đổi đáng kể, là tín hiệu duy nhất về độ mới được coi trọng — và chỉ khi bạn không khai sai.
Những việc thực sự làm tăng tần suất thu thập lại
Danh sách các đòn bẩy làm thay đổi nhịp — và các cạm bẫy không có tác dụng:
- Làm cho trang quan trọng hơn. Thêm liên kết nội bộ từ các trang mạnh; thu hút liên kết bên ngoài. Mức độ phổ biến là đòn bẩy lớn nhất đối với tần suất.
- Thực hiện thay đổi thực. Cập nhật nội dung chính, dữ liệu có cấu trúc hoặc liên kết — không phải chỉnh sửa bề ngoài. Google học xem một trang có thực sự thay đổi hay không.
- Giữ
lastmodchính xác và có thể kiểm chứng. Giá trị này phải phản ánh lần cập nhật đáng kể gần nhất; đổi năm bản quyền không được tính và còn làm xói mòn độ tin cậy. - Đừng mất công với
changefreq/priority— Google bỏ qua cả hai. - Giữ máy chủ nhanh và không có lỗi.
5xx/429/timeout làm giảm năng lực thu thập, từ đó giới hạn tần suất. - Gửi yêu cầu cho một URL khi thực sự cần — GSC URL Inspection → Request indexing cho một trang sau khi có cập nhật đáng kể.
- Trên Bing/Yandex, dùng IndexNow để đẩy thông báo thay đổi thay vì chờ bộ lập lịch (Google không sử dụng giao thức này).
- Đừng kỳ vọng chỉ tăng số lượng bài xuất bản sẽ có ích — tần suất đi theo tầm quan trọng và thay đổi thực, không đi theo số lần bạn bấm xuất bản.
- Kiểm tra Crawl Stats về ngày thu thập gần nhất và phân tách lượt khám phá với lượt làm mới trước khi cho rằng có vấn đề về tần suất.
Công cụ để quan sát tần suất thu thập
- Google Search Console — báo cáo Crawl Stats — số yêu cầu theo thời gian, phân tách theo mã phản hồi, loại tệp và loại Googlebot. Đây là góc nhìn cấp trang web rõ nhất về mức độ thường xuyên Google quay lại nói chung — không phải nhật ký theo từng URL.
- URL Inspection (GSC) — ngày “last crawl” của từng URL, cùng thao tác Request indexing khi bạn đã thực hiện một thay đổi đáng kể. Gửi yêu cầu nhiều lần cho cùng một URL không làm quá trình nhanh hơn.
- Bing Webmaster Tools — Crawl Control (đặt tốc độ theo giờ của Bingbot) và IndexNow Insights cho cơ chế đẩy.
- Phân tích tệp nhật ký máy chủ — dữ liệu thực tế cho biết chính xác bot truy cập URL nào và thường xuyên đến mức nào. Công cụ: Screaming Frog Log File Analyser, hoặc đưa nhật ký vào BigQuery / một nền tảng nhật ký. (Xem phân tích tệp nhật ký.)
- Ahrefs Site Audit / Webmaster Tools — mô phỏng một lượt thu thập và làm rõ các tín hiệu về tầm quan trọng (liên kết nội bộ, độ sâu) có ảnh hưởng đến tần suất.
Những sai lầm về tần suất thu thập
- Đổi
lastmodtrong sitemap mà không thay đổi trang. Ngày tháng sai khiến tín hiệu kém hữu ích hơn. Chỉ cập nhậtlastmodkhi nội dung có thay đổi đáng kể. - Dựa vào
changefreqhoặcpriority. Google bỏ qua các gợi ý này trong sitemap. Thay vào đó, hãy dùng tín hiệu khám phá mạnh, tầm quan trọng và thông tin sửa đổi trung thực. - Liên tục yêu cầu lập chỉ mục cho một trang không đổi. Thêm một lượt tìm nạp không tạo ra giá trị và không ép Google lập chỉ mục. Trước hết, hãy cải thiện trang hoặc các tín hiệu của trang.
- Coi việc được thu thập thường xuyên là một chiến thắng về thứ hạng. Tần suất thu thập mô tả hoạt động tìm nạp, không phải chất lượng hay vị trí. Hãy đo xem các thay đổi quan trọng có được phát hiện đúng lúc hay không.
- Ép thực hiện chỉnh sửa bề ngoài theo lịch. Công cụ tìm kiếm học quy luật thay đổi thực. Hãy cập nhật nội dung hữu ích thay vì chỉ đổi ngày tháng hoặc khoảng trắng.
Bảng tra nhanh về tín hiệu tần suất thu thập
| Tín hiệu hoặc hành động | Vai trò có thể có |
|---|---|
| Liên kết nội bộ/bên ngoài mạnh | Truyền đạt tầm quan trọng và hỗ trợ thu thập lại thường xuyên hơn |
| Thay đổi nội dung đáng kể | Cho crawler lý do để quay lại |
lastmod chính xác trong sitemap | Giúp truyền đạt thời điểm URL có thay đổi đáng kể |
| Phản hồi nhanh, khỏe mạnh | Cho phép thu thập nhưng tự thân không tạo ra nhu cầu |
changefreq / priority trong sitemap | Bị Google bỏ qua |
| Gửi nhiều yêu cầu URL Inspection | Yêu cầu theo trường hợp, không phải cơ chế kiểm soát tần suất bền vững |
| IndexNow | Thông báo thay đổi cho các công cụ tham gia, không bảo đảm thu thập hoặc lập chỉ mục |
Chỉ số đo tần suất thu thập
Khoảng thời gian thu thập lại trung vị theo mẫu trang
Chỉ số: thời gian trung vị giữa các lượt tìm nạp đã xác minh của crawler đối với cùng một URL. Cho bạn biết điều gì: nhịp quay lại mà hệ thống đã học. Cách lấy dữ liệu: sắp xếp yêu cầu trong access log theo URL đã chuẩn hóa và dấu thời gian, sau đó phân đoạn theo mẫu trang. Mốc so sánh / phạm vi thực tế: so với nhịp thay đổi thực của từng mẫu; không có một mục tiêu toàn trang web phù hợp cho cả trang tin và trang thường xanh. Chu kỳ: hằng tháng.
Độ trễ từ thay đổi đến lần thu thập lại
Chỉ số: thời gian từ một lần xuất bản/cập nhật đáng kể đến lượt tìm nạp tiếp theo. Cho bạn biết điều gì: các thay đổi quan trọng có được phát hiện kịp thời hay không. Cách lấy dữ liệu: nối dấu thời gian trong CMS hoặc hệ thống triển khai với access log. Mốc so sánh / phạm vi thực tế: thiết lập đường cơ sở cho từng mẫu và điều tra các trường hợp suy giảm. Chu kỳ: hằng tháng và sau khi thay đổi sitemap/liên kết nội bộ.
Tỷ lệ lastmod trung thực
Chỉ số: tỷ lệ thay đổi lastmod trong sitemap tương ứng với thay đổi đáng kể trên trang. Cho bạn biết điều gì: tín hiệu về độ mới còn đáng tin cậy hay không. Cách lấy dữ liệu: so sánh lịch sử sitemap với hàm băm nội dung hoặc hồ sơ phát hành. Mốc so sánh / phạm vi thực tế: mọi ngày bị thay đổi đều phải giải thích được bằng một cập nhật đáng kể. Chu kỳ: mỗi lần phát hành sitemap hoặc lấy mẫu hằng tuần.
Tự kiểm tra: Tần suất thu thập dữ liệu
Tài nguyên đáng đọc
Bài viết liên quan của tôi
- Khi nào bạn nên lo về ngân sách thu thập dữ liệu? — bài bổ trợ gần nhất: nhu cầu, tốc độ, cơ chế giãn dần do độ cũ và lý do tần suất không phải là yếu tố xếp hạng.
- Googlebot là gì và hoạt động ra sao? — cơ chế crawler phía sau bộ lập lịch.
- Crawl Me Maybe? Crawler trang web hoạt động như thế nào — kiến thức nhập môn chung về crawler.
- Hướng dẫn SEO kỹ thuật cho người mới bắt đầu — vị trí của hoạt động thu thập dữ liệu trong bức tranh lớn hơn.
Bài thuyết trình của tôi
- How Search Works (SlideShare) — phần trình bày của tôi về các yếu tố của nhu cầu thu thập (PageRank, tần suất thay đổi, thời gian kể từ lần thu thập gần nhất, thay đổi lớn trên trang web). (Tuyên bố miễn trừ thường trực của tôi vẫn áp dụng: “This is my understanding of systems… not going to be 100% complete or accurate.” (bản dịch) «Đây là cách tôi hiểu các hệ thống… sẽ không đầy đủ hoặc chính xác 100%.»)
Nguồn khác
- Loạt bài Crawling December của Google — bộ tài liệu giải thích chính thức về thu thập dữ liệu tập trung và hữu ích nhất.
- Google có hai loại thu thập dữ liệu — Khám phá và Làm mới (Search Engine Journal) — trích dẫn nguyên văn của John Mueller về lượt thu thập để khám phá so với làm mới và cách Google học quy luật cập nhật của từng trang.
- Ưu tiên thu thập của Google: Góc nhìn từ nhà phân tích Gary Illyes (Search Engine Journal) — Gary Illyes nói về bộ lập lịch linh hoạt, tín hiệu chất lượng chi phối nhu cầu thu thập và cách thuyết phục Google rằng nội dung đáng được tìm nạp.
- Google cân nhắc giảm tốc độ thu thập trang web (Search Engine Journal) — bài viết về mục tiêu Google đã nêu là thu thập các trang ổn định ít hơn, củng cố mô hình giãn dần.
- Loạt bài bingbot: Tối đa hóa hiệu quả thu thập (Bing Webmaster Blog) — bài bổ trợ của Bing về hiệu quả thu thập; đi cùng bài Optimizing Crawl Frequency trong thẻ Tài liệu chính thức.
- r/TechSEO — cộng đồng thảo luận việc gỡ lỗi thu thập/lập chỉ mục.
Nhật ký thay đổi
Đã cập nhật 7 thg 9, 2026.
Tóm tắt biên tập và chi tiết thay đổi đã ghi nhận.Tóm tắt
Khôi phục toàn bộ phần văn xuôi tiếng Việt từ nguồn đã khóa bằng tuyến Sol mức high, loại bỏ phần tiếng Anh và cấu trúc lai còn sót trong bài, TM và sidecar thành phần mà không thay đổi ranh giới bằng chứng.
Chi tiết thay đổi
-
Viết lại toàn bộ phần văn xuôi bằng tiếng Việt tự nhiên; giữ nguyên cấu trúc MDX/Lens, URL, token kỹ thuật, trích dẫn tiếng Anh có chú thích bản dịch, ID bằng chứng và trạng thái kiểm dịch chờ người bản ngữ duyệt.
Không thể so sánh đầy đủ — không có bản lưu trước đó cho lần sửa đổi này.
Đã cập nhật 8 thg 8, 2026.
Tóm tắt biên tập và chi tiết thay đổi đã ghi nhận.Tóm tắt
Tái tạo bản dịch tiếng Việt từ nguồn đã khóa bằng tuyến Luna để sửa phần tiếng Anh còn sót và giữ nguyên cấu trúc, mã, URL, trích dẫn và ranh giới bằng chứng.
Chi tiết thay đổi
-
Đã bản địa hóa lại các trường văn bản và hoàn tất sidecar thành phần trong khi bảo toàn token giao thức; bản thảo vẫn chờ người bản ngữ duyệt và chưa được phép xuất bản.
Không thể so sánh đầy đủ — không có bản lưu trước đó cho lần sửa đổi này.
Đã cập nhật 17 thg 7, 2026.
Tóm tắt biên tập và chi tiết thay đổi đã ghi nhận.Tóm tắt
Đối chiếu bài viết với đợt hiệu chỉnh nghiên cứu ngày 2026-07-16: diễn đạt các khoảng thời gian minh họa theo loại trang như ví dụ thay vì lịch cố định; lưu ý rằng các yếu tố về nhu cầu thu thập dữ liệu của Google không chỉ gồm mức độ phổ biến và độ cũ; sửa phần mô tả Crawl Stats để loại bỏ nhận định chưa được xác minh về phân tách lượt khám phá và lượt làm mới; đồng thời bổ sung cảnh báo rõ ràng của Google rằng gửi yêu cầu thu thập lại nhiều lần không giúp tăng tốc.
Chi tiết thay đổi
-
Bổ sung rằng mô hình nhu cầu thu thập dữ liệu của Google còn nêu số lượng URL ước tính và các sự kiện trên toàn trang web, không chỉ mức độ phổ biến và độ cũ (phần Cơ bản và Nâng cao).
-
Diễn đạt lại ví dụ về nhịp thu thập trang chủ và trang Giới thiệu như các minh họa, không phải lịch do Google công bố.
-
Sửa phần mô tả Crawl Stats (phần Nâng cao và Công cụ) để nêu các phân tích theo mã phản hồi, loại tệp và loại Googlebot thay vì khẳng định chưa được xác minh về mục đích khám phá so với làm mới; làm rõ URL Inspection là nơi kiểm tra lần thu thập gần nhất của từng URL.
-
Bổ sung tuyên bố rõ ràng của Google rằng gửi nhiều yêu cầu URL Inspection cho cùng một URL không làm quá trình thu thập nhanh hơn.
Không thể so sánh đầy đủ — không có bản lưu trước đó cho lần sửa đổi này.