Tốc độ thu thập dữ liệu

Tốc độ công cụ tìm kiếm tải các trang — khái niệm tốc độ thu thập dữ liệu, lý do Google bỏ thanh trượt trong Search Console, cách giảm tốc độ Googlebot an toàn, vì sao không thể ép tăng tốc độ và sự khác biệt của Crawl Control trên Bing.

Xuất bản lần đầu: 22 thg 6, 2026 · Cập nhật lần cuối: 24 thg 8, 2026 · Nâng cao

Tốc độ thu thập dữ liệu là tốc độ crawler tải trang từ máy chủ — phía cung của crawl budget. Google tự động điều chỉnh theo tình trạng máy chủ; thanh trượt thủ công trong Search Console đã bị xóa ngày 8 tháng 1 năm 2024. Để tạm thời làm Googlebot chậm lại, hãy trả mã 500/503/429 trong tối đa một hoặc hai ngày, không dùng 403/404; Google bỏ qua crawl-delay. Bạn không thể yêu cầu tăng tốc độ lâu dài mà chỉ có thể cải thiện gián tiếp bằng máy chủ nhanh, sitemap sạch và ít URL lãng phí. Bing vẫn có lưới Crawl Control thủ công. Tốc độ thu thập không phải yếu tố xếp hạng và hầu hết website không cần quản lý nó.

TL;DR — Tốc độ thu thập dữ liệu là phía cung của crawl budget — tốc độ crawler tải trang, do “giới hạn năng lực thu thập dữ liệu” của Google quyết định (số kết nối đồng thời + độ trễ giữa các lần tải). Cơ chế này tự động phản ứng với tình trạng máy chủ; thanh trượt thủ công trong GSC đã bị xóa ngày 8 tháng 1 năm 2024. Muốn làm Googlebot chậm lại, hãy phát tín hiệu qua HTTP: 500/503/429 trong tối đa 1–2 ngày, không bao giờ dùng 401/403/404; Google bỏ qua crawl-delay (Bing tuân thủ). Bạn không thể yêu cầu tăng tốc độ mà chỉ có thể cải thiện gián tiếp. Bing vẫn có lưới Crawl Control thủ công. Tốc độ thu thập dữ liệu không phải yếu tố xếp hạng và hầu hết website không cần can thiệp.

Tốc độ thu thập dữ liệu thực sự là gì

Tốc độ thu thập dữ liệu là tốc độ crawler tải trang từ máy chủ — số yêu cầu đồng thời và độ trễ giữa chúng. Google gọi đó là giới hạn năng lực thu thập dữ liệu: “the maximum number of simultaneous parallel connections that Google can use to crawl a site, as well as the time delay between fetches.” (bản dịch) “số kết nối đồng thời tối đa mà Google có thể dùng để thu thập dữ liệu một website, cũng như độ trễ giữa các lần tải”. Bằng chứng cho nhận định này Google defines crawl capacity using simultaneous connections and the delay between fetches, adjusted according to site responses. Phạm vi: Google crawler capacity, not a ranking factor. Độ tin cậy: cao · Đã xác minh: Google: Large site crawl budget guide

Đây là một nửa của crawl budget. Như tôi viết trong hướng dẫn crawl budget của Ahrefs, crawl budget gồm “crawl demand which is how many pages a search engine wants to crawl on your site and crawl rate which is how fast they can crawl.” (bản dịch) “nhu cầu thu thập dữ liệu là số trang mà công cụ tìm kiếm muốn thu thập trên website, còn tốc độ thu thập dữ liệu là tốc độ nó có thể thực hiện”. Tốc độ là phía cung (bạn cho phép chúng nhanh đến đâu); nhu cầu là phía cầu (chúng muốn bao nhiêu). Crawl budget là nơi hai phía gặp nhau — còn thứ hạng hoàn toàn nằm ngoài vòng lặp đó.

Trong bộ slide Cách công cụ tìm kiếm hoạt động, tôi mô tả giới hạn tốc độ thu thập đơn giản là mức website của bạn có thể chịu được. Nó phụ thuộc vào độ ổn định và tình trạng thu thập của máy chủ, phản hồi chậm, lỗi 5xx (máy chủ) và phản hồi 429 (quá nhiều yêu cầu). Google lùi lại khi máy chủ gặp khó khăn vì không muốn làm sập website. Một chi tiết dễ bị bỏ qua: tất cả Googlebot dùng chung một nguồn lực thu thập — bot tìm kiếm, hình ảnh, quảng cáo và các bot khác đều dùng chung tốc độ. Vì vậy, một loại tài nguyên bị thu thập mất kiểm soát sẽ chiếm phần dành cho mọi thứ khác.

Tốc độ crawl là đó capacity gate. Điều này có thể constrain demand, nhưng increasing capacity không manufacture demand hoặc thứ hạng. Nguồn: Google Search Central

Crawl demand orders URLs dùng popularity, genuine thay đổi, và hữu ích inventory. Crawl capacity là shaped by máy chủ phản hồi speed, stability, và các lỗi. Đó capacity gate determines cách far Googlebot proceeds qua đó ordered queue. MỘT nhanh hơn, healthier máy chủ có thể raise đó ceiling, nhưng điều này không tạo crawl demand và không phải một tín hiệu xếp hạng.

© Patrick Stox LLC · CC BY 4.0 ·

Điều gì quyết định tốc độ thu thập dữ liệu

Giới hạn năng lực là tự động và phản ứng với máy chủ theo thời gian thực. Google: “If the site responds quickly for a while, the limit goes up, meaning more connections can be used to crawl. If the site slows down or responds with server errors, the limit goes down and Google crawls less.” (bản dịch) “Nếu website phản hồi nhanh trong một thời gian, giới hạn sẽ tăng, nghĩa là có thể dùng nhiều kết nối hơn để thu thập dữ liệu. Nếu website chậm lại hoặc trả về lỗi máy chủ, giới hạn sẽ giảm và Google thu thập ít hơn”.

Còn một yếu tố thứ hai bạn không kiểm soát được: tài nguyên của chính Google. “Google has a lot of machines, but not infinite machines. We still need to make choices with the resources that we have.” (bản dịch) “Google có rất nhiều máy, nhưng không phải vô hạn. Chúng tôi vẫn phải lựa chọn cách dùng những tài nguyên hiện có”. Vì vậy, tình trạng máy chủ đặt ra mức trần Google sẵn sàng sử dụng, nhưng năng lực của Google và nhu cầu thu thập dữ liệu của website quyết định bao nhiêu phần của mức trần đó thực sự được dùng.

Tài liệu về các quan niệm sai lầm xác nhận mối liên hệ với tình trạng máy chủ tác động theo cả hai hướng: “A speedy site is a sign of healthy servers, so it can get more content over the same number of connections,” (bản dịch) “Website nhanh là dấu hiệu máy chủ khỏe, nên có thể nhận thêm nội dung qua cùng số kết nối”, trong khi “a significant number of 5xx HTTP response status codes (server errors) or connection timeouts signal the opposite, and crawling slows down.” (bản dịch) “nhiều mã trạng thái phản hồi HTTP 5xx (lỗi máy chủ) hoặc hết thời gian kết nối báo hiệu điều ngược lại, và việc thu thập dữ liệu sẽ chậm xuống”.

Tốc độ thu thập dữ liệu có ảnh hưởng thứ hạng không? Không.

Hãy bác bỏ điều này trước vì nó gây ra nhiều nỗ lực sai hướng. Thu thập dữ liệu là điều kiện để xuất hiện trong tìm kiếm, nhưng không phải tín hiệu xếp hạng. Google nói rõ: “Improving your crawl rate won’t necessarily lead to better positions in Google Search results.” (bản dịch) “Cải thiện tốc độ thu thập dữ liệu không nhất thiết giúp đạt vị trí tốt hơn trong kết quả Google Tìm kiếm”. Thu thập nhanh hoặc nhiều hơn giúp nội dung được phát hiện và lập chỉ mục mới hơn, chứ không tạo vị trí cao hơn. Đây là vấn đề hiệu quả và tình trạng máy chủ — chỉ vậy.

Bằng chứng cho nhận định này Improving crawl rate does not itself improve ranking positions; crawling is necessary for eligibility but is not a ranking signal. Phạm vi: websites Độ tin cậy: cao · Đã xác minh: Myths and facts about crawling

Cách giảm tốc độ thu thập của Googlebot

Theo thứ tự, từ giải pháp thực sự đến biện pháp khẩn cấp:

1. Khắc phục máy chủ (giải pháp thực sự). Tăng tốc hoặc bổ sung tài nguyên. Vì giới hạn năng lực theo dõi thời gian phản hồi và lỗi, máy chủ khỏe hơn là cách bền vững để giữ việc thu thập dữ liệu ở mức phù hợp — đồng thời không gây rủi ro cho việc lập chỉ mục.

2. Biện pháp khẩn cấp — 500/503/429. Google: “return 500, 503, or 429 HTTP response status code instead of 200 to the crawl requests.” (bản dịch) “trả về mã trạng thái phản hồi HTTP 500, 503 hoặc 429 thay cho 200 đối với yêu cầu thu thập dữ liệu”. Crawler của Google “treat the 429 status code as a signal that the server is overloaded,” (bản dịch) “coi mã trạng thái 429 là tín hiệu máy chủ đang quá tải”, và 5xx and 429 server errors prompt Google’s crawlers to temporarily slow down with crawling.” (bản dịch) “lỗi máy chủ 5xx429 khiến crawler của Google tạm thời giảm tốc độ thu thập”. Gary Illyes nói cụ thể: “if the server persistently returns HTTP 500 status codes for a range of URLs, Googlebot will automatically, and almost immediately slow down crawling.” (bản dịch) “nếu máy chủ liên tục trả mã HTTP 500 cho một nhóm URL, Googlebot sẽ tự động và gần như ngay lập tức giảm tốc độ thu thập”. Nên ưu tiên 429 khi có thể — nó nói rõ “quá nhiều yêu cầu” và có thể kèm header Retry-After.

Điểm cần lưu ý là biện pháp này chỉ dùng tạm thời. Google: “We don’t recommend that you do this for a long period of time (meaning, longer than 1-2 days).” (bản dịch) “Chúng tôi không khuyến nghị làm việc này trong thời gian dài (nghĩa là lâu hơn 1–2 ngày)”. Nếu kéo dài, hậu quả là có thật — nếu các mã đó tồn tại trên cùng URL trong nhiều ngày, “the URL may be dropped from Google’s index” (bản dịch) “URL có thể bị loại khỏi chỉ mục của Google” và với Google Ads, “your campaigns may be cancelled or paused, and your ads may not serve.” (bản dịch) “chiến dịch có thể bị hủy hoặc tạm dừng và quảng cáo có thể không phân phối”.

3. Những điều KHÔNG nên làm. Đừng dùng 4xx để điều tiết. “The 4xx status codes, except 429, have no effect on crawl rate,” (bản dịch) “Các mã trạng thái 4xx, trừ 429, không ảnh hưởng đến tốc độ thu thập dữ liệu”, và Google nói rõ “Don’t use 401 and 403 status codes for limiting the crawl rate.” (bản dịch) “Đừng dùng mã trạng thái 401403 để giới hạn tốc độ thu thập dữ liệu”. Trong bài đăng riêng năm 2023 về chính hành vi này, Google viết: “Over the last few months we noticed an uptick in website owners and some content delivery networks (CDNs) attempting to use 404 and other 4xx client errors (but not 429) to attempt to reduce Googlebot’s crawl rate. The short version of this blog post is: please don’t do that…” (bản dịch) “Trong vài tháng qua, chúng tôi nhận thấy ngày càng nhiều chủ website và một số mạng phân phối nội dung (CDN) cố dùng lỗi máy khách 404 và các lỗi 4xx khác (không phải 429) để giảm tốc độ thu thập của Googlebot. Tóm lại: xin đừng làm vậy…”. Và đừng tìm đến crawl-delay trong robots.txt: “The non-standard ‘crawl-delay’ robots.txt rule is not processed by Google’s crawlers.” (bản dịch) “Quy tắc robots.txt không chuẩn ‘crawl-delay’ không được crawler của Google xử lý”.

Bằng chứng cho nhận định này Google's crawlers do not process the non-standard crawl-delay robots.txt rule. Phạm vi: websites Độ tin cậy: cao · Đã xác minh: Myths and facts about crawling

4. Yêu cầu không khẩn cấp. Với vấn đề kéo dài nhưng không phải sự cố khẩn cấp, bạn có thể “file a special request to report a problem with unusually high crawl rate, mentioning the optimal rate for your site.” (bản dịch) “gửi yêu cầu đặc biệt để báo cáo tốc độ thu thập cao bất thường, trong đó nêu tốc độ tối ưu cho website”. Quy trình này chậm và chỉ đi theo một hướng (xem dưới đây).

Có thể tăng tốc độ thu thập không? Không — ít nhất là không trực tiếp.

Không có cách tăng thủ công. Google: “You cannot request an increase in crawl rate, and it may take several days for the request to be evaluated and fulfilled.” (bản dịch) “Bạn không thể yêu cầu tăng tốc độ thu thập dữ liệu, và việc đánh giá, thực hiện yêu cầu có thể mất vài ngày”. Điều bạn có thể làm là cải thiện gián tiếp. Theo hướng dẫn crawl budget của tôi, các đòn bẩy thực sự cải thiện hiệu quả gồm: tăng tốc hoặc bổ sung tài nguyên máy chủ; đưa trang quan trọng vào sitemap sạch; loại bỏ nội dung trùng lặp; có thêm liên kết ngoài và nội bộ; sửa liên kết chuyển hướng; dùng GET thay cho POST khi có thể; và dùng Indexing API khi đủ điều kiện. Lưu ý “a speedy site… can get more content over the same number of connections” (bản dịch) “website nhanh… có thể nhận thêm nội dung qua cùng số kết nối” — vì vậy tình trạng máy chủ là đòn bẩy ở cả chiều giảm lẫn tăng.

Cách kiểm soát tốc độ thu thập của Bingbot

Đây là khác biệt rõ ràng giữa hai công cụ tìm kiếm. Khi Google bỏ điều khiển thủ công, Bing vẫn giữ lại. Bing Webmaster Tools có Crawl Control (trong Configuration): một lưới theo từng giờ, trong đó số khối biểu thị tốc độ — nhiều khối hơn nghĩa là nhanh hơn. Bạn có thể chọn cài đặt sẵn theo giờ cao điểm hoặc chọn “Custom” và tự vẽ mẫu cho cả ngày. Bing cũng vẫn tuân thủ crawl-delay trong robots.txt — chính chỉ thị mà Google bỏ qua. Quy tắc ngắn gọn: với Google, phát tín hiệu qua phản hồi máy chủ; với Bing, bạn có nút điều chỉnh thực sự.

Điều gì đã xảy ra với công cụ tốc độ thu thập trong Search Console?

Dòng thời gian dưới đây rất cần thiết vì nhiều lời khuyên vẫn nhắc tới một công cụ không còn tồn tại:

  • Tháng 12 năm 2008 — Google giới thiệu quyền điều khiển tốc độ thu thập cho người dùng trong Webmaster Tools.
  • Tháng 2 năm 2023 — Google đăng bài “đừng dùng 403 hoặc 404 để giới hạn tốc độ”.
  • Ngày 24 tháng 11 năm 2023 — Google thông báo ngừng công cụ Crawl Rate Limiter. Lý do của Illyes: “with the improvements we’ve made to our crawling logic and other tools available to publishers, its usefulness has dissipated.” (bản dịch) “với những cải tiến trong logic thu thập dữ liệu và các công cụ khác dành cho nhà xuất bản, tính hữu dụng của nó đã mất dần”. Công cụ cũ chậm và ít được dùng — nó có “a much slower effect” (bản dịch) “hiệu lực chậm hơn nhiều”, “would have taken over a day for the new limits to be applied on crawling” (bản dịch) “mất hơn một ngày để giới hạn mới được áp dụng”, và được dùng “rarely,” (bản dịch) “hiếm khi”, trong khi người dùng “in many cases set the crawling speed to the bare minimum.” (bản dịch) “trong nhiều trường hợp đặt tốc độ xuống mức tối thiểu”.
  • Ngày 8 tháng 1 năm 2024 — công cụ bị xóa. Bằng chứng cho nhận định này Google deprecated the Search Console crawl-rate limiter and removed it on January 8, 2024. Phạm vi: Google Search Console's legacy crawl-rate limiter. Độ tin cậy: cao · Đã xác minh: Google: Crawl rate limiter deprecation Google cũng hạ mức sàn: “With the deprecation of the crawl limiter tool, we’re also setting the minimum crawling speed to a lower rate, comparable to the old crawl rate limits.” (bản dịch) “Khi ngừng công cụ giới hạn, chúng tôi cũng đặt tốc độ thu thập tối thiểu xuống mức thấp hơn, tương đương các giới hạn cũ”.

Kết luận thực tế: thanh trượt thủ công cũ vốn có độ trễ hơn 24 giờ; phương pháp phát tín hiệu bằng máy chủ hiện nay (5xx/429) làm Googlebot chậm lại gần như ngay lập tức, hiệu quả hơn hẳn trong tình huống khẩn cấp thực sự.

Cách theo dõi tốc độ thu thập dữ liệu

Báo cáo Crawl Stats trong GSC cho biết Google thực sự đang làm gì: tổng số yêu cầu theo thời gian, tổng dung lượng tải xuống, thời gian phản hồi trung bình, chế độ xem trạng thái host về khả năng Google truy cập website trong khoảng 90 ngày, cùng phân tích theo mã phản hồi, loại tệp, mục đích thu thập và loại Googlebot. Hãy theo dõi thời gian phản hồi trung bình cùng tín hiệu trạng thái host — thời gian tăng hoặc hàng loạt lỗi 5xx chính là điều khiến Googlebot giảm tốc độ. Báo cáo này sẽ cho bạn thấy việc tự gây chậm trước khi đi tìm nguyên nhân khác. Với Bing, Crawl Control và thông tin thu thập trong Bing Webmaster Tools là các công cụ tương đương.

Tốc độ, ngân sách và tần suất thu thập dữ liệu

Hãy phân biệt rõ các khái niệm sau:

  • Tốc độ thu thập dữ liệu = nhanh đến mức nào (cung / năng lực).
  • Nhu cầu thu thập dữ liệu = công cụ muốn bao nhiêu (mức phổ biến + độ cũ).
  • Crawl budget = tương tác giữa hai yếu tố — “the amount of time and resources a search engine allows for crawling a website.” (bản dịch) “lượng thời gian và tài nguyên mà công cụ tìm kiếm dành cho việc thu thập dữ liệu một website”.
  • Tần suất thu thập dữ liệu = một trang được thu thập lại thường xuyên đến đâu; đây chủ yếu là vấn đề nhu cầu (độ phổ biến và độ mới/cũ của trang).

Điều đáng yên tâm, cũng là quan điểm nhất quán của tôi: hầu hết website không cần lo về bất kỳ điều nào ở trên. “Most sites don’t need to worry about crawl budget, but there are few cases where you may want to take a look” (bản dịch) “Hầu hết website không cần lo về crawl budget, nhưng có một vài trường hợp bạn nên xem xét”: website mới có nhiều trang, website rất lớn hoặc thay đổi nhanh, và website có nhiều URL “Discovered – currently not indexed” trong GSC. Nếu không thuộc các trường hợp đó, hãy để Google tự động làm việc.

Thêm ghi chú chuyên gia

Ghim trích dẫn chuyên gia

Người mới? Hãy tạo hồ sơ chưa có người xác nhận cho họ tại /admin/experts/ → Ghim trích dẫn chuyên gia trước.