Tốc độ thu thập dữ liệu
Tốc độ công cụ tìm kiếm tải các trang — khái niệm tốc độ thu thập dữ liệu, lý do Google bỏ thanh trượt trong Search Console, cách giảm tốc độ Googlebot an toàn, vì sao không thể ép tăng tốc độ và sự khác biệt của Crawl Control trên Bing.
Tốc độ thu thập dữ liệu là tốc độ crawler tải trang từ máy chủ — phía cung của crawl budget. Google tự động điều chỉnh theo tình trạng máy chủ; thanh trượt thủ công trong Search Console đã bị xóa ngày 8 tháng 1 năm 2024. Để tạm thời làm Googlebot chậm lại, hãy trả mã 500/503/429 trong tối đa một hoặc hai ngày, không dùng 403/404; Google bỏ qua crawl-delay. Bạn không thể yêu cầu tăng tốc độ lâu dài mà chỉ có thể cải thiện gián tiếp bằng máy chủ nhanh, sitemap sạch và ít URL lãng phí. Bing vẫn có lưới Crawl Control thủ công. Tốc độ thu thập không phải yếu tố xếp hạng và hầu hết website không cần quản lý nó.
TL;DR — Tốc độ thu thập dữ liệu là tốc độ công cụ tìm kiếm tải các trang trên website của bạn. Google tự động đặt tốc độ này dựa trên tình trạng máy chủ — không còn nút để tăng hoặc giảm. Nếu máy chủ bị quá tải, cách khắc phục là làm nó nhanh hơn (hoặc chỉ trong một hay hai ngày, trả về lỗi báo “hãy chậm lại”). Thu thập dữ liệu nhanh hơn không giúp bạn xếp hạng cao hơn.
Tốc độ thu thập dữ liệu là gì
Khi công cụ tìm kiếm thu thập dữ liệu website, nó không lấy mọi trang cùng lúc mà tự điều tiết nhịp độ. Tốc độ thu thập dữ liệu là nhịp độ đó: crawler tải bao nhiêu trang trong một khoảng thời gian và chờ bao lâu giữa các lần tải. Googlebot dành cho Google, Bingbot dành cho Bing. Bằng chứng cho nhận định này Google defines crawl capacity using simultaneous connections and the delay between fetches, adjusted according to site responses. Phạm vi: Google crawler capacity, not a ranking factor. Độ tin cậy: cao · Đã xác minh: Google: Large site crawl budget guide
Mục đích của việc điều tiết là tránh gây quá tải. Một crawler có thể dễ dàng làm sập máy chủ nhỏ nếu yêu cầu hàng trăm trang mỗi giây, vì vậy nó theo dõi phản hồi của website và lùi lại khi máy chủ bắt đầu gặp khó khăn. Phản hồi nhanh thì nó tải nhanh hơn một chút; phản hồi chậm hoặc phát sinh lỗi thì nó thu thập ít hơn.
Thay đổi lớn cần biết
Trong nhiều năm, lời khuyên là “vào Search Console và giảm thanh trượt tốc độ thu thập dữ liệu”. Thanh trượt đó không còn nữa — Google đã xóa nó vào ngày 8 tháng 1 năm 2024. Vì vậy, hướng dẫn nào còn bảo bạn điều chỉnh nó đã lỗi thời.
Bằng chứng cho nhận định này Google deprecated the Search Console crawl-rate limiter and removed it on January 8, 2024. Phạm vi: Google Search Console's legacy crawl-rate limiter. Độ tin cậy: cao · Đã xác minh: Google: Crawl rate limiter deprecationNgày nay tốc độ được đặt tự động. Bạn không tự vặn nút điều chỉnh; Google đọc phản hồi của máy chủ rồi quyết định.
Cách làm Googlebot chậm lại
Nếu máy chủ thực sự bị quá tải, hãy xử lý theo thứ tự ưu tiên sau:
- Làm máy chủ nhanh hơn hoặc cấp thêm tài nguyên. Đây là cách khắc phục thực sự. Googlebot sẽ tự nhiên thu thập dữ liệu trên một máy chủ nhanh và ổn định một cách thoải mái hơn.
- Chỉ khi có tình huống khẩn cấp thực sự: để máy chủ trả về lỗi
500,503hoặc429thay cho trang bình thường. Google gần như ngay lập tức hiểu đó là tín hiệu “hãy chậm lại”. Nhưng chỉ làm vậy trong tối đa một hoặc hai ngày — nếu kéo dài hơn, Google có thể bắt đầu loại các trang khỏi kết quả tìm kiếm.
Những điều không nên làm: đừng chặn Googlebot bằng lỗi 403/404 (cách này
không làm chậm việc thu thập dữ liệu và có nguy cơ khiến trang biến mất), và đừng
dựa vào crawl-delay trong robots.txt — Google bỏ qua chỉ thị này (Bing
thì có tuân thủ).
Bạn có thể khiến Google thu thập dữ liệu nhanh hơn không?
Không thể theo yêu cầu — không có nút “thu thập nhiều hơn” và bạn không thể yêu cầu tăng tốc độ. Bạn có thể khuyến khích gián tiếp bằng máy chủ nhanh hơn, sitemap sạch, liên kết nội bộ tốt và loại bỏ URL trùng lặp hoặc rác. Nhưng thu thập nhiều hơn không phải mục tiêu tự thân — nó không giúp bạn xếp hạng cao hơn.
Muốn xem chi tiết về mã trạng thái, lịch sử ngừng cung cấp công cụ và sự khác biệt của Bing? Hãy chuyển sang thẻ Nâng cao.
TL;DR — Tốc độ thu thập dữ liệu là phía cung của crawl budget — tốc độ crawler tải trang, do “giới hạn năng lực thu thập dữ liệu” của Google quyết định (số kết nối đồng thời + độ trễ giữa các lần tải). Cơ chế này tự động phản ứng với tình trạng máy chủ; thanh trượt thủ công trong GSC đã bị xóa ngày 8 tháng 1 năm 2024. Muốn làm Googlebot chậm lại, hãy phát tín hiệu qua HTTP:
500/503/429trong tối đa 1–2 ngày, không bao giờ dùng401/403/404; Google bỏ quacrawl-delay(Bing tuân thủ). Bạn không thể yêu cầu tăng tốc độ mà chỉ có thể cải thiện gián tiếp. Bing vẫn có lưới Crawl Control thủ công. Tốc độ thu thập dữ liệu không phải yếu tố xếp hạng và hầu hết website không cần can thiệp.
Tốc độ thu thập dữ liệu thực sự là gì
Tốc độ thu thập dữ liệu là tốc độ crawler tải trang từ máy chủ — số yêu cầu đồng thời và độ trễ giữa chúng. Google gọi đó là giới hạn năng lực thu thập dữ liệu: “the maximum number of simultaneous parallel connections that Google can use to crawl a site, as well as the time delay between fetches.” (bản dịch) “số kết nối đồng thời tối đa mà Google có thể dùng để thu thập dữ liệu một website, cũng như độ trễ giữa các lần tải”. Bằng chứng cho nhận định này Google defines crawl capacity using simultaneous connections and the delay between fetches, adjusted according to site responses. Phạm vi: Google crawler capacity, not a ranking factor. Độ tin cậy: cao · Đã xác minh: Google: Large site crawl budget guide
Đây là một nửa của crawl budget. Như tôi viết trong hướng dẫn crawl budget của Ahrefs, crawl budget gồm “crawl demand which is how many pages a search engine wants to crawl on your site and crawl rate which is how fast they can crawl.” (bản dịch) “nhu cầu thu thập dữ liệu là số trang mà công cụ tìm kiếm muốn thu thập trên website, còn tốc độ thu thập dữ liệu là tốc độ nó có thể thực hiện”. Tốc độ là phía cung (bạn cho phép chúng nhanh đến đâu); nhu cầu là phía cầu (chúng muốn bao nhiêu). Crawl budget là nơi hai phía gặp nhau — còn thứ hạng hoàn toàn nằm ngoài vòng lặp đó.
Trong bộ slide Cách công cụ tìm kiếm hoạt động, tôi mô tả giới hạn tốc độ thu thập đơn giản là mức website
của bạn có thể chịu được. Nó phụ thuộc vào độ ổn định và tình trạng thu thập của
máy chủ, phản hồi chậm, lỗi 5xx (máy chủ) và phản hồi 429 (quá nhiều yêu cầu).
Google lùi lại khi máy chủ gặp khó khăn vì không muốn làm sập website. Một chi tiết
dễ bị bỏ qua: tất cả Googlebot dùng chung một nguồn lực thu thập — bot tìm kiếm,
hình ảnh, quảng cáo và các bot khác đều dùng chung tốc độ. Vì vậy, một loại tài
nguyên bị thu thập mất kiểm soát sẽ chiếm phần dành cho mọi thứ khác.
Crawl demand orders URLs dùng popularity, genuine thay đổi, và hữu ích inventory. Crawl capacity là shaped by máy chủ phản hồi speed, stability, và các lỗi. Đó capacity gate determines cách far Googlebot proceeds qua đó ordered queue. MỘT nhanh hơn, healthier máy chủ có thể raise đó ceiling, nhưng điều này không tạo crawl demand và không phải một tín hiệu xếp hạng.
© Patrick Stox LLC · CC BY 4.0 ·
Điều gì quyết định tốc độ thu thập dữ liệu
Giới hạn năng lực là tự động và phản ứng với máy chủ theo thời gian thực. Google: “If the site responds quickly for a while, the limit goes up, meaning more connections can be used to crawl. If the site slows down or responds with server errors, the limit goes down and Google crawls less.” (bản dịch) “Nếu website phản hồi nhanh trong một thời gian, giới hạn sẽ tăng, nghĩa là có thể dùng nhiều kết nối hơn để thu thập dữ liệu. Nếu website chậm lại hoặc trả về lỗi máy chủ, giới hạn sẽ giảm và Google thu thập ít hơn”.
Còn một yếu tố thứ hai bạn không kiểm soát được: tài nguyên của chính Google. “Google has a lot of machines, but not infinite machines. We still need to make choices with the resources that we have.” (bản dịch) “Google có rất nhiều máy, nhưng không phải vô hạn. Chúng tôi vẫn phải lựa chọn cách dùng những tài nguyên hiện có”. Vì vậy, tình trạng máy chủ đặt ra mức trần Google sẵn sàng sử dụng, nhưng năng lực của Google và nhu cầu thu thập dữ liệu của website quyết định bao nhiêu phần của mức trần đó thực sự được dùng.
Tài liệu về các quan niệm sai lầm xác nhận mối liên hệ với tình trạng máy chủ tác động theo cả hai hướng: “A speedy site is a sign of healthy servers, so it can get more content over the same number of connections,” (bản dịch) “Website nhanh là dấu hiệu máy chủ khỏe, nên có thể nhận thêm nội dung qua cùng số kết nối”, trong khi “a significant number of 5xx HTTP response status codes (server errors) or connection timeouts signal the opposite, and crawling slows down.” (bản dịch) “nhiều mã trạng thái phản hồi HTTP 5xx (lỗi máy chủ) hoặc hết thời gian kết nối báo hiệu điều ngược lại, và việc thu thập dữ liệu sẽ chậm xuống”.
Tốc độ thu thập dữ liệu có ảnh hưởng thứ hạng không? Không.
Hãy bác bỏ điều này trước vì nó gây ra nhiều nỗ lực sai hướng. Thu thập dữ liệu là điều kiện để xuất hiện trong tìm kiếm, nhưng không phải tín hiệu xếp hạng. Google nói rõ: “Improving your crawl rate won’t necessarily lead to better positions in Google Search results.” (bản dịch) “Cải thiện tốc độ thu thập dữ liệu không nhất thiết giúp đạt vị trí tốt hơn trong kết quả Google Tìm kiếm”. Thu thập nhanh hoặc nhiều hơn giúp nội dung được phát hiện và lập chỉ mục mới hơn, chứ không tạo vị trí cao hơn. Đây là vấn đề hiệu quả và tình trạng máy chủ — chỉ vậy.
Bằng chứng cho nhận định này Improving crawl rate does not itself improve ranking positions; crawling is necessary for eligibility but is not a ranking signal. Phạm vi: websites Độ tin cậy: cao · Đã xác minh: Myths and facts about crawlingCách giảm tốc độ thu thập của Googlebot
Theo thứ tự, từ giải pháp thực sự đến biện pháp khẩn cấp:
1. Khắc phục máy chủ (giải pháp thực sự). Tăng tốc hoặc bổ sung tài nguyên. Vì giới hạn năng lực theo dõi thời gian phản hồi và lỗi, máy chủ khỏe hơn là cách bền vững để giữ việc thu thập dữ liệu ở mức phù hợp — đồng thời không gây rủi ro cho việc lập chỉ mục.
2. Biện pháp khẩn cấp — 500/503/429. Google: “return 500,
503, or 429 HTTP response status code instead of 200 to the crawl
requests.” (bản dịch) “trả về mã trạng thái phản hồi HTTP 500, 503 hoặc
429 thay cho 200 đối với yêu cầu thu thập dữ liệu”. Crawler của Google
“treat the 429 status code as a signal that the server is overloaded,” (bản dịch) “coi mã trạng thái 429 là tín hiệu máy chủ đang quá tải”, và “5xx and
429 server errors prompt Google’s crawlers to temporarily slow down with
crawling.” (bản dịch) “lỗi máy chủ 5xx và 429 khiến crawler của Google tạm
thời giảm tốc độ thu thập”. Gary Illyes nói cụ thể: “if the server persistently
returns HTTP 500 status codes for a range of URLs, Googlebot will automatically,
and almost immediately slow down crawling.” (bản dịch) “nếu máy chủ liên tục
trả mã HTTP 500 cho một nhóm URL, Googlebot sẽ tự động và gần như ngay lập tức giảm
tốc độ thu thập”. Nên ưu tiên 429 khi có thể — nó nói rõ “quá nhiều yêu cầu”
và có thể kèm header Retry-After.
Điểm cần lưu ý là biện pháp này chỉ dùng tạm thời. Google: “We don’t recommend that you do this for a long period of time (meaning, longer than 1-2 days).” (bản dịch) “Chúng tôi không khuyến nghị làm việc này trong thời gian dài (nghĩa là lâu hơn 1–2 ngày)”. Nếu kéo dài, hậu quả là có thật — nếu các mã đó tồn tại trên cùng URL trong nhiều ngày, “the URL may be dropped from Google’s index” (bản dịch) “URL có thể bị loại khỏi chỉ mục của Google” và với Google Ads, “your campaigns may be cancelled or paused, and your ads may not serve.” (bản dịch) “chiến dịch có thể bị hủy hoặc tạm dừng và quảng cáo có thể không phân phối”.
3. Những điều KHÔNG nên làm. Đừng dùng 4xx để điều tiết. “The 4xx status
codes, except 429, have no effect on crawl rate,” (bản dịch) “Các mã trạng
thái 4xx, trừ 429, không ảnh hưởng đến tốc độ thu thập dữ liệu”, và Google
nói rõ “Don’t use 401 and 403 status codes for limiting the crawl rate.”
(bản dịch) “Đừng dùng mã trạng thái 401 và 403 để giới hạn tốc độ thu thập
dữ liệu”. Trong bài đăng riêng năm 2023 về chính hành vi này, Google viết: “Over
the last few months we noticed an uptick in website owners and some content
delivery networks (CDNs) attempting to use 404 and other 4xx client errors (but
not 429) to attempt to reduce Googlebot’s crawl rate. The short version of this
blog post is: please don’t do that…” (bản dịch) “Trong vài tháng qua, chúng tôi
nhận thấy ngày càng nhiều chủ website và một số mạng phân phối nội dung (CDN) cố
dùng lỗi máy khách 404 và các lỗi 4xx khác (không phải 429) để giảm tốc độ thu thập
của Googlebot. Tóm lại: xin đừng làm vậy…”. Và đừng tìm đến crawl-delay trong
robots.txt: “The non-standard ‘crawl-delay’ robots.txt rule is not processed
by Google’s crawlers.” (bản dịch) “Quy tắc robots.txt không chuẩn ‘crawl-delay’
không được crawler của Google xử lý”.
4. Yêu cầu không khẩn cấp. Với vấn đề kéo dài nhưng không phải sự cố khẩn cấp, bạn có thể “file a special request to report a problem with unusually high crawl rate, mentioning the optimal rate for your site.” (bản dịch) “gửi yêu cầu đặc biệt để báo cáo tốc độ thu thập cao bất thường, trong đó nêu tốc độ tối ưu cho website”. Quy trình này chậm và chỉ đi theo một hướng (xem dưới đây).
Có thể tăng tốc độ thu thập không? Không — ít nhất là không trực tiếp.
Không có cách tăng thủ công. Google: “You cannot request an increase in crawl
rate, and it may take several days for the request to be evaluated and fulfilled.”
(bản dịch) “Bạn không thể yêu cầu tăng tốc độ thu thập dữ liệu, và việc đánh giá,
thực hiện yêu cầu có thể mất vài ngày”. Điều bạn có thể làm là cải thiện gián tiếp.
Theo hướng dẫn crawl budget của tôi, các đòn
bẩy thực sự cải thiện hiệu quả gồm: tăng tốc hoặc bổ sung tài nguyên máy chủ; đưa
trang quan trọng vào sitemap sạch; loại bỏ nội dung trùng lặp; có thêm liên kết
ngoài và nội bộ; sửa liên kết chuyển hướng; dùng GET thay cho POST khi có thể;
và dùng Indexing API khi đủ điều kiện. Lưu ý “a speedy site… can get more content
over the same number of connections” (bản dịch) “website nhanh… có thể nhận thêm
nội dung qua cùng số kết nối” — vì vậy tình trạng máy chủ là đòn bẩy ở cả chiều
giảm lẫn tăng.
Cách kiểm soát tốc độ thu thập của Bingbot
Đây là khác biệt rõ ràng giữa hai công cụ tìm kiếm. Khi Google bỏ điều khiển thủ
công, Bing vẫn giữ lại. Bing Webmaster Tools có Crawl Control (trong
Configuration): một lưới theo từng giờ, trong đó số khối biểu thị tốc độ — nhiều
khối hơn nghĩa là nhanh hơn. Bạn có thể chọn cài đặt sẵn theo giờ cao điểm hoặc
chọn “Custom” và tự vẽ mẫu cho cả ngày. Bing cũng vẫn tuân thủ crawl-delay
trong robots.txt — chính chỉ thị mà Google bỏ qua. Quy tắc ngắn gọn: với Google,
phát tín hiệu qua phản hồi máy chủ; với Bing, bạn có nút điều chỉnh thực sự.
Điều gì đã xảy ra với công cụ tốc độ thu thập trong Search Console?
Dòng thời gian dưới đây rất cần thiết vì nhiều lời khuyên vẫn nhắc tới một công cụ không còn tồn tại:
- Tháng 12 năm 2008 — Google giới thiệu quyền điều khiển tốc độ thu thập cho người dùng trong Webmaster Tools.
- Tháng 2 năm 2023 — Google đăng bài “đừng dùng 403 hoặc 404 để giới hạn tốc độ”.
- Ngày 24 tháng 11 năm 2023 — Google thông báo ngừng công cụ Crawl Rate Limiter. Lý do của Illyes: “with the improvements we’ve made to our crawling logic and other tools available to publishers, its usefulness has dissipated.” (bản dịch) “với những cải tiến trong logic thu thập dữ liệu và các công cụ khác dành cho nhà xuất bản, tính hữu dụng của nó đã mất dần”. Công cụ cũ chậm và ít được dùng — nó có “a much slower effect” (bản dịch) “hiệu lực chậm hơn nhiều”, “would have taken over a day for the new limits to be applied on crawling” (bản dịch) “mất hơn một ngày để giới hạn mới được áp dụng”, và được dùng “rarely,” (bản dịch) “hiếm khi”, trong khi người dùng “in many cases set the crawling speed to the bare minimum.” (bản dịch) “trong nhiều trường hợp đặt tốc độ xuống mức tối thiểu”.
- Ngày 8 tháng 1 năm 2024 — công cụ bị xóa. Bằng chứng cho nhận định này Google deprecated the Search Console crawl-rate limiter and removed it on January 8, 2024. Phạm vi: Google Search Console's legacy crawl-rate limiter. Độ tin cậy: cao · Đã xác minh: Google: Crawl rate limiter deprecation Google cũng hạ mức sàn: “With the deprecation of the crawl limiter tool, we’re also setting the minimum crawling speed to a lower rate, comparable to the old crawl rate limits.” (bản dịch) “Khi ngừng công cụ giới hạn, chúng tôi cũng đặt tốc độ thu thập tối thiểu xuống mức thấp hơn, tương đương các giới hạn cũ”.
Kết luận thực tế: thanh trượt thủ công cũ vốn có độ trễ hơn 24 giờ; phương pháp
phát tín hiệu bằng máy chủ hiện nay (5xx/429) làm Googlebot chậm lại gần như
ngay lập tức, hiệu quả hơn hẳn trong tình huống khẩn cấp thực sự.
Cách theo dõi tốc độ thu thập dữ liệu
Báo cáo Crawl Stats trong GSC cho biết Google thực sự đang làm gì: tổng số yêu
cầu theo thời gian, tổng dung lượng tải xuống, thời gian phản hồi trung bình, chế độ
xem trạng thái host về khả năng Google truy cập website trong khoảng 90 ngày,
cùng phân tích theo mã phản hồi, loại tệp, mục đích thu thập và loại Googlebot. Hãy
theo dõi thời gian phản hồi trung bình cùng tín hiệu trạng thái host — thời gian tăng
hoặc hàng loạt lỗi 5xx chính là điều khiến Googlebot giảm tốc độ. Báo cáo này sẽ
cho bạn thấy việc tự gây chậm trước khi đi tìm nguyên nhân khác. Với Bing, Crawl
Control và thông tin thu thập trong Bing Webmaster Tools là các công cụ tương đương.
Tốc độ, ngân sách và tần suất thu thập dữ liệu
Hãy phân biệt rõ các khái niệm sau:
- Tốc độ thu thập dữ liệu = nhanh đến mức nào (cung / năng lực).
- Nhu cầu thu thập dữ liệu = công cụ muốn bao nhiêu (mức phổ biến + độ cũ).
- Crawl budget = tương tác giữa hai yếu tố — “the amount of time and resources a search engine allows for crawling a website.” (bản dịch) “lượng thời gian và tài nguyên mà công cụ tìm kiếm dành cho việc thu thập dữ liệu một website”.
- Tần suất thu thập dữ liệu = một trang được thu thập lại thường xuyên đến đâu; đây chủ yếu là vấn đề nhu cầu (độ phổ biến và độ mới/cũ của trang).
Điều đáng yên tâm, cũng là quan điểm nhất quán của tôi: hầu hết website không cần lo về bất kỳ điều nào ở trên. “Most sites don’t need to worry about crawl budget, but there are few cases where you may want to take a look” (bản dịch) “Hầu hết website không cần lo về crawl budget, nhưng có một vài trường hợp bạn nên xem xét”: website mới có nhiều trang, website rất lớn hoặc thay đổi nhanh, và website có nhiều URL “Discovered – currently not indexed” trong GSC. Nếu không thuộc các trường hợp đó, hãy để Google tự động làm việc.
Tóm tắt cho AI
Bản rút gọn của nội dung Nâng cao:
- Tốc độ thu thập dữ liệu = tốc độ crawler tải trang — “giới hạn năng lực thu thập dữ liệu” (kết nối đồng thời + độ trễ giữa các lần tải). Đây là phía cung của crawl budget; nhu cầu thu thập là phía cầu.
- Tự động và phản ứng với tình trạng máy chủ: máy chủ nhanh/khỏe → giới hạn cao;
phản hồi chậm hoặc
5xx/429→ Google thu thập ít hơn. Năng lực của Google là mức trần thứ hai ngoài tầm kiểm soát. Tất cả Googlebot dùng chung một nguồn lực. - Thanh trượt thủ công trong GSC bị xóa ngày 8 tháng 1 năm 2024. Lời khuyên bảo “điều chỉnh thanh trượt” đã lỗi thời.
- Để làm Googlebot chậm lại: sửa máy chủ (tốt nhất), hoặc trả
500/503/429trong tối đa 1–2 ngày (lâu hơn có nguy cơ mất chỉ mục + Ads tạm dừng). Ưu tiên429(cóRetry-After). Không bao giờ dùng401/403/404; Google bỏ quacrawl-delay. - Bạn không thể yêu cầu tăng tốc độ. Hãy cải thiện gián tiếp: máy chủ nhanh hơn, sitemap sạch, ít URL trùng lặp/rác hơn, thêm liên kết nội bộ + bên ngoài, dùng Indexing API khi đủ điều kiện.
- Bing giữ điều khiển thủ công: lưới Crawl Control theo giờ + tuân thủ
crawl-delay. - Tốc độ thu thập không phải yếu tố xếp hạng — “cải thiện tốc độ không nhất thiết giúp có vị trí tốt hơn”. Hầu hết website không cần quản lý nó.
Tài liệu chính thức
Tài liệu nguồn sơ cấp từ các công cụ tìm kiếm.
- Giảm tốc độ thu thập của Googlebot — hướng dẫn chính:
500/503/429, giới hạn 1–2 ngày và biểu mẫu yêu cầu (chỉ có thể giảm, không thể tăng). - Quản lý crawl budget — định nghĩa giới hạn năng lực thu thập và cách nó phản ứng với tình trạng máy chủ.
- Ảnh hưởng của mã trạng thái HTTP đến crawler của Google — những mã nào làm chậm (
5xx/429) và những mã nào không (4xxtrừ429). - Quan niệm sai và sự thật về thu thập dữ liệu — Google không xử lý
crawl-delay; tốc độ thu thập ≠ thứ hạng; tình trạng máy chủ ảnh hưởng việc thu thập. - Sắp ngừng công cụ Crawl Rate Limiter (tháng 11 năm 2023) — thông báo ngừng cung cấp.
- Đừng dùng 403s hoặc 404s để giới hạn tốc độ (tháng 2 năm 2023) — lý do
4xxlà biện pháp sai. - Báo cáo thống kê thu thập mới và cải tiến (tháng 11 năm 2020) — cách đọc báo cáo Crawl Stats.
- Tối ưu crawl budget — năng lực + nhu cầu, và ai thực sự cần quan tâm.
Bing / Microsoft
- Bing Webmaster Tools — Crawl Control — lưới tốc độ thủ công theo từng giờ mà Google đã bỏ.
- Hướng dẫn về Bingbot — tài liệu hiện tại của Bing Webmaster mô tả giá trị
crawl-delaytừ 1–20 giây. - Loạt bài bingbot: Tối ưu tần suất thu thập (tháng 10 năm 2018) — quan điểm của Bing về thời điểm tải lại.
Trích dẫn từ nguồn
Các phát biểu chính thức của Google. Mỗi liên kết sâu chuyển thẳng đến đoạn được trích dẫn trên trang nguồn.
Google — tốc độ thu thập là gì và điều gì quyết định nó
- “If the site responds quickly for a while, the limit goes up, meaning more connections can be used to crawl. If the site slows down or responds with server errors, the limit goes down and Google crawls less.” (bản dịch) “Khi website phản hồi nhanh trong một thời gian, mức giới hạn tăng lên để có thể mở thêm kết nối thu thập dữ liệu. Khi website chậm hoặc phát sinh lỗi máy chủ, mức giới hạn hạ xuống và Google giảm hoạt động thu thập”. — Quản lý crawl budget. Chuyển đến trích dẫn
- “Google has a lot of machines, but not infinite machines. We still need to make choices with the resources that we have.” (bản dịch) “Google sở hữu nhiều máy nhưng số lượng không vô hạn. Chúng tôi vẫn phải cân nhắc với nguồn lực mình có”. Chuyển đến trích dẫn
Google — cách giảm tốc độ thu thập dữ liệu
- “return
500,503, or429HTTP response status code instead of200to the crawl requests.” (bản dịch) “trả về mã trạng thái phản hồi HTTP500,503hoặc429thay cho200đối với yêu cầu thu thập dữ liệu”. — Giảm tốc độ thu thập của Googlebot. Chuyển đến trích dẫn - “We don’t recommend that you do this for a long period of time (meaning, longer than 1-2 days).” (bản dịch) “Chúng tôi không khuyến nghị làm việc này trong thời gian dài (nghĩa là lâu hơn 1–2 ngày)”. Chuyển đến trích dẫn
- “You cannot request an increase in crawl rate, and it may take several days for the request to be evaluated and fulfilled.” (bản dịch) “Bạn không thể yêu cầu tăng tốc độ thu thập dữ liệu, và việc đánh giá, thực hiện yêu cầu có thể mất vài ngày”. Chuyển đến trích dẫn
Google — những mã trạng thái làm chậm việc thu thập
- “Google’s crawlers treat the
429status code as a signal that the server is overloaded, and it’s considered a server error.” (bản dịch) “Crawler của Google coi mã trạng thái429là tín hiệu máy chủ đang quá tải và xem đó là lỗi máy chủ”. — Ảnh hưởng của mã trạng thái HTTP đến crawler của Google. Chuyển đến trích dẫn - “The
4xxstatus codes, except429, have no effect on crawl rate.” (bản dịch) “Các mã trạng thái4xx, trừ429, không ảnh hưởng đến tốc độ thu thập dữ liệu”. / “Don’t use401and403status codes for limiting the crawl rate.” (bản dịch) “Đừng dùng mã trạng thái401và403để giới hạn tốc độ thu thập dữ liệu”. Chuyển đến trích dẫn
Google — crawl-delay và thứ hạng
- “The non-standard ‘crawl-delay’ robots.txt rule is not processed by Google’s crawlers.” (bản dịch) “Quy tắc robots.txt không chuẩn ‘crawl-delay’ không được crawler của Google xử lý”. — Quan niệm sai và sự thật về thu thập dữ liệu. Chuyển đến trích dẫn
- “Improving your crawl rate won’t necessarily lead to better positions in Google Search results.” (bản dịch) “Cải thiện tốc độ thu thập dữ liệu không nhất thiết giúp đạt vị trí tốt hơn trong kết quả Google Tìm kiếm”. Chuyển đến trích dẫn
Gary Illyes, Google (về việc ngừng công cụ tốc độ thu thập)
- “if the server persistently returns HTTP 500 status codes for a range of URLs, Googlebot will automatically, and almost immediately slow down crawling.” (bản dịch) “nếu máy chủ liên tục trả mã HTTP 500 cho một nhóm URL, Googlebot sẽ tự động và gần như ngay lập tức giảm tốc độ thu thập”. Đọc bài viết
- “with the improvements we’ve made to our crawling logic and other tools available to publishers, its usefulness has dissipated.” (bản dịch) “với những cải tiến trong logic thu thập dữ liệu và các công cụ khác dành cho nhà xuất bản, tính hữu dụng của nó đã mất dần”. Đọc bài viết
Danh sách kiểm tra tốc độ thu thập dữ liệu
Giảm tốc độ thu thập của Googlebot một cách an toàn (theo thứ tự)
- Trước tiên, xác nhận crawler thực sự là vấn đề — kiểm tra Crawl Stats trong GSC (thời gian phản hồi trung bình, trạng thái host) và log máy chủ, đừng chỉ dựa vào phỏng đoán.
- Khắc phục nguyên nhân gốc: tăng tốc hoặc bổ sung tài nguyên máy chủ. Đây là giải pháp bền vững và là cách duy nhất không gây rủi ro cho việc lập chỉ mục.
- Nếu thật sự khẩn cấp, trả
500/503/429cho yêu cầu thu thập (ưu tiên429kèmRetry-After). Googlebot sẽ chậm lại gần như ngay lập tức. - Chỉ duy trì phản hồi khẩn cấp trong tối đa 1–2 ngày — lâu hơn có nguy cơ trang bị loại khỏi chỉ mục và Ads bị tạm dừng.
- Với vấn đề kéo dài nhưng không khẩn cấp, gửi yêu cầu tốc độ đặc biệt cho Google và nêu tốc độ tối ưu của website.
- Với Bing, đặt tốc độ trong Crawl Control và/hoặc thêm
crawl-delayvàorobots.txt.
KHÔNG làm những điều sau
- Đừng dùng
401/403/404để điều tiết — không ảnh hưởng tốc độ và có nguy cơ mất trang. - Đừng dựa vào
crawl-delaytrongrobots.txtđối với Google — Google bỏ qua (Bing tuân thủ). - Đừng tìm thanh trượt tốc độ cũ trong GSC — nó đã bị xóa ngày 8 tháng 1 năm 2024.
Khi bạn muốn thu thập nhiều hơn (không thể ép buộc — hãy cải thiện gián tiếp)
- Tăng tốc / bổ sung tài nguyên cho máy chủ.
- Giữ các URL chuẩn, có thể lập chỉ mục trong sitemap sạch với
lastmodchính xác. - Loại bỏ URL trùng lặp và giá trị thấp làm lãng phí việc thu thập.
- Củng cố liên kết nội bộ và thu hút thêm liên kết bên ngoài.
- Dùng
GETthay choPOSTkhi có thể; dùng Indexing API khi đủ điều kiện.
Tốc độ thu thập dữ liệu — bảng tra nhanh
Mã trạng thái và tác động đến tốc độ thu thập của Google
| Mã trạng thái | Tác động đến tốc độ thu thập | Dùng để điều tiết? |
|---|---|---|
200 | Bình thường — tải thành công | không áp dụng |
429 | Làm chậm thu thập (máy chủ được xem là quá tải; có thể kèm Retry-After) | Có — khẩn cấp, ≤1–2 ngày |
500 | Làm chậm thu thập (lỗi máy chủ) | Có — khẩn cấp, ≤1–2 ngày |
503 | Làm chậm thu thập (dịch vụ không khả dụng) | Có — khẩn cấp, ≤1–2 ngày |
401 | Không ảnh hưởng tốc độ | Không — Google nói không dùng |
403 | Không ảnh hưởng tốc độ | Không — Google nói không dùng |
404 | Không ảnh hưởng tốc độ | Không — có nguy cơ mất trang |
crawl-delay trong robots.txt | Google bỏ qua (Bing tuân thủ) | Không (Google) / Có (Bing) |
Thông tin nhanh
- Tốc độ thu thập = nhanh đến đâu (cung); nhu cầu thu thập = muốn bao nhiêu (cầu); crawl budget = hai yếu tố kết hợp.
- Thuật ngữ của Google: giới hạn năng lực thu thập dữ liệu — kết nối đồng thời + độ trễ giữa các lần tải. Cơ chế tự động, theo dõi tình trạng máy chủ.
- Khoảng dùng
5xx/429trong khẩn cấp: tối đa 1–2 ngày — lâu hơn có nguy cơ mất chỉ mục + Ads tạm dừng. - Không thể tăng thủ công — bạn chỉ có thể yêu cầu Google giảm, không thể tăng.
- Thanh trượt thủ công trong GSC: bị xóa ngày 8 tháng 1 năm 2024 (thông báo ngày 24 tháng 11 năm 2023).
- Tất cả Googlebot dùng chung một nguồn lực thu thập (tìm kiếm, hình ảnh, quảng cáo…).
- Tốc độ thu thập không phải yếu tố xếp hạng.
- Công cụ tương đương của Bing: lưới Crawl Control + tuân thủ
crawl-delay.
Tạm thời yêu cầu Googlebot chậm lại
Đây chỉ là biện pháp khẩn cấp — trả về 503 (hoặc 429) kèm header
Retry-After cho crawler thay vì 200. Google gần như ngay lập tức nhận ra yêu cầu
giảm nhịp độ. Chỉ duy trì trong tối đa một hoặc hai ngày: nếu lâu hơn,
các URL bị ảnh hưởng có thể bị loại khỏi chỉ mục (và Google Ads trỏ đến chúng có
thể bị tạm dừng). Giải pháp dài hạn đúng đắn là máy chủ nhanh, khỏe hơn, không phải
phản hồi lỗi vĩnh viễn.
Apache (.htaccess) — trả về 503 kèm Retry-After
# Emergency only — remove within 1–2 days.
# Sends Googlebot a "slow down / try later" signal.
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} (Googlebot|bingbot) [NC]
RewriteRule ^ - [R=503,L]
Header always set Retry-After "3600"
ErrorDocument 503 "Server temporarily overloaded — please retry later."Nginx — trả về 503 kèm Retry-After cho crawler
# Emergency only — remove within 1–2 days.
if ($http_user_agent ~* (Googlebot|bingbot)) {
return 503;
}
# Send a Retry-After hint with the 503 response.
add_header Retry-After 3600 always;Express / Node.js — 429 Too Many Requests kèm Retry-After
// Emergency only — remove within 1–2 days.
// 429 explicitly means "too many requests" and carries a Retry-After.
app.use((req, res, next) => {
const ua = req.get("user-agent") || "";
if (/Googlebot|bingbot/i.test(ua)) {
res.set("Retry-After", "3600"); // seconds
return res.status(429).send("Too many requests — please retry later.");
}
next();
});Nhắc lại: cách này chỉ tạm thời làm chậm việc thu thập. Nó không phải cách tạm dừng hoặc chặn lập chỉ mục và không thể thay thế việc khắc phục năng lực máy chủ.
Công cụ để xem và kiểm soát tốc độ thu thập
- Google Search Console — báo cáo Crawl Stats — chế độ xem của Google: tổng yêu cầu theo thời gian, tổng dung lượng tải xuống, thời gian phản hồi trung bình, trạng thái host (khả năng Google truy cập website trong khoảng 90 ngày), cùng phân tích theo mã phản hồi, loại tệp, mục đích và loại Googlebot. Đây là nơi bạn nhìn thấy việc giảm tốc độ.
- Bing Webmaster Tools — Crawl Control — lưới thủ công theo từng giờ (mẫu đặt sẵn hoặc tự vẽ) để đặt tốc độ Bingbot theo thời gian trong ngày. Đây là cơ chế thủ công Google đã bỏ.
crawl-delaytrongrobots.txt— Bing và một số công cụ khác tuân thủ, Google bỏ qua. Hữu ích cho Bing, không có tác dụng với Google.- Phân tích tệp log máy chủ — dữ liệu thực tế về tốc độ bot truy cập và mã trạng thái chúng nhận được. (Xem phân tích tệp log.)
- Công cụ audit / crawler — Ahrefs Site Audit và Screaming Frog SEO Spider giúp tìm URL trùng lặp, có tham số và dạng bẫy gây lãng phí việc thu thập.
Bạn nên làm gì với tốc độ thu thập dữ liệu?
Chọn đó crawl-rate phản hồi
Quy trình ứng phó sự cố: lưu lượng crawler làm origin quá tải
- Xác minh bot. Xác nhận IP nguồn thuộc crawler được khai báo. Nếu không, hãy chặn hoặc giới hạn kẻ giả mạo bằng biện pháp bảo mật thông thường.
- Đo tác động. Đối chiếu yêu cầu của crawler với độ trễ, mức bão hòa, hết thời gian và phản hồi 5xx. Nếu không tương quan, hãy điều tra nguồn tải thực sự.
- Bảo vệ tính khả dụng. Chỉ giảm phần lưu lượng cần thiết; trong tình huống Googlebot khẩn cấp tạm thời, dùng
429hoặc503, không dùng403hay404. - Tìm mẫu gây nóng. Nhóm yêu cầu theo thư mục, tham số, mã phản hồi và dung lượng. Nếu một không gian URL mất kiểm soát chiếm ưu thế, hãy sửa liên kết hoặc quy tắc tạo URL.
- Khắc phục nguyên nhân. Tăng năng lực, cache phản hồi an toàn, loại bỏ bẫy crawler hoặc dùng cơ chế được crawler cụ thể hỗ trợ.
- Khôi phục và xác minh. Gỡ giới hạn tạm thời, rồi xác nhận độ trễ người dùng và tỷ lệ lỗi crawler trở về mức cơ sở của website.
Những sai lầm về tốc độ thu thập dữ liệu
- Dùng
crawl-delaycho Googlebot. Google bỏ qua. Chỉ dùng phản hồi 429/503 tạm thời trong tình huống khẩn cấp và khắc phục nguyên nhân tải. - Trả 403 hoặc 404 để làm Googlebot chậm lại. Các trạng thái này báo hiệu bị từ chối truy cập hoặc không tồn tại, không phải quá tải tạm thời. Hãy dùng tín hiệu tạm thời đúng.
- Cố ép tăng tốc độ lâu dài. Thanh trượt Search Console đã bị loại bỏ và thu thập nhiều hơn không cải thiện thứ hạng. Hãy cải thiện tình trạng máy chủ và tín hiệu nhu cầu.
- Tin chuỗi user-agent. Kẻ giả mạo có thể tự xưng là Googlebot. Hãy xác minh IP trước khi thay đổi hành vi website.
- Để giới hạn khẩn cấp hoạt động quá lâu. Lỗi kéo dài có thể gây hại cho thu thập và lập chỉ mục. Hãy chỉ định người chịu trách nhiệm và điều kiện gỡ bỏ trước khi triển khai.
Khung xác minh → bảo vệ → khắc phục
- Xác minh: chứng minh lưu lượng đến từ crawler thật và tương quan với tác hại cho máy chủ.
- Bảo vệ: dùng biện pháp tạm thời hẹp nhất, vẫn duy trì tính khả dụng cho người dùng và truyền đạt đúng ý nghĩa HTTP.
- Khắc phục: loại bỏ nút thắt năng lực hoặc không gian URL mất kiểm soát, rồi rút biện pháp tạm thời.
Hãy tách tốc độ khỏi nhu cầu thu thập dữ liệu: máy chủ khỏe có thể nâng mức trần năng lực, nhưng không thể buộc công cụ tìm kiếm muốn thêm URL.
Chứng minh biện pháp can thiệp tốc độ đã hiệu quả
Phản hồi giới hạn tạm thời
Kiểm thử: yêu cầu một URL thử nghiệm đang bị giới hạn bằng curl -I. Kết quả mong đợi: mã 429 hoặc 503 theo kế hoạch chỉ xuất hiện trong sự cố, còn URL bình thường vẫn khả dụng. Diễn giải khi thất bại: quy tắc sai phạm vi hoặc trả sai trạng thái. Khoảng theo dõi: ngay lập tức. Điều kiện rollback: người dùng hoặc bot không liên quan bất ngờ nhận phản hồi giới hạn.
Khôi phục sau khi gỡ giới hạn
Kiểm thử: lặp lại kiểm tra header và theo dõi máy chủ cùng log truy cập. Kết quả mong đợi: phản hồi 200 bình thường trở lại, lỗi crawler giảm và độ trễ người dùng giữ ở mức cơ sở. Diễn giải khi thất bại: quy tắc tạm thời vẫn hoạt động hoặc vấn đề năng lực còn tồn tại. Khoảng theo dõi: ngay lập tức với hành vi HTTP; tiếp tục qua chu kỳ thu thập bình thường kế tiếp. Điều kiện rollback: mức bão hòa hoặc lỗi 5xx tái diễn thì quay lại kế hoạch ứng phó.
Khắc phục không gian URL
Kiểm thử: crawl và kiểm tra log của mẫu tham số hoặc đường dẫn gây quá nhiều yêu cầu. Kết quả mong đợi: URL bẫy mới không còn được tạo hoặc liên kết, trong khi URL giá trị vẫn truy cập được. Diễn giải khi thất bại: một đường phát hiện khác vẫn làm lộ mẫu đó. Khoảng theo dõi: so sánh các khoảng log tương đương. Điều kiện rollback: trang giá trị hoặc tài nguyên cần thiết trở nên không truy cập được.
Chỉ số đánh giá tình trạng tốc độ thu thập
Tỷ lệ yêu cầu của crawler đã xác minh
Chỉ số: số yêu cầu trên mỗi đơn vị thời gian từ IP crawler đã xác minh. Cho biết: nhịp độ thực tế của crawler. Cách lấy: log truy cập sau khi xác minh bot. Mốc / khoảng thực tế: thiết lập mức cơ sở theo crawler và giai đoạn lưu lượng; không có tốc độ an toàn chung. Tần suất: hằng ngày trong sự cố, hằng tháng vào thời gian khác.
Tỷ lệ lỗi và độ trễ tương quan với crawler
Chỉ số: 5xx/hết thời gian và độ trễ origin trong lúc crawler hoạt động. Cho biết: tốc độ có vượt năng lực hay không. Cách lấy: đối chiếu telemetry máy chủ với dấu thời gian trong log crawler. Mốc / khoảng thực tế: dùng mức cơ sở bình thường ngoài sự cố và mục tiêu năng lực của website. Tần suất: cảnh báo liên tục với website quan trọng.
Tỷ trọng yêu cầu hữu ích
Chỉ số: yêu cầu của crawler đã xác minh đến trang 200 giá trị so với chuyển hướng, lỗi và URL bẫy đã biết. Cho biết: năng lực có được sử dụng hiệu quả hay không. Cách lấy: phân loại URL và trạng thái trong log. Mốc / khoảng thực tế: theo dõi xu hướng dựa trên kho URL của website; tránh mục tiêu chung. Tần suất: hằng tháng.
Tự kiểm tra: Tốc độ thu thập dữ liệu
Tài nguyên đáng dành thời gian
Các bài viết liên quan của tôi
- Khi nào bạn nên lo về crawl budget? — tốc độ là một nửa của crawl budget, cùng các đòn bẩy giảm/tăng.
- Googlebot là gì và hoạt động như thế nào? — cách Googlebot quyết định tốc độ và nội dung cần thu thập (và vì sao “thay đổi tốc độ” đã bị ngừng).
- Hướng dẫn SEO kỹ thuật cho người mới — vị trí của hoạt động và tốc độ thu thập trong bức tranh tổng thể.
Các bài thuyết trình của tôi
- Cách công cụ tìm kiếm hoạt động (SlideShare) — nơi tôi mô tả giới hạn tốc độ là “mức website có thể chịu được” và lưu ý mọi Googlebot dùng chung một nguồn lực. (Tuyên bố miễn trừ thường trực: “This is my understanding of systems… not going to be 100% complete or accurate.” (bản dịch) “Đây là hiểu biết của tôi về các hệ thống… sẽ không đầy đủ hoặc chính xác 100%”.)
Từ các nguồn khác
- Search Engine Land — Công cụ tốc độ thu thập của Googlebot sắp bị ngừng và công cụ hiện đã bị xóa — việc ngừng công cụ và lý do của Illyes.
- Loạt bài Crawling December của Google — tuyển tập cô đọng nhất về thu thập dữ liệu từ nguồn chính thức.
- Search Engine Journal — Google xóa Crawl Rate Limiter khỏi Search Console — Roger Montti tường thuật thông báo tháng 11 năm 2023 cùng chi tiết tốc độ tối thiểu mới được đặt tự động.
- Search Engine Journal — Đừng dùng phản hồi lỗi 403/400 để giới hạn Googlebot — bài cảnh báo tháng 2 năm 2023 của Google về việc dùng 4xx để điều tiết.
- Bing Webmaster Blog — Loạt bài bingbot: Tối ưu tần suất thu thập — giải thích của Bing về thời điểm và cách Bingbot quyết định tải lại; đối chiếu hữu ích với cách tự động của Google.
- Bing Webmaster Blog — Tận dụng Bingbot qua Bing Webmaster Tools — cách dùng Crawl Control và cài đặt BWT khác để quản lý tốc độ Bingbot.
Nhật ký thay đổi
Đã cập nhật 24 thg 8, 2026.
Tóm tắt biên tập và chi tiết thay đổi đã ghi nhận.Chi tiết thay đổi
-
Ghi chú thay đổi chi tiết hiện chỉ có bằng tiếng Anh.
Không thể so sánh đầy đủ — không có bản lưu trước đó cho lần sửa đổi này.
Đã cập nhật 24 thg 8, 2026.
Tóm tắt biên tập và chi tiết thay đổi đã ghi nhận.Chi tiết thay đổi
-
Ghi chú thay đổi chi tiết hiện chỉ có bằng tiếng Anh.
Không thể so sánh đầy đủ — không có bản lưu trước đó cho lần sửa đổi này.
Đã cập nhật 24 thg 8, 2026.
Tóm tắt biên tập và chi tiết thay đổi đã ghi nhận.Chi tiết thay đổi
-
Ghi chú thay đổi chi tiết hiện chỉ có bằng tiếng Anh.
Không thể so sánh đầy đủ — không có bản lưu trước đó cho lần sửa đổi này.
Đã cập nhật 8 thg 8, 2026.
Tóm tắt biên tập và chi tiết thay đổi đã ghi nhận.Chi tiết thay đổi
-
Ghi chú thay đổi chi tiết hiện chỉ có bằng tiếng Anh.
Không thể so sánh đầy đủ — không có bản lưu trước đó cho lần sửa đổi này.