Tốc độ crawl
Cách fast các công cụ tìm kiếm fetch của bạn các trang — điều gì tốc độ crawl là, vì sao Google retired đó Search Console rate slider, cách safely chậm Googlebot xuống hôm nay, vì sao bạn không thể force an increase, và cách Bing manual Crawl Control differs.
Ngôn ngữ
Tốc độ crawl là cách fast một crawler fetches các trang từ máy chủ của bạn — đó supply side of ngân sách crawl (đó demand side là cách nhiều đó engine wants to crawl). Google hiện tại sets điều này tự động từ máy chủ của bạn health: đó manual Search Console rate slider đã là đã xóa on January 8, 2024. To chậm Googlebot hôm nay bạn tín hiệu qua HTTP các mã trạng thái — trả về 500/503/429 cho một day hoặc hai, không bao giờ 403/404, và crawl-delay là đã bỏ qua by Google. Bạn không thể yêu cầu một vĩnh viễn increase; bạn improve điều này indirectly với một nhanh hơn máy chủ, sạch sitemaps, và ít hơn wasted URLs. Bing vẫn cho bạn một manual Crawl Control grid. Tốc độ crawl không phải một xếp hạng factor, và hầu hết các trang không bao giờ cần to manage điều này.
Tóm tắt — Tốc độ crawl là Cách fast công cụ tìm kiếm fetches các trang từ của bạn trang web. Google sets nó tự động dựa trên Cách healthy của bạn máy chủ là — có không lâu hơn button để turn nó up hoặc xuống. nếu của bạn máy chủ là getting hammered, khắc phục là để làm nó nhanh hơn (hoặc, cho day hoặc hai chỉ, có nó trả về “chậm xuống” lỗi). Crawling nhanh hơn không help bạn xếp hạng.
Điều gì tốc độ crawl là
Khi công cụ tìm kiếm crawl của bạn trang web, nó không grab mỗi trang tại sau khi — nó paces itself. Tốc độ crawl là đó pace: Cách nhiều các trang crawler fetches theo moment, và Cách dài nó chờ giữa fetches. Googlebot cho Google, Bingbot cho Bing. Evidence for this claim Google defines crawl capacity using simultaneous connections and the delay between fetches, adjusted according to site responses. Scope: Google crawler capacity, not a ranking factor. Confidence: high · Verified: Google: Large site crawl budget guide
toàn bộ point của pacing là politeness. crawler có thể easily overwhelm nhỏ máy chủ nếu nó asked cho hundreds của các trang thứ hai, so nó watches Cách của bạn trang web responds và backs off Khi máy chủ bắt đầu để struggle. Câu trả lời quickly và nó’ll fetch bit nhanh hơn; chậm xuống hoặc throw các lỗi và nó crawl ít hơn.
big điều đó changed
Cho năm đó advice đã là “go into Search Console and turn down the crawl rate slider.” (bản dịch) «go vào Search Console và turn xuống đó tốc độ crawl slider.» Đó slider là đã biến mất — Google đã xóa điều này on January 8, 2024. So nếu bạn tìm một tutorial telling bạn to adjust điều này, đó tutorial là out of date. Evidence for this claim Google deprecated the Search Console crawl-rate limiter and removed it on January 8, 2024. Scope: Google Search Console's legacy crawl-rate limiter. Confidence: high · Verified: Google: Crawl rate limiter deprecation
Hôm nay rate là tự động. bạn không dial nó; Google đọc của bạn máy chủ các phản hồi và decides.
Cách chậm Googlebot xuống
nếu của bạn máy chủ thực sự là là overloaded, trong order của preference:
- Làm máy chủ nhanh hơn hoặc cho nó nhiều hơn các tài nguyên. Đây là thực khắc phục. Googlebot sẽ naturally crawl healthy, fast máy chủ nhiều hơn comfortably.
- cho đúng emergency chỉ: có của bạn máy chủ trả về
500,503, hoặc429lỗi thay vì thông thường trang. Google đọc đó as “chậm xuống” gần như immediately. nhưng làm điều này cho ** day hoặc hai tại phần lớn** — leave nó on lâu hơn và Google có thể bắt đầu dropping của bạn các trang từ tìm kiếm.
Điều gì không để làm: không block Googlebot với 403/404 các lỗi (nó không chậm
crawling và risks losing các trang), và không rely on crawl-delay trong của bạn
robots.txt — Google bỏ qua nó (Bing làm honor nó).
có thể bạn làm Google crawl nhanh hơn?
không on demand — có không “crawl hơn” button, và Bạn có thể’t yêu cầu increase. Bạn có thể encourage nó indirectly: nhanh hơn máy chủ, sạch sitemap, good internal links, và getting rid của duplicate hoặc junk các URL all help. nhưng nhiều hơn crawling là không goal trong itself — nó sẽ không làm bạn xếp hạng cao hơn.
Muốn status-code details, deprecation history, và Cách Bing differs? Switch để Nâng cao tab.
Tóm tắt — Tốc độ crawl là supply side của ngân sách crawl — Cách fast crawler fetches, đặt by Điều gì Google calls crawl capacity limit (parallel connections
- delay giữa fetches). nó tự động và reacts để máy chủ health; manual GSC slider là đã xóa Jan 8, 2024. để chậm Googlebot hiện tại bạn tín hiệu qua HTTP:
500/503/429cho 1–2 days max, không bao giờ401/403/404, vàcrawl-delaylà đã bỏ qua by Google (honored by Bing). Bạn có thể’t yêu cầu increase — improve nó indirectly. Bing vẫn có manual Crawl Control grid. Tốc độ crawl không phải xếp hạng factor, và phần lớn các trang không bao giờ cần để touch nó.
Điều gì tốc độ crawl thực ra là
Tốc độ crawl là cách fast một crawler fetches các trang từ máy chủ của bạn — đó number of simultaneous các yêu cầu điều này làm và đó delay giữa them. Google name cho điều này là đó crawl capacity limit: “the maximum number of simultaneous parallel connections that Google can use to crawl a site, as well as the time delay between fetches.” (bản dịch) «đó maximum number of simultaneous parallel connections đó Google có thể dùng to crawl một site, cũng như đó time delay giữa fetches.» Evidence for this claim Google defines crawl capacity using simultaneous connections and the delay between fetches, adjusted according to site responses. Scope: Google crawler capacity, not a ranking factor. Confidence: high · Verified: Google: Large site crawl budget guide
đây là một half of ngân sách crawl. As I put điều này trong my Ahrefs crawl-budget hướng dẫn, ngân sách crawl breaks vào “crawl demand which is how many pages a search engine wants to crawl on your site and crawl rate which is how fast they can crawl.” (bản dịch) «crawl demand mà là cách nhiều các trang một công cụ tìm kiếm wants to crawl trên trang web của bạn và tốc độ crawl mà là cách fast they có thể crawl.» Tốc độ crawl là đó supply side (cách fast bạn’ll let them); crawl demand là đó demand side (cách nhiều they muốn to). Ngân sách crawl là nơi đó hai đáp ứng — và thứ hạng sit bên ngoài đó loop hoàn toàn.
Trong my Cách Tìm kiếm Hoạt động deck I frame tốc độ crawl limit as đơn giản Điều gì của bạn
trang web có thể hỗ trợ — nó driven by của bạn máy chủ stability và crawl health, chậm
các phản hồi, 5xx (máy chủ) các lỗi, và 429 (Quá nhiều yêu cầu) các phản hồi. Google
backs off Khi của bạn máy chủ bắt đầu để struggle vì nó không muốn để crash
của bạn trang web. Một detail mọi người miss: all Googlebots share single crawl
pool — bots Đối với tìm kiếm, images, quảng cáo, và so on all draw từ giống nhau rate.
So runaway crawl của một tài nguyên loại eats vào crawling của mọi thứ khác.
Crawl demand orders URLs using popularity, genuine change, and useful inventory. Crawl capacity is shaped by server response speed, stability, and errors. The capacity gate determines how far Googlebot proceeds through the ordered queue. A faster, healthier server can raise the ceiling, but it does not create crawl demand and is not a ranking signal.
© Patrick Stox LLC · CC BY 4.0 ·
Điều gì sets tốc độ crawl
Đó capacity limit là tự động và reacts to máy chủ của bạn trong real time. Google: “If the site responds quickly for a while, the limit goes up, meaning more connections can be used to crawl. If the site slows down or responds with server errors, the limit goes down and Google crawls less.” (bản dịch) «Nếu đó site responds quickly cho một trong khi, đó limit goes up, meaning hơn connections có thể là được dùng để crawl. Nếu đó site làm chậm xuống hoặc responds với máy chủ các lỗi, đó limit goes xuống và Google crawl ít hơn.»
có một second lever bạn không control: Google own các tài nguyên. “Google has a lot of machines, but not infinite machines. We still need to make choices with the resources that we have.” (bản dịch) «Google có một lot of machines, nhưng không infinite machines. We vẫn cần to làm choices với đó các tài nguyên đó we có.» So máy chủ của bạn health sets đó ceiling Google là willing to dùng, nhưng Google own capacity và trang web của bạn crawl demand decide cách nhiều of đó ceiling thực ra nhận dùng.
Đó myths doc xác nhận đó máy chủ-health link hoạt động cả hai ways: “A speedy site is a sign of healthy servers, so it can get more content over the same number of connections,” (bản dịch) «MỘT speedy site là một sign of healthy các máy chủ, so điều này có thể nhận hơn nội dung over đó giống nhau number of connections,» trong khi “a significant number of 5xx HTTP response status codes (server errors) or connection timeouts signal the opposite, and crawling slows down.” (bản dịch) «một significant number of 5xx HTTP phản hồi các mã trạng thái (máy chủ các lỗi) hoặc connection timeouts tín hiệu đó opposite, và crawling làm chậm xuống.»
Làm tốc độ crawl ảnh hưởng thứ hạng? Không.
Bust này đầu tiên, vì điều này drives một lot of misguided effort. Crawling là bắt buộc to xuất hiện trong tìm kiếm, nhưng điều này là không phải là tín hiệu xếp hạng. Google là rõ ràng: “Improving your crawl rate won’t necessarily lead to better positions in Google Search results.” (bản dịch) «Improving của bạn tốc độ crawl sẽ không nhất thiết lead to tốt hơn positions trong Google Kết quả tìm kiếm.» Nhanh hơn hoặc hơn crawling buys bạn fresher discovery và lập chỉ mục, không cao hơn positions. Tốc độ crawl là an efficiency và máy chủ-health concern — đầy đủ dừng.
Evidence for this claim Improving crawl rate does not itself improve ranking positions; crawling is necessary for eligibility but is not a ranking signal. Scope: websites Confidence: high · Verified: Myths and facts about crawlingCách reduce Googlebot’s tốc độ crawl
Trong order, từ thực khắc phục để emergency lever:
1. khắc phục máy chủ ( thực khắc phục). Speed nó up hoặc thêm các tài nguyên. vì capacity limit tracks phản hồi time và các lỗi, healthier máy chủ là durable way để giữ crawling trong comfortable range — và nó một đó không risk của bạn lập chỉ mục.
2. Đó emergency lever — 500/503/429. Google: “return 500, 503, or
429 HTTP response status code instead of 200 to the crawl requests.” (bản dịch) «trả về 500, 503, hoặc
429 HTTP phản hồi mã trạng thái thay vì 200 to đó các yêu cầu crawl.» Của nó
các crawler “treat the 429 status code as a signal that the server is overloaded,” (bản dịch) «treat đó 429 mã trạng thái as một tín hiệu đó đó máy chủ là overloaded,»
và “5xx and 429 server errors prompt Google’s crawlers to temporarily slow
down with crawling.” (bản dịch) «5xx và 429 máy chủ các lỗi prompt Google các crawler to temporarily chậm
xuống với crawling.» Gary Illyes put đó speed of này trong concrete terms: “if the
server persistently returns HTTP 500 status codes for a range of URLs, Googlebot
will automatically, and almost immediately slow down crawling.” (bản dịch) «nếu đó
máy chủ persistently trả về HTTP 500 các mã trạng thái cho một range of URLs, Googlebot
sẽ tự động, và gần như immediately chậm xuống crawling.» Ưu tiên 429
khi bạn có thể — điều này explicitly có nghĩa là “too many requests” (bản dịch) «quá nhiều yêu cầu» và có thể carry một
Retry-After header.
Đó catch là đó này là strictly tạm thời. Google: “We don’t recommend that you do this for a long period of time (meaning, longer than 1-2 days).” (bản dịch) «We không khuyến nghị đó bạn làm này cho một dài period of time (meaning, lâu hơn hơn 1-2 days).» Leave điều này on và đó cost là real — nếu những codes persist on đó giống nhau URL cho multiple days, “the URL may be dropped from Google’s index” (bản dịch) «đó URL có thể là dropped từ Google chỉ mục» và, cho Google Quảng cáo, “your campaigns may be cancelled or paused, and your ads may not serve.” (bản dịch) «của bạn campaigns có thể là cancelled hoặc paused, và của bạn quảng cáo có thể không serve.»
3. Điều không nên làm. không dùng 4xx to throttle. “The 4xx status codes, except
429, have no effect on crawl rate,” (bản dịch) «Đó 4xx các mã trạng thái, except
429, có không effect on tốc độ crawl,» và Google says plainly “Don’t use 401 and
403 status codes for limiting the crawl rate.” (bản dịch) «không dùng 401 và
403 các mã trạng thái cho limiting đó tốc độ crawl.» Trong một dedicated 2023 post về
mọi người đang làm chính xác này, Google wrote: “Over the last few months we noticed an
uptick in website owners and some content delivery networks (CDNs) attempting to use
404 and other 4xx client errors (but not 429) to attempt to reduce Googlebot’s crawl
rate. The short version of this blog post is: please don’t do that…” (bản dịch) «Over đó cuối cùng một vài months we noticed an
uptick trong website owners và some nội dung phân phối networks (CDNs) attempting to dùng
404 và other 4xx client các lỗi (nhưng không 429) to attempt to reduce Googlebot’s crawl
rate. Phiên bản ngắn gọn of này blog post là: please không làm đó…» Và không reach
cho robots.txt crawl-delay: “The non-standard ‘crawl-delay’ robots.txt rule is
not processed by Google’s crawlers.” (bản dịch) «Đó non-tiêu chuẩn ‘crawl-delay’ robots.txt rule là
không processed by Google các crawler.»
4. Đó non-emergency yêu cầu. Cho an ongoing vấn đề đó không một fire, bạn có thể “file a special request to report a problem with unusually high crawl rate, mentioning the optimal rate for your site.” (bản dịch) «file một special yêu cầu to báo cáo một vấn đề với unusually cao tốc độ crawl, mentioning đó optimal rate cho trang web của bạn.» đây là chậm, và điều này chỉ goes một direction (see dưới).
có thể bạn increase tốc độ crawl? Không — không trực tiếp.
Có không manual increase. Google: “You cannot request an increase in crawl rate,
and it may take several days for the request to be evaluated and fulfilled.” (bản dịch) «Bạn không thể yêu cầu an increase trong tốc độ crawl,
và điều này có thể take several days cho đó yêu cầu to là evaluated và fulfilled.» Điều gì
bạn có thể làm là improve điều này indirectly. Từ my crawl-budget hướng dẫn, đó levers đó
thực ra move hiệu quả crawl: speed up máy chủ của bạn / thêm các tài nguyên; giữ quan trọng
các trang trong sạch sitemaps; kill duplicate nội dung; earn hơn links (external và
internal); cách sửa được chuyển hướng links; dùng GET thay vì POST nơi có thể; và dùng
đó Lập chỉ mục API nơi bạn là eligible. Note đó “a speedy site… can get more
content over the same number of connections” (bản dịch) «một speedy site… có thể nhận hơn
nội dung over đó giống nhau number of connections» — so máy chủ health là đó lever đó
cho thấy up on cả hai đó reduce và đó increase side.
Cách control Bingbot’s tốc độ crawl
Ở đây sharp cross-engine contrast. nơi Google retired manual control, Bing
kept nó. Bing Quản trị viên web Tools có Crawl Control (under Configuration):
hour-by-hour grid nơi mỗi hour hiển thị bricks representing crawl speed — nhiều hơn bricks
có nghĩ là nhanh hơn crawling, ít hơn có nghĩ là chậm hơn. Bạn có thể pick preset được xây dựng khoảng của bạn
peak business hours, hoặc chọn “Custom” và draw của bạn own pattern across day.
Bing cũng vẫn honors crawl-delay trong robots.txt — chính xác directive Google
bỏ qua. So hai-engine rule của thumb: cho Google bạn tín hiệu qua máy chủ
các phản hồi; cho Bing bạn có thực tế dial.
Điều gì happened để Search Console tốc độ crawl tool?
timeline, vì so nhiều advice vẫn references tool đó không lâu hơn tồn tại:
- Dec 2008 — Google introduces người dùng crawl-rate control trong Quản trị viên web Tools.
- Feb 2023 — Google publishes “don’t use 403s or 404s for rate limiting.” (bản dịch) «không dùng 403s hoặc 404s cho rate limiting.»
- Nov 24, 2023 — Google announces đó deprecation of đó Tốc độ crawl Limiter Tool. Illyes’ reasoning: “with the improvements we’ve made to our crawling logic and other tools available to publishers, its usefulness has dissipated.” (bản dịch) «với đó improvements chúng ta đã đã làm to của chúng ta crawling logic và other tools khả dụng to publishers, của nó usefulness có dissipated.» Đó old tool đã là chậm và barely dùng — điều này đã có “a much slower effect” (bản dịch) «một nhiều chậm hơn effect» và “would have taken over a day for the new limits to be applied on crawling,” (bản dịch) «sẽ có taken over một day cho đó new limits to là applied on crawling,» và đã là dùng “rarely,” với những ai đã làm “in many cases set the crawling speed to the bare minimum.” (bản dịch) «trong nhiều cases set đó crawling speed to đó bare minimum.»
- Jan 8, 2024 — đó tool là đã xóa. Evidence for this claim Google deprecated the Search Console crawl-rate limiter and removed it on January 8, 2024. Scope: Google Search Console's legacy crawl-rate limiter. Confidence: high · Verified: Google: Crawl rate limiter deprecation Google cũng lowered đó floor: “With the deprecation of the crawl limiter tool, we’re also setting the minimum crawling speed to a lower rate, comparable to the old crawl rate limits.” (bản dịch) «Với đó deprecation of đó crawl limiter tool, chúng ta là cũng setting đó minimum crawling speed to một thấp hơn rate, comparable to đó old tốc độ crawl limits.»
practical upshot: old manual slider có >24-hour lag anyway; hôm nay
máy chủ-tín hiệu approach (5xx/429) làm chậm Googlebot gần như immediately, mà là
strictly tốt hơn cho thực tế emergency.
Cách monitor tốc độ crawl
GSC Crawl Số liệu báo cáo là của bạn window vào Điều gì Google là thực ra đang làm:
total các yêu cầu crawl theo thời gian, total download size, average phản hồi time, và
host status view của của bạn trang web availability để Google over cuối cùng ~90 days,
plus breakdown by phản hồi code, file loại, crawl purpose, và Googlebot loại.
Watch average phản hồi time và host-status các tín hiệu — climbing phản hồi time
hoặc rash của 5xx là chính xác Điều gì làm Googlebot throttle bạn, so điều này báo cáo là
nơi bạn’ll see self-inflicted slowdown trước khi bạn go hunting cho một. On Bing,
Crawl Control và crawl information trong Bing Quản trị viên web Tools là equivalents.
Tốc độ crawl so với ngân sách crawl so với crawl frequency
giữ những điều này straight:
- Tốc độ crawl = cách fast (supply / capacity).
- Crawl demand = cách nhiều they muốn to (popularity + staleness).
- Ngân sách crawl = đó interaction of đó hai — “the amount of time and resources a search engine allows for crawling a website.” (bản dịch) «đó amount of time và các tài nguyên một công cụ tìm kiếm cho phép cho crawling một website.»
- Crawl frequency = cách thường một được cho trang nhận re-được crawl, mà là mostly một crawl-demand câu hỏi (popularity và cách fresh/stale đó trang là).
Và đó reassuring part, mà là my standing take: hầu hết các trang không cần to worry về any of này. “Most sites don’t need to worry about crawl budget, but there are few cases where you may want to take a look” (bản dịch) «Hầu hết các trang không cần to worry về ngân sách crawl, nhưng ở đó là một vài cases nơi bạn có thể muốn to take một look» — newer các trang với một lot of các trang, very lớn hoặc rapidly thay đổi các trang, và các trang với một pile of “Discovered – currently not indexed” (bản dịch) «Discovered – hiện tại không được lập chỉ mục» URLs trong GSC. Nếu đó là không bạn, leave tốc độ crawl alone và let Google automation làm của nó job.
AI summary
condensed take on Nâng cao version:
- Tốc độ crawl = cách fast một crawler fetches các trang — đó “crawl capacity limit” (bản dịch) «crawl capacity limit» (parallel connections + delay giữa fetches). đây là đó supply side of crawl budget; crawl demand là đó demand side.
- đây là tự động và reacts to máy chủ health: fast/healthy máy chủ → cao hơn
limit; chậm các phản hồi hoặc
5xx/429→ Google crawl ít hơn. Google own capacity là một second ceiling bạn không control. All Googlebots share một crawl pool. - Đó GSC manual rate slider đã là đã xóa Jan 8, 2024. Advice telling bạn to “adjust the slider” (bản dịch) «adjust đó slider» là outdated.
- To chậm Googlebot hôm nay: cách sửa đó máy chủ (best), hoặc trả về
500/503/429cho 1–2 days max (lâu hơn risks de-lập chỉ mục + Quảng cáo pausing). Ưu tiên429(carriesRetry-After). Không bao giờ dùng401/403/404, vàcrawl-delaylà đã bỏ qua by Google. - Bạn không thể yêu cầu an increase. Improve điều này indirectly: nhanh hơn máy chủ, sạch sitemaps, ít hơn duplicate/junk URLs, hơn internal + liên kết bên ngoài, Lập chỉ mục API nơi eligible.
- Bing kept manual control: Crawl Control hourly grid +
crawl-delayhonored. - Tốc độ crawl không phải một xếp hạng factor — “improving your crawl rate won’t necessarily lead to better positions.” (bản dịch) «improving của bạn tốc độ crawl sẽ không nhất thiết lead to tốt hơn positions.» Hầu hết các trang không bao giờ cần to manage điều này.
Tài liệu chính thức
Chính-nguồn tài liệu từ các công cụ tìm kiếm.
- Reduce Googlebot tốc độ crawl — headline Cách-để:
500/503/429, 1–2 day limit, và yêu cầu form (Bạn có thể thấp hơn, không raise). - Ngân sách crawl Management — defines crawl capacity limit và Cách nó reacts để máy chủ health.
- Cách HTTP các mã trạng thái Ảnh hưởng Google Các crawler — chính xác mà codes throttle crawling (
5xx/429) và mà không (4xxexcept429). - Myths và facts về crawling —
crawl-delaykhông processed; tốc độ crawl ≠ thứ hạng; máy chủ health ảnh hưởng crawling. - Upcoming deprecation của Tốc độ crawl Limiter Tool (Nov 2023) — deprecation announcement.
- không sử dụng 403s hoặc 404s cho rate limiting (Feb 2023) — Vì sao
4xxlà sai lever. - New và improved crawl số liệu cho của bạn trang web (Nov 2020) — Cách đọc Crawl Số liệu báo cáo.
- Optimize của bạn ngân sách crawl — capacity + demand, và ai thực ra cần nó.
Bing / Microsoft
- Bing Quản trị viên web Tools — Crawl Control — manual hour-by-hour crawl-rate grid Google retired.
- Bingbot hướng dẫn — hiện tại Bing Quản trị viên web hướng dẫn documents
crawl-delaycác giá trị từ 1–20 seconds. - bingbot Series: Optimizing Crawl Frequency (Oct 2018) — Bing take on Khi để re-fetch.
Quotes từ nguồn
On—record statements từ Google. mỗi link là deep link đó jumps để quoted passage on nguồn trang.
Google — Điều gì tốc độ crawl là và Điều gì sets nó
- “If the site responds quickly for a while, the limit goes up, meaning more connections can be used to crawl. If the site slows down or responds with server errors, the limit goes down and Google crawls less.” (bản dịch) «Nếu đó site responds quickly cho một trong khi, đó limit goes up, meaning hơn connections có thể là được dùng để crawl. Nếu đó site làm chậm xuống hoặc responds với máy chủ các lỗi, đó limit goes xuống và Google crawl ít hơn.» — Ngân sách crawl Management. Jump to quote
- “Google has a lot of machines, but not infinite machines. We still need to make choices with the resources that we have.” (bản dịch) «Google có một lot of machines, nhưng không infinite machines. We vẫn cần to làm choices với đó các tài nguyên đó we có.» Jump to quote
Google — Cách reduce tốc độ crawl
- “return
500,503, or429HTTP response status code instead of200to the crawl requests.” (bản dịch) «trả về500,503, hoặc429HTTP phản hồi mã trạng thái thay vì200to đó các yêu cầu crawl.» — Reduce đó Googlebot tốc độ crawl. Jump to quote - “We don’t recommend that you do this for a long period of time (meaning, longer than 1-2 days).” (bản dịch) «We không khuyến nghị đó bạn làm này cho một dài period of time (meaning, lâu hơn hơn 1-2 days).» Jump to quote
- “You cannot request an increase in crawl rate, and it may take several days for the request to be evaluated and fulfilled.” (bản dịch) «Bạn không thể yêu cầu an increase trong tốc độ crawl, và điều này có thể take several days cho đó yêu cầu to là evaluated và fulfilled.» Jump to quote
Google — mà các mã trạng thái throttle crawling
- “Google’s crawlers treat the
429status code as a signal that the server is overloaded, and it’s considered a server error.” (bản dịch) «Google các crawler treat đó429mã trạng thái as một tín hiệu đó đó máy chủ là overloaded, và đây là considered một máy chủ lỗi.» — Cách HTTP Các mã trạng thái Ảnh hưởng Google Các crawler. Jump to quote - “The
4xxstatus codes, except429, have no effect on crawl rate.” (bản dịch) «Đó4xxcác mã trạng thái, except429, có không effect on tốc độ crawl.» / “Don’t use401and403status codes for limiting the crawl rate.” (bản dịch) «không dùng401và403các mã trạng thái cho limiting đó tốc độ crawl.» Jump to quote
Google — crawl-delay và thứ hạng
- “The non-standard ‘crawl-delay’ robots.txt rule is not processed by Google’s crawlers.” (bản dịch) «Đó non-tiêu chuẩn ‘crawl-delay’ robots.txt rule không phải processed by Google các crawler.» — Myths và facts về crawling. Jump to quote
- “Improving your crawl rate won’t necessarily lead to better positions in Google Search results.” (bản dịch) «Improving của bạn tốc độ crawl sẽ không nhất thiết lead to tốt hơn positions trong Google Search kết quả.» Jump to quote
Gary Illyes, Google (on crawl-rate tool deprecation)
- “if the server persistently returns HTTP 500 status codes for a range of URLs, Googlebot will automatically, and almost immediately slow down crawling.” (bản dịch) «nếu đó máy chủ persistently trả về HTTP 500 các mã trạng thái cho một range of URLs, Googlebot sẽ tự động, và gần như immediately chậm xuống crawling.» Đọc đó coverage
- “with the improvements we’ve made to our crawling logic and other tools available to publishers, its usefulness has dissipated.” (bản dịch) «với đó improvements chúng ta đã đã làm to của chúng ta crawling logic và other tools khả dụng to publishers, của nó usefulness có dissipated.» Đọc đó coverage
Crawl-rate checklists
Safely reduce Googlebot’s tốc độ crawl (trong order)
- đầu tiên, xác nhận crawler là thực vấn đề — kiểm tra GSC Crawl Số liệu (average phản hồi time, host status) và của bạn máy chủ nhật ký, không chỉ hunch.
- khắc phục root nguyên nhân: speed up máy chủ hoặc thêm các tài nguyên. Đây là durable khắc phục và chỉ một đó không risk lập chỉ mục.
- nếu nó genuine emergency, trả về
500/503/429để các yêu cầu crawl (ưu tiên429vớiRetry-After). Googlebot làm chậm gần như immediately. - giữ emergency phản hồi on cho 1–2 days tại phần lớn — lâu hơn risks các trang là dropped từ chỉ mục và Quảng cáo là paused.
- cho ongoing (non-fire) vấn đề, file Google special crawl-rate yêu cầu, naming optimal rate cho của bạn trang web.
- cho Bing, đặt speed trong Crawl Control và/hoặc thêm
crawl-delayđểrobots.txt.
không làm những điều này
- không sử dụng
401/403/404để throttle — không effect on rate, và bạn risk losing các trang. - không rely on
robots.txtcrawl-delaycho Google — nó đã bỏ qua (Bing honors nó). - không look cho old GSC crawl-rate slider — nó là đã xóa Jan 8, 2024.
Khi bạn muốn nhiều hơn crawling (Bạn có thể’t force nó — improve nó indirectly)
- Speed up / thêm các tài nguyên để máy chủ.
- giữ canonical, indexable các URL trong sạch sitemaps với chính xác
lastmod. - Xóa duplicate và thấp-giá trị các URL đó waste crawling.
- Strengthen liên kết nội bộ và earn nhiều hơn liên kết bên ngoài.
- sử dụng
GETthay vìPOSTnơi có thể; sử dụng lập chỉ mục API nơi eligible.
Tốc độ crawl — bảng tra nhanh
các mã trạng thái và Điều gì họ làm để Google tốc độ crawl
| mã trạng thái | Effect on tốc độ crawl | sử dụng nó để throttle? |
|---|---|---|
200 | Thông thường — fetched fine | n/ |
429 | Làm chậm crawling (được xem như máy chủ overloaded; có thể carry Retry-After) | Có — emergency, ≤1–2 days |
500 | Làm chậm crawling (máy chủ lỗi) | Có — emergency, ≤1–2 days |
503 | Làm chậm crawling (Dịch vụ không khả dụng) | Có — emergency, ≤1–2 days |
401 | Không effect on rate | Không — Google nói không |
403 | Không effect on rate | Không — Google nói không |
404 | Không effect on rate | Không — risks losing các trang |
robots.txt crawl-delay | Đã bỏ qua by Google (honored by Bing) | Không (Google) / Có (Bing) |
Fast facts
- Tốc độ crawl = Cách fast (supply); crawl demand = Cách nhiều họ muốn (demand); ngân sách crawl = hai together.
- Google term: crawl capacity limit — parallel connections + delay giữa fetches. Tự động, tracks máy chủ health.
- Emergency
5xx/429window: 1–2 days max — lâu hơn risks de-lập chỉ mục + Quảng cáo pausing. - Không manual increase — Bạn có thể chỉ ask Google để thấp hơn, không bao giờ raise.
- Manual GSC crawl-rate slider: đã xóa Jan 8, 2024 (announced Nov 24, 2023).
- All Googlebots share một crawl pool (tìm kiếm, images, quảng cáo, etc.).
- Tốc độ crawl là không xếp hạng factor.
- Bing tương đương: Crawl Control grid +
crawl-delayhonored.
Temporarily tell Googlebot để chậm xuống
Đây là emergency lever chỉ — trả về 503 (hoặc 429) với
Retry-After header để crawler thay vì 200. Google đọc nó as “chậm
xuống” gần như immediately. giữ nó on cho ** day hoặc hai tại phần lớn**: leave nó lâu hơn
và affected các URL có thể là dropped từ chỉ mục (và bất kỳ Google Quảng cáo pointing tại
them có thể là paused). right dài-term khắc phục là nhanh hơn, healthier máy chủ, không
vĩnh viễn lỗi phản hồi.
Apache (.htaccess) — trả về 503 với Retry-sau khi
# Emergency only — remove within 1–2 days.
# Sends Googlebot a "slow down / try later" signal.
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} (Googlebot|bingbot) [NC]
RewriteRule ^ - [R=503,L]
Header always set Retry-After "3600"
ErrorDocument 503 "Server temporarily overloaded — please retry later."Nginx — trả về 503 với Retry-sau khi cho các crawler
# Emergency only — remove within 1–2 days.
if ($http_user_agent ~* (Googlebot|bingbot)) {
return 503;
}
# Send a Retry-After hint with the 503 response.
add_header Retry-After 3600 always;Express / Node.js — 429 Quá nhiều yêu cầu với Retry-sau khi
// Emergency only — remove within 1–2 days.
// 429 explicitly means "too many requests" and carries a Retry-After.
app.use((req, res, next) => {
const ua = req.get("user-agent") || "";
if (/Googlebot|bingbot/i.test(ua)) {
res.set("Retry-After", "3600"); // seconds
return res.status(429).send("Too many requests — please retry later.");
}
next();
});Reminder: điều này chỉ làm chậm crawling temporarily. nó không phải way để pause hoặc block lập chỉ mục, và nó không phải substitute cho sửa máy chủ capacity.
Tools cho seeing và controlling tốc độ crawl
- Google Search Console — Crawl Số liệu báo cáo — Google own view: total crawl các yêu cầu theo thời gian, total download size, average phản hồi time, host status (trang web availability để Google over ~90 days), và breakdowns by phản hồi code, file loại, crawl purpose, và Googlebot loại. Đây là nơi bạn’ll see throttling.
- Bing Quản trị viên web Tools — Crawl Control — manual hour-by-hour grid (presets hoặc custom-drawn) cho setting Bingbot’s speed by time của day. manual lever Google retired.
robots.txtcrawl-delay— honored by Bing (và some khác engines), đã bỏ qua by Google. hữu ích cho Bing, useless cho Google.- máy chủ log file analysis — ground truth cho Cách fast bots là thực ra hitting bạn và Điều gì các mã trạng thái họ’re getting. (See log file analysis.)
- trang web audits / các crawler — Ahrefs trang web Audit và Screaming Frog SEO Spider để tìm duplicate, parameterized, và trap-như các URL đó waste crawling.
Điều gì nên bạn làm về tốc độ crawl?
Choose the crawl-rate response
Incident playbook: crawler traffic là overloading origin
- Verify bot. xác nhận nguồn IP belongs để claimed crawler. nếu không, block hoặc rate-limit impersonator qua thông thường security controls.
- Đo lường impact. Correlate crawler các yêu cầu với latency, saturation, timeouts, và 5xx các phản hồi. nếu họ không align, investigate thực tế load nguồn.
- Bảo vệ availability. Shed chỉ necessary traffic; cho tạm thời Googlebot emergency, sử dụng
429hoặc503, không403hoặc404. - tìm hot patterns. Group các yêu cầu by directory, parameters, phản hồi code, và bytes. nếu runaway URL space dominates, khắc phục của nó links hoặc generation rules.
- Repair nguyên nhân. Increase capacity, bộ nhớ đệm safe các phản hồi, xóa crawler traps, hoặc sử dụng cụ thể crawler supported controls.
- Restore và verify. Xóa tạm thời throttling, sau đó xác nhận người dùng latency và crawler lỗi rates trả về để trang web baseline.
Crawl-rate mistakes
- sử dụng
crawl-delaycho Googlebot. Google bỏ qua nó. sử dụng tạm thời 429/503 các phản hồi chỉ cho emergency và khắc phục underlying load. - Returning 403 hoặc 404 để chậm Googlebot. những điều đó statuses communicate access hoặc absence, không tạm thời overload. sử dụng đúng tạm thời tín hiệu.
- Trying để force vĩnh viễn increase. retired Search Console slider là đã biến mất, và nhiều hơn crawling không improve thứ hạng. Improve máy chủ health và demand các tín hiệu.
- Trusting người dùng-agent string. Spoofers có thể claim để là Googlebot. Verify IP trước khi thay đổi trang web behavior.
- Leaving emergency throttling trong place. Dài-đang chạy các lỗi có thể harm crawling và lập chỉ mục. đặt owner và removal condition trước khi deployment.
verify → bảo vệ → repair framework
- Verify: prove traffic là thực crawler và đó nó correlates với máy chủ harm.
- Bảo vệ: sử dụng narrowest tạm thời control đó preserves người dùng availability và communicates right HTTP meaning.
- Repair: xóa capacity bottleneck hoặc runaway URL space, sau đó withdraw tạm thời control.
giữ crawl rate tách biệt từ crawl demand: healthy máy chủ có thể raise capacity ceiling, nhưng nó không thể force công cụ tìm kiếm để muốn nhiều hơn các URL.
Prove crawl-rate intervention worked
Tạm thời throttle phản hồi
Kiểm thử để chạy: yêu cầu throttled kiểm thử URL với curl -I. Dự kiến kết quả: planned 429 hoặc 503 xuất hiện chỉ during incident và thông thường các URL vẫn khả dụng. thất bại interpretation: rule là mis-scoped hoặc sai status là là được trả về. Monitoring window: immediate. Rollback trigger: người dùng hoặc unrelated bots nhận throttle unexpectedly.
Recovery sau khi removing throttle
Kiểm thử để chạy: repeat header kiểm tra và monitor máy chủ plus access nhật ký. Dự kiến kết quả: thông thường 200 các phản hồi trả về, crawler các lỗi decline, và người dùng latency vẫn giữ tại baseline. thất bại interpretation: tạm thời rule vẫn active hoặc capacity vấn đề persists. Monitoring window: immediate cho HTTP behavior; continue qua tiếp theo thông thường crawl window. Rollback trigger: renewed saturation hoặc 5xx các lỗi require returning để incident plan.
URL-space repair
Kiểm thử để chạy: crawl và log-kiểm tra parameter hoặc path pattern đó gây ra excess các yêu cầu. Dự kiến kết quả: new trap các URL là không lâu hơn generated hoặc linked, trong khi valuable các URL vẫn reachable. thất bại interpretation: một discovery path vẫn exposes pattern. Monitoring window: so sánh tương đương log windows. Rollback trigger: valuable các trang hoặc bắt buộc các tài nguyên become inaccessible.
Các chỉ số cho crawl-rate health
Verified crawler yêu cầu rate
Chỉ số: các yêu cầu theo time unit từ verified crawler IPs. Điều gì nó tells bạn: thực tế crawler pace. Cách pull nó: access nhật ký sau khi bot verification. Benchmark / realistic range: establish baseline by crawler và traffic period; không universal safe rate tồn tại. Cadence: daily during incidents, monthly nếu không.
Crawler-correlated lỗi và latency rate
Chỉ số: 5xx/timeouts và origin latency during crawler activity. Điều gì nó tells bạn: liệu rate exceeds capacity. Cách pull nó: align máy chủ telemetry với crawler log timestamps. Benchmark / realistic range: sử dụng trang web thông thường non-incident baseline và capacity objectives. Cadence: continuous alerting cho cốt yếu các trang.
hữu ích-yêu cầu share
Chỉ số: verified crawler các yêu cầu để valuable 200 các trang versus các chuyển hướng, các lỗi, và known trap các URL. Điều gì nó tells bạn: liệu capacity là spent productively. Cách pull nó: classify log các URL và statuses. Benchmark / realistic range: trend so với trang web own inventory; tránh universal đích. Cadence: monthly.
Tự kiểm tra: Tốc độ crawl
các tài nguyên worth của bạn time
My related writing
- Khi Nên Bạn Worry Về Ngân sách crawl? — tốc độ crawl as một half of ngân sách crawl, plus đó reduce/increase levers.
- Điều gì Là Googlebot & Cách Làm Điều này Hoạt động? — cách Googlebot decides cách fast và điều cần crawl (và vì sao “change crawl rate” (bản dịch) «thay đổi tốc độ crawl» là hiện tại deprecated).
- Đó Beginner Hướng dẫn to SEO kỹ thuật — nơi crawling và tốc độ crawl fit trong đó bigger picture.
My speaking
- Cách Tìm kiếm Hoạt động (SlideShare) — nơi I frame đó tốc độ crawl limit as “what your site can support” (bản dịch) «điều gì trang web của bạn có thể hỗ trợ» và note all Googlebots share một crawl pool. (Standing disclaimer: “This is my understanding of systems… not going to be 100% complete or accurate.” (bản dịch) «Này là my understanding of các hệ thống… không going to là 100% hoàn tất hoặc chính xác.»)
từ others
- công cụ tìm kiếm Land — Googlebot tốc độ crawl tool là going away và tool là hiện tại đã biến mất — deprecation, với Illyes’ reasoning.
- Google Crawling December series — best concentrated đặt của chính thức crawl explainers.
- công cụ tìm kiếm Journal — Google Removing Tốc độ crawl Limiter Tool từ Search Console — Roger Montti relay của Nov-2023 deprecation với new auto-đặt minimum crawl speed detail.
- công cụ tìm kiếm Journal — không sử dụng 403/400 lỗi các phản hồi cho Rate Limiting Googlebot — covers Google Feb-2023 blog post warning so với sử dụng 4xx để throttle crawling.
- Bing Quản trị viên web Blog — bingbot Series: Optimizing Crawl Frequency — Bing own lời giải thích của Khi và Cách Bingbot decides để re-fetch; hữu ích counterpoint để Google tự động approach.
- Bing Quản trị viên web Blog — Getting phần lớn của Bingbot qua Bing Quản trị viên web Tools — Cách sử dụng Crawl Control và khác BWT settings để manage Bingbot’s tốc độ crawl.
Nhật ký thay đổi
Đã cập nhật 8 thg 8, 2026.
Tóm tắt biên tập và chi tiết thay đổi đã ghi nhận.Chi tiết thay đổi
-
Ghi chú thay đổi chi tiết hiện chỉ có bằng tiếng Anh.
Không thể so sánh đầy đủ — không có bản lưu trước đó cho lần sửa đổi này.