Crawl Số liệu Báo cáo

Cách đọc Google Search Console's Crawl Số liệu báo cáo — total các yêu cầu, download size, thời gian phản hồi, và đó breakdowns by phản hồi, file loại, Googlebot loại, và purpose.

Xuất bản lần đầu: 23 thg 6, 2026 · Cập nhật lần cuối: 8 thg 8, 2026 · Advanced
Ngôn ngữ

Đó Crawl Số liệu báo cáo (Search Console → Settings → Crawl số liệu) cho thấy cách Google được crawl trang web của bạn over đó cuối cùng 90 days: total các yêu cầu crawl, total download size, và average thời gian phản hồi, plus breakdowns by phản hồi code, file loại, Googlebot loại, và purpose (Discovery so với Refresh). đây là chỉ khả dụng cho root-level properties — một Domain property hoặc một URL-prefix property verified tại đó site root — không subfolder properties. Đối với hầu hết trang web điều này không một crawl-budget dashboard to optimize — đây là một máy chủ-health sớm-warning hệ thống. Rising phản hồi times hoặc 5xx làm Google back off; sustained robots.txt unavailability có thể halt crawling. đây là đó closest GSC nhận to log dữ liệu, nhưng điều này covers Google các crawler chỉ và không guaranteed to là yêu cầu-hoàn tất.

Tóm tắt — Crawl Số liệu (Settings → Crawl số liệu, root-level properties chỉ — Domain hoặc root URL-prefix) các báo cáo total các yêu cầu crawl, total download size, và average phản hồi time over ~90 days, plus breakdowns by phản hồi, file loại, Googlebot loại, và purpose (Discovery so với Refresh). đọc nó as máy chủ-health monitor, không crawl-budget vanity dashboard: rising phản hồi time hoặc 5xx làm Google reduce crawl capacity, và sustained robots.txt thất bại có thể halt crawling. nó closest GSC nhận để log dữ liệu, nhưng nó covers Google các crawler chỉ và không phải guaranteed để là yêu cầu-hoàn tất — cho all bots, người dùng, và hoàn tất record bạn vẫn cần máy chủ nhật ký. Google scopes của nó own crawl-budget hướng dẫn để lớn, frequently-thay đổi các trang; cho phần lớn nhỏ hơn các trang, trong my experience, nó gần như không bao giờ matters.

Evidence for this claim The Crawl Stats report shows Googlebot request totals, download size, response time, host status, and request breakdowns. Scope: Current Search Console Crawl Stats report. Confidence: high · Verified: Google Search Console: Crawl Stats report Evidence for this claim Google says crawl-budget management is mainly relevant to very large or rapidly changing sites; most sites can rely on normal crawling. Scope: Google's current crawl-budget guidance. Confidence: high · Verified: Google Search Central: Crawl budget management

Điều gì nó là và nơi nó lives

Google own framing là trực tiếp: “The Crawl Stats report shows you statistics about Google’s crawling history on your website.” (bản dịch) «Đó Crawl Số liệu báo cáo cho thấy bạn statistics về Google crawling history on của bạn website.» Bạn nhận to điều này under Settings → Crawl số liệu — không trong đó main báo cáo sidebar, mà trips một lot of mọi người up.

Đó single biggest reason mọi người think đó báo cáo là “missing” hoặc “hỏng”: Google chỉ cho thấy điều này cho root-level properties. Trong của họ words, “This report is available only for root-level properties.” (bản dịch) «Này báo cáo là khả dụng chỉ cho root-level properties.» Đó covers cả hai một Domain property và một URL-prefix property verified tại đó site root (ví dụ, https:// example.com) — điều này không limited to giao thức-ít hơn Domain properties. Nếu bạn verified một URL-prefix property scoped to một subfolder hoặc subpath, re-verify tại đó root level và điều này xuất hiện. có không có gì wrong với trang web của bạn.

Evidence for this claim Crawl Stats is available for root-level properties, including a Domain property or a URL-prefix property at a host root; saying it requires a Domain property or a property without a protocol is too narrow. Scope: root-level properties Confidence: high · Verified: Crawl Stats report

nên bạn care? crawl-budget reframe

phần lớn các trang không cần để optimize ngân sách crawl, và báo cáo thực giá trị là health monitoring thay vì budget tuning. Google scopes của nó own crawl-budget hướng dẫn để lớn các trang (1M+ unique các trang) và medium-hoặc-lớn hơn các trang (10k+ các trang với daily thay đổi). Dưới đó, Đây là diagnostic, không project.

Google cũng frames báo cáo itself as được xây dựng cho Nâng cao người dùng, và nói các trang under roughly 1 000 các trang generally không cần để dig vào nó tại điều này granularity — nhỏ hơn threshold hơn crawl-budget hướng dẫn trên. My own rule của thumb là looser: cho phần lớn các trang under về 10 000 các trang, I vẫn sẽ không spend nhiều time on ngân sách crawl. Treat đó as practitioner judgment, không chính thức cutoff.

Tốc độ crawl là governed by hai điều hoạt động together — crawl capacity limitcrawl demand. Capacity là điều gì máy chủ của bạn có thể xử lý. Google defines đó capacity limit as “The maximum number of simultaneous parallel connections that Google can use to crawl a site, as well as the time delay between fetches.” (bản dịch) «Đó maximum number of simultaneous parallel connections đó Google có thể dùng to crawl một site, cũng như đó time delay giữa fetches.» Demand là cách nhiều Google wants to crawl, driven by factors như popularity và staleness. Đó báo cáo là nơi đó consequences of cả hai cho thấy up. (Hơn on đó concept trong ngân sách crawl.)

một vài phạm vi details worth knowing trước khi bạn đọc numbers: báo cáo được tính thực tế URL Googlebot requested thay vì canonical nó resolves để, và nó được tính duplicate các yêu cầu và mỗi máy chủ-side chuyển hướng hop riêng (client-side các chuyển hướng không phải counted as chuyển hướng các phản hồi ở đây). nó scoped để property hoặc host bạn’re viewing — các tài nguyên on khác domains, và đôi khi sibling hoặc child domains, có thể là under- hoặc over-represented depending on property loại. và theo Google own tài liệu, báo cáo reflects phần lớn các yêu cầu crawl nhưng có thể omit some, so nhỏ mismatch so với của bạn own máy chủ nhật ký là dự kiến, không bug.

Đây là closest điều Search Console cho bạn để log-file dữ liệu — nhưng nó Google các crawler chỉ, aggregated, và không guaranteed để là yêu cầu-hoàn tất. nếu bạn muốn hits từ all bots và người dùng, hoặc guaranteed hoàn tất record, bạn cần của bạn máy chủ nhật ký. Treat Crawl Số liệu as free đầu tiên look trước khi bạn invest trong log analysis.

three top-line các chỉ số

đọc những điều này as trends, không targets:

  • Total các yêu cầu crawl“The total number of crawl requests issued for URLs on your site, whether successful or not.” (bản dịch) «Đó total number of các yêu cầu crawl issued cho URLs trên trang web của bạn, liệu successful hoặc không.» Mỗi yêu cầu được tính, including đó ones đó errored.
  • Total download size“Total number of bytes downloaded from your site during crawling, for the specified time period.” (bản dịch) «Total number of bytes downloaded từ trang web của bạn during crawling, cho đó specified time period.»
  • Average thời gian phản hồi“Average response time for all resources fetched from your site during the specified time period.” (bản dịch) «Average thời gian phản hồi cho all các tài nguyên fetched từ trang web của bạn during đó specified time period.» Này là effectively một máy chủ-health proxy. MỘT sustained spike là một performance alarm, và Google có thể respond by dropping của bạn crawl capacity limit — so đó SEO harm là gián tiếp (chậm hơn, ít hơn crawling), tách biệt từ any trang-speed xếp hạng factor.

Breakdown: By phản hồi

Này bảng, trong Google words, cho thấy “the responses that Google received when crawling your site, grouped by response type, as a percentage of all crawl responses.” (bản dịch) «đó các phản hồi đó Google đã nhận khi crawling trang web của bạn, grouped by phản hồi loại, as một percentage of all crawl các phản hồi.» Đó phản hồi types bao gồm OK (200), Đã chuyển vĩnh viễn (301), Moved temporarily (302), Không tìm thấy (404), Máy chủ lỗi (5XX), và robots.txt không khả dụng.

Cách I đọc mỗi pattern:

  • 200 nên là lớn majority. Google không publish cụ thể đích percentage, so judge điều này so với của bạn own baseline và watch cho sustained shifts thay vì chasing chính xác number.
  • Lots của 404s không phải fatal nhưng các tín hiệu wasted crawl — Google spending các yêu cầu on các URL đó không exist.
  • Lots của 301s points tại chuyển hướng chains hoặc liên kết nội bộ vẫn aimed tại old các URL. khắc phục links để point tại cuối đích.
  • ** 5xx spike** là phần lớn damaging pattern trong báo cáo. của bạn máy chủ là erroring under crawl load, mà drops capacity limit, mà có nghĩ là ít hơn crawling. Sustained 5xx có thể effectively throttle Google để crawl.
  • robots.txt không khả dụng không nên hiển thị up trong bất kỳ sustained, có ý nghĩa way. Google không publish fixed đích percentage, nhưng persistent share có nghĩ là Google periodically không thể fetch của bạn robots.txt. đó matters vì nếu của bạn robots.txt vẫn giữ không khả dụng, Google sẽ conservatively pause crawling cho trong khi thay vì guess. (cho Điều gì robots.txt làm và không control, see robots.txt.)

Breakdown: By file loại

Google groups crawling by file loại — HTML, image, JavaScript, CSS, JSON, PDF, và others. Đây là diagnostic lead, không proof của waste on của nó own — Cách nhiều JS, CSS, image, hoặc JSON crawling là thông thường phụ thuộc vào Cách của bạn trang web là được xây dựng ( JS-nặng app legitimately cần nhiều hơn tài nguyên crawling hơn static HTML trang web). JS/CSS/image share đó cao relative để của bạn own baseline, hoặc đó jumps suddenly, là worth investigating as có thể render-tài nguyên overhead. Unexpected file types cho thấy up có thể reveal crawl trap — infinite hoặc near-infinite URL space generating junk.

Breakdown: By Googlebot loại

điều này splits crawling by mà Googlebot đã làm fetching — smartphone, desktop, image, video, trang tài nguyên load, và AdsBot. Google không document bắt buộc mix, nhưng trong mobile-đầu tiên crawl, Smartphone typically leads cho phần lớn các trang. desktop-nặng profile, hoặc unexpected volume từ Image hoặc AdsBot, là lead worth investigating thay vì violation by itself — nó có thể có nghĩa là Google không phải treating của bạn trang web as mobile-đầu tiên, đó quảng cáo/image crawling là eating vào budget bạn’d rather spend on nội dung, hoặc chỉ đó của bạn trang web có unusual tài nguyên cần.

Breakdown: By purpose — Discovery so với Refresh

Hai categories, và Google defines them chỉ by prior crawl history — labels alone không tell bạn liệu mix là healthy:

  • Discovery“The URL requested was never crawled by Google before.” (bản dịch) «Đó URL requested đã là không bao giờ được crawl by Google trước.»
  • Refresh“A recrawl of a known page.” (bản dịch) «MỘT recrawl of một known trang.»

rise trong Discovery là dự kiến during launch hoặc migration (Google là finding của bạn new các URL); giống nhau rise là vấn đề nếu nó coming từ infinite-space hoặc parameter các URL — đó ngân sách crawl going để garbage. Refresh-nặng mix là thông thường cho established trang web đó không phải xuất bản nhiều new nội dung. Judge either so với của bạn own baseline và Điều gì bạn know changed, không so với fixed “healthy” ratio.

Host status — phần lớn actionable block

Host status summarizes liệu Google hit availability các vấn đề trying để crawl bạn, grouped vào three sub-kiểm tra: robots.txt fetch, DNS resolution, và máy chủ connectivity. red host status là một của phần lớn actionable các tín hiệu trong báo cáo — nó thường có nghĩ là Google là blocked hoặc throttled tại infrastructure level, trước khi nó bao giờ đã nhận để của bạn nội dung, during đó window. nó aggregate alert, though, không proof đó mỗi URL là affected hoặc đó vấn đề là vẫn happening hiện tại — kiểm tra timeline và xác nhận hiện tại status ( trực tiếp fetch, URL Inspection, hoặc của bạn nhật ký) trước khi bạn cân nhắc nó fixed. vẫn, treat red host status as đầu tiên điều để investigate. (Covered trong của nó own right under Host status.)

Reading spikes và drops

mechanism để internalize: của bạn máy chủ behavior feeds back vào Cách nhiều Google crawl. nếu trang web responds quickly và reliably, Google capacity limit có thể rise; nếu nó làm chậm xuống hoặc bắt đầu returning máy chủ các lỗi, limit drops. So:

  • phản hồi-time spike → capacity limit có thể drop → ít hơn crawling.
  • 5xx surge → capacity limit drops → ít hơn crawling; sustained, nó có thể throttle bạn hard.
  • robots.txt không khả dụng → nếu nó vẫn giữ không khả dụng, Google pauses crawling conservatively.

None của Đây là xếp hạng penalty. damage là gián tiếp: nếu các trang không phải được crawl và được lập chỉ mục, họ có thể’t xếp hạng tại all — nhưng extra crawling không lift thứ hạng either. (See ngân sách crawl concept cho đầy đủ capacity-plus-demand model.)

Crawl Số liệu so với máy chủ nhật ký

Crawl Số liệu là closest GSC nhận để nhật ký, nhưng gaps quan trọng:

Crawl Số liệu báo cáomáy chủ nhật ký
Ai nó coversGoogle các crawler chỉAll bots và all người dùng
GranularityAggregated; có thể omit some các yêu cầumỗi individual yêu cầu
Retention~90 daysWhatever bạn giữ
Theo-URL detailKhông
CostFree, trong GSCStorage + analysis effort

nếu bạn outgrow Crawl Số liệu — bạn cần theo-URL dữ liệu, non-Google bots, hoặc lâu hơn history — đó Khi bạn graduate để log file analysis. Crawl Số liệu tells bạn điều gì đó off; nhật ký tell bạn chính xác nơi.

Cách điều này relates để rest của crawling

Crawl Số liệu báo cáo là của bạn view vào crawling sau khi fact. cho lập chỉ mục side của Điều gì happens tiếp theo, trang lập chỉ mục báo cáo là companion — Crawl Số liệu hiển thị Điều gì Google fetched; trang lập chỉ mục hiển thị Điều gì đã làm nó vào chỉ mục. và Host status, surfaced bên trong điều này báo cáo, là infrastructure-level tín hiệu worth leading với.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.