Hướng dẫn về Spider Traps (Crawler Traps)

Spider traps (crawler traps) là site structures đó generate effectively infinite URLs — faceted filters, calendars, session IDs, chuyển hướng loops — và âm thầm drain ngân sách crawl. Cách tìm và cách sửa them.

Xuất bản lần đầu: 22 thg 6, 2026 · Cập nhật lần cuối: 8 thg 8, 2026 · Advanced
Ngôn ngữ
1 tín hiệu bằng chứng trên trang này

MỘT spider trap (crawler trap) là bất kỳ part of một site đó mints an effectively infinite number of URLs — faceted filters, endless calendars, session IDs, loại/tracking params, infinite pagination, chuyển hướng loops, relative-link explosion — so các crawler burn của họ budget on near-duplicate junk thay vì của bạn real nội dung. Google named đó vấn đề 'infinite spaces' lại trong 2008; trong một February 2026 Tìm kiếm Off đó Record recap of Google 2025 năm-end crawling báo cáo, Gary Illyes put faceted navigation và hành động parameters tại khoảng 75% of đó crawling các vấn đề Google sees (50% faceted nav, 25% hành động parameters, plus nhỏ hơn chia sẻ từ tracking params và plugin). Điều này mainly hurts lớn, new, và ecommerce các trang; nhỏ các trang rarely cần để care. Detect điều này trong máy chủ của bạn logs đầu tiên — đó signature là một URL pattern eating một disproportionate, lopsided share of crawl hits relative để của bạn own site thông thường baseline, không một fixed percentage đó áp dụng mọi nơi — thì cách sửa điều này tại đó nguồn — ideally dừng generating đó URLs, hoặc robots.txt-disallow / noindex / 404 trong đó right order. Canonical và nofollow help nhưng không dừng đó crawling, và order matters: block cũng sớm và đó noindex không bao giờ nhận seen.

TL;DR — MỘT spider trap (crawler trap) là bất kỳ structure đó generates effectively infinite URLs — faceted nav, calendars, session IDs, loại/tracking params, infinite pagination, chuyển hướng loops, relative-link explosion — so các crawler waste capacity on near-duplicate junk. Google có dài described những patterns as “infinite spaces.” (bản dịch) «infinite spaces.» Đó impact là thường greatest on lớn, new, hoặc ecommerce các trang, though nhỏ hơn các trang có thể vẫn tạo traps. Tìm điều này trong logs đầu tiên; cách sửa điều này tại đó nguồn. Robots.txt dừng crawling nhưng không lập chỉ mục, noindex cần crawl access để là seen, canonical là một chậm hint — so đó order of của bạn các cách sửa matters.

Evidence for this claim Faceted navigation can generate effectively unbounded URL spaces that consume crawling resources; Google recommends controlling crawlable combinations. Scope: Current Google faceted-navigation crawl guidance. Confidence: high · Verified: Google Search Central: Managing faceted navigation Evidence for this claim Large duplicate or low-value URL inventories can waste crawl activity, while most smaller sites do not need specialized crawl-budget management. Scope: Current Google crawl-budget guidance. Confidence: high · Verified: Google Search Central: Crawl budget management

Điều gì một spider trap thực ra là

MỘT spider trap — synonymous với crawler trap — là một part of một site đó spawns an effectively infinite, hoặc impractically lớn, number of URLs, so một crawler giữ requesting thấp-giá trị, near-duplicate, hoặc empty các trang và burns của nó ngân sách crawl trước điều này reaches của bạn real nội dung. Google term cho đó underlying phenomenon là “infinite spaces” (bản dịch) «infinite spaces» (hoặc “infinite URL spaces” (bản dịch) «infinite URL spaces»).

Đó key word là effectively. MỘT trap không có để là truly infinite — “de facto infinite” (bản dịch) «de facto infinite» là plenty. Vài filters đó combine trong bất kỳ order produce an astronomical number of URLs cho đó giống nhau handful of các sản phẩm. Đó vấn đề không đó bất kỳ single URL là bad; đây là đó combinatorial explosion.

Và ở đây vì sao các crawler không thể chỉ sidestep điều này. As Google faceted-navigation tài liệu diễn đạt điều này, “Because the URLs created for the faceted navigation seem to be novel and crawlers can’t determine whether the URLs are going to be useful without crawling first, the crawlers will typically access a very large number of faceted navigation URLs.” (bản dịch) «Vì đó URLs đã tạo cho đó faceted navigation seem để là novel và các crawler không thể determine liệu đó URLs là going để là hữu ích không có crawling đầu tiên, đó các crawler sẽ typically access một very lớn number of faceted navigation URLs.» Gary Illyes đã nói cùng một điều hơn plainly: khi một crawler discovers một set of URLs, điều này không thể judge liệu đó URL space là good until điều này có được crawl một lớn chunk of điều này. Đó trap hoạt động precisely vì đó bot có để walk vào điều này để tìm out đây là một trap.

Vì sao spider traps hurt SEO

Đó damage là opportunity cost. Google là rõ ràng: “If crawling is spent on useless URLs, the crawlers have less time to spend on new, useful URLs.” (bản dịch) «Nếu crawling là spent on useless URLs, đó các crawler có ít hơn time để spend on new, hữu ích URLs.» Đó web, as Google notes, là “a nearly infinite space, exceeding Google’s ability to explore and index every available URL” (bản dịch) «một nearly infinite space, exceeding Google ability để explore và chỉ mục mỗi khả dụng URL» — so một finite crawl pool spent on của bạn junk là nội dung đó không bao giờ nhận discovered.

Này là một crawl-budget vấn đề, và ngân sách crawl là an efficiency concern, không một tín hiệu xếp hạng. Hơn crawling không lift của bạn thứ hạng — as I’ve được viết trong my ngân sách crawl hướng dẫn, “More crawling doesn’t mean you’ll rank better, but if your pages aren’t crawled and indexed they aren’t going to rank at all.” (bản dịch) «Hơn crawling không có nghĩa là bạn’ll xếp hạng tốt hơn, nhưng nếu của bạn các trang không được crawl và được lập chỉ mục they không going để xếp hạng tại all.» đó là đó real stakes: một bad đủ trap on một lớn site có thể leave genuinely quan trọng các trang stuck trong “Discovered – currently not indexed” (bản dịch) «Discovered – hiện tại không được lập chỉ mục» vì đó budget went để junk.

Ai thực ra cần để care? Google own crawl-budget hướng dẫn scopes itself để lớn các trang (1 million+ unique các trang, thay đổi ít nhất weekly), medium-hoặc-lớn hơn các trang (10 000+ unique các trang) đó thay đổi daily, và bất kỳ site với một lớn share of của nó URLs sitting trong “Discovered – currently not indexed” (bản dịch) «Discovered – hiện tại không được lập chỉ mục» — plus, by extension, ecommerce các trang với faceted catalogs, mà là đó fastest way để hit những numbers. Google calls những rough estimates, không chính xác thresholds. Hầu hết nhỏ các trang nhận được crawl fully regardless và có thể dừng reading ở đây. Đó trap scenario là chính xác đó case nơi ngân sách crawl làm quan trọng — và Google frames đó toàn bộ concept khoảng crawl capacity (cách nhiều máy chủ của bạn có thể take) và crawl demand (cách nhiều Google wants để crawl), không một fixed quota handed để mỗi site.

Này không một new hoặc rare vấn đề

Google named “infinite spaces” (bản dịch) «infinite spaces» lại trong 2008, trong một post titled Để infinity và beyond? Không!, calling out endless calendars và stacked tìm kiếm-kết quả filters as đó nguồn, và naming robots.txt và nofollow as đó các cách sửa. (Đó post là old và JS-được kết xuất, so I’m paraphrasing điều này thay vì quoting điều này.)

điều gì là striking là đó điều này không bao giờ went away — điều này scaled. Google ran một Crawling December blog series on faceted navigation lại trong December 2024, và hơn recently, on một Tìm kiếm Off đó Record episode recapping Google 2025 năm-end crawling báo cáo, Gary Illyes broke xuống điều gì là thực ra driving crawl waste: faceted navigation và hành động parameters together account cho khoảng 75% of đó crawling các vấn đề Google sees — 50% từ faceted navigation, 25% từ hành động parameters (URL parameters đó trigger an hành động thay vì thay đổi trang nội dung). Đó remaining quarter là nhỏ hơn stuff: về 10% từ “irrelevant” parameters như session IDs và UTM tags, 5% từ plugin và widgets đó generate problematic URLs, và 2% từ other các trường hợp biên như double-encoded URLs. Eighteen năm on, faceted navigation là vẫn, by một wide margin, đó single biggest nguồn of đó vấn đề.

Types of spider traps

Đó catalogue, với đó một-line tell cho mỗi. (See đó Các bảng tra nhanh tab cho đó matching một-line các cách sửa.)

  • Faceted navigation / filter combinations — đó #1 trap. Người dùng pick vài filters; đó crawler tries mỗi permutation. Google: “This often means a very large number of possible combinations of filters, which translates to a very large number of possible URLs.” (bản dịch) «Này thường có nghĩa là một very lớn number of có thể combinations of filters, mà translates để một very lớn number of có thể URLs.»
  • Infinite calendars — “next month / next year” (bản dịch) «tiếp theo month / tiếp theo năm» links với không horizon. MỘT bot có thể walk forward indefinitely (Illyes’ memorable ví dụ đã là một calendar widget generating một hợp lệ URL cho đó năm 3000).
  • Session IDs trong URLs?sid=, jsessionid, etc. mint một unique URL theo khách truy cập cho giống hệt nội dung.
  • Loại / order parameters?sort=price, ?order=desc. Google says “differently sorted versions of the same page” (bản dịch) «differently sorted versions of đó cùng trang» không nên là được crawl.
  • Infinite scroll / looping pagination — endless “load hơn” / “tiếp theo” đó không bao giờ terminates hoặc duplicates linked nội dung. Google flags “infinite scrolling pages that duplicate information on linked pages.” (bản dịch) «infinite scrolling các trang đó duplicate information on linked các trang.»
  • Chuyển hướng loops / dài chains — MỘT → B → MỘT forever, thường từ một mistyped rewrite rule.
  • Relative-URL / path explosion — malformed relative links đó giữ appending directories (/abc/def/abc/def/abc/def/…) until đó máy chủ cho lên.
  • Internal tìm kiếm kết quả các trang — tìm kiếm URLs treated as crawlable nội dung; một sitewide tìm kiếm on một single letter có thể mint một million các trang.
  • Dynamic / “magic” URLs — một URL đó accepts arbitrary text hoặc IDs và vẫn trả về 200.
  • Tracking / “hành động” parameters — UTM tags và thêm-để-cart/so sánh actions tạo de-facto-infinite URL variants (này là đó “action parameters” (bản dịch) «hành động parameters» half of Google 75%).

Cách detect một spider trap

  • Máy chủ logs đầu tiên — này là đó fastest tell. Của bạn logs cho thấy chính xác mà URLs bots hit và cách thường. có không fixed universal ngưỡng cho điều gì được tính as “cũng nhiều” — đó signature là một lopsided, disproportionate share of crawl hits concentrated on một junk URL pattern relative để của bạn own site thông thường baseline, không một cụ thể percentage đó áp dụng mọi nơi. (Yoast founder Joost de Valk có được viết đó trong his own experience đây là “not uncommon” (bản dịch) «không uncommon» cho một trap để take lên 20-30% hoặc hơn of all crawl — một hữu ích gut-kiểm tra cho cách skewed một real trap có thể nhận, không một benchmark để kiểm thử trang web của bạn so với.) (See log file analysis.)
  • Chạy một crawl — Screaming Frog, Ahrefs Site Audit, Sitebulb. Watch cho một crawl đó sẽ không finish, URLs đó giữ getting lâu hơn (path explosion), hoặc an exploding count of parameter combinations.
  • Google Search Console — một ballooning “Discovered – currently not indexed” (bản dịch) «Discovered – hiện tại không được lập chỉ mục» count, một swelling Soft 404 báo cáo (autogenerated empty các trang), Crawl Số liệu skewed toward junk paths, hoặc đó “Googlebot encountered an extremely high number of URLs” (bản dịch) «Googlebot encountered an extremely cao number of URLs» message.
  • MỘT site/chỉ mục sanity kiểm tra — khi một tiny fraction of được lập chỉ mục URLs thực ra drive traffic, bạn là probably feeding một trap.
  • Tìm kiếm operatorssite: plus inurl: on một known parameter string.
  • Bing — Site Scan và Crawl Control trong Bing Quản trị viên web Tools.

Cách sửa và ngăn spider traps

Đó các cách sửa, khoảng best để cuối cùng-resort — và đó sequencing matters, vì những controls làm khác nhau jobs.

  1. Best cách sửa: không generate đó URLs. Dừng minting crawlable URLs tại đó nguồn. Đó sạch nhất version là JavaScript/fragment-based filtering so filters cập nhật đó trang không có creating một new crawlable address (Google faceted-nav doc và SEJ cả hai khuyến nghị converting facet parameters để URL fragments). Mọi thứ dưới là một patch by so sánh.
  2. Pick mà facets deserve lập chỉ mục, block đó rest. Google: “Oftentimes there’s no good reason to allow crawling of filtered items, as it consumes server resources for no or negligible benefit.” (bản dịch) «Oftentimes có không good reason để cho phép crawling of filtered items, as điều này consumes máy chủ các tài nguyên cho không hoặc negligible benefit.» Cho phép một unfiltered listing plus đó riêng lẻ item các trang; block đó combinatorial filtered space.
  3. robots.txt disallow đó trap patterns cho spaces bạn không cần được lập chỉ mục. Này là Google chính khuyến nghị cho filtered/sorted junk. Caveat: robots.txt chặn crawling, không lập chỉ mục — see đó sequencing note dưới.
  4. noindex để xóa đã-được lập chỉ mục junk. Nếu đó junk là đã trong đó chỉ mục, bạn không thể robots-block điều này đầu tiên — Google có để là able để crawl đó trang để see đó noindex. Đó correct order là: giữ điều này crawlable, let noindex deindex điều này, thì (tùy chọn) robots.txt-disallow để dừng tương lai crawling. Block cũng sớm và đó noindex không bao giờ nhận seen.
  5. Trả về 404/410 cho empty filter combinations. Google: “Return an HTTP 404 status code when a filter combination doesn’t return results.” (bản dịch) «Trả về an HTTP 404 mã trạng thái khi một filter combination không trả về kết quả.»“Eliminate soft 404 errors. Soft 404 pages will continue to be crawled, and waste your budget.” (bản dịch) «Eliminate soft 404 các lỗi. Soft 404 các trang sẽ continue để là được crawl, và waste của bạn budget.»
  6. rel="canonical" để consolidate sorted/variant URLs để đó sạch version — hữu ích, nhưng chậm và một hint, không một directive. Google: điều này “may, over time, decrease the crawl volume of non-canonical versions of those URLs.” (bản dịch) «có thể, theo thời gian, decrease đó crawl volume of non-canonical versions of những URLs.» Điều này không dừng đó crawling, và Bing warns “relying on canonical tag is not necessarily the perfect solution to fix all your duplicate content problems.” (bản dịch) «relying on canonical tag không phải nhất thiết đó perfect giải pháp để cách sửa all của bạn duplicate nội dung các vấn đề.»
  7. rel="nofollow" on filter links — chỉ hoạt động nếu bạn apply điều này để mỗi link, internal và external. Google: “Every anchor pointing to a specific URL must have the rel=” (bản dịch) «Mỗi anchor pointing để một cụ thể URL phải có đó rel=\»nofollow” attribute in order for it to be effective.” (bản dịch) «thuộc tính trong order cho điều này để là effective.»
  8. Theo-trap các cách sửa: cap calendar links past một sane horizon và noindex distant dates; strip session IDs out of URLs (dùng cookies); cách sửa chuyển hướng loops so đó nguồn các chuyển hướng straight để đó cuối đích; dùng absolute URLs và máy chủ rules để dừng relative-link explosion; noindex/disallow internal tìm kiếm các trang.

Nếu bạn giữ sạch URL parameters và một ổn định parameter order, bạn cũng tránh minting needless variants ngay từ đầu. Note đó Google retired của nó URL Parameters tool trong 2022, so robots.txt / canonical / noindex hiện tại carry đó load on Google side. On Bing, đó tương đương là URL Normalization — bạn tell Bing mà parameters để bỏ qua.

Một nuance: không break legitimate pagination

Đó over-correction trap là real cũng. Khi mọi người panic về “infinite” pagination, they thường block hoặc canonicalize all paginated các trang — và tạo một new vấn đề. As I’ve được viết về pagination, “Blocking the pages from crawling will again make it more difficult to find content on the website, end up orphaning pages,” (bản dịch) «Blocking đó các trang từ crawling sẽ again làm điều này hơn difficult để tìm nội dung on đó website, end lên orphaning các trang,» và canonicalizing mỗi trang để trang một “makes it harder for search engines to find and index valuable content, and also cuts off the flow of PageRank.” (bản dịch) «làm điều này harder cho các công cụ tìm kiếm để tìm và chỉ mục valuable nội dung, và cũng cuts off đó flow of PageRank.» Distinguish một genuine infinite/looping pagination trap từ legitimate finite pagination — giữ đó finite version crawlable.

Nơi này sits

Spider traps là một crawl-efficiency vấn đề, so they trực tiếp theo để ngân sách crawl (điều gì đó trap drains) và log file analysis (cách bạn catch điều này). Nếu bạn đã đọc đó crawling hub, này là đó chế độ lỗi đó làm ngân sách crawl worth managing on đó các trang nơi điều này matters.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.