Jebakan Laba-laba (Jebakan Perayap)
Jebakan laba-laba (jebakan perayap) adalah struktur situs yang menghasilkan URL nyaris tak terbatas—filter berfaset, kalender, ID sesi, dan loop pengalihan—sehingga diam-diam menguras anggaran perayapan. Pelajari cara menemukan dan memperbaikinya.
Bahasa
1 sinyal bukti di halaman ini
- Alat aktif terkaitLog File Analyzer
Jebakan laba-laba (jebakan perayap) adalah bagian situs yang menciptakan URL dalam jumlah nyaris tak terbatas—filter berfaset, kalender tanpa akhir, ID sesi, parameter pengurutan/pelacakan, paginasi tak terbatas, loop pengalihan, dan ledakan tautan relatif—sehingga perayap menghabiskan anggarannya untuk sampah yang nyaris duplikat, bukan konten Anda yang sebenarnya. Google menamai masalah ini 'infinite spaces' pada 2008; dalam rangkuman Search Off the Record pada Februari 2026 atas laporan perayapan akhir tahun 2025 Google, Gary Illyes menyebut navigasi berfaset dan parameter tindakan menyumbang sekitar 75% masalah perayapan yang ditemui Google (50% navigasi berfaset, 25% parameter tindakan, ditambah porsi lebih kecil dari parameter pelacakan dan plugin). Dampaknya terutama terasa pada situs besar, baru, dan ecommerce; situs kecil jarang perlu mengkhawatirkannya. Deteksi terlebih dahulu melalui log server—tandanya adalah satu pola URL mengambil porsi hit perayapan yang sangat besar dan tidak proporsional dibandingkan pola dasar umum situs Anda sendiri, bukan persentase tetap yang berlaku di semua situs—lalu perbaiki dari sumbernya: idealnya hentikan pembuatan URL, atau terapkan larangan robots.txt / noindex / 404 dalam urutan yang tepat. Kanonis dan nofollow membantu tetapi tidak menghentikan perayapan, dan urutannya penting: blokir terlalu dini maka noindex tidak pernah terlihat.
Evidence for this claim Faceted navigation can generate effectively unbounded URL spaces that consume crawling resources; Google recommends controlling crawlable combinations. Scope: Current Google faceted-navigation crawl guidance. Confidence: high · Verified: Google Search Central: Managing faceted navigation Evidence for this claim Large duplicate or low-value URL inventories can waste crawl activity, while most smaller sites do not need specialized crawl-budget management. Scope: Current Google crawl-budget guidance. Confidence: high · Verified: Google Search Central: Crawl budget managementTL;DR — Jebakan laba-laba (atau jebakan perayap) adalah bagian situs yang tanpa sengaja membuat daftar URL nyaris tanpa akhir—misalnya kombinasi filter, kalender dengan tautan “next month” (terjemahan) “bulan berikutnya” yang terus berlanjut, atau alamat web dengan ID sesi yang melekat. Bot mesin pencari terjebak merayapi semua sampah itu, bukan halaman Anda yang sebenarnya. Waktu bot terbuang, dan pada situs besar halaman yang baik pun akhirnya lebih jarang dirayapi.
Apa itu jebakan laba-laba
Ketika mesin pencari mengunjungi situs Anda, bot mengikuti tautan dan mengunduh halaman—proses ini disebut perayapan. Jebakan laba-laba adalah struktur yang memberi perayap pasokan tautan yang pada dasarnya tak terbatas. Sebagian besar tautan itu mengarah ke halaman kosong atau nyaris identik. Bot terus mengambilnya tanpa pernah kehabisan URL atau menemukan sesuatu yang baru.
“Spider trap” (terjemahan) “jebakan laba-laba” dan “crawler trap” (terjemahan) “jebakan perayap” berarti hal yang sama—spider dan crawler merupakan dua sebutan untuk bot. Istilah Google untuk masalah ini adalah “infinite spaces.” (terjemahan) “ruang tak terbatas.”
Apa penyebabnya
Beberapa penyebab klasik:
- Filter — pilih warna, ukuran, merek, rentang harga, lalu urutkan dari yang termurah… setiap kombinasi menjadi URL baru dan jumlahnya berlipat dengan cepat.
- Kalender — tautan “next month” (terjemahan) “bulan berikutnya” tanpa batas. Bot dapat terus mengeklik hingga tahun 3000.
- ID sesi — kode unik ditambahkan ke URL setiap pengunjung sehingga halaman yang sama tersedia melalui ribuan alamat.
- Loop pengalihan — halaman A mengirim bot ke B, lalu B mengirimnya kembali ke A tanpa henti.
Mengapa ini penting (dan kapan tidak)
Bot hanya memiliki waktu terbatas untuk situs Anda. Setiap menit yang dihabiskan pada URL sampah adalah waktu yang tidak dipakai untuk konten Anda yang sebenarnya. Pada situs kecil, hal ini jarang menjadi masalah karena biasanya tersedia cukup waktu untuk merayapi semuanya. Pada situs besar, situs yang masih baru, atau toko online besar, halaman penting bisa dirayapi dengan lambat atau tidak sama sekali.
Cara menemukan dan memperbaikinya
Petunjuk tercepat ada di log server. Jika satu pola URL yang aneh mengambil porsi perayapan yang sangat besar dan tidak proporsional dibandingkan pola dasar situs Anda, itulah jebakannya. Perbaikan terbaik ialah menghentikan pembuatan URL sejak awal (misalnya, membuat filter berfungsi tanpa membuat alamat web baru setiap kali digunakan). Jika itu tidak memungkinkan, blokir pola sampah agar dilewati bot.
Ingin katalog lengkap per jenis, alur deteksi, dan urutan yang tepat untuk menerapkan setiap perbaikan? Beralihlah ke tab Lanjutan.
Evidence for this claim Faceted navigation can generate effectively unbounded URL spaces that consume crawling resources; Google recommends controlling crawlable combinations. Scope: Current Google faceted-navigation crawl guidance. Confidence: high · Verified: Google Search Central: Managing faceted navigation Evidence for this claim Large duplicate or low-value URL inventories can waste crawl activity, while most smaller sites do not need specialized crawl-budget management. Scope: Current Google crawl-budget guidance. Confidence: high · Verified: Google Search Central: Crawl budget managementTL;DR — jebakan laba-laba (jebakan perayap) adalah apa pun struktur yang menghasilkan URL yang nyaris tak terbatas — navigasi berfaset, kalender, ID sesi, pengurutan/pelacakan parameter, paginasi tak terbatas, loop pengalihan, ledakan tautan relatif — sehingga perayap menyia-nyiakan kapasitas pada sampah yang nyaris duplikat. Google memiliki panjang described ini pola ini sebagai “ruang tak terbatas.” Dampaknya biasanya paling besar pada situs besar, baru, atau situs ecommerce, meskipun lebih kecil situs dapat masih buat jebakan. temukan di log pertama; perbaiki pada sumbernya. Robots.txt menghentikan perayapan tetapi bukan pengindeksan, noindex perlu perayapan akses untuk menjadi terlihat, kanonis adalah petunjuk yang lambat — sehingga urutan dari Anda perbaikan penting.
apa jebakan laba-laba sebenarnya adalah
jebakan laba-laba — sinonim dengan jebakan perayap — adalah bagian situs yang menghasilkan sebuah secara efektif tak terbatas, atau secara tidak praktis besar, jumlah URL, sehingga sebuah perayap mempertahankan meminta rendah-nilai, nyaris duplikat, atau halaman kosong dan menghabiskan anggaran perayapannya sebelum ini mencapai Anda konten sebenarnya. Google istilah untuk mendasari fenomena adalah “infinite spaces” (terjemahan) “ruang tak terbatas” (atau “infinite URL spaces” (terjemahan) “ruang URL tak terbatas”).
key kata adalah secara efektif. sebuah jebakan tidak memiliki untuk menjadi benar-benar tak terbatas — “de facto tak terbatas” (terjemahan) “de facto tak terbatas” adalah cukup. sebuah beberapa filter itu digabungkan di apa pun urutan menghasilkan sebuah sangat besar jumlah URL untuk yang sama segelintir dari produk. masalah bukan itu apa pun tunggal URL adalah buruk; ini adalah kombinatorial ledakan.
dan di sini’s mengapa perayap dapat’t hanya menghindari ini. sebagai Google berfaset-navigasi dokumentasi menyatakan ini, “Because the URLs created for the faceted navigation seem to be novel and crawlers can’t determine whether the URLs are going to be useful without crawling first, the crawlers will typically access a very large number of faceted navigation URLs.” (terjemahan) “karena URL dibuat untuk navigasi berfaset tampak untuk menjadi baru dan perayap dapat’t determine apakah URL adalah akan untuk menjadi berguna tanpa perayapan terlebih dahulu, perayap akan biasanya akses sebuah sangat besar angka dari navigasi berfaset URL.” Gary Illyes menyatakan yang sama hal lebih sederhana: setelah sebuah perayap menemukan sekumpulan dari URL, ini dapat’t menilai apakah itu URL space adalah baik sampai ini memiliki dirayapi sebuah besar bagian dari ini. jebakan berfungsi justru karena bot memiliki untuk masuk ke ini untuk cari tahu ini adalah sebuah jebakan.
mengapa jebakan laba-laba hurt SEO
kerugiannya adalah biaya peluang. Google menjelaskannya secara tegas: “If crawling is spent on useless URLs, the crawlers have less time to spend on new, useful URLs.” (terjemahan) “jika perayapan adalah dihabiskan pada tidak berguna URL, perayap memiliki lebih sedikit waktu untuk spend pada baru, berguna URL.” web, sebagai Google mencatat, adalah “a nearly infinite space, exceeding Google’s ability to explore and index every available URL” (terjemahan) “sebuah nearly tak terbatas space, exceeding Google ability untuk explore dan mengindeks setiap available URL” — sehingga sebuah terbatas perayapan kapasitas dihabiskan pada Anda sampah adalah konten itu tidak pernah mendapatkan ditemukan.
ini adalah sebuah perayapan-anggaran masalah, dan anggaran perayapan adalah sebuah efficiency concern, bukan sinyal peringkat. lebih perayapan tidak lift Anda peringkat — sebagai saya telah menulis di saya anggaran crawling guide, “More crawling doesn’t mean you’ll rank better, but if your pages aren’t crawled and indexed they aren’t going to rank at all.” (terjemahan) “lebih perayapan tidak berarti Anda’ll peringkat lebih baik, tetapi jika Anda halaman tidak dirayapi dan terindeks mereka tidak akan untuk peringkat sama sekali.” itu nyata dampaknya: sebuah buruk cukup jebakan pada sebuah situs besar dapat membiarkan benar-benar penting halaman terjebak di “ditemukan – saat ini belum diindeks” (terjemahan) “ditemukan – saat ini bukan terindeks” karena anggaran dialihkan untuk sampah.
siapa sebenarnya perlu untuk peduli? Google sendiri perayapan-anggaran panduan membatasi cakupannya sendiri untuk besar situs (1 juta+ unik halaman, berubah setidaknya setiap minggu), medium-atau-larger situs (10 000+ unik halaman) itu perubahan setiap hari, dan situs mana pun dengan sebuah besar porsi -nya URL berada di “ditemukan – saat ini belum diindeks” (terjemahan) “ditemukan – saat ini bukan terindeks” — ditambah, oleh perluasan, situs ecommerce dengan berfaset catalogs, mana adalah cara tercepat untuk mencapai itu angka. Google panggilan ini perkiraan kasar, bukan persis ambang. sebagian besar situs kecil mendapatkan dirayapi sepenuhnya tanpa masalah dan dapat berhenti membaca di sini. jebakan skenario adalah persis kasus di mana anggaran perayapan melakukan penting — dan Google membingkai seluruh konsep sekitar perayapan kapasitas (seberapa banyak server Anda dapat tampung) dan perayapan permintaan (seberapa banyak Google ingin untuk perayapan), bukan sebuah tetap kuota diberikan untuk setiap situs.
ini bukan sebuah baru atau langka masalah
Google menamai masalah ini “ruang tak terbatas” pada 2008, dalam artikel berjudul untuk infinity dan
beyond? tidak!, menyoroti endless kalender dan dipasang penelusuran-hasil filter sebagai
sumber, dan menyebut robots.txt dan nofollow sebagai perbaikan. (itu artikel adalah lama
dan JS-rendered, sehingga I’m paraphrasing ini alih-alih quoting ini.)
apa’s striking adalah itu ini tidak pernah dialihkan away — ini membesar. Google ran sebuah perayapan December blog seri pada navigasi berfaset kembali di December 2024, dan lebih baru-baru ini, pada sebuah Search Off Record episode merangkum Google 2025 tahun-akhir perayapan laporan, Gary Illyes merinci apa’s sebenarnya mendorong perayapan waste: navigasi berfaset dan parameter tindakan bersama-sama menyumbang untuk sekitar 75% dari masalah perayapan Google sees — 50% dari navigasi berfaset, 25% dari tindakan parameter (parameter URL itu pemicu sebuah tindakan alih-alih berubah halaman konten). sisanya seperempat adalah hal-hal yang lebih kecil: tentang 10% dari “irrelevant” (terjemahan) “irrelevant” parameter seperti ID sesi dan UTM tag, 5% dari plugin dan widget yang menghasilkan bermasalah URL, dan 2% dari lainnya kasus khusus seperti dikodekan ganda URL. Eighteen years pada, navigasi berfaset adalah masih, oleh sebuah selisih besar, tunggal biggest sumber dari masalah.
jenis dari jebakan laba-laba
katalog, dengan satu-baris petunjuk untuk setiap. (melihat Cheat Sheets tab untuk yang cocok satu-baris perbaikan.)
- navigasi berfaset / filter kombinasi — #1 jebakan. pengguna memilih sebuah beberapa filter; perayap mencoba setiap permutasi. Google: “This often means a very large number of possible combinations of filters, which translates to a very large number of possible URLs.” (terjemahan) “ini sering berarti sebuah sangat besar angka dari mungkin kombinasi dari filter, mana translates untuk sebuah sangat besar angka dari mungkin URL.”
- kalender tak berujung — “next month / next year” (terjemahan) “bulan berikutnya / tahun berikutnya” tautan dengan tidak horizon. sebuah bot dapat masuk forward indefinitely (Illyes’ memorable contoh adalah sebuah kalender widget generating sebuah valid URL untuk tahun 3000).
- ID sesi di URL —
?sid=,jsessionid, etc. mint sebuah unik URL per pengunjung untuk identical konten. - pengurutan / urutan parameter —
?sort=price,?order=desc. Google menyatakan “differently sorted versions of the same page” (terjemahan) “differently sorted versi dari yang halaman yang sama” shouldn’t menjadi dirayapi. - tak terbatas scroll / looping paginasi — endless “load more” (terjemahan) “muat lebih” / “next” (terjemahan) “berikutnya” itu tidak pernah terminates atau duplikat ditautkan konten. Google flags “infinite scrolling pages that duplicate information on linked pages.” (terjemahan) “tak terbatas scrolling halaman itu duplikat informasi pada ditautkan halaman.”
- loop pengalihan / panjang chains — sebuah → B → sebuah selamanya, sering dari sebuah mistyped rewrite aturan.
- relatif-URL / jalur ledakan — malformed relatif tautan yang terus appending
directories (
/abc/def/abc/def/abc/def/…) sampai server memberikan up. - penelusuran internal hasil halaman — penelusuran URL diperlakukan sebagai dapat dirayapi konten; sebuah sitewide penelusuran pada satu letter dapat mint sebuah juta halaman.
- Dynamic / “magic” (terjemahan) “ajaib” URL — sebuah URL itu accepts sebarang text atau IDs dan masih
mengembalikan
200. - pelacakan / “tindakan” (terjemahan) “tindakan” parameter — UTM tag dan tambahkan-untuk-cart/compare tindakan buat de-facto-tak terbatas URL varian (ini adalah “tindakan parameter” (terjemahan) “parameter tindakan” half dari Google 75%).
cara Deteksi jebakan laba-laba
- Mulailah dari log server—ini petunjuk tercepat. log menunjukkan dengan persis URL mana yang diminta bot dan seberapa sering. Tidak ada ambang universal tetap untuk menentukan jumlah yang “too much” (terjemahan) “terlalu banyak”; tandanya ialah satu pola mengambil porsi permintaan perayapan yang sangat timpang concentrated pada satu sampah URL pola dibandingkan dengan pola dasar umum situs Anda sendiri, bukan sebuah spesifik persentase itu berlaku di semua situs. (Yoast founder Joost de Valk memiliki menulis itu di miliknya sendiri experience ini adalah “not uncommon” (terjemahan) “bukan hal yang tidak lazim” untuk sebuah jebakan untuk tampung up 20-30% atau lebih dari semua melakukan perayapan — sebuah berguna gut-periksa untuk bagaimana skewed sebuah nyata jebakan dapat mendapatkan, bukan sebuah Tolok ukur untuk uji situs Anda terhadap.) (melihat log file analysis.)
- Run sebuah perayapan — Screaming Frog, Ahrefs situs audit, Sitebulb. Watch untuk sebuah perayapan yang tidak akan finish, URL yang terus getting longer (jalur ledakan), atau sebuah exploding jumlah dari kombinasi parameter.
- Google Search Console — sebuah ballooning “ditemukan – saat ini belum diindeks” (terjemahan) “ditemukan – saat ini bukan terindeks” jumlah, sebuah swelling soft 404 laporan (autogenerated halaman kosong), perayapan Stats skewed toward sampah jalur, atau “Googlebot encountered an extremely high number of URLs” (terjemahan) “Googlebot encountered sebuah extremely tinggi angka dari URL” message.
- sebuah situs/indeks sanity periksa — ketika sebuah tiny fraction dari terindeks URL sebenarnya drive traffic, Anda mungkin feeding sebuah jebakan.
- penelusuran operators —
site:ditambahinurl:pada sebuah known parameter string. - Bing — situs Scan dan perayapan Control di Bing Webmaster alat.
cara memperbaiki dan mencegah jebakan laba-laba
Urutan berikut bergerak dari perbaikan terbaik hingga pilihan terakhir. Urutannya penting karena setiap kontrol menjalankan tugas yang berbeda.
- Perbaikan terbaik: jangan buat URL tersebut. Hentikan pembuatan URL yang dapat dirayapi dari sumbernya. Pilihan paling bersih ialah pemfilteran berbasis JavaScript atau fragmen, sehingga filter memperbarui halaman tanpa membuat alamat baru yang dapat dirayapi. Dokumentasi navigasi berfaset Google dan SEJ sama-sama menyarankan pemindahan parameter faset ke fragmen URL. Semua pilihan berikutnya hanyalah penanganan setelah URL terlanjur dibuat.
- Pilih faset yang layak diindeks dan blokir sisanya. Google: “Oftentimes there’s no good reason to allow crawling of filtered items, as it consumes server resources for no or negligible benefit.” (terjemahan) “Sering kali tidak ada alasan yang baik untuk mengizinkan perayapan item yang difilter karena hal itu menghabiskan sumber daya server dengan manfaat yang tidak ada atau sangat kecil.” Izinkan satu daftar tanpa filter beserta halaman item individual, lalu blokir ruang kombinasi filter.
- Gunakan
robots.txtuntuk melarang pola jebakan pada ruang yang tidak perlu diindeks. Ini rekomendasi utama Google untuk URL filter dan pengurutan yang tidak berguna. Catatan: robots.txt memblokir perayapan, bukan pengindeksan. - Gunakan
noindexuntuk menghapus URL sampah yang sudah diindeks. Jangan langsung memblokirnya dengan robots.txt karena Google harus dapat merayapi halaman untuk melihatnoindex. Urutan yang benar: biarkan halaman dapat dirayapi, tunggunoindexmenghapusnya dari indeks, kemudian jika perlu larang perayapan berikutnya melalui robots.txt. Jika diblokir terlalu dini,noindextidak pernah terbaca. - Kembalikan
404/410untuk kombinasi filter kosong. Google: “Return an HTTP 404 status code when a filter combination doesn’t return results.” (terjemahan) “Kembalikan kode status HTTP 404 ketika kombinasi filter tidak menghasilkan apa pun.” dan “Eliminate soft 404 errors. Soft 404 pages will continue to be crawled, and waste your budget.” (terjemahan) “Hilangkan kesalahan soft 404. Halaman soft 404 akan terus dirayapi dan menghabiskan anggaran Anda.” - Gunakan
rel="canonical"untuk menggabungkan URL hasil pengurutan atau varian ke versi bersih. Ini berguna, tetapi lambat dan hanya petunjuk, bukan perintah. Menurut Google, langkah ini “may, over time, decrease the crawl volume of non-canonical versions of those URLs.” (terjemahan) “seiring waktu dapat mengurangi volume perayapan versi nonkanonis URL tersebut.” Namun, kanonis tidak menghentikan perayapan; Bing juga mengingatkan bahwa “relying on canonical tag is not necessarily the perfect solution to fix all your duplicate content problems.” (terjemahan) “mengandalkan tag kanonis belum tentu menjadi solusi sempurna bagi semua masalah konten duplikat.” - Tambahkan
rel="nofollow"pada tautan filter. Cara ini hanya berfungsi jika diterapkan pada setiap tautan, baik internal maupun eksternal. Google menjelaskan bahwa setiap jangkar yang menuju URL tertentu harus memakai atribut rel=nofollow agar pengendalian tersebut efektif. - Sesuaikan per jenis jebakan: batasi tautan kalender pada rentang waktu yang wajar dan beri noindex pada tanggal yang terlalu jauh; keluarkan ID sesi dari URL dengan memakai cookie; perbaiki loop pengalihan agar URL sumber langsung menuju tujuan akhir; gunakan URL absolut dan aturan server untuk menghentikan ledakan tautan relatif; serta beri noindex atau larangan pada halaman penelusuran internal.
jika Anda pertahankan clean parameter URL dan sebuah stable parameter urutan, Anda juga hindari minting needless varian sejak awal. Perhatikan bahwa Google retired -nya URL parameter alat di 2022, sehingga robots.txt / kanonis / noindex now carry itu muat pada Google side. pada Bing, equivalent adalah URL Normalization — Anda petunjuk Bing mana parameter untuk ignore.
satu nuance: jangan break legitimate paginasi
di atas-correction jebakan adalah nyata too. ketika people panic tentang “tak terbatas” (terjemahan) “tak terbatas” paginasi, mereka sering blokir atau canonicalize semua paginated halaman — dan buat baru masalah. sebagai saya telah menulis tentang paginasi, “Blocking the pages from crawling will again make it more difficult to find content on the website, end up orphaning pages,” (terjemahan) “memblokir halaman dari perayapan akan again membuat ini lebih difficult untuk temukan konten pada situs web, akhir up orphaning halaman,” dan canonicalizing setiap halaman untuk halaman pertama “makes it harder for search engines to find and index valuable content, and also cuts off the flow of PageRank.” (terjemahan) “membuat ini harder untuk mesin pencari untuk temukan dan indeks bernilai konten, dan juga cuts off flow dari PageRank.” Distinguish sebuah genuine tak terbatas/looping paginasi jebakan dari legitimate terbatas paginasi — pertahankan terbatas versi dapat dirayapi.
di mana ini sits
jebakan laba-laba adalah sebuah perayapan-efficiency masalah, sehingga mereka aktif berikutnya untuk anggaran perayapan (apa jebakan drains) dan log file analysis (bagaimana Anda menangkap ini). jika Anda telah dibaca perayapan hub, ini adalah kegagalan mode itu membuat anggaran perayapan layak managing pada situs di mana ini penting.
AI summary
sebuah condensed tampung pada lanjutan versi:
- jebakan laba-laba = sebuah jebakan perayap = struktur yang menghasilkan secara efektif tak terbatas URL, sehingga perayap menyia-nyiakan anggaran pada sampah yang nyaris duplikat. Google name untuk ini adalah “ruang tak terbatas.”
- ini tidak memiliki untuk menjadi benar-benar tak terbatas — kombinatorial (“de facto infinite” (terjemahan) “secara de facto tak terbatas”) adalah cukup. perayap dapat’t petunjuk sebuah URL adalah sampah tanpa perayapan ini, sehingga mereka masuk di.
- ** biaya adalah biaya peluang:** “If crawling is spent on useless URLs, the crawlers have less time to spend on new, useful URLs.” (terjemahan) “jika perayapan adalah dihabiskan pada tidak berguna URL, perayap memiliki lebih sedikit waktu untuk spend pada baru, berguna URL.” ini adalah sebuah perayapan-anggaran efficiency masalah, bukan sinyal peringkat.
- siapa cares: besar / baru / yang cepat berubah / situs ecommerce. situs kecil biasanya jangan.
- bukan baru, hanya membesar: Google named ini di 2008; Gary Illyes (Feb 2026, pada Google 2025 tahun-akhir perayapan laporan) put navigasi berfaset + tindakan parameter ≈ 75% dari -nya masalah perayapan (50% faset, 25% tindakan parameter, ditambah lebih kecil shares dari parameter pelacakan dan plugin).
- jenis: navigasi berfaset, kalender tak berujung, ID sesi, pengurutan/parameter pelacakan, tak terbatas scroll/paginasi loops, loop pengalihan, ledakan URL relatif, penelusuran internal, “magic” (terjemahan) “ajaib” URL.
- Deteksi: log terlebih dahulu— satu pola mengambil porsi yang tidak proporsional dari melakukan perayapan dibandingkan dengan Anda sendiri pola dasar, bukan persentase tetap — lalu perayapan alat, GSC (“ditemukan – saat ini belum diindeks” (terjemahan) “ditemukan – saat ini bukan terindeks”, soft 404, “extremely high angka dari URL” (terjemahan) “extremely tinggi angka dari URL”), Bing situs Scan.
- perbaikan, di urutan: hentikan pembuatan URL (JS/fragment filter) → choose mana
faset untuk indeks, blokir sisanya → robots.txt untuk sampah →
noindexuntuk hapus sudah-terindeks sampah (let ini deindex sebelum Anda robots-blokir) →404/410untuk kosong hasil → kanonis/nofollow sebagai lambat hints. Robots.txt ≠ noindex ≠ kanonis — sequencing penting.
dokumentasi resmi
Sumber primer dokumentasi pada tak terbatas spaces, navigasi berfaset, dan perayapan anggaran.
- To infinity and beyond? No! — artikel asli tahun 2008 yang menamai masalah “infinite spaces,” (terjemahan) “ruang tak terbatas”, dengan contoh kalender tanpa akhir dan filter bertumpuk, serta perbaikan robots.txt dan
nofollow. - Mengelola perayapan URL navigasi berfaset — sumber utama terkini tentang alasan faset dapat dirayapi berlebihan, kapan harus memblokirnya, dan praktik pengindeksan seperti pemisah, urutan filter stabil,
404untuk hasil kosong, kanonis, dan nofollow. URL lamasearch/docs/crawling-indexing/crawling-managing-faceted-navigationkini dialihkan 301 ke halaman ini. - Praktik terbaik (dan lima praktik terburuk) navigasi berfaset — artikel tahun 2014 yang menunjukkan bahwa navigasi berfaset telah lama dikenal sebagai sumber jebakan perayapan.
- Pengelolaan anggaran perayapan — menjelaskan “nearly tak terbatas space” (terjemahan: “ruang yang nyaris tak terbatas”), model kapasitas dan permintaan perayapan, ukuran situs yang menjadi sasaran panduan, duplikat gulir tanpa akhir, versi berurutan berbeda, dan penanganan soft 404. Halaman ini juga memuat materi dari panduan lama bagi pemilik situs besar yang sekarang dialihkan ke sini.
- Crawling December: navigasi berfaset (2024) — artikel Google khusus tentang navigasi berfaset pada Desember 2024; rincian masalah perayapan Februari 2026 merupakan sumber yang terpisah.
- Bantuan GSC: Googlebot menemukan jumlah URL yang sangat besar — sinyal langsung di produk bahwa situs mungkin memiliki jebakan.
Bing / Microsoft
- Better daripada kanonis; URL Normalization — Bing stance itu “the real number of URLs on the Internet is infinity,” (terjemahan) “jumlah URL sebenarnya di Internet tidak terbatas,” kalender “Next Day” (terjemahan) “Hari Berikutnya” contoh, dan URL Normalization sebagai Bing diutamakan perbaikan untuk parameter duplikat.
- Bing Webmaster alat — situs Scan — pada-permintaan situs audit.
- Bing Webmaster alat — Block URLs — temporarily blokir URL pola (pair dengan sebuah NOINDEX meta tag).
- Bing Webmaster alat — perayapan Control — throttle Bingbot.
Kutipan dari sumber
tercatat statements dari Google dan Bing. setiap tautan adalah sebuah deep tautan itu berpindah untuk quoted passage pada sumber halaman.
Google — navigasi berfaset ( #1 jebakan)
- “This often means a very large number of possible combinations of filters, which translates to a very large number of possible URLs.” (terjemahan) “Hal ini sering menghasilkan sangat banyak kemungkinan kombinasi filter, yang pada akhirnya menciptakan sangat banyak kemungkinan URL.” berpindah untuk quote
- “Because the URLs created for the faceted navigation seem to be novel and crawlers can’t determine whether the URLs are going to be useful without crawling first, the crawlers will typically access a very large number of faceted navigation URLs.” (terjemahan) “Karena URL navigasi berfaset tampak baru dan perayap tidak dapat mengetahui kegunaannya tanpa merayapi terlebih dahulu, perayap biasanya akan mengakses sangat banyak URL navigasi berfaset.” berpindah untuk quote
- “If crawling is spent on useless URLs, the crawlers have less time to spend on new, useful URLs.” (terjemahan) “Jika perayapan dihabiskan untuk URL yang tidak berguna, perayap memiliki lebih sedikit waktu untuk URL baru yang bermanfaat.” berpindah untuk quote
- “Oftentimes there’s no good reason to allow crawling of filtered items, as it consumes server resources for no or negligible benefit.” (terjemahan) “Sering kali tidak ada alasan yang baik untuk mengizinkan perayapan item yang difilter karena hal itu menghabiskan sumber daya server dengan manfaat yang tidak ada atau sangat kecil.” berpindah untuk quote
- “Return an HTTP 404 status code when a filter combination doesn’t return results.” (terjemahan) “Kembalikan kode status HTTP 404 ketika kombinasi filter tidak menghasilkan apa pun.” berpindah untuk quote
- pada kanonis: ini “may, over time, decrease the crawl volume of non-canonical versions of those URLs.” (terjemahan) “dapat, di atas waktu, decrease perayapan volume dari non-kanonis versi dari itu URL.” berpindah untuk quote
- Tentang nofollow: “Every anchor pointing to a specific URL” (terjemahan) “Setiap jangkar yang mengarah ke URL tertentu” harus memiliki atribut rel=nofollow agar cara ini efektif. berpindah untuk quote
Google — anggaran perayapan & tak terbatas spaces
- “The web is a nearly infinite space, exceeding Google’s ability to explore and index every available URL.” (terjemahan) “ web adalah sebuah nearly tak terbatas space, exceeding Google ability untuk explore dan mengindeks setiap available URL.” berpindah untuk quote
- jangan perayapan “infinite scrolling pages that duplicate information on linked pages, or differently sorted versions of the same page.” (terjemahan) “tak terbatas scrolling halaman itu duplikat informasi pada ditautkan halaman, atau differently sorted versi dari yang halaman yang sama.” berpindah untuk quote
- “Eliminate soft 404 errors. Soft 404 pages will continue to be crawled, and waste your budget.” (terjemahan) “Eliminate soft 404 errors. soft 404 halaman akan continue untuk menjadi dirayapi, dan waste Anda anggaran.” berpindah untuk quote
Gary Illyes, Google (Search Off Record, merangkum Google 2025 tahun-akhir perayapan laporan — dilaporkan oleh Search Engine Land, Feb 2026)
- navigasi berfaset dan parameter tindakan “accounted for about 75% of the problems” (terjemahan) “accounted untuk tentang 75% dari masalah” Google encounters dengan perayapan — broken down di yang sama artikel sebagai 50% navigasi berfaset, 25% parameter tindakan, 10% “irrelevant” (terjemahan) “irrelevant” pelacakan/ID sesi parameter, 5% plugin/widget, dan 2% lainnya kasus khusus seperti dikodekan ganda URL. berpindah untuk quote
- pada mengapa perayap dapat’t hindari jebakan: “Once it discovers a set of URLs, it cannot make a decision about whether that URL space is good or not unless it crawled a large chunk of that URL space.” (terjemahan) “setelah ini menemukan sekumpulan dari URL, ini tidak dapat membuat sebuah decision tentang apakah itu URL space adalah baik atau bukan unless ini dirayapi sebuah besar bagian dari itu URL space.” berpindah untuk quote
Bing / Microsoft — URL Normalization
- “the real number of URLs on the Internet is infinity.” (terjemahan) “ nyata jumlah URL pada Internet adalah infinity.” berpindah untuk quote
- “relying on canonical tag is not necessarily the perfect solution to fix all your duplicate content problems.” (terjemahan) “relying pada tag kanonis adalah bukan necessarily perfect solusi untuk perbaikan semua Anda duplikat konten masalah.” berpindah untuk quote
Deteksi-dan-perbaikan checklist
Deteksi
- Pull server log dan cari satu URL pola mengambil sebuah disproportionate, lopsided porsi bot hits dibandingkan dengan pola dasar normal situs Anda — tidak tetap universal persentase defines “too banyak.” (terjemahan) “too banyak.”
- Run sebuah perayapan (Screaming Frog / Ahrefs situs audit / Sitebulb) dan watch untuk sebuah perayapan yang tidak akan finish, URL yang terus getting longer, atau exploding parameter counts.
- periksa GSC: ballooning “ditemukan – saat ini belum diindeks” (terjemahan) “ditemukan – saat ini bukan terindeks”, sebuah swelling soft 404 laporan, perayapan Stats skewed untuk sampah jalur, “extremely high angka dari URL” (terjemahan) “extremely tinggi angka dari URL” message.
- Sanity-periksa terindeks vs. traffic-mendorong URL — sebuah tiny fraction earning traffic sinyal sebuah jebakan.
- Spot-periksa dengan
site:+inurl:pada sebuah known parameter string. - periksa Bing via situs Scan / perayapan Control.
perbaikan (di urutan — sequence penting)
- hentikan pembuatan URL di mana Anda dapat (JS/fragment-based pemfilteran).
- Decide mana faset deserve pengindeksan; blokir sisanya.
- jika sampah adalah bukan yet terindeks:
robots.txtdisallow jebakan pola. - jika sampah adalah sudah terindeks: pertahankan ini dapat dirayapi, tambahkan
noindex, let ini deindex, lalu (optionally) robots.txt-disallow. jangan blokir terlebih dahulu. - kembalikan
404/410untuk kosong filter kombinasi; eliminate soft 404s. - gunakan
rel=canonicaluntuk consolidate sorted/varian URL (lambat hint, bukan sebuah stop). - gunakan
rel=nofollowhanya jika applied untuk setiap tautan untuk itu URL. - pertahankan sebuah stable parameter urutan dan clean parameter untuk hindari minting varian.
- Per-jebakan: cap kalender, strip ID sesi (gunakan cookies), perbaikan loop pengalihan, gunakan absolute URL, noindex/disallow internal penelusuran.
mental models
1. “De facto infinite” (terjemahan) “Secara de facto tak terbatas” beats “truly infinite.” (terjemahan) “benar-benar tak terbatas.” sebuah jebakan tidak perlu untuk menjadi secara harfiah endless. segelintir dari filter itu digabungkan di apa pun urutan produces sebuah sangat besar URL jumlah untuk yang sama konten. ini adalah kombinatorial ledakan, bukan apa pun tunggal buruk URL, itu melakukan kerugiannya.
2. mengapa perayap dapat’t dodge ini — biaya dari menemukan out. sebuah perayap dapat’t petunjuk sebuah URL adalah sampah tanpa mengambil ini. sebagai Illyes put ini, ini dapat’t menilai apakah sebuah URL space adalah baik “unless ini crawled besar bagian dari itu URL space.” (terjemahan) “unless ini dirayapi sebuah besar bagian dari itu URL space.” jebakan berfungsi karena bot memiliki untuk masuk di untuk learn ini adalah sebuah jebakan.
3. drain adalah biaya peluang, bukan sebuah penalty. Nothing tentang sebuah jebakan adalah sebuah peringkat penalty. biaya adalah itu anggaran dihabiskan pada tidak berguna URL adalah anggaran bukan dihabiskan pada baru, berguna ones. terbatas perayapan kapasitas, tak terbatas sampah — Anda halaman sebenarnya lose race untuk attention. ini adalah mengapa ini bites besar/baru/ecommerce situs dan ignores kecil ones.
4. Three controls, three jobs — dan sebuah urutan.
robots.txt stops perayapan tetapi bukan pengindeksan. noindex menghapus dari indeks tetapi
perlu halaman untuk menjadi dapat dirayapi untuk menjadi terlihat. canonical adalah petunjuk yang lambat, bukan sebuah stop.
sehingga untuk hapus sudah-terindeks sampah: allow perayapan → noindex → let ini deindex → lalu
robots.txt. blokir pertama dan noindex adalah tidak pernah dibaca.
5. Prevention beats patching. terbaik perbaikan adalah untuk tidak pernah mint URL — JS/fragment filter, tidak ID sesi di URL, bounded kalender. kanonis-setelah—fact adalah weakest perbaikan karena perayapan masih terjadi.
jebakan jenis → satu-baris perbaikan
| jebakan | apa ini looks seperti | satu-baris perbaikan |
|---|---|---|
| navigasi berfaset / filter | setiap filter combo adalah URL baru; counts explode | JS/fragment filter; indeks sebuah chosen beberapa, blokir sisanya |
| kalender tak berujung | ”next month” (terjemahan) “bulan berikutnya” selamanya (ke tahun 3000) | cap horizon; noindex/robots-blokir distant dates |
| ID sesi di URL | ?sid= / jsessionid — unik URL per pengunjung | strip dari URL; gunakan cookies sebagai gantinya |
| pengurutan / urutan parameter | ?sort=price, ?order=desc duplikat | kanonis untuk clean URL, atau robots.txt-disallow |
| tak terbatas scroll / paginasi loops | endless “load more” (terjemahan) “muat lebih” / “next” (terjemahan) “berikutnya” itu duplikat | paginate finitely dengan nyata <a href>; jangan loop |
| loop pengalihan / chains | sebuah → B → sebuah, atau panjang hops | pengalihan sumber langsung untuk akhir destination |
| ledakan URL relatif | /abc/def/abc/def/… mempertahankan growing | gunakan absolute URL; perbaikan malformed relatif tautan |
| penelusuran internal halaman | /?s= URL diperlakukan sebagai konten | noindex dan/atau disallow penelusuran jalur |
| ”Magic” (terjemahan) “Ajaib” / dynamic URL | sebarang text/IDs masih kembalikan 200 | kembalikan 404; validate sebelum serving 200 |
| pelacakan / tindakan parameter | UTM, tambahkan-untuk-cart/compare varian | strip/ignore parameter; stable param urutan |
Quick reference
** deteksi signature:** satu sampah pola mengambil sebuah disproportionate, lopsided share dari semua melakukan perayapan dibandingkan dengan situs Anda sendiri’s pola dasar — Tidak ada tidak tetap universal persentase.
** 75% breakdown (Google Gary Illyes, pada 2025 tahun-akhir perayapan laporan, dilaporkan Feb 2026):** navigasi berfaset + tindakan parameter ≈ 75% dari masalah perayapan (50% navigasi berfaset, 25% tindakan parameter, 10% pelacakan/ID sesi parameter, 5% plugin/ widget, 2% lainnya kasus khusus).
apa setiap control melakukan
| Control | menghentikan perayapan? | Stops pengindeksan? |
|---|---|---|
robots.txt disallow | ya | tidak |
noindex (perlu perayapan akses) | tidak | ya |
rel=canonical | tidak | Consolidates (lambat hint) |
rel=nofollow (setiap tautan) | Discourages | tidak |
404 / 410 | Drops di atas waktu | ya (eventually) |
hilang: Google parameter URL alat (retired 2022). Bing equivalent: URL Normalization.
alat untuk menemukan dan fixing jebakan
- server log file analysis — ground truth, dan cara tercepat untuk spot sebuah jebakan (cari satu pola dominating bot hits). alat: Screaming Frog log File Analyser, atau pipe log ke BigQuery / sebuah log platform. (melihat log file analysis.)
- Ahrefs situs audit — simulates sebuah perayapan dan surfaces rantai pengalihan, parameter bloat, nyaris duplikat URL spaces, dan melakukan perayapan itu balloon — klasik jebakan fingerprints.
- Screaming Frog SEO Spider — sebuah desktop perayapan itu exposes jalur ledakan, loop pengalihan, dan exploding kombinasi parameter; watch untuk sebuah perayapan itu tidak akan terminate.
- Google Search Console — Statistik Perayapan untuk melihat dominasi jalur sampah, laporan Halaman dengan status “Discovered – currently not indexed” (terjemahan) “Ditemukan—saat ini belum diindeks” dan soft 404, serta pesan “extremely high number of URLs” (terjemahan) “jumlah URL yang sangat besar”.
- Bing Webmaster alat — situs Scan, perayapan Control, dan URL Normalization (petunjuk Bing mana parameter untuk ignore).
- pemeriksaan URL (GSC) — pastikan bagaimana satu mencurigakan URL adalah dirayapi dan terindeks.
KPI utama: porsi sampah dari perayapan
jebakan laba-laba tidak tampilkan up sebagai satu alert — ini menampilkan up sebagai sebuah share dari Anda perayapan akan tempat lain ini shouldn’t. honesty periksa pertama: ini Metrik penting terutama pada besar, yang cepat berubah, atau berfaset-katalog situs; sebuah situs kecil’s perayapan adalah jarang skewed cukup untuk menjadi layak pelacakan.
sampah-pola porsi perayapan permintaan
- Metrik — berapa bagian permintaan Googlebot atau Bingbot yang telah diverifikasi dalam log server mengenai satu pola URL mencurigakan—parameter faset, ID sesi, atau jalur kalender—dibandingkan dengan konten nyata yang dapat diindeks.
- Maknanya — metrik ini membedakan struktur yang benar-benar menguras anggaran dari struktur yang hanya berpotensi melakukannya. Satu pola yang mengambil bagian besar dan tidak proporsional dari seluruh permintaan perayapan merupakan tanda jebakan.
- Cara mengambil data — jalankan log mentah melalui Log File Analyzer, kelompokkan permintaan menurut pola URL, lalu bandingkan jangka waktu yang sama dengan laporan Statistik Perayapan GSC menurut jalur URL.
- Tolok ukur atau rentang realistis — tidak ada ambang universal yang jujur. Nilainya bergantung pada arsitektur situs dan jumlah pola URL yang ada. Jadikan pola dasar situs Anda sendiri sebagai acuan dan turunkan nilainya dari waktu ke waktu, bukan mengejar angka mutlak.
- Frekuensi — periksa segera setelah menemukan dugaan jebakan atau menerapkan perbaikan; untuk sebagian situs besar, pemeriksaan bulanan cukup pada waktu lain. Periksa kembali setiap kali menambahkan filter, pengurutan, atau bagian dinamis baru.
”ditemukan / Crawled – saat ini belum diindeks” (terjemahan) “ditemukan / dirayapi – saat ini bukan terindeks” jumlah
- Metrik — jumlah dari URL berada di GSC’s halaman laporan di bawah “Discovered – currently not indexed” (terjemahan) “ditemukan – saat ini bukan terindeks” atau “Crawled – currently not indexed.” (terjemahan) “dirayapi – saat ini bukan terindeks.”
- apa ini memerintahkan Anda — sebuah rising jumlah, terutama bersama sebuah known jebakan pola, adalah consistent dengan Google menemukan URL ini tidak pertimbangkan layak perayapan/indeks anggaran — ini adalah sebuah symptom, bukan proof dari sebuah jebakan pada -nya sendiri, since cukup dari things besides jebakan cause ini.
- cara pull ini — GSC → halaman laporan → filter oleh “belum diindeks” (terjemahan) “bukan terindeks” alasan; sample segelintir dari URL dan periksa apakah mereka cocok jebakan pola Anda investigating.
- Tolok ukur / realistic range — Situational, sama caveat sebagai di atas — track trend pada situs Anda sendiri alih-alih comparing untuk anyone lain’s jumlah.
- Frekuensi — Monthly, atau right setelah sebuah perbaikan ships (ini jumlah lags log perayapan Metrik di atas oleh days untuk weeks, sehingga jangan expect ini untuk perpindahan immediately).
temukan dan fence di sebuah jebakan pola
ini adalah starting poin, bukan finished alat — baca keluarannya sebelum trusting ini, dan adjust field positions/jalur untuk cocok Anda sendiri log format.
Grep server log untuk sebuah mencurigakan URL pola
poin ini di sebuah raw akses log (Apache/Nginx combined format) untuk jumlah bagaimana banyak permintaan sebuah mencurigakan pola adalah pulling, dan melihat apakah mereka’re sebenarnya coming dari Googlebot’s declared pengguna-agent string. sebuah pengguna-agent string alone dapat menjadi spoofed — pastikan IP dengan Googlebot Verifier sebelum treating hits sebagai nyata perayapan waste dan bukan spoofed traffic:
# Count requests to a suspect pattern (e.g. a filter parameter) by user-agent
grep -i "googlebot" access.log | grep -oE '"[A-Z]+ [^ ]*\?[^ "]*calendar[^ "]*' | wc -l
# Same, but for a session-ID pattern
grep -i "googlebot" access.log | grep -oE '"[A-Z]+ [^ "]*[?&](sid|jsessionid)=[^ "&]*' | wc -l
# Total Googlebot requests in the same window, for the share calculation
grep -ci "googlebot" access.logDivide pola jumlah oleh total untuk mendapatkan porsi sampah described di Cara mengukur tab.
Regex untuk menangkap klasik tak terbatas-space parameter
sebuah starting filter list untuk faset, sorting, ID sesi, dan pelacakan/tindakan parameter — extend ini dengan whatever situs Anda sendiri sebenarnya generates:
[?&](sort|order|page|sid|jsessionid|phpsessid|utm_[a-z]+|ref|affid|add_to_cart|compare)=Run ini terhadap sebuah perayapan export atau log sample untuk flag candidate jebakan URL sebelum Anda decide apakah untuk robots.txt-disallow, canonicalize, atau noindex masing-masing — jangan blokir oleh pola cocok alone tanpa memeriksa sebuah sample dari matched URL terlebih dahulu.
Screaming Frog: menangkap sebuah perayapan yang tidak akan terminate
Tidak ada tidak tunggal ajaib setting, tetapi three configuration choices turn Screaming Frog ke sebuah jebakan detector alih-alih sebuah alat itu hanya hangs:
- Configuration → Spider → Limits — set sebuah URL perayapan limit dan sebuah max perayapan depth sehingga sebuah genuine tak terbatas space stops perayapan alih-alih running untuk hours.
- Configuration → URL Rewriting — strip ID sesi dan known pelacakan parameter sebelum perayap treats masing-masing sebagai URL baru.
- Watch URL length dan kode respons columns aktif selama perayapan — URL yang terus getting longer (jalur ledakan) atau sebuah parameter jumlah itu mempertahankan climbing adalah perayapan-waktu versi dari log signature di atas.
Prompts untuk spider-jebakan triage
Paste di Anda sendiri log excerpts atau URL lists di mana indicated — verify model’s keluaran terhadap sebuah sample dari sebenarnya URL sebelum acting pada ini; ini dapat misjudge mana parameter sebenarnya perubahan halaman konten.
Flag candidate jebakan pola dari sebuah URL list
Paste di: daftar dari URL pulled dari sebuah perayapan export, server log, atau sebuah site:
penelusuran. Expect kembali: URL grouped oleh mungkin-jebakan pola (filter berfaset,
kalender, ID sesi, pengurutan/parameter pelacakan) dengan sebuah satu-baris alasan setiap group adalah
mencurigakan.
Here is a list of URLs from my site. Group them by pattern that looks
like a spider trap / infinite space: faceted-navigation filter
combinations, calendar/date paths with no apparent end, session IDs
in the URL, sort or tracking parameters, or redirect-loop candidates.
For each group, give a one-line reason it's suspect and roughly how
many URLs are in it.
URLs:
[paste URL list here]Draft sebuah robots.txt disallow untuk sebuah dipastikan pola
Paste di: sebuah dipastikan jebakan URL pola dan Anda existing robots.txt. Expect kembali: sebuah disallow aturan scoped untuk itu pola, ditambah sebuah periksa untuk apakah ini akan accidentally menangkap legitimate halaman (seperti nyata paginasi).
Here is a URL pattern I've confirmed is a spider trap (with example
URLs) and my current robots.txt. Write a Disallow rule scoped to just
this pattern, and tell me if it risks blocking anything else on the
site, especially legitimate finite pagination or individual item pages
that happen to share part of the path.
Pattern + example URLs:
[paste here]
Current robots.txt:
[paste here]Sanity-periksa perbaikan sequencing sebelum I ship ini
Paste di: sebuah plain deskripsi dari apa’s saat ini aktif untuk sebuah mencurigakan URL pola (terindeks sudah? robots.txt diblokir? noindex tag present?). Expect kembali: apakah urutan adalah safe, given itu noindex perlu perayapan akses untuk menjadi terlihat dan robots.txt blocks perayapan tetapi bukan pengindeksan.
Here's the current state of a URL pattern I think is a spider trap:
[describe: is it already indexed? currently crawlable? does it have
a noindex tag? is robots.txt already blocking it?]
Tell me if my planned fix sequence is safe, given that: robots.txt
disallow stops crawling but not indexing, and noindex needs the page
to stay crawlable to be seen and processed. Flag if I'm about to block
crawling before a noindex has had a chance to be read. Prove perbaikan sebenarnya stopped perayapan
memblokir sebuah jebakan pola tidak berarti ini stopped draining anggaran — ini memeriksa pastikan perayapan permintaan sebenarnya dropped, di urutan fastest untuk slowest untuk pastikan.
Uji 1 — diblokir pola masih mengembalikan expected respons
- Pengujian — Fetch sebuah beberapa URL yang cocok pola directly (
curl -Iatau pengalihan Checker untuk pengalihan-based perbaikan) dan periksarobots.txtsendiri untuk baru disallow baris. - Hasil yang diharapkan — disallow aturan adalah present dan dengan benar scoped, dan (jika perbaikan adalah noindex/404 alih-alih robots.txt) URL mengembalikan expected status atau meta tag.
- Arti kegagalan — sebuah missing atau mis-scoped aturan berarti perbaikan tidak pernah sebenarnya shipped, bahkan jika Anda believe ini melakukan — periksa untuk sebuah typo di jalur atau sebuah aturan itu too narrow untuk menangkap nyata pola.
- Jendela pemantauan — Immediate.
- Pemicu rollback — aturan adalah accidentally catching legitimate halaman (terbatas paginasi, nyata item halaman) — narrow pola sebelum ini stays aktif panjang cukup untuk hurt itu halaman’ perayapan too.
Uji 2 — perayapan permintaan untuk pola sebenarnya drop di Anda log
- Pengujian — Re-run yang sama Log File Analyzer pola periksa dari Cara mengukur tab, sebuah week atau dua setelah perbaikan ships.
- Hasil yang diharapkan — sampah-pola porsi total perayapan permintaan falls toward zero (robots.txt-diblokir pola tidak akan mencapai zero instantly — Google mempertahankan occasionally re-memeriksa sebuah disallowed jalur untuk sebuah sementara).
- Arti kegagalan — tidak drop biasanya berarti either aturan tidak sebenarnya cocok nyata URL menjadi requested, atau URL adalah masih menjadi ditemukan melalui sebuah tautan jalur Anda belum tetap (sebuah internal tautan, sebuah lama sitemap entry).
- Jendela pemantauan — satu untuk sebuah beberapa weeks dari log data sebelum Anda trust trend di atas day-untuk-day noise.
- Pemicu rollback — jangan loosen atau hapus blokir hanya karena drop adalah lambat — pastikan pertama apakah ini adalah simply bukan-yet-recrawled versus bukan-berfungsi.
Uji 3 — GSC perayapan Stats dan “belum diindeks” (terjemahan) “bukan terindeks” counts perpindahan yang sama direction
- Pengujian — periksa perayapan Stats (oleh-URL-jalur breakdown, jika Anda dapat infer ini) dan halaman laporan’s “ditemukan/Crawled – saat ini belum diindeks” (terjemahan) “ditemukan/dirayapi – saat ini bukan terindeks” counts.
- Hasil yang diharapkan — Total perayapan permintaan untuk affected jalur class trend down, dan (untuk noindex perbaikan) “belum diindeks” (terjemahan) “bukan terindeks” jumlah untuk itu pola eventually falls sebagai halaman mendapatkan deindexed.
- Arti kegagalan — perayapan Stats lags server log oleh design — jangan panic jika ini belum moved setelah hanya sebuah beberapa days. sebuah stat itu mempertahankan climbing setelah sebuah bulan suggests perbaikan bukan reaching nyata URL space.
- Jendela pemantauan — Several weeks; GSC aggregates adalah lebih lambat untuk reflect perubahan daripada raw log.
- Pemicu rollback — sebuah sustained climb dengan tidak plateau setelah sebuah bulan adalah sebuah sign untuk re-audit pola cocok, bukan untuk tambahkan sebuah kedua, broader perbaikan pada top sebelum confirming pertama satu adalah bahkan scoped dengan benar.
Resources yang layak dibaca
Tulisan terkait saya
- ketika seharusnya Anda Worry tentang anggaran crawling? — core piece: apa menyia-nyiakan anggaran (parameter, navigasi berfaset, sorting, ID sesi), dan mengapa menghapus duplikat lets Google focus pada unik URL. ini adalah home untuk jebakan-sebagai-perayapan-anggaran masalah.
- Robots.txt dan SEO: Everything Anda perlu Know — cara blokir jebakan pola dengan benar (dan mengapa robots.txt bukan sebuah deindexing alat).
- terindeks, though diblokir oleh robots.txt — sequencing jebakan: blokir too early dan Anda
noindextidak pernah mendapatkan terlihat. - SEOs adalah Breaking Pagination setelah Google Changed Rel=Prev/Next — bagaimana di atas-correcting pada paginasi membuat baru perayapan/orphaning masalah; distinguish terbatas paginasi dari sebuah nyata loop.
- Beginner’s panduan untuk SEO teknis — di mana perayapan efficiency fits di bigger gambaran.
(I tend untuk write tentang ini di bawah anggaran perayapan, robots.txt, dan paginasi alih-alih daripada literal “jebakan laba-laba” (terjemahan) “jebakan laba-laba” label — sehingga ini halaman adalah di mana I pull istilah dan itu pieces together.)
saya speaking
- sebuah Crash Course di SEO teknis (SlideShare) — covers parameter, navigasi berfaset, ID sesi, dan trailing slashes sebagai duplikat-konten sources.
- bagaimana penelusuran berfungsi (SlideShare) — bagaimana Googlebot menemukan URL dan bagaimana perayapan scheduling berfungsi; berguna context untuk mengapa sebuah terbatas perayapan kapasitas mendapatkan drained oleh tak terbatas URL spaces. (ini tidak cover jebakan laba-laba directly — cite ini untuk perayapan-penemuan/anggaran context.)
Dari penulis lain
- Jebakan Perayap: Penyebab, Solusi & Pencegahan (Hamlet Batista, SEJ) — paling lengkap daftar jenis, dengan pengembang-tingkat perbaikan.
- perayap Traps: cara Identify dan hindari Them (Conductor) — clean daftar jenis ditambah log/operator/GSC deteksi.
- Jebakan laba-laba: tanda dan solusi (Joost de Valk, Yoast) — definisi sederhana yang sangat baik dan log-file-deteksi aspek.
- Field panduan untuk Spider Traps (Matthew Henry, Portent) — memorable rumusan dan per-jebakan langkah deteksi.
- Google crawling December seri — terbaik concentrated set dari official perayapan explainers, including navigasi berfaset.
- cara Identify, Analyze, dan Fix Infinite Spaces (Glenn Gabe, GSQI) — sebuah nyata enterprise kasus study showing GSC + perayapan + analytics triangulation workflow dan benar deindex-sebelum-disallow sequence.
- Spider trap (Wikipedia) — authoritative definition dan origin dari istilah, dengan klasik countermeasures.
- Google: 75% dari crawling issues come dari dua umum URL mistakes (Search Engine Land) — write-up dari Gary Illyes’ tercatat admission itu navigasi berfaset + parameter tindakan menyumbang untuk ~75% dari Google perayapan masalah.
uji yourself: jebakan laba-laba
Five quick pertanyaan pada jebakan laba-laba (perayap jebakan) dan cara memperbaiki mereka. memilih sebuah jawaban untuk setiap, lalu periksa.
Log perubahan
Diperbarui 21 Agu 2026.
Ringkasan editorial dan detail perubahan yang tercatat.Detail perubahan
-
Catatan perubahan terperinci saat ini tersedia dalam bahasa Inggris.
Perbandingan lengkap tidak tersedia — tidak ada cuplikan sebelumnya yang diarsipkan untuk revisi ini.
Diperbarui 18 Jul 2026.
Ringkasan editorial dan detail perubahan yang tercatat.Detail perubahan
-
Catatan perubahan terperinci saat ini tersedia dalam bahasa Inggris.
-
Catatan perubahan terperinci saat ini tersedia dalam bahasa Inggris.
-
Catatan perubahan terperinci saat ini tersedia dalam bahasa Inggris.
-
Catatan perubahan terperinci saat ini tersedia dalam bahasa Inggris.
Perbandingan lengkap tidak tersedia — tidak ada cuplikan sebelumnya yang diarsipkan untuk revisi ini.