Blocked oleh robots.txt (GSC Status)
Apa Google Search Console "Blocked by robots.txt" _(terjemahan)_ “Blocked oleh robots.txt” halaman pengindeksan status berarti — sebuah URL excluded dari pengindeksan karena robots.txt disallowed crawling. biasanya intentional. Bagaimana ini differs dari "Indexed, though blocked," _(terjemahan)_ “terindeks, though blocked,” mengapa noindex + disallow conflict, dan cara perbaiki ini jika block adalah sebuah mistake.
Bahasa
1 sinyal bukti di halaman ini
- Alat aktif terkaitrobots.txt Tester
"Blocked by robots.txt" _(terjemahan)_ “Blocked oleh robots.txt” adalah sebuah Google Search Console halaman pengindeksan exclusion: Google ditemukan URL tetapi tidak crawl ini karena Anda robots.txt disallows ini, so ini tidak terindeks di ini state. sebagian besar dari time ini adalah intentional dan fine — robots.txt controls crawling, tidak pengindeksan, so sebuah disallow adalah tidak sebuah deindexing alat. ini adalah sebuah sibling untuk "Indexed, though blocked by robots.txt" _(terjemahan)_ “terindeks, though blocked oleh robots.txt” warning, yang adalah opposite outcome (Google terindeks sebuah blocked URL anyway, biasanya melalui tautan). big gotcha: noindex + disallow conflict — Google dapat't crawl sebuah disallowed halaman, so ini tidak pernah sees noindex. untuk hapus sebuah halaman, izinkan crawling dan sajikan noindex. hanya "perbaiki" _(terjemahan)_ “perbaiki” ini status ketika Anda blocked sesuatu Anda sebenarnya wanted terindeks.
TL;DR — “Blocked by robots.txt” (terjemahan) “Blocked oleh robots.txt” di Search Console berarti Google ditemukan halaman tetapi tidak baca ini, karena Anda
robots.txtfile tells crawler untuk stay out. biasanya itu’s pada purpose dan ini adalah fine — ini adalah wajar hasil dari sebuah block, tidak sebuah error. ini adalah hanya sebuah masalah jika Anda blocked sebuah halaman Anda sebenarnya wanted di Google.
Apa ini status berarti
Open halaman pengindeksan report di Google Search Console, click ke “Blocked by
robots.txt,” (terjemahan) “Diblokir oleh robots.txt,” dan Anda’ll see sebuah list dari URLs Google chose tidak untuk indeks.
alasan adalah sederhana: Google ditemukan itu URLs, tetapi Anda situs’s robots.txt file says
crawler tidak diizinkan untuk fetch them. Evidence for this claim Google reports Blocked by robots.txt when crawling is disallowed and warns that this does not guarantee the URL cannot be indexed by other means. Scope: Google Search Console report terminology and documented Search behavior; the label alone may not prove the underlying root cause. Confidence: high · Verified: Google: Page indexing report label reports crawl block; ini melakukan tidak jaminan itu URL dapat tidak pernah menjadi terindeks melalui lainnya sinyal.
pertama hal I tell orang adalah: jangan panic. ini status adalah biasanya intentional. jika Anda (atau Anda CMS, atau sebuah plugin) blocked sesuatu pada purpose — internal hasil pencarian, faceted-navigation URLs, sebuah staging path, cart dan checkout URLs — lalu seeing ini di sini adalah persis apa supposed untuk happen. ini adalah Google confirming block worked, tidak flagging sebuah mistake.
satu idea untuk hold onto
robots.txt controls crawling, tidak pengindeksan. itu adalah dua berbeda hal.
Blocking sebuah halaman di robots.txt berhenti Google dari reading ini; ini melakukan tidak delete Evidence for this claim Google says robots.txt manages crawler access and is not a mechanism for keeping a page out of Google. Scope: Google Search Console report terminology and documented Search behavior; the label alone may not prove the underlying root cause. Confidence: high · Verified: Google: robots.txt introduction
ini dari Google, dan ini tidak sebuah cara untuk hapus sebuah halaman dari penelusuran. I’ve tested
“apa happens jika Anda block a halaman” (terjemahan) “apa happens jika Anda block sebuah halaman” side dari ini myself — lebih pada itu di
Advanced tab — tetapi headline adalah: sebuah block berhenti crawl, penuh berhenti.
adalah ini sebuah masalah?
Jalankan satu periksa: melakukan Anda berarti untuk block ini URLs?
- Ya, pada purpose → leave ini alone. ini adalah berfungsi sebagai yang dimaksud.
- Tidak, itu halaman seharusnya menjadi di Google → itu’s satu case untuk perbaiki. temukan
aturan di Anda
robots.txtitu’s catching URL dan hapus atau loosen ini, lalu permintaan pengindeksan.
ada sebuah related-tetapi-berbeda status Anda mungkin juga see: “Indexed, though blocked oleh robots.txt.” (terjemahan) “terindeks, though blocked oleh robots.txt.” itu satu’s sebuah warning, tidak sebuah exclusion — ini berarti Google terindeks sebuah blocked URL anyway (biasanya karena lainnya halaman tautan untuk ini). sama penyebab, opposite outcome. jika itu’s apa Anda’re looking di, ini adalah covered secara terpisah.
Evidence for this claim Google reports Blocked by robots.txt when crawling is disallowed and warns that this does not guarantee the URL cannot be indexed by other means. Scope: Google Search Console report terminology and documented Search behavior; the label alone may not prove the underlying root cause. Confidence: high · Verified: Google: Page indexing reportSatu lebih hal robots.txt dapat’t melakukan: pertahankan sesuatu privat. ini adalah sebuah permintaan, tidak sebuah access control — well-behaved bot honor ini, tetapi tidak ada apa pun forces them untuk, dan tidak ada apa pun berhenti URL dari surfacing elsewhere (sebuah tautan, sebuah screenshot, sebuah scraper itu ignores robots.txt entirely). jika sebuah halaman holds sensitive konten, lindungi ini dengan sebuah login atau password, tidak sebuah disallow.
mistake untuk hindari
sebuah lot dari orang try untuk hapus sebuah halaman dari Google oleh blocking ini di robots.txt,
sometimes menambahkan sebuah noindex tag pada saat yang sama untuk baik mengukur. itu tidak
berfungsi — dan ini backfires. jika Google dapat’t crawl halaman, ini dapat tidak pernah see
noindex pada ini, so halaman dapat stay di Google. untuk sebenarnya take sebuah halaman out dari
penelusuran, Anda melakukan opposite: let Google crawl ini, dan tambahkan noindex.
ingin penuh versi — cara temukan tepat blocking aturan, mengapa
noindex + disallow combo conflicts, dan apa my own experiment showed — switch
untuk Advanced tab.
TL;DR — “Blocked by robots.txt” (terjemahan) “Blocked oleh robots.txt” adalah sebuah halaman pengindeksan exclusion: Google ditemukan URL tetapi tidak crawl ini karena
robots.txtdisallows ini, so ini tidak terindeks di ini state. ini adalah biasanya intentional dan benign — robots.txt governs crawling, tidak pengindeksan, so sebuah disallow adalah tidak pernah sebuah deindexing alat. jangan confuse ini dengan warning “Indexed, though blocked by robots.txt” (terjemahan) “terindeks, though blocked oleh robots.txt” (Google terindeks sebuah blocked URL anyway, biasanya melalui inbound tautan). classic mistake adalah pairingdisallowdengannoindex: Google dapat’t crawl halaman, so ini tidak pernah seesnoindexdan halaman dapat stay terindeks. untuk hapus sebuah halaman, izinkan crawling dan sajikannoindex. hanya treat ini status sebagai sebuah bug ketika Anda blocked sebuah URL Anda sebenarnya wanted terindeks.
Apa status sebenarnya reports
di Search Console halaman pengindeksan report, “Blocked by robots.txt” (terjemahan) “Blocked oleh robots.txt” adalah sebuah excluded state, tidak sebuah error dan tidak sebuah warning. Google’s own wording adalah plain: halaman “was blocked by your site’s robots.txt file,” (terjemahan) “diblokir oleh berkas robots.txt situs Anda,” dan Google menambahkan penting caveat bahwa “does not guarantee that the page won’t be indexed through some other means.” (terjemahan) “ini tidak menjamin bahwa halaman tidak akan diindeks melalui cara lain.” Evidence for this claim Google reports Blocked by robots.txt when crawling is disallowed and warns that this does not guarantee the URL cannot be indexed by other means. Scope: Google Search Console report terminology and documented Search behavior; the label alone may not prove the underlying root cause. Confidence: high · Verified: Google: Page indexing report Itu caveat adalah seluruh topic di satu line — see di bawah.
Mechanically: Googlebot knows URL ada (ini ditemukan ini melalui sebuah tautan, sebuah sitemap,
atau history), tried untuk respect Anda aturan, hit sebuah matching Disallow, dan berhenti.
Tidak fetch berarti tanpa konten untuk indeks, so URL sits di ini excluded bucket. ini
adalah yang diharapkan hasil dari sebuah disallow — sebagian besar URLs di di sini adalah supposed untuk menjadi di
di sini.
crawling adalah tidak pengindeksan — mengapa sebuah disallow tidak deindex
Google documents robots.txt sebagai crawl-access control, tidak sebuah reliable removal mechanism. Evidence for this claim Google says robots.txt manages crawler access and is not a mechanism for keeping a page out of Google. Scope: Google Search Console report terminology and documented Search behavior; the label alone may not prove the underlying root cause. Confidence: high · Verified: Google: robots.txt introduction
ini adalah accuracy spine dari seluruh status. robots.txt adalah sebuah crawl control.
Google adalah jelas itu ini “adalah tidak a mechanism untuk mempertahankan a web halaman out dari
Google.” (terjemahan) “adalah tidak sebuah mechanism untuk mempertahankan sebuah halaman web out dari
Google.” Blocking sebuah URL mencegah fetch; ini melakukan tidak hapus URL dari
indeks, dan ini adalah tidak sebuah deindexing alat.
sebagai I’ve put ini di my Ahrefs artikel pada sibling status: “crawling dan indexing
adalah dua berbeda hal.” (terjemahan) “crawling dan pengindeksan
adalah dua berbeda hal.” sebuah halaman Anda block dapat masih end up terindeks jika lainnya
halaman tautan untuk ini — Google hanya dapat’t see konten, dan ini dapat’t see apa pun
noindex Anda tried untuk put di sana either. Yang leads untuk single sebagian besar umum
mistake orang membuat ketika mereka land pada ini report.
”Blocked by robots.txt” (terjemahan) “Blocked oleh robots.txt” vs “Indexed, though blocked by robots.txt” (terjemahan) “terindeks, though blocked oleh robots.txt”
ini dua mendapatkan conflated constantly, dan mereka’re yang sama penyebab dengan opposite outcomes:
| Blocked oleh robots.txt | terindeks, though blocked oleh robots.txt | |
|---|---|---|
| Report bucket | Excluded (tidak terindeks) | Warning (terindeks) |
| Apa happened | Google ditemukan URL, tidak crawl ini, tidak pengindeksan ini | Google terindeks URL despite tidak crawling ini |
| Mengapa | Disallow worked, tidak ada apa pun forced pengindeksan | Disallow worked, tetapi tautan/sinyal terindeks ini anyway |
| adalah ini biasanya sebuah masalah? | Tidak — typically intentional | Bergantung — sering fine untuk utility URLs |
jika Anda’re staring di warning versi — sebuah blocked URL itu mendapat terindeks anyway, menunjukkan sebagai sebuah bare URL dengan Tidak deskripsi — itu’s terindeks-though-blocked case, dan ini adalah handled di -nya own tulis-up. ini artikel adalah tentang plain exclusion: blocked, dan tidak terindeks.
untuk utility URLs, “indexed anyway” (terjemahan) “terindeks anyway” adalah sering tidak ada apa pun untuk worry tentang. John Mueller,
addressing sebuah situs owner milik siapa WooCommerce ?add-to-cart= URLs showed up sebagai
terindeks-though-blocked, mengatakan Anda tidak perlu itu URLs terindeks, itu blocking them
dengan robots.txt adalah fine, dan itu bahkan jika mereka mendapatkan “indexed” (terjemahan) “terindeks” sementara blocked, mereka’re
unlikely untuk sebenarnya surface di penelusuran unless seseorang berjalan sebuah very spesifik kueri
untuk itu URLs — yang pengguna nyata jangan.
noindex + disallow conflict ( #1 perbaiki itu backfires)
Di sini’s trap. Seseorang ingin sebuah halaman hilang, so mereka Disallow ini di robots.txt
dan tambahkan sebuah noindex meta tag — belt dan suspenders. ini tidak berfungsi, karena
dua instructions contradict setiap lainnya.
Google status aturan secara langsung: “For the noindex rule to be effective, the page
or resource must not be blocked by a robots.txt file, and it has to be otherwise
accessible to the crawler.” (terjemahan) “Agar aturan noindex efektif, halaman atau resource tidak boleh diblokir oleh berkas robots.txt dan harus tetap dapat diakses crawler.” Jika halaman adalah disallowed, Google tidak pernah melakukan crawl ini,
tidak pernah sees noindex, dan halaman dapat stay terindeks. sebagai I’ve ditulis di my artikel pada “Indexed, though blocked by robots.txt” (terjemahan) “terindeks, though blocked oleh robots.txt”: unless Google dapat crawl sebuah halaman, ini tidak akan see noindex tag dan dapat
masih indeks ini karena ini memiliki tautan.
So deindex sequence adalah opposite dari apa orang reach untuk:
- Izinkan crawling dari URL (hapus
Disallow). - sajikan
noindex(meta robots tag atauX-Robots-Tagheader) dan let Google re-crawl untuk see ini. - Leave halaman dapat di-crawl dengan
noindexdi place setelah ini adalah dropped. Re-blocking ini afterward tidak sebuah safe “finishing move” (terjemahan) “finishing move” — jika Anda disallow URL again, Google dapat lose visibilitas kenoindexaturan pada berikutnya crawl, dan sebuah blocked-tetapi-ditautkan URL dapat mendapatkan terindeks again dari lainnya halaman’ tautan, yang adalah tepat “indexed, though blocked” (terjemahan) “terindeks, though blocked” outcome Anda adalah trying untuk hindari. jika crawl budget pada dihapus halaman adalah sebuah nyata concern, itu’s sebuah case untuk authentication atau deletion (404/410) — tidak sebuah kembalikan trip melaluirobots.txt.
untuk urgent removals, Search Console Removals alat, password protection, atau
sekadar deleting halaman (returning 404/410) adalah lebih cepat routes.
cara temukan yang aturan adalah blocking URL
Three alat, setiap melakukan sebuah berbeda job — jangan expect satu untuk melakukan others’ berfungsi:
- pemeriksaan URL (GSC). Paste spesifik URL. ini tells Anda apakah itu URL adalah saat ini blocked dan adalah quickest per-URL periksa.
- robots.txt report (GSC). sebuah domain-property-tingkat monitoring report — tidak
sebuah editable tester — menunjukkan
robots.txtfiles Google ditemukan untuk Anda top hosts, terakhir-fetched time, fetch status, dan apa pun parsing warnings, plus sebuah “request a recrawl” (terjemahan) “permintaan sebuah recrawl” tindakan setelah Anda perubahan file. ini tells Anda Google dapat see Anda file; ini tidak test individual URLs terhadap ini. - sebuah robots.txt validator atau Google’s open-sumber robots.txt parser. untuk see
yang line matches sebuah diberikan URL, jalankan ini melalui sebuah validator — karena
longest, sebagian besar spesifik matching aturan wins (dan sebuah
Allowdapat override sebuah lebih luasDisallow).
setelah Anda’ve ditemukan offending line, perbaiki bergantung pada di mana Anda robots.txt
lives. jika Anda control file secara langsung, hapus atau correct aturan (dan mind
syntax). jika Anda’re pada sebuah hosted platform like Wix, Shopify, atau Squarespace, Anda dapat
perlu untuk ikuti itu provider’s spesifik docs untuk perubahan ini, since beberapa platforms
manage robots.txt untuk Anda.
My own experiment: apa happens ketika Anda block sebuah halaman Anda wanted terindeks
genuinely berguna pertanyaan adalah: jika Anda accidentally block sebuah halaman itu seharusnya
peringkat, bagaimana buruk adalah ini? I ran itu test secara langsung. pada January 30, 2023 I blocked dua dari
kami sebenarnya-peringkat halaman — “Top Bing Searches” (terjemahan) “Top Bing Searches” dan “Top YouTube Searches” (terjemahan) “Top YouTube Searches” — dengan
robots.txt dan tracked apa happened.
damage adalah nyata tetapi lebih kecil daripada I yang diharapkan. kami lost sebuah position di sini atau di sana (sebuah sedikit keywords slipped satu atau dua spots, sebuah couple bahkan gained), dan kami lost semua featured snippets untuk itu halaman sementara mereka adalah blocked — mereka came back setelah I unblocked. SERP appearance degraded too: Google showed “no information is available for this page” (terjemahan) “Tidak informasi adalah tersedia untuk ini halaman” alih-alih deskripsi meta, dan lost kami custom judul. dan karena listing looked worse, clicks dropped lebih daripada impressions melakukan — CTR took hit.
My summary di time: “We lost a position here or there and all of the featured snippets for the pages. I expected a lot more impact, but the world didn’t end.” (terjemahan) “kami lost sebuah position di sini atau di sana dan semua dari featured snippets untuk halaman. I yang diharapkan sebuah lot lebih impact, tetapi world tidak end.” dan takeaway I’d masih stand behind: jangan block halaman Anda ingin terindeks. ini hurts. Tidak sebagai buruk sebagai Anda mungkin think — tetapi ini masih hurts. itu’s right mental frame untuk ini report. jika semuanya di Anda “Blocked by robots.txt” (terjemahan) “Blocked oleh robots.txt” bucket adalah stuff Anda dimaksudkan untuk block, Anda’re fine. jika sebuah halaman Anda care tentang adalah di di sana, mendapatkan ini out.
Satu cakupan note pada ini experiment: keduanya halaman adalah sudah peringkat dan terindeks sebelum I blocked them, so apa I diukur adalah apa happens ketika sebuah terindeks halaman mendapatkan pushed ke “indexed, though blocked” (terjemahan) “terindeks, though blocked” state — tidak apa happens untuk sebuah URL itu adalah tidak pernah terindeks dan adalah sekadar sitting di ini exclusion bucket. jika sebuah URL di sini adalah tidak pernah terindeks untuk begin dengan, unblocking ini hanya lets Google crawl dan pertimbangkan ini biasanya; ada Tidak featured-snippet atau CTR history untuk lose, karena ini adalah tidak pernah di sana.
decision tree
- melakukan Anda berarti untuk block ini? → Leave ini. berfungsi sebagai yang dimaksud.
- Tidak — Anda ingin ini terindeks? → hapus/loosen
robots.txtaturan, lalu permintaan pengindeksan. - Anda ingin ini hilang dari Google? → jangan gunakan disallow. Izinkan crawling +
noindex(atau Removals alat / delete), lalu leave ini dapat di-crawl — re-blocking ini afterward dapat hidenoindexaturan again. - ini adalah sebuah blocked URL itu mendapat terindeks anyway? → itu’s terindeks-though-blocked case, tidak ini satu — tangani ini di sana.
- ** halaman memiliki sensitive atau privat konten?** → robots.txt tidak sebuah access control; ini adalah sebuah permintaan bot dapat ignore. gunakan authentication atau password protection, tidak sebuah disallow.
crawl-vs-indeks principle adalah universal, oleh cara: Bing honors robots.txt untuk
crawling yang sama cara, dan menghapus sebuah URL dari Bing similarly menggunakan -nya Block URLs
alat atau sebuah noindex pada sebuah dapat di-crawl halaman — tidak sebuah bare disallow.
untuk lebih luas file itself — syntax, wildcards, di mana ini lives, dan apa ini dapat dan dapat’t melakukan — see robots.txt guide. untuk bagaimana pengindeksan decisions mendapatkan dibuat upstream, see pengindeksan hub.
AI summary
sebuah condensed take pada Advanced versi:
- “Blocked by robots.txt” (terjemahan) “Blocked oleh robots.txt” = sebuah halaman pengindeksan exclusion. Google ditemukan URL
tetapi tidak crawl ini karena
robots.txtdisallows ini, so ini tidak terindeks di ini state. ini adalah wajar hasil dari sebuah block — biasanya intentional dan benign. - robots.txt controls crawling, tidak pengindeksan. Google says “it is not a mechanism for keeping a web page out of Google.” (terjemahan) “robots.txt bukan mekanisme untuk menjauhkan halaman web dari Google.” sebuah disallow berhenti fetch; ini melakukan tidak deindex sebuah halaman.
- jangan confuse ini dengan warning “Indexed, though blocked by robots.txt.” (terjemahan) “terindeks, though blocked oleh robots.txt.” sama penyebab, opposite outcome: itu satu berarti sebuah blocked URL mendapat terindeks anyway, biasanya melalui inbound tautan. untuk utility URLs, Mueller says itu’s typically fine — blocked-dan-terindeks URLs rarely surface untuk wajar kueri.
- ** #1 backfire:
noindex+disallowtogether.** Google dapat’t crawl sebuah disallowed halaman, so ini tidak pernah seesnoindexdan halaman dapat stay terindeks. Google’s aturan: untuknoindexuntuk berfungsi, halaman harus tidak menjadi blocked olehrobots.txt. - untuk sebenarnya hapus sebuah halaman: izinkan crawling, sajikan
noindex, let Google re-crawl, lalu leave ini dapat di-crawl. Re-blocking ini afterward dapat hidenoindexaturan again dan let URL mendapatkan terindeks dari tautan — opposite dari apa Anda wanted. untuk urgent cases gunakan Removals alat, password protection, atau delete halaman. - temukan blocking aturan dengan pemeriksaan URL (per-URL) dan sebuah robots.txt validator (yang line matches; longest/sebagian besar-spesifik aturan wins). GSC robots.txt report monitors file fetch status — ini tidak test individual URLs. Perbaiki bergantung pada di mana file lives — hosted platforms dapat perlu provider-spesifik langkah.
- Patrick’s experiment: blocking dua sudah-peringkat, sudah-terindeks halaman cost sebuah position di sini atau di sana dan semua featured snippets, degraded SERP listing, dan dropped clicks lebih daripada impressions — “itu world tidak end,” (terjemahan) “ world tidak end,” tetapi “don’t block pages you want indexed.” (terjemahan) “jangan block halaman Anda ingin terindeks.” ini menampilkan apa happens untuk sebuah terindeks halaman pushed ke “indexed, though blocked” (terjemahan) “terindeks, though blocked” — ini tidak forecast outcomes untuk sebuah URL itu adalah tidak pernah terindeks.
- robots.txt tidak sebuah security control. ini adalah sebuah permintaan bot dapat choose untuk ignore. Lindungi sensitive konten dengan authentication, tidak sebuah disallow.
- Decision aturan: dimaksudkan untuk block ini → leave ini; ingin ini terindeks → unblock +
permintaan pengindeksan; ingin ini hilang → izinkan-crawl +
noindex(dan stay dapat di-crawl).
Dokumentasi resmi
Utama-sumber documentation dari mesin pencari.
- halaman pengindeksan report — report ini status lives di, dengan verbatim definitions dari “Blocked by robots.txt” (terjemahan) “Blocked oleh robots.txt” dan “Indexed, though blocked by robots.txt.” (terjemahan) “terindeks, though blocked oleh robots.txt.”
- Unblock sebuah halaman blocked oleh robots.txt — Google’s langkah-oleh-langkah untuk finding dan memperbaiki aturan itu blocks sebuah URL.
- robots.txt report — domain-property report menunjukkan robots.txt files Google ditemukan, fetch status, warnings, dan recrawl permintaan.
- Introduction untuk robots.txt — apa robots.txt melakukan dan tidak melakukan, including itu ini “is not a mechanism for keeping a web page out of Google.” (terjemahan) “adalah tidak sebuah mechanism untuk mempertahankan sebuah halaman web out dari Google.”
- Block Penelusuran pengindeksan dengan noindex — aturan itu
noindexhanya berfungsi pada sebuah halaman itu tidak blocked oleh robots.txt ( noindex + disallow conflict).
Bing / Microsoft
- Bing Webmaster alat Help — Bing honors robots.txt untuk crawling too; -nya robots.txt Tester dan Block URLs alat ikuti yang sama crawl-vs-indeks principle.
Quotes dari sumber
pada—record statements dari Google. setiap tautan adalah sebuah deep tautan itu jumps untuk quoted passage pada sumber halaman.
Google — apa status berarti
- “This page was blocked by your site’s robots.txt file. You can verify this using the robots.txt tester. Note that this does not guarantee that the page won’t be indexed through some other means.” (terjemahan) “Halaman ini diblokir oleh berkas robots.txt situs Anda. Anda dapat memverifikasinya menggunakan penguji robots.txt. Perhatikan bahwa ini tidak menjamin halaman tidak akan diindeks melalui cara lain.”* — Google Search Console Help, halaman pengindeksan report. Jump untuk quote
Google — robots.txt controls crawling, tidak pengindeksan
- “it is not a mechanism for keeping a web page out of Google.” (terjemahan) “robots.txt bukan mekanisme untuk menjauhkan halaman web dari Google.”* — Google Search Central, Introduction untuk robots.txt. Jump untuk quote
Google — mengapa noindex + disallow conflict
- “For the
noindexrule to be effective, the page or resource must not be blocked by a robots.txt file, and it has to be otherwise accessible to the crawler.” (terjemahan) “Agar aturannoindexefektif, halaman atau resource tidak boleh diblokir oleh berkas robots.txt dan harus tetap dapat diakses crawler.”* — Google Search Central, Block Penelusuran pengindeksan dengan noindex. Jump untuk quote
Stats & pertama-party data worth citing
- Blocking peringkat halaman: nyata tetapi survivable damage. di my experiment blocking
dua sudah-peringkat, sudah-terindeks halaman dengan
robots.txt(dimulai Jan 30, 2023), halaman lost sebuah position di sini atau di sana dan semua dari mereka featured snippets, SERP listing degraded untuk “Tidak information adalah tersedia untuk ini halaman,” (terjemahan) “Tidak informasi adalah tersedia untuk ini halaman,” dan clicks dropped lebih daripada impressions. My summary: “I yang diharapkan a lot lebih impact, tetapi itu world tidak end” (terjemahan) “I yang diharapkan sebuah lot lebih impact, tetapi world tidak end” — tetapi “don’t block pages you want indexed. It hurts.” (terjemahan) “jangan block halaman Anda ingin terindeks. ini hurts.” ini tests apa happens untuk sebuah terindeks halaman pushed ke “indexed, though blocked” (terjemahan) “terindeks, though blocked” state; ini tidak sebuah forecast untuk sebuah URL itu adalah tidak pernah terindeks di pertama place. Sumber - Blocked utility URLs itu mendapatkan terindeks adalah biasanya harmless. Per John Mueller, blocking tambahkan-untuk-cart-style URLs dengan robots.txt adalah fine; bahkan jika mereka tampilkan sebagai terindeks-though-blocked, mereka’re unlikely untuk surface untuk wajar kueri. Coverage
- Bagaimana umum robots.txt blocking adalah di seluruh web — block-rate data pada yang crawler ~140M situs disallow paling, dari my study dengan Xibeijia Guan. Sumber
mistake itu defines ini status: noindex + disallow
Mistake: pairing Disallow dengan noindex untuk try untuk hapus sebuah halaman.
ini adalah single sebagian besar umum mistake tied untuk “Blocked by robots.txt,” (terjemahan) “Blocked oleh robots.txt,” dan ini adalah
worth naming secara langsung karena ini feels like belt-dan-suspenders dan adalah sebenarnya
self-defeating. Seseorang ingin sebuah halaman hilang dari Google, so mereka Disallow ini di
robots.txt dan tambahkan sebuah noindex meta tag untuk baik mengukur. ini tidak berfungsi.
Google status aturan plainly: “For the noindex rule to be effective, the page
or resource must not be blocked by a robots.txt file, and it has to be otherwise
accessible to the crawler.” (terjemahan) “Agar aturan noindex efektif, halaman atau resource tidak boleh diblokir oleh berkas robots.txt dan harus tetap dapat diakses crawler.”* Jika halaman adalah disallowed, Google tidak pernah melakukan crawl ini,
tidak pernah sees noindex, dan halaman dapat stay terindeks — tepat opposite dari
yang dimaksud outcome. perbaiki adalah opposite instinct: izinkan crawling, lalu
sajikan noindex.
Myth: “A disallow in robots.txt is a deindexing tool.” (terjemahan) “sebuah disallow di robots.txt adalah sebuah deindexing alat.”
ini tidak, dan Google says so secara langsung: robots.txt “is not a mechanism for keeping
a web page out of Google.” (terjemahan) “adalah tidak sebuah mechanism untuk mempertahankan
sebuah halaman web out dari Google.” Blocking sebuah URL berhenti fetch — ini melakukan tidak hapus
URL dari indeks, dan sebuah blocked-tetapi-ditautkan halaman dapat masih tampilkan up (itu’s
sibling “Indexed, though blocked by robots.txt” (terjemahan) “terindeks, though blocked oleh robots.txt” status). gunakan noindex (dengan
crawling diizinkan) atau Removals alat ketika goal adalah sebenarnya removal.
Myth: “Everything in the ‘Blocked by robots.txt’ bucket is a problem to fix.” (terjemahan) “Semuanya di ‘Blocked oleh robots.txt’ bucket adalah sebuah masalah untuk perbaiki.” ini adalah biasanya opposite. ini status adalah yang diharapkan outcome dari sebuah intentional disallow — internal hasil pencarian, faceted-nav parameters, staging paths. hanya versi dari ini status worth treating sebagai sebuah bug adalah sebuah URL Anda sebenarnya wanted terindeks sitting di list oleh accident.
Mistake: blocking sebuah halaman Anda ingin peringkat, tanpa memeriksa cost pertama. Blocking sebuah halaman Anda ingin peringkat untuk “clean things up” (terjemahan) “bersih hal up” atau “save crawl budget” (terjemahan) “save anggaran crawling” adalah riskier daripada ini looks. di my own experiment blocking dua peringkat halaman, I lost semua featured snippets sementara mereka adalah blocked dan clicks dropped lebih daripada impressions karena SERP listing degraded untuk “no information is available for this page.” (terjemahan) “Tidak informasi adalah tersedia untuk ini halaman.” rankings themselves mostly held — tetapi treat sebuah robots.txt block pada sebuah halaman Anda care tentang sebagai sebuah nyata decision, tidak sebuah housekeeping tweak.
”Blocked by robots.txt” (terjemahan) “Blocked oleh robots.txt” triage checklist
berfungsi melalui ini list top untuk bottom ketika Anda open status di Search Console:
- Open halaman pengindeksan report dan click ke “Blocked by robots.txt” (terjemahan) “Blocked oleh robots.txt” untuk see sebenarnya list dari affected URLs.
- untuk setiap URL (atau pattern dari URLs), tanyakan: melakukan I berarti untuk block ini?
- jika Ya — internal penelusuran, faceted nav, staging, cart/checkout — leave ini alone. ini status adalah berfungsi sebagai yang dimaksud untuk itu URL.
- jika Tidak, atau Anda’re tidak sure — jalankan URL melalui pemeriksaan URL untuk konfirmasi ini adalah saat ini blocked (tidak sebuah stale snapshot).
- temukan spesifik aturan catching URL dengan robots.txt Tester
(atau lainnya robots.txt validator) — longest, sebagian besar spesifik matching aturan
wins, dan sebuah
Allowdapat override sebuah lebih luasDisallow. GSC’s robots.txt report monitors file fetch status; ini tidak test individual URLs. - Konfirmasi Anda’re tidak juga relying pada
noindexpada yang sama disallowed URL — itu combination dapat’t berfungsi; pick izinkan-crawl-plus-noindex alih-alih jika goal adalah removal. - hapus atau loosen blocking aturan (secara langsung jika Anda control
robots.txt, atau melalui Anda hosting platform’s docs jika ini adalah managed untuk Anda, e.g. Wix, Shopify, Squarespace). - permintaan pengindeksan untuk fixed URL di Search Console setelah block adalah cleared.
- Double-periksa Anda’re tidak confusing ini status dengan “Indexed, though blocked oleh robots.txt” (terjemahan) “terindeks, though blocked oleh robots.txt” — itu’s opposite outcome (terindeks anyway) dan perlu sebuah berbeda perbaiki.
- Re-periksa bucket di sebuah sedikit weeks untuk konfirmasi count trended cara Anda yang diharapkan (down untuk fixed URLs, flat untuk intentional blocks).
- jika apa pun dari ini URLs hold sensitive konten, jangan rely pada disallow untuk pertahankan ini privat — tambahkan authentication atau password protection alih-alih.
berfungsi decision tree
jawaban satu pertanyaan di sebuah time untuk land pada right move untuk sebuah URL sitting di “Blocked by robots.txt” (terjemahan) “Blocked oleh robots.txt” bucket.
What should I do about a URL blocked by robots.txt?
mental models
1. crawling ≠ pengindeksan. seluruh status collapses ke confusion jika Anda conflate dua. robots.txt controls crawling — apakah Googlebot fetches sebuah halaman. ini memiliki Tidak direct control di atas pengindeksan — apakah URL ends up di Google’s indeks. sebuah disallowed halaman tidak terindeks melalui crawling, tetapi ini dapat masih menjadi terindeks tanpa konten jika lainnya halaman tautan untuk ini. pertahankan dua ideas terpisah dan sebagian besar dari ini status berhenti menjadi confusing.
2. satu-pertanyaan triage. sebelum melakukan apa pun else, tanyakan: melakukan I berarti untuk block ini? Ya → leave ini, ini adalah berfungsi sebagai yang dimaksud. Tidak → itu’s satu case worth memperbaiki. ini single pertanyaan sorts hampir setiap URL di bucket correctly.
3. untuk hapus sebuah halaman, invert Anda instinct. natural move — disallow plus noindex, “extra safe” (terjemahan) “extra safe” — adalah persis backwards. Google dapat’t see sebuah directive pada sebuah halaman ini tidak pernah fetches. correct sequence adalah opposite dari intuitive satu: izinkan crawling, lalu sajikan noindex. Anytime seseorang reaches untuk sebuah disallow untuk membuat sebuah halaman disappear, itu’s sinyal untuk apply ini model.
4. robots.txt adalah sebuah crawl-budget alat, tidak sebuah penelusuran-hasil alat.
gunakan ini untuk pertahankan bot off rendah-nilai atau infinite URL spaces (internal penelusuran,
facets, staging) so crawl effort goes toward halaman Anda ingin ditemukan — tidak sebagai sebuah lever
untuk apa menampilkan up di hasil pencarian. itu job belongs untuk noindex, password
protection, atau deletion.
Track bucket count, tidak hanya -nya existence
satu angka worth watching adalah bagaimana banyak URLs sit di “Blocked by robots.txt” (terjemahan) “Blocked oleh robots.txt” baris dari halaman pengindeksan report di atas time — sebuah single snapshot dapat’t tell Anda apakah sebuah perbaiki worked atau apakah baru unintended blocks adalah creeping di.
”Blocked by robots.txt” (terjemahan) “Blocked oleh robots.txt” bucket count di atas time
- Metric — count dari URLs di bawah “Blocked by robots.txt” (terjemahan) “Blocked oleh robots.txt” di GSC’s halaman pengindeksan report, tracked di atas time.
- Apa ini tells Anda — Apakah bucket adalah behaving cara Anda expect. untuk
URLs Anda intentionally block (internal penelusuran, facets, staging), count
seharusnya stay roughly flat sebagai itu URL spaces stay stable — sebuah sudden jump biasanya
berarti sebuah baru bagian mendapat swept ke sebuah existing
Disallowpattern oleh accident. untuk sebuah URL Anda dengan sengaja unblocked karena Anda wanted ini terindeks, itu spesifik URL seharusnya drop out dari bucket setelah berikutnya crawl. - cara pull ini — GSC halaman pengindeksan report, filtered untuk “Blocked by robots.txt” (terjemahan) “Blocked oleh robots.txt” baris; spot-periksa spesifik URLs dengan pemeriksaan URL untuk konfirmasi saat ini status alih-alih sebuah stale snapshot.
- Benchmark / realistic range — ada Tidak universal target — ini bergantung entirely pada bagaimana banyak dari Anda situs adalah intentionally disallowed. honest bar: zero URLs di ini bucket itu Anda sebenarnya wanted terindeks, dan sebuah flat trend untuk semuanya else. Baseline Anda own count sebelum judging apakah sebuah perubahan moved ini di right direction.
- Cadence — periksa right setelah apa pun
robots.txtperubahan; jika tidak sebuah periodic glance (monthly adalah plenty untuk sebagian besar situs) adalah cukup untuk catch drift.
playbook: sebenarnya menghapus sebuah halaman dari Google
sebuah repeatable sequence untuk ketika sebuah URL perlu untuk come out dari Google’s indeks untuk nyata — tidak hanya mendapatkan blocked dari future crawling.
1. Konfirmasi goal adalah removal, tidak hanya crawl control.
jika goal adalah benar-benar “berhenti wasting anggaran crawling pada ini,” (terjemahan) “berhenti wasting anggaran crawling pada ini,” sebuah plain robots.txt
disallow adalah right alat dan ini playbook tidak apply — itu halaman dapat stay
terindeks melalui tautan dan itu’s fine. hanya gunakan ini sequence ketika halaman harus
sebenarnya leave indeks.
2. Izinkan crawling.
hapus atau loosen Disallow aturan blocking URL. Konfirmasi dengan
robots.txt Tester itu URL now muncul back
diizinkan, tidak blocked.
3. sajikan noindex.
tambahkan sebuah noindex meta robots tag atau X-Robots-Tag header HTTP untuk now-dapat di-crawl
halaman. ini adalah sebenarnya removal instruction — disallow adalah tidak pernah melakukan itu
job.
4. Let Google re-crawl dan pick ini up.
Google memiliki untuk fetch halaman again untuk see noindex. ada Tidak cara untuk force
sebuah instant fetch beyond requesting pengindeksan di Search Console dan menunggu untuk
berikutnya crawl.
5. Konfirmasi removal.
periksa pemeriksaan URL di Search Console untuk halaman’s saat ini terindeks status.
Setelah ini reports halaman sebagai excluded karena noindex, removal memiliki worked.
6. jangan treat re-blocking sebagai finishing langkah.
Setelah halaman memiliki dropped, menambahkan Disallow back tidak free: Google dapat lose
visibilitas ke noindex aturan again pada berikutnya crawl, dan sebuah blocked-tetapi-ditautkan
URL dapat come back sebagai terindeks melalui lainnya halaman’ tautan — tepat “indexed, though
blocked” (terjemahan) “terindeks, though
blocked” outcome Anda adalah trying untuk hindari. jika anggaran crawling adalah concern, weigh
itu terhadap risk, atau reach untuk authentication/deletion alih-alih untuk halaman itu
truly perlu untuk stay hilang untuk baik.
7. untuk urgent cases, skip tunggu.
jika halaman perlu untuk menjadi out now, gunakan Search Console Removals alat,
password-lindungi halaman, atau delete ini outright (kembalikan 404/410) alih-alih
menunggu pada crawl-lalu-noindex cycle.
Ready-untuk-gunakan AI prompts
Copy-paste prompts untuk berfungsi melalui sebuah robots.txt block dengan sebuah LLM. Treat output sebagai sebuah starting hypothesis — konfirmasi apa pun muat-bearing dengan robots.txt Tester atau Search Console’s pemeriksaan URL alat sebelum acting pada ini.
Figure out yang aturan blocks yang URL
Here is my robots.txt file and a list of URLs. For each URL, tell me whether it
is blocked or allowed, and quote the exact line in robots.txt responsible
(remember: the longest, most specific matching rule wins, and an Allow can
override a broader Disallow). If a URL isn't matched by any rule, say so.
ROBOTS.TXT:
[paste]
URLS:
[paste list, one per line]Sanity-periksa apakah sebuah block looks intentional
I run a [type of site]. Here is my robots.txt file. For each Disallow rule, tell
me what kind of URLs it likely targets (e.g. internal search, faceted
navigation, staging, cart/checkout, admin) and flag any rule that looks broad
enough it might be catching content pages by accident. Don't guess about pages
you can't see — just reason from the rule pattern and ask me to confirm
anything ambiguous.
ROBOTS.TXT:
[paste]Draft noindex-lalu-crawl sequence untuk sebuah spesifik halaman
I need to remove [URL] from Google. It's currently blocked by this robots.txt
rule: [paste rule]. Walk me through the exact sequence of changes in order
(robots.txt edit, meta tag or header change, what to check in Search Console at
each step) so I don't accidentally leave the noindex tag unseen by Google. Test sebuah URL terhadap Anda robots.txt aturan
sebelum Anda perubahan apa pun, konfirmasi persis yang aturan adalah catching sebuah diberikan URL. robots.txt Tester melakukan ini dengan sebuah matcher ported dari Google’s own open-sumber robots.txt parser dan menampilkan winning aturan per URL — itu’s fastest dan sebagian besar accurate cara untuk periksa. untuk sebuah quick manual sanity periksa tanpa sebuah alat, di sini’s core logic di Python:
import re
def rule_matches(path, rule):
"""Very simplified robots.txt path matcher: '*' = wildcard, '$' = end anchor."""
pattern = re.escape(rule).replace(r'\*', '.*')
if pattern.endswith(r'\$'):
pattern = pattern[:-2] + '$'
return re.match(pattern, path) is not None
def find_blocking_rule(path, disallow_rules, allow_rules):
"""Longest matching rule wins; ties go to Allow (mirrors Google's documented
precedence). Returns the winning rule string, or None if nothing matches."""
matches = [r for r in disallow_rules if rule_matches(path, r)]
matches += [r for r in allow_rules if rule_matches(path, r)]
if not matches:
return None
return max(matches, key=len)
# Example
disallow = ["/search", "/*?*sort="]
allow = ["/search/help"]
print(find_blocking_rule("/search/help", disallow, allow)) # -> "/search/help" (Allow wins, longer)
print(find_blocking_rule("/search/results", disallow, allow)) # -> "/search" (Disallow, no competing Allow)ini adalah sebuah simplification dari Google’s sebenarnya matcher (nyata robots.txt parsing memiliki lebih edge cases sekitar escaping dan group selection) — gunakan ini untuk sanity-periksa Anda mental model, dan konfirmasi apa pun itu penting dengan nyata tester sebelum Anda rely pada ini.
alat untuk diagnosing dan memperbaiki ini status
- Google indeks Checker — setelah Anda’ve fixed sebuah
block, gunakan ini untuk periksa halaman’s observable indexability sinyal (status
code, redirects,
noindex, canonical) sebelum routing untuk Search Console untuk Google’s sebenarnya jawaban. - pemeriksaan URL (Google Search Console) — sumber kebenaran untuk apakah sebuah spesifik URL adalah saat ini blocked, -nya langsung-tested indexability, dan (setelah fixed) apakah Google memiliki picked ini back up.
- robots.txt report (Google Search Console) — sebuah domain-property-tingkat view dari
robots.txtfiles Google ditemukan untuk Anda top hosts, terakhir-fetched time, dan fetch status, dengan sebuah “request a recrawl” (terjemahan) “permintaan sebuah recrawl” tindakan setelah Anda perubahan file.
Uji pemahaman Anda: Blocked oleh robots.txt
Five pertanyaan pada “Blocked by robots.txt” (terjemahan) “Blocked oleh robots.txt” status dan mistakes orang membuat sekitar ini. Pick sebuah jawaban untuk setiap, lalu periksa.
Prove removal sebenarnya worked
“I set noindex” (terjemahan) “I set noindex” atau “I edited robots.txt” (terjemahan) “I edited robots.txt” tidak proof dari apa pun pada -nya own — hanya hasil itu counts adalah apa Google’s indeks sebenarnya reflects afterward. ini tests terpisah perubahan Anda dibuat dari outcome Google reached.
Test 1 — crawling adalah genuinely diizinkan
- Test untuk jalankan — Jalankan URL melalui robots.txt Tester setelah editing file.
- Yang diharapkan hasil — URL muncul back diizinkan, dengan Tidak
Disallowaturan matching ini (atau sebuah lebih spesifikAllowwinning di atas sebuah lebih luasDisallow). - Failure interpretation — masih blocked berarti sebuah berbeda, lebih spesifik aturan adalah catching URL, atau edit tidak deploy — periksa file’s sebenarnya langsung contents, tidak hanya apa Anda yang dimaksud untuk perubahan.
- Monitoring window — Immediate — ini adalah sebuah static periksa dari file sebagai disajikan.
- Rollback trigger — N/sebuah — perbaiki aturan sebelum moving untuk berikutnya test; tidak ada apa pun downstream berfungsi until crawling adalah sebenarnya diizinkan.
Test 2 — noindex adalah menjadi disajikan correctly
- Test untuk jalankan — pemeriksaan URL → Pengujian langsung di Search Console (atau fetch halaman secara langsung dan periksa respons headers/HTML) pada now-dapat di-crawl URL.
- Yang diharapkan hasil — pengujian langsung menampilkan
noindexpresent, either sebagai sebuah meta robots tag di<head>atau sebuahX-Robots-Tagheader HTTP. - Failure interpretation — Missing
noindexdi sini berarti removal akan tidak pernah happen Tidak penting bagaimana panjang Anda tunggu — crawl-diizinkan langkah alone tidak hapus apa pun. - Monitoring window — Immediate — pengujian langsung reflects saat ini disajikan halaman.
- Rollback trigger — N/sebuah — ini harus lulus sebelum Google memiliki apa pun chance untuk act pada ini.
Test 3 — Google memiliki sebenarnya dropped halaman
- Test untuk jalankan — pemeriksaan URL ( terindeks-status field, tidak hanya Langsung Test) pada URL, diperiksa periodically setelah sebelumnya dua tests lulus.
- Yang diharapkan hasil — status perubahan untuk excluded karena
noindex, dan URL berhenti appearing untuk sebuahsite:penelusuran atau di Anda peringkat-tracking data. - Failure interpretation — masih terindeks setelah sebuah penuh crawl cycle biasanya berarti caching/propagation delay, tidak sebuah rusak setup — Google memiliki untuk re-crawl untuk notice perubahan, dan itu tidak instant.
- Monitoring window — 1–3 weeks, depending pada bagaimana sering Google adalah sudah crawling URL — jangan judge ini day setelah shipping perubahan.
- Rollback trigger — named abort condition — masih terindeks setelah sebuah penuh
crawl cycle dan halaman mempertahankan menunjukkan sebagai freshly di-crawl di server logs →
berhenti assuming ini adalah hanya propagation dan re-periksa Tests 1 dan 2 untuk sebuah mistake
(sebuah caching layer serving sebuah stale robots.txt, sebuah CDN stripping
X-Robots-Tagheader, atau sebuah kedua conflicting aturan adalah biasa culprits).
Log perubahan
Diperbarui 8 Agu 2026.
Ringkasan editorial dan detail perubahan yang tercatat.Detail perubahan
-
Catatan perubahan terperinci saat ini tersedia dalam bahasa Inggris.
Perbandingan lengkap tidak tersedia — tidak ada cuplikan sebelumnya yang diarsipkan untuk revisi ini.
Diperbarui 17 Jul 2026.
Ringkasan editorial dan detail perubahan yang tercatat.Detail perubahan
-
Catatan perubahan terperinci saat ini tersedia dalam bahasa Inggris.
-
Catatan perubahan terperinci saat ini tersedia dalam bahasa Inggris.
-
Catatan perubahan terperinci saat ini tersedia dalam bahasa Inggris.
-
Catatan perubahan terperinci saat ini tersedia dalam bahasa Inggris.
Perbandingan lengkap tidak tersedia — tidak ada cuplikan sebelumnya yang diarsipkan untuk revisi ini.