Bị chặn bởi robots.txt — trạng thái GSC

Trạng thái “Blocked by robots.txt” trong Page Indexing của Google Search Console: URL bị loại khỏi lập chỉ mục vì robots.txt không cho phép crawl; cách phân biệt với “Indexed, though blocked”, xử lý xung đột noindex + disallow và sửa điểm chặn ngoài ý muốn.

Xuất bản lần đầu: 23 thg 6, 2026 · Cập nhật lần cuối: 9 thg 8, 2026 · Advanced
Ngôn ngữ
1 tín hiệu bằng chứng trên trang này

“Blocked by robots.txt” là trạng thái loại trừ trong Page Indexing của Google Search Console: Google tìm thấy URL nhưng không crawl vì robots.txt không cho phép, nên URL không được lập chỉ mục ở trạng thái này. Phần lớn trường hợp có chủ đích và không có vấn đề — robots.txt kiểm soát crawl, không kiểm soát lập chỉ mục, vì vậy disallow không phải công cụ gỡ chỉ mục. Trạng thái liên quan “Indexed, though blocked by robots.txt” có kết quả ngược lại: Google vẫn lập chỉ mục URL bị chặn, thường qua liên kết. Sai lầm lớn là kết hợp noindex với disallow: Google không thể crawl trang nên không thấy noindex. Muốn gỡ trang, hãy cho phép crawl và phục vụ noindex. Chỉ sửa trạng thái này khi bạn chặn nhầm nội dung thực sự muốn được lập chỉ mục.

Tóm tắt — “Blocked by robots.txt” là trạng thái loại trừ trong Page Indexing: Google phát hiện URL nhưng không crawl vì robots.txt không cho phép, nên URL không được lập chỉ mục ở trạng thái này. Điều này thường có chủ đích và vô hại — robots.txt quản lý crawl, không quản lý lập chỉ mục, vì vậy Disallow không bao giờ là công cụ gỡ chỉ mục. Đừng nhầm với cảnh báo “Indexed, though blocked by robots.txt” — Google vẫn lập chỉ mục URL bị chặn, thường qua liên kết trỏ đến. Sai lầm kinh điển là kết hợp disallow với noindex: Google không thể crawl trang nên không thấy noindex, và trang vẫn có thể được lập chỉ mục. Muốn gỡ trang, hãy cho phép crawl và phục vụ noindex. Chỉ coi trạng thái này là lỗi khi bạn chặn nhầm URL thực sự muốn được lập chỉ mục.

Trạng thái này thực sự báo điều gì

Trong báo cáo Page Indexing của Search Console, “Blocked by robots.txt” là trạng thái loại trừ, không phải lỗi hay cảnh báo. Google mô tả rõ rằng trang “was blocked by your site’s robots.txt file,” (bản dịch) “đã bị tệp robots.txt của website chặn,” đồng thời thêm lưu ý quan trọng rằng điều này “does not guarantee that the page won’t be indexed through some other means.” (bản dịch) “không bảo đảm trang sẽ không được lập chỉ mục bằng cách khác.” Evidence for this claim Google reports Blocked by robots.txt when crawling is disallowed and warns that this does not guarantee the URL cannot be indexed by other means. Scope: Google Search Console report terminology and documented Search behavior; the label alone may not prove the underlying root cause. Confidence: high · Verified: Google: Page indexing report Lưu ý đó tóm gọn toàn bộ chủ đề — xem phần dưới.

Về cơ chế: Googlebot biết URL tồn tại — qua liên kết, sitemap hoặc lịch sử — cố tuân thủ quy tắc, gặp một Disallow phù hợp rồi dừng lại. Không fetch nghĩa là không có nội dung để lập chỉ mục, vì vậy URL nằm trong nhóm loại trừ này. Đây là kết quả dự kiến của một lệnh disallow; phần lớn URL ở đây đúng ra phải nằm ở đây.

Crawl không phải lập chỉ mục — vì sao disallow không gỡ chỉ mục

Google mô tả robots.txt là cơ chế kiểm soát quyền crawl, không phải biện pháp gỡ nội dung đáng tin cậy. Evidence for this claim Google says robots.txt manages crawler access and is not a mechanism for keeping a page out of Google. Scope: Google Search Console report terminology and documented Search behavior; the label alone may not prove the underlying root cause. Confidence: high · Verified: Google: robots.txt introduction

Đây là trục chính xác của toàn bộ trạng thái. robots.txt kiểm soát crawl. Google nói rõ nó “is not a mechanism for keeping a web page out of Google.” (bản dịch) “không phải cơ chế giữ một trang web khỏi Google.” Chặn URL ngăn việc fetch; không xóa URL khỏi chỉ mục và không phải công cụ gỡ chỉ mục.

Như tôi từng viết trong bài Ahrefs về trạng thái liên quan: “crawling and indexing are two different things.” (bản dịch) “crawl và lập chỉ mục là hai việc khác nhau.” Trang bị chặn vẫn có thể được lập chỉ mục nếu trang khác liên kết đến nó — Google chỉ không thể thấy nội dung, đồng thời không thấy bất kỳ noindex nào bạn đặt trên trang. Điều này dẫn tới sai lầm phổ biến nhất khi người dùng mở báo cáo này.

“Blocked by robots.txt” so với “Indexed, though blocked by robots.txt”

Hai trạng thái này thường xuyên bị nhập làm một; chúng có cùng nguyên nhân nhưng kết quả trái ngược:

Blocked by robots.txtIndexed, though blocked by robots.txt
Nhóm báo cáoLoại trừ — chưa lập chỉ mụcCảnh báo — đã lập chỉ mục
Điều đã xảy raGoogle tìm thấy URL, không crawl và không lập chỉ mụcGoogle lập chỉ mục URL không crawl
Lý doDisallow hoạt động và không có tín hiệu nào buộc lập chỉ mụcDisallow hoạt động nhưng liên kết/tín hiệu vẫn khiến URL được lập chỉ mục
Thường là vấn đề?Không — thường có chủ đíchTùy trường hợp — thường không sao với URL tiện ích

Nếu bạn đang nhìn phiên bản cảnh báo — URL bị chặn nhưng vẫn được lập chỉ mục và hiển thị dưới dạng URL trần không có mô tả — đó là trường hợp indexed-though-blocked, được xử lý trong bài riêng. Bài này nói về trạng thái loại trừ thuần túy: bị chặn và chưa được lập chỉ mục.

Với URL tiện ích, việc “vẫn được lập chỉ mục” thường không đáng lo. John Mueller trả lời một chủ website có URL WooCommerce ?add-to-cart= xuất hiện trong trạng thái indexed-though-blocked rằng các URL đó không cần được lập chỉ mục, chặn chúng bằng robots.txt là ổn, và ngay cả khi chúng được “lập chỉ mục” trong lúc bị chặn, chúng khó xuất hiện trong tìm kiếm trừ khi ai đó dùng truy vấn rất cụ thể cho chính các URL đó — điều người dùng thực tế không làm.

Xung đột noindex + disallow — cách sửa số một nhưng phản tác dụng

Đây là cái bẫy. Ai đó muốn một trang biến mất nên thêm Disallow trong robots.txt thẻ meta noindex — tưởng là bảo vệ hai lớp. Cách này không hiệu quả vì hai chỉ thị mâu thuẫn nhau.

Google nêu quy tắc trực tiếp: “For the noindex rule to be effective, the page or resource must not be blocked by a robots.txt file, and it has to be otherwise accessible to the crawler.” (bản dịch) “Để quy tắc noindex có hiệu lực, trang hoặc tài nguyên không được bị tệp robots.txt chặn và phải truy cập được với crawler theo cách khác.” Nếu trang bị disallow, Google không crawl, không thấy noindex và trang vẫn có thể được lập chỉ mục. Như tôi đã viết trong bài về “Indexed, though blocked by robots.txt”: nếu Google không thể crawl trang, Google sẽ không thấy thẻ noindex và vẫn có thể lập chỉ mục trang vì có liên kết trỏ tới.

Vì vậy, trình tự gỡ chỉ mục trái ngược với phản xạ thường thấy:

  1. Cho phép crawl URL — xóa Disallow.
  2. Phục vụ noindex — qua thẻ meta robots hoặc header X-Robots-Tag — và để Google crawl lại để thấy chỉ thị.
  3. Sau khi URL bị loại, vẫn để trang có thể crawl với noindex. Chặn lại không phải “bước kết thúc” an toàn: nếu disallow URL lần nữa, Google có thể mất khả năng nhìn thấy quy tắc noindex ở lần crawl tiếp theo, và URL bị chặn nhưng có liên kết vẫn có thể được lập chỉ mục lại từ liên kết trên trang khác — đúng kết quả “indexed, though blocked” bạn muốn tránh. Nếu crawl budget cho trang đã gỡ thật sự là vấn đề, hãy dùng xác thực hoặc xóa trang — 404/410 — thay vì quay lại robots.txt.

Nếu cần gỡ khẩn cấp, công cụ Removals của Search Console, bảo vệ bằng mật khẩu hoặc xóa hẳn trang — trả 404/410 — là các đường nhanh hơn.

Cách tìm quy tắc đang chặn URL

Có ba công cụ, mỗi công cụ làm một việc khác nhau — đừng mong một công cụ làm thay hai công cụ còn lại:

  • URL Inspection — GSC. Dán URL cụ thể. Công cụ cho biết URL hiện có bị chặn không và là cách kiểm tra nhanh nhất cho từng URL.
  • Báo cáo robots.txt — GSC. Báo cáo giám sát cấp domain property, không phải trình kiểm thử có thể chỉnh sửa; nó hiển thị các tệp robots.txt Google tìm thấy cho những host hàng đầu, thời điểm fetch gần nhất, trạng thái fetch, cảnh báo phân tích cú pháp và thao tác “request a recrawl” sau khi bạn đổi tệp. Báo cáo cho biết Google thấy tệp; không kiểm thử từng URL với tệp đó.
  • Trình xác thực robots.txt hoặc parser robots.txt mã nguồn mở của Google. Muốn biết dòng nào khớp một URL, hãy chạy URL qua trình xác thực, vì quy tắc dài nhất và cụ thể nhất sẽ thắng — một Allow có thể ghi đè Disallow rộng hơn.
Evidence for this claim The current Search Console robots.txt report shows fetched files, history, fetch status, and parsing issues and can request a file recrawl; for a specific URL Google points to URL Inspection, a validator, or its open-source robots library rather than an editable legacy GSC tester. Scope: robots.txt diagnosis Confidence: high · Verified: Unblock a page blocked by robots.txt

Sau khi tìm được dòng gây chặn, cách sửa phụ thuộc vị trí quản lý robots.txt. Nếu bạn trực tiếp kiểm soát tệp, hãy xóa hoặc sửa quy tắc và chú ý cú pháp. Nếu dùng nền tảng host như Wix, Shopify hoặc Squarespace, bạn có thể phải làm theo tài liệu riêng của nhà cung cấp vì một số nền tảng quản lý robots.txt thay bạn.

Thử nghiệm của tôi: điều gì xảy ra khi chặn một trang cần được lập chỉ mục

Câu hỏi thực sự hữu ích là: nếu vô tình chặn một trang cần xếp hạng, thiệt hại nghiêm trọng đến đâu? Tôi đã trực tiếp chạy thử nghiệm đó. Ngày 30 tháng 1 năm 2023, tôi chặn hai trang đang thực sự xếp hạng của chúng tôi — “Top Bing Searches” và “Top YouTube Searches” — bằng robots.txt rồi theo dõi kết quả.

Thiệt hại có thật nhưng nhỏ hơn tôi dự kiến. Chúng tôi mất một vị trí ở chỗ này hay chỗ khác — vài từ khóa tụt một hoặc hai bậc, một vài từ thậm chí tăng — và mất toàn bộ đoạn trích nổi bật của hai trang khi bị chặn; chúng quay lại sau khi tôi bỏ chặn. Cách hiển thị trên SERP cũng suy giảm: Google hiện “no information is available for this page” (bản dịch) “không có thông tin cho trang này” thay cho phần mô tả và mất tiêu đề tùy chỉnh. Vì mục hiển thị trông kém hơn, lượt nhấp giảm nhiều hơn lượt hiển thị — CTR chịu tác động.

Tóm tắt của tôi khi đó là: “We lost a position here or there and all of the featured snippets for the pages. I expected a lot more impact, but the world didn’t end.” (bản dịch) “Chúng tôi mất một vị trí ở chỗ này hay chỗ khác và toàn bộ featured snippet của các trang. Tôi đã dự kiến tác động lớn hơn nhiều, nhưng thế giới không kết thúc.” Kết luận tôi vẫn giữ nguyên: đừng chặn trang bạn muốn được lập chỉ mục. Việc đó gây hại. Không tệ như bạn có thể nghĩ — nhưng vẫn gây hại. Đó là khung tư duy đúng cho báo cáo này. Nếu mọi mục trong nhóm “Blocked by robots.txt” đều là nội dung bạn định chặn, không có vấn đề. Nếu có trang bạn quan tâm, hãy bỏ chặn.

Một lưu ý về phạm vi thử nghiệm: cả hai trang đã được lập chỉ mục và xếp hạng trước khi tôi chặn, nên kết quả đo lường cho thấy điều xảy ra khi một trang đã lập chỉ mục bị đẩy vào trạng thái “indexed, though blocked” — không dự báo điều xảy ra với URL chưa bao giờ được lập chỉ mục và chỉ nằm trong nhóm loại trừ này. Nếu URL ở đây chưa từng được lập chỉ mục, bỏ chặn chỉ cho phép Google crawl và xem xét bình thường; không có lịch sử featured snippet hay CTR để mất vì chúng chưa từng tồn tại.

Cây quyết định

  • Bạn có chủ ý chặn URL không? → Giữ nguyên. Hệ thống hoạt động đúng chủ đích.
  • Không — bạn muốn URL được lập chỉ mục? → Xóa hoặc thu hẹp quy tắc robots.txt, rồi yêu cầu lập chỉ mục.
  • Bạn muốn URL biến mất khỏi Google? → Đừng dùng disallow. Cho phép crawl + noindex — hoặc dùng Removals/xóa trang — rồi giữ URL có thể crawl; chặn lại có thể che quy tắc noindex lần nữa.
  • URL bị chặn nhưng vẫn được lập chỉ mục? → Đó là trường hợp indexed-though-blocked, không phải trạng thái này; xử lý theo bài tương ứng.
  • Trang chứa nội dung nhạy cảm hoặc riêng tư? → robots.txt không phải kiểm soát truy cập; đó là yêu cầu bot có thể bỏ qua. Dùng xác thực hoặc mật khẩu, không dùng disallow.

Nguyên tắc crawl-khác-lập-chỉ-mục có tính phổ quát: Bing cũng tuân thủ robots.txt khi crawl, và việc gỡ URL khỏi Bing tương tự dùng công cụ Block URLs hoặc noindex trên trang có thể crawl — không dùng riêng một disallow.

Muốn tìm hiểu toàn bộ tệp — cú pháp, wildcard, vị trí tệp và những gì nó có hoặc không thể làm — hãy xem hướng dẫn robots.txt. Muốn hiểu cách quyết định lập chỉ mục được đưa ra ở thượng nguồn, hãy xem hub về indexing.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.