Crawler AI

Crawler AI dùng cho huấn luyện, tìm kiếm và fetch theo yêu cầu khác nhau thế nào; cách xác định bot, đặt robots.txt và tránh chặn nhầm khả năng hiển thị AI.

Xuất bản lần đầu: 24 thg 6, 2026 · Cập nhật lần cuối: 22 thg 8, 2026 · Advanced
Ngôn ngữ
2 tín hiệu bằng chứng trên trang này

Crawler AI gồm ba nhóm: bot huấn luyện, bot tìm kiếm AI và fetcher do người dùng kích hoạt. Mỗi bot có token và chính sách riêng; Google-Extended cùng Applebot-Extended chỉ là token kiểm soát, không phải crawler. Chặn huấn luyện không ảnh hưởng xếp hạng Google, nhưng chặn bot tìm kiếm AI làm giảm khả năng xuất hiện trong câu trả lời AI. Xác minh danh tính và dùng kiểm soát mạng riêng khi robots.txt không đủ.

OpenAI nói cài đặt cho GPTBot, OAI-SearchBot và ChatGPT-User độc lập. Evidence for this claim OpenAI publishes separate controls for GPTBot, OAI-SearchBot, and ChatGPT-User, and says each setting is independent. Scope: OpenAI-declared crawlers and user agents; their purposes and robots behavior are platform-specific. Confidence: high · Verified: OpenAI: Crawlers Anthropic xác định riêng ClaudeBot, Claude-SearchBot và Claude-User, đồng thời tài liệu hóa cách xử lý robots.txt. Evidence for this claim Anthropic documents ClaudeBot, Claude-SearchBot, and Claude-User separately and says its bots honor robots.txt directives. Scope: Anthropic-declared bots; user-initiated retrieval has additional product-specific conditions. Confidence: high · Verified: Anthropic: Bot information

Tóm tắt — Crawler AI chia thành ba nhóm; trộn lẫn chúng là sai lầm gần như ai cũng mắc. Bot huấn luyện (GPTBot, ClaudeBot, CCBot, Bytespider, Amazonbot, Meta-ExternalAgent) scrape để xây corpus cho model. Bot tìm kiếm AI (OAI-SearchBot, PerplexityBot, Applebot, Amzn-SearchBot) xây chỉ mục để trích dẫn. Fetcher do người dùng kích hoạt (ChatGPT-User, Perplexity-User, Claude-User) lấy trang trực tiếp khi có người yêu cầu. Mỗi bot có user-agent và quy tắc robots.txt riêng, nên chặn GPTBot không ảnh hưởng OAI-SearchBot. Google-Extended và Applebot-Extended là token, không phải bot — chúng không crawl mà chỉ cho phép bạn opt out khỏi huấn luyện/grounding. Chặn bot huấn luyện không ảnh hưởng xếp hạng Google; chặn bot tìm kiếm AI làm giảm khả năng hiển thị trong câu trả lời AI. Tranh luận robots.txt có cơ sở với fetcher người dùng (nhà vận hành nói quy tắc “may not apply” (bản dịch) «có thể không áp dụng») và Perplexity (được báo cáo crawl lén). llms.txt là đề xuất, phần lớn không được đọc và chưa được các nhà cung cấp lớn áp dụng.

Ba nhóm — trục chính của toàn bộ chủ đề

Classify the purpose before writing the rule: training, AI-search visibility, and live user fetching are separate decisions. Nguồn: /technical-seo/how-search-works/crawling/crawler/ai-crawlers/

Training crawlers such as GPTBot, ClaudeBot, and CCBot collect data for model corpora. AI-search crawlers such as OAI-SearchBot and PerplexityBot build indexes used for answers and citations. User-triggered agents such as ChatGPT-User and Claude-User fetch a page for a live request. Blocking one category does not automatically block the others.

© Patrick Stox LLC · CC BY 4.0 ·

Mọi bot AI được nêu tên đều thuộc một trong ba nhóm. Xác định đúng nhóm thì mọi quyết định tiếp theo (chặn hay cho phép? SEO bị ảnh hưởng gì?) sẽ rõ.

1. Crawler huấn luyện / thu thập dữ liệu. Chúng crawl ở quy mô lớn để xây corpus cho việc huấn luyện và fine-tune LLM. Đây là nhóm phần lớn publisher muốn chặn, và việc từ chối chúng không ảnh hưởng xếp hạng tìm kiếm. Thành viên gồm GPTBot (OpenAI), ClaudeBot (Anthropic), CCBot (Common Crawl), Bytespider (ByteDance), Amazonbot (Amazon), Meta-ExternalAgent (Meta), AI2Bot (Allen Institute), cohere-training-data-crawler (Cohere), Diffbot, Timpibot (Timpi), webzio-extended (Webz.io). Ngoài ra còn hai token kiểm soát KHÔNG phải crawler riêng — Google-ExtendedApplebot-Extended — được trình bày bên dưới.

2. Crawler tìm kiếm / lập chỉ mục AI. Chúng xây chỉ mục trực tiếp dùng để trả lời truy vấn kèm trích dẫn và liên kết về bạn. Chặn chúng có thể loại bạn khỏi kết quả tìm kiếm AI. Thành viên: OAI-SearchBot (OpenAI — khác GPTBot), PerplexityBot (Perplexity), Applebot (Apple — hỗ trợ đề xuất Spotlight/Siri/Safari), Amzn-SearchBot (Amazon).

3. Fetcher do người dùng kích hoạt / theo yêu cầu. Chúng fetch trực tiếp một trang cụ thể vì người dùng đặt câu hỏi, không phải bot tự đi khắp web. Nhà vận hành thường nói robots.txt không ràng buộc fetch do người dùng khởi tạo — một vùng tranh cãi. Thành viên: ChatGPT-User (OpenAI), Perplexity-User (Perplexity), Claude-UserClaude-SearchBot (Anthropic), Amzn-User (Amazon, cho Alexa), Meta-ExternalFetcher (Meta).

Bảng đầy đủ về token user-agent và mức tuân thủ robots.txt nằm trong thẻ Bảng tra nhanh — đây là bảng trung tâm của bài.

Cạm bẫy “token, không phải bot” (Google-Extended và Applebot-Extended)

Đây là dữ kiện bị hiểu sai nhiều nhất, nên cần nói chính xác. Google-Extended và Applebot-Extended không crawl gì cả. Chúng không có user-agent độc lập và không tạo traffic crawl. Đây là token kiểm soát robots.txt làm thay đổi cách các lượt crawl hiện có được phép sử dụng nội dung.

  • Google-Extended kiểm soát việc dùng nội dung để cải thiện Gemini Apps và model tạo sinh Vertex AI, gồm grounding ngoài Google Search. Nó không kiểm soát AI Overviews hay AI Mode của Google Search; các sản phẩm đó dùng quyền truy cập Googlebot. Google nói rõ: “Google-Extended does not impact a site’s inclusion in Google Search nor is it used as a ranking signal in Google Search.” (bản dịch) «Google-Extended không ảnh hưởng việc site được đưa vào Google Search và cũng không được dùng làm tín hiệu xếp hạng trong Google Search.» Từ chối token này không ảnh hưởng Googlebot hay xếp hạng.
  • Applebot-Extended có vai trò tương tự với Apple. Apple nói: “Applebot-Extended does not crawl webpages. Webpages that disallow Applebot-Extended can still be included in search results.” (bản dịch) «Applebot-Extended không crawl trang web. Trang từ chối Applebot-Extended vẫn có thể được đưa vào kết quả tìm kiếm.» Token này cho phép opt out khỏi huấn luyện foundation model Apple (Apple Intelligence); trang vẫn xuất hiện trong Spotlight/Siri qua crawler thật là Applebot.

Vì vậy Disallow: Google-ExtendedDisallow: Applebot-Extended là biện pháp kiểm soát cách dùng sản phẩm, không phải lệnh chặn crawl độc lập. Phạm vi được công bố không xóa trang khỏi chỉ mục tìm kiếm tương ứng, nhưng hai token không hoán đổi cho nhau và không nên cùng bị rút gọn thành “bot huấn luyện”.

Các nhà vận hành lớn và từng bot

OpenAI vận hành bốn bot đã khai báo, mỗi bot độc lập: GPTBot (huấn luyện — “used to make our generative AI foundation models more useful and safe” (bản dịch) «dùng để làm foundation model AI tạo sinh hữu ích và an toàn hơn»), OAI-SearchBot (tìm kiếm — “used to surface websites in search results in ChatGPT’s search features” (bản dịch) «dùng để hiển thị website trong kết quả tìm kiếm của tính năng tìm kiếm ChatGPT»), ChatGPT-User (fetcher người dùng — “used for certain user actions in ChatGPT” (bản dịch) «dùng cho một số hành động người dùng trong ChatGPT») và OAI-AdsBot (phạm vi quảng cáo độc lập, không huấn luyện và không lập chỉ mục tìm kiếm). Dòng chính sách của OpenAI là mẫu cho toàn bộ lĩnh vực: “Each bot setting is independent, allowing webmasters granular control over how their content interacts with different OpenAI systems.” (bản dịch) «Mỗi cài đặt bot độc lập, cho phép webmaster kiểm soát chi tiết cách nội dung tương tác với các hệ thống OpenAI khác nhau.» Từ chối GPTBot “signals that future data from these materials should be excluded from model training datasets” (bản dịch) «báo hiệu dữ liệu tương lai từ tài liệu này phải bị loại khỏi tập dữ liệu huấn luyện model»; từ chối OAI-SearchBot nghĩa là site “won’t appear in ChatGPT search results” (bản dịch) «sẽ không xuất hiện trong kết quả tìm kiếm ChatGPT».

Anthropic vận hành ba bot: ClaudeBot (huấn luyện), Claude-SearchBot (lập chỉ mục tìm kiếm) và Claude-User (fetch người dùng). Anthropic nói bot của họ “respect ‘do not crawl’ signals by honoring industry standard directives in robots.txt” (bản dịch) «tôn trọng tín hiệu ‘không crawl’ bằng cách tuân theo directive tiêu chuẩn ngành trong robots.txt». Trang hỗ trợ hiện hành cũng trỏ tới danh sách IP dùng chung đã công bố để xác minh riêng Anthropic. Danh sách của nhà cung cấp này là bằng chứng danh tính, không phải quy tắc IP hay DNS ngược phổ quát cho mọi bot.

Google — điểm mấu chốt đã nêu ở trên: Google-Extended là token, không phải bot. Google còn vận hành Google-CloudVertexBot (crawl cho Vertex AI Agent theo yêu cầu của chủ site; không ảnh hưởng xếp hạng) và các agent do người dùng kích hoạt như Gemini-Deep-ResearchGoogle-NotebookLM.

Apple vận hành Applebot (crawler thật hỗ trợ đề xuất Spotlight/Siri/Safari và “may also be used to help train Apple foundation models” (bản dịch) «cũng có thể được dùng để hỗ trợ huấn luyện foundation model Apple») cùng token Applebot-Extended. Chặn Applebot loại bạn khỏi tìm kiếm Apple; chặn Applebot-Extended chỉ opt out khỏi huấn luyện.

Perplexity khai báo hai bot: PerplexityBot (tìm kiếm/trích dẫn — được nói rõ là “not used to crawl content for AI foundation models” (bản dịch) «không dùng để crawl nội dung cho foundation model AI», nên Perplexity không khai báo crawler huấn luyện) và Perplexity-User (fetch người dùng). Tài liệu nói Perplexity-User “generally ignores robots.txt rules” (bản dịch) «thường bỏ qua quy tắc robots.txt» vì request do người dùng khởi tạo. Perplexity cũng là chủ thể của báo cáo crawl lén — xem tranh luận bên dưới.

Amazon vận hành ba bot, tạo một ngoại lệ hữu ích: Amazonbot (cải thiện sản phẩm và “may be used to train Amazon AI models” (bản dịch) «có thể dùng để huấn luyện model AI Amazon»), Amzn-SearchBot (tìm kiếm) và Amzn-User (fetch người dùng Alexa). Theo tài liệu Amazon, Amzn-SearchBot và Amzn-User KHÔNG crawl để huấn luyện model AI tạo sinh — vì vậy “mọi công ty AI đều scrape để huấn luyện” là ngộ nhận. Amazon còn hiểu meta tag noarchive theo nghĩa đặc biệt: không dùng trang để huấn luyện model — một cơ chế opt out theo trang hiếm gặp.

Cách Amazon xử lý robots có hai điểm vận hành bất thường: crawler có thể dùng bản robots.txt được cache trong 30 ngày trước đó, và Amazon nói nếu không fetch được file thì crawler hành xử như thể file không tồn tại. Điều đó không có nghĩa một lần audit không fetch được chứng minh Amazon thấy trạng thái cho phép tất cả; audit và Amazon có thể tiếp cận host ở thời điểm hoặc đường mạng khác nhau. Evidence for this claim Amazon says its crawlers may use a robots.txt copy cached within the previous 30 days. Scope: Amazon crawler behavior only; a current audit fetch cannot identify which cached copy Amazon used. Confidence: high · Verified: Amazon: Amazonbot Evidence for this claim Amazon says its crawlers behave as if robots.txt does not exist when they cannot fetch it. Scope: Amazon crawler behavior only; a tool-side fetch failure is not proof that Amazon observed the same failure. Confidence: high · Verified: Amazon: Amazonbot

Meta vận hành Meta-ExternalAgent (huấn luyện/lập chỉ mục cho Llama và Meta AI), Meta-ExternalFetcher (fetch người dùng) và riêng Facebookbot (preview liên kết — không phải crawler AI). Chặn Meta-ExternalAgent không ảnh hưởng preview liên kết Facebook.

Common Crawl (CCBot) do một tổ chức phi lợi nhuận vận hành và duy trì kho lưu trữ web mở. Đây là lớp ẩn: dataset Common Crawl đã được dùng để huấn luyện ChatGPT, Claude, LLaMA và nhiều model khác — vì vậy chặn CCBot có tác động downstream tới model không bao giờ trực tiếp crawl bạn. Common Crawl cũng cảnh báo có đối tượng mạo danh CCBot.

ByteDance (Bytespider) là trường hợp mạnh tay: tuyên bố tuân thủ robots.txt nhưng bị báo cáo rộng rãi là vi phạm với lượng request rất cao. Các tên khác nên biết: AI2Bot (Allen Institute, model mở / dataset Dolma), Cohere, Diffbot (trích xuất dữ liệu có cấu trúc, đầu ra được nhiều pipeline AI downstream dùng) và Timpibot / webzio-extended.

Bot AI có thực sự tuân thủ robots.txt không?

Với crawler huấn luyện và tìm kiếm, các nhà vận hành lớn (OpenAI, Anthropic, Google, Apple, Amazon) đều nói trong tài liệu rằng họ tuân thủ robots.txt. Vùng gây tranh cãi là fetcher do người dùng kích hoạt, nơi một số nhà vận hành nói rõ robots.txt có thể không áp dụng vì có người khởi tạo request — OpenAI nói “these actions are initiated by a user, robots.txt rules may not apply” (bản dịch) «các hành động này do người dùng khởi tạo, quy tắc robots.txt có thể không áp dụng»; Perplexity nói Perplexity-User “generally ignores robots.txt rules” (bản dịch) «thường bỏ qua quy tắc robots.txt». Đó là chính sách được công bố, không phải vi phạm.

Tranh luận Perplexity là vụ việc nổi bật và cần gắn nhãn được báo cáo, chưa ngã ngũ. Tháng 6/2024, Wired và developer Robb Knight báo cáo Perplexity truy cập nội dung từ site đã chặn, dường như dùng IP không được liệt kê. Tháng 8/2025, Cloudflare báo cáo Perplexity dùng user-agent lén giả Chrome trên macOS, luân chuyển IP và ASN để né chặn, rồi fetch nội dung từ domain thử nghiệm mới có Disallow: / đầy đủ — sau đó Cloudflare loại Perplexity khỏi danh sách bot đã xác minh. Hãy trình bày đây là báo cáo có tài liệu từ các nguồn đó; tài liệu của Perplexity vẫn khẳng định PerplexityBot tuân thủ robots.txt.

Vì một số bot bỏ qua robots.txt ở mức nào đó, Cloudflare đã trở thành lớp thực thi thực tế — chặn cấp mạng, nút “AI Scrapers and Crawlers” (bản dịch) «Scraper và crawler AI» một lần nhấp, robots.txt được quản lý, theo dõi vi phạm robots.txt và bản beta trả phí theo lượt crawl. Từ tháng 7/2025, domain Cloudflare mới chặn crawler AI đã biết theo mặc định.

Cách kiểm soát crawler AI

  • robots.txt theo từng user-agent là đòn bẩy chính và có tính chi tiết: chặn GPTBot không chặn OAI-SearchBot hay ChatGPT-User. Công thức robots.txt (chặn mọi bot huấn luyện, chặn bot tìm kiếm AI) nằm trong thẻ Scripts.
  • Token huấn luyệnGoogle-ExtendedApplebot-Extended — cho phép opt out khỏi huấn luyện Gemini/Apple Intelligence mà không mất tìm kiếm.
  • Meta tag noarchive của Amazon là opt out huấn luyện theo trang.
  • Cloudflare AI Crawl Control — chặn/cho phép/tính phí ở cấp mạng, kèm robots.txt được quản lý và directive Content Signals (search, ai-input, ai-train); mặc định là search=yes, ai-train=no.
  • llms.txtđề xuất (Jeremy Howard / Answer.AI, tháng 9/2024), không phải tiêu chuẩn đã áp dụng — và không được crawler lớn tuân theo. Đây là bản đồ markdown tuyển chọn để đọc lúc inference, nhưng nghiên cứu Ahrefs trên 137 000 site thấy 97% file llms.txt đã xuất bản nhận không có request, và không nhà cung cấp LLM lớn nào chính thức áp dụng. Hãy xem nó là công cụ tài liệu, không phải công cụ tìm kiếm AI.
  • Dự án cộng đồng ai.robots.txt duy trì file Disallow: / đầy đủ liệt kê hơn 150 user-agent bot AI — tài liệu tham khảo hữu ích để chặn toàn bộ.

Chính sách crawler ưu tiên khả năng hiển thị

Với một site giáo dục hoặc thương mại công khai muốn hiện diện trong tìm kiếm AI, chính sách mặc định của tôi là:

  1. Cho phép crawler tìm kiếm thông thường phục vụ các bề mặt tìm kiếm bạn muốn, gồm Googlebot và Bingbot.
  2. Cho phép crawler tìm kiếm/lập chỉ mục AI được tài liệu hóa như OAI-SearchBot, Claude-SearchBotPerplexityBot trên nội dung công khai.
  3. Cho phép fetcher dự kiến do người dùng điều khiển như ChatGPT-User, Claude-UserPerplexity-User, đồng thời nhận biết hành vi robots khác nhau theo nhà cung cấp. Evidence for this claim OpenAI publishes separate controls for GPTBot, OAI-SearchBot, and ChatGPT-User, and says each setting is independent. Scope: OpenAI-declared crawlers and user agents; their purposes and robots behavior are platform-specific. Confidence: high · Verified: OpenAI: Crawlers Evidence for this claim Anthropic documents ClaudeBot, Claude-SearchBot, and Claude-User separately and says its bots honor robots.txt directives. Scope: Anthropic-declared bots; user-initiated retrieval has additional product-specific conditions. Confidence: high · Verified: Anthropic: Bot information Evidence for this claim Perplexity documents PerplexityBot for search indexing separately from Perplexity-User for user-requested fetches, with different robots behavior. Scope: Perplexity-declared crawlers and published IP ranges; a user-agent string alone does not verify identity. Confidence: high · Verified: Perplexity: Crawlers
  4. Đưa ra quyết định quyền riêng cho quyền truy cập huấn luyện/phát triển model. GPTBot, ClaudeBot, Google-Extended và biện pháp huấn luyện khác không cần dùng cùng chính sách tìm kiếm. Chỉ cho phép nếu phù hợp chính sách xuất bản.
  5. Bảo vệ route riêng tư và vận hành bằng xác thực. Giữ /admin/, preview, dữ liệu tài khoản và API không công khai sau authorization phía máy chủ; Disallow chỉ là tùy chọn crawler.
  6. Xác minh danh tính trước khi bỏ qua kiểm soát WAF. Kết hợp user-agent được tài liệu hóa với dải IP hiện hành của nhà cung cấp, xác minh DNS ngược hoặc xác thực bot được hỗ trợ. Không tạo quy tắc WAF cho phép rộng chỉ từ user-agent có thể giả mạo.

Đừng thêm nhóm user-agent cụ thể chỉ để nói Allow: / trừ khi lặp lại mọi hạn chế vẫn phải áp dụng. Theo quy tắc khớp robots riêng của nhà cung cấp, nhóm cụ thể có thể thay thế nhóm wildcard thay vì kế thừa lệnh loại trừ đường dẫn riêng tư. File an toàn đơn giản nhất thường là một nhóm wildcard tự đủ an toàn cộng với opt out huấn luyện có phạm vi hẹp.

Với site này, chính sách công khai hiện hành là cho phép rõ ràng tìm kiếm, đầu vào AI và huấn luyện AI, đồng thời loại trừ route admin, preview, API, trap và gateway. Tôi sẽ tiếp tục cho phép tìm kiếm và retrieval do người dùng điều khiển. Tôi chỉ đổi ai-train=yes như quyết định quyền biên tập — không phải chiến thuật hiển thị AI — vì quyền huấn luyện chưa có lợi ích trích dẫn được chứng minh.

Quyền truy cập của crawler AI không đồng nghĩa với mức sẵn sàng cho AI

Quy tắc cho phép nhiều nhất chỉ chứng minh chính sách robots đã khai báo cho phép agent mang tên đó request URL. Nó không chứng minh nhà vận hành tuân thủ chính sách, đã fetch trang, render, trích xuất thông tin quan trọng, đưa vào context model, trích dẫn hay hoàn tất hành động.

Tách riêng năm lớp sau:

LớpCâu hỏiBằng chứng
QuyềnAgent mang tên này có thể request URL theo chính sách đã khai báo không?Phép thử robots hiệu lực và quyền truy cập mạng
Khả năng trích xuấtNội dung quan trọng có trong văn bản, liên kết, metadata hoặc dữ liệu có cấu trúc ổn định không?Bản chụp thô và đã render kèm trích xuất trường
RenderNội dung có tồn tại qua năng lực trình duyệt/JavaScript thực tế của agent không?Bằng chứng fetch riêng theo nhà cung cấp khi có; nếu không, nêu giới hạn phép thử
Khả năng vận hànhAgent có thể xác định và gọi hành động dự kiến một cách an toàn không?Hợp đồng tool/interface được tài liệu hóa và phép thử end-to-end có kiểm soát
Mức sẵn sàng thương mạiDanh tính, giá, tồn kho, chính sách, fulfillment, giỏ hàng và checkout có nhất quán không?Đối soát feed/trang/backend/đơn hàng

Vì vậy công cụ kiểm tra quyền crawler nên báo được phép, bị chặn hoặc không xác định cho chính sách — không phải “sẵn sàng cho AI”. Request log thành công chứng minh request đã xảy ra; không chứng minh trang được dùng trong câu trả lời. Feed hoặc khai báo tool hợp lệ cũng không chứng minh trang công khai render đúng hay checkout có thể thực hiện offer được trình bày.

Dùng Cách tìm kiếm AI hoạt động cho các lớp retrieval và trích dẫn, và Tối ưu mua sắm AI cho mức sẵn sàng catalog và giao dịch. Tách các lớp giúp cách sửa cụ thể: sửa chính sách truy cập khi bị chặn, đầu ra trang cho trích xuất, render cho trạng thái bị thiếu, hợp đồng interface cho khả năng vận hành hoặc dữ liệu thương mại cho giao dịch thất bại.

Với trang ecommerce, phép thử khả năng trích xuất phải xác minh danh tính sản phẩm cốt lõi và offer đã chọn — SKU, group ID, giá, tiền tệ và tình trạng còn hàng — có trong phản hồi ban đầu và vẫn nhất quán sau render. Tiêu chuẩn trang sản phẩm thô so với đã render xác định thứ phải hiển thị từ máy chủ; riêng quyền crawler không nói gì về hợp đồng này.

Ngộ nhận làm mất traffic: huấn luyện ≠ tìm kiếm AI

Đây là điểm phải hiểu đúng. Chặn bot huấn luyện không giống chặn bot tìm kiếm AI. Chúng là quy tắc robots.txt riêng với hệ quả trái ngược:

  • Chặn bot huấn luyện (GPTBot, ClaudeBot, CCBot, Bytespider, cộng token Google-Extended/Applebot-Extended) → không ảnh hưởng xếp hạng Google, được Google và dữ liệu publisher thực nghiệm xác nhận. Bạn chỉ opt out khỏi huấn luyện model.
  • Chặn bot tìm kiếm AI (OAI-SearchBot, PerplexityBot) → mất khả năng hiển thị trong câu trả lời ChatGPT và Perplexity. Đó là đánh đổi thật, không miễn phí.

Nếu chặn quá rộng — chẳng hạn quy tắc toàn bộ bắt OAI-SearchBot trong khi bạn chỉ muốn dừng huấn luyện — bạn có thể âm thầm tự xóa khỏi tìm kiếm AI. Hãy xác định chính xác nhóm mà từng quy tắc tác động.

Vì sao publisher vẫn chặn: hợp đồng xã hội

Lý do tranh luận tồn tại cuối cùng là traffic. Như tôi viết trong phân tích bot AI, “there’s a cost to bots crawling your websites and there’s a social contract between search engines and website owners, where search engines add value by sending referral traffic to websites. Google sends traffic (for now), so they don’t get blocked.” (bản dịch) «Bot crawl website tạo chi phí và có hợp đồng xã hội giữa công cụ tìm kiếm với chủ website, trong đó công cụ tìm kiếm mang lại giá trị bằng referral traffic. Google gửi traffic (hiện tại), nên họ không bị chặn.» Crawler AI đến nay phần lớn không gửi traffic trở lại — dữ liệu củng cố mối lo này. Trong phân tích Cloudflare Radar, bot AI đã vững vị trí crawler số 2 sau công cụ tìm kiếm và có xu hướng vượt lên. Xem thêm trong thẻ Số liệu.

Tiết lộ: Tôi là cựu nhân viên Ahrefs và nhận quyền truy cập Ahrefs miễn phí. Phân tích crawler được liên kết là công trình tôi xuất bản trong vai trò đó; Ahrefs không đánh giá hay phê duyệt kết luận biên tập hiện tại của site này.

Để hiểu pipeline rộng hơn — discovery, bộ lập lịch crawl, render và khác biệt giữa crawl với lập chỉ mục — xem hub crawl cùng các chủ đề song hành về crawler nói chung, user-agent, Googlebot, Bingbot và robots.txt.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.