Crawler AI
Crawler AI dùng cho huấn luyện, tìm kiếm và fetch theo yêu cầu khác nhau thế nào; cách xác định bot, đặt robots.txt và tránh chặn nhầm khả năng hiển thị AI.
Ngôn ngữ
2 tín hiệu bằng chứng trên trang này
- Dữ liệu nguồn được liên kếtdanh sách IP dùng chung đã công bố
- Công cụ trực tuyến liên quanLog File Analyzer
Crawler AI gồm ba nhóm: bot huấn luyện, bot tìm kiếm AI và fetcher do người dùng kích hoạt. Mỗi bot có token và chính sách riêng; Google-Extended cùng Applebot-Extended chỉ là token kiểm soát, không phải crawler. Chặn huấn luyện không ảnh hưởng xếp hạng Google, nhưng chặn bot tìm kiếm AI làm giảm khả năng xuất hiện trong câu trả lời AI. Xác minh danh tính và dùng kiểm soát mạng riêng khi robots.txt không đủ.
OpenAI công bố các biện pháp kiểm soát riêng cho bot huấn luyện, tìm kiếm và hành động người dùng. Evidence for this claim OpenAI publishes separate controls for GPTBot, OAI-SearchBot, and ChatGPT-User, and says each setting is independent. Scope: OpenAI-declared crawlers and user agents; their purposes and robots behavior are platform-specific. Confidence: high · Verified: OpenAI: Crawlers Anthropic cũng tài liệu hóa riêng agent huấn luyện, tìm kiếm và request người dùng. Evidence for this claim Anthropic documents ClaudeBot, Claude-SearchBot, and Claude-User separately and says its bots honor robots.txt directives. Scope: Anthropic-declared bots; user-initiated retrieval has additional product-specific conditions. Confidence: high · Verified: Anthropic: Bot information
Evidence for this claim Cloudflare Radar reports worldwide Cloudflare-observed HTTP request trends for the five most active AI bots during the 28 days ending 2026-07-30. Scope: A dated Cloudflare Radar context chart; it is not site-specific traffic and is not a census of all web requests. Confidence: high · Verified: Cloudflare Radar: HTTP traffic by AI botThe chart compares request trends for the five most active AI bots observed by Cloudflare during the selected four-week period, including Googlebot, ClaudeBot, Meta-ExternalAgent, GPTBot, and Bingbot.
Tóm tắt — “Crawler AI” không phải một loại mà có ba nhóm. Một số bot scrape site để huấn luyện model AI (như GPTBot và ClaudeBot). Một số xây chỉ mục để tìm kiếm AI có thể trích dẫn bạn (như OAI-SearchBot và PerplexityBot). Nhóm khác fetch trang trực tiếp vì người dùng vừa đặt câu hỏi (như ChatGPT-User). Mỗi bot có tên riêng trong
robots.txt, nên có thể cho phép hoặc chặn riêng. Chặn bot huấn luyện không ảnh hưởng xếp hạng Google; chặn bot tìm kiếm AI có thể khiến bạn biến mất khỏi câu trả lời AI.
Crawler AI là gì
Bạn đã biết crawler tìm kiếm — crawler như Googlebot hoặc Bingbot truy cập trang để chúng có thể xuất hiện trong tìm kiếm. Crawler AI là nhóm mới hơn: bot do công ty AI (OpenAI, Anthropic, Google, Apple, Perplexity và các bên khác) vận hành để fetch trang cho mục đích của họ.
Điều quan trọng cần hiểu trước khi chặn bất cứ thứ gì: không phải bot nào cũng làm cùng một việc. Có ba nhóm.
- Bot huấn luyện đọc trang để giúp xây và cải thiện model AI. GPTBot (OpenAI) và ClaudeBot (Anthropic) là hai ví dụ nổi tiếng.
- Bot tìm kiếm AI đọc trang để xây chỉ mục có thể tìm kiếm; khi ai đó hỏi ChatGPT hoặc Perplexity, hệ thống có thể trả lời và liên kết tới bạn. OAI-SearchBot và PerplexityBot làm việc này.
- Fetcher do người dùng kích hoạt lấy một trang cụ thể theo thời gian thực vì có người vừa yêu cầu. ChatGPT-User là ví dụ — nó không tự đi khắp web mà thực hiện nhiệm vụ cho người dùng.
Vì sao sự khác biệt này quan trọng
Mỗi bot có tên riêng (tức user-agent riêng), và file robots.txt có thể cho phép hoặc chặn từng bot theo đúng tên. Vì vậy, bạn có thể quyết định riêng từng việc:
- Tôi có chấp nhận công ty AI huấn luyện trên nội dung của mình không? → liên quan bot huấn luyện.
- Tôi có muốn xuất hiện trong câu trả lời ChatGPT và Perplexity không? → liên quan bot tìm kiếm AI. Phần lớn mọi người muốn giữ các bot này.
Đây là ngộ nhận lớn cần loại bỏ: chặn bot AI không làm hại xếp hạng Google. Google nói trực tiếp như vậy, và publisher chặn bot huấn luyện AI vẫn xếp hạng bình thường. Nhưng nếu chặn bot tìm kiếm AI, bạn có thể biến mất khỏi câu trả lời AI — đừng vô tình chặn nhầm nhóm.
Những tên sẽ xuất hiện trong log
- GPTBot — OpenAI, huấn luyện.
- OAI-SearchBot — OpenAI, hỗ trợ tìm kiếm ChatGPT.
- ChatGPT-User — OpenAI, fetch trực tiếp khi người dùng yêu cầu.
- ClaudeBot — Anthropic, huấn luyện.
- PerplexityBot — Perplexity, tìm kiếm/trích dẫn.
- CCBot — Common Crawl, tổ chức phi lợi nhuận có dữ liệu huấn luyện nhiều model AI.
- Bytespider — ByteDance (công ty mẹ TikTok), huấn luyện.
- Applebot — Apple, hỗ trợ Siri/Spotlight và Apple Intelligence.
Hai tên khác bạn sẽ gặp — Google-Extended và Applebot-Extended — không phải crawler thực. Chúng chỉ là công tắc trong robots.txt nói “don’t use my content to train your AI.” (bản dịch) «đừng dùng nội dung của tôi để huấn luyện AI». Chúng không fetch gì cả.
Muốn xem bảng đầy đủ theo từng bot, công thức robots.txt, tranh luận “bot có thực sự tuân thủ robots.txt không?” và có nên chặn hay không? Hãy chuyển sang thẻ Nâng cao.
OpenAI nói cài đặt cho GPTBot, OAI-SearchBot và ChatGPT-User độc lập. Evidence for this claim OpenAI publishes separate controls for GPTBot, OAI-SearchBot, and ChatGPT-User, and says each setting is independent. Scope: OpenAI-declared crawlers and user agents; their purposes and robots behavior are platform-specific. Confidence: high · Verified: OpenAI: Crawlers Anthropic xác định riêng ClaudeBot, Claude-SearchBot và Claude-User, đồng thời tài liệu hóa cách xử lý robots.txt. Evidence for this claim Anthropic documents ClaudeBot, Claude-SearchBot, and Claude-User separately and says its bots honor robots.txt directives. Scope: Anthropic-declared bots; user-initiated retrieval has additional product-specific conditions. Confidence: high · Verified: Anthropic: Bot information
Tóm tắt — Crawler AI chia thành ba nhóm; trộn lẫn chúng là sai lầm gần như ai cũng mắc. Bot huấn luyện (GPTBot, ClaudeBot, CCBot, Bytespider, Amazonbot, Meta-ExternalAgent) scrape để xây corpus cho model. Bot tìm kiếm AI (OAI-SearchBot, PerplexityBot, Applebot, Amzn-SearchBot) xây chỉ mục để trích dẫn. Fetcher do người dùng kích hoạt (ChatGPT-User, Perplexity-User, Claude-User) lấy trang trực tiếp khi có người yêu cầu. Mỗi bot có user-agent và quy tắc
robots.txtriêng, nên chặn GPTBot không ảnh hưởng OAI-SearchBot. Google-Extended và Applebot-Extended là token, không phải bot — chúng không crawl mà chỉ cho phép bạn opt out khỏi huấn luyện/grounding. Chặn bot huấn luyện không ảnh hưởng xếp hạng Google; chặn bot tìm kiếm AI có làm giảm khả năng hiển thị trong câu trả lời AI. Tranh luận robots.txt có cơ sở với fetcher người dùng (nhà vận hành nói quy tắc “may not apply” (bản dịch) «có thể không áp dụng») và Perplexity (được báo cáo crawl lén). llms.txt là đề xuất, phần lớn không được đọc và chưa được các nhà cung cấp lớn áp dụng.
Ba nhóm — trục chính của toàn bộ chủ đề
Training crawlers such as GPTBot, ClaudeBot, and CCBot collect data for model corpora. AI-search crawlers such as OAI-SearchBot and PerplexityBot build indexes used for answers and citations. User-triggered agents such as ChatGPT-User and Claude-User fetch a page for a live request. Blocking one category does not automatically block the others.
© Patrick Stox LLC · CC BY 4.0 ·
Mọi bot AI được nêu tên đều thuộc một trong ba nhóm. Xác định đúng nhóm thì mọi quyết định tiếp theo (chặn hay cho phép? SEO bị ảnh hưởng gì?) sẽ rõ.
1. Crawler huấn luyện / thu thập dữ liệu. Chúng crawl ở quy mô lớn để xây corpus cho việc huấn luyện và fine-tune LLM. Đây là nhóm phần lớn publisher muốn chặn, và việc từ chối chúng không ảnh hưởng xếp hạng tìm kiếm. Thành viên gồm GPTBot (OpenAI), ClaudeBot (Anthropic), CCBot (Common Crawl), Bytespider (ByteDance), Amazonbot (Amazon), Meta-ExternalAgent (Meta), AI2Bot (Allen Institute), cohere-training-data-crawler (Cohere), Diffbot, Timpibot (Timpi), webzio-extended (Webz.io). Ngoài ra còn hai token kiểm soát KHÔNG phải crawler riêng — Google-Extended và Applebot-Extended — được trình bày bên dưới.
2. Crawler tìm kiếm / lập chỉ mục AI. Chúng xây chỉ mục trực tiếp dùng để trả lời truy vấn kèm trích dẫn và liên kết về bạn. Chặn chúng có thể loại bạn khỏi kết quả tìm kiếm AI. Thành viên: OAI-SearchBot (OpenAI — khác GPTBot), PerplexityBot (Perplexity), Applebot (Apple — hỗ trợ đề xuất Spotlight/Siri/Safari), Amzn-SearchBot (Amazon).
3. Fetcher do người dùng kích hoạt / theo yêu cầu. Chúng fetch trực tiếp một trang cụ thể vì người dùng đặt câu hỏi, không phải bot tự đi khắp web. Nhà vận hành thường nói robots.txt không ràng buộc fetch do người dùng khởi tạo — một vùng tranh cãi. Thành viên: ChatGPT-User (OpenAI), Perplexity-User (Perplexity), Claude-User và Claude-SearchBot (Anthropic), Amzn-User (Amazon, cho Alexa), Meta-ExternalFetcher (Meta).
Bảng đầy đủ về token user-agent và mức tuân thủ robots.txt nằm trong thẻ Bảng tra nhanh — đây là bảng trung tâm của bài.
Cạm bẫy “token, không phải bot” (Google-Extended và Applebot-Extended)
Đây là dữ kiện bị hiểu sai nhiều nhất, nên cần nói chính xác. Google-Extended và Applebot-Extended không crawl gì cả. Chúng không có user-agent độc lập và không tạo traffic crawl. Đây là token kiểm soát robots.txt làm thay đổi cách các lượt crawl hiện có được phép sử dụng nội dung.
- Google-Extended kiểm soát việc dùng nội dung để cải thiện Gemini Apps và model tạo sinh Vertex AI, gồm grounding ngoài Google Search. Nó không kiểm soát AI Overviews hay AI Mode của Google Search; các sản phẩm đó dùng quyền truy cập Googlebot. Google nói rõ: “Google-Extended does not impact a site’s inclusion in Google Search nor is it used as a ranking signal in Google Search.” (bản dịch) «Google-Extended không ảnh hưởng việc site được đưa vào Google Search và cũng không được dùng làm tín hiệu xếp hạng trong Google Search.» Từ chối token này không ảnh hưởng Googlebot hay xếp hạng.
- Applebot-Extended có vai trò tương tự với Apple. Apple nói: “Applebot-Extended does not crawl webpages. Webpages that disallow Applebot-Extended can still be included in search results.” (bản dịch) «Applebot-Extended không crawl trang web. Trang từ chối Applebot-Extended vẫn có thể được đưa vào kết quả tìm kiếm.» Token này cho phép opt out khỏi huấn luyện foundation model Apple (Apple Intelligence); trang vẫn xuất hiện trong Spotlight/Siri qua crawler thật là Applebot.
Vì vậy Disallow: Google-Extended và Disallow: Applebot-Extended là biện pháp kiểm soát cách dùng sản phẩm, không phải lệnh chặn crawl độc lập. Phạm vi được công bố không xóa trang khỏi chỉ mục tìm kiếm tương ứng, nhưng hai token không hoán đổi cho nhau và không nên cùng bị rút gọn thành “bot huấn luyện”.
Các nhà vận hành lớn và từng bot
OpenAI vận hành bốn bot đã khai báo, mỗi bot độc lập: GPTBot (huấn luyện — “used to make our generative AI foundation models more useful and safe” (bản dịch) «dùng để làm foundation model AI tạo sinh hữu ích và an toàn hơn»), OAI-SearchBot (tìm kiếm — “used to surface websites in search results in ChatGPT’s search features” (bản dịch) «dùng để hiển thị website trong kết quả tìm kiếm của tính năng tìm kiếm ChatGPT»), ChatGPT-User (fetcher người dùng — “used for certain user actions in ChatGPT” (bản dịch) «dùng cho một số hành động người dùng trong ChatGPT») và OAI-AdsBot (phạm vi quảng cáo độc lập, không huấn luyện và không lập chỉ mục tìm kiếm). Dòng chính sách của OpenAI là mẫu cho toàn bộ lĩnh vực: “Each bot setting is independent, allowing webmasters granular control over how their content interacts with different OpenAI systems.” (bản dịch) «Mỗi cài đặt bot độc lập, cho phép webmaster kiểm soát chi tiết cách nội dung tương tác với các hệ thống OpenAI khác nhau.» Từ chối GPTBot “signals that future data from these materials should be excluded from model training datasets” (bản dịch) «báo hiệu dữ liệu tương lai từ tài liệu này phải bị loại khỏi tập dữ liệu huấn luyện model»; từ chối OAI-SearchBot nghĩa là site “won’t appear in ChatGPT search results” (bản dịch) «sẽ không xuất hiện trong kết quả tìm kiếm ChatGPT».
Anthropic vận hành ba bot: ClaudeBot (huấn luyện), Claude-SearchBot (lập chỉ mục tìm kiếm) và Claude-User (fetch người dùng). Anthropic nói bot của họ “respect ‘do not crawl’ signals by honoring industry standard directives in robots.txt” (bản dịch) «tôn trọng tín hiệu ‘không crawl’ bằng cách tuân theo directive tiêu chuẩn ngành trong robots.txt». Trang hỗ trợ hiện hành cũng trỏ tới danh sách IP dùng chung đã công bố để xác minh riêng Anthropic. Danh sách của nhà cung cấp này là bằng chứng danh tính, không phải quy tắc IP hay DNS ngược phổ quát cho mọi bot.
Google — điểm mấu chốt đã nêu ở trên: Google-Extended là token, không phải bot. Google còn vận hành Google-CloudVertexBot (crawl cho Vertex AI Agent theo yêu cầu của chủ site; không ảnh hưởng xếp hạng) và các agent do người dùng kích hoạt như Gemini-Deep-Research và Google-NotebookLM.
Apple vận hành Applebot (crawler thật hỗ trợ đề xuất Spotlight/Siri/Safari và “may also be used to help train Apple foundation models” (bản dịch) «cũng có thể được dùng để hỗ trợ huấn luyện foundation model Apple») cùng token Applebot-Extended. Chặn Applebot loại bạn khỏi tìm kiếm Apple; chặn Applebot-Extended chỉ opt out khỏi huấn luyện.
Perplexity khai báo hai bot: PerplexityBot (tìm kiếm/trích dẫn — được nói rõ là “not used to crawl content for AI foundation models” (bản dịch) «không dùng để crawl nội dung cho foundation model AI», nên Perplexity không khai báo crawler huấn luyện) và Perplexity-User (fetch người dùng). Tài liệu nói Perplexity-User “generally ignores robots.txt rules” (bản dịch) «thường bỏ qua quy tắc robots.txt» vì request do người dùng khởi tạo. Perplexity cũng là chủ thể của báo cáo crawl lén — xem tranh luận bên dưới.
Amazon vận hành ba bot, tạo một ngoại lệ hữu ích: Amazonbot (cải thiện sản phẩm và “may be used to train Amazon AI models” (bản dịch) «có thể dùng để huấn luyện model AI Amazon»), Amzn-SearchBot (tìm kiếm) và Amzn-User (fetch người dùng Alexa). Theo tài liệu Amazon, Amzn-SearchBot và Amzn-User KHÔNG crawl để huấn luyện model AI tạo sinh — vì vậy “mọi công ty AI đều scrape để huấn luyện” là ngộ nhận. Amazon còn hiểu meta tag noarchive theo nghĩa đặc biệt: không dùng trang để huấn luyện model — một cơ chế opt out theo trang hiếm gặp.
Cách Amazon xử lý robots có hai điểm vận hành bất thường: crawler có thể dùng bản robots.txt được cache trong 30 ngày trước đó, và Amazon nói nếu không fetch được file thì crawler hành xử như thể file không tồn tại. Điều đó không có nghĩa một lần audit không fetch được chứng minh Amazon thấy trạng thái cho phép tất cả; audit và Amazon có thể tiếp cận host ở thời điểm hoặc đường mạng khác nhau. Evidence for this claim Amazon says its crawlers may use a robots.txt copy cached within the previous 30 days. Scope: Amazon crawler behavior only; a current audit fetch cannot identify which cached copy Amazon used. Confidence: high · Verified: Amazon: Amazonbot Evidence for this claim Amazon says its crawlers behave as if robots.txt does not exist when they cannot fetch it. Scope: Amazon crawler behavior only; a tool-side fetch failure is not proof that Amazon observed the same failure. Confidence: high · Verified: Amazon: Amazonbot
Meta vận hành Meta-ExternalAgent (huấn luyện/lập chỉ mục cho Llama và Meta AI), Meta-ExternalFetcher (fetch người dùng) và riêng Facebookbot (preview liên kết — không phải crawler AI). Chặn Meta-ExternalAgent không ảnh hưởng preview liên kết Facebook.
Common Crawl (CCBot) do một tổ chức phi lợi nhuận vận hành và duy trì kho lưu trữ web mở. Đây là lớp ẩn: dataset Common Crawl đã được dùng để huấn luyện ChatGPT, Claude, LLaMA và nhiều model khác — vì vậy chặn CCBot có tác động downstream tới model không bao giờ trực tiếp crawl bạn. Common Crawl cũng cảnh báo có đối tượng mạo danh CCBot.
ByteDance (Bytespider) là trường hợp mạnh tay: tuyên bố tuân thủ robots.txt nhưng bị báo cáo rộng rãi là vi phạm với lượng request rất cao. Các tên khác nên biết: AI2Bot (Allen Institute, model mở / dataset Dolma), Cohere, Diffbot (trích xuất dữ liệu có cấu trúc, đầu ra được nhiều pipeline AI downstream dùng) và Timpibot / webzio-extended.
Bot AI có thực sự tuân thủ robots.txt không?
Với crawler huấn luyện và tìm kiếm, các nhà vận hành lớn (OpenAI, Anthropic, Google, Apple, Amazon) đều nói trong tài liệu rằng họ tuân thủ robots.txt. Vùng gây tranh cãi là fetcher do người dùng kích hoạt, nơi một số nhà vận hành nói rõ robots.txt có thể không áp dụng vì có người khởi tạo request — OpenAI nói “these actions are initiated by a user, robots.txt rules may not apply” (bản dịch) «các hành động này do người dùng khởi tạo, quy tắc robots.txt có thể không áp dụng»; Perplexity nói Perplexity-User “generally ignores robots.txt rules” (bản dịch) «thường bỏ qua quy tắc robots.txt». Đó là chính sách được công bố, không phải vi phạm.
Tranh luận Perplexity là vụ việc nổi bật và cần gắn nhãn được báo cáo, chưa ngã ngũ. Tháng 6/2024, Wired và developer Robb Knight báo cáo Perplexity truy cập nội dung từ site đã chặn, dường như dùng IP không được liệt kê. Tháng 8/2025, Cloudflare báo cáo Perplexity dùng user-agent lén giả Chrome trên macOS, luân chuyển IP và ASN để né chặn, rồi fetch nội dung từ domain thử nghiệm mới có Disallow: / đầy đủ — sau đó Cloudflare loại Perplexity khỏi danh sách bot đã xác minh. Hãy trình bày đây là báo cáo có tài liệu từ các nguồn đó; tài liệu của Perplexity vẫn khẳng định PerplexityBot tuân thủ robots.txt.
Vì một số bot bỏ qua robots.txt ở mức nào đó, Cloudflare đã trở thành lớp thực thi thực tế — chặn cấp mạng, nút “AI Scrapers and Crawlers” (bản dịch) «Scraper và crawler AI» một lần nhấp, robots.txt được quản lý, theo dõi vi phạm robots.txt và bản beta trả phí theo lượt crawl. Từ tháng 7/2025, domain Cloudflare mới chặn crawler AI đã biết theo mặc định.
Cách kiểm soát crawler AI
- robots.txt theo từng user-agent là đòn bẩy chính và có tính chi tiết: chặn
GPTBotkhông chặnOAI-SearchBothayChatGPT-User. Công thức robots.txt (chặn mọi bot huấn luyện, chặn bot tìm kiếm AI) nằm trong thẻ Scripts. - Token huấn luyện —
Google-ExtendedvàApplebot-Extended— cho phép opt out khỏi huấn luyện Gemini/Apple Intelligence mà không mất tìm kiếm. - Meta tag
noarchivecủa Amazon là opt out huấn luyện theo trang. - Cloudflare AI Crawl Control — chặn/cho phép/tính phí ở cấp mạng, kèm robots.txt được quản lý và directive Content Signals (
search,ai-input,ai-train); mặc định làsearch=yes, ai-train=no. - llms.txt là đề xuất (Jeremy Howard / Answer.AI, tháng 9/2024), không phải tiêu chuẩn đã áp dụng — và không được crawler lớn tuân theo. Đây là bản đồ markdown tuyển chọn để đọc lúc inference, nhưng nghiên cứu Ahrefs trên 137 000 site thấy 97% file llms.txt đã xuất bản nhận không có request, và không nhà cung cấp LLM lớn nào chính thức áp dụng. Hãy xem nó là công cụ tài liệu, không phải công cụ tìm kiếm AI.
- Dự án cộng đồng ai.robots.txt duy trì file
Disallow: /đầy đủ liệt kê hơn 150 user-agent bot AI — tài liệu tham khảo hữu ích để chặn toàn bộ.
Chính sách crawler ưu tiên khả năng hiển thị
Với một site giáo dục hoặc thương mại công khai muốn hiện diện trong tìm kiếm AI, chính sách mặc định của tôi là:
- Cho phép crawler tìm kiếm thông thường phục vụ các bề mặt tìm kiếm bạn muốn, gồm Googlebot và Bingbot.
- Cho phép crawler tìm kiếm/lập chỉ mục AI được tài liệu hóa như
OAI-SearchBot,Claude-SearchBotvàPerplexityBottrên nội dung công khai. - Cho phép fetcher dự kiến do người dùng điều khiển như
ChatGPT-User,Claude-UservàPerplexity-User, đồng thời nhận biết hành vi robots khác nhau theo nhà cung cấp. Evidence for this claim OpenAI publishes separate controls for GPTBot, OAI-SearchBot, and ChatGPT-User, and says each setting is independent. Scope: OpenAI-declared crawlers and user agents; their purposes and robots behavior are platform-specific. Confidence: high · Verified: OpenAI: Crawlers Evidence for this claim Anthropic documents ClaudeBot, Claude-SearchBot, and Claude-User separately and says its bots honor robots.txt directives. Scope: Anthropic-declared bots; user-initiated retrieval has additional product-specific conditions. Confidence: high · Verified: Anthropic: Bot information Evidence for this claim Perplexity documents PerplexityBot for search indexing separately from Perplexity-User for user-requested fetches, with different robots behavior. Scope: Perplexity-declared crawlers and published IP ranges; a user-agent string alone does not verify identity. Confidence: high · Verified: Perplexity: Crawlers - Đưa ra quyết định quyền riêng cho quyền truy cập huấn luyện/phát triển model.
GPTBot,ClaudeBot,Google-Extendedvà biện pháp huấn luyện khác không cần dùng cùng chính sách tìm kiếm. Chỉ cho phép nếu phù hợp chính sách xuất bản. - Bảo vệ route riêng tư và vận hành bằng xác thực. Giữ
/admin/, preview, dữ liệu tài khoản và API không công khai sau authorization phía máy chủ;Disallowchỉ là tùy chọn crawler. - Xác minh danh tính trước khi bỏ qua kiểm soát WAF. Kết hợp user-agent được tài liệu hóa với dải IP hiện hành của nhà cung cấp, xác minh DNS ngược hoặc xác thực bot được hỗ trợ. Không tạo quy tắc WAF cho phép rộng chỉ từ user-agent có thể giả mạo.
Đừng thêm nhóm user-agent cụ thể chỉ để nói Allow: / trừ khi lặp lại mọi hạn chế vẫn phải áp dụng. Theo quy tắc khớp robots riêng của nhà cung cấp, nhóm cụ thể có thể thay thế nhóm wildcard thay vì kế thừa lệnh loại trừ đường dẫn riêng tư. File an toàn đơn giản nhất thường là một nhóm wildcard tự đủ an toàn cộng với opt out huấn luyện có phạm vi hẹp.
Với site này, chính sách công khai hiện hành là cho phép rõ ràng tìm kiếm, đầu vào AI và huấn luyện AI, đồng thời loại trừ route admin, preview, API, trap và gateway. Tôi sẽ tiếp tục cho phép tìm kiếm và retrieval do người dùng điều khiển. Tôi chỉ đổi ai-train=yes như quyết định quyền biên tập — không phải chiến thuật hiển thị AI — vì quyền huấn luyện chưa có lợi ích trích dẫn được chứng minh.
Quyền truy cập của crawler AI không đồng nghĩa với mức sẵn sàng cho AI
Quy tắc cho phép nhiều nhất chỉ chứng minh chính sách robots đã khai báo cho phép agent mang tên đó request URL. Nó không chứng minh nhà vận hành tuân thủ chính sách, đã fetch trang, render, trích xuất thông tin quan trọng, đưa vào context model, trích dẫn hay hoàn tất hành động.
Tách riêng năm lớp sau:
| Lớp | Câu hỏi | Bằng chứng |
|---|---|---|
| Quyền | Agent mang tên này có thể request URL theo chính sách đã khai báo không? | Phép thử robots hiệu lực và quyền truy cập mạng |
| Khả năng trích xuất | Nội dung quan trọng có trong văn bản, liên kết, metadata hoặc dữ liệu có cấu trúc ổn định không? | Bản chụp thô và đã render kèm trích xuất trường |
| Render | Nội dung có tồn tại qua năng lực trình duyệt/JavaScript thực tế của agent không? | Bằng chứng fetch riêng theo nhà cung cấp khi có; nếu không, nêu giới hạn phép thử |
| Khả năng vận hành | Agent có thể xác định và gọi hành động dự kiến một cách an toàn không? | Hợp đồng tool/interface được tài liệu hóa và phép thử end-to-end có kiểm soát |
| Mức sẵn sàng thương mại | Danh tính, giá, tồn kho, chính sách, fulfillment, giỏ hàng và checkout có nhất quán không? | Đối soát feed/trang/backend/đơn hàng |
Vì vậy công cụ kiểm tra quyền crawler nên báo được phép, bị chặn hoặc không xác định cho chính sách — không phải “sẵn sàng cho AI”. Request log thành công chứng minh request đã xảy ra; không chứng minh trang được dùng trong câu trả lời. Feed hoặc khai báo tool hợp lệ cũng không chứng minh trang công khai render đúng hay checkout có thể thực hiện offer được trình bày.
Dùng Cách tìm kiếm AI hoạt động cho các lớp retrieval và trích dẫn, và Tối ưu mua sắm AI cho mức sẵn sàng catalog và giao dịch. Tách các lớp giúp cách sửa cụ thể: sửa chính sách truy cập khi bị chặn, đầu ra trang cho trích xuất, render cho trạng thái bị thiếu, hợp đồng interface cho khả năng vận hành hoặc dữ liệu thương mại cho giao dịch thất bại.
Với trang ecommerce, phép thử khả năng trích xuất phải xác minh danh tính sản phẩm cốt lõi và offer đã chọn — SKU, group ID, giá, tiền tệ và tình trạng còn hàng — có trong phản hồi ban đầu và vẫn nhất quán sau render. Tiêu chuẩn trang sản phẩm thô so với đã render xác định thứ phải hiển thị từ máy chủ; riêng quyền crawler không nói gì về hợp đồng này.
Ngộ nhận làm mất traffic: huấn luyện ≠ tìm kiếm AI
Đây là điểm phải hiểu đúng. Chặn bot huấn luyện không giống chặn bot tìm kiếm AI. Chúng là quy tắc robots.txt riêng với hệ quả trái ngược:
- Chặn bot huấn luyện (GPTBot, ClaudeBot, CCBot, Bytespider, cộng token Google-Extended/Applebot-Extended) → không ảnh hưởng xếp hạng Google, được Google và dữ liệu publisher thực nghiệm xác nhận. Bạn chỉ opt out khỏi huấn luyện model.
- Chặn bot tìm kiếm AI (OAI-SearchBot, PerplexityBot) → mất khả năng hiển thị trong câu trả lời ChatGPT và Perplexity. Đó là đánh đổi thật, không miễn phí.
Nếu chặn quá rộng — chẳng hạn quy tắc toàn bộ bắt OAI-SearchBot trong khi bạn chỉ muốn dừng huấn luyện — bạn có thể âm thầm tự xóa khỏi tìm kiếm AI. Hãy xác định chính xác nhóm mà từng quy tắc tác động.
Vì sao publisher vẫn chặn: hợp đồng xã hội
Lý do tranh luận tồn tại cuối cùng là traffic. Như tôi viết trong phân tích bot AI, “there’s a cost to bots crawling your websites and there’s a social contract between search engines and website owners, where search engines add value by sending referral traffic to websites. Google sends traffic (for now), so they don’t get blocked.” (bản dịch) «Bot crawl website tạo chi phí và có hợp đồng xã hội giữa công cụ tìm kiếm với chủ website, trong đó công cụ tìm kiếm mang lại giá trị bằng referral traffic. Google gửi traffic (hiện tại), nên họ không bị chặn.» Crawler AI đến nay phần lớn không gửi traffic trở lại — dữ liệu củng cố mối lo này. Trong phân tích Cloudflare Radar, bot AI đã vững vị trí crawler số 2 sau công cụ tìm kiếm và có xu hướng vượt lên. Xem thêm trong thẻ Số liệu.
Tiết lộ: Tôi là cựu nhân viên Ahrefs và nhận quyền truy cập Ahrefs miễn phí. Phân tích crawler được liên kết là công trình tôi xuất bản trong vai trò đó; Ahrefs không đánh giá hay phê duyệt kết luận biên tập hiện tại của site này.Để hiểu pipeline rộng hơn — discovery, bộ lập lịch crawl, render và khác biệt giữa crawl với lập chỉ mục — xem hub crawl cùng các chủ đề song hành về crawler nói chung, user-agent, Googlebot, Bingbot và robots.txt.
Tóm tắt về AI
Bản rút gọn của phần Nâng cao:
- Crawler AI gồm ba nhóm, không phải một — trộn lẫn chúng là sai lầm cốt lõi.
- Huấn luyện: GPTBot, ClaudeBot, CCBot, Bytespider, Amazonbot, Meta-ExternalAgent, AI2Bot, Cohere, Diffbot — scrape để xây corpus model.
- Tìm kiếm/lập chỉ mục AI: OAI-SearchBot, PerplexityBot, Applebot, Amzn-SearchBot — xây chỉ mục trích dẫn.
- Fetcher do người dùng kích hoạt: ChatGPT-User, Perplexity-User, Claude-User — fetch trang trực tiếp khi có người yêu cầu.
- Mỗi bot có user-agent và quy tắc robots.txt riêng. Chặn GPTBot không chặn OAI-SearchBot hay ChatGPT-User.
- Google-Extended và Applebot-Extended là token, không phải bot — chúng không crawl; chỉ opt out huấn luyện/grounding. Từ chối chúng không mất tìm kiếm.
- Chặn bot huấn luyện ≠ làm hại SEO. Google dẫn nguyên văn: “does not impact a site’s inclusion in Google Search.” (bản dịch) «không ảnh hưởng việc site được đưa vào Google Search». Dữ liệu publisher thực nghiệm đồng ý.
- Chặn bot tìm kiếm AI CÓ làm giảm khả năng hiển thị AI trong ChatGPT/Perplexity — một đánh đổi thật.
- Amzn-SearchBot và Amzn-User của Amazon KHÔNG huấn luyện trên nội dung đã crawl. “Mọi bot AI đều huấn luyện” là ngộ nhận.
- Tranh luận robots.txt: fetcher người dùng tự loại mình khỏi một số quy tắc (“may not apply” (bản dịch) «có thể không áp dụng»); Perplexity được báo cáo (Wired/Robb Knight 2024; Cloudflare 2025) dùng crawler lén — hãy trình bày là báo cáo, chưa ngã ngũ.
- llms.txt là đề xuất, chưa được áp dụng — 97% file không được đọc; không LLM lớn nào hỗ trợ. Cloudflare là lớp thực thi thực tế.
Tài liệu chính thức
Tài liệu nguồn chính từ các nhà vận hành AI và những đề xuất liên quan.
OpenAI
- Bot / crawler OpenAI — GPTBot, OAI-SearchBot, ChatGPT-User, OAI-AdsBot và chính sách “each bot setting is independent” (bản dịch) «mỗi cài đặt bot độc lập».
Anthropic
- Anthropic có crawl dữ liệu từ web không? — ClaudeBot, Claude-SearchBot, Claude-User, kiểm soát robots và xác minh danh sách IP hiện hành.
- Danh sách IP crawler Anthropic — dữ liệu xác minh riêng của nhà cung cấp.
- Các crawler phổ biến của Google (gồm Google-Extended) — token sản phẩm và user-agent.
- Các tính năng AI và website của bạn — Googlebot, không phải Google-Extended, kiểm soát việc xuất hiện trong AI Overviews và AI Mode.
Apple
- Giới thiệu Applebot — phân biệt Applebot với Applebot-Extended và tuyên bố “Applebot-Extended does not crawl webpages” (bản dịch) «Applebot-Extended không crawl trang web».
Amazon
- Amazonbot — Amazonbot, Amzn-SearchBot, Amzn-User, cơ chế opt out huấn luyện bằng
noarchivevà các bot không dùng cho huấn luyện.
Perplexity
- Crawler của Perplexity — PerplexityBot, Perplexity-User và tuyên bố “generally ignores robots.txt rules” (bản dịch) «thường bỏ qua quy tắc robots.txt».
Common Crawl
- CCBot — crawler phi lợi nhuận đứng sau nhiều tập dữ liệu huấn luyện LLM, kèm cảnh báo về hành vi mạo danh.
Allen Institute for AI
- Thông báo về crawler AI2 — AI2Bot và cách lọc bot này.
Cloudflare (kiểm soát crawler AI)
- AI Crawl Control — chặn/cho phép/tính phí, giám sát và theo dõi vi phạm robots.txt.
- robots.txt được quản lý — directive crawler AI được tự động duy trì.
- Kiểm soát việc dùng nội dung để huấn luyện AI — robots.txt được quản lý, Content Signals và trả phí theo lượt crawl.
Đề xuất
- Đặc tả llms.txt — bản đồ dùng lúc inference mới chỉ là đề xuất, chưa phải tiêu chuẩn được áp dụng.
- Dự án ai.robots.txt — danh sách user-agent bot AI do cộng đồng duy trì.
Trích dẫn từ nguồn
Các phát biểu chính thức từ nhà vận hành và bên đề xuất. Mỗi liên kết trỏ sâu tới đoạn trích đã được xác minh.
OpenAI — bot độc lập, mục đích độc lập
- “Each bot setting is independent, allowing webmasters granular control over how their content interacts with different OpenAI systems.” (bản dịch) «Mỗi cài đặt bot độc lập, cho phép webmaster kiểm soát chi tiết cách nội dung tương tác với các hệ thống OpenAI khác nhau.» — tài liệu bot OpenAI. Đi đến trích dẫn
- GPTBot “used to make our generative AI foundation models more useful and safe.” (bản dịch) «được dùng để làm foundation model AI tạo sinh hữu ích và an toàn hơn». OAI-SearchBot “used to surface websites in search results in ChatGPT’s search features.” (bản dịch) «được dùng để hiển thị website trong kết quả của tính năng tìm kiếm ChatGPT». Với ChatGPT-User, vì “these actions are initiated by a user, robots.txt rules may not apply.” (bản dịch) «các hành động này do người dùng khởi tạo, quy tắc robots.txt có thể không áp dụng». Đi đến trích dẫn
Anthropic — kiểm soát robots và phạm vi xác minh
- Anthropic tài liệu hóa ClaudeBot, Claude-SearchBot và Claude-User, cách các bot này xử lý robots.txt và cách chủ site có thể xác minh request bằng danh sách IP dùng chung đã công bố. Danh sách đó là bằng chứng riêng của nhà cung cấp, không phải quy tắc xác minh phổ quát cho mọi bot. Nguồn
Google — token, không phải bot
- “Google-Extended does not impact a site’s inclusion in Google Search nor is it used as a ranking signal in Google Search.” (bản dịch) «Google-Extended không ảnh hưởng việc site được đưa vào Google Search và cũng không được dùng làm tín hiệu xếp hạng trong Google Search.» Đi đến trích dẫn
Apple — Applebot-Extended không crawl
- “Applebot-Extended does not crawl webpages. Webpages that disallow Applebot-Extended can still be included in search results.” (bản dịch) «Applebot-Extended không crawl trang web. Trang từ chối Applebot-Extended vẫn có thể được đưa vào kết quả tìm kiếm.» Đi đến trích dẫn
Perplexity — ngoại lệ dành cho fetcher người dùng
- PerplexityBot “designed to surface and link websites in search results on Perplexity. It is not used to crawl content for AI foundation models.” (bản dịch) «được thiết kế để hiển thị và liên kết website trong kết quả tìm kiếm Perplexity; không dùng để crawl nội dung cho foundation model AI». Với Perplexity-User: “Since a user requested the fetch, this fetcher generally ignores robots.txt rules.” (bản dịch) «Vì người dùng yêu cầu fetch, fetcher này thường bỏ qua quy tắc robots.txt». Đi đến trích dẫn
Common Crawl — lớp huấn luyện ẩn
- CCBot tồn tại để “democratizing access to web information by producing and maintaining an open repository of web crawl data.” (bản dịch) «dân chủ hóa quyền truy cập thông tin web bằng cách tạo và duy trì kho dữ liệu crawl web mở». Lưu ý: “we are aware of crawlers falsely identifying themselves as CCBot.” (bản dịch) «chúng tôi biết có crawler tự nhận sai là CCBot». Đi đến trích dẫn
llms.txt — theo chính mô tả, đây là một đề xuất
- “A proposal to standardise on using an
/llms.txtfile to provide information to help LLMs use a website at inference time.” (bản dịch) «Đề xuất chuẩn hóa việc dùng file/llms.txtđể cung cấp thông tin giúp LLM sử dụng website lúc inference.» — đặc tả llms.txt. Đi đến trích dẫn
Tôi — hợp đồng xã hội
- “There’s a cost to bots crawling your websites and there’s a social contract between search engines and website owners, where search engines add value by sending referral traffic to websites. Google sends traffic (for now), so they don’t get blocked.” (bản dịch) «Việc bot crawl website có chi phí; hợp đồng xã hội giữa công cụ tìm kiếm và chủ website là công cụ tạo giá trị bằng cách gửi referral traffic. Google hiện vẫn gửi traffic nên không bị chặn.» — Patrick Stox, Ahrefs. Đọc bài
Bảng tổng hợp crawler AI
Bảng trung tâm: mọi bot AI lớn, token user-agent, nhà vận hành, nhóm và mức tuân thủ robots.txt được tuyên bố. Sao chép token chính xác — chính tả và hoa thường có ý nghĩa trong robots.txt.
| Bot | Token UA | Nhà vận hành | Nhóm | Tuân thủ robots.txt? |
|---|---|---|---|---|
| GPTBot | GPTBot | OpenAI | Huấn luyện | Có (tuyên bố) |
| OAI-SearchBot | OAI-SearchBot | OpenAI | Tìm kiếm AI | Có (tuyên bố) |
| ChatGPT-User | ChatGPT-User | OpenAI | Fetch người dùng | “Có thể không áp dụng” (do người dùng khởi tạo) |
| OAI-AdsBot | OAI-AdsBot | OpenAI | Quảng cáo (không huấn luyện) | Có (tuyên bố) |
| ClaudeBot | ClaudeBot | Anthropic | Huấn luyện | Có (tuyên bố) |
| Claude-SearchBot | Claude-SearchBot | Anthropic | Tìm kiếm AI | Có cho lập chỉ mục |
| Claude-User | Claude-User | Anthropic | Fetch người dùng | Có (Anthropic nói mọi bot tuân thủ robots.txt) |
| Google-Extended | Google-Extended (chỉ token — không có UA riêng) | Kiểm soát huấn luyện/grounding | Có (token opt out) | |
| Google-CloudVertexBot | Google-CloudVertexBot | Vertex AI do chủ sở hữu yêu cầu | Có | |
| PerplexityBot | PerplexityBot | Perplexity | Tìm kiếm AI | Có khi lập chỉ mục (xem tranh chấp) |
| Perplexity-User | Perplexity-User | Perplexity | Fetch người dùng | “Thường bỏ qua” (tuyên bố) |
| Applebot | Applebot | Apple | Tìm kiếm AI (+ huấn luyện) | Có |
| Applebot-Extended | Applebot-Extended (chỉ token — không crawl) | Apple | Kiểm soát huấn luyện | Có (token opt out) |
| Amazonbot | Amazonbot | Amazon | Huấn luyện | Có (tuyên bố) |
| Amzn-SearchBot | Amzn-SearchBot | Amazon | Tìm kiếm AI (không huấn luyện) | Có (tuyên bố) |
| Amzn-User | Amzn-User | Amazon | Fetch người dùng (Alexa; không huấn luyện) | Có (tuyên bố) |
| Meta-ExternalAgent | meta-externalagent | Meta | Huấn luyện/lập chỉ mục | Có (tuyên bố) |
| Meta-ExternalFetcher | meta-externalfetcher | Meta | Fetch người dùng | Tuyên bố |
| CCBot | CCBot | Common Crawl | Huấn luyện (dữ liệu mở) | Có; có đối tượng mạo danh |
| Bytespider | Bytespider | ByteDance | Huấn luyện | Tranh cãi — xem báo cáo |
| AI2Bot | AI2Bot | Allen Institute | Huấn luyện | Có (tuyên bố) |
| cohere-training-data-crawler | cohere-training-data-crawler | Cohere | Huấn luyện | Có (tuyên bố) |
| Diffbot | Diffbot | Diffbot | Huấn luyện/trích xuất | Mặc định có |
| Timpibot | Timpibot | Timpi | Huấn luyện | Có (tuyên bố) |
| webzio-extended | webzio-extended | Webz.io | Huấn luyện | Tuyên bố |
Ba quy tắc rút ra từ bảng
- Chặn bot huấn luyện (GPTBot, ClaudeBot, CCBot…) → không ảnh hưởng xếp hạng.
- Chặn bot tìm kiếm AI (OAI-SearchBot, PerplexityBot) → mất khả năng hiển thị câu trả lời AI.
- Google-Extended và Applebot-Extended là token, không phải crawler — opt out huấn luyện thuần túy, không mất tìm kiếm.
Fast facts
- GPTBot ≠ OAI-SearchBot ≠ ChatGPT-User — ba quy tắc OpenAI độc lập.
Amzn-SearchBotvàAmzn-Usercủa Amazon không huấn luyện trên nội dung crawl.- Amazon hiểu meta
noarchivelà tín hiệu không huấn luyện theo trang. - llms.txt là đề xuất, không phải tiêu chuẩn đã áp dụng; crawler lớn không tuân theo.
- Chặn theo user-agent trong robots.txt, không theo IP (chặn IP có thể ngăn bot đọc robots.txt).
Cách audit và quyết định bot nào được phép
Quy trình thực tế để quyết định crawler AI nào nên cho phép, chặn hoặc chỉ giám sát.
- Lấy log máy chủ và liệt kê user-agent AI thực sự truy cập (GPTBot, ClaudeBot, CCBot, Bytespider, OAI-SearchBot, PerplexityBot, Applebot, v.v.) cùng tần suất. Log là nguồn sự thật.
- Xếp từng bot vào nhóm — huấn luyện, tìm kiếm AI hoặc fetch người dùng. Quyết định dựa trên nhóm, không phải thương hiệu.
- Quyết định lập trường về huấn luyện. Chấp nhận nội dung được dùng để huấn luyện? Cho phép bot huấn luyện. Không chấp nhận? Chặn GPTBot, ClaudeBot, CCBot, Bytespider, Amazonbot, Meta-ExternalAgent — và thêm token
Google-Extended,Applebot-Extended. Không việc nào ảnh hưởng xếp hạng Google. - Quyết định cẩn thận về tìm kiếm AI. Nếu muốn xuất hiện trong câu trả lời ChatGPT và Perplexity, giữ OAI-SearchBot và PerplexityBot được phép. Chỉ chặn khi thực sự muốn rời tìm kiếm AI.
- Đừng chặn nhầm bot. Xác nhận quy tắc “chặn huấn luyện” không bắt bot tìm kiếm AI. GPTBot ≠ OAI-SearchBot.
- Chặn theo user-agent, không theo IP — chặn IP có thể ngăn bot đọc robots.txt (cảnh báo rõ của Anthropic).
- Xác minh bot đáng ngờ. CCBot và bot khác bị mạo danh; kiểm tra dải IP công bố / DNS ngược trước khi tin chuỗi user-agent.
- Cân nhắc thực thi cấp mạng (Cloudflare AI Crawl Control) với bot không tuân thủ robots.txt đáng tin cậy.
- Bỏ qua llms.txt như chiến thuật SEO — đây là đề xuất, phần lớn không được đọc và crawler lớn không tuân theo. Đừng kỳ vọng khả năng hiển thị AI từ nó.
- Kiểm tra lại hằng quý. Bot mới xuất hiện liên tục (danh sách ai.robots.txt là tham khảo tốt) và nhà vận hành thay đổi hành vi.
Sai lầm làm mất traffic tìm kiếm AI
Trộn bot huấn luyện với bot tìm kiếm AI là sai lầm tốn kém nhất trong lĩnh vực này và là ngộ nhận cần loại bỏ. Quy tắc nhằm dừng huấn luyện model và quy tắc nhằm dừng trích dẫn tìm kiếm AI không giống nhau — nhầm lẫn tạo hệ quả trái ngược.
- Sai: chặn “bot AI” như một khối (một quy tắc
Disallowbắt cả GPTBot và OAI-SearchBot). Vì sao sai: bạn âm thầm tự xóa khỏi câu trả lời ChatGPT và Perplexity trong khi tưởng chỉ opt out huấn luyện. Nên làm: viết quy tắc riêng có tên cho từng bot — chặn GPTBot/ClaudeBot/CCBot/Bytespider để ngăn huấn luyện, giữ OAI-SearchBot/PerplexityBot được phép trừ khi cố ý rời tìm kiếm AI.
Nhầm lẫn xác minh danh tính với chính sách truy cập
Danh sách IP nhà cung cấp công bố có thể giúp xác minh ai gửi request. Nó không quyết định chính sách của bạn và không biến lệnh chặn mạng thành quy tắc robots.
- Sai: coi dải đã xác minh là quyết định cho phép/chặn tự động.
Vì sao sai: danh tính, tùy chọn crawl đã khai báo và quyền truy cập mạng bị cưỡng chế là các dữ kiện riêng.
Nên làm: thể hiện chính sách crawl bằng token
User-agentđược tài liệu hóa; thêm thực thi cấp mạng (Cloudflare AI Crawl Control) cho bot không tuân thủ file đáng tin cậy.
Coi llms.txt là đòn bẩy tìm kiếm AI
llms.txt thường được quảng bá là “the robots.txt for AI search” (bản dịch) «robots.txt cho tìm kiếm AI», nhưng cách diễn đạt đó sai theo chính nguồn của bài.
- Sai: xuất bản file
llms.txtvới kỳ vọng tăng khả năng hiển thị hoặc trích dẫn tìm kiếm AI. Vì sao sai: đó là đề xuất, không phải tiêu chuẩn đã áp dụng — nghiên cứu Ahrefs trên 137 000 site thấy 97% file llms.txt đã xuất bản nhận không request, và không nhà cung cấp LLM lớn nào chính thức áp dụng. Nên làm: nhiều nhất hãy xem llms.txt là công cụ tài liệu; tập trung vào quy tắcrobots.txtvà bot tìm kiếm AI thực sự kiểm soát khả năng hiển thị.
Tin chuỗi user-agent mà không xác minh
Riêng CCBot bị mạo danh, theo chính Common Crawl thừa nhận; Bytespider bị báo cáo rộng rãi là bỏ qua quy tắc mà nó tuyên bố tuân thủ.
- Sai: cho rằng chuỗi
User-agenttrong log đúng là đối tượng nó tự nhận. Vì sao sai: bot giả mạo hoặc không tuân thủ có thể truy cập ở lưu lượng đầy đủ trong khi quy tắcrobots.txtkhông được thực thi. Nên làm: đối chiếu lượt truy cập lớn hoặc đáng ngờ với dải IP nhà vận hành công bố hoặc DNS ngược trước khi tin chuỗi — thẻ Công cụ có công cụ dành cho phép kiểm tra này.
Quyết định: cho phép, chặn hay giám sát
1. Phân loại trước — bước này quyết định mọi thứ. Huấn luyện so với tìm kiếm AI so với fetch người dùng. Xác định đúng nhóm thì hệ quả rõ: chặn huấn luyện an toàn cho SEO; chặn tìm kiếm AI làm mất khả năng hiển thị AI; fetch người dùng còn tranh cãi.
2. Quy tắc cho phép / chặn / giám sát.
- Cho phép bot tìm kiếm AI (OAI-SearchBot, PerplexityBot, Applebot) nếu muốn referral AI — phần lớn site nên làm vậy.
- Chặn bot huấn luyện (GPTBot, ClaudeBot, CCBot, Bytespider) nếu không muốn nội dung được dùng để huấn luyện — không mất xếp hạng. Thêm token Google-Extended/Applebot-Extended cho huấn luyện Gemini/Apple.
- Giám sát fetcher do người dùng kích hoạt và đối tượng xấu đã biết (Bytespider, traffic Perplexity không khai báo). robots.txt có thể không dừng chúng; log và quy tắc cấp mạng mới cho thấy và kiểm soát thực tế.
3. Kiểm tra “token, không phải bot”. Trước khi suy luận về traffic crawl, hãy hỏi: đây là crawler thật hay token kiểm soát? Google-Extended và Applebot-Extended không tạo traffic — chúng chỉ chuyển quyền trên traffic đã xảy ra.
4. Huấn luyện ≠ tìm kiếm AI (sai lầm tốn kém). Hai quy tắc robots.txt riêng, hệ quả trái ngược. Đừng chặn “bot AI” như một khối — bạn sẽ không dừng được huấn luyện hoặc vô tình tự xóa khỏi câu trả lời AI.
5. robots.txt là lời yêu cầu; thực thi là lớp riêng. Giao thức có tác dụng với bot tuân thủ. Với bot tự loại mình khỏi quy tắc (fetcher người dùng) hoặc được báo cáo bỏ qua (crawler lén Perplexity, Bytespider), thực thi thật nằm ở cấp mạng (Cloudflare) — chỉ robots.txt không đủ.
Tôi có nên chặn bot AI này không?
Cây quyết định này triển khai từng bước quy tắc cho phép/chặn/giám sát trong thẻ Frameworks. Bắt đầu bằng xác định bot thuộc nhóm nào trong ba nhóm, rồi trả lời câu hỏi quyết định cách xử lý.
Should I block this AI bot?
Audit robots.txt cho bot AI hằng quý
Kiểm tra định kỳ giúp quy tắc robots.txt khớp thực tế khi bot AI mới xuất hiện và nhà vận hành đổi hành vi — thẻ Checklist đã nêu “kiểm tra lại hằng quý”; đây là phiên bản từng bước.
- Lấy lượt truy cập bot AI trong quý. Chạy log máy chủ qua Log File Analyzer hoặc grep danh sách user-agent đã biết (thẻ Scripts có lệnh chính xác) để biết bot AI nào thực sự truy cập và tần suất.
- Kiểm tra lại nhóm của từng bot. Đối chiếu mọi user-agent với bảng chính trong thẻ Bảng tra nhanh để xác nhận nó vẫn là huấn luyện, tìm kiếm AI hay fetch người dùng — và đối chiếu bot mới, không nhận diện với danh sách dự án ai.robots.txt.
- Kiểm tra quy tắc hiện hành. Chạy
robots.txttrực tiếp qua robots.txt Tester với user-agent từng bot để xác nhận quy tắc huấn luyện không vô tình bắt bot tìm kiếm AI. - Xác minh lượt truy cập đáng ngờ hoặc lưu lượng cao. Đối chiếu bot như CCBot hoặc Bytespider với dải IP nhà vận hành công bố hoặc DNS ngược bằng Googlebot Verifier trước khi tin chuỗi user-agent — mạo danh có xảy ra.
- Ghi tỷ lệ crawl bot AI trong quý. Ghi phần huấn luyện so với tìm kiếm AI so với fetch người dùng (xem thẻ Cách đo) để lần kiểm tra sau có xu hướng đối chiếu, không chỉ ảnh chụp.
Xác nhận chỉnh sửa robots.txt hoạt động đúng ý định
Sau khi sửa robots.txt để chặn bot huấn luyện, hãy chạy các phép kiểm tra này trước khi coi thay đổi hoàn tất — mục tiêu là chứng minh bot tìm kiếm AI vẫn tiếp cận trang còn bot huấn luyện thực sự bị từ chối.
Kiểm thử 1: Bot tìm kiếm AI vẫn được phép
- Phép thử: Kiểm tra URL với user-agent
OAI-SearchBotvàPerplexityBotbằng robots.txt Tester, hoặc xác nhận lượt truy cập thật bằng Googlebot Verifier. - Kết quả mong đợi: “Allowed” (bản dịch) «Được phép» cho cả hai trên mọi trang bạn muốn được dẫn trong câu trả lời AI.
- Diễn giải khi thất bại: “Disallowed” (bản dịch) «Bị từ chối» nghĩa là quy tắc chặn huấn luyện quá rộng và bắt nhầm user-agent.
- Cửa sổ giám sát: ngay lập tức với tester; chờ vài ngày để bản robots.txt cache của bot làm mới.
- Điều kiện rollback: bot tìm kiếm AI dự kiến cho phép hiển thị Disallowed, hoặc trích dẫn/referral từ engine đó giảm sau thay đổi.
Kiểm thử 2: Bot huấn luyện thực sự bị chặn
- Phép thử: Kiểm tra cùng URL với
GPTBot,ClaudeBot,CCBotvàBytespiderbằng robots.txt Tester. - Kết quả mong đợi: “Disallowed” (bản dịch) «Bị từ chối» cho từng bot.
- Diễn giải khi thất bại: “Allowed” (bản dịch) «Được phép» thường nghĩa token bị gõ sai — chính tả và hoa thường quan trọng trong robots.txt.
- Cửa sổ giám sát: ngay lập tức.
- Điều kiện rollback: không cần — chặn huấn luyện không cần đường rollback trừ khi bạn đổi quyết định và chấp nhận huấn luyện.
Kiểm thử 3: Xếp hạng Google không bị ảnh hưởng
- Phép thử: Kiểm tra Search Console Performance/Index Coverage cho URL bị ảnh hưởng vài tuần sau khi chặn bot huấn luyện hoặc token
Google-Extended. - Kết quả mong đợi: không thay đổi đáng kể về impression hoặc xếp hạng — Google nói về
Google-Extended: “does not impact a site’s inclusion in Google Search.” (bản dịch) «không ảnh hưởng việc site được đưa vào Google Search». - Diễn giải khi thất bại: impression giảm rộng trùng thời điểm thường nghĩa chính Googlebot bị bắt bởi quy tắc quá rộng.
- Cửa sổ giám sát: 2–4 tuần (độ trễ báo cáo Search Console).
- Điều kiện rollback: impression hoặc xếp hạng giảm và Googlebot hiển thị Disallowed trên URL phải crawl được.
KPI thường trực cho traffic bot AI
Theo dõi các chỉ số theo quý cho biết tư thế bot AI có thực sự đúng ý định hay không — tách khỏi một lần sửa robots.txt riêng lẻ.
| Chỉ số | Cho biết điều gì | Cách lấy | Benchmark / phạm vi thực tế | Nhịp đo |
|---|---|---|---|---|
| Tỷ lệ bot AI trong tổng traffic crawl, theo nhóm (huấn luyện / tìm kiếm AI / fetch người dùng) | Bot AI có chiếm phần lớn hơn trong tải crawl và nhóm nào thúc đẩy | Log máy chủ qua Log File Analyzer, hoặc Cloudflare AI Crawl Control nếu dùng Cloudflare | Không có mục tiêu phổ quát — Cloudflare Radar đặt bot AI ở khoảng 18,9% request bot toàn ngành (2025), nhưng cơ cấu site của bạn mới quan trọng; thiết lập baseline quý đầu rồi theo xu hướng | Hằng quý |
| Tỷ lệ crawl/referral theo bot tìm kiếm AI | “Tiền thuê” crawl phải trả cho mỗi đơn vị referral tìm kiếm AI | Đối chiếu số crawl trong log theo user-agent với lượt referral thực tế trong analytics | Không có mục tiêu cố định — thẻ Số liệu nêu khoảng 14 lượt crawl Google mỗi referral so với tỷ lệ cao hơn nhiều của crawler AI; kỳ vọng tỷ lệ tệ hơn Google và theo dõi xu hướng, không số tuyệt đối | Hằng quý |
| Độ chính xác chặn huấn luyện | Quy tắc Disallow bot huấn luyện có vô tình bắt bot tìm kiếm AI hoặc fetch người dùng không | Audit robots.txt với bảng chính trong thẻ Bảng tra nhanh; xác nhận bằng robots.txt Tester | Phải bằng 0 — không bot tìm kiếm AI nào nên bị chặn bởi quy tắc dành cho huấn luyện | Mỗi thay đổi robots.txt và audit hằng quý |
robots.txt — chặn các bot lớn
Chặn crawler huấn luyện, giữ tìm kiếm AI. Cách này opt out khỏi huấn luyện model nhưng vẫn hiển thị trong câu trả lời ChatGPT/Perplexity. Sao chép token chính xác.
# --- AI training crawlers ---
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Bytespider
Disallow: /
User-agent: meta-externalagent
Disallow: /
User-agent: Amazonbot
Disallow: /
# --- Training control tokens (not crawlers) ---
# Opt out of Gemini/Vertex training; search unaffected
User-agent: Google-Extended
Disallow: /
# Opt out of Apple Intelligence training; Applebot search unaffected
User-agent: Applebot-Extended
Disallow: /Chặn bot lập chỉ mục tìm kiếm AI (việc này GIẢM khả năng hiển thị trong câu trả lời AI). Chỉ làm nếu thực sự muốn rời câu trả lời ChatGPT/Perplexity.
User-agent: OAI-SearchBot
Disallow: /
User-agent: PerplexityBot
Disallow: /Nguyên tắc chính: chặn GPTBot không chặn OAI-SearchBot hay ChatGPT-User — mỗi bot có quy tắc độc lập.
Phát hiện bot AI trong access log
Tìm user-agent AI nào đang truy cập site và tần suất của chúng.
macOS / Linux
# Count hits per known AI bot in an Apache/Nginx access log
grep -iE 'GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|Claude-User|Claude-SearchBot|PerplexityBot|Perplexity-User|CCBot|Bytespider|Amazonbot|Amzn-SearchBot|meta-externalagent|Applebot|AI2Bot|Diffbot' access.log \
| grep -oiE 'GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|Claude-User|Claude-SearchBot|PerplexityBot|Perplexity-User|CCBot|Bytespider|Amazonbot|Amzn-SearchBot|meta-externalagent|Applebot|AI2Bot|Diffbot' \
| sort | uniq -c | sort -rnWindows (PowerShell)
# Count hits per known AI bot in an access log
$bots = 'GPTBot','OAI-SearchBot','ChatGPT-User','ClaudeBot','Claude-User','Claude-SearchBot','PerplexityBot','Perplexity-User','CCBot','Bytespider','Amazonbot','Amzn-SearchBot','meta-externalagent','Applebot','AI2Bot','Diffbot'
Select-String -Path .\access.log -Pattern ($bots -join '|') |
ForEach-Object { ($_ -split '"')[5] } |
ForEach-Object { foreach ($b in $bots) { if ($_ -match $b) { $b } } } |
Group-Object | Sort-Object Count -Descending | Select-Object Count, NameChuỗi user-agent có thể bị giả (đặc biệt CCBot) — xác nhận bot quan trọng với dải IP nhà vận hành công bố hoặc DNS ngược + xuôi trước khi hành động.
Phân loại lượt truy cập trong log theo nhóm bot AI
Dán dòng log máy chủ thô hoặc danh sách chuỗi user-agent rồi yêu cầu AI phân loại từng mục bằng bảng chính trong thẻ Bảng tra nhanh — hữu ích khi nhìn file log đầy tên bot lạ.
I have a list of user-agent strings from my server logs. Using this
classification (paste the Cheat Sheets table from this article, or the list
below), classify each user-agent as one of: Training, AI-search, User fetch,
or Control token (not a crawler). Flag any user-agent you don't recognize as
"unknown — verify."
Categories:
- Training: GPTBot, ClaudeBot, CCBot, Bytespider, Amazonbot, Meta-ExternalAgent,
AI2Bot, cohere-training-data-crawler, Diffbot, Timpibot, webzio-extended
- AI-search: OAI-SearchBot, PerplexityBot, Applebot, Amzn-SearchBot
- User fetch: ChatGPT-User, Perplexity-User, Claude-User, Claude-SearchBot,
Amzn-User, Meta-ExternalFetcher
- Control token (no crawl traffic): Google-Extended, Applebot-Extended
My user-agent list:
<paste your list here>Soạn danh sách chặn robots.txt theo lập trường của bạn
Mô tả lập trường huấn luyện và tìm kiếm AI bằng ngôn ngữ thường, yêu cầu AI soạn quy tắc robots.txt tương ứng, rồi xác minh đầu ra bằng robots.txt Tester trước khi xuất bản.
Draft a robots.txt block that does the following, using exact, correctly-cased
user-agent tokens for each rule (one User-agent/Disallow pair per bot, don't
combine bots under one User-agent line):
1. Block all training bots: GPTBot, ClaudeBot, CCBot, Bytespider,
Meta-ExternalAgent, Amazonbot.
2. Also disallow the Google-Extended and Applebot-Extended control tokens
(training/grounding opt-out only — not real crawlers).
3. Leave OAI-SearchBot and PerplexityBot allowed so AI-search visibility is
unaffected.
Output only the robots.txt block, no explanation. Công cụ xác minh và kiểm soát bot AI
-
Googlebot Verifier — dán lượt truy cập trong log máy chủ và xác nhận request “GPTBot” hoặc “ClaudeBot” thực sự đến từ dải IP nhà vận hành công bố hay đối tượng mạo danh. Đây là cách sửa trực tiếp cho lỗi “tin chuỗi user-agent” trong thẻ Những điều không nên làm.
-
robots.txt Tester — kiểm tra URL cụ thể được phép hay bị chặn cho user-agent bot cụ thể, để xác nhận quy tắc chặn huấn luyện không bắt cả bot tìm kiếm AI.
-
robots.txt Generator — xây quy tắc chặn huấn luyện / cho phép tìm kiếm AI từ thẻ Scripts mà không gõ tay token user-agent, nơi lỗi chính tả âm thầm phá quy tắc.
-
Trình tạo + xác thực llms.txt — nếu vẫn muốn file llms.txt cho mục đích tài liệu, hãy tạo và xác thực tại đây — nhưng đừng kỳ vọng nó cải thiện khả năng hiển thị tìm kiếm AI (xem Những điều không nên làm).
Các tài nguyên đáng đọc
Bài viết liên quan của tôi
- Gặp các crawler web mới: Bot AI đang tiến gần bot công cụ tìm kiếm — phân tích Cloudflare Radar của tôi; bot AI là crawler số 2 rõ ràng và khung hợp đồng xã hội.
- Các bot AI bị khoảng 140 triệu website chặn nhiều nhất — dữ liệu tỷ lệ chặn robots.txt trên web mở và tương quan lượng request/tỷ lệ chặn.
- ChatGPT có 12% lượng tìm kiếm của Google nhưng Google gửi traffic gấp 190 lần — khoảng cách referral AI so với tìm kiếm thúc đẩy tranh luận chặn.
- Những gì chúng ta thực sự biết về tối ưu tìm kiếm LLM — bối cảnh GEO rộng hơn.
Từ nguồn khác
- Cloudflare: Perplexity dùng crawler lén, không khai báo — điều tra tháng 8/2025 (phát hiện được báo cáo).
- Robb Knight: Perplexity AI nói sai về user-agent — điều tra gốc tháng 6/2024.
- Dự án ai.robots.txt — danh sách cộng đồng duy trì hơn 150 user-agent bot AI.
- Known Agents (trước đây Dark Visitors) — thư mục bot AI toàn diện.
- Cloudflare: Tuyên bố độc lập AI (chặn bot AI một lần nhấp) — thông báo nút “AI Scrapers and Crawlers” của Cloudflare.
- Cloudflare: Kiểm soát việc dùng nội dung để huấn luyện AI — giải thích robots.txt được quản lý, directive Content Signals và beta trả phí theo crawl.
- Heise Online: Crawler không giới hạn — Perplexity bỏ qua robots.txt — báo cáo tháng 6/2024 về việc Perplexity né robots.txt.
- Gizmodo: Perplexity AI bỏ qua quy tắc internet — bài viết thêm về tranh luận tuân thủ robots.txt.
Số liệu đáng trích dẫn
- Bot AI là crawler số 2 rõ ràng. Theo phân tích Cloudflare Radar của tôi, bot công cụ tìm kiếm vẫn crawl nhiều nhất, nhưng bot AI đứng vững thứ hai và có xu hướng vượt lên — đã chiếm khoảng 18,9% mọi request bot. Nguồn
- Khoảng cách referral thúc đẩy việc chặn. Google gửi traffic tới website nhiều hơn ChatGPT khoảng 190 lần, dù ChatGPT có tỷ lệ đáng kể so với lượng tìm kiếm Google — sự mất cân đối đứng sau lập luận “hợp đồng xã hội”. Nguồn
- Tỷ lệ crawl/referral (Cloudflare, 2025). Khoảng 14 lượt crawl Google mỗi referral, so với tỷ lệ cao hơn nhiều của crawler AI — hàng nghìn lượt OpenAI và hàng chục nghìn lượt Anthropic mỗi referral. Các con số giải thích vì sao publisher đặt câu hỏi.
- Kiểm tra thực tế llms.txt. Trong nghiên cứu Ahrefs trên 137 000 site, khoảng 28% xuất bản file llms.txt nhưng 97% file nhận không request; không nhà cung cấp LLM lớn nào chính thức áp dụng. Nguồn
- Tỷ lệ chặn trên web mở. Trong nghiên cứu khoảng 140 triệu site của tôi, các bot AI bị chặn nhiều nhất tập trung quanh GPTBot, CCBot, ClaudeBot, Amazonbot và Bytespider — tỷ lệ chặn đi cùng lượng request. Nguồn
- Phạm vi Bytespider và thực thi. Bytespider truy cập 40,40% website được Cloudflare bảo vệ trước khi Cloudflare bắt đầu chặn vào tháng 7/2024; traffic giảm 71,45% sau đó. Meta-ExternalAgent truy cập 22,16% site được bảo vệ — chỉ sau GPTBot (28,97%). Nguồn
- Tăng trưởng traffic bot AI. Dữ liệu Cloudflare Radar cho thấy traffic bot AI tăng 65% trong sáu tháng (2025), request GPTBot tăng 305% từ tháng 5/2024 đến tháng 5/2025. Từ tháng 7/2025, domain Cloudflare mới chặn crawler AI đã biết theo mặc định và hơn 1 triệu khách hàng đã bật tính năng chặn bot AI. Nguồn
Tự kiểm tra: Crawler AI
Năm câu hỏi nhanh về ba nhóm crawler AI và các bẫy liên quan. Chọn một đáp án cho mỗi câu rồi kiểm tra.
Nhật ký thay đổi
Đã cập nhật 22 thg 8, 2026.
Tóm tắt biên tập và chi tiết thay đổi đã ghi nhận.Chi tiết thay đổi
-
Ghi chú thay đổi chi tiết hiện chỉ có bằng tiếng Anh.
Không thể so sánh đầy đủ — không có bản lưu trước đó cho lần sửa đổi này.
Đã cập nhật 9 thg 8, 2026.
Tóm tắt biên tập và chi tiết thay đổi đã ghi nhận.Chi tiết thay đổi
-
Ghi chú thay đổi chi tiết hiện chỉ có bằng tiếng Anh.
Không thể so sánh đầy đủ — không có bản lưu trước đó cho lần sửa đổi này.
Đã cập nhật 8 thg 8, 2026.
Tóm tắt biên tập và chi tiết thay đổi đã ghi nhận.Chi tiết thay đổi
-
Ghi chú thay đổi chi tiết hiện chỉ có bằng tiếng Anh.
Không thể so sánh đầy đủ — không có bản lưu trước đó cho lần sửa đổi này.
Đã cập nhật 30 thg 7, 2026.
Tóm tắt biên tập và chi tiết thay đổi đã ghi nhận.Chi tiết thay đổi
-
Ghi chú thay đổi chi tiết hiện chỉ có bằng tiếng Anh.
Không thể so sánh đầy đủ — không có bản lưu trước đó cho lần sửa đổi này.
Đã cập nhật 29 thg 7, 2026.
Tóm tắt biên tập và chi tiết thay đổi đã ghi nhận.Chi tiết thay đổi
-
Ghi chú thay đổi chi tiết hiện chỉ có bằng tiếng Anh.
Không thể so sánh đầy đủ — không có bản lưu trước đó cho lần sửa đổi này.
Đã cập nhật 29 thg 7, 2026.
Tóm tắt biên tập và chi tiết thay đổi đã ghi nhận.Chi tiết thay đổi
-
Ghi chú thay đổi chi tiết hiện chỉ có bằng tiếng Anh.
Không thể so sánh đầy đủ — không có bản lưu trước đó cho lần sửa đổi này.
Đã cập nhật 28 thg 7, 2026.
Tóm tắt biên tập và chi tiết thay đổi đã ghi nhận.Chi tiết thay đổi
-
Ghi chú thay đổi chi tiết hiện chỉ có bằng tiếng Anh.
-
Ghi chú thay đổi chi tiết hiện chỉ có bằng tiếng Anh.
-
Ghi chú thay đổi chi tiết hiện chỉ có bằng tiếng Anh.
Không thể so sánh đầy đủ — không có bản lưu trước đó cho lần sửa đổi này.
Đã cập nhật 19 thg 7, 2026.
Tóm tắt biên tập và chi tiết thay đổi đã ghi nhận.Chi tiết thay đổi
-
Ghi chú thay đổi chi tiết hiện chỉ có bằng tiếng Anh.
Không thể so sánh đầy đủ — không có bản lưu trước đó cho lần sửa đổi này.
Đã cập nhật 16 thg 7, 2026.
Tóm tắt biên tập và chi tiết thay đổi đã ghi nhận.Chi tiết thay đổi
- Advanced
Ghi chú thay đổi chi tiết hiện chỉ có bằng tiếng Anh.
Không thể so sánh đầy đủ — không có bản lưu trước đó cho lần sửa đổi này.