Tìm kiếm tác nhân
Tìm kiếm tác nhân là AI tự lập kế hoạch, duyệt web và tổng hợp một tác vụ nghiên cứu nhiều bước thay vì chỉ trả lời một truy vấn.
Ngôn ngữ
1 tín hiệu bằng chứng trên trang này
- Công cụ trực tuyến liên quanSEO MCP Server
Tìm kiếm tác nhân là AI tự duyệt web, nghiên cứu và tổng hợp trong nhiều phút thay vì chỉ trả lời một truy vấn. Điểm kỹ thuật quan trọng: trình duyệt tác nhân chạy máy ảo Chrome hoặc Edge thật, nên robots.txt không thể chặn chúng; cần kiểm soát phía máy chủ.
Tóm tắt — Tìm kiếm tác nhân là AI thực hiện toàn bộ công việc nghiên cứu thay cho một người, chứ không chỉ trả lời một câu hỏi. Thay vì phản hồi ngay, hệ thống tự chạy hàng chục lượt tìm kiếm, đọc các trang thật rồi trở lại với một câu trả lời hoàn chỉnh — đôi khi sau vài phút. Hãy so sánh câu trả lời nhanh của ChatGPT với việc ChatGPT Deep Research mất mười phút để tạo một báo cáo. Điều thực tế cần nhớ: một số tác nhân duyệt web bằng trình duyệt Chrome thật, nên
robots.txtkhông thể ngăn chúng.
Ba lớp tìm kiếm
“Agentic search” (bản dịch) «tìm kiếm tác nhân» là một mô hình sản phẩm đang phát triển, không phải kiến trúc xếp hạng tiêu chuẩn duy nhất. Evidence for this claim Deep-research products can perform multi-step web research and synthesize cited results. Scope: Documented product capabilities, not a universal definition or ranking architecture for agentic search. Confidence: high · Verified: OpenAI: Introducing deep research Các hệ thống đã được ghi nhận có thể duyệt web, tổng hợp và thực hiện hành động nhiều bước, nhưng hành vi thay đổi theo sản phẩm và phiên bản. Evidence for this claim The term agentic search covers an evolving set of vendor implementations whose tools and behavior can differ. Scope: Editorial synthesis from documented product behavior; implementations and releases may vary. Confidence: medium · Verified: OpenAI: Introducing deep research
Có thể hình dung tìm kiếm đã phát triển thành ba lớp, lớp sau bổ sung cho lớp trước:
- Tìm kiếm truyền thống. Bạn nhập truy vấn, Google trả về danh sách liên kết, rồi bạn đọc và quyết định. Con người làm phần việc chính.
- Tìm kiếm AI. Bạn đặt câu hỏi, AI lấy một số nguồn và viết một câu trả lời — chẳng hạn AI Overview, câu trả lời của ChatGPT hoặc Perplexity. AI đọc nguồn, bạn đọc phần tổng hợp.
- Tìm kiếm tác nhân. Bạn giao cho AI một mục tiêu — “compare the best project management tools for a 10-person agency and tell me which to pick” (bản dịch) «so sánh các công cụ quản lý dự án tốt nhất cho một agency 10 người và cho tôi biết nên chọn công cụ nào» — rồi nó tự làm việc. Hệ thống lập kế hoạch, chạy nhiều lượt tìm kiếm, mở và đọc trang thật, điều chỉnh cách tiếp cận theo những gì tìm thấy, sau đó viết báo cáo hoặc thậm chí thực hiện hành động như điền biểu mẫu. Bạn có thể không bao giờ thấy các bước ở giữa.
Cách dễ nhớ nhất: mọi tìm kiếm tác nhân đều là tìm kiếm AI, nhưng không phải mọi tìm kiếm AI đều mang tính tác nhân. Tìm kiếm tác nhân là tập con có thể tự làm việc trong một khoảng thời gian.
Một ví dụ cụ thể
Cùng một sản phẩm, hai chế độ:
- ChatGPT, câu trả lời thông thường: bạn hỏi, hệ thống trả lời sau vài giây dựa trên điều đã “biết” và có thể tra web nhanh. Đây là một lượt xử lý.
- ChatGPT Deep Research: bạn hỏi cùng một vấn đề, hệ thống báo sẽ cần thời gian rồi dành nhiều phút để tìm kiếm, đọc và đối chiếu hàng chục nguồn trước khi viết câu trả lời có cấu trúc và trích dẫn.
Chế độ thứ hai là tìm kiếm tác nhân. Gemini Deep Research của Google và Deep Research của Perplexity hoạt động theo cách tương tự.
Vì sao người làm SEO nên quan tâm
Có hai lý do:
- Các tác nhân đọc sâu những trang thật của bạn. Crawler truyền thống lướt nông qua nhiều trang. Một tác nhân có thể đọc kỹ 5–10 trang và trích ra các tuyên bố cụ thể. Trở thành một trong số ít trang được chọn là cuộc chơi mới.
- Không phải lúc nào bạn cũng có thể ngăn chúng. Các phiên bản “research crawler” (bản dịch) «crawler nghiên cứu» như Gemini tự khai báo và tuân thủ
robots.txt. Nhưng các phiên bản trình duyệt tác nhân — ChatGPT Agent và Project Mariner của Google — mở trình duyệt Chrome thật trên đám mây và trông như người truy cập. Không có tên bot để chặn, nênrobots.txtkhông có tác dụng.
Muốn xem phân tích đầy đủ về từng nền tảng, bảng user-agent và các tín hiệu nội dung thực sự hữu ích, hãy chuyển sang thẻ Nâng cao.
Tóm tắt — Tìm kiếm tác nhân là lớp thứ ba của tìm kiếm (truyền thống → tìm kiếm AI → tác nhân): hệ thống chạy vòng lặp nhiều bước — Lập kế hoạch → Tìm kiếm → Đọc → Đánh giá → tìm lại → tổng hợp/hành động — trong nhiều phút, phát 20–160+ truy vấn mỗi phiên và đọc toàn bộ nội dung trang thay vì snapshot lưu trong bộ nhớ đệm. Xét về kiểm soát, nền tảng chia thành hai nhóm. Crawler có khai báo (
Gemini-Deep-Research,Claude-User) tôn trọngrobots.txt. Trình duyệt tác nhân (ChatGPT Agent, Project Mariner, Copilot Actions) chạy máy ảo Chrome/Edge thật mà không khai báo user-agent bot;robots.txtkhông thể chạm tới chúng, chỉ biện pháp phía máy chủ hoặc RFC Web Bot Auth đang hình thành mới có thể tác động. Lợi ích: traffic do AI giới thiệu chuyển đổi tốt hơn khoảng 42% so với traffic không đến từ AI, và traffic tác nhân là phần có ý định cao nhất trong đó.
Tìm kiếm tác nhân là lớp thứ ba, không phải sự thay thế
Mô tả hiện tại của các nhà cung cấp cho thấy khả năng nghiên cứu nhiều bước và dùng công cụ, chứ không chứng minh việc thay thế retrieval hay xếp hạng trên mọi hệ thống. Evidence for this claim Deep-research products can perform multi-step web research and synthesize cited results. Scope: Documented product capabilities, not a universal definition or ranking architecture for agentic search. Confidence: high · Verified: OpenAI: Introducing deep research Các sơ đồ pipeline ở đây là mô hình giải thích, trừ khi nhà cung cấp ghi rõ. Evidence for this claim The term agentic search covers an evolving set of vendor implementations whose tools and behavior can differ. Scope: Editorial synthesis from documented product behavior; implementations and releases may vary. Confidence: medium · Verified: OpenAI: Introducing deep research
Mô hình tư duy tôi thường quay lại là:
- Tìm kiếm truyền thống trả về liên kết; con người đọc và quyết định.
- Tìm kiếm AI — mục tiêu của GEO/AEO như AI Overviews, câu trả lời ChatGPT và Perplexity — trả về một câu trả lời được tổng hợp từ ngữ cảnh đã truy xuất.
- Tìm kiếm tác nhân chia mục tiêu thành nhiệm vụ con, tự chọn công cụ, đọc toàn bộ trang, lặp lại dựa trên điều học được rồi kết thúc bằng báo cáo tổng hợp hoặc một hành động như mua hàng, đặt chỗ hay điền biểu mẫu.
Semrush diễn đạt mối quan hệ này rất rõ: “All agentic search is AI search. Not all agentic search is the same thing as AI search.” (bản dịch) «Mọi tìm kiếm tác nhân đều là tìm kiếm AI. Không phải mọi tìm kiếm tác nhân đều đồng nghĩa với tìm kiếm AI.» Cách nói ngắn gọn dễ nhớ là mọi tìm kiếm tác nhân đều là tìm kiếm AI; không phải mọi tìm kiếm AI đều mang tính tác nhân. Điều này không thay thế SEO truyền thống. Authority, khả năng lập chỉ mục và dữ liệu có cấu trúc vẫn là điều kiện tiên quyết; tối ưu cho tác nhân bổ sung tính đầy đủ, khả năng máy đọc và độ rõ của thực thể.
Hệ thống tác nhân thực sự hoạt động thế nào
Điểm khác biệt cốt lõi so với RAG hoặc một lần retrieval đơn lẻ là retrieval diễn ra giữa quá trình suy luận, theo vòng lặp:
An agent begins by breaking a goal into sub-tasks. It formulates one or more searches, fetches and reads live sources, and evaluates gaps, conflicts, and evidence. When evidence is missing, it revises the query and loops back to search. Once the task is sufficiently supported, it synthesizes a report or takes an allowed action. This is an explanatory model; products vary and do not all expose or implement every step identically.
Firecrawl mô tả đây là phương pháp trong đó tác nhân “decides when to search, formulates the query from context, reads actual page content from each result, and evaluates what it found before deciding whether to synthesize or search again.” (bản dịch) «tự quyết định khi nào cần tìm kiếm, tạo truy vấn từ ngữ cảnh, đọc nội dung trang thật của từng kết quả và đánh giá điều tìm thấy trước khi quyết định tổng hợp hay tìm lại». Các hệ quả thực tế:
- Đọc trang theo thời gian thực, không đọc bản tóm tắt đã lập chỉ mục. Tác nhân lấy và đọc toàn bộ nội dung đang hoạt động. Độ mới và khả năng truy cập trực tiếp quan trọng hơn so với tìm kiếm truyền thống; chúng không chỉ làm việc từ snapshot đã lưu.
- Lặp lại việc điều chỉnh truy vấn. Nếu kết quả lỗi thời hoặc lệch mục tiêu, tác nhân viết lại truy vấn — chẳng hạn thêm “2026” khi gặp tài liệu đã ngừng dùng — rồi thử lại.
- Nối chuỗi công cụ. Một tác vụ có thể kết hợp tìm kiếm web, thực thi code, đọc tệp và gửi biểu mẫu.
Bao nhiêu lượt tìm kiếm trong mỗi phiên
Đây không phải một truy vấn duy nhất. Quy mô theo nền tảng:
| Sản phẩm | Lượt tìm kiếm mỗi phiên | Thời lượng |
|---|---|---|
| Perplexity Deep Research | 20–50 truy vấn | 2–4 phút |
| Gemini Deep Research | ~80 (tiêu chuẩn); ~160 (Max) | tối đa 60 phút (phần lớn < 20) |
| OpenAI Deep Research | chưa công bố; “tens of minutes” (bản dịch) «hàng chục phút» | 10–30+ phút |
| Project Mariner | duyệt theo tác vụ (tối đa 10 tác vụ đồng thời) | theo tác vụ |
| ChatGPT Agent | tối đa ~10 tác vụ đồng thời | theo tác vụ |
Nghiên cứu SAGE của Google cho thấy các tác nhân AI thực hiện trung bình 4,9 bước cho mỗi truy vấn — tìm kiếm, so sánh và đánh giá nhiều nguồn trước khi đưa ra kết quả.
Các nền tảng tác nhân lớn
OpenAI — Deep Research + ChatGPT Agent. Deep Research (o3-deep-research / o4-mini-deep-research) được xây dựng để “find, analyze, and synthesize hundreds of sources to create a comprehensive report at the level of a research analyst,” (bản dịch) «tìm, phân tích và tổng hợp hàng trăm nguồn để tạo báo cáo toàn diện ở cấp độ một chuyên viên nghiên cứu», và OpenAI cảnh báo yêu cầu “can take a long time.” (bản dịch) «có thể mất nhiều thời gian». ChatGPT Agent kế nhiệm Operator — một phiên Chromium chạy trên đám mây, duyệt web thật và có thể chạy khoảng 10 tác vụ đồng thời. Các bot retrieval của nó (OAI-SearchBot, ChatGPT-User) có khai báo; trình duyệt tác nhân thì không.
Google — Gemini Deep Research + Project Mariner. Gemini Deep Research chạy vòng lặp rõ ràng “Plan → Search → Read → Iterate → Output” (bản dịch) «Lập kế hoạch → Tìm kiếm → Đọc → Lặp lại → Đầu ra». Google mô tả hệ thống “continuously refin[ing] its analysis, browsing the web by searching and finding interesting pieces of information then starting a new search based on what it’s learned, repeating this process multiple times before generating a comprehensive report.” (bản dịch) «liên tục tinh chỉnh phân tích, duyệt web để tìm thông tin đáng chú ý rồi bắt đầu lượt tìm kiếm mới dựa trên điều đã học, lặp lại nhiều lần trước khi tạo báo cáo toàn diện». Hệ thống có user-agent Gemini-Deep-Research được khai báo và tôn trọng robots.txt. Project Mariner là tác nhân tự động hóa trình duyệt, hỗ trợ tối đa 10 tác vụ đồng thời; nó dùng dấu vân tay Chrome tiêu chuẩn từ máy ảo đám mây và không khai báo user-agent bot.
Perplexity — Deep Research / Sonar. Perplexity “performs dozens of searches, reads hundreds of sources, and reasons through the material to autonomously deliver a comprehensive report” (bản dịch) «thực hiện hàng chục lượt tìm kiếm, đọc hàng trăm nguồn và suy luận trên tài liệu để tự tạo báo cáo toàn diện» — 20–50 truy vấn trong 2–4 phút. PerplexityBot được khai báo là tôn trọng robots.txt. Tháng 8 năm 2025, Cloudflare báo cáo đã quan sát các crawler không khai báo mà họ quy cho Perplexity truy cập nội dung bất chấp chỉ thị cấm crawl; Perplexity phản bác tường thuật của Cloudflare. Ngoài ra, tài liệu Perplexity nói Perplexity-User thường bỏ qua robots.txt vì đây là lượt lấy dữ liệu do người dùng yêu cầu.
Anthropic — Claude web search + computer use. Claude-User — các lượt lấy dữ liệu thời gian thực do người dùng khởi tạo — tôn trọng robots.txt. Khi Claude chạy ở chế độ computer use, nó điều khiển trình duyệt tiêu chuẩn và không phát user-agent bot được khai báo, cùng mô hình trình duyệt tác nhân như Mariner và ChatGPT Agent.
Microsoft — Copilot + Copilot Actions. Retrieval web bên dưới Copilot dùng Bingbot, vốn tôn trọng robots.txt. Copilot Actions — duyệt web bằng tác nhân — dùng user-agent Edge/Chromium tiêu chuẩn và không có tín hiệu bot được khai báo, nên không thể phân biệt với người duyệt web ở tầng user-agent.
User-agent và khoảng trống của robots.txt
Đây là phần dễ gây nhầm lẫn, nên bảng sau gom toàn cảnh:
| Bot / tác nhân | Tín hiệu user-agent | robots.txt | Loại |
|---|---|---|---|
| GPTBot | …compatible; GPTBot/1.3 | Tôn trọng | Huấn luyện |
| OAI-SearchBot | …compatible; OAI-SearchBot/1.3 | Tôn trọng | Chỉ mục tìm kiếm |
| ChatGPT-User | …compatible; ChatGPT-User/1.0 | Chưa rõ từ tháng 12/2025 | Do người dùng kích hoạt |
| ChatGPT Agent | User-agent Chrome tiêu chuẩn + header Signature-Agent | Không có tín hiệu | Trình duyệt tác nhân |
| ClaudeBot | …compatible; ClaudeBot/1.0 | Tôn trọng | Huấn luyện |
| Claude-SearchBot | Claude-SearchBot | Tôn trọng | Chỉ mục tìm kiếm |
| Claude-User | …compatible; Claude-User/1.0 | Tôn trọng | Do người dùng kích hoạt |
| PerplexityBot | …compatible; PerplexityBot/1.0 | Nói là có; Cloudflare phản bác mức tuân thủ | Chỉ mục tìm kiếm |
| Perplexity-User | …compatible; Perplexity-User/1.0 | Thường bỏ qua | Do người dùng kích hoạt |
| Gemini-Deep-Research | …compatible; Gemini-Deep-Research; +https://gemini.google/… | Tôn trọng | Tác nhân nghiên cứu chuyên sâu |
| Google-Agent | User-agent Chrome tiêu chuẩn | Bỏ qua | Do người dùng kích hoạt |
| Bingbot | …compatible; bingbot/2.0 | Tôn trọng | Chỉ mục Search / Copilot |
| Copilot Actions | User-agent Edge/Chromium tiêu chuẩn | Không có tín hiệu | Trình duyệt tác nhân |
| Project Mariner | User-agent Chrome tiêu chuẩn (máy ảo đám mây) | Không có tín hiệu | Trình duyệt tác nhân |
Các nhóm quan trọng là: crawler huấn luyện và bot chỉ mục tìm kiếm tôn trọng robots.txt; fetcher do người dùng kích hoạt có hành vi khác nhau — OpenAI khiến vị trí của ChatGPT-User kém rõ ràng hơn vào tháng 12 năm 2025; còn trình duyệt tác nhân bỏ qua tệp này theo thiết kế.
Điểm cần nhớ: robots.txt không thể chặn trình duyệt tác nhân
robots.txt là chỉ thị dành cho crawler. Trình duyệt tác nhân — ChatGPT Agent, Project Mariner, Copilot Actions và Claude ở chế độ computer use — khởi chạy phiên Chrome hoặc Edge thật trong máy ảo đám mây. Chúng xuất hiện như trình duyệt tiêu chuẩn, không khai báo danh tính bot và được xem là proxy trình duyệt thay vì crawler. Vì vậy:
- Bạn có thể chặn bot huấn luyện (
GPTBot,ClaudeBot) và bot chỉ mục tìm kiếm (OAI-SearchBot,Claude-SearchBot) trongrobots.txt. - Bạn không thể chặn trình duyệt tác nhân ở đó. Chúng đơn giản không đọc tệp này.
Những biện pháp có tác dụng với tầng trình duyệt tác nhân là kiểm soát phía máy chủ — quy tắc dải IP, giới hạn tốc độ, quản lý bot ở edge — và RFC Web Bot Auth đang hình thành, dùng xác minh tác nhân bằng mật mã. ChatGPT Agent đã phát tín hiệu sớm: nó gửi HTTP Message Signature Signature-Agent: +"https://chatgpt.com" được ký bằng ed25519, là định danh phía máy chủ đáng tin cậy duy nhất cho nó. Trong analytics thông thường, lượt truy cập trực tiếp xuất hiện là “direct/(none)” hoặc “Bing/organic” khi nó tìm thấy bạn qua Bing.
Một hệ quả đáng nói rõ: chặn GPTBot không ngăn ChatGPT đọc trang của bạn theo thời gian thực. GPTBot là crawler huấn luyện. Deep Research và ChatGPT Agent tiếp cận nội dung qua các cơ chế hoàn toàn khác.
Tín hiệu nội dung nào quan trọng với AI tác nhân
Tác nhân đọc toàn bộ trang và đánh giá tính đầy đủ, khả năng trích dẫn, tính nhất quán và khả năng máy đọc. Từ nghiên cứu, những yếu tố thực sự hữu ích gồm:
- Trang toàn diện, tập trung vào một chủ đề. Tác nhân đi sâu nhưng hẹp: chúng có thể đọc kỹ 5–10 trang thay vì lướt hàng trăm trang. Một trang trả lời đầy đủ chủ đề và các câu hỏi con hữu ích hơn nhiều so với năm trang mỏng. ALM Corp diễn đạt: “Structure gives agents stable extraction points — a page with clear headings, labeled sections and consistent formatting is easier to quote accurately.” (bản dịch) «Cấu trúc cung cấp cho tác nhân các điểm trích xuất ổn định; một trang có tiêu đề rõ, phần được gắn nhãn và định dạng nhất quán sẽ dễ được trích dẫn chính xác hơn.»
- Nội dung có thẩm quyền, được trích dẫn và máy đọc được. Tác nhân đối chiếu với nguồn bên thứ ba và kho tri thức, nên trích dẫn bên ngoài giúp vượt ngưỡng tin cậy. Điều này phù hợp với kết quả tôi thấy ở AI Overviews: lượt nhắc trên các trang có nhiều liên kết tương quan ~0,70 (Spearman) với khả năng hiển thị AI — tín hiệu đơn mạnh nhất trong nghiên cứu đó và có thể cũng là dạng tín hiệu mà retrieval tác nhân dựa vào.
- Dữ liệu có cấu trúc. JSON-LD không bắt buộc để được trích dẫn, nhưng cải thiện độ chính xác khi trích xuất; trong một thử nghiệm được dẫn nguồn, tỷ lệ trả lời đúng của GPT-4 tăng từ 16% lên 54% khi nội dung có dữ liệu có cấu trúc.
- Tốc độ. Dữ liệu BrightEdge cho thấy các tác nhân ChatGPT rời trang tải chậm ngay lập tức; chúng ít kiên nhẫn hơn Googlebot. Điều này mở rộng kỷ luật Core Web Vitals sang bối cảnh tác nhân. Nội dung cũng phải truy cập được mà không cần thực thi JavaScript.
- Phạm vi và đánh đổi rõ ràng. Trang nêu rõ giải pháp dành cho ai, không dành cho ai và những đánh đổi sẽ hữu ích hơn với tác nhân đang lập danh sách rút gọn so với nội dung cố làm hài lòng mọi người.
Vì sao đáng đầu tư: chất lượng chuyển đổi
Lượng traffic còn nhỏ nhưng chất lượng thì không. Tính đến tháng 3 năm 2026, traffic do AI giới thiệu chuyển đổi tốt hơn khoảng 42% so với traffic không đến từ AI, còn traffic tìm kiếm AI chuyển đổi khoảng 14,2% so với 2,8% của Google. Traffic tác nhân là tập con của traffic AI và gần như chắc chắn có ý định cao nhất, vì tác nhân chỉ đưa người dùng đến trang sau khi thay họ đánh giá các lựa chọn. Trở thành một trong số ít trang được tác nhân đọc và là trang được đề xuất có giá trị vượt trội.
Cách tư duy: SEO → GEO → ASO
Hãy coi tối ưu tác nhân là lớp thứ ba xếp trên hai lớp đầu, không phải sự thay thế. Nền tảng không đổi: authority, khả năng lập chỉ mục và dữ liệu có cấu trúc. Phần mới là tài nguyên toàn diện theo một chủ đề, khả năng máy đọc triệt để, thực thể rõ ràng, trích dẫn bên ngoài và nhận thức rằng robots.txt không còn là toàn bộ câu chuyện kiểm soát truy cập. Xem thẻ Checklists để có lượt kiểm tra cụ thể.
Tóm tắt AI
Bản cô đọng của phần Nâng cao:
- Tìm kiếm tác nhân là lớp thứ ba của tìm kiếm: truyền thống (liên kết) → tìm kiếm AI (một câu trả lời) → tác nhân (nghiên cứu/hành động nhiều bước tự chủ). “All agentic search is AI search. Not all AI search is agentic.” (bản dịch) «Tìm kiếm tác nhân luôn thuộc tìm kiếm AI, nhưng tìm kiếm AI không phải lúc nào cũng hoạt động theo kiểu tác nhân.»
- Hệ thống chạy vòng lặp, không phải một truy vấn: Lập kế hoạch → Tìm kiếm → Đọc → Đánh giá → tìm lại → tổng hợp/hành động trong nhiều phút. Gemini Deep Research phát khoảng 80–160 truy vấn mỗi phiên; Perplexity 20–50; nghiên cứu SAGE của Google ghi nhận khoảng 4,9 bước mỗi truy vấn.
- Hai nhóm kiểm soát. Crawler có khai báo (
Gemini-Deep-Research,Claude-User) tôn trọngrobots.txt. Trình duyệt tác nhân (ChatGPT Agent, Project Mariner, Copilot Actions) chạy máy ảo Chrome/Edge thật mà không khai báo user-agent bot, nênrobots.txtkhông chặn được. - Điểm khó: chỉ kiểm soát phía máy chủ hoặc RFC Web Bot Auth đang hình thành mới chặn được trình duyệt tác nhân. Header ed25519
Signature-Agentcủa ChatGPT Agent là định danh phía máy chủ đáng tin cậy duy nhất. ChặnGPTBotkhông đồng nghĩa ngăn ChatGPT đọc trang. - Cloudflare và Perplexity bất đồng về sự việc. Cloudflare báo cáo các crawler không khai báo mà họ quy cho Perplexity đã vượt chỉ thị cấm crawl; Perplexity phủ nhận cáo buộc. Hãy coi đây là tranh chấp được báo cáo, không phải kết luận đã ngã ngũ.
- Yếu tố hữu ích: trang toàn diện theo một chủ đề, trích dẫn bên ngoài (~0,70 Spearman với khả năng hiển thị AI), dữ liệu có cấu trúc, tốc độ — tác nhân rời trang chậm — và phạm vi rõ ràng.
- Lý do đáng làm: traffic do AI giới thiệu chuyển đổi tốt hơn khoảng 42%; tìm kiếm AI đạt 14,2% so với 2,8% của Google. Tác nhân là tập con có ý định cao nhất.
Tài liệu chính thức
Tài liệu nguồn chính từ các nhà cung cấp nền tảng.
OpenAI
- Hướng dẫn Deep Research — các model
o3-deep-research/o4-mini-deep-research, thực thi nền và quyền truy cập công cụ. - Bot và crawler của OpenAI — chuỗi user-agent đầy đủ của GPTBot, OAI-SearchBot và ChatGPT-User.
- Giới thiệu ChatGPT Agent — trình duyệt tác nhân kế nhiệm Operator.
- Tài liệu API Gemini Deep Research — số truy vấn, giới hạn thời lượng và thực thi nền.
- Thử Deep Research trong Gemini — mô tả vòng lặp nghiên cứu bằng ngôn ngữ dễ hiểu của Google.
Anthropic
- Công cụ computer use của Claude — cách Claude điều khiển trình duyệt hoặc máy tính ở chế độ tác nhân.
Perplexity
- Sonar Deep Research — model API đứng sau Deep Research.
- Crawler của Perplexity — PerplexityBot so với Perplexity-User và hành vi robots.txt được công bố.
Microsoft
- Bing Webmaster Tools — Bingbot làm nền cho retrieval web của Copilot; kiểm soát crawl nằm ở đây.
Trích dẫn từ nguồn
Các phát biểu được ghi nhận của nhà cung cấp nền tảng và những nhà nghiên cứu mô tả hành vi của họ.
Google — vòng lặp Gemini Deep Research
- “Over the course of a few minutes, Gemini continuously refines its analysis, browsing the web by searching and finding interesting pieces of information then starting a new search based on what it’s learned, repeating this process multiple times before generating a comprehensive report.” (bản dịch) «Trong vài phút, Gemini liên tục tinh chỉnh phân tích, duyệt web bằng cách tìm kiếm thông tin đáng chú ý rồi bắt đầu lượt tìm kiếm mới dựa trên điều đã học, lặp lại quy trình nhiều lần trước khi tạo báo cáo toàn diện.» — Google Blog. Nguồn
OpenAI — mục đích của Deep Research
- Các model Deep Research “find, analyze, and synthesize hundreds of sources to create a comprehensive report at the level of a research analyst.” (bản dịch) «tìm, phân tích và tổng hợp hàng trăm nguồn để tạo báo cáo toàn diện ở cấp độ một chuyên viên nghiên cứu»
[unverified]— đây là diễn giải định vị Deep Research của OpenAI; cần đối chiếu tài liệu trực tiếp. Nguồn
Perplexity — cách Deep Research hoạt động
- “Perplexity performs dozens of searches, reads hundreds of sources, and reasons through the material to autonomously deliver a comprehensive report.” (bản dịch) «Perplexity thực hiện hàng chục lượt tìm kiếm, đọc hàng trăm nguồn và suy luận trên tài liệu để tự tạo báo cáo toàn diện.» — Perplexity Blog. Nguồn
Cloudflare — crawler ẩn của Perplexity
Cáo buộc của Cloudflare được trích bên dưới; Perplexity phản bác tường thuật này.- “Both their declared and undeclared crawlers were attempting to access the content for scraping contrary to the web crawling norms as outlined in RFC 9309.” (bản dịch) «Cả crawler có khai báo lẫn không khai báo của họ đều cố truy cập nội dung để thu thập dữ liệu, trái với chuẩn mực crawl web nêu trong RFC 9309.» — Cloudflare. Nguồn
Firecrawl — định nghĩa tìm kiếm tác nhân
- Tìm kiếm tác nhân là phương pháp trong đó tác nhân “decides when to search, formulates the query from context, reads actual page content from each result, and evaluates what it found before deciding whether to synthesize or search again.” (bản dịch) «tự quyết định khi nào cần tìm kiếm, tạo truy vấn từ ngữ cảnh, đọc nội dung trang thật của từng kết quả và đánh giá điều tìm thấy trước khi quyết định tổng hợp hay tìm lại». — Firecrawl Blog. Nguồn
ALM Corp — điều tác nhân ưu tiên
- “Structure gives agents stable extraction points — a page with clear headings, labeled sections and consistent formatting is easier to quote accurately.” (bản dịch) «Cấu trúc cung cấp cho tác nhân các điểm trích xuất ổn định; một trang có tiêu đề rõ, phần được gắn nhãn và định dạng nhất quán sẽ dễ được trích dẫn chính xác hơn.» — ALM Corp. Nguồn
Semrush — phân biệt các lớp
- “All agentic search is AI search. Not all AI search is agentic.” (bản dịch) «Tìm kiếm mang tính tác nhân là một dạng tìm kiếm AI; chiều ngược lại không luôn đúng.»
[unverified]— đây là diễn giải khung của Semrush; cần xác nhận nguyên văn trên bài trực tiếp. Nguồn
[unverified] là diễn giải và phải được đối chiếu với nguồn trực tiếp trước khi xem là nguyên văn. Checklist tối ưu tìm kiếm tác nhân
Một lượt kiểm tra để bảo đảm tác nhân có thể tìm, đọc, tin cậy và trích dẫn bạn — đồng thời bạn có thể nhận biết khi chúng truy cập:
- Trang toàn diện theo một chủ đề. Mỗi chủ đề quan trọng có một trang trả lời đầy đủ chủ đề và các câu hỏi con, thay vì nhiều trang mỏng. Tác nhân đọc sâu, không đọc rộng.
- Nguồn trích dẫn và thẩm quyền bên ngoài. Các tuyên bố có nguồn; bạn được nhắc trên trang bên thứ ba có thẩm quyền và nhiều liên kết — tín hiệu hiển thị AI mạnh nhất tôi từng đo.
- Có dữ liệu có cấu trúc. Dùng JSON-LD như Organization, FAQPage hoặc Product để tác nhân trích xuất sự thật chính xác mà không đoán.
- Phạm vi và đánh đổi rõ ràng. Trang nói giải pháp dành cho ai, không dành cho ai và các đánh đổi, giúp tác nhân lập danh sách rút gọn dễ hơn.
- Truy cập được không cần JavaScript và tải nhanh. Nội dung cốt lõi có trong HTML thô; trang tải nhanh vì tác nhân rời trang chậm nhanh hơn Googlebot.
- Kiểm soát phía máy chủ, không chỉ
robots.txt. Nếu cần giới hạn truy cập, dùng quy tắc dải IP hoặc quản lý bot ở edge; trình duyệt tác nhân bỏ quarobots.txt. - Vẫn cấu hình đúng
robots.txtcho bot có khai báo. Quyết định riêng cho bot huấn luyện (GPTBot,ClaudeBot), retrieval (OAI-SearchBot,Claude-SearchBot) và nghiên cứu chuyên sâu (Gemini-Deep-Research). - Theo dõi crawler tác nhân trong log máy chủ. Quan sát cả user-agent nghiên cứu chuyên sâu được khai báo lẫn header
Signature-Agent— định danh đáng tin cậy duy nhất của ChatGPT Agent; nhớ rằng lượt truy cập trực tiếp có thể hiện là “direct/(none)” trong analytics.
Bảng tra nhanh user-agent của AI tác nhân
| Nền tảng / tác nhân | Tín hiệu user-agent | Nhóm | robots.txt | Ghi chú |
|---|---|---|---|---|
| GPTBot | …compatible; GPTBot/1.3 | Huấn luyện | Tôn trọng | Chặn không đồng nghĩa dừng lượt đọc trực tiếp của ChatGPT |
| OAI-SearchBot | …compatible; OAI-SearchBot/1.3 | Chỉ mục tìm kiếm | Tôn trọng | Cấp dữ liệu cho tìm kiếm ChatGPT |
| ChatGPT-User | …compatible; ChatGPT-User/1.0 | Do người dùng kích hoạt | Chưa rõ (thay đổi tháng 12/2025) | Câu chữ chính sách đã nới lỏng |
| ChatGPT Agent | User-agent Chrome + header Signature-Agent | Trình duyệt tác nhân | Không | Ký ed25519; định danh phía máy chủ đáng tin cậy duy nhất |
| ClaudeBot | …compatible; ClaudeBot/1.0 | Huấn luyện | Tôn trọng | — |
| Claude-SearchBot | Claude-SearchBot | Chỉ mục tìm kiếm | Tôn trọng | — |
| Claude-User | …compatible; Claude-User/1.0 | Do người dùng kích hoạt | Tôn trọng | — |
| Claude (computer use) | User-agent trình duyệt tiêu chuẩn | Trình duyệt tác nhân | Không | Điều khiển trình duyệt thật |
| PerplexityBot | …compatible; PerplexityBot/1.0 | Chỉ mục tìm kiếm | Nói là có; mức tuân thủ bị tranh cãi | Cáo buộc Cloudflare; Perplexity phủ nhận |
| Perplexity-User | …compatible; Perplexity-User/1.0 | Do người dùng kích hoạt | Thường bỏ qua | Theo tài liệu Perplexity |
| Gemini-Deep-Research | …compatible; Gemini-Deep-Research; +https://gemini.google/… | Tác nhân nghiên cứu chuyên sâu | Tôn trọng | Có khai báo, có thể chặn |
| Google-Agent | User-agent Chrome tiêu chuẩn | Do người dùng kích hoạt | Bỏ qua | Proxy trình duyệt |
| Bingbot | …compatible; bingbot/2.0 | Chỉ mục Search / Copilot | Tôn trọng | Làm nền cho retrieval của Copilot |
| Copilot Actions | User-agent Edge/Chromium tiêu chuẩn | Trình duyệt tác nhân | Không | Không có tín hiệu bot |
| Project Mariner | User-agent Chrome tiêu chuẩn (máy ảo đám mây) | Trình duyệt tác nhân | Không | Tối đa 10 tác vụ đồng thời |
Quy tắc một dòng: crawler có khai báo và bot tìm kiếm tôn trọng robots.txt; trình duyệt tác nhân — máy ảo Chrome/Edge thật — thì không. Hãy chặn chúng phía máy chủ hoặc qua Web Bot Auth.
Những sai lầm về tìm kiếm tác nhân
Cho rằng robots.txt kiểm soát mọi tác nhân
Một số hệ thống tác nhân duyệt qua hạ tầng trình duyệt thông thường thay vì danh tính crawler được khai báo. Hãy dùng quy tắc robots cho bot tôn trọng chúng, nhưng đừng xem tệp này là ranh giới kiểm soát truy cập.
Chỉ thiết kế cho câu trả lời một lượt
Tác nhân có thể so sánh, quay lại, lọc và hoàn thành tác vụ nhiều bước. Hãy làm cho điều hướng, biểu mẫu, trạng thái, giá, chính sách và quan hệ thực thể đủ rõ để tồn tại qua một quy trình dài.
Giấu dữ kiện quan trọng sau tương tác mong manh
Tác nhân không thể dùng đáng tin cậy thông tin chỉ xuất hiện sau một cử chỉ không truy cập được, trạng thái canvas hoặc hành động client không có tài liệu. Hãy duy trì HTML ngữ nghĩa, URL ổn định, nhãn rõ và kết quả có thể xác minh phía máy chủ.
Khung Khám phá, Hiểu, Hành động, Xác minh
- Khám phá: Trang và khả năng quan trọng có liên kết ổn định hoặc điểm vào máy đọc được có tài liệu.
- Hiểu: Thực thể, ràng buộc, giá, chính sách và bước tiếp theo được nêu rõ trong nội dung ngữ nghĩa.
- Hành động: Biểu mẫu và quy trình có nhãn rõ, điều khiển dự đoán được và trạng thái lỗi có thể khôi phục.
- Xác minh: Một hành động hoàn tất tạo ra xác nhận bền vững mà người dùng hoặc tác nhân có thể kiểm tra trước khi tiếp tục.
Dùng khung này để rà soát toàn bộ hành trình tác vụ. Một trang có thể dễ truy xuất nhưng vẫn thất bại khi tác nhân cố hành động hoặc xác nhận kết quả.
Công cụ cho trải nghiệm tìm kiếm mà tác nhân truy cập được
- SEO MCP Server — xem ví dụ giới hạn, chỉ đọc về cách đưa nội dung SEO đã xuất bản và khả năng xác minh trực tiếp cho tác nhân.
- Trình kiểm tra robots.txt — xác minh quy tắc crawler có khai báo và chỉ thị thắng, đồng thời nhớ rằng tác nhân dựa trên trình duyệt thông thường có thể không trình bày danh tính crawler có thể kiểm soát.
- Công cụ phát triển trình duyệt — kiểm tra tên ngữ nghĩa, thứ tự focus, cuộc gọi mạng, trạng thái lỗi và tín hiệu hoàn tất bền vững trong toàn bộ tác vụ.
- Log máy chủ — phân biệt bot có tài liệu, trình duyệt thông thường và client chưa biết mà không tuyên bố mọi request đều cho biết tác nhân hoặc mục đích của nó.
Tự kiểm tra: tìm kiếm tác nhân
Tài nguyên đáng xem
Tài liệu nền tảng chính thức
- OpenAI Deep Research và bot OpenAI.
- API Google Gemini Deep Research và bài ra mắt.
- Anthropic Claude computer use.
- Perplexity Sonar Deep Research và crawler Perplexity.
Bài viết liên quan của tôi
- Điều chúng ta thực sự biết về tối ưu tìm kiếm LLM — nghiên cứu tương quan đứng sau kết quả ~0,70 Spearman về lượt nhắc trên trang có thẩm quyền cao.
- Gặp các crawler web mới: bot AI đang áp sát bot công cụ tìm kiếm — bức tranh crawler đang thay đổi.
Nguồn khác
- Cloudflare: Perplexity dùng crawler ẩn, không khai báo — cáo buộc và phân tích kỹ thuật của Cloudflare; Perplexity phủ nhận.
- Simon Willison: user-agent của ChatGPT Agent — chi tiết
Signature-Agent/ ed25519. - Firecrawl: Tìm kiếm tác nhân là gì — cấu trúc kỹ thuật của vòng lặp.
- Semrush: Tìm kiếm tác nhân và ALM Corp: Giải thích Agentic Web — khung chiến lược.
- No Hacks: Toàn cảnh user-agent AI năm 2026 và danh sách user-agent crawler AI của SEJ.
- BrightEdge: Hoạt động AI tác nhân tăng gấp đôi — dữ liệu hoạt động ChatGPT Agent tăng gấp đôi từ tháng 7 đến tháng 8/2025 và tác nhân rời trang chậm nhanh hơn Googlebot.
- Seer Interactive: Cách nhận biết OpenAI Operator truy cập website — hướng dẫn nhận diện và đo lượt truy cập trình duyệt tác nhân trong analytics.
- Cloudflare: Từ Googlebot đến GPTBot — dữ liệu khối lượng crawl của bot AI có khai báo so với crawler tìm kiếm truyền thống.
- Navoto: Tối ưu tìm kiếm tác nhân — khung ASO thực tế về lớp SEO → GEO → ASO và tín hiệu nội dung.
Số liệu đáng trích dẫn
- Traffic do AI giới thiệu chuyển đổi tốt hơn khoảng 42% so với traffic không đến từ AI (tháng 3/2026) — lý do chính khiến khả năng hiển thị với tác nhân đáng đầu tư. Nguồn
- Tìm kiếm AI chuyển đổi khoảng 14,2% so với 2,8% của Google — traffic tác nhân là tập con có ý định cao nhất. Nguồn
- Gemini Deep Research: khoảng 80 truy vấn mỗi phiên (tiêu chuẩn), khoảng 160 (Max) — quy mô của một lượt nghiên cứu tác nhân. Nguồn
- Perplexity Deep Research: 20–50 truy vấn mỗi phiên, 2–4 phút — lượt chạy nhẹ hơn nhưng vẫn nhiều bước. Nguồn
- Tương quan Spearman ~0,70 giữa lượt nhắc trên trang có nhiều liên kết và khả năng hiển thị AI trong Google AI Overviews — kết quả của tôi và có thể phản ánh dạng tín hiệu tin cậy tác nhân. Nguồn
- Traffic AI tác nhân tăng 1 300% trong tám tháng đầu năm 2025, riêng hoạt động ChatGPT Agent tăng gấp đôi từ tháng 7 đến tháng 8/2025 — phần tăng nhanh nhất của traffic do AI giới thiệu. Nguồn
Nhật ký thay đổi
Đã cập nhật 22 thg 8, 2026.
Tóm tắt biên tập và chi tiết thay đổi đã ghi nhận.Chi tiết thay đổi
-
Ghi chú thay đổi chi tiết hiện chỉ có bằng tiếng Anh.
Không thể so sánh đầy đủ — không có bản lưu trước đó cho lần sửa đổi này.
Đã cập nhật 9 thg 8, 2026.
Tóm tắt biên tập và chi tiết thay đổi đã ghi nhận.Chi tiết thay đổi
-
Ghi chú thay đổi chi tiết hiện chỉ có bằng tiếng Anh.
Không thể so sánh đầy đủ — không có bản lưu trước đó cho lần sửa đổi này.
Đã cập nhật 8 thg 8, 2026.
Tóm tắt biên tập và chi tiết thay đổi đã ghi nhận.Chi tiết thay đổi
-
Ghi chú thay đổi chi tiết hiện chỉ có bằng tiếng Anh.
Không thể so sánh đầy đủ — không có bản lưu trước đó cho lần sửa đổi này.