Hướng dẫn Baiduspider

Baiduspider là gì — các biến thể crawler và user-agent của Baidu, tuân thủ robots.txt cùng ngoại lệ cpro/ads, xác minh DNS hai chiều, kết xuất JavaScript yếu và kiểm soát crawl trong Ziyuan.

Xuất bản lần đầu: 3 thg 7, 2026 · Cập nhật lần cuối: 22 thg 8, 2026 · Advanced
Ngôn ngữ
1 tín hiệu bằng chứng trên trang này

Baiduspider là crawler web của Baidu, công cụ tìm kiếm dành cho thị trường Trung Quốc. Các biến thể dùng chung họ token Baiduspider, cùng biến thể JavaScript Baiduspider-render chỉ được Baidu ghi nhận bằng tiếng Trung. Vì user-agent có thể giả mạo, hãy xác minh bằng DNS hai chiều tới *.baidu.com hoặc *.baidu.jp. FAQ Baidu tuyên bố crawler tuân thủ nghiêm ngặt robots.txt, nhưng nêu ngoại lệ Baiduspider-cpro và Baiduspider-ads theo thỏa thuận thương mại; Baiduspider cũng xử lý JavaScript yếu nên HTML do máy chủ kết xuất là mặc định an toàn. Kiểm soát tần suất crawl trong Baidu Search Resource Platform (Ziyuan).

Tóm tắt — Baiduspider là crawler của Baidu — Googlebot cho thị trường Trung Quốc. Các biến thể có tên dùng chung họ token Baiduspider — PC/mobile thông thường, cùng -image, -video, -news, -favo, -cpro, -ads — và biến thể JavaScript Baiduspider-render mà Baidu chỉ ghi nhận bằng tiếng Trung. Hãy xác minh bằng DNS hai chiều tới *.baidu.com/*.baidu.jp — FAQ của chính Baidu cảnh báo về kẻ giả mạo. Baidu tuyên bố crawler “strictly complies with robots.txt protocol,” (bản dịch) “tuân thủ nghiêm ngặt giao thức robots.txt”, với ngoại lệ được nêu tên: Baiduspider-cproBaiduspider-ads hoạt động theo thỏa thuận thương mại và có thể theo quy tắc truy cập khác; Baidu cũng không ghi nhận crawl-delay phi tiêu chuẩn là biện pháp kiểm soát đáng tin cậy. Vì hành vi kết xuất có thể thay đổi, HTML do máy chủ kết xuất là mặc định thận trọng cho nội dung thiết yếu. Xác minh kiểm soát hiện tại trong Baidu Search Resource Platform — Ziyuan.

Evidence for this claim Baiduspider is Baidu Search's crawler and Baidu's Search Resource Platform is the authoritative place to verify current crawler guidance. Scope: Current official Baidu webmaster platform; user-agent text alone is not authentication. Confidence: medium · Verified: Baidu Search Resource Platform Evidence for this claim Crawler access directives use the standardized robots.txt protocol, but engine-specific support and verification should be checked against Baidu's current documentation. Scope: Robots Exclusion Protocol baseline, distinct from undocumented Baidu-specific behavior. Confidence: high · Verified: IETF RFC 9309: Robots Exclusion Protocol

Baiduspider thực chất là gì

Baiduspider (百度蜘蛛) là crawler do Baidu vận hành — công cụ tìm kiếm chiếm ưu thế tại Trung Quốc đại lục, nơi Google phần lớn không thể truy cập phía sau Great Firewall. Công việc của nó là quy trình crawl → lập chỉ mục → phục vụ tiêu chuẩn: khám phá URL, truy xuất trang và xây chỉ mục Baidu Search sử dụng. FAQ tiếng Anh chính thức của Baidu, “FAQs of Baiduspider” trên help.baidu.com, là tài liệu sơ cấp tiếng Anh hiếm hoi và là nguồn của phần lớn trích dẫn trực tiếp bên dưới.

Sự bất đối xứng định hình toàn bộ chủ đề: Baidu quan trọng trong nước, không phải toàn cầu. Ảnh chụp StatCounter tháng 6/2026 tại Trung Quốc ghi Baidu 47,44%, Bing 23,24%, Haosou 14,02%, Sogou 2,62% và Google chỉ 2,28% — StatCounter, thị phần công cụ tìm kiếm Trung Quốc. Hãy coi đây là ảnh chụp, không phải hằng số — số liệu Trung Quốc của StatCounter biến động đáng kể theo tháng tùy thiết bị và phương pháp; Baidu từng được báo cáo khoảng 40–65% trong các ảnh chụp 2025–2026. Vì vậy, hãy kiểm tra lại số liệu trực tiếp thay vì dùng mãi số của một tháng. Kết luận vẫn đúng: Baidu dẫn đầu bên trong Trung Quốc còn Google dẫn đầu phần còn lại của thế giới; đó là lý do tối ưu Baiduspider là chuyên môn international SEO riêng chứ không phải việc phụ sau Googlebot. Trung tâm SEO theo từng thị trường trình bày vị trí của Baidu bên cạnh Yandex, Naver và các công cụ khu vực khác.

Chuỗi user-agent và các biến thể crawler

FAQ tiếng Anh của Baidu nêu trực tiếp các biến thể crawler. Dưới đây được giữ nguyên văn — và đúng là nội dung của chính Baidu lặp “Baiduspider” cho cả PC lẫn mobile thay vì cung cấp chuỗi khác nhau:

Tên sản phẩm | User-agent Tìm kiếm PC | Baiduspider Tìm kiếm mobile | Baiduspider Tìm kiếm hình ảnh | Baiduspider-image Tìm kiếm video | Baiduspider-video Tìm kiếm tin tức | Baiduspider-news Dấu trang Baidu | Baiduspider-favo Liên minh Baidu | Baiduspider-cpro Tìm kiếm thương mại | Baiduspider-ads Tìm kiếm khác | Baiduspider

Vì vậy, các biến thể được FAQ tiếng Anh chính thức nêu tên là Baiduspider-image, -video, -news, -favo — dấu trang — -cpro — crawler mạng quảng cáo “union” — và -ads — tìm kiếm thương mại; tất cả dùng chung token họ Baiduspider. Chuỗi user-agent PC thông thường theo chính website Baidu là:

Mozilla/5.0 (compatible; Baiduspider/2.0; +http://www.baidu.com/search/spider.html)

UA mobile nhúng Baiduspider/2.0 trong chuỗi Android WebKit. Mọi biến thể được công bố đều trỏ tới cùng URL tham chiếu http://www.baidu.com/search/spider.html — tương đương google.com/bot.html của Googlebot.

Baiduspider-render — biến thể JS Baidu chỉ ghi nhận bằng tiếng Trung

Đây là sắc thái cần nêu đúng vì nhiều bài viết nói sai: bảng FAQ tiếng Anh ở trên không liệt kê biến thể “Baiduspider-render”, khiến một số hướng dẫn gọi nó là chuyện truyền miệng của bên thứ ba. Không phải vậy. Baidu chính thức ghi nhận Baiduspider-render — nhưng chỉ trên trang Ziyuan Academy bằng tiếng Trung, “【官方说法】只需两步,正确识别百度蜘蛛(User-Agent)” — “Tuyên bố chính thức: hai bước để nhận diện đúng Baiduspider”. Trang chia UA thành ba kênh — 移动 (mobile), PC và 小程序 (mini-program) — rồi liệt kê UA kết xuất thay thế bên cạnh UA thông thường:

Mozilla/5.0 (compatible; Baiduspider-render/2.0; +http://www.baidu.com/search/spider.html)

cùng chuỗi mobile tương ứng và biến thể mini-program — Baiduspider-render/2.0;Smartapp. Vì vậy, Baiduspider-render được ghi nhận chính thức — chỉ bằng tiếng Trung, không có trong FAQ tiếng Anh. Điều Baidu không công bố là đặc tả “-render” làm gì khác; khác Google, Baidu không ghi nhận năng lực kết xuất JavaScript. Khoảng trống đó là nguồn của lưu ý về kết xuất JS bên dưới.

Cách xác minh Baiduspider và tránh bot giả mạo

Chuỗi user-agent rất dễ bị giả mạo — bất kỳ ai cũng có thể gửi request tự nhận là Baiduspider. FAQ của chính Baidu cảnh báo đúng việc này, mô tả “spammers or other trouble makers who pretend to be Baiduspider,” (bản dịch) “spammer hoặc kẻ gây rối giả làm Baiduspider”, và hướng dẫn xác minh bằng DNS, không phải chuỗi. Nguyên văn từ FAQ:

“We recommend using reverse DNS lookup to verify Baiduspider. Verification methods are different under linux/windows/os environments.” (bản dịch) “Chúng tôi khuyến nghị dùng tra cứu DNS ngược để xác minh Baiduspider. Phương thức xác minh khác nhau giữa môi trường Linux/Windows/hệ điều hành.”

FAQ cung cấp lệnh theo hệ điều hành — host trên Linux, nslookup trên Windows, dig -x trên macOS — kèm ví dụ, và quy tắc quan trọng:

“The hostname of Baiduspider is *.baidu.com or *.baidu.jp. Others are fake hostnames.” (bản dịch) “Hostname Baiduspider phải thuộc *.baidu.com hoặc *.baidu.jp; mọi hostname khác đều là giả mạo.”

Hai domain *.baidu.com*.baidu.jp là điểm khác thường cần nhớ — Baidu crawl từ cả namespace DNS ngược .com lẫn .jp, nên hostname Baiduspider hợp lệ có thể kết thúc bằng một trong hai. Một ví dụ của chính Baidu còn phân giải thành BaiduMobaider-119-63-195-254.crawl.baidu.jp — lưu ý “BaiduMobaider”, không phải “Baiduspider”, trong hostname; đây là điểm lạ thật trong tài liệu Baidu, không phải lỗi đánh máy cần âm thầm sửa.

FAQ tiếng Anh của Baidu chỉ nêu nửa tra cứu ngược trong phần văn xuôi, nhưng trang Ziyuan Academy tiếng Trung rõ hơn: trang gọi toàn bộ quy trình là “双向DNS解析认证” — xác thực phân giải DNS hai chiều — và chia thành “第一步:DNS反查IP” — bước 1: tra cứu ngược IP — cùng “第二步:对域名运行正向DNS查找” — bước 2: chạy tra cứu DNS xuôi trên hostname. Đây là phương thức đầy đủ và đúng: tra cứu ngược IP để xác nhận hostname *.baidu.com/*.baidu.jp, sau đó tra cứu xuôi hostname và xác nhận nó phân giải về cùng IP. Đây là cùng phương thức hai bước để xác minh Googlebot hoặc Bingbot — các lệnh nằm trong tab Scripts.

Baiduspider và robots.txt

Baidu đưa ra một tuyên bố tuân thủ mạnh, có thể trích dẫn trong FAQ của chính mình:

“Baidu strictly complies with robots.txt protocol.” (bản dịch) “Baidu tuân thủ nghiêm ngặt giao thức robots.txt.”

Baidu cũng hỗ trợ các kiểm soát tiêu chuẩn như dự kiến. Theo tài liệu Ziyuan Academy, Baiduspider hỗ trợ wildcard *$ trong đường dẫn robots.txt — tương đương Google và Bing — đồng thời khớp đường dẫn chính xác, phân biệt hoa thường. Có thể đặt quy tắc theo từng user-agent; FAQ Baidu cung cấp ví dụ, gồm ví dụ chặn toàn bộ Baiduspider thông thường nhưng cho crawler hình ảnh vào /image/:

User-agent: Baiduspider
Disallow: /
User-agent: Baiduspider-image
Allow: /image/

Baidu cũng lưu ý Baiduspider-video hiện không hỗ trợ các quy tắc này.

Ngoại lệ được nêu tên cho “tuân thủ nghiêm ngặt”

Điểm căng thẳng đáng chú ý: Baidu tuyên bố tuân thủ nghiêm ngặt nhưng ghi nhận một ngoại lệ chính thức, được nêu tên. Baiduspider-cpro — crawler mạng quảng cáo — và Baiduspider-ads — tìm kiếm thương mại — hoạt động theo thỏa thuận thương mại riêng và bỏ qua robots.txt theo thiết kế. Nguyên văn FAQ: “Baiduspider-cpro will not work on the records set by robots.txt” (bản dịch) “Baiduspider-cpro sẽ không hoạt động theo các bản ghi do robots.txt đặt ra”, và -ads cũng vậy. Vì thế, cách diễn đạt trung thực không phải câu mơ hồ “Baidu không luôn tôn trọng robots.txt” trên các website tổng hợp — crawler tiêu chuẩn của Baidu tuân thủ, còn hai crawler quảng cáo được miễn theo hợp đồng là ngoại lệ cụ thể, có tài liệu.

Một điểm riêng, hẹp hơn và dễ bị đánh đồng: Baiduspider không tôn trọng chỉ thị crawl-delay phi tiêu chuẩn. Abby Hamilton của Search Engine Journal ghi nhận điều này trong The Modern Guide To Robots.txt — tháng 11/2024; bảng so sánh crawler ghi “Baidu | Baiduspider | No” cho hỗ trợ crawl-delay — ngược lại YandexBot là “Yes”. Đây là tuyên bố khác với việc tuân thủ Allow/Disallow tiêu chuẩn; cần giữ tách biệt để không vô tình mâu thuẫn tuyên bố robots.txt của chính Baidu.

Ví dụ thật: robots.txt của chính baidu.com

Baidu áp dụng phân đoạn robots.txt trên domain của mình. robots.txt đang hoạt động cung cấp cho Baiduspider của chính mình danh sách disallow ngắn hơn Googlebot, MSNBot, Sogou và Youdao — các bot này còn bị chặn /shifen/, /homepage/, /cpro — và mặc định chặn toàn bộ — Disallow: / — với mọi user-agent không được nêu tên:

User-agent: Baiduspider
Disallow: /baidu
Disallow: /s?
Disallow: /ulink?
Disallow: /link?
Disallow: /home/news/data/
Disallow: /bh

Một chi tiết vận hành từ FAQ cần biết khi chỉnh quy tắc: nếu siết robots.txt sau khi Baidu đã lập chỉ mục website, “it usually takes 48 hours for the updated robots.txt to take effect.” (bản dịch) “Thông thường mất 48 giờ để robots.txt đã cập nhật có hiệu lực.”

Baiduspider có kết xuất JavaScript không?

Đây là hạn chế thực tế lớn nhất của Baiduspider so với Googlebot và cần phân biệt điều chính thức với điều không chính thức. FAQ tiếng Anh của Baidu hoàn toàn không đề cập kết xuất JavaScript — không có đặc tả năng lực như Google công bố cho Googlebot. Thay vào đó là các thử nghiệm nhất quán trong ngành. Dan Taylor nói thẳng trong bài so sánh Google với Baidu trên Search Engine Journal — tháng 3/2021: “Baidu is notoriously bad when it comes to crawling JavaScript, so make sure that all your important content and links are served in plain HTML on both the mobile and desktop versions of your website.” (bản dịch) “Baidu nổi tiếng xử lý crawl JavaScript kém, vì vậy hãy bảo đảm mọi nội dung và liên kết quan trọng được cung cấp bằng HTML thuần trên cả phiên bản mobile lẫn desktop.”

Điều này phù hợp với lập trường website hiện có. Nội dung Contentful SEO lưu ý Bing, Yandex và Baidu “may not index [client-side-rendered JS] at all,” (bản dịch) “có thể hoàn toàn không lập chỉ mục JS được kết xuất phía client”, còn dynamic rendering đã lỗi thời như kỹ thuật Google phổ quát. Có thể đặt ba crawler lớn trên một phổ: Googlebot kết xuất đầy đủ bằng Chromium evergreen, Bingbot kết xuất tốt bằng Chromium/Edge, còn Baiduspider yếu nhất trong ba crawler về JavaScript — HTML thuần do máy chủ kết xuất là fallback an toàn cho tất cả.

Hướng dẫn thực tế cho website hướng tới Trung Quốc: mặc định dùng server-side rendering hoặc HTML tĩnh để nội dung, liên kết và metadata thiết yếu có trong phản hồi ban đầu trước khi JavaScript chạy. Riêng với Baidu, coi nội dung chỉ có phía client là rủi ro lập chỉ mục, bất kể trang có xếp hạng tốt trên Google. Hãy trình bày SSR là best practice đồng thuận trong ngành — không phải khuyến nghị chính thức của Baidu, vì không có tuyên bố sơ cấp nào của Baidu về kết xuất JS để trích dẫn.

Kiểm soát tần suất crawl của Baiduspider

Baidu trình bày tần suất crawl là tự điều chỉnh bằng thuật toán, không phải giá trị bạn đặt trực tiếp. Nguyên văn FAQ:

“In order to ensure the search results cover most of your pages, Baiduspider must keep the crawling at a certain level. We have been trying our best to avoid increasing the loading to your servers, and to adjust the frequency based on combined factors, such as your server’s capability, your site’s quality and the update frequency of your site.” (bản dịch) “Để bảo đảm kết quả tìm kiếm bao phủ phần lớn trang, Baiduspider phải duy trì crawl ở một mức nhất định. Chúng tôi cố gắng tránh làm tăng tải cho máy chủ và điều chỉnh tần suất dựa trên các yếu tố kết hợp như năng lực máy chủ, chất lượng website và tần suất cập nhật.”

Đây là cùng logic năng lực máy chủ cộng nhu cầu mà Google và Bing mô tả. FAQ nêu biểu mẫu phản hồiwebmaster.baidu.com/feedback/index — là kênh chính thức để báo crawl quá mức: “If you find any unreasonable access from Baiduspider, please inform us.” (bản dịch) “Nếu phát hiện truy cập bất hợp lý từ Baiduspider, hãy thông báo cho chúng tôi.”

Ở cấp sản phẩm, Baidu Search Resource Platform (百度搜索资源平台 tại ziyuan.baidu.com — console trước đây gọi là “Baidu Webmaster Tools”) tương đương Google Search Console và Bing Webmaster Tools. Chỉ mục hướng dẫn xác nhận khu vực sản phẩm “抓取频次” — Crawl Frequency, nơi chủ website có thể xem và giới hạn trực tiếp tốc độ crawl Baiduspider, cùng công cụ robots và Crawl Diagnostics. Hãy coi biểu mẫu phản hồi là đường escalation chính thức trong tài liệu tiếng Anh của Baidu, còn dashboard Crawl Frequency của Ziyuan là kiểm soát thực tế trên UI. Đường dẫn menu chính xác nằm sau tài khoản Ziyuan đã đăng nhập, nên xác nhận giao diện hiện tại trước khi trích các bước cụ thể.

hreflang và các tín hiệu tiêu chuẩn khác của Google

Không phải mọi tín hiệu tiêu chuẩn của Google đều chuyển sang Baidu — đây là phát hiện trong ngành/thực hành, không phải điều hai công ty ghi nhận. Tài liệu về phiên bản được bản địa hóa của Google chỉ áp dụng cho Google Search và không tuyên bố Baidu, Bing hay Yandex có tôn trọng hreflang hay không. Hướng dẫn hreflang trên website này nói thẳng: Baidu hoàn toàn không hỗ trợ hreflang — fallback là đặt content-language<html lang> chính xác để Baidu ít nhất đọc được ngôn ngữ trang. Điều này bổ sung, không mâu thuẫn, với công việc hreflang dành cho Google của tôi — hướng dẫn thẻ hreflangnghiên cứu 374 756 domain, cả hai chỉ bàn triển khai Google.

Không có văn hóa đại diện tiếng Anh — vì sao FAQ đặc biệt giá trị

Một khác biệt thật của hệ sinh thái Baidu: không giống Google — Gary Illyes, John Mueller — Bing — Fabrice Canel — hay Yandex, Baidu không có văn hóa hỏi đáp công khai với đại diện nói tiếng Anh dễ thấy. Không có phát ngôn viên có tên tương tác với cộng đồng SEO. Tiếng nói tiếng Anh chính thức rõ nhất của Baidu là FAQ thể chế, không ký tên tại help.baidu.com. Đó là lý do FAQ này — và các trang Ziyuan Academy tiếng Trung phía sau — rất giá trị: phần lớn kiến thức vận hành Baiduspider trong giới SEO nói tiếng Anh đến từ thử nghiệm của người thực hành — phân tích log máy chủ, xác minh DNS, thử robots.txt — thay vì bình luận chính thức từ đại diện. Michael Bonfils tóm tắt bài học rộng hơn trong bài Baidu với Google trên Search Engine Land: “SEO strategies that work for Google may not always translate directly to success on Baidu, China’s dominant search engine.” (bản dịch) “Chiến lược SEO hiệu quả trên Google không phải lúc nào cũng đem lại thành công trực tiếp trên Baidu, công cụ tìm kiếm dẫn đầu Trung Quốc.”

Để hiểu vị trí của Baiduspider trong bức tranh lớn — họ crawler, Googlebot và Bingbot như các crawler ngang hàng, khái niệm user-agent và robots.txt — trung tâm crawling kết nối các phần, còn international SEO là nơi chứa bối cảnh thị trường Trung Quốc.

Add an expert note

Pin an expert quote

New person? Create their unclaimed profile at /admin/experts/ → Pin a quote first.