Trình tạo và xác thực llms.txt

Free, no signup. Build a clean llms.txt that points LLMs at your key pages, or paste one you already have and check that it's well-formed.

llms.txt structural rubric
CheckStatus when healthy
H1 One site-name H1
Summary A short blockquote is recommended
Links Grouped, absolute HTTPS URLs
Size Keep the map concise (under ~20 KiB)

Source: llmstxt.org proposal; not a crawler-consumption guarantee

Heads up: llms.txt is a community proposal (llmstxt.org), not an official standard. No major AI crawler is documented to read it today. Treat it as low-effort, low-risk housekeeping — not a ranking lever. If you want to influence what AI systems can access, that's robots.txt and your on-page content, not this file. More on how AI crawlers actually work →
Want evidence instead of assumptions?

Upload your own access log to the Log File Analyzer. Its browser-local /llms.txt report distinguishes verified AI crawler requests, unverifiable crawler claims, spoofed claims, other traffic, and no observation in the supplied period. A request is retrieval evidence only—not proof of rankings, citations, or broad provider adoption.

The Optional section (a crawler may skip it) is emitted last automatically — just name a section “Optional”.

Output — llms.txt

Chạy hoàn toàn trong trình duyệt của bạn — nội dung bạn dán không được tải lên hay lưu trữ. Số đếm kết quả ẩn danh theo từng lần chạy có thể được dùng cho nghiên cứu tổng hợp; URL, tên miền, IP và mã định danh không bao giờ được bao gồm, và không công bố số liệu thống kê khi có dưới 100 lần chạy.

Where this is heading: serving Markdown to LLMs

Looking ahead — not something to do today. llms.txt and per-page Markdown are proposals no major AI crawler is documented to consume yet.

llms.txt is a directory — one file pointing at your key pages. The more interesting idea, once AI clients adopt it, is content negotiation: same URL, two representations. Serve HTML to browsers and a clean Markdown rendering to LLM clients, and decide which at the edge.

A Cloudflare Worker picks the representation from the request — either Accept: text/markdown or a known AI user-agent — and emits Vary: Accept (or Vary: User-Agent) so shared caches don't hand the wrong variant to the wrong client.

It's exactly the move behind this site's hybrid /robots.txt — same bytes, only the Content-Type label negotiated — just extended to actual content, and to a real body difference rather than only a header.

Giới thiệu công cụ

Tạo tệp llms.txt đúng cấu trúc để trỏ LLM đến các trang quan trọng, hoặc dán/tải tệp hiện có để kiểm tra H1, phần tóm tắt, các liên kết Markdown tuyệt đối, URL trùng lặp và liên kết ngoài.

llms.txt là đề xuất của cộng đồng, không phải tiêu chuẩn chính thức; hiện chưa có trình thu thập AI lớn nào được ghi nhận là đọc tệp. Hãy coi đây là công việc sắp xếp gọn gàng, không phải đòn bẩy xếp hạng.

Tính năng

  • Trình tạo dạng biểu mẫu với tên trang web, các phần Tài liệu/Hướng dẫn/Nhật ký và các dòng liên kết; đầu ra trực tiếp tự kiểm tra chính nó.
  • Trình xác thực đánh dấu H1 hoặc phần tóm tắt bị thiếu, URL tương đối hoặc sai định dạng, liên kết HTTP, URL trùng lặp, liên kết ngoài trang và lỗi cấu trúc.
  • Điền trước từ sitemap.xml theo đoạn đường dẫn đầu tiên; thêm URL trang web tùy chọn để đánh dấu liên kết ngoài.
  • Đầu ra trực tiếp với các nhãn lỗi/cảnh báo/thông tin, sao chép/tải xuống/liên kết chia sẻ; mọi thứ chạy trong trình duyệt trừ lần lấy URL tùy chọn qua Cloudflare Worker.

Cách hoạt động

Trong tab Tạo, nhập tên trang web, phần tóm tắt và các phần; trình tạo yêu cầu một H1 #, phần tóm tắt > ngay sau đó và các phần ## với các liên kết Markdown dạng - [tiêu đề](https://url). Trong tab Xác thực, dán, tải lên hoặc lấy /llms.txt từ tên miền; lần lấy URL gọi /api/llms-fetch để vượt CORS, còn các phát hiện được nhóm theo mức độ và hiển thị cùng bản xem trước.

Giới hạn

  • Việc kiểm tra chỉ đánh giá hình thức và cấu trúc; không cho biết hệ thống AI có đọc tệp hay các liên kết có truy xuất được không.
  • Tệp lớn hơn khoảng 20 KiB sẽ được đánh dấu là không còn là bản đồ súc tích; nội dung đầy đủ nên được cung cấp theo từng trang bằng thương lượng nội dung.
  • Lần lấy URL sử dụng proxy CORS giới hạn qua Cloudflare Worker tại /api/llms-fetch; nội dung dán hoặc tải lên chỉ ở trong trình duyệt và không được lưu.

Câu hỏi thường gặp

Các trình thu thập AI có thật sự đọc llms.txt không?

Chưa có tài liệu nào xác nhận điều đó. llms.txt là một đề xuất cộng đồng từ llmstxt.org, không phải tiêu chuẩn chính thức, và chưa có trình thu thập AI lớn nào (OpenAI, Google, Anthropic, Perplexity) công bố hỗ trợ đọc tệp này. Hãy xem nó là công việc sắp xếp ít tốn công, ít rủi ro để tạo bản đồ gọn gàng cho các trang tốt nhất, chứ không phải đòn bẩy xếp hạng. Những gì hệ thống AI thật sự có thể truy cập do robots.txt và nội dung trên trang của bạn quyết định.

Tệp llms.txt gồm những gì?

Tệp cần một tiêu đề H1 bắt buộc dạng "# " (tên trang web), tiếp ngay sau đó nên có phần tóm tắt một dòng dạng trích dẫn khối "> "; rồi đến các đề mục phần dạng "## " (Tài liệu, Hướng dẫn, Nhật ký), mỗi phần chứa các mục liên kết Markdown theo mẫu "- [tiêu đề](url): ghi chú tùy chọn". Phần đặc biệt "## Optional" chứa các liên kết mà trình thu thập có thể bỏ qua. Mỗi URL liên kết phải là địa chỉ https:// tuyệt đối mà LLM có thể truy xuất trực tiếp.

Tệp llms.txt được đặt ở đâu trên trang web?

Tệp nằm ở gốc tên miền, được phân phối tại https://site.example/llms.txt, theo cùng quy ước vị trí với robots.txt. Trình xác thực này có thể truy xuất chính đường dẫn đó cho bất kỳ tên miền nào qua một bộ chuyển tiếp nhỏ phía máy chủ, vì trình duyệt không thể truy xuất khác nguồn gốc, nên bạn có thể kiểm tra tệp đang hoạt động mà không cần dán nội dung.

Trình xác thực kiểm tra những gì?

Trình xác thực kiểm tra hình thức tệp theo đề xuất, không kiểm tra liệu hệ thống nào có đọc tệp hay không. Nó gắn cờ tiêu đề H1 bị thiếu (lỗi), phần tóm tắt bị thiếu (cảnh báo), URL liên kết sai định dạng hoặc tương đối, liên kết http://, URL trùng lặp, liên kết xuất hiện trước bất kỳ phần nào, đề mục sâu "### " không thuộc cấu trúc, liên kết ngoài trang web và tệp quá lớn đến mức không còn là bản đồ súc tích. Công cụ không thể và không bảo đảm bất kỳ hệ thống AI nào sử dụng tệp.

llms.txt nên lớn đến mức nào?

Nên nhỏ. Đây là thư mục liên kết, không phải bản sao nội dung của bạn. Trình xác thực đưa ra ghi chú thông tin khi tệp vượt khoảng 20 KiB vì ở kích thước đó, tệp thường không còn là bản đồ súc tích mà bắt đầu sao chép nội dung trang. Nếu muốn cung cấp toàn bộ nội dung sạch cho LLM, hãy dùng Markdown theo từng trang và thương lượng nội dung, không phải một tệp llms.txt lớn hơn.

Bước tiếp theoTrình ước tính khối lượng tìm kiếm AI — score it against a calibrated model. Hướng dẫn có bằng tiếng Anh.