Nội dung
Ngày 27/07/2026 tôi dựng cho marketing365.vn một file tên llms.txt, kèm bản đầy đủ llms-full.txt. Ý tưởng đơn giản: thay vì bắt các mô hình ngôn ngữ đọc từng trang HTML lẫn giao diện, quảng cáo và menu, tôi gói sẵn nội dung sạch thành một file văn bản, có mục lục, có mô tả, có dàn ý từng bài. Đến hôm nay file đầy đủ nặng 183.880 byte, gom 262 bài, chia 12 mục, và được sinh lại mỗi tuần bằng một lệnh chạy tự động lúc 5h sáng thứ Hai.
Hôm nay 14/08/2026 tôi mở log máy chủ ra đếm xem có bao nhiêu con bot AI đã tải file đó. Con số là 0. Không phải ít. Là không có lượt nào.

Đếm bằng log của chính máy chủ, không đoán
Chỗ này có một cái bẫy tôi suýt dính. Máy chủ đang chạy 13 trang khác nhau, log chung của nginx không ghi tên miền nào nhận request, nên đọc log chung sẽ ra số của cả 13 trang cộng lại. Muốn đếm riêng marketing365.vn thì phải đọc log của đúng container chạy trang này. Tôi gộp toàn bộ log kể cả các bản đã nén xoay vòng, được 4.138.335 dòng, trải từ 06/06/2026 đến hôm nay.
Trong đống đó, lọc theo chuỗi nhận dạng có tên trình thu thập AI, tôi được 78.421 lượt tải, 7.310 MB dữ liệu, chạm vào 34.758 đường dẫn khác nhau. Chúng đọc rất khỏe. Amazonbot 30.628 lượt, GPTBot 16.317, meta-externalagent 12.768, ClaudeBot 12.333, PerplexityBot 3.909, chín trình còn lại cộng lại 2.466 lượt.
Rồi lọc riêng hai đường dẫn /llms.txt và /llms-full.txt. Tổng cộng có đúng 100 lượt mở hai file này, từ ngày dựng đến giờ. Trong đó 59 lượt là do tôi tự kiểm bằng dòng lệnh, 36 lượt từ trình duyệt, 2 lượt của một dịch vụ quét web, còn lại vài lượt lặt vặt. Không lượt nào của bot AI.
Lần đếm đầu tiên của tôi cho ra số dương, và nó sai
Lần chạy đầu tôi viết điều kiện lọc theo kiểu tìm chuỗi con: đường dẫn nào có chứa chữ llms thì tính. Kết quả ra GPTBot 10 lượt, Amazonbot 6, meta 6, ClaudeBot 4, Perplexity 2. Nhìn thì hợp lý, tôi suýt viết bài theo hướng “file có được đọc nhưng ít”.
May là con số đó đá nhau với một phép đếm khác tôi làm song song. Mở ra soi thì hoá ra chuỗi llms khớp vào hai bài viết bình thường:
/4-xu-huong-seo-moi-nhat-tin-hieu-ai-llmstxt-nhan-gia-tot/
/en/openai-broadcom-jalapeno-chip-llms/
Hai bài này có chữ llms trong tên đường dẫn, và bot đọc chúng như đọc mọi bài khác. Sửa lại thành so khớp đúng đường dẫn — chỉ tính khi đường dẫn bằng chính xác /llms.txt hoặc /llms-full.txt — thì kết quả về 0, và khớp với phép đếm song song. Đây đúng là kiểu sai số mà cả loạt bài này đang ghi lại: bốn lần tôi đoán sai nguồn giật layout cũng bắt đầu từ một phép đo lỏng tay như vậy.
Không ai được báo là file này tồn tại
Biết là 0 rồi thì câu hỏi tiếp theo là vì sao. Tôi kiểm ba chỗ mà một con bot có thể biết được file:
- Tải
robots.txtvề đọc: không có dòng nào nhắc tới llms. Đếm được 0 lần xuất hiện. - Tải trang chủ về tìm thẻ liên kết: cũng 0 lần xuất hiện trong mã nguồn trang.
- Đọc phần đầu phản hồi của máy chủ: có khai sitemap, có khai nguồn tin, có khai danh mục API — không khai llms.
Tức là tôi làm một file cho máy đọc rồi cất nó ở chỗ không ai biết đường tới. Bot không đoán mò đường dẫn, chúng đi theo đúng những gì được khai.
Cách kiểm này chắc tay hơn suy đoán, vì trên cùng một trang tôi có sẵn ba đầu mối khác để đối chiếu. Sitemap được khai cả trong robots.txt lẫn phần đầu phản hồi: bot AI gọi 425 lượt. Nguồn tin của từng bài được gắn thẻ liên kết ngay trong trang: 652 lượt. Danh mục API chỉ khai ở phần đầu phản hồi, không link trong trang: 0 lượt. Và llms.txt, không khai ở đâu cả: 0 lượt. Bốn đầu mối, bốn mức khai báo, số lượt đi theo đúng mức khai báo.
Cách sửa hiển nhiên nhất chỉ với tới một phần tư
Phản xạ đầu tiên là thêm một dòng khai file vào robots.txt. Trước khi làm, tôi đếm xem có bao nhiêu bot thật sự tải robots.txt về đọc. Đây là chỗ tôi không ngờ.
Trong toàn bộ khoảng log này, ba trình đông nhất — Amazonbot, GPTBot và meta-externalagent — cộng lại 59.713 lượt, chiếm 76% lưu lượng bot AI, và chưa lần nào tải robots.txt. Số lượt tải robots.txt của cả nhóm bot AI là 517, gần như toàn bộ đến từ ClaudeBot (248), OAI-SearchBot (157), Bytespider (73) và PerplexityBot (37).
Nên câu “cứ khai vào robots.txt là xong” không đúng với trang này. Tính theo lượt tải, nó chỉ với tới khoảng một phần tư. Muốn ba con to kia biết file tồn tại thì phải khai ở chỗ chúng chắc chắn đi qua, tức là ngay trong trang — thẻ liên kết trong phần đầu tài liệu, hoặc phần đầu phản hồi của máy chủ, hoặc cả hai.
Một điều phải nói thẳng để không tự huyễn hoặc: log này bắt đầu từ 06/06/2026, là ngày dựng lại máy chủ. Nếu Amazonbot hay GPTBot có tải robots.txt trước ngày đó rồi nhớ luôn, tôi không nhìn thấy. Con số 0 của chúng đúng trong khoảng tôi đo được, không phải chân lý vĩnh viễn.
Cắt đúng 18 ngày để so cho công bằng
So 78.421 lượt của cả kỳ với 0 lượt mở llms.txt là hơi ăn gian, vì file chỉ tồn tại từ 27/07. Cắt lại đúng khoảng 27/07 đến 14/08, tức 18 ngày file đã nằm sẵn trên máy chủ:
- Bot AI tải 37.435 lượt, 3.357 MB, chạm 18.905 đường dẫn khác nhau.
- Trong đó có 235 lượt tải robots.txt và 186 lượt gọi sitemap.
- Số lượt mở llms.txt hoặc llms-full.txt: 0.
Chúng vào nhà, đi hết 18.905 phòng, có ghé đọc bảng chỉ dẫn 235 lần, mà cái tủ hồ sơ tôi soạn sẵn cho chúng thì không ai mở, vì không có dòng nào trên bảng chỉ dẫn nhắc tới cái tủ.

Ba chỗ tôi chưa kết luận được
Chưa biết khai xong thì có ai đọc không. Bài này chỉ chứng minh được một chiều: không khai thì chắc chắn không ai đọc. Chiều ngược lại phải khai rồi đếm lại sau vài tuần mới biết. Tôi cố ý chưa sửa gì trong lúc viết bài, để lần đo sau còn có mốc so.
Chưa biết bot có đọc bằng địa chỉ khác không. Một số dịch vụ tổng hợp nội dung qua bên thứ ba, khi đó chuỗi nhận dạng không mang tên bot nào. Cách đếm của tôi lọc theo chuỗi nhận dạng nên sẽ bỏ sót loại này. Với llms.txt thì không ảnh hưởng kết luận, vì tổng số lượt mở hai file chỉ có 100 và tôi đã soi từng lượt một.
Chưa biết file có đáng giữ không. 183 KB sinh lại mỗi tuần, tốn chỗ và tốn một lệnh chạy tự động. Nếu khai báo tử tế rồi mà ba tháng sau vẫn 0 lượt, thì đó là bằng chứng để bỏ, chứ không phải lý do làm to hơn. Nguyên tắc tôi giữ khi gỡ 613 bài dính link hỏng cũng vậy: cái gì không đo được tác dụng thì đừng vội nhân bản nó ra.
Kết luận gọn cho ai đang định làm llms.txt cho trang của mình: file dễ làm, phần khó là khai báo. Và trước khi tin bất kỳ hướng dẫn nào bảo “thêm vào robots.txt là đủ”, hãy mở log ra đếm xem bot đông nhất trên trang bạn có thèm tải robots.txt hay không. Trên trang này, câu trả lời là không.



