Câu trả lời trung thực cho việc llms.txt đã có tác dụng gì chưa là: gần như không có gì đo lường được, và những người nói với bạn rằng tệp này thiết yếu cho khả năng hiển thị trên AI đều đang bán một thứ gì đó. Đó là một lập trường khó chịu khi vẫn khuyên bạn nên xuất bản một tệp như vậy, nên bài viết này sẽ đưa ra các con số trước rồi mới giải thích khuyến nghị.
Bản thân tệp này là một ý tưởng hợp lý. Nó là một chỉ mục dạng markdown đặt ở thư mục gốc của website, cho một mô hình ngôn ngữ biết bạn xuất bản những gì và ở đâu, giống như cách robots.txt cho trình thu thập dữ liệu biết nó được phép tải về những gì. Ý tưởng thì ổn. Vấn đề nằm ở mức độ tiếp nhận của chính những công ty mà nó được thiết kế để phục vụ.
Nhật ký máy chủ thực sự cho thấy điều gì: một phân tích của Ahrefs trên 137.000 tên miền cho thấy 97% tệp llms.txt không nhận được yêu cầu nào trong tháng 5 năm 2026. Không phải là ít yêu cầu. Là con số không. Trong khi đó, mức độ áp dụng tăng 8,8 lần trong một năm, nghĩa là tệp này đang được xuất bản nhanh hơn nhiều so với tốc độ nó được đọc.
Các con số và nguồn gốc của chúng
Có hai bộ dữ liệu đáng biết, bởi vì phần lớn bài viết về chủ đề này không trích dẫn bộ nào cả.
Originality.ai đã theo dõi hơn 3 triệu website trong khoảng từ tháng 6 năm 2025 đến tháng 5 năm 2026. Số lần xuất hiện của llms.txt tăng từ 4.088 lên 36.120, tức là gấp 8,8 lần, và đến tháng 5 năm 2026 có khoảng 38.980 website xuất bản một trong các định dạng liên quan. Đó là tăng trưởng thật, nhưng xuất phát từ một nền rất thấp.
Sau đó Ahrefs phân tích nhật ký máy chủ trên 137.000 tên miền và phát hiện 97% số tệp đó không nhận được yêu cầu nào trong tháng 5 năm 2026. Trong số các yêu cầu thực sự đến, bot truy xuất phục vụ AI chỉ chiếm 1,1%. GPTBot tạo ra 4,51% số yêu cầu tới các tệp này, ClaudeBot 0,80% và DeepseekBot 0,02%.
Đặt cạnh nhau, hai nghiên cứu này mô tả một chuẩn được nhà xuất bản đón nhận nhiệt tình và bị phía tiêu thụ phớt lờ gần như hoàn toàn.
Các công ty AI thực sự nói gì
Đây là phần khép lại tranh luận.
Google không hỗ trợ tệp này. Google đã nói công khai vào tháng 7 năm 2025 và cho biết không có kế hoạch nào. OpenAI không nhắc đến llms.txt trong tài liệu về trình thu thập dữ liệu và hướng chủ website sang robots.txt. Anthropic xuất bản llms.txt của riêng mình và có tham gia thảo luận về đề xuất, nhưng chưa từng nói rằng cơ chế truy xuất của Claude đọc tệp của bên thứ ba.
Perplexity là ngoại lệ đáng chú ý, cho biết họ tải tệp về để hỗ trợ xếp thứ tự ưu tiên cho các trang.
Có một sự trớ trêu thú vị nằm trong dữ liệu: Google, OpenAI và Anthropic đều xuất bản tệp llms.txt cho tài liệu của chính họ, trong khi khuyên chủ website đừng trông cậy vào nó để có khả năng hiển thị trong tìm kiếm. Tài liệu của họ dễ đọc bằng máy thì có ích. Điều đó không đồng nghĩa với việc trình thu thập của họ đọc tệp của bạn.
Bên tiêu thụ thật sự hiện nay là các tác nhân lập trình chứ không phải công cụ tìm kiếm. Cursor, Claude Code, Continue và Cline đọc llms.txt khi người dùng trỏ chúng vào một tên miền. Nếu sản phẩm của bạn có tài liệu cho lập trình viên, đó là một nhóm độc giả thật với ý định thật, và có lẽ là lý do mạnh nhất để có tệp này.
Vậy tại sao vẫn nên xuất bản một tệp
Bốn lý do, và không lý do nào là “nó sẽ cải thiện thứ hạng của bạn”.
Chi phí gần như bằng không. Một chỉ mục được sinh ra từ chính nội dung của bạn chỉ tốn một buổi chiều, và còn ít hơn nếu website đã tự biết cấu trúc của nó.
Nhóm tiêu thụ hiện có mang ý định cao. Một lập trình viên trỏ Cursor vào tài liệu của bạn gần với việc dùng sản phẩm hơn phần lớn lưu lượng tìm kiếm. Việc Perplexity ưu tiên các trang của bạn tuy nhỏ nhưng có thật.
Việc chấp nhận chuẩn giống một bánh cóc. Nếu các hệ thống truy xuất thực sự bắt đầu tiêu thụ tệp này, những website có tệp chính xác và cập nhật sẽ sẵn sàng, còn những website không có thì không. Cái giá của việc đi sớm là một buổi chiều. Cái giá của việc đi muộn là toàn bộ thời gian bạn cần để nhận ra điều đó.
Viết nó buộc bạn phải rà soát. Tạo ra một chỉ mục chính xác nghĩa là liệt kê mọi thứ bạn xuất bản, và đó chính là cách bạn tìm ra những trang không ai liên kết tới cùng những mục bạn đã quên là mình có.
Điểm cuối cùng này không hề lý thuyết. Việc rà soát tệp của chính chúng tôi trong tháng này đã lôi ra một vấn đề còn giá trị hơn cả bản thân tệp đó.
Một llms.txt lỗi thời còn tệ hơn không có llms.txt
Tệp llms.txt của chúng tôi liệt kê 29 bài viết. Website có 166 bài. Tệ hơn, mọi URL trong đó đều thiếu tiền tố ngôn ngữ, nên mecanik.dev/posts/<slug>/ trả về 404 trong khi trang thật nằm ở mecanik.dev/en/posts/<slug>/. Trong 243 địa chỉ của website có mặt trong tệp, chỉ bảy địa chỉ phản hồi.
Bất cứ thứ gì thực sự đọc tệp đó đều được trao tấm bản đồ của một website không tồn tại. Điều đó tệ hơn hẳn việc không xuất bản gì, bởi vì không có gì thì ít nhất cũng thất bại một cách trung thực.
Bài học vượt ra ngoài một tệp duy nhất này. Một chỉ mục là lời hứa về website của bạn, và lời hứa không được duy trì sẽ lặng lẽ trở thành lời nói dối. Nếu bạn xuất bản một tệp, hãy đưa nó vào cùng quy trình phát hành với sitemap, và hãy kiểm tra xem các địa chỉ có phản hồi hay không thay vì mặc định rằng bộ sinh đã tạo đúng. Việc một slug tồn tại trong nội dung không giống với việc một URL phản hồi trên máy chủ của bạn.
Cách xuất bản một tệp cho đúng
Hãy theo đặc tả của llmstxt.org
thay vì tự nghĩ ra định dạng riêng. Một thẻ H1 chứa tên website là phần tử bắt buộc duy nhất. Phần tóm tắt dạng trích dẫn và các mục H2 chứa liên kết kèm chú thích là quy ước chung. Cũng theo quy ước, có một mục Optional dành cho các liên kết mà tác nhân có thể bỏ qua khi ngữ cảnh eo hẹp.
Ngoài đặc tả, có ba quy tắc thực tế. Hãy sinh tệp từ nội dung của bạn thay vì bảo trì thủ công, vì một chỉ mục bảo trì bằng tay sẽ lỗi thời trong vòng hai tháng. Hãy kiểm tra từng URL bằng một yêu cầu thật. Và nếu website đa ngôn ngữ, hãy nêu quy luật ngôn ngữ một lần thay vì liệt kê từng ngôn ngữ, để người đọc có thể dựng bất kỳ URL nào từ một quy tắc.
Hướng dẫn tối ưu hóa công cụ tạo sinh của chúng tôi trình bày những phần của khả năng hiển thị trên AI thực sự có tác dụng đo lường được, còn bài cách công cụ tìm kiếm AI đọc dữ liệu có cấu trúc nói về schema, thứ khác với llms.txt ở chỗ được tiêu thụ bởi những hệ thống công khai tài liệu hóa việc chúng tiêu thụ nó.
Khuyến nghị
Hãy xuất bản một tệp. Giữ cho nó chính xác. Đừng kỳ vọng gì từ nó trong năm nay, và đừng để ai xuất hóa đơn cho bạn coi đó là một dịch vụ hiển thị AI.
Nếu bạn muốn thứ thực sự làm thay đổi số lần AI trích dẫn, đó không phải một tệp ở thư mục gốc tên miền. Đó là nội dung trả lời một câu hỏi đủ trọn vẹn để được trích dẫn, cùng đủ uy tín để hệ thống truy xuất tin vào câu trả lời đó. Mecanik bao quát cả hai trong một buổi kiểm tra SEO kỹ thuật , bao gồm cả việc các chỉ mục đọc được bằng máy của bạn có đang nói thật về website hay không.
Bài viết liên quan: Vì sao nội dung của bạn xếp hạng tốt nhưng không bao giờ được trích dẫn , Chặn hay cho phép trình thu thập AI: quyết định kinh doanh , Google AI Mode: điều đó có ý nghĩa gì với lưu lượng website của bạn và Công ty SEO cho hãng luật: tuân thủ, nội dung và chi phí .
Câu hỏi thường gặp
llms.txt có thực sự hiệu quả trong năm 2026 không? Gần như không. Phân tích của Ahrefs trên 137.000 tên miền cho thấy 97% tệp llms.txt không nhận được yêu cầu nào trong tháng 5 năm 2026, và bot truy xuất phục vụ AI chỉ chiếm 1,1% số yêu cầu thực sự đến. Mức độ áp dụng tăng 8,8 lần trong một năm, nên tệp này đang được xuất bản nhanh hơn nhiều so với tốc độ bất cứ thứ gì đọc nó.
Google, OpenAI và Anthropic có hỗ trợ llms.txt không? Không. Google đã nói công khai vào tháng 7 năm 2025 rằng họ không hỗ trợ llms.txt và không có kế hoạch nào. OpenAI không nhắc đến nó trong tài liệu về trình thu thập dữ liệu và hướng chủ website sang robots.txt. Anthropic xuất bản tệp của riêng mình nhưng chưa nói rằng cơ chế truy xuất của Claude đọc tệp của bên thứ ba. Perplexity là ngoại lệ và cho biết họ tải tệp về để ưu tiên các trang.
llms.txt có giống robots.txt không? Không. robots.txt cho trình thu thập biết chúng được phép tải về những gì và được mọi bot cư xử đúng mực tôn trọng. llms.txt là một chỉ mục nội dung cho mô hình ngôn ngữ biết bạn xuất bản những gì và ở đâu, và rất ít hệ thống tôn trọng nó. Nếu bạn muốn kiểm soát quyền truy cập của trình thu thập AI, robots.txt và các công cụ chặn trình thu thập của CDN mới là cơ chế thực sự hoạt động.
Ngày nay ai thực sự đọc llms.txt? Chủ yếu là các tác nhân lập trình chứ không phải công cụ tìm kiếm. Cursor, Claude Code, Continue và Cline đọc tệp khi người dùng trỏ chúng vào một tên miền, còn Perplexity cho biết họ dùng nó để ưu tiên các trang. Nếu bạn xuất bản tài liệu cho lập trình viên, đó là nhóm độc giả nhỏ nhưng có ý định thực sự cao.
Tôi có nên xuất bản tệp llms.txt không? Có, nhưng vì những lý do đúng đắn. Nó tốn một buổi chiều, nhóm tiêu thụ hiện có mang ý định cao, và bạn sẽ sẵn sàng nếu mức độ áp dụng cải thiện. Đừng kỳ vọng lợi ích về thứ hạng. Quan trọng nhất là hãy giữ cho nó chính xác: một tệp lỗi thời liệt kê những URL không còn phản hồi thì tệ hơn việc không xuất bản gì, vì nó trao cho mọi người đọc tấm bản đồ của một website không tồn tại.
Bình luận