Câu hỏi có nên chặn crawler AI hay không thường được trình bày như một vấn đề kỹ thuật, nhưng nó không phải vậy. Chặn chỉ là vài dòng cấu hình, làm xong trong mười phút. Phần khó là quyết định bạn có muốn chặn hay không, và quyết định đó thuộc về kinh doanh: bạn đang chọn giữa việc bảo vệ nội dung khỏi bị dùng để huấn luyện mô hình và việc hiện diện trong những câu trả lời mà người ta nhận được thay cho danh sách kết quả tìm kiếm.
Phần lớn lời khuyên trên mạng chọn sẵn một phe rồi bênh phe đó. Cách nói trung thực thì khác: câu trả lời đúng thay đổi theo mô hình kinh doanh, và một tòa soạn sống bằng lượt xem trang với một agency sống bằng yêu cầu báo giá phải đi tới kết luận ngược nhau.
Sự đánh đổi gói trong một câu: chặn crawler AI ngăn nội dung của bạn bị thu nạp, và cũng ngăn luôn việc bạn được trích dẫn. Nếu doanh thu phụ thuộc vào việc người ta vào trang của bạn, chặn là bảo vệ. Nếu doanh thu phụ thuộc vào việc người ta biết bạn tồn tại rồi liên hệ, chặn sẽ gạt bạn khỏi đúng bề mặt nơi sự phát hiện đó đang diễn ra ngày một nhiều.
Cloudflare thực sự đã thay đổi điều gì
Mặc định đã đảo chiều. Ngày 1 tháng 7 năm 2025, Cloudflare trở thành nhà cung cấp hạ tầng lớn đầu tiên chặn crawler AI theo mặc định , chuyển từ mô hình phải tự từ chối sang mô hình phải xin phép. Tên miền mới được hỏi ngay từ đầu rằng crawler AI có được thu thập nội dung hay không, và các công ty AI giờ cần một sự cho phép rõ ràng thay vì chỉ cần vắng mặt một lời từ chối.
Điều đó có ý nghĩa vượt ra ngoài tập khách hàng của Cloudflare, vì một phần lớn lưu lượng web đi qua mạng lưới này. Một giá trị mặc định không phải là luật, nhưng một giá trị mặc định áp ở quy mô đó sẽ vẽ lại những gì các công ty AI được phép mặc nhiên coi là đúng.
Công cụ đi kèm là AI Crawl Control , có trên mọi gói kể cả gói miễn phí. Nó cho bạn thấy dịch vụ AI nào đang chạm tới nội dung, cho phép đặt luật cho phép hoặc chặn theo từng crawler, và kiểm tra xem một crawler cụ thể có tôn trọng robots.txt hay không. Phần hữu ích nhất là nhìn thấy lưu lượng trước khi quyết định bất cứ điều gì, và phần lớn chủ website chưa từng nhìn.
Cloudflare cũng thúc các crawler khai báo mục đích. Nhờ vậy bạn phân biệt được bot đang huấn luyện mô hình, bot đang tải trang để dựng một câu trả lời trực tiếp, và bot đang lập chỉ mục cho tìm kiếm. Đó là ba giao kèo rất khác nhau, và cho tới gần đây chúng đến với bạn mà không thể phân biệt.
Mô hình tiền lại đổi vào tháng 7 năm 2026
Đây chính là chỗ khiến mọi lời khuyên viết năm ngoái trở nên sai.
Pay Per Crawl ra mắt năm 2025 như một chợ nơi nhà xuất bản tính tiền công ty AI theo từng lần tải trang. Ngày 1 tháng 7 năm 2026, Cloudflare tuyên bố mô hình đó chưa đủ và chuyển sang Pay Per Use , tức là trả tiền khi nội dung của bạn tạo ra giá trị bên trong một câu trả lời, chứ không phải khi một bot tải một trang về.
Lý lẽ trở nên rõ ràng ngay khi bạn thấy con số: hơn 50% lưu lượng crawler AI tải lại những trang không hề thay đổi. Tính tiền theo lượt tải, vì thế, chủ yếu là tính tiền cho sự lãng phí. Tính tiền khi nội dung xuất hiện trong một câu trả lời thì lại tính đúng vào thứ đã thay thế một lượt ghé thăm trang của bạn.
Vẫn còn sớm. Đối tác khởi đầu là Ceramic.ai và You.com, nên đây chưa phải nguồn thu rộng rãi cho một doanh nghiệp nhỏ ở Anh. Hãy coi đó là hướng đi của thị trường, không phải một dòng trong ngân sách năm sau.
Còn một mốc nữa đáng ghi vào lịch. Từ ngày 15 tháng 9 năm 2026, crawler dùng chung nhiều mục đích sẽ bị chặn theo mặc định trên các trang có quảng cáo, trừ khi chủ site đổi thiết lập. Nếu bạn chạy quảng cáo và trông vào lưu lượng do AI giới thiệu, mặc định đó sẽ áp lên bạn mà bạn chẳng phải làm gì.
Chặn thực sự khiến bạn mất gì
Ba thứ, và chỉ thứ đầu tiên là hiển nhiên.
Bạn mất phần trích dẫn. Câu trả lời của AI có nêu tên nguồn. Được nằm trong số đó là phiên bản hiện đại của việc lên trang nhất, và một crawler bị chặn không thể trích dẫn thứ nó không được đọc. Hướng dẫn Generative Engine Optimization của chúng tôi nói rõ điều gì giúp bạn xứng đáng được trích dẫn, một khi đã chọn hiện diện.
Bạn mất khả năng đo lường. Lưu lượng bị chặn không xuất hiện trong báo cáo dưới dạng tổn thất. Nó xuất hiện dưới dạng không có gì, và điều đó không thể phân biệt với việc chưa từng có. Những site chặn sớm thường không nói được mình đã mất bao nhiêu, vì kịch bản đối chứng chưa từng được ghi lại.
Bạn không thực sự chặn được việc huấn luyện. Chặn những crawler ngoan, loại tự khai danh tính và tôn trọng robots.txt, chính là loại bỏ đúng nhóm sẵn sàng tuân thủ luật chơi. Nội dung đã bị thu nạp thì vẫn nằm đó, còn các công cụ cào bất chấp robots.txt thì chưa bao giờ nằm trong tầm với. Bạn chỉ đang uốn nắn hành vi của nhóm lịch sự.
Ở chiều ngược lại, chặn thật sự bảo vệ một doanh nghiệp mà sản phẩm chính là nội dung. Một tòa soạn thu phí thuê bao, một hãng nghiên cứu bán báo cáo, một kho ảnh: với họ, câu trả lời AI tóm tắt nội dung là thứ thay thế trực tiếp cho việc bán hàng, và một dòng ghi nguồn là khoản đền bù quá mỏng.
Cách quyết định có chặn crawler AI hay không
Hãy hỏi một khách truy cập đáng giá bao nhiêu và họ chuyển đổi theo đường nào.
Chặn nếu nội dung chính là sản phẩm. Báo chí thu phí, nghiên cứu bán tiền, dữ liệu tham chiếu bạn cấp phép. Câu trả lời AI cạnh tranh trực tiếp với đơn hàng của bạn.
Cho phép nếu nội dung là marketing cho thứ khác. Một agency phần mềm, một hãng tư vấn, một văn phòng luật, một phòng khám. Bài viết của bạn tồn tại để người mua biết rằng bạn giải được vấn đề của họ. Được nêu tên trong một câu trả lời chính là mức nhận biết bạn vẫn đang trả tiền để có, và yêu cầu vẫn phải tìm đến bạn.
Cho phép có chọn lọc nếu bạn nằm đâu đó ở giữa. Luật theo từng crawler cho phép bạn nhận việc lập chỉ mục tìm kiếm và từ chối việc huấn luyện, một lập trường trung dung có thể bảo vệ được, giờ đây khi mục đích đã được khai báo.
Với phần lớn doanh nghiệp đang đọc bài này, câu trả lời là cho phép. Bản năng muốn chặn là bản năng phòng vệ và dễ hiểu, nhưng nó thường bảo vệ thứ nội dung không có giá trị thương mại độc lập, trong khi cắt đứt đúng kênh khám phá mà nội dung ấy được viết ra để nuôi.
Bắt đầu từ đâu
Hãy nhìn lưu lượng trước khi đổi bất cứ thứ gì. AI Crawl Control cho thấy trên mọi gói rằng crawler nào đang đến với bạn và đến bao nhiêu lần. Một tháng dữ liệu như vậy biến một cuộc cãi vã quan điểm thành một bài toán số học.
Sau đó hãy quyết theo từng crawler thay vì quyết chung, và ghi lại quyết định kèm ngày tháng, vì lĩnh vực này đã đổi hai lần trong 14 tháng và sẽ còn đổi nữa.
Mecanik thực hiện audit SEO kỹ thuật bao gồm quyền truy cập của crawler AI và mức hiện diện trong trích dẫn, bên cạnh các hạng mục kiểm tra thông thường, rồi triển khai cấu hình qua đội phát triển web của chúng tôi. Nếu bạn xếp hạng tốt mà không bao giờ xuất hiện trong câu trả lời AI, quyền truy cập của crawler là thứ đầu tiên cần loại trừ.
Bài viết liên quan: Agency SEO cho AI: họ làm gì và giá bao nhiêu , Google AI Mode và lưu lượng website của bạn , WordPress bị hack: gỡ mã độc và khôi phục site và Tốc độ website Cloudflare: hướng dẫn tối ưu 2026 .
Câu hỏi thường gặp
Tôi có nên chặn crawler AI trên website của mình không? Chuyện đó phụ thuộc hoàn toàn vào cách bạn kiếm tiền. Hãy chặn nếu nội dung chính là sản phẩm, như báo chí thu phí hay nghiên cứu bán tiền, vì một bản tóm tắt của AI thay thế cho đơn hàng. Hãy cho phép nếu nội dung là marketing cho một dịch vụ, vì được trích dẫn trong câu trả lời chính là mức nhận biết mà bài viết sinh ra để tạo, và yêu cầu vẫn tìm đến bạn.
Chặn crawler AI có ngăn được nội dung của tôi bị dùng để huấn luyện không? Chỉ một phần. Nó chặn những crawler ngoan, loại tự khai danh tính và tôn trọng robots.txt, tức đúng nhóm sẵn sàng tuân thủ luật chơi. Nội dung đã bị thu nạp thì vẫn nằm đó, còn các công cụ cào bất chấp robots.txt thì chưa từng bị ảnh hưởng. Bạn đang uốn nắn nhóm crawler lịch sự, không phải toàn bộ.
Cloudflare AI Crawl Control là gì? Một tính năng của Cloudflare, có trên mọi gói kể cả gói miễn phí, cho bạn thấy dịch vụ AI nào đang truy cập site, đặt luật cho phép hoặc chặn cho từng crawler, và theo dõi xem mỗi crawler có tôn trọng robots.txt hay không. Nó cũng hỗ trợ cách tính tiền theo lượt tải. Việc hữu ích nhất nó làm được là cho bạn nhìn lưu lượng trước khi quyết định bất cứ điều gì.
Cái gì đã thay thế Cloudflare Pay Per Crawl? Pay Per Use, công bố ngày 1 tháng 7 năm 2026. Thay vì tính tiền công ty AI mỗi lần một trang bị tải về, nhà xuất bản được trả tiền khi nội dung của họ tạo ra giá trị bên trong một câu trả lời. Lý lẽ của Cloudflare là hơn 50% lưu lượng crawler AI tải lại những trang không đổi, nên cách tính theo lượt tải chủ yếu là tính tiền cho sự lãng phí. Đối tác khởi đầu là Ceramic.ai và You.com.
Ngày 15 tháng 9 năm 2026 sẽ có chuyện gì? Cloudflare bắt đầu chặn theo mặc định các crawler AI dùng chung nhiều mục đích trên những trang có quảng cáo, trừ khi chủ site đổi thiết lập. Dùng chung nhiều mục đích nghĩa là crawler không tách việc lập chỉ mục tìm kiếm khỏi việc huấn luyện và lưu lượng của tác nhân AI. Nếu bạn chạy quảng cáo và phụ thuộc vào lượt giới thiệu từ AI, mặc định đó áp lên bạn mà bạn không phải làm gì cả.
Bình luận