Hầu hết các đội gọi thẳng nhà cung cấp mô hình từ mã ứng dụng. Khóa API nằm trong biến môi trường, lệnh gọi SDK dài ba dòng, chạy ngay lần đầu. Cloudflare AI Gateway tồn tại vì thứ xảy ra sau đó. Hóa đơn tới, không ai nói được tính năng nào sinh ra con số đó. Nhà cung cấp gặp một buổi chiều tồi tệ và kéo sản phẩm của bạn theo. Một system prompt bị sửa, và không còn bản ghi nào về thứ prompt cũ từng trả về.
Gateway là proxy đặt giữa ứng dụng và nhà cung cấp. Mọi yêu cầu đi qua nó, nên đều có thể được đếm, ghi log, cache, giới hạn tần suất và, khi nhà cung cấp hỏng, thử lại ở nơi khác. Đó là cách chữa cấu trúc rẻ nhất cho ba vấn đề vốn sẽ được xử lý muộn, bằng tay.
Phần sau nói nó làm gì, cưỡng chế được gì chứ không chỉ quan sát, tốn bao nhiêu tiền và mili giây, và giới hạn thật ở đâu.
Đặt gateway trước model API có thực sự tiết kiệm tiền không? Không trực tiếp. Phần lõi của Cloudflare AI Gateway miễn phí trên mọi gói và không cộng phí vào suy luận, nên tiết kiệm đến từ thứ nó cho thấy, không phải thứ nó chặn. Phân bổ chi phí theo tính năng cho biết phần nào của sản phẩm đắt, cache bỏ các lệnh gọi giống hệt nhau ở nơi an toàn, còn định tuyến dự phòng ngăn sự cố của nhà cung cấp thành sự cố của bạn. Có cưỡng chế ngân sách, nhưng chuyện xảy ra khi hết ngân sách là quyết định sản phẩm, không phải cấu hình.
Ba câu hỏi mà một lệnh gọi mô hình trực tiếp không trả lời được
Mọi lập luận ủng hộ gateway đều quy về một trong ba câu hỏi mà lệnh gọi SDK trực tiếp để lại không lời đáp. Cách nói trừu tượng, khả năng nhìn thấy và khả năng kiểm soát, không thuyết phục được ai phải đi biện minh cho khối lượng công việc đó.
Không ai bóc tách được hóa đơn
Tính tiền theo token là theo mức dùng, còn hóa đơn của nhà cung cấp thì gộp lại. Bạn nhận được tổng theo tháng cho mỗi khóa API, chứ không phải tổng theo tính năng. Nếu một bộ tóm tắt, một trợ lý chat và một tác vụ phân loại chạy đêm cùng dùng chung một khóa, hóa đơn không nói được cái nào đã tăng gấp ba. Cách xử lý quen thuộc là mỗi tính năng một khóa, và nó hiệu quả cho tới khi bạn có mười một tính năng cùng một chính sách xoay vòng khóa.
Không ai tái hiện được sự cố
Khi một lệnh gọi hỏng bên trong mã ứng dụng, thứ còn lại là những gì logger bắt được, thường là một mã trạng thái và một thông báo bị cắt cụt. Hiếm khi còn đúng prompt, phiên bản mô hình đã trả lời, hay độ trễ mà tại đó nó bỏ cuộc. Tái hiện một sự cố sau đó một ngày trở thành trò đoán mò về đầu vào. Trong lúc ấy, sự cố của nhà cung cấp lan thẳng tới người dùng của bạn.
Không có gì chặn một vòng lặp chạy loạn
Một agent tự thử lại, một consumer của hàng đợi giao lại mỗi lần thất bại, hay một vòng lặp mà mô hình cứ phán là chưa đạt điều kiện dừng: mỗi thứ đều có thể sinh ra hàng nghìn lệnh gọi trước khi ai đó nhận ra. Nếu không có gì nằm trên đường đi và đếm, tín hiệu đầu tiên là hóa đơn. Hạn mức theo người dùng và điểm dừng cứng không tồn tại trừ khi một thành phần trên đường đi cưỡng chế chúng, và mã ứng dụng là chỗ tồi để đặt chúng vì mọi điểm gọi đều phải nhớ làm.
Cloudflare AI Gateway là gì và nằm ở đâu trên đường đi của yêu cầu
Tổng quan AI Gateway của Cloudflare mô tả một dịch vụ nằm giữa ứng dụng của bạn và các nhà cung cấp mô hình AI để bạn theo dõi mức dùng và quản lý cách ứng dụng mở rộng. Các tính năng gồm phân tích, ghi log, cache, giới hạn tần suất và thử lại yêu cầu kèm dự phòng, trên mọi gói của Cloudflare. Cloudflare nói chỉ cần một dòng mã để bắt đầu, và hình dạng của phần tích hợp cho thấy vì sao điều đó gần đúng.
Tích hợp chỉ là đổi một base URL
Thay vì trỏ SDK tới nhà cung cấp, bạn trỏ nó tới một địa chỉ gateway mang mã tài khoản, mã gateway và tên nhà cung cấp. Cloudflare ghi dạng dành cho OpenAI là https://gateway.ai.cloudflare.com/v1/{account_id}/{gateway_id}/openai, truyền vào làm baseURL khi khởi tạo client. Tên mô hình, tham số, streaming và cách phân tích phản hồi giữ nguyên. Danh sách nhà cung cấp của Cloudflare bao trùm hơn hai chục dịch vụ theo cùng một khuôn, trong đó có OpenAI, Anthropic, Google Vertex AI, Amazon Bedrock, Azure OpenAI, Mistral, Groq, DeepSeek, xAI và chính Workers AI của Cloudflare.
Hình dạng ấy hàm ý điều gì
Việc áp dụng thật sự rẻ: mỗi dịch vụ một giá trị cấu hình, đổi lại là hoàn tác được, khiến đây là một trong số ít thay đổi hạ tầng bạn có thể thử mà không cần kế hoạch dự án.
Đổi lại, khóa của nhà cung cấp nay đi qua Cloudflare, vì proxy buộc phải chuyển tiếp nó, trừ khi bạn chuyển sang khóa lưu sẵn hoặc thông tin xác thực do Cloudflare quản lý. Đó là một quyết định về niềm tin, không phải một chi tiết.
Và mọi thứ được cung cấp đều bị giới hạn bởi những gì một proxy nhìn thấy. Nó thấy yêu cầu và phản hồi, không thấy ý định của ứng dụng, nên phân bổ chi phí đòi hỏi bạn gắn nhãn cho yêu cầu chứ không phải chờ gateway đoán ra lệnh gọi đó phục vụ việc gì.
Phân tích và ghi log mới là thứ tiết kiệm tiền
Gateway đếm mọi yêu cầu. Tài liệu ghi log của Cloudflare liệt kê những gì một bản ghi chứa: prompt của người dùng, phản hồi của mô hình, nhà cung cấp, dấu thời gian, trạng thái yêu cầu, mức dùng token, chi phí, thời lượng và user agent của client. Theo từng yêu cầu chứ không theo tháng, và truy vấn được.
Hãy nói thẳng vì sao tiền nằm ở đây chứ không nằm ở các tính năng cưỡng chế. Chặn chi tiêu chỉ tiết kiệm được đúng phần chi phí của những lệnh gọi bạn đã dừng, và phần đó có giới hạn. Biết tiền chảy đi đâu sẽ thay đổi thứ bạn xây, và phần đó thì không.
Phân bổ không tự động. Metadata tùy biến gắn nhãn của riêng bạn, chẳng hạn tên tính năng hay tenant, để phần phân tích gom nhóm theo đó. Bỏ qua bước ấy thì bạn chỉ có một con số tổng, đúng thứ hóa đơn đã đưa cho bạn rồi.
Cache, và những trường hợp một lần trúng cache phá hỏng sản phẩm
Cache là tính năng bị bật vì lý do sai nhiều nhất, và cũng là tính năng có khả năng làm hỏng sản phẩm trong im lặng nhiều nhất.
Khóa cache được dựng thế nào
Tài liệu cache của Cloudflare giải thích khóa là một băm SHA-256 của nhà cung cấp, endpoint, mô hình, header xác thực và toàn bộ thân yêu cầu. Khớp chính xác tất cả những thứ đó là trúng, còn lại là trượt. Vậy nên trúng đòi hỏi một yêu cầu giống nhau tới từng byte, điều hiếm xảy ra sau lượt đầu ở một endpoint chat mang theo lịch sử tích lũy. Thời gian sống tối thiểu là 60 giây và tối đa là một tháng. Điều khiển theo từng yêu cầu đến từ cf-aig-cache-ttl, cf-aig-skip-cache và cf-aig-cache-key, còn cf-aig-cache-status trả về HIT hoặc MISS để bạn đo tỷ lệ trúng thật.
Khi nào trúng cache là an toàn và khi nào không
Trúng cache an toàn ở nơi cùng một đầu vào nên cho cùng một đầu ra và câu trả lời cũ vẫn chấp nhận được: phân loại, trích xuất có cấu trúc, dịch các chuỗi cố định, embedding của tài liệu không đổi, lưu lượng đánh giá. Nó không an toàn ở bất cứ đâu mà giá trị của sản phẩm phụ thuộc vào sự khác biệt. Nếu hai người dùng hỏi cùng một câu và người thứ hai nhận phản hồi sinh ra cho người thứ nhất, thiết lập temperature của bạn chỉ là đồ trang trí.
Thất bại tệ hơn nằm ở quyền riêng tư. Nếu thân yêu cầu không mang gì phân biệt được người dùng, một phản hồi đã cache có thể vượt qua ranh giới giữa hai người, và đó là chuyện lộ dữ liệu chứ không phải chuyện chất lượng. Cache cũng chỉ bao phủ phản hồi dạng văn bản và hình ảnh.
Giới hạn tần suất, thử lại và định tuyến dự phòng
Ba thứ này thường được mô tả chung như các tính năng độ tin cậy. Chỉ một trong ba ràng buộc chi phí một cách có ý nghĩa.
Giới hạn tần suất chặn số yêu cầu, không chặn token
Cloudflare cung cấp cửa sổ cố định và cửa sổ trượt, và yêu cầu vượt hạn mức nhận về 429. Hãy để ý thứ được đếm: yêu cầu. Một lệnh gọi mang ngữ cảnh rất lớn tốn hơn nhiều so với một lệnh gọi ngắn, và bộ giới hạn không phân biệt được hai thứ đó. Giới hạn tần suất bảo vệ bạn khỏi vòng lặp chạy loạn và khỏi một endpoint bị lạm dụng, chứ không khỏi một prompt đắt tiền, và coi nó là công cụ kiểm soát chi phí là sai lầm phổ biến.
Thử lại và thời gian chờ
Các header xử lý yêu cầu của Cloudflare cho phép tối đa 5 lần thử với cf-aig-max-attempts, độ trễ tối đa 5000 mili giây với cf-aig-retry-delay, và chiến lược hằng số, tuyến tính hoặc hàm mũ với cf-aig-backoff. Header cf-aig-request-timeout được đo từ lúc phần đầu tiên của phản hồi tới, nên với một lệnh gọi streaming nó là hạn mức cho thời gian tới byte đầu tiên chứ không phải cho tổng thời lượng. Ở lần thử cuối, gateway chờ cho tới khi yêu cầu hoàn tất, dù lâu đến đâu.
Định tuyến dự phòng đã đổi hình dạng
Universal Endpoint, thứ nhận vào một mảng các đối tượng nhà cung cấp rồi đi dần xuống mỗi khi hỏng, đã bị ngừng khuyến nghị. Cloudflare nay hướng các tích hợp mới sang endpoint tương thích OpenAI, và sang Dynamic Routing cho dự phòng, thử lại và định tuyến có điều kiện. Một tuyến động là một luồng có tên và có phiên bản, dựng bằng giao diện hoặc bằng JSON, gồm nút mô hình, nút điều kiện rẽ nhánh theo thân yêu cầu, header hay metadata, nút tỷ lệ phần trăm cho thử nghiệm A/B, cùng nút giới hạn tần suất và nút hạn mức ngân sách chuyển sang phương án dự phòng khi vượt ngưỡng. Bạn gọi nó bằng cách đặt tên tuyến vào chỗ vốn dành cho tên mô hình.
Soi thứ đi vào và thứ quay lại
Vì proxy giữ cả hai nửa của cuộc trao đổi, nó có thể đánh giá chúng. Guardrails của Cloudflare chặn prompt của người dùng và phản hồi của mô hình, đánh dấu nội dung để xem lại hoặc chặn không cho đi tiếp, và áp một chính sách duy nhất bất kể nhà cung cấp nào đã trả lời.
Lập luận cho việc đặt chính sách trên đường đi thay vì trong mã là kiểm duyệt ở tầng ứng dụng phải được viết một lần cho mỗi điểm gọi, và điểm gọi thêm vào tuần trước chính là điểm bỏ sót. Cái giá là bản thân việc kiểm tra cũng là suy luận: Guardrails được tính tiền như mức dùng theo token của Workers AI, nên giá tăng theo độ dài của thứ bạn đem đi soi. Quét chống thất thoát dữ liệu thì miễn phí trên mọi gói.
Những gì đã đổi trong Agents Week tháng 8 năm 2026
Cloudflare tổ chức Agents Week đầu tiên từ ngày 3 đến ngày 7 tháng 8 năm 2026 và vào ngày cuối đã công bố việc hợp nhất Workers AI và AI Gateway thành một control plane duy nhất. Hãy tách phần đã phát hành khỏi phần mới chỉ được loan báo.
Phần đã phát hành: một binding AI thay vì hai, nên env.AI.run() bao trùm cả mô hình Workers AI lẫn nhà cung cấp bên ngoài. Định tuyến qua gateway trở thành mặc định cho Workers AI thay vì tùy chọn, với gateway: { id: 'default' } tự tạo gateway ngay lần dùng đầu và mang lại ghi log yêu cầu, theo dõi token và phân bổ chi phí mà không cần đổi gì khác. Tín dụng trở nên tiêu được xuyên nhà cung cấp, nên Workers AI có thể trả từ cùng số dư trả trước với OpenAI hay Anthropic.
Phần chưa phát hành: định tuyến ưu tiên mô hình, nơi bạn yêu cầu một mô hình và nền tảng chọn nhà cung cấp, là thứ sắp tới chứ chưa dùng được, còn bộ định tuyến thông minh phân loại prompt vẫn đang thử nghiệm nội bộ. Đây là việc gom lại phần tính tiền, binding và bảng điều khiển, không phải một năng lực mới. Nếu bạn vốn đã gọi Workers AI ở biên mà không qua gateway, nay bạn có khả năng quan sát theo mặc định.
Cloudflare AI Gateway tốn bao nhiêu
Trang giá AI Gateway của Cloudflare nói rằng các tính năng lõi hiện có được cung cấp miễn phí, bao gồm phân tích trên bảng điều khiển, cache và giới hạn tần suất trên mọi gói. Mọi con số dưới đây là giá đô la Mỹ do Cloudflare công bố, giữ nguyên đơn vị tiền tệ mà Cloudflare công bố.
Tiền thực sự phát sinh ở đâu
Log lưu lâu dài thì dùng miễn phí nhưng bị chặn trần theo gói: 100.000 bản ghi cho tất cả gateway trên Workers Free, và 10 triệu mỗi gateway trên Workers Paid. Logpush, thứ xuất các log đó ra nơi khác, là tính năng của gói trả tiền với mức 10 triệu mỗi tháng và 0,05 USD cho mỗi triệu tiếp theo. Bản thân Workers AI, theo trang giá của nó, gồm 10.000 neuron mỗi ngày miễn phí và tính 0,011 USD cho mỗi 1.000 neuron vượt quá trên gói trả tiền, với neuron là đơn vị của Cloudflare cho phần tính toán GPU.
Gộp hóa đơn tốn 5 phần trăm
Nếu bạn dùng thông tin xác thực do Cloudflare quản lý thay vì khóa nhà cung cấp của mình, mỗi lần mua tín dụng chịu phí 5 phần trăm. Ví dụ của chính Cloudflare là mua 100 USD tín dụng và bị tính 105 USD. Phần suy luận được chuyển tiếp nguyên giá, không cộng thêm. Mang khóa của bạn tới thì gộp hóa đơn không áp dụng, vì một yêu cầu mang theo thông tin xác thực của nhà cung cấp hoặc một khóa lưu sẵn sẽ đi vòng qua nó.
Kiểm soát chi phí cho đúng cách
Gateway cưỡng chế đáng tin ba thứ: tần suất yêu cầu, hạn mức ngân sách bên trong một tuyến động, và việc một yêu cầu có được phục vụ từ cache hay không. Mọi thứ khác nó làm đều là đo đạc. Lẫn lộn hai nhóm ấy là lý do các đội cài nó vào, tích hết mọi ô, rồi vẫn bị hóa đơn làm cho bất ngờ.
Một trần ngân sách cứng là quyết định kinh doanh trước khi là một mục cấu hình. Phải có điều gì đó xảy ra khi chạm trần, và mọi lựa chọn đều tệ theo cách riêng. Cho yêu cầu hỏng làm sản phẩm xấu đi với đúng người hỏi sau cùng, và điều đó trông như một lỗi. Rơi xuống mô hình rẻ hơn làm chất lượng tụt trong im lặng. Xếp hàng đợi biến bài toán chi phí thành bài toán độ trễ. Chọn giữa những thứ đó mới là phần việc thật.
Khoản tiết kiệm đến được hóa đơn thường sinh ra từ khả năng quan sát chứ không từ cưỡng chế. Khi chi tiêu đã gom nhóm theo tính năng, thứ đắt tiền gần như luôn sửa được mà không phải đổi mô hình: một system prompt quá khổ gửi đi mỗi lượt, toàn bộ lịch sử hội thoại gửi lại trong khi một bản tóm tắt cuốn chiếu là đủ, một vòng thử lại cứ bắn vào một lỗi vốn không bao giờ thành công. Log tìm ra tất cả những thứ đó. Bộ giới hạn tần suất không tìm ra thứ nào.
Độ trễ mà bạn đang cộng thêm
Một chặng phụ không miễn phí, và giả vờ ngược lại là cách một quyết định tốt được đưa ra vì một lý do tồi. Yêu cầu của bạn nay kết thúc tại một trung tâm dữ liệu của Cloudflare, được xử lý ở đó rồi chuyển tiếp tới nhà cung cấp, tức là thêm một lần bắt tay TLS và một chặng mạng mà trước đây bạn không phải trả.
Trong trường hợp thông thường, phần đó nhỏ so với thứ nó bao quanh. Một lượt hoàn thành chat chạy từ vài trăm mili giây tới vài giây và bị chi phối bởi thời gian sinh nội dung, còn gateway nằm trên mạng biên của Cloudflare nên chặng đầu kết thúc gần người gọi. So với một lượt hoàn thành mất 2 giây, phần cộng thêm chỉ là nhiễu.
Chỗ nó thôi là nhiễu là các lệnh gọi ngắn, rẻ và nhiều. Một yêu cầu embedding trả về trong khoảng thấp hơn hẳn 0,1 giây là trường hợp mà chi phí cố định trở thành một tỷ lệ nhìn thấy được. Streaming là trường hợp còn lại, vì con số người dùng cảm nhận là thời gian tới token đầu tiên, nên mọi thứ cộng vào trước khi token ấy tới đều rơi đúng vào chỉ số quan trọng nhất. Hãy đo nó từ thời lượng mà gateway ghi lại, đối chiếu với cùng lệnh gọi thực hiện trực tiếp.
Chiến lược nhiều nhà cung cấp và phần phụ thuộc bạn không thoát được
Lời chào hàng là gateway khiến các nhà cung cấp thay thế được cho nhau, và ở tầng truyền tải thì điều đó đúng. Endpoint tương thích OpenAI cho bạn một khuôn yêu cầu duy nhất, định tuyến động cho bạn khả năng chuyển đổi khi hỏng mà không cần triển khai lại, và đổi tên mô hình trở thành việc cấu hình chứ không phải việc viết mã.
Tầng truyền tải chưa bao giờ là phần đắt. Đổi mô hình đắt vì các mô hình hành xử khác nhau. Một system prompt được tinh chỉnh hàng tháng trời cho một mô hình sẽ cho đầu ra khác trên mô hình khác. Định dạng gọi công cụ và độ tin cậy của nó khác nhau. Cách từ chối khác nhau, nên nội dung trước đây lọt qua nay bị chối. Mức tuân thủ khuôn JSON đã yêu cầu cũng khác, và một bộ phân tích viết theo thói quen của mô hình này sẽ vỡ trước mô hình kia. Kích thước cửa sổ ngữ cảnh cũng khác.
Thứ bạn thực sự mua được là việc chuyển đổi trở thành một buổi chiều ngồi đánh giá thay vì một sprint đi nối ống, và việc chuyển đổi khi có sự cố tồn tại sẵn mà bạn không phải tự xây. Điều đó đáng có, nhưng nó không phải tính khả chuyển. Có một phụ thuộc thứ cấp đáng gọi tên: gateway nay nằm trên đường đi của mọi lệnh gọi mô hình, nên độ sẵn sàng của nó trở thành độ sẵn sàng của bạn. Đó cũng chính là đánh đổi chúng tôi đã xem xét khi so sánh Cloudflare Workers và AWS Lambda.
Ghi log prompt nghĩa là xử lý dữ liệu cá nhân
Đây là phần hay bị bỏ qua và cũng là phần có rủi ro pháp lý đi kèm. Ghi log bật sẵn cho mỗi gateway, và một bản ghi chứa nguyên vẹn prompt của người dùng cùng phản hồi của mô hình. Nếu người dùng gõ bất cứ điều gì về bản thân, dán một tài liệu, hay kể cho trợ lý một tình huống y tế hoặc tài chính, nội dung ấy là dữ liệu cá nhân nằm trong kho log của bên thứ ba, và theo UK GDPR bạn vẫn là bên kiểm soát nó.
Che dữ liệu trước khi nó rời ứng dụng
Nơi duy nhất chắc chắn để bỏ đi một thứ là trước khi gửi. Gateway cung cấp cf-aig-collect-log-payload: false để giữ metadata mà bỏ phần thân, và cf-aig-collect-log: false để không ghi gì cả. Nhưng tối thiểu hóa dữ liệu nói về chuyện ngay từ đầu đừng thu nhiều hơn mức cần, nên cách sửa bền nằm ở phía trên: hãy bỏ số tài khoản, định danh và các trường văn bản tự do mà mô hình không cần, trước khi yêu cầu rời tiến trình của bạn.
Thời hạn lưu là quyết định bạn phải tự đưa ra
Hướng dẫn của ICO về giới hạn lưu trữ không ấn định thời hạn cố định. Nó đòi bạn không giữ dữ liệu cá nhân lâu hơn mức cần, giải thích được thời hạn đã chọn, có một chính sách đặt ra các thời hạn chuẩn, rồi rà soát và xóa hoặc ẩn danh những gì không còn cần. Một kho log có trần theo gói không phải là chính sách lưu trữ, vì cái trần là giới hạn dung lượng chứ không phải một thời hạn có lý do.
Các phương án thay thế, nói cho công bằng
Có ba phương án thay thế thực sự, và lựa chọn chủ yếu xoay quanh chuyện ai vận hành thứ đó.
Một proxy LLM mã nguồn mở tự vận hành cho bạn cùng đường đi của yêu cầu với log nằm trên hạ tầng bạn kiểm soát, và đó là lựa chọn đúng khi chính độ nhạy cảm của prompt mới là vấn đề. Cái giá là phải vận hành một thành phần nằm trên đường đi trọng yếu của mọi lệnh gọi mô hình.
Một nhà cung cấp chuyên về khả năng quan sát LLM đi sâu hơn vào đánh giá, quản lý phiên bản prompt và soi trace. Nếu vấn đề của bạn là đầu ra sai chứ không phải chi phí mù mờ, hướng đó hợp hơn, và hai thứ này không loại trừ nhau.
Tự xây cũng đứng vững khi nhu cầu hẹp. Một lớp bọc ghi lại yêu cầu, phản hồi, số token và một nhãn tính năng vào hệ quan sát sẵn có mất chừng hai ngày và trả lời được câu hỏi phân bổ. Thứ bạn sẽ không có được với giá rẻ là cache với khóa dựng đúng, và dự phòng chéo giữa các nhà cung cấp.
Quy tắc: nếu không ai biết tiền chảy đi đâu, gateway là cách sửa nhanh nhất và bậc miễn phí chứng minh điều đó. Nếu prompt không được rời hạ tầng của bạn, hãy tự vận hành. Nếu đầu ra sai, không gateway nào giúp được và thứ bạn cần là công cụ đánh giá.
Triển khai tốn những gì và trả lại những gì
Với một dịch vụ đơn lẻ vốn đã gọi một nhà cung cấp, nửa ngày. Tạo gateway, đổi base URL trong cấu hình, triển khai sau một cờ để việc quay lui chỉ là một biến môi trường chứ không phải một bản phát hành, ngồi xem log đầy dần, xác nhận streaming vẫn chạy đúng.
Với một sản phẩm thật, hãy dự trù 3 đến 5 ngày công kỹ sư, và phần lớn trong đó không phải việc của gateway. Đó là việc quyết một lược đồ metadata để phân bổ trả lời được những câu bạn sẽ thật sự hỏi, rà mọi điểm gọi kể cả các tác vụ theo lịch và đoạn mã cả năm không ai mở, xác định endpoint nào cache được an toàn, và viết bước che dữ liệu. Cộng thêm một ngày cho định tuyến dự phòng, vì một phương án dự phòng chỉ đáng có sau khi bạn đã thử và thấy mô hình dự phòng cho ra đầu ra chấp nhận được.
Phần trả lại không hào nhoáng. Bạn thôi bị hóa đơn làm cho bất ngờ, và với hầu hết các đội điều đó còn hơn con số tiết kiệm tuyệt đối. Sự cố của nhà cung cấp trở thành một phản hồi kém đi thay vì một sự cố của bạn. Các đội xây luồng agent hưởng lợi nhiều nhất, vì một thao tác của người dùng tỏa ra thành hàng chục lệnh gọi mô hình chính là chỗ ước tính rời xa thực tế, một khuôn mẫu chúng tôi đã bàn trong chi phí của agent AI và những chỗ chúng hỏng.
Đưa gateway vào mà không phá vỡ production
Trình tự hiệu quả thì chán một cách có chủ ý. Đặt gateway vào đường đi với ghi log bật và không bật gì khác. Thu một tuần dữ liệu. Đọc phần phân bổ. Rồi bật đúng những tính năng mà dữ liệu biện minh được, và bật cache sau cùng, chỉ trên các endpoint mà bạn nói rõ được vì sao một câu trả lời lặp lại vẫn là một câu trả lời đúng.
Mecanik xây và vận hành lớp này như một phần công việc tích hợp AI của chúng tôi, còn dịch vụ tích hợp OpenAI API lo phía nhà cung cấp. Các dự án gần như luôn bắt đầu theo cùng một cách, với một tuần ghi log và không đổi gì khác, vì dữ liệu phân bổ thường sắp xếp lại danh sách ưu tiên.
Câu hỏi thường gặp
Cloudflare AI Gateway có miễn phí không? Các tính năng lõi miễn phí trên mọi gói, và trang giá của Cloudflare mô tả phạm vi đó gồm phân tích trên bảng điều khiển, cache và giới hạn tần suất, còn quét chống thất thoát dữ liệu cũng miễn phí. Tiền phát sinh ở rìa: Logpush là tính năng của gói trả tiền, Guardrails được tính như suy luận theo token của Workers AI, và phần lưu log bị chặn trần theo gói chứ không tính giá theo từng bản ghi.
Một AI gateway có làm lệnh gọi mô hình chậm đi không? Có, nó thêm một lần bắt tay TLS và một chặng mạng. So với một lượt hoàn thành chat mất từ vài trăm mili giây tới vài giây, phần cộng thêm ấy thường không đáng kể. Nó trở nên thấy được ở các lệnh gọi ngắn và nhiều như embedding hay phân loại nhỏ, và ở phản hồi streaming nơi chỉ số người dùng cảm nhận là thời gian tới token đầu tiên chứ không phải tổng thời lượng.
Khi nào thì không an toàn để cache phản hồi LLM? Bất cứ khi nào giá trị của sản phẩm phụ thuộc vào sự khác biệt giữa các phản hồi, hoặc bất cứ khi nào thân yêu cầu không phân biệt được người dùng này với người dùng kia. Cloudflare dựng khóa cache từ nhà cung cấp, endpoint, mô hình, header xác thực và toàn bộ thân yêu cầu, nên một lần trúng nghĩa là một yêu cầu giống nhau tới từng byte. Cache hợp với phân loại, trích xuất và embedding, không hợp với phản hồi hội thoại vốn nên khác nhau theo từng người.
Gateway có làm việc đổi nhà cung cấp mô hình trở nên dễ không? Ở tầng truyền tải thì có: một khuôn yêu cầu, một thay đổi cấu hình, và chuyển đổi khi hỏng mà không cần triển khai lại. Phần đắt đỏ của việc đổi thì vẫn nguyên: prompt tinh chỉnh cho một mô hình sẽ hành xử khác trên mô hình kia, định dạng gọi công cụ và cách từ chối khác nhau, mức tuân thủ JSON khác nhau, và cửa sổ ngữ cảnh cũng khác. Gateway bỏ đi phần nối ống, không bỏ đi phần đánh giá.
Cloudflare đã thay đổi những gì vào tháng 8 năm 2026? Ngày 7 tháng 8 năm 2026, vào cuối Agents Week, Cloudflare hợp nhất Workers AI và AI Gateway thành một control plane duy nhất: một binding AI bao trùm cả Workers AI lẫn nhà cung cấp bên ngoài, định tuyến qua gateway bật sẵn cho Workers AI, và tín dụng tiêu được xuyên nhà cung cấp từ một số dư trả trước. Định tuyến ưu tiên mô hình được loan báo là thứ sắp tới chứ chưa phát hành.
Bình luận