Kimi K3 API xuất hiện cùng một tổ hợp khá hiếm gặp: kết quả benchmark gần chạm nhóm dẫn đầu, mức giá quyết liệt, và trọng số có thể tải về. Moonshot AI công bố bộ trọng số đó vào ngày 27 tháng 7 năm 2026, biến K3 thành mô hình mở lớn nhất từng được phát hành và là lần đầu tiên một mô hình ở quy mô này là thứ mà về nguyên tắc bạn có thể tự vận hành.
Với những ai đang trả tiền cho một nhà cung cấp hàng đầu, điều này đặt ra một câu hỏi thực tế chứ không phải triết lý. Nó có chỗ trong hệ thống của bạn không, và việc chuyển một phần lưu lượng sang đó thực sự thay đổi điều gì? Bài viết này bàn về phép tính chi phí, công việc tích hợp, và những chỗ mà các con số công bố không chuyển hóa thành hành vi trong môi trường sản xuất.
Tóm lại: Kimi K3 tính khoảng 3 đô la cho mỗi triệu token đầu vào không trúng bộ nhớ đệm, khoảng 0,30 đô la cho mỗi triệu token đầu vào trúng đệm, và khoảng 15 đô la cho mỗi triệu token đầu ra, với cửa sổ ngữ cảnh 1.048.576 token. Nó cung cấp giao diện tương thích OpenAI và Anthropic, nên việc chuyển một khối lượng công việc chủ yếu chỉ là đổi base URL và tên mô hình. Điểm đáng lưu ý là suy luận luôn bật và mặc định ở mức tối đa, khiến token đầu ra trở thành khoản lớn nhất trên hóa đơn nếu bạn không cấu hình có chủ đích.
Kimi K3 thực chất là gì
Kiến trúc quan trọng ở đây vì nó giải thích cả mức giá lẫn các ràng buộc triển khai.
K3 là mô hình hỗn hợp chuyên gia thưa với tổng cộng 2,8 nghìn tỷ tham số, trong đó khoảng 104 tỷ được kích hoạt cho mỗi token. Nó có 896 chuyên gia và định tuyến mỗi token tới 16 trong số đó. Chính tỷ lệ này khiến một mô hình cỡ đó có thể phục vụ được: bạn trả chi phí bộ nhớ cho toàn bộ số tham số nhưng chỉ trả chi phí tính toán của một mô hình nhỏ hơn nhiều.
Thiết kế attention mới là phần thực sự mới mẻ. Moonshot xây K3 trên cái họ gọi là Kimi Delta Attention, một cơ chế attention tuyến tính xen kẽ với các lớp attention đầy đủ theo chu kỳ ở tỷ lệ khoảng ba trên một, được hỗ trợ bởi kỹ thuật họ đặt tên là Attention Residuals. Các lớp tuyến tính xử lý cấu trúc chuỗi cục bộ với chi phí thấp, còn các lớp attention đầy đủ giữ dòng thông tin toàn cục. Chính tổ hợp đó khiến cửa sổ một triệu token khả thi về mặt kinh tế chứ không chỉ là lời quảng cáo.
Hai chi tiết vận hành đi kèm từ model card. Trọng số phát hành ở định dạng MXFP4 với kích hoạt MXFP8, và suy luận luôn được bật, nghĩa là mô hình trả về trường reasoning_content bên cạnh câu trả lời trong mọi yêu cầu. Bạn không thể tắt suy luận. Bạn chỉ có thể chọn mua bao nhiêu.
Chi phí của Kimi K3 API
Bảng giá công bố khá rõ ràng, và khoảng cách giữa các mục chính là nơi những quyết định thú vị diễn ra.
Đầu vào không trúng đệm khoảng 3 đô la mỗi triệu token. Đầu vào trúng đệm khoảng 0,30 đô la, tức giảm mười lần. Đầu ra khoảng 15 đô la mỗi triệu token. Khác với một số nhà cung cấp, mức giá này áp dụng đồng nhất trên toàn bộ cửa sổ ngữ cảnh thay vì tăng bậc sau một ngưỡng nào đó, khiến việc dự báo chi phí cho tác vụ ngữ cảnh dài dễ hơn nhiều.
Một ví dụ tính toán
Hãy thử một tình huống thực tế. Giả sử một tác nhân xử lý quy trình hỗ trợ khách hàng với lời nhắc hệ thống và phần dẫn nhập kiến thức dài 40.000 token, cộng thêm 2.000 token hội thoại, và sinh ra 1.500 token gồm câu trả lời và suy luận. Khi bộ đệm nguội, yêu cầu đó tốn khoảng 12,5 xu cho đầu vào và hơn 2 xu cho đầu ra một chút. Khi bộ đệm ấm, với tiền tố 40.000 token đã được lưu, chi phí đầu vào sụt xuống dưới 1,5 xu trong khi chi phí đầu ra không đổi. Ở mức mười nghìn yêu cầu mỗi ngày, chênh lệch đó chính là toàn bộ bài toán kinh tế của tính năng.
Từ đó rút ra hai bài học. Thứ nhất, hãy sắp xếp lời nhắc sao cho phần nội dung ổn định nằm ở đầu và không bao giờ thay đổi, vì bộ đệm chỉ hữu ích với một tiền tố giữ nguyên y hệt. Thứ hai, hãy theo dõi kỹ phía đầu ra, vì token suy luận được tính như đầu ra và mức nỗ lực mặc định là tối đa. Hướng dẫn của chúng tôi về giảm độ trễ mô hình ngôn ngữ bằng bộ đệm bàn kỹ hơn về kỷ luật tiền tố, và nó áp dụng ở đây gần như nguyên vẹn.
Tích hợp chủ yếu là đổi base URL
Moonshot cung cấp K3 qua giao diện tương thích với cả quy ước của OpenAI lẫn Anthropic, nghĩa là với phần lớn ứng dụng, việc chuyển đổi thực sự nhỏ. Trỏ client hiện có của bạn tới endpoint của Moonshot, đặt định danh mô hình thành kimi-k3, và cung cấp thông tin xác thực mới. Mã đã nói được một trong hai giao thức thường sẽ chạy mà không cần sửa.
Có ba khác biệt đáng xử lý rõ ràng trước khi phát hành.
Thứ nhất là reasoning_effort. K3 nhận một trường cấp cao nhất với các giá trị low, high hoặc max, và mặc định là max. Để nguyên giá trị mặc định cho tác vụ phân loại hay trích xuất đồng nghĩa với việc trả tiền cho suy nghĩ kéo dài mà công việc đó không cần. Hãy đặt low cho các lệnh gọi thông thường và dành high hoặc max cho những yêu cầu thực sự hưởng lợi.
Ba khác biệt cần xử lý
Thứ hai là reasoning_content. Vì suy luận luôn bật, phản hồi mang theo một trường suy luận bên cạnh câu trả lời. Mã phân tích của bạn cần biết trường đó tồn tại, hệ thống log cần quyết định có lưu nó hay không, và giao diện chắc chắn không nên vô tình hiển thị nó.
Thứ ba là kỷ luật thông thường áp dụng cho mọi nhà cung cấp. Giữ thông tin xác thực ở phía máy chủ, đặt lệnh gọi sau proxy của riêng bạn để giữ khả năng đo lường theo người dùng và đổi nhà cung cấp, đồng thời ghim định danh mô hình thay vì bám theo một bí danh luôn dịch chuyển. Cách chúng tôi dựng lớp đó được trình bày trong hướng dẫn tích hợp OpenAI API , và nó được thiết kế trung lập với nhà cung cấp chính vì lý do này.
Cửa sổ một triệu token, và khi nào nên bỏ qua nó
Cửa sổ 1.048.576 token là một năng lực thật, đồng thời cũng là tính năng dễ bị dùng sai nhất.
Nó xứng đáng khi tác vụ thực sự đòi hỏi suy luận trên toàn bộ kho dữ liệu: đối chiếu một hợp đồng với mọi phiên bản trước đó, lần theo một hành vi xuyên suốt cả kho mã, hay xâu chuỗi một hành trình tác nhân dài mà các bước đầu vẫn còn quan trọng. Trong những trường hợp đó, truy hồi thực sự gây hại, vì đoạn liên quan được xác định bởi những mối quan hệ mà bộ truy hồi không nhìn thấy.
Nhưng nó là công cụ sai cho việc hỏi đáp trên một tập tài liệu. Nhồi một triệu token vào mỗi yêu cầu vừa chậm hơn vừa đắt hơn rất nhiều so với việc truy hồi đúng bốn đoạn cần thiết, và độ chính xác khi tra cứu chính xác thường còn kém hơn. Nguyên tắc trung thực là: ngữ cảnh lớn dành cho những bài toán mà bạn không thể biết trước phần nào là liên quan. Mọi thứ còn lại vẫn thuộc về một quy trình truy hồi.
Đọc benchmark một cách trung thực
K3 đạt điểm tốt. Trên các chỉ số trí tuệ tổng hợp, nó đứng ngay sau các mô hình thương mại hàng đầu trong khi vượt khá xa thế hệ trước, và thể hiện mạnh ở các bài đánh giá lập trình dạng tác nhân và trên terminal. Các con số công bố bao gồm kết quả ở khoảng cuối tám mươi trên Terminal-Bench 2.1 và đầu tám mươi trên FrontierSWE.
Những con số đó cần một lưu ý áp dụng cho mọi mô hình chứ không riêng mô hình này. Kết quả benchmark lập trình phụ thuộc rất nhiều vào bộ khung dùng để chạy, và các so sánh trộn lẫn nhiều bộ khung có thể chênh mười đến hai mươi lăm điểm trên cùng một mô hình. Điểm số tạo ra bằng bộ khung tác nhân của chính nhà cung cấp không thể so sánh trực tiếp với điểm từ một trình chạy phổ thông. Khi một bảng cho thấy mô hình này dẫn trước mô hình kia, hãy kiểm tra xem cả hai có được đánh giá theo cùng cách hay không trước khi kết luận.
Hệ quả thực tế là benchmark công khai hữu ích để lập danh sách rút gọn và vô dụng để ra quyết định cuối cùng. Hãy dựng một bộ đánh giá nhỏ từ chính lưu lượng của bạn, chạy các mô hình ứng viên qua đó với lời nhắc và bộ khung của bạn, rồi so sánh trên đúng công việc bạn thực sự làm. Ba mươi đến một trăm trường hợp tiêu biểu sẽ nói lên nhiều điều hơn bất kỳ bảng xếp hạng nào.
Vị trí của nó trong hệ thống sản xuất
Mô thức hợp lý năm 2026 là định tuyến chứ không phải trung thành với một bên, và K3 khớp tốt với mô thức đó.
Hãy đẩy khối lượng công việc thông thường có tần suất cao sang một mô hình nhỏ, nhanh và rẻ. Đẩy công việc tác nhân dài hơi, các tác vụ trên kho mã lớn và những trường hợp thực sự cần suy luận toàn bộ kho dữ liệu sang K3, nơi cửa sổ ngữ cảnh và hiệu năng tác nhân xứng với chi phí. Và giữ sẵn một mô hình thương mại hàng đầu cho thiểu số yêu cầu mà bạn cần câu trả lời tốt nhất và giá không phải yếu tố quyết định.
Điều kiện tiên quyết là một lớp trừu tượng cho phép bạn dịch chuyển lưu lượng giữa các nhà cung cấp mà không đụng vào mã ứng dụng. Những đội gắn cứng client của một hãng khắp codebase sẽ phát hiện việc chuyển đổi mất hàng tuần, nghĩa là họ không bao giờ chuyển, nghĩa là họ không bao giờ thu được khoản tiết kiệm. Hãy dựng đường nối trước, và lựa chọn mô hình trở thành một quyết định cấu hình thay vì một dự án.
Còn một cân nhắc đặc biệt có lợi cho K3. Vì trọng số đã được công bố, một khối lượng công việc bạn xây trên API sau này có thể chuyển sang hạ tầng do bạn kiểm soát mà không cần viết lại ứng dụng. Đó là một lựa chọn chiến lược thực sự, và được bàn trong bài đồng hành tự lưu trữ Kimi K3 .
Xây dựng phần tích hợp cho đúng
Mecanik xây dựng các tích hợp mô hình ngôn ngữ ở môi trường sản xuất trên nhiều nhà cung cấp, trong khuôn khổ dịch vụ tích hợp AI . Chúng tôi lo lớp proxy và định tuyến, cấu trúc bộ đệm lời nhắc, tinh chỉnh mức nỗ lực, bộ khung đánh giá, và các cơ chế kiểm soát chi phí giúp một tính năng đầy hứa hẹn không biến thành hóa đơn khó lường.
Nếu bạn đang cân nhắc chuyển từ nhà cung cấp hiện tại sang Kimi K3, chúng tôi sẽ chạy lưu lượng thật của bạn qua cả hai và cho bạn thấy chênh lệch về chất lượng lẫn chi phí trước khi bạn cam kết bất cứ điều gì. Về bức tranh thương mại rộng hơn, hướng dẫn chi phí tích hợp AI trình bày ngân sách xây dựng và vận hành thực tế trông ra sao. Thông số đầy đủ được công bố trên model card của Kimi K3 .
Bài viết liên quan: Đại lý AI hay Nội bộ: Áp dụng AI tại Vương quốc Anh 2026 , Claude API vs OpenAI API: so sánh cho lập trình viên , DeepSeek R1 vs. OpenAI o3-mini: API nào tốt nhất? , AI thực sự có tồn tại không? Làm sáng tỏ các huyền thoại và thực tế .
Câu hỏi thường gặp
Kimi K3 API có giá bao nhiêu? Giá công bố khoảng 3 đô la mỗi triệu token đầu vào không trúng đệm, 0,30 đô la mỗi triệu token đầu vào trúng đệm và 15 đô la mỗi triệu token đầu ra, áp dụng đồng nhất trên toàn bộ cửa sổ ngữ cảnh. Vì token suy luận tính như đầu ra và mức nỗ lực mặc định là tối đa, đầu ra thường là khoản chi phí lớn nhất.
Kimi K3 API có tương thích với thư viện client của OpenAI không? Có. Moonshot cung cấp giao diện tương thích với cả quy ước của OpenAI lẫn Anthropic, nên phần lớn ứng dụng chuyển đổi bằng cách đổi base URL, định danh mô hình và thông tin xác thực. Hãy dành chút thời gian cho trường mức nỗ lực suy luận và phần nội dung suy luận bổ sung trả về trong mọi phản hồi.
Tôi có thể tắt suy luận trong Kimi K3 không? Không. Suy luận luôn được bật và mọi phản hồi đều kèm trường nội dung suy luận. Bạn chỉ kiểm soát độ sâu qua thiết lập mức nỗ lực, vốn nhận low, high hoặc max và mặc định là max, nên hãy đặt rõ ràng ở các tác vụ thông thường để tránh trả tiền cho suy nghĩ không cần thiết.
Tôi có nên dùng cửa sổ một triệu token thay cho truy hồi không? Chỉ khi tác vụ thực sự đòi hỏi suy luận trên toàn bộ kho dữ liệu, chẳng hạn lần theo một hành vi xuyên suốt cả kho mã. Với hỏi đáp trên tập tài liệu, truy hồi vẫn nhanh hơn, rẻ hơn và thường chính xác hơn việc lấp đầy cửa sổ ngữ cảnh ở mỗi yêu cầu.
Điểm benchmark công bố của Kimi K3 đáng tin đến đâu? Điểm số là thật nhưng phụ thuộc vào bộ khung. Các bài đánh giá lập trình có thể chênh mười đến hai mươi lăm điểm tùy bộ khung tác nhân được dùng, nên kết quả từ bộ khung của chính nhà cung cấp không thể so trực tiếp với trình chạy phổ thông. Hãy kiểm chứng trên tác vụ của bạn trước khi quyết định.
Bình luận