Tự lưu trữ Kimi K3 trở nên khả thi về mặt kỹ thuật vào ngày 27 tháng 7 năm 2026, khi Moonshot AI công bố trọng số của mô hình 2,8 nghìn tỷ tham số cùng với hỗ trợ suy luận cho môi trường sản xuất. Rất nhiều tổ chức đọc tin đó và kết luận rằng giờ đây họ có thể chạy suy luận cấp hàng đầu trên phần cứng của mình và thôi trả tiền theo từng token.

Kết luận ấy thường sai, nhưng không phải vì lý do người ta hay nghĩ. Về kỹ thuật thì làm được. Thứ đánh bại phần lớn dự án là phép tính, và nó đánh bại một cách âm thầm, vài tháng sau khi ngân sách đã được duyệt.

Câu trả lời ngắn gọn: Ở độ chính xác MXFP4, 2,8 nghìn tỷ tham số chiếm khoảng 1,4 TB trước khi tính đến bộ nhớ đệm khóa-giá trị. Một node tám card H100 chỉ có 640 GB nên hoàn toàn không thể phục vụ mô hình này. Triển khai thực tế bắt đầu từ khoảng 1,7 TB VRAM, tức các node thế hệ hiện tại dùng card 288 GB hoặc cấu hình mười sáu card của thế hệ trước. Moonshot hướng người dùng sản xuất tới các cụm từ sáu mươi tư card trở lên.


Trọng số mở thực sự mang lại điều gì

Trước khi bàn phần cứng, hãy bàn giấy phép, vì nó quyết định toàn bộ kế hoạch này có đáng lập hay không.

Bộ trọng số công bố đi kèm một giấy phép riêng mà model card gọi là Kimi K3 License. Đây không phải giấy phép MIT hay Apache thông thường, và không nên tin vào những bản tóm tắt của bên thứ ba mô tả nó như vậy. Hãy tự đọc nguyên văn giấy phép và cho rà soát trước khi cam kết triển khai thương mại, đặc biệt chú ý yêu cầu ghi nhận tác giả và các điều kiện chỉ kích hoạt ở một quy mô sử dụng nhất định. Việc này mất nửa buổi và giúp tránh một cuộc trao đổi khó xử về sau.

Thứ mà trọng số thực sự mua cho bạn là quyền kiểm soát. Dữ liệu không bao giờ rời khỏi hệ thống của bạn. Không ai ngừng cung cấp mô hình dưới chân bạn hay thay đổi giá. Bạn có thể tinh chỉnh, lượng tử hóa thêm, hoặc sửa hành vi phục vụ theo cách mà một API sẽ không bao giờ cho phép. Với các tổ chức có nghĩa vụ về chủ quyền dữ liệu, những đặc tính đó mới là trọng tâm, còn chi phí chỉ là yếu tố thứ yếu.

Thứ mà trọng số không mua cho bạn là một cách rẻ hơn để làm đúng việc API vốn đã làm. Sự phân biệt này là điều hữu ích nhất cần chốt trước khi bất kỳ ai lập danh mục phần cứng.


Tự lưu trữ Kimi K3: phép tính phần cứng

Hãy bắt đầu từ trọng số rồi mở rộng ra, vì mọi yêu cầu khác đều bắt nguồn từ đó.

2,8 nghìn tỷ tham số ở bốn bit mỗi tham số cho ra khoảng 1,4 TB dung lượng, và toàn bộ phải thường trú trong bộ nhớ của card tăng tốc để phục vụ yêu cầu ở tốc độ hợp lý. Chỉ riêng con số này đã loại bỏ cấu hình mà phần lớn đội ngũ mặc định hình dung. Tám card H100 80 GB cho ra 640 GB, chưa bằng một nửa nhu cầu của riêng trọng số.

Sau đó còn phải cộng thêm bộ nhớ đệm khóa-giá trị. Một mô hình quảng bá cửa sổ một triệu token cần chỗ để giữ trạng thái attention cho mỗi yêu cầu đồng thời, và phần cấp phát đó tăng theo cả độ dài ngữ cảnh lẫn kích thước lô. Siêu dữ liệu vLLM công bố đặt mức tối thiểu khả dụng vào khoảng 1.680 GB, con số này khớp với trọng số cộng một bộ đệm vừa phải và không còn dư địa cho việc gộp lô mạnh tay.

Các cấu hình khả dĩ

Trên thực tế, điều đó dẫn tới một trong vài hình thái sau. Tám card thế hệ hiện tại dung lượng 288 GB mỗi card, dù là NVIDIA B300 hay AMD MI355X, cho khoảng 2,3 TB trong một node duy nhất và là lựa chọn đơn giản nhất. Mười sáu card lớp B200 hoặc GB200 cũng đạt tổng dung lượng tương đương nhưng chiếm nhiều không gian hơn. Nếu mục tiêu là thông lượng sản xuất bền vững chứ không phải bản thử nghiệm, hướng dẫn của chính Moonshot chỉ tới cấu hình siêu node từ sáu mươi tư card trở lên.

Có một chi tiết đáng nhấn mạnh vì nó thường làm khó những người từng triển khai mô hình dày đặc. Đây là kiến trúc hỗn hợp chuyên gia, định tuyến mỗi token tới mười sáu trong số 896 chuyên gia, tạo ra lượng lớn giao tiếp toàn phần giữa các thiết bị đang giữ những chuyên gia khác nhau. Băng thông liên kết ở đây không phải thứ có thì tốt. Một cấu hình đủ tổng bộ nhớ nhưng liên kết yếu sẽ cho thông lượng thấp hơn nhiều so với những gì bảng thông số gợi ý, và chẩn đoán ra điều đó sau khi đã mua là một bài học đắt giá.


Đưa nó vào vận hành

Mảng phần mềm đã ổn định hơn nhiều so với một năm trước, và điều đó có ích.

Model card liệt kê vLLM, SGLang và TokenSpeed là các engine suy luận được hỗ trợ. Điểm mấu chốt là phần hỗ trợ cho Kimi Delta Attention được phát hành cùng lúc với trọng số chứ không đến sau, nên một bản dựng vLLM hiện hành đã bao gồm các nhân mà kiến trúc này cần. Bản cài cũ thì không, và đây là thứ đầu tiên cần kiểm tra khi việc triển khai không khởi động được.

Ngoài engine, hãy tính đến hậu cần. Bạn phải tải và lưu hơn một terabyte trọng số, vì vậy hãy chuẩn bị lưu trữ cục bộ tốc độ cao và dự trù thời gian tải và nạp lần đầu tính bằng giờ chứ không phải phút. Hãy đặt trần cho độ dài ngữ cảnh tối đa chấp nhận trên mỗi yêu cầu, vì cho phép mọi bên gọi dùng trọn một triệu token sẽ làm cạn hạn mức bộ đệm chỉ với vài người dùng đồng thời. Hãy quyết định sớm bạn tối ưu cho độ trễ hay thông lượng, bởi gộp lô mạnh tay cải thiện số token mỗi giây nhưng làm xấu thời gian tới token đầu tiên, và bạn không thể có cả hai.

Cuối cùng, hãy coi đây là hạ tầng sản xuất chứ không phải một triển khai nghiên cứu. Nó cần giám sát, hoạch định dung lượng, kỷ luật về phiên bản driver và nhân hệ điều hành, cùng một người có thể liên hệ được khi nó dừng. Gánh nặng vận hành này chính là phần hay bị bỏ sót nhất khỏi bản luận chứng kinh doanh.


Phép so sánh chi phí không ai chịu làm

Đây là phép tính quyết định phần lớn các dự án, và nên làm trước cuộc thảo luận về phần cứng chứ không phải sau.

Một node đủ sức phục vụ K3 có giá thuê dao động rộng tùy nhà cung cấp, khu vực và cam kết, nhưng khoảng 25.000 đến 50.000 đô la mỗi tháng là một biên độ hoạch định hợp lý cho phần cứng thế hệ hiện tại. Mua đứt tốn hơn nhiều ngay từ đầu và chỉ hợp lý khi có tầm nhìn nhiều năm.

So sánh trực tiếp với API

Giờ hãy so với API. Ở mức khoảng 15 đô la mỗi triệu token đầu ra, hóa đơn hạ tầng 30.000 đô la một tháng mua được hai tỷ token đầu ra từ dịch vụ được lưu trữ. Hai tỷ token đầu ra mỗi tháng tương đương khoảng sáu mươi sáu triệu mỗi ngày. Nếu một phản hồi điển hình dài 1.500 token, đó là khoảng bốn mươi bốn nghìn phản hồi mỗi ngày, duy trì liên tục, trước khi tự lưu trữ hòa vốn xét riêng về chi phí.

Tệ hơn, phép so sánh này còn giả định cụm của bạn chạy hết công suất suốt ngày đêm. Phần lớn khối lượng công việc không như vậy. Chúng đạt đỉnh trong giờ hành chính và nhàn rỗi ban đêm, mà bạn trả tiền cho thời gian nhàn rỗi y hệt như thời gian bận rộn. Mức sử dụng thực tế ba mươi phần trăm, vốn phổ biến với công cụ nội bộ, làm chi phí thực trên mỗi token tăng khoảng ba lần và đẩy điểm hòa vốn ra xa tầm với hơn nữa.

Kết luận không dễ nghe nhưng nhất quán: với đại đa số tổ chức, tự lưu trữ Kimi K3 tốn kém hơn dùng API. Nếu luận chứng kinh doanh dựa trên việc tiết kiệm tiền, hãy chạy lại những con số này với báo giá thật và dự báo khối lượng thật trước khi có ai ký lệnh mua.


Khi nào tự lưu trữ thực sự là lựa chọn đúng

Chi phí là lý do sai. Đây mới là những lý do đúng.

Nghĩa vụ pháp lý hoặc hợp đồng ngăn dữ liệu rời khỏi hạ tầng của bạn sẽ tự quyết định thay bạn, và không mức giá API hấp dẫn nào thay đổi được điều đó. Quốc phòng, y tế và một phần dịch vụ tài chính thường xuyên ở vị trí này, và với họ phép tính đơn giản chỉ là tuân thủ tốn bao nhiêu. Tại Việt Nam, các yêu cầu về lưu trữ dữ liệu trong nước cũng thường là yếu tố quyết định trong những dự án thuộc khu vực công và ngân hàng.

Khối lượng cao và bền vững thực sự sẽ lật ngược phép tính. Nếu bạn tiêu thụ hàng tỷ token mỗi tháng ở mức sử dụng ổn định, mô hình chi phí cố định thắng, và càng tăng quy mô nó càng thắng vì chi phí không tăng tuyến tính.

Tính dự đoán và quyền tự do

Tính dự đoán được cũng có giá trị riêng. Sở hữu hệ thống triển khai nghĩa là không có thông báo ngừng hỗ trợ, không có thay đổi giá giữa hợp đồng, và không có giới hạn tốc độ do kế hoạch dung lượng của người khác áp đặt. Với một sản phẩm mà chức năng cốt lõi phụ thuộc vào mô hình, riêng sự ổn định đó đã có thể biện minh cho khoản chi.

Cuối cùng, nếu bạn định tinh chỉnh, sửa hành vi phục vụ, hoặc vận hành trong môi trường cách ly hoàn toàn thì API không giúp được bạn ở bất kỳ mức giá nào.

Ngược lại, hãy trung thực về những trường hợp đây là lựa chọn sai: khối lượng thất thường hoặc khiêm tốn, đội ngũ không có kinh nghiệm vận hành GPU, hoặc một luận chứng kinh doanh chủ yếu dựa vào cắt giảm chi phí. Hướng dẫn của chúng tôi về Kimi K3 API bàn về hướng dùng dịch vụ lưu trữ sẵn, và trình tự hợp lý với phần lớn tổ chức là xây trên API trước rồi chuyển sang hạ tầng riêng khi khối lượng và yêu cầu đủ để biện minh.


Một con đường trung dung hợp lý

Rất ít tổ chức cần một câu trả lời được ăn cả ngã về không, và phương án lai thường mạnh nhất.

Hãy định tuyến phần lớn lưu lượng tới API được lưu trữ, nơi bạn chỉ trả cho những gì đã dùng. Dành hệ thống tự lưu trữ cho những khối lượng công việc cụ thể mang dữ liệu thực sự không thể rời khỏi hạ tầng của bạn. Vì K3 cung cấp cùng một mô hình phía sau cả hai hướng, bạn có thể phân luồng yêu cầu theo phân loại dữ liệu thay vì theo năng lực, và ứng dụng thậm chí không cần biết nó đã đi đường nào.

Cách làm này đòi hỏi đúng lớp trừu tượng được mô tả trong hướng dẫn tích hợp OpenAI API : một proxy nắm giữ thông tin xác thực, định tuyến và đo lường, để nhà cung cấp và vị trí trở thành cấu hình chứ không phải kiến trúc. Xây một lần, và cả hai lựa chọn đều còn để ngỏ.


Lập kế hoạch triển khai cùng những người đã thực sự làm

Mecanik cung cấp dịch vụ tích hợp AI bao trùm các hình thức triển khai mô hình ngôn ngữ dạng lưu trữ sẵn, tự lưu trữ và lai, bao gồm cả việc mô hình hóa dung lượng để cho bạn biết phương án nào thực sự phù hợp với khối lượng công việc của mình.

Chúng tôi sẽ chạy phép tính mức sử dụng và điểm hòa vốn trên lưu lượng thật của bạn, kê khai phần cứng một cách trung thực, và nói thẳng khi API mới là câu trả lời tốt hơn, điều xảy ra khá thường xuyên. Khi việc tự lưu trữ là chính đáng, dịch vụ phát triển phần mềm theo yêu cầu của chúng tôi lo phần ngăn xếp phục vụ, lớp định tuyến, giám sát và logic phân loại dữ liệu xung quanh nó. Thông số đầy đủ được công bố trên model card của Kimi K3 .


Bài viết liên quan: AI thực sự có tồn tại không? Làm sáng tỏ các huyền thoại và thực tế , Giải thích Retrieval-Augmented Generation (RAG) 2026 , OpenAI ChatGPT 5 vs Grok 4 - Cái nào tạo mã Python tốt hơn? , Đại lý AI hay Nội bộ: Áp dụng AI tại Vương quốc Anh 2026 ., Tiny BPE Trainer – Trình huấn luyện BPE nhanh và nhẹ bằng C++


Câu hỏi thường gặp

Tự lưu trữ Kimi K3 cần phần cứng gì? Ở độ chính xác MXFP4, trọng số chiếm khoảng 1,4 TB, và việc phục vụ thực tế cần khoảng 1,7 TB VRAM sau khi tính bộ nhớ đệm khóa-giá trị. Điều đó loại bỏ node tám card H100 640 GB, và hướng tới tám card thế hệ hiện tại 288 GB, cấu hình mười sáu card thế hệ trước, hoặc cụm lớn hơn cho thông lượng sản xuất.

Tự lưu trữ Kimi K3 có rẻ hơn dùng API không? Thường là không. Một node phù hợp tốn khoảng 25.000 đến 50.000 đô la mỗi tháng, số tiền đủ mua khoảng hai tỷ token đầu ra từ API được lưu trữ. Trừ khi bạn duy trì khối lượng đó với mức sử dụng cao suốt ngày đêm, API vẫn rẻ hơn. Tự lưu trữ được biện minh bằng chủ quyền dữ liệu và quyền kiểm soát, không phải bằng chi phí.

Trọng số Kimi K3 dùng giấy phép nào? Model card nêu một giấy phép riêng tên là Kimi K3 License, không phải giấy phép MIT hay Apache tiêu chuẩn. Hãy đọc trực tiếp nguyên văn và xin rà soát pháp lý trước khi triển khai thương mại, vì các bản tóm tắt của bên thứ ba mô tả nó như giấy phép mã nguồn mở tiêu chuẩn là không đáng tin.

Những engine suy luận nào hỗ trợ Kimi K3? Model card liệt kê vLLM, SGLang và TokenSpeed. Phần hỗ trợ cho cơ chế Kimi Delta Attention của mô hình được phát hành cùng trọng số, nên bạn cần một bản dựng hiện hành có chứa các nhân đó. Bản cài cũ sẽ thất bại khi nạp mô hình.

Tôi có thể chạy Kimi K3 trên một máy đơn không? Chỉ trên máy chủ nhiều card tăng tốc thuộc phân khúc cao cấp. Một node với tám card 288 GB có thể chứa mô hình, nhưng phần cứng tiêu dùng và máy trạm một GPU thì còn xa mới đủ. Ngoài ra, cách định tuyến hỗn hợp chuyên gia cũng khiến băng thông liên kết giữa các card trở thành yếu tố chính của thông lượng thực tế.