自架 Kimi K3 在 2026 年 7 月 27 日成為技術上可行的選項,當天 Moonshot AI 連同生產級推理支援一起公開了這個 2.8 兆參數模型的權重。許多組織讀到這則消息後得出結論:現在可以在自家硬體上執行前沿級推理,不必再按 token 付費了。 這個結論通常是錯的,但原因並非人們預想的那樣。工程上是做得到的。真正擊垮多數專案的是那筆帳,而且它往往在預算核准好幾個月後才悄無聲息地發作。 簡短回答: 在 MXFP4 精度下,2.8 兆參數在計入鍵值快取之前就已占用約 1.4TB。一個八卡 H100 節點只有 640GB,因此根本無法服務這個模型。實際的部署要從約 1.7TB 顯示記憶體起步,也就是採用 288GB ...
Kimi K3
關於 Kimi K3 的指南、基準測試與整合說明。這是 Moonshot AI 推出的 2.8 兆參數開放權重推理模型,涵蓋 API 呼叫與自架部署。
Kimi K3 API 帶著一個不尋常的組合登場:接近前沿水準的基準成績、積極的定價,以及可供下載的權重。Moonshot AI 在 2026 年 7 月 27 日公開了這些權重,使 K3 成為迄今公開發布的最大模型,也是這種規模的模型首次在原則上可以由你自己運行。 對於已經在向前沿供應商付費的團隊而言,這提出的是務實問題而非哲學問題:它在你的技術堆疊裡有沒有位置,把一部分流量遷過去究竟會改變什麼。本文討論成本試算、整合工作,以及那些公開數字無法轉化為生產表現的環節。 簡而言之: Kimi K3 的快取未命中輸入約為每百萬 token 3 美元,快取命中輸入約 0.30 美元,輸出約 15 美元,脈絡視窗為 1,048,576...