Kimi K3 API 帶著一個不尋常的組合登場:接近前沿水準的基準成績、積極的定價,以及可供下載的權重。Moonshot AI 在 2026 年 7 月 27 日公開了這些權重,使 K3 成為迄今公開發布的最大模型,也是這種規模的模型首次在原則上可以由你自己運行。
對於已經在向前沿供應商付費的團隊而言,這提出的是務實問題而非哲學問題:它在你的技術堆疊裡有沒有位置,把一部分流量遷過去究竟會改變什麼。本文討論成本試算、整合工作,以及那些公開數字無法轉化為生產表現的環節。
簡而言之: Kimi K3 的快取未命中輸入約為每百萬 token 3 美元,快取命中輸入約 0.30 美元,輸出約 15 美元,脈絡視窗為 1,048,576 個 token。它提供相容 OpenAI 與 Anthropic 的介面,因此遷移一個工作負載基本上只是改動基礎 URL 與模型名稱。要留意的是,思考始終開啟且預設為最高強度,除非你刻意設定,否則輸出 token 會成為帳單上最大的一項。
Kimi K3 究竟是什麼
架構在這裡很重要,因為它同時解釋了定價與部署限制。
K3 是一個稀疏專家混合模型,總參數量 2.8 兆,每個 token 啟用約 1040 億。它擁有 896 位專家,每個 token 路由到其中 16 位。正是這個比例讓這種規模的模型得以被服務:你付出的是全部參數量的顯示記憶體代價,而運算代價只相當於一個小得多的模型。
真正新穎的是注意力設計。Moonshot 在名為 Kimi Delta Attention 的線性注意力機制之上建構了 K3,並以大約三比一的比例與週期性的全注意力層交錯排列,再輔以他們稱為 Attention Residuals 的技術。線性層以低成本處理局部序列結構,全注意力層則保留全域資訊流動。正是這個組合讓百萬 token 脈絡在經濟上可行,而不只是宣傳口號。
模型卡還帶出兩個維運細節。權重以 MXFP4 提供,啟用值為 MXFP8;思考始終啟用,代表模型在每次請求中都會連同答案回傳一個 reasoning_content 欄位。你無法關閉推理,只能選擇購買多少。
Kimi K3 API 的成本
公開的費率很直白,而各項之間的落差正是有趣決策發生的地方。
快取未命中輸入約為每百萬 token 3 美元。快取命中輸入約 0.30 美元,相差十倍。輸出約為每百萬 token 15 美元。與部分供應商不同,這個定價在整個脈絡視窗內保持一致,不會在超過某個門檻後跳漲,讓長脈絡任務的成本預測容易得多。
用一個實際的例子來算。假設某個客服工作流程的代理帶有 4 萬 token 的系統提示與知識前言,加上 2000 token 的對話,並產生 1500 token 的回答與推理。冷啟動時,這次請求的輸入約花費 12.5 美分,輸出略高於 2 美分。而在快取溫熱、4 萬 token 前綴已被快取的情況下,輸入成本驟降到 1.5 美分以下,輸出成本不變。以每天一萬次請求計算,這個差額就是該功能的全部經濟性。
由此得出兩點。第一,組織提示詞,讓穩定的內容位於最前且永不變動,因為快取只對保持完全一致的前綴有效。第二,密切留意輸出側,因為推理 token 按輸出計費,而強度設定預設為最高。我們關於用快取降低大型語言模型延遲 的指南更詳細地討論了前綴紀律,這裡幾乎可以原樣適用。
整合基本上就是改一個基礎 URL
Moonshot 透過同時相容 OpenAI 與 Anthropic 慣例的介面提供 K3,這代表對多數應用而言遷移確實很小。把現有用戶端指向 Moonshot 的端點,將模型識別碼設為 kimi-k3,再提供新的憑證即可。已經使用其中任一協定的程式碼通常無需修改就能運作。
上線前有三個差異值得明確處理。
第一是 reasoning_effort。K3 接受一個頂層欄位,取值為 low、high 或 max,預設是 max。在分類或抽取類任務上保留預設值,等於為根本不需要的深度思考付費。日常呼叫請設為 low,把 high 或 max 留給真正受益的請求。
第二是 reasoning_content。由於思考始終開啟,回應中除答案外還會攜帶推理欄位。你的解析程式碼需要知道該欄位存在,日誌需要決定是否保留它,而介面絕不應該意外地把它顯示出來。
第三是適用於任何供應商的常規紀律。把憑證保留在伺服器端,將呼叫置於自有代理之後以保留按使用者計量與更換供應商的能力,並固定模型識別碼而不要追蹤會移動的別名。我們如何建構該層,寫在 OpenAI API 整合指南 中,它正是基於這個原因刻意保持供應商中立。
百萬 token 脈絡,以及何時該忽略它
1,048,576 token 的視窗是一項真實能力,同時也是最容易被誤用的特性。
當任務確實需要跨整個語料進行推理時,它物有所值:把一份合約與其全部歷史版本比對、追蹤某個行為在整個程式碼倉庫中的流轉、梳理早期步驟仍然重要的長程代理軌跡。在這些情況下,檢索反而有害,因為決定哪一段相關的是檢索器看不見的關係。
而對於面向文件集合的問答,它是錯誤的工具。每次請求都塞進百萬 token,比檢索出真正相關的四個段落更慢也昂貴得多,在精確查找上準確率往往還更低。誠實的原則是:大脈絡用於那些你事先無法知道哪部分相關的問題,其餘的都屬於檢索管線。
誠實地解讀基準測試
K3 的成績不錯。在綜合智慧指數上,它緊隨領先的商業前沿模型之後,同時明顯超越上一代,並在代理式與終端類程式設計評測中表現強勁。已公布的數字包括 Terminal-Bench 2.1 上接近九成的成績,以及 FrontierSWE 上八十出頭的結果。
這些數字需要一個適用於所有模型而非僅此一家的註解。程式設計基準的結果高度依賴執行所用的框架,混用不同框架的比較在同一模型上可能相差十到二十五分。用廠商自家代理鷹架跑出的分數,無法與通用執行器的分數直接比較。當一張表格顯示某個模型領先另一個時,請先確認兩者是否以相同方式評測,再下結論。
實際含意是:公開基準適合用來篩選候選,不適合用來做最終決定。從你自己的流量中建立一個小型評測集,用你自己的提示詞與鷹架跑一遍候選模型,在你真正要做的工作上比較。三十到一百個有代表性的樣例,比任何排行榜都更能說明問題。
它在生產技術堆疊中的位置
2026 年合理的模式是路由而非選邊,而 K3 很適合這個模式。
把高頻的常規工作交給小而快、成本低的模型。把長程代理任務、大型倉庫任務和真正需要全語料推理的工作交給 K3,在這裡脈絡視窗與代理表現對得起它的成本。同時保留一個商業前沿模型,用於那少數需要最佳答案、價格不是決定因素的請求。
前提是一個抽象層,讓你無需改動應用程式碼就能在供應商之間遷移流量。把某個廠商的用戶端寫死在整個程式碼庫的團隊會發現切換需要數週,於是他們從不切換,於是也從未拿到那份節省。先把接縫做出來,模型選擇就從一個專案變成一項設定決策。
還有一個尤其有利於 K3 的考量。由於權重已經公開,你基於 API 建構的工作負載日後可以遷移到自己掌控的基礎設施上,而無需重寫應用。這是一個真實的策略選項,我們的姊妹篇自架 Kimi K3 對此有詳細討論。
把整合做扎實
Mecanik 作為人工智慧整合服務 的一部分,為多家供應商建構生產級的語言模型整合。我們負責代理與路由層、提示快取結構、強度調校、評測框架,以及那些防止一個有前景的功能變成無法預測帳單的成本控制。
如果你正在考慮從現有供應商遷移到 Kimi K3,我們會把你的真實流量分別跑過兩邊,在你做出任何承諾之前把品質與成本的差異攤開來。關於更宏觀的商業視角,我們的 AI 整合成本指南 說明了建構與營運預算的現實樣貌。完整規格發布在 Kimi K3 模型卡 上。
相關文章: AI機構vs自建團隊:2026年英國AI導入指南 、Claude API vs OpenAI API:開發者比較 2026 、DeepSeek R1 vs. OpenAI o3-mini:哪個 API 最好? 、真正的人工智能存在嗎? 揭開神話與現實 。
常見問題
Kimi K3 API 的費用是多少? 公開定價約為快取未命中輸入每百萬 token 3 美元、快取命中輸入 0.30 美元、輸出 15 美元,並在整個脈絡視窗內一致適用。由於推理 token 按輸出計費且強度預設為最高,通常輸出才是最大的成本項。
Kimi K3 API 相容 OpenAI 的用戶端函式庫嗎? 相容。Moonshot 提供同時符合 OpenAI 與 Anthropic 慣例的介面,因此多數應用只需更改基礎 URL、模型識別碼與憑證即可遷移。請為推理強度欄位以及每次回應中回傳的額外推理內容留一點處理時間。
可以關閉 Kimi K3 的推理嗎? 不行。思考始終啟用,每個回應都會包含推理內容欄位。你只能透過推理強度設定控制深度,它接受 low、high 或 max,預設是 max,因此在常規任務上請明確設定,以免為不必要的深度思考付費。
我應該用百萬 token 脈絡取代檢索嗎? 只有當任務確實需要跨整個語料推理時才該如此,例如追蹤某個行為在整個倉庫中的流轉。若是面向文件集合的問答,檢索仍然比每次請求都填滿脈絡視窗更快、更便宜,通常也更準確。
Kimi K3 公布的基準分數可信度如何? 分數本身是真實的,但依賴執行框架。程式設計類評測可能因所用代理鷹架而相差十到二十五分,因此廠商自家框架給出的結果無法與通用執行器直接比較。做決定前請在你自己的任務上驗證。
評論