Kimi K3

关于 Kimi K3 的指南、基准测试与集成说明。这是 Moonshot AI 推出的 2.8 万亿参数开放权重推理模型,涵盖 API 调用与自托管部署。

自托管 Kimi K3:硬件、成本与数据主权

自托管 Kimi K3 在 2026 年 7 月 27 日成为技术上可行的选项,那天 Moonshot AI 连同生产级推理支持一起公开了这个 2.8 万亿参数模型的权重。许多机构读到这条消息后得出结论:现在可以在自家硬件上运行前沿级推理,不必再按 token 付费了。 这个结论通常是错的,但原因并非人们预想的那样。工程上是可以做到的。真正击垮多数项目的是那笔账,而且它往往在预算批下来好几个月后才悄无声息地发作。 简短回答: 在 MXFP4 精度下,2.8 万亿参数在计入键值缓存之前就已占用约 1.4TB。一个八卡 H100 节点只有 640GB,因此根本无法服务这个模型。现实的部署要从约 1.7TB 显存起步,...

Kimi K3 API:定价、集成与权衡

Kimi K3 API 带着一个不寻常的组合登场:接近前沿水平的基准成绩、激进的定价,以及可供下载的权重。Moonshot AI 于 2026 年 7 月 27 日公开了这些权重,使 K3 成为迄今公开发布的最大模型,也是这一规模的模型首次在原则上可以由你自己运行。 对于已经在向前沿供应商付费的团队来说,这提出的是一个务实问题,而非哲学问题:它在你的技术栈里有没有位置,把一部分流量迁过去究竟会改变什么。本文讨论成本测算、集成工作,以及那些公开数字无法转化为生产表现的环节。 简而言之: Kimi K3 的缓存未命中输入约为每百万 token 3 美元,缓存命中输入约为 0.30 美元,输出约为 15 美元,...