Kimi K3 部署成本:GPU 卡数、240 万美元说法与实时租赁计算
·12 min read
Kimi K3 开源后,有个数字比模型本身传得还快:部署一套要 240 万美元。这个数字确实够吓人——一家团队还没跑出第一个 token,就要先准备上千万元人民币的机器?我们顺着这个说法去翻月之暗面的发布资料、已经放出的权重,以及 AMD 和 NVIDIA 的部署方案,最后发现大家其实把三笔账混在了一起:权重能不能装下、模型能不能稳定跑起来、集群能不能同时服务大量用户。这篇文章就把三笔账拆开,再放进 ComputeUnion 正在跟踪的 GPU 租赁价格里算一遍。
先算显存下限,再看真实租赁价格
完整权重已经发布。官方参数数学下限约 1.4TB,AMD 对已发布检查点的测量约为 1.56TB;这里把权重装载下限、可用试运行和高吞吐生产集群分开计算。
约 1.56TB 已发布检查点的容量下限
更现实的容量规划范围
AMD 已验证 8×MI355X 的 Day‑0 功能性部署,NVIDIA 提供 16×GB200/GB300 等生产配方;上表其他型号仍是容量询价起点,不是官方认证配置。
Kimi K3 GPU 租赁成本计算器
为运行时和上下文留出基础余量,用于询价和 PoC 预算,不代表吞吐保证。
ComputeUnion GPU 租赁价格曲线
曲线使用站内最近 30 天各型号每日最低按需租赁价;它反映可租市场变化,不代表固定采购价。
240 万美元,买的到底是什么?
先做一个最朴素的除法。240 万美元除以 64 张加速卡,平均每个卡位约 3.75 万美元。但“卡位”不是一张拆箱即用的裸卡。真正的 64 卡系统还要有 8 卡服务器或超节点、高带宽交换网络、CPU、内存、存储、供电、散热、备件,以及能把整套系统调通的人。
所以,一套面向大量并发请求的生产集群报价达到数百万美元,完全有可能。问题在于,这个价格不能顺手变成“下载 K3 的门票”,也不能证明想把模型跑起来就必须准备 64 张卡。
| 你可能见过的数字 | 它真正说明什么 | 它没有说明什么 |
|---|---|---|
| 约 1.4TB | 2.8T 参数 × 4 bits 得出的数学下限 | 真实检查点大小和运行显存 |
| 约 1.56TB | AMD 对已发布 MXFP4/BF16 混合检查点的测量 | 你的上下文和并发所需总显存 |
| 8×MI355X | AMD 已验证的 TP8 Day‑0 功能性部署 | 最高生产吞吐 |
| 16–32×GB200/GB300 | NVIDIA Dynamo 的聚合与解耦部署方案 | 每个团队最省钱的拓扑 |
| 64 张以上 | 媒体转述的高吞吐超节点情景 | 试跑 K3 所需的最低硬件 |
别把 96 个权重文件,误读成 96 张 GPU
K3 的 Hugging Face 官方仓库里有 96 个 safetensor 分片。这个数字很容易让人联想到显卡数量,但它只是一个超大检查点的打包和下载方式。文件最后怎么分配到显卡上,是推理框架决定的。
AMD 测得完整检查点约 1.5609TB。在它验证的 8 卡 MI355X 方案里,每张卡装载约 190.974GiB 权重;再加上一条百万上下文的已知运行状态,每卡约 205.401GiB。这还没有把框架工作区、通信缓冲和内存碎片算进去。
K3 的 MoE 架构也容易制造另一个错觉。每个 token 只激活 896 个路由专家中的 16 个,活跃参数约 104B,确实能省计算;但没有被当前 token 激活的专家权重,仍然要留在整个并行系统里。
先看权重能不能装下,再谈模型好不好用
把 1.56TB 除以每张 GPU 的标称显存,可以得到一个有用的边界。但这只是“勉强装下”的算术,不是一份拿来就能跑的部署单。真正的试运行还要给推理引擎、上下文、batch 和各种看不见的开销留位置。
| GPU | 单卡显存 | 只装权重的下限 | 我们会拿去询价的试运行起点 |
|---|---|---|---|
| NVIDIA H100 SXM 80GB | 80GB | 20 | 24–32 张 |
| NVIDIA H200 SXM 141GB | 141GB | 12 | 16–24 张 |
| NVIDIA B200 SXM 180GB | 180GB | 9 | 12–16 张 |
| NVIDIA B300 288GB | 288GB | 6 | 8–16 张 |
| AMD MI300X 192GB | 192GB | 9 | 12–16 张 |
第三列和第四列故意没有写成同一个数字。GPU 是否原生支持 MXFP4、卡间互联是什么、框架是否成熟、你要保留多长的上下文,这些问题往往比一道简单的除法更重要。
把卡数换成账单,事情就清楚多了
上方计算器读取 ComputeUnion 跟踪的按需 GPU 市场价。选一个卡型,再切换“只装权重”“可用试运行”和“64 卡高吞吐集群”,就能看到小时、一天和连续运行 30 天大概要花多少。它不是供应商的正式报价,但至少能把一句模糊的“部署很贵”,变成一张可以继续追问的预算表。
这里还有一个很容易踩的坑:单张 H100 的最低小时价,不等于你能按这个价格拿到一整套集群。如果 20 张便宜显卡散落在不同机器上,没有 NVLink、NVSwitch 或经过验证的多机互联,它们很可能根本跑不成你想象中的 K3 服务。付款前应该问清楚拓扑、可一次性交付的卡数、预装的推理环境,以及能否先做短时验收。
真正容易被低估的,往往不是显卡数量
显卡最贵,也最容易吸引注意力。但实际部署卡住的地方,经常没那么耀眼:
- 推理栈:月之暗面推荐 vLLM、SGLang 和 TokenSpeed;AMD、NVIDIA 也给出了具体路径,但这些方案不能随意互换。
- 高速互联:专家并行和张量并行会产生大量通信。普通以太网方案可能看起来便宜,跑起来却一直在等。
- 存储:检查点本身约 1.56TB,下载、转换、缓存和可恢复副本都要另外占空间。
- 运行余量:KV 状态、工作区、通信缓冲、CUDA Graph、batch、内存碎片和容灾都不会出现在“权重卡数”里。
- 自己的真实任务:代码、Agent、长上下文和多模态任务的失败方式不同。最后该算的是“每个合格任务多少钱”,不只是每秒吐出多少 token。
如果这笔钱由我们来花,会按这个顺序
一上来就买机器,看起来最有决心,却也是最贵的试错方式。更稳妥的做法,是先买便宜的信息,再买昂贵的基础设施。
| 你现在处于什么阶段 | 下一步怎么做 | 这一步要弄清什么 |
|---|---|---|
| 还在判断模型效果 | 先做一轮 K3 API 测试 | K3 能不能稳定完成你的真实任务 |
| 需要数据安全或运行时控制 | 按已验证拓扑短租几天 | 权重、引擎和网络能不能一起正常工作 |
| 业务用量稳定,而且有基础设施团队 | 比较调优后的租赁集群与自购成本 | 持续利用率能否摊薄网络、运维和折旧 |
| 只有个人工作站或小实验室 | 使用 API、卸载实验或更小的模型 | 自部署是在解决问题,还是只满足好奇心 |
准备商用时,还有一件容易忘记的事
K3 使用自定义的 Kimi K3 License,不是 Apache 2.0,也不是纯 MIT。许可证允许使用、修改、部署和分发;但如果经营 Model‑as‑a‑Service,且企业及关联方连续 12 个月总收入超过 2000 万美元,商业使用前需要另行签署协议。达到规定 MAU 或月收入门槛的商业产品,还需要在界面显著展示“Kimi K3”。从测试走向正式商用之前,应该重新阅读最新许可证,并取得适合自己业务的法律意见。
再回头看 240 万美元,这个数字应该放在哪里?
它应该出现在“大型生产集群采购”这场讨论里,而不是贴在 K3 的下载按钮旁边。完整权重让自部署成为可能,但“开放权重”和“基础设施便宜”从来不是一回事。
对大多数团队来说,真正合理的顺序没有那么戏剧化:先用 K3 API 跑自己的任务,再短租一套互联完整的多卡环境做 PoC,测出持续利用率,最后才向供应商要采购方案。走到那一步时,卡数和预算来自你的业务,而不是别人的标题。
这些数字是怎么核对的
模型架构、权重、量化、推荐引擎和发布状态来自月之暗面 Kimi K3 官方仓库、官方 Hugging Face 仓库和技术报告。约 1.5609TB 检查点和 8×MI355X 验证结果来自 AMD 部署报告。16–32 卡 GB200/GB300 拓扑来自 NVIDIA Dynamo 文档。64 张以上的情景由 Tom's Hardware转述;我们没有找到月之暗面把 240 万美元列为官方部署价格的原始表述。租赁价与 30 天低点来自 ComputeUnion 观测,会随市场变化。除明确标注的厂商验证方案外,卡数下限和试运行范围都属于规划估算。
常见问题
Kimi K3 部署真的要 240 万美元吗?
不是统一最低门槛。这个数字可以对应采购并集成 64 卡生产系统,但 AMD 已验证 8×MI355X 的功能性 Day‑0 部署,NVIDIA 也给出了 16–32 卡生产配方。
Kimi K3 能用一张 H100 或消费级显卡运行吗?
不能作为实用的全 GPU 部署。已发布检查点约 1.56TB,远高于单张 80GB H100 或 24GB、48GB 消费级显卡。极慢的 CPU/内存卸载实验不等于生产服务。
Kimi K3 有 96 个权重分片,是不是要 96 张 GPU?
不是。96 是 safetensor 文件数量;真实卡数由检查点大小、单卡 HBM、运行时放置、上下文、并发和互联决定。
Kimi K3 权重现在可以下载了吗?
可以。月之暗面已按自定义 Kimi K3 License 发布完整权重,并推荐 vLLM、SGLang 和 TokenSpeed 推理路径。
为什么要看 GPU 租赁价格历史?
某一个小时的最低价可能很短暂。ComputeUnion 的每日价格曲线可以帮助判断目标 GPU 是否持续有库存,以及市场低价如何变化。
现在应该用 API 还是自部署 Kimi K3?
立即评估和波动用量优先用 API;先短租接近已验证的拓扑做 PoC,只有持续利用率能覆盖整套系统成本时再考虑采购。