开源了,但你可能跑不动:部署 Kimi K3 真正要多少算力

发布时间:2026/8/6 23:21:08
开源了,但你可能跑不动:部署 Kimi K3 真正要多少算力 开头Kimi K3 权重已经公开2.8T MoE、104B 激活、原生 MXFP4官方还把 vLLM / SGLang recipe 摆出来了。但这不等于「下载就能私有化」。门槛不在软件而在聚合显存与互联规模——绝大多数团队会在机柜账单前停下来。核心分析第一层权重本身就约 1.56 TB。实测 checkpoint 约1560.9 GB96 个 safetensors不是坊间常说的「2.8T×4bit≈1.4TB」。MXFP4 有效比特约 4.25注意力、共享专家、LM Head、视觉塔等还没被压到 4bit。vLLM recipe 直接写明MXFP4 变体最低约1680 GB显存——这还只是「能加载」不含高并发 KV 与通信缓冲。第二层能加载 ≠ 能服务。单机 8×H200约 1128 GB装不下权重常见可行起步是路线大致配置定位Blackwell 单机8×B300 / GB300约 2.3 TBday-0 最省心Hopper 多机2×(8×H200)TP16存量 Hopper 的务实解存量 H100约 32×H1004 节点容量够但互联与运维更重AMD至少 8×MI355XROCm 官方路线Moonshot 明确建议64 卡及以上 supernode才更像生产吞吐形态。原因是 MoE 专家并行吃高带宽通信域卡少了能跑通 demo吞吐和稳定性会难看。1M context 在 KDA 下单序列 KV 并不夸张真正吃显存的是并发数 常驻 recurrent state。第三层对谁有用怎么落地。有合规/数据不出域硬约束、且日均 token 极大自建才谈得上 ROI且必须按「集群 推理平台 值班」立项不是买几张卡。研发试用、Agent 编排、长程编码走官方 API 更理性——缓存命中输入约 $0.30/MTok编码场景官方称命中率可很高。中小团队别被「开源」绑架更划算的是 API 本地小模型分流而不是硬上 2.8T。苍狮技术团队观点被高估的是「开源可私有化」低估的是运维与互联成本。短期价值API 立刻可用自建只适合已有多机 HBM 集群的组织。长期价值开源压低了「3T 级」能力的获取门槛但算力与调度仍是护城河。是否值得投入没有稳定高流量与集群能力不值得有则按「≥1.7TB 聚合显存起步、生产看 64 卡级」做预算而不是按消费卡幻想。总结Kimi K3 的真实门槛是约 1.56TB 权重 ≥1.68TB 聚合显存起步生产更接近 64 卡 supernode——开源降低的是权限不是机柜。