我看小部分人又找了一个看衰算力的理由,说kimi k3 最低只需要8张b300就能部署模型了,不需要更多的算力,这是一个完全错误的观点:
Kimi K3虽然每个Token只激活约104B参数,但完整模型仍有2.8T参数。官方权重采用原生MXFP4格式,Hugging Face仓库体积约 1.56TB。
一台8卡B300服务器的显存是:
288GB × 8 = 2304GB,也就是约2.3TB
装入1.56TB权重后,理论上还剩约744GB,用于推理框架、激活值、KDA状态、KV Cache、视觉编码器和通信缓冲区。NVIDIA官方也确认HGX/DGX B300八卡系统总显存约2.3TB;AMD MI350X同样是单卡288GB。
Kimi K3有896个专家,每个Token选择16个专家,但不同Token选择的专家可能不同。104B决定的是每一步实际参与计算的参数量,而不是整个模型需要驻留的权重量。
通俗的说,当只有一个或者几个用户请求时,8卡是够用的,因为每个token只激活了16个专家。但如果面对的是一群用户的请求,承载能力,要看总Token吞吐量,依旧必须使用大规模集群来满足庞大的请求,这一点自始自终就没有变过。
客观事实不因资本市场的波动而改变。
发布于 中国香港
