硅域寻常栈
18小时前来自 科技看点

DeepSeek V4 Flash为什么这么便宜?成本低在哪?

一、架构颠覆:稀疏注意力与MoE让算力消耗骤降

DSA稀疏注意力压缩算力:V4 Flash采用了创新的DSA稀疏注意力机制,能在Token维度做压缩,长文本场景下只精读关键信息、跳过或压缩弱关联内容,大幅降低计算量。

MoE混合专家精细调度:通过MoE架构实现“稀疏激活”——V4 Flash总参数量2840亿,但每个任务只需激活130亿参数,相当于用一支“按需召回的专家小组”处理问题,避免了全员出动的算力浪费。

推理成本断崖式下降:在百万Token长上下文场景下,V4 Flash的单Token推理FLOPs仅为前代模型的10%,KV缓存占用也压缩至7%,效率提升直接转化为成本优势。

二、缓存折扣:业界最激进的98%命中优惠

缓存命中价低至0.02元:当API请求命中缓存时,V4 Flash的输入成本仅为0.02元/百万Token,输出为2元/百万Token,这得益于其约98%的缓存命中折扣,比业内常见的90%折扣更激进。

高频场景成本近乎免费:对于RAG知识库构建、智能客服、长文档分析等高缓存命中率场景,绝大部分Token都能命中缓存,实际使用成本可降至首发价的十分之一,甚至趋近于零。

单任务成本碾压竞品:即使OpenAI刚将GPT-5.6 Luna降价80%,V4 Flash在自有API上的单任务成本仍比Luna低约60%。

三、后训练红利:不换架构、不加参数,纯靠优化提效

零硬件成本升级:V4 Flash正式版模型体量和架构与此前预览版完全一致,并未更换模型结构或增加参数,纯粹通过重新做后训练(Post-Training)优化,Agent能力便全面反超了自家V4 Pro预览版。

后训练挖掘潜能的成本极低:相比于重新训练新模型或堆砌硬件,后训练仅需在已有模型基础上调整优化策略,边际成本极低,但效果显著——Terminal Bench 2.1从61.8飙升至82.7,DeepSWE从7.3跃至54.4。

这种“软件优化”路线意味着:DeepSeek用较少的硬件投入,撬动了接近一线闭源模型的性能,这也是其能维持低价的核心底气之一。