新浪AI前沿速递
2026-08-07 14:18来自 科技看点

DeepSeek V4-Flash的API定价为什么能低至1元?

  DeepSeek V4-Flash把API输入价格压到1元/百万Token,靠的不是亏本补贴,而是用“只激活13亿参数干活”的稀疏架构外加98%缓存命中折扣,把单位Token的算力成本砍到了业界最低水平。

  一、稀疏激活的“瘦身”底牌:只调13亿参数,扛下284亿参数的活

  MoE架构的本质:V4-Flash总参数量高达2840亿,但采用的是混合专家模型(MoE)架构,每次推理仅激活约130亿参数。这相当于一个“瘦身战士”——只派出必要员工,不需要把全员拉出来,大幅降低单次计算的算力消耗与显存占用。

  降低隐性成本:更少的激活参数意味着单位Token占用的计算资源大幅下降。DeepSeek-V4系列在100万Token极端场景下,V4-Pro处理单Token的计算量仅为上一代V3.2的27%,KVCache占用更是暴降至10%。同样的服务器,以前只能处理100个长文本请求,现在可以处理三四百个,固定成本被均摊得更薄。

  后训练挖潜:V4-Flash架构没变、参数没变,仅靠重新做后训练,就将Agent编程得分等性能指标提升了数倍,证明堆参数不是唯一路径,训练方法本身就在压降成本。

  

  

  二、缓存命中率的“价格杠杆”:98%折扣把调用价格打下来

  近乎全额的缓存折扣:DeepSeek在第一方API上提供了约98%的缓存命中折扣,远高于行业主流的90%折扣。这意味着大量高频、重复的请求(如通用知识问答、常见代码补全等),可以通过缓存的Token直接返回,几乎不再消耗算力推理资源。

  定价结构:缓存命中的输入价格仅0.02元/百万Token,而缓存未命中为1元/百万Token,输出价格为2元/百万Token。对开发者来说,只要合理设计缓存策略,实际使用成本能比标价再压低一大截。有开发者实测,完成一次复杂任务消耗51万Token,总花费仅为0.53元。

  峰谷定价削峰填谷:DeepSeek还引入了高峰时段(工作日9:00-12:00、14:00-18:00)价格翻倍、其他时段维持低价的峰谷定价机制,利用价格杠杆引导用户错峰调用,避免在高负载时间段挤占稀缺算力,从而提升集群整体利用效率。

  三、规模效应与工程压榨:用极致并发摊薄固定成本

  规模驱动的正向飞轮:V4-Flash上线后迅速登顶OpenRouter全球调用量榜首,单日处理高达8万亿Token。如此高的并发量,使得服务商可以针对性地堆叠大规模推理集群并跑满Batch Size,通过极高的并发量将单次推理的固定成本(如电力、GPU折旧)摊至极低水平。

  从“堆算力”转向“改成本结构”:全球知名AI基准测试机构Artificial Analysis的评估显示,V4-Flash完成一项基准任务的平均成本仅约0.03美元,而Claude Fable 5约为3.15美元,成本差距超过百倍。DeepSeek并非简单地亏本甩卖,而是利用Engram等内存优化技术,把静态知识放进CPU内存,将昂贵的HBM显存腾出来给计算用,从硬件调度层面重构了成本模型。