代码演进窗
8-1 15:08来自 科技看点

DeepSeek V3和V4 Flash的推理速度差距有多大?

DeepSeek V4 Flash正式版刚刚发布,推理速度相比V3实现了飞跃式提升,在保持低成本和轻量化架构的同时,核心响应速度提升约一倍,同时Agent任务执行能力大幅超越V4 Pro预览版。

一、架构差异:V4 Flash的轻量化与效率革命

参数量级对比:DeepSeek V3采用传统MoE架构,总参数约1.6万亿、激活参数约370亿;而V4 Flash总参数仅为2840亿、激活参数仅130亿,激活参数不到V3的一半,这意味着每次推理需要计算的神经元数量大幅减少

注意力机制升级:V4 Flash采用了全新的分层注意力压缩机制,结合稀疏注意力(CSA与HCA),大幅降低了长文本场景的计算和内存开销,支持原生100万token上下文,而V3仅支持约128K上下文

推理效率提升:在相同硬件条件下,V4 Flash的推理延迟低至约10ms(TPOT),单卡Decode吞吐可达2000+ TPS,相比V3的15-20ms/Token,速度提升约50%~100%

二、实测性能:V4 Flash速度与能力的双重跨越

Agent能力爆发:V4 Flash正式版在Terminal Bench 2.1上拿下82.7分,DeepSWE从预览版的7.3暴涨至54.4,在工具调用、代码生成等复杂任务中,单次响应速度比V3快2-3倍

成本与速度双赢:V4 Flash API输出价格仅为每百万Token 0.28美元(约2元人民币),输入价格在缓存命中时低至每百万Token 0.003元,远低于V3的3-6元/百万Token;更低的成本使得开发者可以更大胆地调用模型,变相缩短了任务整体完成时间

实际体验反馈:开发者实测显示,V4 Flash在复杂编程辅助任务中,指令遵循能力和执行效率显著优于V3,单次任务耗时平均减少30%-50%

三、价格与效率的综合权衡:V4 Flash的性价比优势

定价策略对比:V4 Flash在高峰时段(9:00-12:00、14:00-18:00)输出价格仅为V3的1/3,非高峰时段更是低至2元/百万Token,而V3巅峰时期定价在6-12元/百万Token

生态兼容性优势:V4 Flash原生支持Responses API和Codex适配,开发者无需额外配置即可完成迁移,接入成本几乎为零;V3则需额外开发适配层

行业影响:V4 Flash的推理速度与成本双优策略,使得它能平替V3及部分闭源模型,将大模型的调用门槛从“低频高成本”推向“高频可负担”