
DeepSeek V4 Flash什么水平?逼近GPT-5.6还便宜60%
DeepSeek V4 Flash正式版刚刚上线,就凭借“输入1元、输出2元”的百万Token定价,硬生生把Agent能力跑分干到了接近GPT-5.6 Luna的水平,在AI圈彻底炸开了锅。
一、性能跃进:纯后训练“榨干”轻量模型天花板
DeepSeek V4 Flash正式版最大的技术看点在于,它没有改动底层架构和参数规模,仅靠一轮深度的后训练(Post-Training)就把Agent能力拉满。官方列出的九项Agent测试,它已全部超过自家的V4 Pro预览版。在权威基准平台Artificial Analysis的智能指数(AII)中,V4 Flash 0731版本获得了50分,仅比OpenAI的GPT-5.6 Luna低1分。前端代码竞技场(Frontend Code Arena)中,它以1586分的成绩冲进开放类别全球第三。几个关键跑分提升尤为明显:Terminal Bench 2.1从61.8飙升至82.7,DeepSWE从7.3暴涨至54.4,DSBench-FullStack从37.0跃升至68.7。

二、价格屠夫:成本仅为头部模型的几十分之一
性能逼近顶级,价格却直接击穿地板。V4 Flash的API定价为:输入1元/百万Token,输出2元/百万Token,缓存命中时更是低至0.02元。对比海外巨头,即使OpenAI已将GPT-5.6 Luna降价80%,V4 Flash的单任务成本仍比Luna低约60%。与自家大哥对比,输出价仅为V4 Pro的约1/12。有开发者实测,执行一次包含本地文件阅读和全网检索的汇总任务,消耗51万Token,费用仅0.53元。这种定价让开发者从“精打细算”变成了“随便用”。
三、技术底座:MoE稀疏架构与极致优化的合力
支撑如此极致性价比的,是 DeepSeek 在架构和工程上的双重创新。V4 Flash采用混合专家模型(MoE)架构,总参数2840亿,但每次推理仅激活130亿参数,大幅降低了单次推理的算力消耗。配合自研的DSA稀疏注意力机制,在百万Token长上下文场景下,推理计算量仅为前代V3.2的10%左右,KV缓存占用降至7%。同时,近98%的缓存命中折扣进一步将高频调用成本压缩到极致。此外,原生支持Responses API并针对性适配Codex工具,开发者的接入成本几乎为零。
