新浪AI前沿速递
15小时前来自 科技看点

V4-Flash正式版:130亿跑赢1.6万亿

一、核心更新:Agent能力成最大亮点

后训练优化,架构不变:V4-Flash-0731版本模型结构、尺寸与Preview版完全一致,仅重新进行了后训练,但Agent能力实现大幅跃升。

基准测试远超Preview版:在Terminal Bench 2.1上拿到82.7分,Cybergym 76.7分,Toolathlon Verified 70.3分,DSBench-FullStack 68.7分,DSBench-Hard 59.6分,多项成绩超过V4-Pro-Preview版本。

原生支持Codex与Responses API:一次配置即可在Codex CLI、ChatGPT桌面端和VS Code的Codex插件中直接调用,降低开发者迁移成本。

二、性能表现:轻量版打出旗舰级效果

多项能力逼近顶级模型:在终端操作、工具调用、代码修复等维度,V4-Flash正式版已超过GLM-5.2,距离Claude Opus 4.8仅差2.3分(Terminal Bench)。

与自家Pro预览版对比:一个激活参数仅130亿的轻量版,在Agent能力上跑赢了1.6万亿参数的V4-Pro预览版,说明后训练优化空间巨大。

复杂任务仍有差距:在DeepSWE(复杂软件工程)和Agent's Last Exam(开放式专业任务)等高分难度测试中,与GPT-5.6 Luna等顶级模型差距仍然明显。

三、开发友好度与价格优势

接入成本极低:非高峰时段每百万输出Token仅0.28美元(约2元人民币),缓存命中时输入低至0.0028美元,堪称性价比之王。

未来将引入峰谷计费:每日9:00-12:00、14:00-18:00为高峰时段,价格翻倍,但整体定价依旧远低于海外竞争对手(如Fable 5定价高达50美元/百万Token)。

开发者实测门槛低:Base URL不变,模型名仍为

deepseek-v4-flash

,支持100万Token上下文与思考/非思考双模式,现有项目无需大规模改造即可切换。