新浪AI前沿速递
17小时前来自 科技看点

deepseek-v4和glm5.2哪个编程能力更强?

在2026年7月31日更新的DeepSeek V4 Flash正式版中,其Agent编程跑分(1559 Elo)已超越GLM-5.2(1510),但用户实测发现两者在复杂指令遵循和速度上各有强弱,并非简单线性胜负。

一、基准测试:V4-Flash跑分略高于GLM-5.2,但仍低于Kimi K3

权威跑分结果:根据Artificial Analysis在GDPval-AA v2评测中,DeepSeek V4 Flash 0731版取得1559 Elo评分,GLM-5.2 max为1510,Kimi K3 max为1687。V4-Flash的Agent能力正式超过GLM-5.2。

后训练优化是关键:V4-Flash模型架构与参数规模完全没有改变,仅通过重新做后训练(Post-Training)就实现了Agent能力大幅跃升,Terminal Bench 2.1从61.8提升至82.7,DeepSWE从7.3飙升至54.4。

第三方汇总评论:多个媒体与博主均指出,跑分排序明确显示V4-Flash处于GLM-5.2与Kimi K3之间,但并非全面超越,而是各有侧重。

二、实际体验:编程能力各有专长,速度与指令遵循分化明显

代码修复与终端操作:部分开发者反馈V4-Flash在后端能力上超越GLM-5.2,在常见代码修改任务中能完成但耗时更长;同一编程修改任务GLM-5.2修复更快。

指令遵循与复杂任务:有用户实测发现,V4-Flash在面对多步骤、文档驱动的编程任务时,容易出现忽略指令、跳过审核步骤等“偷懒”现象,而Kimi K3则表现得更稳定。但V4-Flash的性价比极高,适合高频日常任务。

结构化推理能力:GLM-5.2以其低延迟和结构化工作流见长,在工程落地稳定性和响应速度上表现突出,适合对时间敏感的场景。

三、极致性价比:价格优势让编程场景更易落地

API价格对比:DeepSeek V4 Flash输入1元/输出2元每百万Token,GLM-5.2约10元/32元,Kimi K3为20元/100元。V4-Flash仅为Kimi K3的上百分之一。

开发者选择逻辑:日常脚本编写、代码调试等高频任务用V4-Flash完全够用,省钱且速度快;大型重构、复杂前端等上限极高的任务才考虑Kimi K3或GLM-5.2。

智谱涨价背景:近期智谱大幅涨价,而DeepSeek保持低价,进一步拉开了性价比差距。