经过较长时间的努力,终于把一些已公开权重的开源模型跑我司内部的 OpenResty Coding Evals 测试集的结果搞出来了。中间修了 opencode、pi、claude code 调开源模型的很多坑,确保这些 Agent harness 不会让开源模型降智。
GLM 5.2 确实还是挺厉害的,接近 Claude Sonnet 5 的水平了,但和 Claude Opus 4.8 之类的还有一些明显的差距。注意因为 LLM 本身存在随机性,所以分数上相差 1% 以内还是在正常的偏差范围内。
第一张图是质量分数,第二张图是 Agent 完成每一项任务的总延时的平均时间。Google 和 xAI 的模型确实还是最快的,虽然质量跑分较低……
我还在等 Kimi K3、Qwen 3.8 Max 和 DeepSeek V4 正式版公开所有模型权重。等公开了我们就方便跟进评测了。
后面几天抽空我再跑一下我司的另一个更难的 OpenResty Bug-Hunt Evals 测试集。敬请期待!
发布于 美国
