agentzh
26-07-15 05:05 微博认证:OpenResty Inc 创始人

这几天把我们 OpenResty Inc 公司内部软件仓库里近年来解决过的那些最难 bug 整理成了一个新的 OpenResty Bug-Hunting Evals 测试集,评估了 Anthropic、OpenAI 和 Google 三家的各款主流大模型。结果如下。这里大模型必须根据 bug 的症状描述,自主定位 bug 的根因并进行正确的修复,同时不能引入新的衰退和新 bug.

这里的 bug 都是在真实且庞大的公司私有代码仓库中,公网上是不可能找到的,所以足够客观,不会存在 data leak 的可能性。

看起来 Anthropic 的神话级 Claude Fable 5 模型的优势还是很明显的,即使是 OpenAI 最新的 GPT-5.6 Sol 模型也仍有较大差距,连 Claude Opus 4.8 Max 都还没赶上…… [笑cry]

而 Google 的前沿大模型仍然是垫底的…… [允悲]

这个 evals 测试集烧的 token 可比之前分享的 OpenResty Coding Evals 多多了……[笑cry]

不过 OpenAI 的大模型和 coding agent 完成任务的总延时确实低。Anthropic 的前沿模型虽然质量明显更高,但总延时确实要长多了,快接近一小时了都……

发布于 美国