最近几天我发现并修复了 OpenCode 这款开源的 Coding Agent Harness 工具内部的很多 bug,涉及推理相关的 bug 会让 DeepSeek V4 等开源模型显著降智。这个 OpenCode 开源项目的代码质量确实不敢恭维,到处都是问题……好在现在终于改得比较靠谱了。
DeepSeek V4 Pro Preview 模型在我司内部的评测集上的测试分数大涨了近 20 分(满分 100 分)。其他开源模型的表现也有明显提升。幸好我们有仔细检查和校对 Agent 具体的运行过程和细节。
考虑到 OpenCode 有那么大的用户群体,我真为他们感到难过……原来大家一直用的都是显著降智的开源模型呀……[允悲]
发布于 美国
