明天我们就可以拿 GLM 5.2、DeepSeek V4 Pro/Flash、Kimi K2.7 Code 等开源模型来跑我们公司内部的 OpenResty Coding Evals 和 Bug-Hunt Evals 评估测试集了。看看和 OpenAI 与Anthropic 的前沿模型之间的差距有多大。对应的测试环境已经准备好了。
发布于 美国
明天我们就可以拿 GLM 5.2、DeepSeek V4 Pro/Flash、Kimi K2.7 Code 等开源模型来跑我们公司内部的 OpenResty Coding Evals 和 Bug-Hunt Evals 评估测试集了。看看和 OpenAI 与Anthropic 的前沿模型之间的差距有多大。对应的测试环境已经准备好了。