实测了一下 GPT-5.6 Sol Max。和之前一样,用同样的提示词生成一个基于 three.js 3D 飞行避障游戏。我的感受是,比其他所有模型,包括 Claude Fable 5(http://t.cn/AXavNy49) 都要出色的多。
飞机建模细节极为细腻,加速时尾灯会自动亮起,转向时机身会倾斜、场景跟着平移,障碍物上的光影是流动的,碰撞时飞机有闪烁效果,结束时有飞机坠落的动画,场景也会跟着旋转。这些全没写在 prompt 里,模型自己补的。桌面和手机操作都极为顺滑。跟 Claude Fable 5 同 prompt 对比,建模、光影、交互细节差距明显。
但有意思的是,这个结果跟公开榜单的排名是反的。
SWE-Bench Pro 上,GPT-5.6 Sol 拿 64.6%,Claude Fable 5 是 80%,差了 16 分。单看这个数,GPT 输得挺难看。换到 Artificial Analysis Coding Agent Index,Sol 反超到 80,Fable 5 是 77.2。两个榜,成绩完全不同。
OpenAI 自己的博客花了大篇幅讲 "设计判断力" 和 computer use,还自己做了个 3D 帆船游戏 Saltwind 当 demo。本质上是在说:模型不光写代码,还能验证渲染结果、自己修视觉和交互的细节。我实测里看到的那些自选动作,应该就是这种能力的体现。
补充几组数据供大家参考:FrontierMath Tier 4,Sol 83%,Fable 5 是 87.8%,高难推理 Claude 仍然领先。GPQA Diamond 两边打平,94.6%。Terminal-Bench 2.1 Sol 88.8%,Ultra 模式 91.9%。BrowseComp Sol 90.4%,Ultra 92.2%,都是目前最高。
这次,OpenAI 的说法是用更少 token 和时间达到相近或更好的结果,从 Coding Agent Index 的数据看确实省。
从这次简单的测试以及我的个人感受来说,GPT-5.6 Sol 对于工程落地和前端生成,有着明显优势。纯推理以及数学难题方面,Claude 依然是王者。在视觉交互类的任务中,榜单排名和实际产出确实有很大的差异。
霓虹地平线试玩:modeltest.caprompt.com
#ChatGPT5.6##AI模型评测##AI创造营# http://t.cn/AXK74zfl
发布于 上海
