OpenAI 发布了 GPT-5.5 和 GPT-5.5 Pro.
怎么说呢……5.5说震撼吧不至于,底层的工程优化很赞,死死钉在了 Agent 执行力上。
核心指标:
1. 跑分.
SWE-bench 干到 52.1%, 上一代 48.0%. HumanEval 92.4%. GPQA 和 MMLU 全面压过 GPT-5.4.
2. 跨软件调度.
原生设计去 Debug 环境, 跨软件操作并自我检查. 单 Token 延迟持平, 但完成相同 Codex 任务消耗的 Token 明显变少.
3. 分发.
GPT-5.5 向 Plus, Pro 及商业端全量推送. GPT-5.5 Pro 仅限 Pro 及企业版可用.
站在一线开发者的角度,这波更新的逻辑太对了。全栈推理效率的提升和跨软件权限的下放,解决了咱们跑长线 Agent 任务最头疼的资源消耗问题。不过也说明它可能闲聊能力、陪伴能力一定又是会下降的。
博客: http://t.cn/AXxNgoid
发布于 四川
