AIGCLINK
26-04-24 08:43 微博认证:AI博主

OpenAI深夜炸弹放出了:GPT-5.5,超Claude Opus 4.7

GPT-5.5被定义为面向实际工作的新一代智能,强调的是agentic,注重真实工作场景中的自主执行能力

也就是说从理解复杂目标、自主规划、使用工具、检查工作、处理模糊性,并将任务推进至完成

在自己最强的领域Terminal-Bench、GDPval、特定长上下文检索任务上领先,在智能体式自主执行这个范式上建立了明显优势

编程能力,在Terminal-Bench 2.0达到SOTA,领先GPT-5.4近8个百分点,领先Claude Opus 4.7 13个百分点

在多样化知识工作上优势突出,在GDPval上领先;计算机操作能力OSWorld-Verified上超5.4、Claude Opus 4.7

科学研究方面,GeneBench 25%(GPT-5.4 19%),GPT-5.5 Pro为33.2%;内部定制的GPT-5.5协助发现了关于Ramsey数的新证明,在Lean中完成验证

与GPT-5.4速度相同,完成相同Codex任务使用token更少

OpenAI这次重点强调agentic执行能力,在benchmark领先的同时比谁能把活干完

过去你问一个问题,AI给一个答案,你来判断对不对用不用,现在你丢一个脏乱多步骤任务,它自己规划、调工具、检查、纠错、一直干到完

Codex,400K上下文,支持Fast模式

向Plus、Pro、Business和Enterprise开放,Pro、Business、Enterprise用户能用GPT-5.5 Pro

博客:http://t.cn/AXxNgoid

#GPT-5.5##openai新模型##最新大模型# http://t.cn/AXx0cROS

发布于 山西