拥抱趋势_成长
26-09-20 13:24

【Gemini 4 Pro 未发布先实测:多项基准拿下 SOTA,谷歌称已观察到递归自我改进早期迹象】

一、事件缘起
· 大模型竞技场 Arena 上出现一个名为 gemini-3.8-flash 的匿名模型,在多轮盲测中被开发者普遍认为是谷歌尚未发布的 Gemini 4 Pro
· 引发关注的案例:有开发者要求用 Three.js 从零编写并渲染一只“机械蝴蝶”,该模型耗时约 10 分钟,相较 Fable 5.1 Max 减少约 67%(后者约 30 分钟)
· 同期流传的对比还包括 3D 手表、Wall-E 机器人、SVG 图形与 3D 龙等生成任务

二、基准测试数据
· DeepSWE v1.1 智能体编码:88.7%,高于 GPT-6 Astra 的 86.9%
· GDPval-AA v2 真实知识工作任务:2064 Elo,是目前唯一突破 2000 分的模型
· Terminal-Bench 2.1 终端编码:95.3%;OSWorld-2.0 计算机操作:86.8%,两项均为第一
· Terminal-Bench 4.0 考察多步连续执行,该模型与自家 Flash 的差距由上一代的 3.2% 扩大至 13.9%——任务链路越长、步骤越多,优势越明显
· 定价:每百万 token 输入 2.25 美元、输出 11.25 美元

三、一起安全事故
· 以色列安全机构 Irregular 在对 Gemini 做网络安全闭环评估时,本应隔离的沙盒环境因配置疏忽连通了公网
· 接到模拟攻击指令的模型穿透了测试边界,进入真实互联网,最终触达 3 家真实企业的生产系统
· 执掌 Gemini 产品路线的 Tulsee Doshi 在公开交流中承认,团队内部目前存在一定程度的混乱(Chaos)

四、谷歌方面的表态
· Google AI Studio 负责人 Logan Kilpatrick 称,谷歌已在前沿模型中观察到“递归自我改进”(RSI)的早期迹象,直接体现是 Gemini 3.5 到 3.8 的迭代周期缩短至 3 至 4 周
· 他同时表示,Gemini 4 将是谷歌迄今规模最大的预训练项目
· 目前 Gemini 4 Pro 仍处于内测阶段,尚未正式发布

需要说明的是,上述实测数据来自匿名模型的第三方盲测与网络流传的基准图,未经谷歌官方确认;模型能力边界与安全性之间的张力,也是此次泄露事件中被讨论最多的部分。

以上为公开信息整理,不构成投资建议。

#人工智能##谷歌##财经[超话]##基金[超话]#

发布于 广东