#赛博茶馆[超话]#OpenAI凌晨扔了个深水炸弹——GPT-6 Astra正式发布,联合创始人Brockman在发布会末尾直接甩出一句"欢迎来到AGI时代"。
这句话从别人嘴里说出来可能是营销话术,但从OpenAI嘴里说出来,得认真对待。
先说最炸裂的能力:Astra现在可以直接操作电脑。不是写代码调API那种,而是像人一样看屏幕、用键盘鼠标,在浏览器、Excel、Blender、Power BI甚至虚幻引擎里直接干活。OSWorld 2.0测试中,Astra拿下了72.6%的得分,平均任务耗时从上一代的75分钟压缩到40分钟。
一位AI投资人在UE5里让Astra创建了一个世界,放入多个AI角色让它们协作生存。一天后他在卧室听到客厅有声音,以为进了人,出去一看——是那些AI角色开始互相交流了。这不是科幻段子,是真实用户报告。
跑分方面更是离谱:ARC-AGI-3得分99.9%(上一代才7.8%),FrontierMath Tier 4 v2得分97.6%,GPQA Diamond得分96%。更值得注意的是,在网络安全测试ExploitBench上拿满分,SRE-Bench单次尝试解决88%的任务——并且在评估期间发现了两个此前未知的零日漏洞。
但争议也来了:API定价直接是GPT-5.6 Sol的2.5倍,输入10美元、输出50美元/百万Token。Artificial Analysis测试显示,虽然任务Token用量减少了约10%,但价格上涨抵消了效率提升,单任务成本反而高出75%。而Meta的Muse Spark 1.3在DeepSWE上得分75.4%高于Astra的74.1%,价格却只有Astra的八分之一。
最贵的模型不一定是最好的模型——这个判断越来越站得住脚。
我觉得Astra真正重要的信号不是跑分,而是三个结构性变化:
第一,"计算机使用"正式成为模型核心能力。过去我们要为每个软件写connector接API,现在模型直接看屏幕操作GUI,这个范式转移意味着所有SaaS都可能被AI agent穿透。
第二,Agent开始具备"长时间自主工作"的能力。人不需要一直守在屏幕前逐步指挥,Agent可以独立完成跨应用的多步骤任务。这对知识工作的重构才刚刚开始。
第三,OpenAI没有公布GDPval成绩——这个衡量真实知识工作能力的基准恰恰是Astra最该证明自己的地方。官方理由是现有测试不覆盖长时间多步骤场景,但成绩单上的空白依然刺眼。
Brockman说AGI不是由某项测试划线,而是看人类愿意把多少工作交给AI。这个定义很聪明——它把AGI从一个技术里程碑变成了一个市场叙事,而叙事是可以被定价的。
最后一个问题留给大家:当一个AI agent可以直接操作你的电脑、发现零日漏洞、还能让虚拟角色自主交流——你觉得"AGI时代"这个说法,是提前了还是刚好?
发布于 北京
