6月22日Claude全家桶集体宕机,只是冰山一角。AISHPerf智算运维智能体评测基准给出残酷答案:主流大模型全军覆没,无一过50分。这道鸿沟,第一次被量化。
当AI从聊天玩具变成驱动千亿美金算力的「生产设备」,基础设施的稳定性已成产业生死存亡的隐形天花板。
由信通院推出、无问芯穹参与建设的AISHPerf基准,把Claude-4-sonnet等国内外主流模型扔进真实GPU集群处理生产级故障。结果综合得分全部低于50分,中等和困难任务正确率普遍不到一半。
想象凌晨三点,训练任务突现无规律性能波动,可网络、存储、硬件却全部正常。这类「幽灵故障」隐蔽、跨层栈、难复现,排查周期常长达十天半月,期间海量算力白白空转。
摩根士丹利预测,2028年全球AI基础设施累计投资将达2.9万亿美元,其中运维与闲置成本占比高达15%-20%,可优化空间超4350亿美元。
无问芯穹早在2025年10月就探索运维智能体,生产数据显示:工单处理时长缩短50%,关键故障效率提升约6倍,综合运维成本下降约30%。
http://t.cn/AXSe0lF4
与以往的「语言知识竞赛」不同,AISHPerf源自近百亿条真实运维数据,且不给根因,只告诉AI「任务卡死了,请复现并修复」。
智能体必须自主进集群、找线索、提假设、验证修复,全程还不能把机房搞炸。它考的是长链路推理、与物理设备交互,以及最关键的安全边界意识。
配套的AIops-Chaos混沌工程可软件层模拟GPU掉卡、NVLink故障、网络分区等异常,一台服务器即可实现分钟级故障编排。
测试结果令人震撼:所有模型总分低于50分,旗舰模型在中高难度任务正确率也普遍低于50%。一旦涉及硬件故障,正确率偏低而Token消耗反而更高。
失败模式有三:生成不符合调用规则的Token、推理治标不治本、执行高风险操作导致环境崩溃。这不是不够聪明,而是还没学会在物理世界负责任地行动。
一个更深的洞察是:当前大模型与人类运维专家的技能高度正交。模型擅长广度检索与假设生成,人类则在硬件直觉与安全决策上占优。
未来最优解或许不是替代,而是「模型快速探索+人类深度把关」的混合范式。该基准还覆盖天数、壁仞、沐曦、摩尔、昇腾五种国产芯片,填补国产智算运维评测空白。
凌晨三点,机房依旧亮着灯。只是终有一天,守夜的不再只有人类。
