艾瑞网
26-05-28 10:02 微博认证:聚合互联网数据资讯,融合互联网行业资源的国内新经济门户。

#AI基准测试##智能体##企业IT##IBM#
【行业动态:前沿模型在企业IT智能体任务中仍未过半】
Artificial Analysis和IBM推出的ITBench-AA SRE基准显示,当前前沿大模型在企业IT智能体任务上的表现仍有明显天花板,所有模型得分都低于50%。Claude Opus 4.7在自适应推理、最大努力设置下以47%领先,GPT-5.5 xhigh得分46%,Qwen3.7 Max为42%。测试包含59个任务,要求模型通过Shell命令调查Kubernetes事件快照,并提交根因诊断。一个有意思的发现是,更长的推理轨迹不一定带来更高准确率,过度调查还可能因为误报被惩罚。
这类基准比普通问答更接近企业真实场景:系统复杂、信息不完整、命令会产生副作用,最后还要给出可执行判断。结果提醒企业,智能体可以提高排障和运维效率,但短期内不能被当成完全自治的SRE替代品。更现实的落地路径,是让模型承担初筛、证据收集和候选诊断,再由人类或规则系统做最终确认。

发布于 北京