爱可可-爱生活
26-07-05 05:28 微博认证:AI博主 2025微博新锐新知博主

[CL]《Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent》L Bai, Z Cao, Y Chen, Z Cui… [Shanghai Artificial Intelligence Laboratory] (2026)

在智能体领域,实现专家级长程推理通常依赖万亿级参数规模,导致研发门槛极高。过去的方法受困于模型体积的盲目扩张,本质原因是互联网语料缺乏“动作—观测—反馈”的闭环逻辑,导致模型难以学习复杂的决策链条与容错机制。

本文的核心洞见是:将智能体的演进路径从“堆参数”转向“拓长度”。通过构建知识-动作图谱(KAG)生成平均 4.5 万标记的长程轨迹,并利用多导师领域路由在线蒸馏技术,将六个异构领域的专家策略高保真地压缩进 35B 规模的模型中。

这项工作证明了通过强化决策深度而非模型宽度,中等规模模型可跨级挑战万亿参数模型的性能。它为低算力条件下构建高等级工具智能体提供了可行路径,但尚未跨过的门槛是在极端复杂的工程全流程中保持长期的目标一致性。

arxiv.org/abs/2606.30616 #机器学习# #人工智能# #论文# #AI创造营#

发布于 北京