宝玉xp
26-07-07 14:46 微博认证:前微软Asp.Net最有价值专家 2025微博年度新知博主 科技博主

Anthropic 最近发布的研究:语言模型中的“内心工作室”。

一直以来,我们都怀疑大语言模型能够在暗中进行“内部推理 (internal reasoning)”。但由于缺乏好用的探索方法,这方面对我们来说几乎是个完全未知的黑盒。

Anthropic 声称,他们在模型中发现了一个名为 J-Space 的机制。请注意,它不同于我们熟知的思维链 (chain-of-thought) 或暂存区 (scratchpad) (注解:思维链和暂存区通常是模型在输出文字前“打草稿”的方式,是肉眼可见的文本输出,而 J-Space 是完全在模型大脑内部发生的隐式计算过程)。J-Space 并不是人类硬编码植入的,而是在训练过程中自己“顿悟”出来的(即自然涌现)。它的发现,就像是在 Claude 的大脑上开了一扇窗,让我们终于能窥探它在内部是如何进行“思考”和“推理”的。

换个更形象的说法,这证明了 Claude 拥有一个属于自己的“内心工作室”。在这个空间里,各种信息被暂存起来,相互碰撞组合,并在模型的各个“神经中枢”之间来回传递。更绝的是,研究人员不仅能从中“读取”信息,还能通过直接篡改里面的内容,像转动方向盘一样去引导和控制模型的行为!

按照以往的剧本,一出这种研究,媒体肯定会立刻把焦点放在“AI 是不是觉醒了意识”这种博眼球的话题上。然而,重点其实是:这是人类历史上第一次,能够精准地指着模型大脑里的某个特定区域说:“看,推理就是在这里发生的!”在此之前,我们只能像算命一样,试图从模型吐出来的文字去反推它到底是怎么想的。

毫无疑问,这一发现彻底颠覆了我们对模型“可解释性 (interpretability)”的认知 (注解:可解释性是指人类理解和解释 AI 模型内部运作逻辑的能力,旨在打开 AI 的“黑盒”)。过去好几年,我们都在通过“听其言”来猜测模型在“做什么”。而现在,我们不仅有了一台能直接观察它的“透视镜”,还找到了一个能直接干预它的“操控杆”。这有望激发大语言模型展现出更加高级的“推理”能力,并且极大地填补了前沿智能与构建世界模型 (world models) 之间的鸿沟。

想象一下它的威力:如果你能亲眼看到一个模型把它的“真实意图”藏在什么地方,你就能对它进行全方位的验证和审查。你甚至能在它偷偷摸摸谋划那些你根本没下达的任务时,当场抓个现行!这意味着我们可以为 AI 设置更加牢靠的安全护栏 (guardrails),并比以往任何时候都能更好地预测和防范潜在的危险或失控场景。

相关文章:http://t.cn/AXo8vsuy
相关推文:http://t.cn/AXoRvWhI http://t.cn/AXoRvgSD

发布于 美国