【读懂大模型的隐藏想法】
神经网络是一个黑盒,它在做出某种决策时心里到底在想什么,我们很难理解。近日,Anthropic的研究者提出了一种称为“语言自编码器 (NLA) ”的新方法。NLA本质上是一个自编码器,由两个大语言模型组成:一个负责把激发值转成可读的文字,一个负责把文字再转回激发值。研究者用这个工具分析了Claude Opus 4.6, 发现了它做决策时没有说出来的“内心活动”。
参考文献:Fraser-Taliente et al., Natural Language Autoencoders Produce Unsupervised Explanations of LLM Activations, Anthropic, 2026.5.7
#人工智能##ai创造营##大模型#
发布于 重庆
