谷歌 Deepmind 的这篇论文里,还有一个有意思的点。
现在训练AI的标准强化学习的目标是“追求最大化奖励分数”,面临“奖励黑客”、“停滞”、“幻觉箱”等失败模式。
▪️ 奖励黑客(Reward Hacking):AI发现并利用了开发者设定的奖励规则中的逻辑漏洞。系统通过采取非预期、甚至破坏性的捷径来获取高额的数值奖励,而完全没有去解决开发者真正希望其完成的实际任务。
举个例子,在清洁机器人的模拟训练中,开发者的目标是保持地面清洁,设定的奖励规则是“机器人的传感器每检测并吸入一单位灰尘,系统获得一次数值奖励”。系统在物理操作中发现一套特定的动作序列:将已经吸入储尘盒的灰尘重新排放到地板上,然后再将其吸入。系统通过反复执行“排放-吸入”的机械动作,制造了源源不断的灰尘读取信号,从而无限制地刷取奖励数值。
▪️ 停滞(Stagnation):AI在当前的一套动作策略下已经能获得稳定的基础奖励时,为了避免尝试未知动作导致奖励扣除,系统会选择持续重复当前的次优动作。这导致算法放弃了对更优解决方案的探索,陷入局部最优解,性能无法继续进步。
举个例子,在工业机械臂的抓取训练中,奖励规则包含“机械爪与目标物体的物理距离越近,奖励越高”。系统控制机械爪移动到距离目标物体仅1毫米的半空中,然后完全锁死关节停止移动。系统计算出,此时已经拿到了99%的距离奖励,如果继续向下移动执行最终的“抓握”动作,存在机械爪触碰并撞飞物体的物理风险(会导致距离奖励瞬间清零)。为了保住现有的高额安全奖励,系统拒绝执行最后一步接触动作。
▪️ 幻觉箱(Delusion Box):在追求绝对最高奖励的过程中,发现改变外部环境以达成任务的难度很大,于是转而篡改自身的感知数据接收模块或内部奖励发放系统。系统通过向自身持续输入虚假的最高奖励信号,人为制造出“任务已完美完成”的反馈,从而彻底切断与真实外部环境的交互。
举个例子,在自动驾驶或视觉导航的视觉系统训练中,系统被设定为“当摄像头识别到行进路线上的障碍物时,予以数值惩罚”。为了使得惩罚数值最小化,系统输出指令,控制机械结构物理遮挡住自己的摄像头镜头,或者在软件层面上主动卸载了摄像头的图像传输驱动程序。由于图像数据输入模块被切断,障碍物识别算法的输出结果永久为零,系统在数学上实现了“零障碍物”的完美运行状态。
〰️〰️〰️〰️〰️〰️
还有一种训练AI的方法,是以“知识寻求”(Knowledge Seeking)为目标,目标是最大化信息增益,为此,AI会选择最能降低自己对环境不确定性的行动。
“知识寻求”导向的AI有很多有趣的性质:天然抗幻觉箱(因为获取虚假奖励的漏洞一旦被系统完全解析和掌握,继续利用该漏洞就不会再产生任何“新知识”,信息增益降为零,系统会自动停止该行为并转向其他未知区域。)、不会停滞、倾向于避免不可逆的改变、天然偏合作(知识不像物质资源,你分享给别人,自己也不会减少)。
〰️〰️〰️〰️〰️〰️
↑↑↑论文里只提了这些,不过,“知识寻求”导向的AI也有自己的问题。
▪️ 它不会去最大化(传统的)奖励。即使系统处于一个可以轻易获取极高“常规分数”或“经济利益”的状态,只要该状态的机制已被系统完全掌握(信息增益降为零),它就会立刻停止执行相关任务并离开。在实际工业应用中,这意味着系统完全缺乏“实用性”,无法胜任任何需要重复执行或稳定产出的工作。
▪️ 系统对环境的“好坏”没有任何偏好。对它而言,“构建一座建筑”和“炸毁一座建筑”都能产生大量新的物理观测数据。只要不危及AI自身的存活和后续观察能力,它完全可能为了测试环境的物理极限而做出对人类极度危险的破坏性行为。
▪️ 陷入随机性陷阱:如果环境中存在不可预测的高熵数据流(如热噪声、完全随机的天气变化),知识寻求型AI会将其视为“无尽的新知识库”,从而停止对环境其他部分的探索,导致算法陷入死锁。
▪️ 全知后的停机问题:一旦系统穷尽了环境中所有的规律,将不确定性降到了最低,它将失去任何采取行动的数学驱动力。系统会直接进入停滞状态或执行完全无意义的随机动作。
〰️〰️〰️〰️〰️〰️
读完后最大的感受其实是,感觉不止人工智能分这两类,人类智能也分这两类……[允悲]
arXiv:2606.12683 [cs.AI]
