Anthropic对于AI安全边界的最新探索,让AI“向善”不局限于技术对齐
如果AI要影响大量人群,那它应该成为什么样的人?他们提出了一个新的研究方向:AI的道德形成
AI模型在大量人类文本上进行训练,从这些文本中它们习得了说话方式、推理模式和决策习惯,开发者随之通过训练进一步塑造这些特质
选择强化哪些模式、摒弃哪些模式,以及希望AI形成什么样的品格,这就引发了一个问题:AI的品格应如何塑造?它应当展现哪些特质和行为,以及在什么情境下展现?它的品格如何才能足够坚韧,在压力下不弯曲、不陷入谄媚等?
Anthropic从道德塑造入手,与宗教、哲学、人文主义传统中的思想者展开对话,让Claude平等深入汲取各种视角
在与神经科学和品格形成交叉领域学者的一次交流中,他们发现,人的道德成长往往需要一个外部良知,身边的一个提醒者能在你面临压力、可能违背自身价值观时拉你一把
于是他们给Claude加上了个实验工具,一个Claude可以在中途主动调用的伦理提醒工具,让AI在关键时刻主动停下来,对照自己的伦理承诺做自我检查,目前实验显示能有效减少跑偏行为
不过这个效果到底是来自提醒内容本身,还是来自暂停反思这个动作?未知,Anthropic也还在研究
博客:http://t.cn/AXiFlHbC
#AI##AI安全#
发布于 山西
