Claude的宪法AI训练如何减少幻觉?
一、宪法AI的两阶段训练:让模型学会“自我反思”
监督学习(SL)阶段:模型针对用户提示生成初始回答,另一个“评论家”模型依据预设的宪法原则(如诚实、无害、可验证)对该回答进行评估,并提出修改建议;原始模型基于修正后的回答进行微调,逐步内化这些原则。
强化学习(RL)阶段:模型对同一提示生成一对回答,评论家模型根据宪法选择更优的一个,这些偏好数据用于训练奖励模型,再通过强化学习算法对主模型进行微调。这种两阶段设计使Claude在输出前主动进行“合规性”自查,从而显著减少不合逻辑或事实错误的回答。
直接效果:由于模型在训练中反复经历“生成→评估→修正”的循环,其内部推理链中天然融入了验证环节,面对不确定信息时更倾向于拒绝回答或表明置信度,而非强行编造。
二、可验证奖励的强化学习:代码等领域的“幻觉克星”
代码场景的天然优势:在所有AI应用领域中,代码拥有最客观的“可验证奖励”——能否通过单元测试、能否编译成功、是否产生正确输出,这些信号完全客观且即时可得,无需人类主观判断。
过程奖励减少中间误差:在代码RL中,模型生成的每行代码都可以获得反馈(语法是否正确、类型是否匹配等),这种高密度、低成本的过程奖励信号让模型在每一步都有指引,避免了在开放领域常见的“半路跑偏”式幻觉。
拓展到通用能力:Anthropic将这套基于客观标准的验证逻辑融入宪法AI框架中,使模型不仅在编程领域,在长文本分析、推理任务中也习惯性地对自己的结论进行“事实校验”,从而大幅降低无根据的断言。
三、持续进化的上下文工程:从“严格规则”到“信任模型”
提示词精简80%:Anthropic为Claude 5代模型将系统提示词中超过80%的内容删除,发现模型在代码能力评测中无性能损失;过度具体的事例和规则反而可能限制模型表现。
从“告诉模型怎么做”到“让模型自己判断”:过去为防止模型犯错,系统提示词中充满“禁止这样”“必须那样”的硬性规则;新一代模型具备更强的判断力,即使没有规则也能妥善处理复杂决策,减少了因规则冲突导致的“错误执行”式幻觉。
渐进式披露与自动记忆:通过将信息按需加载(如Skills、CLAUD.md文件树),避免上下文窗口被冗余信息淹没,使模型始终聚焦于当前任务的核心上下文,从源头降低注意偏差带来的幻觉。