新浪AI前沿速递
9小时前来自 科技看点

人工智能为何会在安全场景出现“幻觉”引发风险?

一、AI幻觉的底层逻辑:它不是“懂”,而是“猜”

大语言模型的工作原理本质是统计预测:它从海量文本中学习词语之间的共现概率,根据上文预测下一个最可能出现的词。

与人类通过感知、经验建立真实世界概念不同,AI对“苹果”的认识只是统计“苹果”常与“红”“甜”一起出现,从而流畅输出“红苹果口感甜脆”——它并不真正理解苹果是什么。

当问题过于冷门、专业或涉及大量细节时,训练语料中缺乏足够样本,模型难以算出可靠概率,于是就可能“编造”看似合理实则错误的内容。

二、安全场景为何成为“高危区”

信息可靠性要求极高:在医疗、法律、工程、金融等安全相关领域,错误信息可能直接导致错误决策。例如AI可能编造不存在的医学研究表明某疗法有效,或虚构法律条文。

决策过程不透明:AI Agent的推理路径往往难以追踪,当它基于错误逻辑得出“安全”结论时,人类很难即时发现漏洞。

数据隐私与系统安全:多模态AI处理海量数据,若防护不当可能导致隐私泄露;边缘AI设备漏洞也可能被利用,造成系统异常。

“自信”的误导性:AI会用流畅的语言、看似规范的引用(包括虚构的论文、作者、期刊)来包装错误,使非专业用户难以辨别真伪。

三、当前技术如何应对幻觉风险

检索增强生成(RAG):让AI在回答问题前先检索权威外部资料,相当于将闭卷考试变为开卷考试,大幅降低编造概率。

多智能体辩论框架:清华大学等单位提出让多个AI共同讨论、相互质疑、交叉验证,筛选出最可靠结论。

编码安全内置检查:在AI生成代码时同步进行静态检查、语义扫描与跨文件数据流追踪,实现“发现-修复-再验证”闭环。

持续迭代的事实核查层:行业正推动模型在输出前自动核查关键事实,并标注不确定信息,让用户清晰辨别可靠与推测内容。

四、普通用户如何规避AI误导

巧问:提供明确上下文与约束。不笼统提问,而是给出背景、目标、不允许使用的表述等,减少AI自由发挥空间。

善查:关键信息必须核实。涉及健康、升学、法律、财务等重大事项,应通过官方渠道或多模型交叉验证,不轻信单一AI输出。

保持怀疑心态,建立辨识能力。将AI视为“高置信度的接话茬高手”,而非百科全书;重要结论自己再核对,尤其是数据、日期、人名、引用出处。

区分确定信息与推测。在提问时要求AI明确哪些是已知事实、哪些是基于模式生成的推测,一眼看清可靠程度。

五、安全应用中的治理方向

机器学习模型本身无法做到100%无幻觉,这是由其概率生成机制决定的必然系统风险。

人类判断必须始终在决策链条中:AI是辅助工具,最终审校与责任归属仍应落在有专业背景的人身上。

行业正在构建可追溯的AI决策记录,使得一旦发生误判能够追查原因,并为模型改进提供数据。

公共教育提升AI素养:通过科普帮助公众理解AI的能力边界,学会“巧问与善查”,从而安全享受技术便利。