评测与安全

幻觉(Hallucination)

也叫: AI 幻觉 · 大模型幻觉 · LLM 幻觉 · Hallucination

幻觉指语言模型输出流畅而笃定、但内容错误、编造,或没有来源与任务输入支撑的现象。

语言模型生成的是“最合理的下文”,而不是经过验证的事实。当提示里或训练中缺少正确信息时,它仍然能给出读起来很顺的答案:一个并不存在的引用、库里根本没有的函数、与你给的文档相矛盾的细节。这就是幻觉,有时也叫“虚构”(confabulation)。

在 Agent 中,后果比聊天严重:编造的文件路径、API 参数或工具结果可能一路传到后面的步骤,甚至触发真实操作。所以幻觉被当作可靠性和安全问题,而不只是质量上的小毛病。

它无法被彻底消除,但可以被降低和隔离。

怎么运作

常见缓解手段是分层的。依据来源:通过检索(agentic-rag)或工具把相关材料交给模型,并要求基于它作答。限定输出:把输出限制在声明好的选项或 schema 内,使无效答案无法出现,但“看起来合法的错误答案”仍会出现(见 jev)。校验:行动前跑测试、编译代码、对照来源核实。升级:让模型能表示“不确定”,并把这类情况交给人(human-in-the-loop)。度量:在 agent-evaluation 中追踪幻觉率。

举个例子

编程 Agent 被要求调用某个库函数,却笃定地用了一个不存在的方法。编译或测试步骤发现了错误,并把失败信息反馈给 Agent,让它修正。如果没有这道检查,这个编造的调用就会被提交。

和相关概念的区别

幻觉与 prompt-injection:幻觉是模型自己的无端失误,提示注入则是外部攻击者的文字在操控模型。两者都可能导致错误行动,但解决办法不同。

常见误解

常被以为: 只有问冷门问题时模型才会产生幻觉。
实际上: 普通任务上也会发生,尤其是所需信息不在上下文里,或模型被逼着必须作答而不是承认不知道时。
常被以为: 加上检索(RAG)就能消除幻觉。
实际上: 检索通过提供来源来降低幻觉,但模型仍可能读错、忽略或张冠李戴,检索本身也可能返回不相关的内容。

常见问题

AI 幻觉是什么?
模型输出的流畅而笃定、但错误、编造或没有来源/输入支撑的内容。
大模型为什么会产生幻觉?
它生成的是听起来合理的文本,而不是去查证过的事实,所以信息缺失或含糊时,仍会给出听起来正确的答案。
怎么减少 AI Agent 的幻觉?
让答案基于检索来源或工具结果,把输出限定在 schema 内,行动前用测试或检查校验,并把不确定的情况升级给人。

最近核实: 2026-09-20

相关术语