什么是 Hallucination
Hallucination(幻觉) 指大语言模型(LLM)生成看似合理但与事实不符、与输入矛盾或与已知知识冲突的内容。通俗说就是 AI "一本正经地胡说八道"。
幻觉不是 bug,而是 LLM 的固有特性。LLM 的本质是"根据上文预测下一个 token",它并不"知道"答案,只是生成统计上最可能的文本。当训练数据不足、问题超出能力边界、或 Prompt 模糊时,模型会生成流畅但错误的内容。
幻觉的根源
1. 概率生成机制
LLM 不是数据库,它不会"查询"事实,而是"生成"文本。当被问"李白生于哪年",模型不是去查表,而是基于训练数据中"李白""生于""701 年"这些 token 的共现概率,生成最可能的答案。如果训练数据中相关内容稀缺或矛盾,模型就可能编造。
2. 训练数据局限
- 时效性:训练截止后的信息模型不知道,但会编造(如"2026 年新发布的 iPhone")
- 长尾知识:冷门领域数据少,模型用相关但不准确的内容填补
- 数据矛盾:训练数据本身有错,模型学到了错误关联
- 来源不可靠:包含博客、论坛等低质量内容
3. 对齐训练的副作用
RLHF(人类反馈强化学习)让模型"乐于助人",但这反而加剧幻觉:模型宁可编造答案,也不愿说"我不知道",因为"助人"被奖励、"拒绝"被惩罚。
4. 上下文窗口限制
当上下文过长,模型可能"忘记"前文的关键信息,生成与上下文矛盾的内容(称为 context hallucination)。
四类典型幻觉表现
1. 事实性幻觉(Factual Hallucination)
生成与客观事实不符的内容。
❌ 问:爱因斯坦哪年获得诺贝尔奖?
答:1921 年。(实际是 1922 年颁发,因 1921 年无合适候选人)
2. 上下文幻觉(Contextual Hallucination)
生成与输入上下文矛盾的内容。
❌ 上下文:张三 2020 年入职,2023 年离职。
问:张三现在还在职吗?
答:张三目前仍在公司任职。(与上下文矛盾)
3. 来源幻觉(Source Hallucination)
编造不存在的引用、论文、链接。
❌ 问:有什么论文支持 RAG 能降低幻觉?
答:Smith et al. (2024) 的 "RAG-Reduce: Hallucination Mitigation"
发表于 ACL 2024。(这篇论文不存在)
4. 逻辑幻觉(Logical Hallucination)
推理过程看似合理但存在逻辑错误。
❌ 问:如果 A > B,B > C,那么 A 和 C 的关系?
答:A < C。(逻辑错误,应为 A > C)
如何检测幻觉
1. 人工核查(最可靠)
- 交叉验证:用搜索引擎查证关键事实
- 来源追溯:要求模型给出引用,核查链接与论文真实性
- 反向提问:换种问法再问一次,看答案是否一致
2. 让模型自检(中等可靠)
请检查你刚才的回答中,哪些是确凿事实,哪些是推测?
对每个推测,标注置信度(高/中/低)和依据。
注意:模型的自检不可全信,它可能"自信地"坚持错误答案。
3. 多模型交叉验证
用 Claude、GPT-4、Gemini 分别回答同一问题,若答案不一致,至少有一个在幻觉。
4. RAG + 引用强制
给模型外挂知识库(RAG),强制要求"每个事实必须引用来源"。若引用不存在或与来源不符,即为幻觉。
5. 置信度评估工具
- SelfCheckGPT:让模型多次采样,答案方差大 = 高幻觉风险
- Vectara:自动评估生成内容与源文档的事实一致性
- Llama Guard:Meta 开源的幻觉检测模型
缓解幻觉的策略
1. Prompt 层面
要求模型:
1. 「如果不确定,请明确说『我不知道』」
2. 「只基于我提供的文档回答,不要用外部知识」
3. 「每个事实必须标注来源」
4. 「先列出已知信息,再回答问题」
5. 「分步推理,每步检查是否合理」
技巧:Step-back Prompting(先调出原则)、Self-Consistency(多次采样取多数)、CoT(分步推理)都能降低幻觉。
2. RAG(检索增强生成)
给模型外挂知识库,让它"查着答"而不是"凭记忆答"。RAG 是目前最有效的幻觉缓解方案,能把幻觉率从 30% 降到 5-10%。
详见我们关于 RAG 的术语详解。
3. 模型选择
- 大模型优于小模型:GPT-4 幻觉率低于 GPT-3.5
- 新模型优于旧模型:经过对齐训练的模型幻觉率持续下降
- 垂直模型优于通用模型:医疗、法律等垂直模型在领域内幻觉更低
4. 后处理校验
- 事实核查 API:Google Fact Check、Snopes
- 规则校验:对结构化输出(如日期、金额)用规则校验
- 人工审核:关键场景必须人工把关
5. 对齐训练
对模型做"诚实性"对齐训练,奖励"承认不知道",惩罚"编造答案"。Anthropic 的 Constitutional AI、OpenAI 的 RLHF 都在朝这个方向努力。
幻觉的两面性
幻觉不总是坏事。在创意场景,"幻觉"就是"想象力":
| 场景 | 幻觉的价值 |
|---|---|
| 创意写作 | 生成新颖情节 |
| 头脑风暴 | 产生意想不到的组合 |
| 角色扮演 | 让虚拟角色"活"起来 |
| 艺术创作 | 打破常规的隐喻与意象 |
关键在于场景匹配:事实查询要零幻觉,创意生成要可控幻觉。
2026 年幻觉研究进展
- 幻觉率持续下降:GPT-4 Turbo 幻觉率约 3%,Claude 3.5 约 2%,较 2023 年下降 80%
- 可解释性突破:研究者开始定位模型中"幻觉产生"的具体神经元
- RAG 标准化:RAG 成为幻觉缓解的工业标准,准确率提升至 95%+
- 宪法 AI:Anthropic 用"诚实宪法"训练 Claude,显著降低编造倾向
相关术语
- LLM:大语言模型,幻觉的"宿主"
- RAG:检索增强生成,最有效的幻觉缓解方案
- Fine-tuning:微调,可降低领域幻觉
- Token:token,LLM 的基本生成单位
- Prompt Engineering:通过 Prompt 设计降低幻觉
小结
Hallucination 是 LLM 的"原罪",源于概率生成机制,无法根除但可缓解。对事实查询场景,用 RAG + Prompt 约束 + 多模型校验把幻觉压到 5% 以下;对创意场景,拥抱幻觉的"想象力"价值。理解幻觉的成因与表现,是使用 LLM 的必修课——不迷信 AI,也不否定 AI,用工程手段管理幻觉才是正确姿势。