基础概念

Hallucination

幻觉

Hallucination(幻觉)指大语言模型生成看似合理但与事实不符的内容。这是 LLM 最棘手的缺陷,根源在于模型的概率生成机制。本文拆解幻觉的成因、四类典型表现、检测方法与缓解策略,帮你识别和应对 AI 的「一本正经地胡说八道」。

2026-08-02
Hallucination幻觉LLM可靠性基础概念

什么是 Hallucination

Hallucination(幻觉) 指大语言模型(LLM)生成看似合理但与事实不符、与输入矛盾或与已知知识冲突的内容。通俗说就是 AI "一本正经地胡说八道"。

幻觉不是 bug,而是 LLM 的固有特性。LLM 的本质是"根据上文预测下一个 token",它并不"知道"答案,只是生成统计上最可能的文本。当训练数据不足、问题超出能力边界、或 Prompt 模糊时,模型会生成流畅但错误的内容。

幻觉的根源

1. 概率生成机制

LLM 不是数据库,它不会"查询"事实,而是"生成"文本。当被问"李白生于哪年",模型不是去查表,而是基于训练数据中"李白""生于""701 年"这些 token 的共现概率,生成最可能的答案。如果训练数据中相关内容稀缺或矛盾,模型就可能编造。

2. 训练数据局限

  • 时效性:训练截止后的信息模型不知道,但会编造(如"2026 年新发布的 iPhone")
  • 长尾知识:冷门领域数据少,模型用相关但不准确的内容填补
  • 数据矛盾:训练数据本身有错,模型学到了错误关联
  • 来源不可靠:包含博客、论坛等低质量内容

3. 对齐训练的副作用

RLHF(人类反馈强化学习)让模型"乐于助人",但这反而加剧幻觉:模型宁可编造答案,也不愿说"我不知道",因为"助人"被奖励、"拒绝"被惩罚。

4. 上下文窗口限制

当上下文过长,模型可能"忘记"前文的关键信息,生成与上下文矛盾的内容(称为 context hallucination)。

四类典型幻觉表现

1. 事实性幻觉(Factual Hallucination)

生成与客观事实不符的内容。

❌ 问:爱因斯坦哪年获得诺贝尔奖?
   答:1921 年。(实际是 1922 年颁发,因 1921 年无合适候选人)

2. 上下文幻觉(Contextual Hallucination)

生成与输入上下文矛盾的内容。

❌ 上下文:张三 2020 年入职,2023 年离职。
   问:张三现在还在职吗?
   答:张三目前仍在公司任职。(与上下文矛盾)

3. 来源幻觉(Source Hallucination)

编造不存在的引用、论文、链接。

❌ 问:有什么论文支持 RAG 能降低幻觉?
   答:Smith et al. (2024) 的 "RAG-Reduce: Hallucination Mitigation"
       发表于 ACL 2024。(这篇论文不存在)

4. 逻辑幻觉(Logical Hallucination)

推理过程看似合理但存在逻辑错误。

❌ 问:如果 A > B,B > C,那么 A 和 C 的关系?
   答:A < C。(逻辑错误,应为 A > C)

如何检测幻觉

1. 人工核查(最可靠)

  • 交叉验证:用搜索引擎查证关键事实
  • 来源追溯:要求模型给出引用,核查链接与论文真实性
  • 反向提问:换种问法再问一次,看答案是否一致

2. 让模型自检(中等可靠)

请检查你刚才的回答中,哪些是确凿事实,哪些是推测?
对每个推测,标注置信度(高/中/低)和依据。

注意:模型的自检不可全信,它可能"自信地"坚持错误答案。

3. 多模型交叉验证

用 Claude、GPT-4、Gemini 分别回答同一问题,若答案不一致,至少有一个在幻觉。

4. RAG + 引用强制

给模型外挂知识库(RAG),强制要求"每个事实必须引用来源"。若引用不存在或与来源不符,即为幻觉。

5. 置信度评估工具

  • SelfCheckGPT:让模型多次采样,答案方差大 = 高幻觉风险
  • Vectara:自动评估生成内容与源文档的事实一致性
  • Llama Guard:Meta 开源的幻觉检测模型

缓解幻觉的策略

1. Prompt 层面

要求模型:
1. 「如果不确定,请明确说『我不知道』」
2. 「只基于我提供的文档回答,不要用外部知识」
3. 「每个事实必须标注来源」
4. 「先列出已知信息,再回答问题」
5. 「分步推理,每步检查是否合理」

技巧:Step-back Prompting(先调出原则)、Self-Consistency(多次采样取多数)、CoT(分步推理)都能降低幻觉。

2. RAG(检索增强生成)

给模型外挂知识库,让它"查着答"而不是"凭记忆答"。RAG 是目前最有效的幻觉缓解方案,能把幻觉率从 30% 降到 5-10%。

详见我们关于 RAG 的术语详解。

3. 模型选择

  • 大模型优于小模型:GPT-4 幻觉率低于 GPT-3.5
  • 新模型优于旧模型:经过对齐训练的模型幻觉率持续下降
  • 垂直模型优于通用模型:医疗、法律等垂直模型在领域内幻觉更低

4. 后处理校验

  • 事实核查 API:Google Fact Check、Snopes
  • 规则校验:对结构化输出(如日期、金额)用规则校验
  • 人工审核:关键场景必须人工把关

5. 对齐训练

对模型做"诚实性"对齐训练,奖励"承认不知道",惩罚"编造答案"。Anthropic 的 Constitutional AI、OpenAI 的 RLHF 都在朝这个方向努力。

幻觉的两面性

幻觉不总是坏事。在创意场景,"幻觉"就是"想象力":

场景幻觉的价值
创意写作生成新颖情节
头脑风暴产生意想不到的组合
角色扮演让虚拟角色"活"起来
艺术创作打破常规的隐喻与意象

关键在于场景匹配:事实查询要零幻觉,创意生成要可控幻觉。

2026 年幻觉研究进展

  • 幻觉率持续下降:GPT-4 Turbo 幻觉率约 3%,Claude 3.5 约 2%,较 2023 年下降 80%
  • 可解释性突破:研究者开始定位模型中"幻觉产生"的具体神经元
  • RAG 标准化:RAG 成为幻觉缓解的工业标准,准确率提升至 95%+
  • 宪法 AI:Anthropic 用"诚实宪法"训练 Claude,显著降低编造倾向

相关术语

  • LLM:大语言模型,幻觉的"宿主"
  • RAG:检索增强生成,最有效的幻觉缓解方案
  • Fine-tuning:微调,可降低领域幻觉
  • Token:token,LLM 的基本生成单位
  • Prompt Engineering:通过 Prompt 设计降低幻觉

小结

Hallucination 是 LLM 的"原罪",源于概率生成机制,无法根除但可缓解。对事实查询场景,用 RAG + Prompt 约束 + 多模型校验把幻觉压到 5% 以下;对创意场景,拥抱幻觉的"想象力"价值。理解幻觉的成因与表现,是使用 LLM 的必修课——不迷信 AI,也不否定 AI,用工程手段管理幻觉才是正确姿势。