Mingyu's Library主页
AI DAILY · 深度学习文档 · 2026-07-25

LLM 幻觉评测与缓解
—— 两把尺子,和一套能落地的防线

「幻觉率」这个词几乎每篇模型对比都在用,却是最容易被误读的一块。准确率高不代表幻觉低,会推理的模型反而更爱编。这份文档讲清两种测法的区别,以及生产里怎么真的把幻觉压下去。

📏 Vectara HHEM🧭 AA-Omniscience🧠 推理税🛡️ RAG + 引用契约🔬 分层防御

0030 秒速览

先把结论摆出来,后面再逐层解释。

「LLM 幻觉」= 模型自信地说出不真实的内容。测它有两种彼此独立、经常打架的尺子:Vectara HHEM 测「总结时会不会脱离原文瞎编」(考的是「忠于来源」),AA-Omniscience 测「不知道答案时会不会承认」(考的是「知不知道自己不知道」)。一个模型可能一把尺子满分、另一把不及格。

最反直觉的一条:会「推理」的模型幻觉更多——同一模型开启思考模式,幻觉率普遍是基础版的 2–3 倍。因为它想得越多,越容易生成「听起来合理但其实错」的细节。所以总结类、事实类任务应该用基础(非推理)模型。

压低幻觉没有银弹,靠分层防御:RAG 接地 + 强制引用 + groundedness 判官 + 评测门禁 CI。多层叠加能把幻觉砍掉 71–89%。而最大的杠杆其实是数据治理——同一个模型,喂治理过的数据几乎零编造,喂未治理数据 52% 的回答含编造。

2 把尺子
HHEM(忠于来源)vs Omniscience(承认无知)
2–3×
推理模式带来的幻觉放大
71–89%
分层防御相比无防护的幻觉削减
52% → ≈0
未治理 vs 治理数据上的编造率

01幻觉到底是什么,为什么它压不干净

先搞清「痛点」,才知道后面每种测法和防线在防什么。

大语言模型的本质是「预测下一个最可能的词」。它没有一个「事实数据库」去核对,只有从训练语料里学到的统计规律。所以当它不知道答案时,它不会像人一样说「我不确定」,而是顺着语言的惯性,生成一段读起来最流畅、最像那么回事的话——哪怕内容是错的。这就是幻觉的根。

🎭 类比:一个从不说「不知道」的博学者

想象一个读书极多、口才极好的人,但他有个毛病:被问到任何问题都必须张口就答,绝不允许自己说「这个我不清楚」。大部分时候他答得对,可一旦碰到知识盲区,他会用同样自信的语气编一个听起来很专业的答案。幻觉就是模型的这个毛病。「压低幻觉」在很大程度上,就是教会它在该闭嘴的时候闭嘴

这也解释了为什么幻觉「压不干净」:让模型更保守(多拒答)会牺牲有用性;让它更博学(多回答)又会增加编造。这是一个准确率与幻觉率之间的权衡,不是一个能单向优化到底的 bug。理解这个权衡,是读懂所有幻觉评测的前提。

02两把尺子:它们测的根本不是一回事

这是全文最容易被误读的地方。看懂这两把尺子的区别,你就不会再被「幻觉率」这个词忽悠。

Vectara HHEM 问:总结时忠于原文吗? 给一篇文档 → 让模型总结 数编造了多少原文没有的事实 越低越好 · <5% 优秀 · >10% 危险 7700+ 篇法律/医疗/金融文档 AA-Omniscience 问:不知道时会承认吗? 6000 道知识题 → 看它答/拒 奖对、罚错、拒答不罚 Index 越高越好 · >25 优秀 42 主题 × 6 领域
两把尺子测的是两种不同的失败:HHEM 防「脱离给定材料瞎编」,Omniscience 防「碰到知识盲区硬答」。(整理自 CodingFleet 幻觉排名、Artificial Analysis 官网)
Vectara HHEM(Hughes Hallucination Evaluation Model)
给模型一篇文档、让它总结,再用一个专门的判别模型检查:总结里有没有原文根本没说的内容。它测的是「接地性」——你手里明明有材料,还编不编。适合评估 RAG、总结、文档问答这类「有给定上下文」的场景。
注意陷阱:模型可以靠「拒绝总结」来刷低分,所以看 HHEM 必须同时看「回答率(answer rate)」是否 ≥95%。(来源:CodingFleet)
AA-Omniscience Index(Artificial Analysis)
6000 道跨领域知识题,算一个 -100 到 100 的分数:答对加分、答错(幻觉)扣分、拒答不扣分。0 分代表「答对的和答错的一样多」。它测的是「校准度」——模型知不知道自己的知识边界在哪。
官方给的幻觉率定义:incorrect / (incorrect + partial + not attempted),即「在所有非正确回答里,有多少是自信答错而非老实拒答」。论文 arXiv:2511.13029;截至评测,仅三个模型 Index 为正,可见前沿模型的事实校准普遍偏弱。
🔑 一个把两把尺子说清楚的例子

Claude Opus 4.7:Vectara 12.0%(偏高,总结时爱编)但 AA-Omniscience Index 26.2(优秀,很会说「我不确定」)。同一个模型,一把尺子差、一把尺子好——因为「总结时忠不忠于材料」和「知不知道自己不知道」是两种能力。选模型要按任务选尺子:做 RAG/总结看 HHEM,做开放知识问答看 Omniscience。

03推理税:越「聪明」的模型越爱编

数据里最反直觉的一条,也是最实用的一条。

直觉上你会以为:模型越强、越会「思考」,答案越可靠。数据说反了。同一个模型,开启推理模式(spend 更多 token 想问题)后,幻觉率普遍是基础版的 2–3 倍

模型对基础版幻觉推理模式放大
GPT-5.4 → GPT-5(高推理)~7%>10%~1.5×
DeepSeek V3.2 → R15.3%11.3%2.1×
Grok 3 → Grok 4 Fast(推理)5.8%20.2%3.5×

来源:CodingFleet 汇总(Vectara HHEM 口径)。

为什么?主流解释是「想太多会跑偏」:推理模型生成一长串内部思考链,链条越长,越容易一步步偏离原始材料,给「编造听起来合理的细节」创造机会。落到实践就是一条明确的规则:

⚠️ 实用规则

总结、事实接地类任务用基础(非推理)模型;把推理模式留给数学、编码、逻辑题这类「编造风险本来就低、且需要多步推演」的任务。别因为一个模型「更贵、更聪明」就默认它更可信。

另外两个反直觉

🧭 Fable 5 改写了 Claude 的「诚实剧本」

过去 Anthropic 旗舰走「中等准确 + 低幻觉」路线(Claude 4.1 Opus 甚至近零幻觉,靠大量拒答)。Fable 5 第一次把「准确」放在「谨慎拒答」之上:准确率 61%(超过 GPT-5.5 的 57%)登顶 AA-Omniscience(Index 40),但代价是幻觉率高于 Opus 4.8(35.9%)——AA 明确注明其高分「由领先的准确率、而非低幻觉驱动」。实践含义:Fable 5 是第一个「你应该去核对它输出」而不是「信任它校准」的 Claude 模型。无人值守、错了要赔钱的 Agent,Opus 4.8 反而更稳。

04怎么压低:按失败模式分层设防

没有单一开关能关掉幻觉。生产里的做法是「按每种失败模式各设一道防线」,叠起来用。

用户提问 ① 检索接地(RAG) 先从可信语料查,再让模型答 ② 生成时强制引用 要求逐句引用检索到的片段 ③ groundedness 判官 第二个模型逐条核对是否有据 贯穿全程 ④ 评测门禁 CI 上线前用 eval 卡关 ⑤ 线上实时监控 错误聚类、回流改进 ⓪ 数据治理 最大杠杆:喂干净数据 叠加后砍 71–89%
分层防御流水线。每一层针对一种失败模式,组合起来把大多数企业系统压到人类基线错误率以下。(整理自 futureagi、atlan、LayerLens 等 2026 实践文章)

五道防线,逐一说

0数据治理(最大杠杆)。研究显示:同一个模型,在未治理数据上 52% 的回答含编造,在治理过的数据上几乎为零。结构化、清洗、分类过的 RAG 源,能让幻觉率比非结构化源低约 87%。先把数据弄干净,比换模型有用得多。
1RAG 接地(主力手段)。任何「已知语料上的事实问题」都先检索、后生成。收紧的 RAG 流水线能把无依据断言砍掉一半——但前提是检索到的上下文本身准确、及时、分类清楚,否则「接地」到错的材料上反而更糟。
2生成时强制引用契约。高风险场景要求模型「引用/照抄检索到的片段」,把「有没有出处」变成可检查的硬性输出格式。没出处的话不许说。
3groundedness / faithfulness 判官。对 RAG 输出跑一个「忠实度判官」(通常是第二个模型),做 claim-level 的蕴含打分——逐条判断每个论断是否被检索材料支撑。
4评测门禁 + 线上监控。上线前用 eval 卡 CI(不达标不给发);上线后对错误做聚类、回流成新的评测用例。把幻觉当成一个需要持续测量的指标,而不是一次性调好的参数。
🔑 效果量级

system prompt + RAG 接地 + 实时监控三层叠加,相比无防护部署,幻觉率下降 71–89%;结构良好的 RAG 源相比非结构化源,幻觉再降约 87%。组合防御能让多数企业系统降到人类基线错误率以下。(来源:futureagi、多篇 2026 实践汇总)

05怎么按任务选模型

把前面的尺子和防线,收敛成一张「该用谁」的判断表。

你的任务优先看的尺子倾向选择
高保真总结 / 文档问答Vectara HHEM(越低越好)基础(非推理)模型;GPT-5.4 Mini 这类总结诚实度高的
开放知识问答AA-Omniscience Index(越高越好)校准好、敢说「不知道」的,如 Gemini 3.1 Pro、Opus 4.8
无人值守 Agent(错了要赔钱)幻觉率(越低越好)Opus 4.8 式「谨慎拒答」优于 Fable 5 式「高准确高幻觉」
复杂研究/分析(你会核对输出)准确率 + 知识广度Fable 5 知识最广,但务必自己 verify
数学 / 编码 / 逻辑——(幻觉风险本就低)放心开推理模式

一句话总结这张表:按任务选模型,不按品牌选。同一个「最强模型」在总结上可能不如一个小模型可靠。

06常见坑

07学习资源清单

五维覆盖:「是什么/两种测法/为何反直觉/怎么缓解/怎么选」均有多来源支撑;相对薄弱的是各家最新模型的精确幻觉数值——2026 年 4 月后发布的多个模型(Opus 5、Grok 4.3、Qwen 3.7 Max 等)Vectara 尚未独立评测,文中数值以标注日期为准。