主页
「幻觉率」这个词几乎每篇模型对比都在用,却是最容易被误读的一块。准确率高不代表幻觉低,会推理的模型反而更爱编。这份文档讲清两种测法的区别,以及生产里怎么真的把幻觉压下去。
先把结论摆出来,后面再逐层解释。
「LLM 幻觉」= 模型自信地说出不真实的内容。测它有两种彼此独立、经常打架的尺子:Vectara HHEM 测「总结时会不会脱离原文瞎编」(考的是「忠于来源」),AA-Omniscience 测「不知道答案时会不会承认」(考的是「知不知道自己不知道」)。一个模型可能一把尺子满分、另一把不及格。
最反直觉的一条:会「推理」的模型幻觉更多——同一模型开启思考模式,幻觉率普遍是基础版的 2–3 倍。因为它想得越多,越容易生成「听起来合理但其实错」的细节。所以总结类、事实类任务应该用基础(非推理)模型。
压低幻觉没有银弹,靠分层防御:RAG 接地 + 强制引用 + groundedness 判官 + 评测门禁 CI。多层叠加能把幻觉砍掉 71–89%。而最大的杠杆其实是数据治理——同一个模型,喂治理过的数据几乎零编造,喂未治理数据 52% 的回答含编造。
先搞清「痛点」,才知道后面每种测法和防线在防什么。
大语言模型的本质是「预测下一个最可能的词」。它没有一个「事实数据库」去核对,只有从训练语料里学到的统计规律。所以当它不知道答案时,它不会像人一样说「我不确定」,而是顺着语言的惯性,生成一段读起来最流畅、最像那么回事的话——哪怕内容是错的。这就是幻觉的根。
想象一个读书极多、口才极好的人,但他有个毛病:被问到任何问题都必须张口就答,绝不允许自己说「这个我不清楚」。大部分时候他答得对,可一旦碰到知识盲区,他会用同样自信的语气编一个听起来很专业的答案。幻觉就是模型的这个毛病。「压低幻觉」在很大程度上,就是教会它在该闭嘴的时候闭嘴。
这也解释了为什么幻觉「压不干净」:让模型更保守(多拒答)会牺牲有用性;让它更博学(多回答)又会增加编造。这是一个准确率与幻觉率之间的权衡,不是一个能单向优化到底的 bug。理解这个权衡,是读懂所有幻觉评测的前提。
这是全文最容易被误读的地方。看懂这两把尺子的区别,你就不会再被「幻觉率」这个词忽悠。
Claude Opus 4.7:Vectara 12.0%(偏高,总结时爱编)但 AA-Omniscience Index 26.2(优秀,很会说「我不确定」)。同一个模型,一把尺子差、一把尺子好——因为「总结时忠不忠于材料」和「知不知道自己不知道」是两种能力。选模型要按任务选尺子:做 RAG/总结看 HHEM,做开放知识问答看 Omniscience。
数据里最反直觉的一条,也是最实用的一条。
直觉上你会以为:模型越强、越会「思考」,答案越可靠。数据说反了。同一个模型,开启推理模式(spend 更多 token 想问题)后,幻觉率普遍是基础版的 2–3 倍。
| 模型对 | 基础版幻觉 | 推理模式 | 放大 |
|---|---|---|---|
| GPT-5.4 → GPT-5(高推理) | ~7% | >10% | ~1.5× |
| DeepSeek V3.2 → R1 | 5.3% | 11.3% | 2.1× |
| Grok 3 → Grok 4 Fast(推理) | 5.8% | 20.2% | 3.5× |
来源:CodingFleet 汇总(Vectara HHEM 口径)。
为什么?主流解释是「想太多会跑偏」:推理模型生成一长串内部思考链,链条越长,越容易一步步偏离原始材料,给「编造听起来合理的细节」创造机会。落到实践就是一条明确的规则:
总结、事实接地类任务用基础(非推理)模型;把推理模式留给数学、编码、逻辑题这类「编造风险本来就低、且需要多步推演」的任务。别因为一个模型「更贵、更聪明」就默认它更可信。
过去 Anthropic 旗舰走「中等准确 + 低幻觉」路线(Claude 4.1 Opus 甚至近零幻觉,靠大量拒答)。Fable 5 第一次把「准确」放在「谨慎拒答」之上:准确率 61%(超过 GPT-5.5 的 57%)登顶 AA-Omniscience(Index 40),但代价是幻觉率高于 Opus 4.8(35.9%)——AA 明确注明其高分「由领先的准确率、而非低幻觉驱动」。实践含义:Fable 5 是第一个「你应该去核对它输出」而不是「信任它校准」的 Claude 模型。无人值守、错了要赔钱的 Agent,Opus 4.8 反而更稳。
没有单一开关能关掉幻觉。生产里的做法是「按每种失败模式各设一道防线」,叠起来用。
system prompt + RAG 接地 + 实时监控三层叠加,相比无防护部署,幻觉率下降 71–89%;结构良好的 RAG 源相比非结构化源,幻觉再降约 87%。组合防御能让多数企业系统降到人类基线错误率以下。(来源:futureagi、多篇 2026 实践汇总)
把前面的尺子和防线,收敛成一张「该用谁」的判断表。
| 你的任务 | 优先看的尺子 | 倾向选择 |
|---|---|---|
| 高保真总结 / 文档问答 | Vectara HHEM(越低越好) | 基础(非推理)模型;GPT-5.4 Mini 这类总结诚实度高的 |
| 开放知识问答 | AA-Omniscience Index(越高越好) | 校准好、敢说「不知道」的,如 Gemini 3.1 Pro、Opus 4.8 |
| 无人值守 Agent(错了要赔钱) | 幻觉率(越低越好) | Opus 4.8 式「谨慎拒答」优于 Fable 5 式「高准确高幻觉」 |
| 复杂研究/分析(你会核对输出) | 准确率 + 知识广度 | Fable 5 知识最广,但务必自己 verify |
| 数学 / 编码 / 逻辑 | ——(幻觉风险本就低) | 放心开推理模式 |
一句话总结这张表:按任务选模型,不按品牌选。同一个「最强模型」在总结上可能不如一个小模型可靠。
五维覆盖:「是什么/两种测法/为何反直觉/怎么缓解/怎么选」均有多来源支撑;相对薄弱的是各家最新模型的精确幻觉数值——2026 年 4 月后发布的多个模型(Opus 5、Grok 4.3、Qwen 3.7 Max 等)Vectara 尚未独立评测,文中数值以标注日期为准。