AI 为什么宁愿编一个答案,也不肯说“不知道”?
TL;DR
AI 幻觉并不只是资料不足,还与语言模型的预测方式和评测机制有关:猜对可能得分,拒答却常常没有奖励。本文拆解“流畅但错误”的形成过程,说明搜索为何不能根治幻觉,并给普通用户一套判断高风险回答的方法。
AI 幻觉并不只是资料不足,还与语言模型的预测方式和评测机制有关:猜对可能得分,拒答却常常没有奖励。本文拆解“流畅但错误”的形成过程,说明搜索为何不能根治幻觉,并给普通用户一套判断高风险回答的方法。

当 AI 不知道某位冷门作家的生平时,它有时不会停下来,而会给出一个年份、一所学校和几本听起来十分可信的书。句子流畅、细节完整,唯一的问题是这些内容并不存在。这种“合理外表下的错误”通常被称为幻觉。
把幻觉仅仅理解成“模型记错了”并不够。语言模型的工作方式和我们给它设置的考试规则,都可能把它推向大胆猜测。
它首先学会的是接着说什么
大语言模型的核心训练任务,是根据前文预测后续 Token。它从海量文本中学会词语、事实和表达之间的统计关系,却没有在内部建立一座每句话都附带出处的数据库。
当问题落在训练资料稀少、互相矛盾或表述模糊的区域,模型仍然必须继续生成。人名后面常接出生年份,论文后面常接期刊与页码,于是它可能拼出形式正确、事实错误的组合。流畅度来自语言规律,真实性却需要另一套约束。
为什么“猜一下”经常比“不知道”划算
2025 年的论文《Why Language Models Hallucinate》提出了一个直观解释:许多评测采用非对即错的计分方式。猜错得零分,回答“不知道”也得零分,但猜对却能得一分。在这种规则下,只要还有一点把握,猜测就是提高平均分的策略。
这和选择题考试很像。答错不倒扣分时,留空通常不如蒙一个。模型在训练和评测中不断接触这种激励,就可能形成“尽量回答”的行为,而不是在不确定时可靠地拒答。
解决思路之一,是把置信要求写进评测:当证据不足时,正确表达不确定也应获得奖励;在医疗、法律等高风险场景,还可以要求模型只有超过特定把握才作答。这样,“我不知道”才不再是一种失败。
接上搜索也不是万能药
搜索、知识库和 RAG 能显著减少部分幻觉,因为模型可以根据外部资料回答。但它们没有消除整个问题:搜索可能没有结果、找错页面、引用过期资料,模型也可能误读检索到的内容。对于字母计数、复杂计算等内生错误,搜索甚至帮不上忙。
更可靠的系统会把链条拆开检查:资料来自哪里,是否真的支持结论,计算能否交给程序,引用是否指向原文。模型负责组织语言,工具负责精确执行,关键判断仍需可追溯。
普通用户可以观察三个危险信号
第一,答案包含异常具体却无法核查的细节,例如精确页码、冷门统计或陌生机构名称。细节越像真的,不代表越可靠。
第二,追问来源后,模型只重复原话或给出打不开的链接。真正的证据应能独立存在,而不是由回答本身证明回答。
第三,同一问题换一种问法,关键事实就改变。表达变化很正常,人物、日期和数字反复漂移则说明模型可能没有稳定依据。
对于低风险任务,例如改写一封邮件,偶尔换个词影响不大;对于用药、合同、投资、新闻与学术引用,则应优先查阅权威原始资料。也可以要求模型把“已确认事实”“推测”和“未知信息”分开写,让不确定性显形。
幻觉不是 AI 突然拥有了撒谎动机。它更像一位语言能力极强、却被要求每题必答的考生:不知道时仍能写出漂亮段落。真正的改进,不只是塞给它更多知识,还要改变评测、工具链和交互方式,让谨慎回答也成为一种成功。



