[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"$fLmGSlBE7uAK8RirgK7tT1cte9r9YwdD3Xvqk7uja5oA":3},{"item":4,"related":46},{"id":5,"type":6,"title":7,"slug":8,"summary":9,"body":10,"coverUrl":11,"productScreenshots":12,"productLinks":13,"authorName":14,"authorUrl":15,"authorSubject":16,"category":17,"tags":22,"sourceLabel":35,"sourceName":36,"sourceUrl":37,"status":38,"seoTitle":39,"seoDescription":39,"canonicalUrl":39,"isFeatured":40,"sno":41,"sortOrder":42,"publishedAt":43,"updatedAt":44,"createdAt":45},"ff12d064-50ab-47ae-b7fd-e5184786e154","article","AI 为什么宁愿编一个答案，也不肯说“不知道”？","why-language-models-hallucinate-instead-of-idk","AI 幻觉并不只是资料不足，还与语言模型的预测方式和评测机制有关：猜对可能得分，拒答却常常没有奖励。本文拆解“流畅但错误”的形成过程，说明搜索为何不能根治幻觉，并给普通用户一套判断高风险回答的方法。","当 AI 不知道某位冷门作家的生平时，它有时不会停下来，而会给出一个年份、一所学校和几本听起来十分可信的书。句子流畅、细节完整，唯一的问题是这些内容并不存在。这种“合理外表下的错误”通常被称为幻觉。\n\n把幻觉仅仅理解成“模型记错了”并不够。语言模型的工作方式和我们给它设置的考试规则，都可能把它推向大胆猜测。\n\n## 它首先学会的是接着说什么\n\n大语言模型的核心训练任务，是根据前文预测后续 Token。它从海量文本中学会词语、事实和表达之间的统计关系，却没有在内部建立一座每句话都附带出处的数据库。\n\n当问题落在训练资料稀少、互相矛盾或表述模糊的区域，模型仍然必须继续生成。人名后面常接出生年份，论文后面常接期刊与页码，于是它可能拼出形式正确、事实错误的组合。流畅度来自语言规律，真实性却需要另一套约束。\n\n```mermaid\nflowchart TD\n    A[用户提出问题] --> B[模型预测可能回答]\n    B --> C{证据是否充足}\n    C -->|充足| D[生成有依据的答案]\n    C -->|不足但仍猜测| E[形成可信外表的错误]\n    C -->|允许拒答| F[表达不知道或不确定]\n```\n\n## 为什么“猜一下”经常比“不知道”划算\n\n2025 年的论文[《Why Language Models Hallucinate》](https:\u002F\u002Fcdn.openai.com\u002Fpdf\u002Fd04913be-3f6f-4d2b-b283-ff432ef4aaa5\u002Fwhy-language-models-hallucinate.pdf)提出了一个直观解释：许多评测采用非对即错的计分方式。猜错得零分，回答“不知道”也得零分，但猜对却能得一分。在这种规则下，只要还有一点把握，猜测就是提高平均分的策略。\n\n这和选择题考试很像。答错不倒扣分时，留空通常不如蒙一个。模型在训练和评测中不断接触这种激励，就可能形成“尽量回答”的行为，而不是在不确定时可靠地拒答。\n\n解决思路之一，是把置信要求写进评测：当证据不足时，正确表达不确定也应获得奖励；在医疗、法律等高风险场景，还可以要求模型只有超过特定把握才作答。这样，“我不知道”才不再是一种失败。\n\n## 接上搜索也不是万能药\n\n搜索、知识库和 RAG 能显著减少部分幻觉，因为模型可以根据外部资料回答。但它们没有消除整个问题：搜索可能没有结果、找错页面、引用过期资料，模型也可能误读检索到的内容。对于字母计数、复杂计算等内生错误，搜索甚至帮不上忙。\n\n更可靠的系统会把链条拆开检查：资料来自哪里，是否真的支持结论，计算能否交给程序，引用是否指向原文。模型负责组织语言，工具负责精确执行，关键判断仍需可追溯。\n\n## 普通用户可以观察三个危险信号\n\n第一，答案包含异常具体却无法核查的细节，例如精确页码、冷门统计或陌生机构名称。细节越像真的，不代表越可靠。\n\n第二，追问来源后，模型只重复原话或给出打不开的链接。真正的证据应能独立存在，而不是由回答本身证明回答。\n\n第三，同一问题换一种问法，关键事实就改变。表达变化很正常，人物、日期和数字反复漂移则说明模型可能没有稳定依据。\n\n对于低风险任务，例如改写一封邮件，偶尔换个词影响不大；对于用药、合同、投资、新闻与学术引用，则应优先查阅权威原始资料。也可以要求模型把“已确认事实”“推测”和“未知信息”分开写，让不确定性显形。\n\n幻觉不是 AI 突然拥有了撒谎动机。它更像一位语言能力极强、却被要求每题必答的考生：不知道时仍能写出漂亮段落。真正的改进，不只是塞给它更多知识，还要改变评测、工具链和交互方式，让谨慎回答也成为一种成功。","\u002Fuploads\u002F2026-08-14\u002Fe8de803f-1a2c-407b-a9dc-686c0ced64d9.jpg",[],[],"Foundit","https:\u002F\u002Ffoundit.cn","f39339b1-aaa6-4e86-b0c2-a6e6a21113b5",{"id":18,"name":19,"slug":20,"description":21},"6179d3b6-dc34-4483-9ded-3cd9f1b37a47","科普","abbreviation","介绍各领域新兴概念",[23,27,31],{"id":24,"name":25,"slug":26},"88d2bc27-0e0f-468a-b907-2991cb97b87b","人工智能","ai",{"id":28,"name":29,"slug":30},"4c2bbea6-eab7-40a8-8447-1de478ff7749","分析","analyse",{"id":32,"name":33,"slug":34},"7c76bfc2-f80f-4ee0-a95d-27bd8708b434","技术","slug","资料来源","OpenAI：Why Language Models Hallucinate","https:\u002F\u002Fcdn.openai.com\u002Fpdf\u002Fd04913be-3f6f-4d2b-b283-ff432ef4aaa5\u002Fwhy-language-models-hallucinate.pdf","published",null,false,60,0,"2026-08-14T00:00:00.000Z","2026-08-14T05:36:02.275Z","2026-08-14T03:06:07.945Z",[47,56,64],{"id":48,"type":6,"title":49,"slug":50,"summary":51,"coverUrl":52,"authorName":14,"sno":53,"publishedAt":54,"createdAt":55},"f00e5274-8e0b-40fe-af3b-b6a8d0183b9c","一张贴纸就能骗过视觉 AI？对抗样本不是魔法","adversarial-examples-fool-visual-ai","人眼仍能认出的物体，经过精心设计的微小扰动或标记后，机器却可能改变判断。这类输入称为对抗样本。本文解释攻击者如何利用模型的决策边界，现实攻击为何比实验更难，以及为什么目前不存在一劳永逸的防御。","\u002Fuploads\u002F2026-09-08\u002F151f887b-c5f1-4647-b369-cdda8a1e1b4f.jpg",50,"2026-09-03T00:00:00.000Z","2026-08-14T03:06:09.765Z",{"id":57,"type":6,"title":58,"slug":59,"summary":60,"coverUrl":61,"authorName":14,"sno":41,"publishedAt":62,"createdAt":63},"305492d4-c146-456a-b341-31140ab9cafd","天气预报不再一格一格算空气，AI 是怎么预测风暴的？","how-ai-weather-forecasting-works","传统数值预报依据物理方程推进大气状态，AI 天气模型则从历史观测与再分析数据中学习状态如何演变。本文以 GraphCast 为例，解释图神经网络如何快速预测全球天气、它与传统方法如何协作，以及极端天气仍有哪些难点。","\u002Fuploads\u002F2026-08-16\u002Fa8b5ddad-d6db-4d12-a159-87a6c5309082.jpg","2026-08-16T00:00:00.000Z","2026-08-14T03:06:12.102Z",{"id":65,"type":6,"title":66,"slug":67,"summary":68,"coverUrl":69,"authorName":14,"sno":41,"publishedAt":43,"createdAt":70},"7f962194-e0c6-4072-9b50-c70054beb0e5","同一个问题问三遍，AI 为什么会给出三个答案？","why-ai-gives-different-answers-sampling","大模型每次回答都在从候选词中继续选择，而不是从数据库里取出一段固定文字。温度、Top-p 和随机采样共同决定回答更稳定还是更有变化。本文用抽签与岔路的比喻，解释 AI 的随机性从哪里来，以及什么时候应该追求一致。","\u002Fuploads\u002F2026-08-14\u002Fb322d338-b5c0-48c7-addf-fbd91421e316.jpg","2026-08-14T03:06:07.351Z"]