[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"$fiaj4ET0w6J2qJQEm-IUuHVQdT8hjU66p2B0kI14vT8I":3},{"item":4,"related":51},{"id":5,"type":6,"title":7,"slug":8,"summary":9,"body":10,"coverUrl":11,"productScreenshots":12,"productLinks":13,"authorName":14,"authorUrl":15,"authorSubject":16,"category":17,"tags":22,"sourceLabel":43,"sourceName":43,"sourceUrl":43,"status":44,"seoTitle":43,"seoDescription":43,"canonicalUrl":43,"isFeatured":45,"sno":46,"sortOrder":47,"publishedAt":48,"updatedAt":49,"createdAt":50},"ce9e6553-0ad3-45a5-86c8-63c9c58b4b61","article","RAG是什么？","what-is-rag","Retrieval-Augmented Generation，中文通常译为“检索增强生成”，其核心在于让大模型先查找相关资料，再根据资料组织答案","大语言模型能够写文章、总结材料、回答问题，但它并不是一个实时更新且绝对可靠的知识库。模型掌握的知识主要来自训练数据：它可能不了解训练结束后发生的事情，也无法自然获取企业内部文件；遇到不确定的问题时，还可能生成看似合理、实际上并不存在的内容。\n\nRAG，即Retrieval-Augmented Generation，中文通常译为“检索增强生成”，就是为解决这些问题而出现的一种技术架构。它的核心思路非常简单：\n\n**不要让大模型只凭记忆回答，而是先查找相关资料，再根据资料组织答案。**\n\n## 一、可以把RAG理解为“开卷考试”\n\n普通大模型回答问题，更像一场闭卷考试。它只能依靠训练过程中记住的知识进行推断。\n\nRAG则像一场开卷考试。当用户提出问题时，系统先从指定的知识库、数据库、网页或文件中找到相关内容，再把这些内容连同问题一起交给大模型。模型阅读资料后，整理出自然语言答案。\n\n例如，一名员工询问：\n\n> 公司一年有多少天带薪年假？\n\n没有RAG时，大模型可能根据一般劳动制度给出一个通用答案，但这个答案未必符合该公司的实际规定。\n\n使用RAG后，系统会先从公司的员工手册中找到“休假制度”相关段落，再要求大模型依据该段落回答，并附上文件名称或原文位置。这样得到的答案更贴近企业实际，也更容易核查。\n\nRAG这一名称来自Patrick Lewis等研究者在2020年发表的论文。该研究将预训练生成模型的“参数化记忆”与外部文档索引形成的“非参数化记忆”结合，用于知识密集型问答和文本生成任务。([arXiv](https:\u002F\u002Farxiv.org\u002Fabs\u002F2005.11401?utm_source=chatgpt.com))\n\n## 二、RAG通常怎样工作？\n\n一个基础的RAG系统可以分为“资料准备”和“问题回答”两个阶段。\n\n### 1.收集和处理资料\n\n系统首先导入可能被查询的资料，例如产品说明书、规章制度、客服记录、研究报告、网页、数据库内容和新闻文章。\n\n由于文档往往很长，系统不会直接把整份文件交给大模型，而是将其拆分成较小的文本片段。这个过程通常称为“分块”或“切片”。\n\n每个文本片段随后会通过Embedding模型转换成一组数字，也就是“向量”。这些向量可以在数学空间中表达文本的大致语义。例如，“年假规定”和“员工休假制度”虽然用词不同，但对应向量通常会比较接近。处理后的向量会被保存到向量数据库或搜索索引中。([微软学习](https:\u002F\u002Flearn.microsoft.com\u002Fen-us\u002Fazure\u002Fstorage\u002Ffiles\u002Fartificial-intelligence\u002Fretrieval-augmented-generation\u002Foverview?utm_source=chatgpt.com))\n\n### 2.理解用户问题\n\n当用户提出问题时，系统同样会把问题转换成向量，有时还会先进行关键词提取、意图识别或问题改写。\n\n例如，用户问“去年买的设备还能免费维修吗”，系统可能将其改写为更适合搜索的问题：“产品保修期限和免费维修条件是什么？”\n\n### 3.检索相关内容\n\n系统将问题与知识库中的文本片段进行比较，找出语义最接近的若干段内容。\n\n实际系统通常不只使用向量检索。向量检索善于理解语义，但对产品型号、人名、编号和精确术语可能不够敏感。因此，企业级RAG经常把关键词检索与向量检索结合起来，形成“混合检索”。候选内容还可以通过Rerank模型重新排序，把真正相关的内容放在前面。([华为云帮助中心](https:\u002F\u002Fsupport.huaweicloud.com\u002Fproductdesc-agentarts0\u002Fagentarts_03_0010.html?utm_source=chatgpt.com))\n\n### 4.把资料交给大模型\n\n系统将检索到的内容放进提示词，大致形成如下指令：\n\n> 请只根据以下资料回答用户问题。资料没有提供答案时，请明确说明无法确定，并列出引用来源。\n\n大模型随后根据这些资料进行归纳、解释或总结，最终生成易于阅读的答案。\n\n因此，RAG并不是重新训练一个大模型，而是在模型回答之前，为它临时补充一份与当前问题相关的参考资料。\n\n## 三、RAG能解决什么问题？\n\n### 1.接入模型没有学过的私有知识\n\n企业合同、内部流程、项目文档和个人资料通常不会出现在大模型的训练数据中。RAG可以把这些资料接入现有模型，而不必为每批新文档重新训练模型。\n\n因此，企业知识助手、内部客服、合同查询、技术文档问答和个人知识库，都是RAG最常见的应用。\n\n### 2.使用持续更新的信息\n\n模型的训练数据存在时间边界，而外部知识库可以随时更新。只要重新收录最新文档，RAG就能在回答时使用较新的产品信息、政策内容、库存数据或新闻资料。([Google Cloud](https:\u002F\u002Fcloud.google.com\u002Fuse-cases\u002Fretrieval-augmented-generation?hl=zh-CN&utm_source=chatgpt.com))\n\n### 3.降低部分事实性幻觉\n\nRAG为模型提供了明确的参考内容，使回答能够建立在真实文档之上。它还可以要求系统为答案标记出处，方便用户返回原文核查。\n\n不过，RAG只能降低幻觉风险，不能彻底消除幻觉。如果系统找错了资料、资料本身存在错误，或者模型误解了检索结果，仍然可能生成错误答案。([WIRED](https:\u002F\u002Fwww.wired.com\u002Fstory\u002Freduce-ai-hallucinations-with-rag?utm_source=chatgpt.com))\n\n### 4.降低知识更新成本\n\n微调需要准备训练数据并执行训练过程，适合调整模型的表达方式、任务能力或行为模式。RAG则更适合补充经常变化、需要引用来源的事实知识。\n\n例如，公司制度更新时，RAG系统通常只需要更新知识库；如果试图通过反复微调让模型记住每次制度变化，成本更高，也更难保证旧知识被彻底覆盖。\n\n## 四、RAG并不是“上传文档就能准确回答”\n\nRAG的概念很直观，但真正做好并不简单。系统的最终效果取决于整条链路，而不仅仅取决于大模型能力。\n\n### 文档质量\n\n如果原始资料结构混乱、内容过时、相互矛盾，系统即使准确找到了相关段落，也可能得到错误结论。\n\n图片、扫描件、复杂表格和流程图也需要专门解析。若系统只能读取普通文本，图片中的操作步骤和表格关系可能在入库时直接丢失。([华为云帮助中心](https:\u002F\u002Fsupport.huaweicloud.com\u002Fbestpractice-agentarts\u002Fagentarts_06_0197.html?utm_source=chatgpt.com))\n\n### 文本分块\n\n切片太短，内容可能失去上下文；切片太长，又会混入大量无关信息。\n\n例如，将“退款条件”和下一节“账户注销说明”放进同一个文本块，可能让系统在回答退款问题时同时召回无关内容。合理的切片通常要参考标题层级、段落结构、表格边界和语义完整性，而不是简单地每隔固定字数切开。\n\n### 检索准确率\n\nRAG系统首先要“找对”，之后才能“答对”。\n\n如果问题是“AX-107设备的保修期”，仅依靠语义相似度，系统可能召回其他型号的保修说明。因此，实际系统往往需要结合关键词匹配、元数据过滤、混合检索和重排序。\n\n### 回答边界\n\n知识库中没有答案时，系统应当明确表示“不知道”或“资料中没有说明”，而不是让大模型根据常识自行补充。\n\n一个可靠的RAG系统不仅要评估答案是否流畅，还要评估检索是否正确、答案是否受到资料支持、引用是否准确，以及面对知识范围之外的问题能否合理拒答。([华为云帮助中心](https:\u002F\u002Fsupport.huaweicloud.com\u002Fbestpractice-agentarts\u002Fagentarts_06_0092.html?utm_source=chatgpt.com))\n\n## 五、RAG、联网搜索和模型微调有什么区别？\n\nRAG是一种架构，知识来源既可以是企业内部数据库，也可以是互联网搜索结果。\n\n联网搜索可以看成一种面向公开网络的检索方式。它能够获得较新的公开信息，但网络内容质量不一，搜索结果也可能变化。\n\n私有知识库RAG的资料范围更可控，适合企业制度、产品文档和内部数据，但只能回答知识库已经收录的内容。\n\n微调则主要改变模型的行为模式和任务能力。例如，让模型学会特定写作风格、分类规则或固定输出格式。它并不天然适合保存大量持续变化、需要精确引用的事实内容。\n\n在实际应用中，这几种技术并不冲突。一个系统可以先通过RAG获取内部资料和联网信息，再使用经过微调的模型按照规定格式生成答案。\n\n## 六、RAG适合哪些场景？\n\nRAG特别适合以下类型的应用：\n\n- 企业内部知识问答；\n- 产品客服和售后助手；\n- 法律、医疗、科研文献检索辅助；\n- 软件开发文档助手；\n- 新闻资料和政策文件查询；\n- 个人笔记与文件问答；\n- 带有来源引用的搜索和研究工具。\n\n它尤其适合那些“答案必须以指定资料为依据”的任务。\n\n相反，如果任务主要是创意写作、闲聊、翻译或通用文本润色，RAG未必能够带来明显价值。对于要求执行计算、调用接口或操作业务系统的任务，通常还需要工具调用、工作流或智能体系统配合，而不能只依赖RAG。\n\n## 七、从基础RAG到高级RAG\n\n最基础的RAG通常只是“问题向量化—检索若干片段—交给模型回答”。高级系统则会增加更多步骤，例如：\n\n- 根据对话历史改写问题；\n- 把复杂问题拆分为多个子问题；\n- 同时使用关键词检索和语义检索；\n- 根据部门、时间、权限等元数据过滤结果；\n- 对候选内容进行重排序；\n- 检查答案中的每个结论是否受到引用内容支持；\n- 检索结果不足时再次搜索；\n- 针对表格、图片、音频和视频建立多模态索引。\n\n这些改进的目标都是相同的：让系统找得更准、引用更可靠，并在缺乏依据时停止回答。相关综述通常将RAG的发展划分为基础RAG、高级RAG和模块化RAG等方向。([arXiv](https:\u002F\u002Farxiv.org\u002Fabs\u002F2402.19473?utm_source=chatgpt.com))\n\n## 结语\n\nRAG没有让大模型真正“记住”更多知识，而是为大模型增加了一套查找和使用外部资料的机制。\n\n它把传统搜索系统擅长的“找到信息”，与大语言模型擅长的“理解和表达”组合起来，使AI能够使用私有知识、较新资料和可追溯来源回答问题。\n\n但RAG并不是消除错误的万能方案。它的可靠性取决于资料质量、文档解析、文本分块、检索算法、提示词设计和系统评估。一个优秀的RAG应用，重点不只是让模型回答得更像人，而是让每个重要结论都能找到依据，并让系统知道什么时候不应该回答。\n\n## 引用来源\n\n1. Patrick Lewis等，《Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks》，NeurIPS 2020。([arXiv](https:\u002F\u002Farxiv.org\u002Fabs\u002F2005.11401?utm_source=chatgpt.com))\n2. Meta AI，《Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks》。([Meta AI](https:\u002F\u002Fai.meta.com\u002Fresearch\u002Fpublications\u002Fretrieval-augmented-generation-for-knowledge-intensive-nlp-tasks\u002F?utm_source=chatgpt.com))\n3. Google Cloud，《什么是检索增强生成（RAG）？》。([Google Cloud](https:\u002F\u002Fcloud.google.com\u002Fuse-cases\u002Fretrieval-augmented-generation?hl=zh-CN&utm_source=chatgpt.com))\n4. Microsoft Learn，《Retrieval Augmented Generation in Azure AI Search》。([微软学习](https:\u002F\u002Flearn.microsoft.com\u002Fen-us\u002Fazure\u002Fsearch\u002Fretrieval-augmented-generation-overview?utm_source=chatgpt.com))\n5. Amazon Web Services，《What is RAG?》。([Amazon Web Services, Inc.](https:\u002F\u002Faws.amazon.com\u002Fwhat-is\u002Fretrieval-augmented-generation\u002F?utm_source=chatgpt.com))\n6. 华为云，《RAG技术原理》。([华为云帮助中心](https:\u002F\u002Fsupport.huaweicloud.com\u002Fbestpractice-agentarts\u002Fagentarts_06_0198.html?utm_source=chatgpt.com))\n7. 华为云，《基本概念：RAG、Embedding模型、Rerank模型》。([华为云帮助中心](https:\u002F\u002Fsupport.huaweicloud.com\u002Fproductdesc-koosearch\u002Fkoosearch_03_0021.html?utm_source=chatgpt.com))\n8. 华为云，《影响RAG效果的因素》。([华为云帮助中心](https:\u002F\u002Fsupport.huaweicloud.com\u002Fbestpractice-agentarts\u002Fagentarts_06_0199.html?utm_source=chatgpt.com))\n9. 华为云，《企业知识问答助手（RAG）智能体评估》。([华为云帮助中心](https:\u002F\u002Fsupport.huaweicloud.com\u002Fbestpractice-agentarts\u002Fagentarts_06_0092.html?utm_source=chatgpt.com))\n10. Penghao Zhao等，《Retrieval-Augmented Generation for AI-Generated Content: A Survey》。([arXiv](https:\u002F\u002Farxiv.org\u002Fabs\u002F2402.19473?utm_source=chatgpt.com))\n11. Shangyu Wu等，《Retrieval-Augmented Generation for Natural Language Processing: A Survey》。([arXiv](https:\u002F\u002Farxiv.org\u002Fabs\u002F2407.13193?utm_source=chatgpt.com))\n12. Datawhale，《All-in-RAG：RAG技术全栈指南》。([GitHub](https:\u002F\u002Fgithub.com\u002Fdatawhalechina\u002Fall-in-rag?utm_source=chatgpt.com))","https:\u002F\u002Foxqtewbrpuiouqqjrvdv.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fpublic-media\u002F2026-07-17\u002Fc152c56f-9e9d-4621-8467-85c414b3e101.jpg",[],[],"GPT-5.6 Sol","https:\u002F\u002Fopenai.com\u002Fzh-Hans-CN\u002Findex\u002Fgpt-5-6\u002F","f39339b1-aaa6-4e86-b0c2-a6e6a21113b5",{"id":18,"name":19,"slug":20,"description":21},"6179d3b6-dc34-4483-9ded-3cd9f1b37a47","科普","abbreviation","介绍各领域新兴概念",[23,27,31,35,39],{"id":24,"name":25,"slug":26},"0848beb4-db26-4fb8-b391-f852a11be192","AI编程","ai-coding",{"id":28,"name":29,"slug":30},"7c76bfc2-f80f-4ee0-a95d-27bd8708b434","技术","slug",{"id":32,"name":33,"slug":34},"88d2bc27-0e0f-468a-b907-2991cb97b87b","人工智能","ai",{"id":36,"name":37,"slug":38},"a2ccffe0-49b2-458b-baf6-a83a1b20443d","大语言模型","llm",{"id":40,"name":41,"slug":42},"d2513b48-43d7-49ba-adac-6d09366f751f","内容由AI生成","gen-by-ai",null,"published",false,48,0,"2026-07-01T00:00:00.000Z","2026-07-18T15:02:36.652Z","2026-07-17T10:19:33.353Z",[52,62,71],{"id":53,"type":6,"title":54,"slug":55,"summary":56,"coverUrl":57,"authorName":58,"sno":59,"publishedAt":60,"createdAt":61},"d4facd11-ef4b-4f61-a556-b4defcdfe98d","语言模型中的全局工作区","global-workspace","Claude发展出了一小组内部神经模式，与它的所有其他内部处理相比，这些模式扮演着特殊的角色","https:\u002F\u002Foxqtewbrpuiouqqjrvdv.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fpublic-media\u002F2026-07-17\u002F9b9914d4-9a89-477f-99f4-a081f4538df0.jpg","Anthropic",1,"2026-07-06T00:00:00.000Z","2026-07-17T01:25:49.821Z",{"id":63,"type":6,"title":64,"slug":65,"summary":66,"coverUrl":67,"authorName":58,"sno":68,"publishedAt":69,"createdAt":70},"7f4dc034-e104-4542-bea6-1148e984189e","构建高效的智能体","building-effective-agents","最成功的效果并没有使用复杂的框架或专门的库。相反，它们是用简单、可组合的模式构建出来的。","https:\u002F\u002Foxqtewbrpuiouqqjrvdv.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fpublic-media\u002F2026-07-17\u002F826eb252-ac2b-4588-9d03-5138802a0d8b.jpg",2,"2024-12-19T00:00:00.000Z","2026-07-17T02:51:58.572Z",{"id":72,"type":6,"title":73,"slug":74,"summary":75,"coverUrl":76,"authorName":77,"sno":78,"publishedAt":79,"createdAt":80},"5ef7ce44-0678-40b4-95e0-af4fe8a6b0a7","提示词也能缓存：固定前缀为什么能省钱提速？","prompt-caching-prefix-kv-cache","Prompt caching 缓存的不是旧答案，而是模型处理重复提示词前缀时产生的中间状态。本文解释它与语义缓存的区别、为什么顺序会影响命中、如何整理 Agent 上下文，以及多租户场景中的隔离风险。","\u002Fuploads\u002F2026-09-08\u002F182822f9-05a3-4d2b-8766-bc5daf93effd.jpg","Foundit",42,"2026-09-08T00:00:00.000Z","2026-09-08T03:19:26.522Z"]