[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"$fnE3Fr06Zb9vhbbIY61o8AhULjJCtiyAK13FFBKR6w30":3},{"item":4,"related":51},{"id":5,"type":6,"title":7,"slug":8,"summary":9,"body":10,"coverUrl":11,"productScreenshots":12,"productLinks":13,"authorName":14,"authorUrl":15,"authorSubject":16,"category":17,"tags":22,"sourceLabel":39,"sourceName":40,"sourceUrl":41,"status":42,"seoTitle":43,"seoDescription":44,"canonicalUrl":45,"isFeatured":46,"sno":47,"sortOrder":48,"publishedAt":49,"updatedAt":50,"createdAt":50},"7645a21b-41c6-4aa4-a221-202846cdb37f","article","不做 OCR 也能搜 PDF？视觉文档检索怎么工作","colpali-visual-document-retrieval-explained","ColPali 直接把 PDF 页面作为图像进行多向量检索，保留表格、图表和版式信息。本文解释视觉文档检索、late interaction、RAG 接入方式和索引成本。","很多 PDF 看起来是“文字文档”，实际上信息可能藏在表格的空间关系、图表的坐标、标题的层级和页面的排版里。传统文档 RAG 通常先做 OCR，再把文字切块、嵌入和检索。只要 OCR 把表格列错位，或者把脚注和正文混在一起，后面的检索就会继承这个错误。\n\nColPali 提供了另一种思路：不急着把页面还原成纯文字，而是直接把渲染后的文档页面当作图像进行检索。它使用视觉语言模型为页面生成多向量表示，再用查询和页面之间的细粒度匹配找出相关页面。\n\n## 从一页 PDF 到一次检索\n\n可以把 ColPali 风格的流程拆成四步。第一步，把 PDF 页面渲染成图像；第二步，视觉编码器把页面中的文字、图表和布局转换成一组向量，而不是压缩成一个向量；第三步，查询文本也被编码成一组向量；第四步，在查询向量和页面向量之间执行 late interaction，计算它们的细粒度相关性。\n\n这里的“多向量”很关键。一页页面不是一个单一概念：左上角可能是标题，右侧是价格表，底部是脚注。保留多个局部表示，检索系统就有机会把查询中的不同词与页面上不同区域对应起来，而不是让所有信息被平均到一个向量中。\n\n```mermaid\nflowchart TD\n    A[PDF 页面] --> B[渲染为页面图像]\n    B --> C[视觉编码器]\n    C --> D[页面多向量索引]\n    E[用户查询] --> F[查询编码器]\n    F --> G[查询多向量]\n    D --> H[Late Interaction \u002F MaxSim]\n    G --> H\n    H --> I[返回相关页面给 RAG 或 VLM]\n```\n\n## 它为什么能避开一部分 OCR 问题\n\nOCR 管线的优势是结果容易进入传统搜索和数据库：你可以按词、段落、页码和坐标索引文本。但它也需要在识别、阅读顺序、表格恢复和图片理解之间做一连串转换。视觉检索直接保留页面外观，因此对复杂排版、表格和图文混排更自然。\n\n这并不意味着 OCR 没用了。检索只需要回答“哪一页可能相关”，而最终回答往往仍需要精确读取数字、复制字段或引用原文。实际系统可以把视觉检索用作第一阶段召回，再用 OCR、版面分析或视觉语言模型完成第二阶段抽取。\n\n## 多向量也带来新的成本\n\n一页文档不再对应一个向量，而是对应一组与图像 patch 或视觉 token 相关的向量。页面越多，索引占用和相似度计算就越需要规划。查询时的 late interaction 也比单向量近邻搜索更复杂，必须考虑候选数量、向量压缩、缓存和批处理。\n\n另外，视觉模型并不会自动解决所有语义问题。低分辨率扫描件、手写内容、极细小字体和跨页表格仍然可能被误读；只检索到正确页面，也不代表模型就能准确解释其中的数字。因此，评测不能只看页面召回率，还要看最终回答是否引用了正确区域、是否保留了表格关系，以及不同文档模板之间能否泛化。\n\n## 适合什么场景\n\n视觉文档检索适合合同、财报、说明书、表单、学术论文和带大量图表的企业资料。对于结构简单、纯文本占主导的知识库，普通文本嵌入可能更便宜、更容易维护。选择 ColPali 一类方案的理由，不应该是“视觉模型更先进”，而应该是原始文档的视觉结构本身就是信息。\n\nColPali 的启发不只是换了一个嵌入模型，而是重新定义了文档进入检索系统的方式：文档不一定要先被压扁成文字，页面的空间和视觉结构也可以成为可检索的表示。对 RAG 来说，这为复杂 PDF 提供了一条更接近原始信息形态的路径，但工程上仍需要在召回质量、索引成本和精确抽取之间做平衡。\n\n来源：[ColPali：Efficient Document Retrieval with Vision Language Models](https:\u002F\u002Farxiv.org\u002Fabs\u002F2407.01449)","\u002Fuploads\u002F2026-09-12\u002F1adbb11c-8c10-4034-95e1-b488e3188b9b.jpg",[],[],"Foundit","https:\u002F\u002Ffoundit.cn","foundit-ai-editorial",{"id":18,"name":19,"slug":20,"description":21},"6179d3b6-dc34-4483-9ded-3cd9f1b37a47","科普","abbreviation","介绍各领域新兴概念",[23,27,31,35],{"id":24,"name":25,"slug":26},"88d2bc27-0e0f-468a-b907-2991cb97b87b","人工智能","ai",{"id":28,"name":29,"slug":30},"a2ccffe0-49b2-458b-baf6-a83a1b20443d","大语言模型","llm",{"id":32,"name":33,"slug":34},"4c2bbea6-eab7-40a8-8447-1de478ff7749","分析","analyse",{"id":36,"name":37,"slug":38},"7c76bfc2-f80f-4ee0-a95d-27bd8708b434","技术","slug","ColPali 研究论文","ColPali: Efficient Document Retrieval with Vision Language Models","https:\u002F\u002Farxiv.org\u002Fabs\u002F2407.01449","published","ColPali 是什么：用视觉语言模型检索 PDF 文档","解释 ColPali 如何绕过纯 OCR 流程，直接对 PDF 页面图像建立多向量索引，并分析视觉 RAG 的优势与成本。",null,false,52,0,"2026-09-12T00:00:00.000Z","2026-09-12T03:56:48.776Z",[52,62,72],{"id":53,"type":6,"title":54,"slug":55,"summary":56,"coverUrl":57,"authorName":58,"sno":59,"publishedAt":60,"createdAt":61},"35a3e5ea-b651-45b6-9b82-d0c4aac1006a","如何让内容更容易被国内大模型引用","geo-in-china","通过可抓取的页面、结构化的答案、可信的证据和多平台权威分发，让大模型更容易发现、理解、信任并引用内容。","https:\u002F\u002Foxqtewbrpuiouqqjrvdv.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fpublic-media\u002F2026-07-17\u002F7d9c4c0e-eb28-4011-9b18-f7e7212eaa9f.jpg","龙家轩",49,"2026-07-17T00:00:00.000Z","2026-07-17T04:40:14.581Z",{"id":63,"type":6,"title":64,"slug":65,"summary":66,"coverUrl":67,"authorName":68,"sno":69,"publishedAt":70,"createdAt":71},"7f4dc034-e104-4542-bea6-1148e984189e","构建高效的智能体","building-effective-agents","最成功的效果并没有使用复杂的框架或专门的库。相反，它们是用简单、可组合的模式构建出来的。","https:\u002F\u002Foxqtewbrpuiouqqjrvdv.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fpublic-media\u002F2026-07-17\u002F826eb252-ac2b-4588-9d03-5138802a0d8b.jpg","Anthropic",2,"2024-12-19T00:00:00.000Z","2026-07-17T02:51:58.572Z",{"id":73,"type":6,"title":74,"slug":75,"summary":76,"coverUrl":77,"authorName":14,"sno":78,"publishedAt":79,"createdAt":80},"f00e5274-8e0b-40fe-af3b-b6a8d0183b9c","一张贴纸就能骗过视觉 AI？对抗样本不是魔法","adversarial-examples-fool-visual-ai","人眼仍能认出的物体，经过精心设计的微小扰动或标记后，机器却可能改变判断。这类输入称为对抗样本。本文解释攻击者如何利用模型的决策边界，现实攻击为何比实验更难，以及为什么目前不存在一劳永逸的防御。","\u002Fuploads\u002F2026-09-08\u002F151f887b-c5f1-4647-b369-cdda8a1e1b4f.jpg",50,"2026-09-03T00:00:00.000Z","2026-08-14T03:06:09.765Z"]