[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"$fq1ek1SCfCblrhJDiUmyHelwZ7ERwt3keJ6h0uhx25sA":3},{"item":4,"related":46},{"id":5,"type":6,"title":7,"slug":8,"summary":9,"body":10,"coverUrl":11,"productScreenshots":12,"productLinks":13,"authorName":14,"authorUrl":15,"authorSubject":16,"category":17,"tags":22,"sourceLabel":35,"sourceName":36,"sourceUrl":37,"status":38,"seoTitle":39,"seoDescription":39,"canonicalUrl":39,"isFeatured":40,"sno":41,"sortOrder":42,"publishedAt":43,"updatedAt":44,"createdAt":45},"62724dbd-ce49-4be9-afa9-4ba127513a62","article","语音搜索一定先变成文字吗？AI 开始绕过转写这一步","speech-to-retrieval-without-transcription","传统语音搜索先把声音转成文字，再拿文字查资料，一次听错就可能让搜索方向完全跑偏。Speech-to-Retrieval 尝试直接把语音与相关文档映射到同一个语义空间。本文用蒙克名画的例子讲清新旧架构及其边界。","你对手机说“搜索蒙克的《呐喊》”，传统语音搜索通常先把声音转成文字，再用文字检索。假如语音识别把英文里的 `Scream` 听成 `screen`，搜索系统便可能认真返回一堆屏幕绘画结果。第二步做得再好，也救不回第一步改变的意思。\n\n这是一种典型的流水线错误：声音先经过语音识别，文字再进入搜索，一个环节的小偏差会传给后面所有环节。新的 Speech-to-Retrieval（语音到检索，简称 S2R）尝试绕过完整转写，直接从声音抵达检索意图。\n\n## 旧流程在寻找“你说了哪些字”\n\n自动语音识别擅长把声波变成文字。对于写字幕、会议记录和语音输入法，这个中间文本本身就是产品需要的结果。但搜索真正想知道的不是每个字如何拼写，而是用户要找什么信息。\n\n人名、地名、外语词和口音最容易暴露矛盾。一段声音可能存在多个相近转写，只有结合网页内容才能知道哪一个更合理。流水线却往往先确定文字，后面的搜索只能接受这个决定。\n\nGoogle Research 在 2025 年介绍的 [S2R 系统](https:\u002F\u002Fresearch.google\u002Fblog\u002Fspeech-to-retrieval-s2r-a-new-approach-to-voice-search\u002F)改变了目标：不要求先得到完美文字，而是学习语音与相关文档之间的对应关系。\n\n## 把声音和文档放到同一张地图\n\nS2R 使用两个编码器。音频编码器把语音转换成一串代表含义的数字，文档编码器也把网页转换成同类表示。训练时，系统拿到语音查询与相关文档的配对，让相关内容在这张数学地图上靠近，不相关内容远离。\n\n当用户发起查询，音频编码器生成查询向量，检索系统先找附近的文档候选，再结合更多质量与相关性信号排序。声音不必先变成一条可展示的完整文字，便能参与搜索。\n\n```mermaid\nflowchart TD\n    A[用户语音] --> B[音频编码器]\n    B --> C[语义向量]\n    D[网页文档] --> E[文档编码器]\n    E --> F[文档向量索引]\n    C --> G[寻找相近文档]\n    F --> G\n    G --> H[排序并返回结果]\n```\n\n这不表示系统完全抛弃语言。训练资料、文档内容和最终结果仍与语言密切相关，只是在线检索时不再把“完美转写”设为必经关卡。\n\n## 它能保留声音中的一切吗\n\n直接语音检索有机会利用文字转写容易丢失的信息，例如发音差异、停顿或上下文线索。但模型是否真正使用这些信号，取决于训练目标和数据。情绪、身份和背景噪声也可能成为不应使用的敏感特征，因此隐私与公平评测同样重要。\n\nGoogle 公布的系统在多语言语音问题数据集上优于级联语音识别基线，并接近使用正确转写的上限，但研究方也明确承认仍有差距。长问题、环境嘈杂、全新专有名词和资料库没有覆盖的查询，依旧可能失败。\n\n## 绕过转写不等于转写没有价值\n\n如果用户需要看到并编辑查询文字，或者系统必须留下可审计记录，转写仍然重要。实际产品也可以采用混合方案：直接语音表示提供检索信号，文字转写帮助展示、纠错和过滤。\n\nS2R 带来的变化更像重新定义问题。过去系统先问：“你究竟说了哪些字？”现在它可以同时追问：“你究竟想找什么？”当中间文本容易成为瓶颈时，直接学习输入与目标之间的关系，可能比把每个环节都做成独立完美的模块更有效。","\u002Fuploads\u002F2026-09-08\u002Fe1173842-1ec4-48f3-8349-240fc2d78197.jpg",[],[],"Foundit","https:\u002F\u002Ffoundit.cn","f39339b1-aaa6-4e86-b0c2-a6e6a21113b5",{"id":18,"name":19,"slug":20,"description":21},"6179d3b6-dc34-4483-9ded-3cd9f1b37a47","科普","abbreviation","介绍各领域新兴概念",[23,27,31],{"id":24,"name":25,"slug":26},"7c76bfc2-f80f-4ee0-a95d-27bd8708b434","技术","slug",{"id":28,"name":29,"slug":30},"4c2bbea6-eab7-40a8-8447-1de478ff7749","分析","analyse",{"id":32,"name":33,"slug":34},"144abe77-0dc6-4f66-a176-20bddb1c0bfa","编程","coding","资料来源","Google Research：Speech-to-Retrieval","https:\u002F\u002Fresearch.google\u002Fblog\u002Fspeech-to-retrieval-s2r-a-new-approach-to-voice-search\u002F","published",null,false,50,0,"2026-08-30T00:00:00.000Z","2026-09-08T02:07:03.736Z","2026-08-14T03:06:11.525Z",[47,56,65],{"id":48,"type":6,"title":49,"slug":50,"summary":51,"coverUrl":52,"authorName":14,"sno":53,"publishedAt":54,"createdAt":55},"0999bb14-a97c-4003-84e7-61ad2da998e0","文件删除以后去了哪里？为什么有时还能恢复？","where-deleted-files-go-data-recovery","普通删除往往只是移除文件系统里的索引并把空间标记为可重用，数据本身未必立即消失；SSD 的 TRIM、磨损均衡与加密又让情况更加复杂。本文区分回收站、删除、覆盖和安全清除，说明何时应停止写入设备。","\u002Fuploads\u002F2026-09-08\u002Fb7222764-de75-4863-8679-0a94a8965af3.jpg",51,"2026-08-20T00:00:00.000Z","2026-08-14T03:06:15.710Z",{"id":57,"type":6,"title":58,"slug":59,"summary":60,"coverUrl":61,"authorName":14,"sno":62,"publishedAt":63,"createdAt":64},"55f42805-a25a-4ce3-89d9-121b9a268a8f","0.1＋0.2 为什么不等于 0.3？计算机真的算错了吗？","why-point-one-plus-point-two-not-point-three","许多十进制小数无法用有限位二进制精确表示，计算机只能保存最接近的值。微小误差在显示时常被隐藏，却会在比较、累计和金额计算中冒出来。本文用三分之一的类比讲清浮点数，并给出可靠的处理原则。","\u002Fuploads\u002F2026-09-08\u002Ffd3a7daf-2a2c-4ef0-8f57-38f1d9de962c.jpg",54,"2026-09-06T00:00:00.000Z","2026-08-14T03:06:15.129Z",{"id":66,"type":6,"title":67,"slug":68,"summary":69,"coverUrl":70,"authorName":14,"sno":71,"publishedAt":72,"createdAt":73},"858bf91b-e11c-4ead-96e1-4fc3eb99ab5d","HTTPS 握手：浏览器和服务器刚连上时到底在聊什么","tls-13-handshake-explained","TLS 1.3 握手用证书确认身份，用密钥协商建立共享秘密，再用 Finished 消息确认双方看到的是同一条会话。本文按消息顺序拆解 1-RTT 握手、前向保密、0-RTT 重放风险，以及 HTTPS 的保护边界。","\u002Fuploads\u002F2026-08-09\u002F16956b29-034c-4cbc-a6ca-80d04f65774d.jpg",65,"2026-08-09T00:00:00.000Z","2026-08-09T12:13:31.177Z"]