[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"$f5Q6gwrFIzvvqjX9hL0tKlb5mSZKIEXWRQNd6tXvUTVA":3},{"item":4,"related":51},{"id":5,"type":6,"title":7,"slug":8,"summary":9,"body":10,"coverUrl":11,"productScreenshots":12,"productLinks":13,"authorName":14,"authorUrl":15,"authorSubject":16,"category":17,"tags":22,"sourceLabel":39,"sourceName":40,"sourceUrl":41,"status":42,"seoTitle":43,"seoDescription":44,"canonicalUrl":45,"isFeatured":46,"sno":47,"sortOrder":48,"publishedAt":49,"updatedAt":50,"createdAt":50},"afc03b50-8146-4a47-9596-9ef29a87ec7d","article","Diffusion LLM：语言模型也能从噪声里逐步生成文字吗？","diffusion-llm-masked-language-generation","Diffusion LLM 不按单一的从左到右顺序生成文字，而是通过多轮掩码恢复逐步确定 token。本文解释它与自回归模型的区别、并行生成潜力、训练目标和现实限制。","大多数语言模型生成文本时都遵循一个方向：从左到右，先预测第一个 token，再根据已有内容预测下一个 token。这个过程很稳定，也很容易流式输出，但它意味着后面的文字必须等待前面的文字生成完。写错了开头，模型通常也不会回头修改，只能继续把错误补下去。\n\nDiffusion LLM 探索的是另一种生成方式。它先把整段文本看成带有大量掩码或噪声的状态，再经过多轮预测，逐步把不确定位置还原成具体 token。它借用了图像扩散模型“从噪声中逐步生成”的直觉，但文本扩散面对的是离散 token，而不是连续像素。\n\n## 从“下一个词”到“下一批未知位置”\n\n自回归模型每一步主要处理序列末尾；掩码扩散语言模型则可以同时处理多个仍然未知的位置。一次去噪步骤可能先确定一个置信度较高的词，再把剩余掩码交给下一轮。随着迭代进行，句子的结构、词语和局部细节逐渐变得明确。\n\n可以把它想象成做填字游戏：第一轮不要求立刻填完所有格子，而是先填最确定的答案；下一轮利用已有交叉关系继续缩小不确定性。这里的“确定”由模型分布和采样策略决定，并不是模型真的拥有一个独立的人类式草稿区。\n\n## 为什么有人研究它\n\n第一，多个位置存在并行处理的可能性。自回归生成必须等待前一个 token，而扩散式生成可以在一轮中处理多个位置，理论上为延迟和吞吐提供新的优化空间。第二，双向上下文更自然。一个位置的预测可以同时参考左边和右边的信息，这对填空、改写和受约束生成尤其有吸引力。第三，生成过程更容易被看作“反复编辑”，而不是一条只能向前走的链。\n\n但这些优势不是自动兑现的。扩散模型往往需要多轮迭代，每轮都要运行网络；如果迭代次数太多，单次请求未必比自回归生成更快。并行计算也会受到显存、调度和硬件利用率影响。模型需要学习合理的掩码策略和去噪顺序，否则可能出现局部词语看似正确、整体语义却不连贯的情况。\n\n## 训练目标与推理策略\n\n扩散语言模型的训练通常会对文本施加掩码或噪声，再让模型恢复被破坏的 token。研究者可以设计不同的噪声调度、掩码比例和损失加权方式，也可以让模型学习哪些位置应该优先解除掩码。相关研究还会观察稀有 token、语言能力和数据效率之间的关系。\n\n推理时则需要决定三件事：每轮要更新多少位置，哪些位置保持不动，以及何时认为结果已经足够稳定。更新太少会拖慢生成，更新太多可能让模型反复改动已经正确的内容。对文本来说，“噪声”不是简单的视觉雪花，而是离散符号空间中的不确定性，因此采样控制和终止条件都需要重新设计。\n\n## 它会取代自回归模型吗\n\n目前更稳妥的判断是：Diffusion LLM 是值得观察的生成范式，而不是已经完成替代的结论。自回归模型在流式输出、工具调用、长文本续写和生态支持上仍然有明显优势；扩散式模型则可能在并行生成、文本编辑、受约束填充和某些数据受限训练场景中形成差异化能力。\n\n理解它最重要的地方，不是记住“扩散也能生成文字”，而是看到语言生成并不只有一种时间顺序。未来的模型可能根据任务，在左到右续写、双向填充和多轮编辑之间选择不同的生成路径。相关结果仍应以具体模型、数据集和推理实现为准，不能把论文中的研究性结论直接当成生产环境性能承诺。\n\n来源：[Masked Diffusion Language Models with Frequency-Informed Training](https:\u002F\u002Farxiv.org\u002Fabs\u002F2509.05056)","\u002Fuploads\u002F2026-09-12\u002F117f7406-bd6c-4bad-861c-5ab835ae8e91.jpg",[],[],"Foundit","https:\u002F\u002Ffoundit.cn","foundit-ai-editorial",{"id":18,"name":19,"slug":20,"description":21},"6179d3b6-dc34-4483-9ded-3cd9f1b37a47","科普","abbreviation","介绍各领域新兴概念",[23,27,31,35],{"id":24,"name":25,"slug":26},"88d2bc27-0e0f-468a-b907-2991cb97b87b","人工智能","ai",{"id":28,"name":29,"slug":30},"a2ccffe0-49b2-458b-baf6-a83a1b20443d","大语言模型","llm",{"id":32,"name":33,"slug":34},"68cedb55-2cac-412f-8f81-fda8c7d686dd","思考","thought",{"id":36,"name":37,"slug":38},"4c2bbea6-eab7-40a8-8447-1de478ff7749","分析","analyse","扩散语言模型研究论文","Masked Diffusion Language Models with Frequency-Informed Training","https:\u002F\u002Farxiv.org\u002Fabs\u002F2509.05056","published","Diffusion LLM 详解：扩散模型如何生成文字","从掩码、去噪和多轮迭代出发，解释 Diffusion LLM 与自回归语言模型的差异、并行生成潜力和工程限制。",null,false,45,0,"2026-09-12T00:00:00.000Z","2026-09-12T03:56:51.479Z",[52,61,71],{"id":53,"type":6,"title":54,"slug":55,"summary":56,"coverUrl":57,"authorName":14,"sno":58,"publishedAt":59,"createdAt":60},"36d074d9-5f45-4e1d-8571-53df99a71e87","让模型忘掉一条训练数据：机器遗忘到底能不能做到？","machine-unlearning-how-models-forget-data","删除训练文件并不代表模型已经忘记其中的信息。机器遗忘研究如何移除特定数据对模型参数的影响，同时保留其他能力。本文区分数据删除、模型遗忘和系统遗忘，解释验证方法、近似保证与工程预防措施。","\u002Fuploads\u002F2026-09-08\u002F0e9bf98c-a37a-4b6e-8aec-376cba810efd.jpg",57,"2026-09-08T00:00:00.000Z","2026-09-08T03:19:31.404Z",{"id":62,"type":6,"title":63,"slug":64,"summary":65,"coverUrl":66,"authorName":67,"sno":68,"publishedAt":69,"createdAt":70},"63c04eca-1ea9-4eca-a993-e359f24f4e2c","MicroGPT解读&思考","microgpt","Andrej Karpathy 的 MicroGPT 展示了在已有的真实名字中学习规律，并通过优化训练编出新名字的过程，揭示了AI大模型训练的底层逻辑","https:\u002F\u002Foxqtewbrpuiouqqjrvdv.supabase.co\u002Fstorage\u002Fv1\u002Fobject\u002Fpublic\u002Fpublic-media\u002F2026-07-16\u002Ffe8eb5f4-804c-4338-982f-60137ea8fbba.jpg","龙家轩",3,"2026-03-31T00:00:00.000Z","2026-07-16T11:15:46.645Z",{"id":72,"type":6,"title":73,"slug":74,"summary":75,"coverUrl":76,"authorName":14,"sno":77,"publishedAt":78,"createdAt":79},"1c047558-44f5-4e84-be6a-5468883d3178","中式巨构：技术终于有能力回应一个古老的梦","chinese-heaven","没有被“发明”，没有被“想出”，它只是被“看见”了。我们做了几千年的梦，终于在2026年，被AI显影在屏幕之上。","\u002Fuploads\u002F2026-08-15\u002Fc987bd06-cca5-4e10-b7a0-1e3213fc78d8.jpg",1,"2026-08-15T00:00:00.000Z","2026-08-15T04:53:56.292Z"]