Diffusion LLM:语言模型也能从噪声里逐步生成文字吗?
TL;DR
从掩码、去噪和多轮迭代出发,解释 Diffusion LLM 与自回归语言模型的差异、并行生成潜力和工程限制。
Diffusion LLM 不按单一的从左到右顺序生成文字,而是通过多轮掩码恢复逐步确定 token。本文解释它与自回归模型的区别、并行生成潜力、训练目标和现实限制。

大多数语言模型生成文本时都遵循一个方向:从左到右,先预测第一个 token,再根据已有内容预测下一个 token。这个过程很稳定,也很容易流式输出,但它意味着后面的文字必须等待前面的文字生成完。写错了开头,模型通常也不会回头修改,只能继续把错误补下去。
Diffusion LLM 探索的是另一种生成方式。它先把整段文本看成带有大量掩码或噪声的状态,再经过多轮预测,逐步把不确定位置还原成具体 token。它借用了图像扩散模型“从噪声中逐步生成”的直觉,但文本扩散面对的是离散 token,而不是连续像素。
从“下一个词”到“下一批未知位置”
自回归模型每一步主要处理序列末尾;掩码扩散语言模型则可以同时处理多个仍然未知的位置。一次去噪步骤可能先确定一个置信度较高的词,再把剩余掩码交给下一轮。随着迭代进行,句子的结构、词语和局部细节逐渐变得明确。
可以把它想象成做填字游戏:第一轮不要求立刻填完所有格子,而是先填最确定的答案;下一轮利用已有交叉关系继续缩小不确定性。这里的“确定”由模型分布和采样策略决定,并不是模型真的拥有一个独立的人类式草稿区。
为什么有人研究它
第一,多个位置存在并行处理的可能性。自回归生成必须等待前一个 token,而扩散式生成可以在一轮中处理多个位置,理论上为延迟和吞吐提供新的优化空间。第二,双向上下文更自然。一个位置的预测可以同时参考左边和右边的信息,这对填空、改写和受约束生成尤其有吸引力。第三,生成过程更容易被看作“反复编辑”,而不是一条只能向前走的链。
但这些优势不是自动兑现的。扩散模型往往需要多轮迭代,每轮都要运行网络;如果迭代次数太多,单次请求未必比自回归生成更快。并行计算也会受到显存、调度和硬件利用率影响。模型需要学习合理的掩码策略和去噪顺序,否则可能出现局部词语看似正确、整体语义却不连贯的情况。
训练目标与推理策略
扩散语言模型的训练通常会对文本施加掩码或噪声,再让模型恢复被破坏的 token。研究者可以设计不同的噪声调度、掩码比例和损失加权方式,也可以让模型学习哪些位置应该优先解除掩码。相关研究还会观察稀有 token、语言能力和数据效率之间的关系。
推理时则需要决定三件事:每轮要更新多少位置,哪些位置保持不动,以及何时认为结果已经足够稳定。更新太少会拖慢生成,更新太多可能让模型反复改动已经正确的内容。对文本来说,“噪声”不是简单的视觉雪花,而是离散符号空间中的不确定性,因此采样控制和终止条件都需要重新设计。
它会取代自回归模型吗
目前更稳妥的判断是:Diffusion LLM 是值得观察的生成范式,而不是已经完成替代的结论。自回归模型在流式输出、工具调用、长文本续写和生态支持上仍然有明显优势;扩散式模型则可能在并行生成、文本编辑、受约束填充和某些数据受限训练场景中形成差异化能力。
理解它最重要的地方,不是记住“扩散也能生成文字”,而是看到语言生成并不只有一种时间顺序。未来的模型可能根据任务,在左到右续写、双向填充和多轮编辑之间选择不同的生成路径。相关结果仍应以具体模型、数据集和推理实现为准,不能把论文中的研究性结论直接当成生产环境性能承诺。
来源:Masked Diffusion Language Models with Frequency-Informed Training



