今天绝大多数语言模型都用自回归方式生成:先写第一个 token,再把它喂回模型预测下一个。这个顺序天然适合文本,却带来两个限制——前面写错后很难回头,每次生成又只能向前推进一步,GPU 的并行能力无法充分用于同一个序列。
Diffusion Language Model 把任务改成了“并行改稿”。模型从一整段未知或被遮蔽的文本开始,反复预测所有位置,再保留一部分高置信结果、重新遮蔽不确定位置,直到得到完整序列。
#训练一个会补全任意位置的模型
最直观的做法是 masked diffusion。训练时随机选择噪声强度,按对应比例把原句 token 替换成 [MASK],让 Transformer 恢复被遮蔽的内容。它看起来像生成式 BERT,但不同噪声强度覆盖了从局部补词到整句重建的全过程。
Masked diffusion 的训练过程:随机遮蔽,再预测原始 token
推理时,序列从全 [MASK] 开始。模型一次预测所有位置,然后根据时间表重新遮蔽一部分 token;随着轮次增加,保留的 token 越来越多。只要采样轮数远小于输出长度,就有机会比逐 token 解码更快。
这种全序列扩散还需要解决长度未知的问题。实践中可以额外预测终止位置,或者采用 block diffusion:块与块之间仍按从左到右生成,但每个块内部并行去噪。后者兼顾长文本的因果结构和局部并行,也更容易复用现有 Transformer 与缓存机制。
#反复修订是能力,也是新的错误来源
自回归模型一旦写出 token 通常不会再改,扩散模型则可以把低置信位置重新遮蔽。论文汇总显示,加入 remasking 并增加采样步骤后,文本分布指标 MAUVE 可从约 0.40 提升到 0.66,更接近自回归基线的 0.76;没有合适修订策略的简单 masked diffusion 可能只有 0.04。
但并行预测也会产生一致性问题:多个位置在同一轮独立作出看似合理的决定,组合起来却互相冲突。更多采样步骤可以纠错,却会侵蚀速度优势。质量与轮数之间因此形成明确的 inference scaling 曲线,而不是“并行一次就完成”的免费午餐。
除了遮蔽扩散,还有 uniform-state diffusion:不使用特殊 [MASK],而是把 token 随机替换成词表中的其他 token。这样每个位置始终有内容,模型可以在任意轮次编辑已有序列。代价是噪声状态更难辨认,训练和采样目标也更复杂。
#速度潜力来自并行,不来自少算
扩散语言模型最有吸引力的承诺是吞吐。通过渐进式蒸馏,可以把原本很多轮的去噪过程压缩成更少步骤;Mercury 等商业系统报告在普通 GPU 上超过每秒 1000 token,其他研究则报告 2 到 8 倍吞吐,同时保留最高约 99% 的任务质量。
这些数字说明方向可行,但不能直接横向相加。模型规模、硬件、批量、输出长度和质量指标不同,都会显著改变速度结论。扩散模型也还没有像主流自回归模型那样,在相同参数、数据和训练算力下经历同等规模的系统验证。
另一项潜力是控制生成。由于整段序列在多轮中持续可编辑,模型可以利用分类器指导、外部奖励或约束条件,把文本、生物序列等输出逐步推向目标属性。难点在于扩散轨迹包含许多中间状态,强化学习和偏好优化不能简单沿用自回归模型的 token 级概率分解。
Diffusion LLM 的核心赌注,不是把“打字动画”换成“逐渐显影”,而是让生成阶段也能吃到 Transformer 训练阶段已经享受的并行硬件红利。如果更好的去噪、蒸馏与后训练方法能同时保住一致性和质量,它才有机会真正改变大模型的推理成本曲线。



