[论文解读] Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution
本文提出Score Entropy Discrete Diffusion(SEDD),一种新颖的离散分数匹配损失,可在自然语言数据上实现稳定且可扩展的扩散模型训练。通过基于原理的分数熵目标估计数据分布的比值,SEDD在实现GPT-2级别困惑度的同时,支持计算-质量权衡、更忠实的分布学习(比GPT-2好4倍),并实现超越自回归生成的任意填充功能。
Despite their groundbreaking performance for many generative modeling tasks, diffusion models have fallen short on discrete data domains such as natural language. Crucially, standard diffusion models rely on the well-established theory of score matching, but efforts to generalize this to discrete structures have not yielded the same empirical gains. In this work, we bridge this gap by proposing score entropy, a novel loss that naturally extends score matching to discrete spaces, integrates seamlessly to build discrete diffusion models, and significantly boosts performance. Experimentally, we test our Score Entropy Discrete Diffusion models (SEDD) on standard language modeling tasks. For comparable model sizes, SEDD beats existing language diffusion paradigms (reducing perplexity by $25$-$75$\%) and is competitive with autoregressive models, in particular outperforming GPT-2. Furthermore, compared to autoregressive mdoels, SEDD generates faithful text without requiring distribution annealing techniques like temperature scaling (around $6$-$8 imes$ better generative perplexity than un-annealed GPT-2), can trade compute and quality (similar quality with $32 imes$ fewer network evaluations), and enables controllable infilling (matching nucleus sampling quality while enabling other strategies besides left to right prompting).
研究动机与目标
- 解决自然语言生成中离散扩散模型缺乏有效分数匹配方法的问题。
- 开发一种稳定且可扩展的训练目标,使离散扩散建模质量可与GPT-2等自回归模型相媲美。
- 实现算法优势,如计算-质量权衡以及超越标准从左到右自回归生成的任意填充能力。
- 证明非自回归扩散模型在大规模语言建模任务中可达到与自回归模型相当的性能。
提出的方法
- 提出分数熵,一种新颖的离散分数匹配损失,通过估计扰动数据分布的比值,形成最大似然训练的变分下界(ELBO)。
- 推导分数熵损失的去噪变体,实现高效优化,而无需显式密度估计。
- 引入基于分数的祖先采样方法和通用的填充流程,支持对序列中任意掩码位置进行条件生成。
- 通过架构改进和高效训练技术,将SEDD模型扩展至与GPT-2相当的模型规模。
- 采用适配离散空间的连续时间SDE框架,将得分函数建模为神经网络,用于预测扰动后对数密度的梯度。
- 采用去噪目标来近似得分函数,无需访问真实数据密度,从而提升训练稳定性。

实验结果
研究问题
- RQ1能否设计一种既稳定又可扩展的离散分数匹配损失,用于语言建模,使扩散模型能够匹配自回归基线?
- RQ2与标准自回归模型(如GPT-2)相比,所提出的分数熵损失是否能带来更优的分布保真度?
- RQ3SEDD模型能否在实现竞争性困惑度的同时,支持如任意填充和计算-质量权衡等新功能?
- RQ4在似然性、样本质量和推理效率方面,SEDD的性能与GPT-2相比如何?
主要发现
- 在相同规模的模型上,SEDD的困惑度得分与GPT-2相比仅高出+10%,部分配置甚至优于自回归基线。
- SEDD模型学习到的序列分布更忠实,使用祖先采样并借助大语言模型评估时,其分布保真度比GPT-2高出约4倍。
- SEDD支持计算-质量权衡,仅需GPT-2 1/16的网络评估次数即可达到其生成质量。
- SEDD支持任意填充,可对序列中任意掩码位置进行条件生成,而标准自回归模型受限于从左到右的生成方式。
- 分数熵损失稳定且构成有效的ELBO,为离散扩散模型提供了原则化的最大似然训练方法。
- 分数熵损失的去噪变体可实现高效优化,无需显式密度估计或复杂采样方案。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。