[论文解读] DiffusionBERT: Improving Generative Masked Language Models with Diffusion Models
DiffusionBERT 提出了一种新颖的生成式掩码语言模型,通过利用其共享的去噪目标,将预训练的 BERT 与离散扩散模型相结合。它引入了一种非马尔可夫、标记感知的噪声调度(spindle schedule)和与时间无关的解码机制,在无条件文本生成任务中实现了最先进性能,相比以往的扩散模型和自回归模型,收敛速度更快,困惑度和 BLEU 分数均得到提升。
We present DiffusionBERT, a new generative masked language model based on discrete diffusion models. Diffusion models and many pre-trained language models have a shared training objective, i.e., denoising, making it possible to combine the two powerful models and enjoy the best of both worlds. On the one hand, diffusion models offer a promising training strategy that helps improve the generation quality. On the other hand, pre-trained denoising language models (e.g., BERT) can be used as a good initialization that accelerates convergence. We explore training BERT to learn the reverse process of a discrete diffusion process with an absorbing state and elucidate several designs to improve it. First, we propose a new noise schedule for the forward diffusion process that controls the degree of noise added at each step based on the information of each token. Second, we investigate several designs of incorporating the time step into BERT. Experiments on unconditional text generation demonstrate that DiffusionBERT achieves significant improvement over existing diffusion models for text (e.g., D3PM and Diffusion-LM) and previous generative masked language models in terms of perplexity and BLEU score.
研究动机与目标
- 通过利用其共享的去噪目标,弥合预训练去噪语言模型(如 BERT)与扩散模型在文本生成任务之间的差距。
- 通过使用 BERT 初始化并调整反向过程,提升离散扩散模型在文本生成中的生成质量和训练效率。
- 解决将扩散模型应用于离散文本数据的挑战,尽管其在图像和音频领域已取得成功,但该领域仍研究不足。
- 探索非马尔可夫扩散过程,该过程同时依赖于前一状态和原始干净序列,以在去噪过程中实现更优的信息流动。
- 在非自回归文本生成中,优化生成质量、收敛速度与推理效率之间的权衡。
提出的方法
- 提出一种名为 'spindle schedule' 的新型噪声调度,根据训练语料中每个标记的频率为其分配唯一的噪声水平,确保在整个扩散过程中受损信息分布均匀。
- 引入一种非马尔可夫前向扩散过程,其中每一步不仅依赖于前一时刻的损坏序列,还依赖于原始干净序列 $\mathbf{x}_0$,从而为去噪提供更丰富的上下文。
- 将 BERT 作为反向去噪网络 $p_\theta(\mathbf{x}_{t-1}|\mathbf{x}_t, t)$ 使用,利用其预训练的掩码标记重建能力。
- 研究了多种将时间步 $t$ 嵌入 BERT 的策略,最终发现去除时间信息(即与时间无关的解码)能获得最佳性能。
- 在反向过程中采用 $x_0$-parameterization,通过调整反向步骤数量,灵活控制推理速度。
- 采用端到端训练方式,使用变分下界(ELBO)目标函数,最小化扩散轨迹上的重建损失。
实验结果
研究问题
- RQ1像 BERT 这类预训练去噪语言模型能否被有效重用于构建离散扩散模型的骨干网络以实现文本生成?
- RQ2针对标记的特定噪声调度(spindle schedule)如何影响离散扩散模型在文本生成中的质量与稳定性?
- RQ3与标准马尔可夫扩散过程相比,若在反向过程中同时依赖 $\mathbf{x}_{t-1}$ 和 $\mathbf{x}_0$(即非马尔可夫过程),是否能提升生成质量?
- RQ4在基于 BERT 的去噪模型中,最优的时序信息整合方式是什么,以实现基于扩散的文本生成?
- RQ5BERT 与扩散模型的结合能否在质量-效率权衡上超越现有的非自回归或自回归模型?
主要发现
- 在无条件文本生成基准测试中,DiffusionBERT 的困惑度显著低于现有基于扩散的文本模型(如 D3PM 和 Diffusion-LM),且 BLEU 分数更高。
- 该模型收敛速度远快于 D3PM,在仅使用 30% 训练预算(0.5 百万步)的情况下即可达到相近性能。
- 与时间无关的解码(TAD)在推理过程中忽略时间步,生成质量最佳,优于时间条件变体。
- spindle 噪声调度使序列中受损信息分布更均匀,并增强了模型在反向过程所有阶段重建有意义文本的能力。
- 在非自回归生成中,DiffusionBERT 实现了更优的质量-方差权衡,其困惑度和解码效率均优于 BERT-Mouth。
- 通过控制反向步数,DiffusionBERT 在保持竞争力生成速度的同时实现了最先进性能,展现出出色的效率-质量平衡。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。