[论文解读] Latent Diffusion for Language Generation
本文提出了用于文本生成的潜在扩散模型(LD4LG),该方法利用预训练的编码器-解码器模型(如 BART、T5)学习文本的高质量潜在空间,通过在这一连续且压缩的潜在空间中进行扩散,实现高效且高质量的文本生成。LD4LG 在无条件生成、类别条件生成以及序列到序列生成任务中均达到当前最优性能,显著减少采样步数的同时优于以往基于扩散的模型。
Diffusion models have achieved great success in modeling continuous data modalities such as images, audio, and video, but have seen limited use in discrete domains such as language. Recent attempts to adapt diffusion to language have presented diffusion as an alternative to existing pretrained language models. We view diffusion and existing language models as complementary. We demonstrate that encoder-decoder language models can be utilized to efficiently learn high-quality language autoencoders. We then demonstrate that continuous diffusion models can be learned in the latent space of the language autoencoder, enabling us to sample continuous latent representations that can be decoded into natural language with the pretrained decoder. We validate the effectiveness of our approach for unconditional, class-conditional, and sequence-to-sequence language generation. We demonstrate across multiple diverse data sets that our latent language diffusion models are significantly more effective than previous diffusion language models.
研究动机与目标
- 为解决将扩散模型应用于离散文本生成的挑战,因为直接对离散标记进行建模在连续模态中不如在离散模态中自然。
- 克服以往扩散语言模型的局限性,这些模型通常存在样本质量差且需要过多采样步数的问题。
- 通过学习一种压缩的、固定长度的潜在表示,充分发挥预训练编码器-解码器模型的优势,以支持高效的扩散建模。
- 在保持语言离散性质的同时,通过预训练解码器在连续潜在空间中利用扩散过程,实现高质量、多样化且可控的文本生成。
- 证明将预训练自编码器与潜在扩散相结合,可在无条件生成、条件生成和序列到序列生成任务中取得更优性能。
提出的方法
- 该方法使用预训练的编码器-解码器模型(如 BART 或 T5)将输入文本编码为高维潜在表示。
- 一个可学习的压缩模块将这些高维、与输入长度相关的表示映射到适合扩散建模的低维、固定长度潜在空间。
- 相应的重建网络将固定长度的潜在码映射回高维特征,用作预训练解码器的交叉注意力上下文。
- 在压缩的潜在空间中训练去噪扩散模型,以生成连续的潜在序列,随后通过重建过程还原为自然语言。
- 采样过程通过在潜在空间中从高斯噪声逐步去噪开始,随后通过学习到的解码器网络进行重建。
- 该方法将高层语义建模(通过潜在空间中的扩散)与离散标记生成(通过预训练解码器)解耦,从而实现高效且高质量的生成。
实验结果
研究问题
- RQ1能否通过在预训练自编码器的可学习潜在空间中操作,有效将扩散模型应用于离散文本生成?
- RQ2与高维、变长的潜在表示相比,学习固定长度的潜在表示是否能提升文本生成的效率和质量?
- RQ3在生成质量与采样效率方面,潜在扩散与自回归模型及先前的基于扩散的语言模型相比表现如何?
- RQ4潜在扩散框架是否能够支持多样化的生成任务,包括无条件生成、类别条件生成和序列到序列生成?
- RQ5与强大的自回归基线相比,该方法是否能减少记忆化现象并提升可控性?
主要发现
- 在 ROCStories 数据集上,LD4LG 仅用 250 步采样即可达到 0.716 的 MAUVE 分数,显著优于 Diffusion-LM 在 2000 步时仅获得的 0.043 MAUVE 分数。
- 在 XSum 摘要生成基准上,LD4LG 在 250 个时间步下达到 31.9 的 ROUGE-L 分数,超过 DiffuSeq 在 2000 个时间步下取得的 14.1 ROUGE-L 分数。
- 该方法在类条件生成中表现出更低的记忆化现象,并相比强大的自回归基线模型性能更优。
- 压缩模块的使用使得在固定长度潜在空间中实现有效扩散成为可能,克服了高维、变长编码器特征带来的挑战。
- 该方法实现了更少采样步数下的高质量文本生成,证明了潜在扩散在语言建模中的高效性与可扩展性。
- 该框架在多种架构(如 BART-Base、FLAN-T5-base)和任务中均具有泛化能力,在不同数据集上均表现出一致的性能提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。