Skip to main content
QUICK REVIEW

[论文解读] Text Generation with Diffusion Language Models: A Pre-training Approach with Continuous Paragraph Denoise

Zhenghao Lin, Yeyun Gong|arXiv (Cornell University)|Dec 22, 2022
Topic Modeling被引用 16
一句话总结

本文提出GENIE,一种大规模预训练扩散语言模型,通过迭代地将随机噪声逐步去噪为连贯的文本序列,利用基于扩散的解码器生成文本。该模型提出了一种新颖的连续段落去噪(CPD)预训练目标,在XSum、CNN/DailyMail、Gigaword和CommonGen基准上实现了与自回归模型相当的性能,并提升了生成结果的多样性。

ABSTRACT

In this paper, we introduce a novel dIffusion language modEl pre-training framework for text generation, which we call GENIE. GENIE is a large-scale pretrained diffusion language model that consists of an encoder and a diffusion-based decoder, which can generate text by gradually transforming a random noise sequence into a coherent text sequence. To pre-train GENIE on a large-scale language corpus, we design a new continuous paragraph denoise objective, which encourages the diffusion-decoder to reconstruct a clean text paragraph from a corrupted version, while preserving the semantic and syntactic coherence. We evaluate GENIE on four downstream text generation benchmarks, namely XSum, CNN/DailyMail, Gigaword, and CommonGen. Our experimental results show that GENIE achieves comparable performance with the state-of-the-art autoregressive models on these benchmarks, and generates more diverse text samples. The code and models of GENIE are available at https://github.com/microsoft/ProphetNet/tree/master/GENIE.

研究动机与目标

  • 开发一种大规模预训练的扩散语言模型,用于序列到序列的文本生成。
  • 通过利用非自回归的扩散生成方法,解决自回归模型存在的暴露偏差和生成速度慢等局限性。
  • 设计一种新颖的预训练目标,以增强段落级别的连贯性与去噪能力。
  • 在标准文本生成基准上评估基于扩散的生成方法的有效性,并分析模型行为。
  • 通过基于扩散的优化过程,在保持高流畅性与连贯性的前提下,提升生成结果的多样性。

提出的方法

  • GENIE采用编码器-解码器架构,其中双向编码器处理输入,基于扩散的解码器从噪声潜在表示中生成输出。
  • 扩散解码器通过反向扩散过程,在多个时间步上迭代地将随机高斯噪声序列去噪为连贯的文本序列。
  • 提出一种新颖的预训练目标——连续段落去噪(CPD),要求模型在保留语义与句法结构的前提下,从被破坏的版本中重建出原始段落。
  • CPD目标被形式化为一个去噪任务,即模型在给定上下文和噪声输入的条件下,预测每个时间步添加的噪声。
  • 模型在大规模无标注文本语料上端到端地进行预训练,采用CPD目标以学习鲁棒的表示。
  • 推理阶段,模型从随机噪声开始,通过受编码器隐藏状态引导的反向扩散过程生成文本。

实验结果

研究问题

  • RQ1基于扩散的语言模型是否能在文本生成任务中达到与最先进自回归模型相当的性能?
  • RQ2所提出的连续段落去噪(CPD)预训练目标是否能提升模型重建连贯且语义准确文本的能力?
  • RQ3扩散步数如何影响生成文本的质量与多样性?
  • RQ4在大规模语料上进行预训练在多大程度上提升了扩散语言模型的泛化能力与生成质量?
  • RQ5与自回归基线相比,基于扩散的生成框架是否能产生更具多样性的输出?

主要发现

  • GENIE在四个主要文本生成基准(XSum、CNN/DailyMail、Gigaword和CommonGen)上实现了具有竞争力的性能,自动评估指标上与或超过最先进自回归模型的表现。
  • 模型在生成多样性方面表现出显著提升,该结果通过自动评估指标得到验证,表明基于扩散的生成能够产生更多样化的输出。
  • 连续段落去噪(CPD)预训练目标有效增强了模型从受损输入中恢复连贯且语义准确文本的能力。
  • 增加反向扩散步数可提升生成质量,性能在1000步时趋于稳定;步数过少则导致性能显著下降。
  • 在预训练中采用均匀采样优于损失感知采样,表明均匀采样更有利于在所有时间步上实现知识的全面学习。
  • 消融实验确认,预训练步数与扩散步数均对模型性能有显著影响,较长的预训练和充足的扩散步数可获得最佳结果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。