Skip to main content
QUICK REVIEW

[论文解读] Argmax Flows and Multinomial Diffusion: Towards Non-Autoregressive Language Models.

Emiel Hoogeboom, Didrik Nielsen|arXiv (Cornell University)|Feb 10, 2021
Topic Modeling被引用 25
一句话总结

本文提出了Argmax Flows与多项式扩散(Multinomial Diffusion),两种用于处理文本和图像分割等类别数据的非自回归生成模型。通过使用带有argmax操作的连续归一化流,或带有类别噪声的扩散过程,这些模型实现了并行生成,并在语言建模与分割任务中取得了具有竞争力的性能。

ABSTRACT

The field of language modelling has been largely dominated by autoregressive models, for which sampling is inherently difficult to parallelize. This paper introduces two new classes of generative models for categorical data such as language or image segmentation: Argmax Flows and Multinomial Diffusion. Argmax Flows are defined by a composition of a continuous distribution (such as a normalizing flow), and an argmax function. To optimize this model, we learn a probabilistic inverse for the argmax that lifts the categorical data to a continuous space. Multinomial Diffusion gradually adds categorical noise in a diffusion process, for which the generative denoising process is learned. We demonstrate that our models perform competitively on language modelling and modelling of image segmentation maps.

研究动机与目标

  • 通过提出非自回归替代方案,解决自回归语言模型中固有的序列瓶颈问题。
  • 通过利用连续归一化流与扩散过程建模类别数据,实现离散序列的并行生成。
  • 通过argmax函数的概率逆,为离散数据设计可微分且可逆的映射。
  • 设计一种扩散过程,逐步添加类别噪声,并学习逆转污染过程以实现生成。
  • 在无需自回归解码的情况下,于语言建模与图像分割任务中展示具有竞争力的性能。

提出的方法

  • 将Argmax Flows定义为连续分布(如归一化流)与argmax操作的组合,用于将连续潜在变量映射到离散标记。
  • 学习argmax函数的概率逆,以在训练与优化过程中将离散数据提升到连续空间。
  • 将多项式扩散公式化为一个马尔可夫过程,通过扩散调度逐步用类别噪声污染离散数据。
  • 训练一个去噪网络以逆转污染过程,从而实现从噪声的条件生成。
  • 在两种框架中均使用归一化流与基于得分的建模,以确保可微性与可计算的似然估计。
  • 通过变分推断与重参数化梯度,利用最大似然优化两种模型。

实验结果

研究问题

  • RQ1Argmax Flows能否提供一种可微分、可逆且可扩展的方式,利用连续归一化流建模离散序列?
  • RQ2通过逐步添加与逆转类别噪声,扩散过程能否有效建模类别数据?
  • RQ3与自回归基线相比,这些非自回归模型在语言建模与图像分割任务中是否能达到具有竞争力的性能?
  • RQ4argmax的概率逆在多大程度上能支持离散流的端到端训练?
  • RQ5多项式扩散中的去噪过程能否在无需自回归生成的情况下生成高质量序列?

主要发现

  • Argmax Flows通过学习从潜在空间到离散标记的连续可逆映射,实现了离散序列的并行生成。
  • argmax的概率逆使得通过离散操作的有效反向传播成为可能,从而支持流模型的端到端训练。
  • 多项式扩散通过带有类别噪声的扩散过程成功建模了类别数据,实现了稳定训练与生成。
  • 两种模型在语言建模基准上均取得了具有竞争力的性能,表明其在无需自回归解码的情况下具备强大的生成质量。
  • 模型在图像分割任务中也表现出色,表明其泛化能力不仅限于自然语言。
  • 所提出的方法为自回归模型提供了可行的非自回归替代方案,在显著减少生成时间的同时,保持了具有竞争力的似然与生成质量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。