Skip to main content
QUICK REVIEW

[论文解读] On the Learning of Non-Autoregressive Transformers

Fei Huang, Tianhua Tao|arXiv (Cornell University)|Jun 13, 2022
Natural Language Processing Techniques被引用 5
一句话总结

本文指出,非自回归Transformer(NATs)在最大似然估计(MLE)下因条件总相关性(C′)度量的信息损失而难以学习标记依赖关系。为解决此问题,作者提出统一框架——最大代理似然估计(MPLE),解释了先前方法的成功源于其隐式地在C′更低的代理分布上进行训练,并表明该视角可指导更优的训练目标设计,从而在似然较低的情况下提升生成质量。

ABSTRACT

Non-autoregressive Transformer (NAT) is a family of text generation models, which aims to reduce the decoding latency by predicting the whole sentences in parallel. However, such latency reduction sacrifices the ability to capture left-to-right dependencies, thereby making NAT learning very challenging. In this paper, we present theoretical and empirical analyses to reveal the challenges of NAT learning and propose a unified perspective to understand existing successes. First, we show that simply training NAT by maximizing the likelihood can lead to an approximation of marginal distributions but drops all dependencies between tokens, where the dropped information can be measured by the dataset's conditional total correlation. Second, we formalize many previous objectives in a unified framework and show that their success can be concluded as maximizing the likelihood on a proxy distribution, leading to a reduced information loss. Empirical studies show that our perspective can explain the phenomena in NAT learning and guide the design of new training methods.

研究动机与目标

  • 理解为何尽管延迟较低,最大似然训练在非自回归Transformer(NATs)中仍会失败。
  • 解释先前NAT训练目标在似然较低但生成质量较高的情况下的经验成功。
  • 基于C′更低的代理分布,形式化现有NAT训练方法的统一框架。
  • 推导一个与生成性能相关且可指导新训练方法设计的通用目标。

提出的方法

  • 理论分析表明,直接在NAT上进行MLE训练会导致边缘分布近似,丢失标记间依赖关系,其损失由数据集的条件总相关性(C′)量化。
  • 本文提出统一框架——最大代理似然估计(MPLE),其中先前方法被重新解释为在代理分布⟨X+Z, T⟩上最大化似然,其中Z和T被设计为降低C′。
  • 通过最小化复合目标(NAT损失 + 通过候选输出与多个教师模型之间的BLEU分数近似的目标失真项)来选择代理目标T。
  • 通过在多参考数据集上进行手动搜索,对加权多个教师输出的超参数进行调优,以最小化真实数据失真,且无需重新训练模型。
  • 该方法应用于GLAT和KD,使用动态KD选择代理目标,同时在选择过程中忽略Z以减少方差。
  • 实验使用标准WMT基准(WMT14 En-De,WMT17 Zh-En),模型在8块V100 GPU上通过混合精度训练,评估时对验证集上表现最好的5个检查点取平均。

实验结果

研究问题

  • RQ1为何在似然较高的情况下,最大似然估计(MLE)在非自回归Transformer中仍无法生成高质量输出?
  • RQ2为何像知识蒸馏和GLAT这样的训练目标即使导致显著更低的似然,仍能实现更好的生成质量?
  • RQ3多样化的NAT训练目标成功背后的共同属性是什么?如何对其进行形式化?
  • RQ4如何利用数据集的条件总相关性(C′)来度量并缓解NAT学习中的信息损失?
  • RQ5能否推导出一个统一框架,既能解释先前的成功,又能指导设计更有效的新NAT训练目标?

主要发现

  • 直接在NAT上进行MLE训练会导致模型近似目标标记的边缘分布,但会丢失标记间依赖关系,其信息损失由数据集的条件总相关性(C′)量化。
  • 先前成功的如知识蒸馏(KD)和GLAT等方法被证明是隐式地在C′低于原始数据的代理分布上进行训练,从而减少信息损失。
  • 所提出的最大代理似然估计(MPLE)框架通过将代理分布上的似然最大化,统一了现有方法,为其成功提供了理论依据。
  • 实证结果表明,代理分布的C′与生成性能强相关,且优化该分布可提升BLEU分数,尽管似然更低。
  • 在WMT14 En-De上,所提出的动态KD + GLAT方法达到30.8的BLEU分数,优于MLE(BLEU 28.1)和GLAT+KD(BLEU 29.5),证明了基于代理的方法的有效性。
  • 该方法在不同基准上均表现稳健,WMT17 Zh-En结果也显示一致改进,验证了该框架的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。