[论文解读] ENGINE: Energy-Based Inference Networks for Non-Autoregressive Machine Translation
本文提出 ENGINE,一种非自回归神经机器翻译模型,通过使用推理网络最小化预训练自回归教师模型的能量函数进行训练。与蒸馏束搜索输出不同,ENGINE 直接针对教师模型的能量进行优化,在 IWSLT14 DE-EN(31.99 BLEU)和 WMT16 RO-EN(33.16 BLEU)上取得最先进性能,接近自回归模型的表现。
We propose to train a non-autoregressive machine translation model to minimize the energy defined by a pretrained autoregressive model. In particular, we view our non-autoregressive translation system as an inference network (Tu and Gimpel, 2018) trained to minimize the autoregressive teacher energy. This contrasts with the popular approach of training a non-autoregressive model on a distilled corpus consisting of the beam-searched outputs of such a teacher model. Our approach, which we call ENGINE (ENerGy-based Inference NEtworks), achieves state-of-the-art non-autoregressive results on the IWSLT 2014 DE-EN and WMT 2016 RO-EN datasets, approaching the performance of autoregressive models.
研究动机与目标
- 提升非自回归机器翻译(NAT)性能,超越基于束搜索输出的知识蒸馏方法。
- 探索利用预训练自回归教师模型作为能量来源,通过能量最小化训练 NAT 模型。
- 开发一种推理网络,近似教师模型能量函数的最小值点,实现端到端训练。
- 证明基于能量的训练在零次迭代和迭代优化设置下均优于标准蒸馏方法。
- 推动基于能量的模型在非自回归文本生成中的广泛应用。
提出的方法
- 该方法将自回归模型视为基于能量的模型,将能量定义为给定源序列的目标序列的负对数似然。
- 训练一个推理网络(如 CMLM 或基于 Transformer 的模型),将源输入映射为使教师模型能量最小化的目标序列。
- 通过可微操作对能量函数进行松弛:一种使用温度参数的 Softmax(SX),另一种使用直通梯度估计(ST)进行离散 token 采样。
- 推理网络在验证集上使用能量损失进行训练,基于能量最小化进行早停。
- 通过独立的头预测目标序列长度,解码时使用长度束中 top-k 候选序列。
- 该方法避免依赖蒸馏语料,直接优化能量函数,从而提供比仅束搜索输出更丰富的监督信号。
实验结果
研究问题
- RQ1训练非自回归模型以最小化预训练自回归模型的能量,是否能超越基于束搜索输出的知识蒸馏方法?
- RQ2不同的离散采样松弛策略(如 SX 与 ST)对基于能量的推理网络在 NAT 中的性能有何影响?
- RQ3基于能量的训练结合推理网络是否优于无需优化的最先进非自回归模型?
- RQ4与标准蒸馏相比,迭代优化在多大程度上提升了基于能量的 NAT 模型性能?
- RQ5基于能量的推理网络能否在非自回归翻译中接近自回归模型的性能?
主要发现
- 在非自回归设置下(1 次迭代),ENGINE 在 IWSLT14 DE-EN 上取得 31.99 的 BLEU 分数,在 WMT16 RO-EN 上取得 33.16 的 BLEU 分数,创下 NAT 模型的新 SOTA 记录。
- 即使在无优化迭代的情况下,ENGINE 在两个数据集上均优于所有先前的非自回归模型,包括使用迭代优化的模型。
- 训练以最小化教师模型能量的模型,在 DE-EN 上比基于蒸馏束搜索输出的模型高出 11.27 BLEU,在 RO-EN 上高出 12.22 BLEU。
- 经过 10 次优化迭代后,ENGINE 在 WMT16 RO-EN 上达到 34.04 BLEU,优于 CMLM,且接近自回归教师模型的性能。
- 采用松弛操作(SX + ST)的组合性能最佳,而 Gumbel 噪声仅带来微小提升并减慢训练速度。
- 该方法表明,能量最小化提供的监督信号比蒸馏输出更丰富,从而在非自回归翻译中实现更好的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。