[论文解读] Aligned Cross Entropy for Non-Autoregressive Machine Translation
AXE 是一种用于非自回归机器翻译的新训练损失,通过可微分的动态规划将目标标记与模型预测对齐,在保持快速解码的同时,显著提高 BLEU,相较于以交叉熵训练的 CMLM。
Non-autoregressive machine translation models significantly speed up decoding by allowing for parallel prediction of the entire target sequence. However, modeling word order is more challenging due to the lack of autoregressive factors in the model. This difficultly is compounded during training with cross entropy loss, which can highly penalize small shifts in word order. In this paper, we propose aligned cross entropy (AXE) as an alternative loss function for training of non-autoregressive models. AXE uses a differentiable dynamic program to assign loss based on the best possible monotonic alignment between target tokens and model predictions. AXE-based training of conditional masked language models (CMLMs) substantially improves performance on major WMT benchmarks, while setting a new state of the art for non-autoregressive models.
研究动机与目标
- 动机并解决在标准交叉熵损失下对非自回归 MT 中词序建模的困难。
- 介绍对齐交叉熵(AXE),一种可微分的、基于对齐的损失。
- 通过训练条件遮蔽语言模型(CMLMs)并在主要基准上取得最先进的非自回归 MT 结果来证明 AXE 的有效性。
- 分析 AXE 如何影响模型置信度、多模态性以及对长序列的处理。
提出的方法
- 将 AXE 定义为对目标 Y 与预测 P 之间最佳单调对齐进行计算的损失。
- 使用三算子动态规划更新(对齐、跳过预测、跳过目标)来计算任意对齐的 AXE。
- 对所有单调对齐最小化 AXE;通过反对角并行实现高效,时间复杂度为每个序列 O(n+m)。
- 通过允许空标记(epsilon)并预测目标长度来将 AXE 适配到 CMLMs,在解码时通过超参数 lambda 实现长度膨胀。
- 在训练变体方面进行实验:未观测输入 vs 部分观测输入,以及预测全部 vs 预测掩码,以识别有效的训练设置。
实验结果
研究问题
- RQ1AXE 能否降低标准交叉熵训练在非自回归 MT 中对词序不对齐的苛刻惩罚?
- RQ2在标准 WMT 基准上使用 CMLMs,AXE 是否能带来更高的翻译质量(BLEU)?
- RQ3AXE 训练的模型在原始数据和蒸馏数据设置下,与其他非自回归方法及自回归基线相比的表现如何?
- RQ4哪些训练选择(如 delta 跳过惩罚、长度倍增 lambda、部分观测输入)对 AXE 的性能影响最大?
主要发现
- AXE 训练的 CMLMs 相较于基于交叉熵的 CMLMs 在 BLEU 上取得显著提升(在基准上的平均提升为 +5.2 BLEU)。
- AXE CMLMs 超越了如 FlowSeq 等最先进的非自回归模型,并在 WMT 基准上与竞争的半自回归系统相当。
- AXE 维持与非自回归解码相同的解码速度,训练时的额外成本适中(约 1.2x)。
- AXE 减少了多模态性和重复现象,并在长序列上给出更有信心的逐位置预测。
- 实验表明 AXE 在处理较长序列方面有所改进,且相较于交叉熵训练减少了对相邻标记概率的依赖。
- 消融显示部分观测输入、在遮罩标记上计算损失、以及经过调优的 delta 和 lambda 值能够提升性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。