[论文解读] ngram-OAXE: Phrase-Based Order-Agnostic Cross Entropy for Non-Autoregressive Machine Translation
该论文提出 ngram-OaXE,一种用于非自回归机器翻译的基于短语的顺序无关交叉熵损失,通过仅允许在 n-gram 短语之间重新排序,同时在每个短语内部严格保持词序,从而提升翻译质量。通过建模 n-gram 级别的概率分布,并利用匈牙利算法优化最佳 n-gram 排序,ngram-OaXE 降低了重复性并提升了流畅性,在未经蒸馏的 WMT14 En-De 数据上相比 OaXE 最高提升 +3.8 BLEU 分数。
Recently, a new training oaxe loss has proven effective to ameliorate the effect of multimodality for non-autoregressive translation (NAT), which removes the penalty of word order errors in the standard cross-entropy loss. Starting from the intuition that reordering generally occurs between phrases, we extend oaxe by only allowing reordering between ngram phrases and still requiring a strict match of word order within the phrases. Extensive experiments on NAT benchmarks across language pairs and data scales demonstrate the effectiveness and universality of our approach. %Further analyses show that the proposed ngram-oaxe alleviates the multimodality problem with a better modeling of phrase translation. Further analyses show that ngram-oaxe indeed improves the translation of ngram phrases, and produces more fluent translation with a better modeling of sentence structure.
研究动机与目标
- 为解决非自回归翻译(NAT)中的多模态问题,即独立的词元预测导致重复且不流畅的输出。
- 通过在 n-gram 短语级别而非单个词元级别建模重排,提升在原始、未经蒸馏训练数据上的 NAT 性能。
- 在保持快速解码速度的同时,提升短语级翻译准确性和句子结构建模能力。
- 通过更结构化的训练目标,减少对知识蒸馏的依赖,实现在原始数据上的有效训练。
提出的方法
- 该方法通过将 NAT 模型在连续 n-gram 区间上的单个词元概率相乘,构建 n-gram 概率分布。
- 将 ngram-OaXE 损失定义为在目标句中所有可能的 n-gram 短语排列中的最小交叉熵。
- 利用匈牙利算法高效计算最优 n-gram 排序以最小化损失。
- 该方法仅需极少代码修改——在 OaXE 源码中增加一行代码——确保训练时间增加微乎其微(例如仅 3%)。
- 该方法在每个 n-gram 内部保持严格的词序,同时允许 n-gram 之间的重排,更符合句法和语法约束。
- 损失函数在训练期间应用,使模型能够学习到更鲁棒且更流畅的翻译,而无需自回归解码。
实验结果
研究问题
- RQ1在 n-gram 级别而非词元级别建模重排,是否能提升非自回归翻译的质量?
- RQ2与 OaXE 和标准交叉熵损失相比,ngram-OaXE 是否能减少词元重复并提升流畅性?
- RQ3ngram-OaXE 是否能在原始、未经蒸馏的训练数据上实现强大的 NAT 性能,从而减少对知识蒸馏的依赖?
- RQ4ngram-OaXE 在多大程度上提升了对长句和短语级连贯性的建模能力?
主要发现
- 在未经蒸馏的原始 WMT14 En-De 数据上,ngram-OaXE 相较于 OaXE 最高提升 +3.8 BLEU 分数,证明了其在无知识蒸馏情况下的显著增益。
- 在蒸馏数据上,ngram-OaXE 将词元重复率从 OaXE 的 1.56% 降低至 0.98%,表明其对多模态问题的处理能力更强。
- 该模型在所有设置下均表现出更低的困惑度,表明其生成的翻译更具流畅性,优于 OaXE。
- ngram-OaXE 显著提升了对长且复杂短语的生成准确性,尤其在长距离依赖任务中表现突出。
- 该方法缩小了在原始数据与蒸馏数据上训练的性能差距,表明其能够有效支持 NAT 中的自监督学习。
- 训练时间增加极小——仅比 OaXE 多约 3%,使其在大规模训练中具备实际可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。