Skip to main content
QUICK REVIEW

[论文解读] ngram-OAXE: Phrase-Based Order-Agnostic Cross Entropy for Non-Autoregressive Machine Translation

Cunxiao Du, Zhaopeng Tu|arXiv (Cornell University)|Oct 8, 2022
Natural Language Processing Techniques被引用 4
一句话总结

该论文提出 ngram-OaXE,一种用于非自回归机器翻译的基于短语的顺序无关交叉熵损失,通过仅允许在 n-gram 短语之间重新排序,同时在每个短语内部严格保持词序,从而提升翻译质量。通过建模 n-gram 级别的概率分布,并利用匈牙利算法优化最佳 n-gram 排序,ngram-OaXE 降低了重复性并提升了流畅性,在未经蒸馏的 WMT14 En-De 数据上相比 OaXE 最高提升 +3.8 BLEU 分数。

ABSTRACT

Recently, a new training oaxe loss has proven effective to ameliorate the effect of multimodality for non-autoregressive translation (NAT), which removes the penalty of word order errors in the standard cross-entropy loss. Starting from the intuition that reordering generally occurs between phrases, we extend oaxe by only allowing reordering between ngram phrases and still requiring a strict match of word order within the phrases. Extensive experiments on NAT benchmarks across language pairs and data scales demonstrate the effectiveness and universality of our approach. %Further analyses show that the proposed ngram-oaxe alleviates the multimodality problem with a better modeling of phrase translation. Further analyses show that ngram-oaxe indeed improves the translation of ngram phrases, and produces more fluent translation with a better modeling of sentence structure.

研究动机与目标

  • 为解决非自回归翻译(NAT)中的多模态问题,即独立的词元预测导致重复且不流畅的输出。
  • 通过在 n-gram 短语级别而非单个词元级别建模重排,提升在原始、未经蒸馏训练数据上的 NAT 性能。
  • 在保持快速解码速度的同时,提升短语级翻译准确性和句子结构建模能力。
  • 通过更结构化的训练目标,减少对知识蒸馏的依赖,实现在原始数据上的有效训练。

提出的方法

  • 该方法通过将 NAT 模型在连续 n-gram 区间上的单个词元概率相乘,构建 n-gram 概率分布。
  • 将 ngram-OaXE 损失定义为在目标句中所有可能的 n-gram 短语排列中的最小交叉熵。
  • 利用匈牙利算法高效计算最优 n-gram 排序以最小化损失。
  • 该方法仅需极少代码修改——在 OaXE 源码中增加一行代码——确保训练时间增加微乎其微(例如仅 3%)。
  • 该方法在每个 n-gram 内部保持严格的词序,同时允许 n-gram 之间的重排,更符合句法和语法约束。
  • 损失函数在训练期间应用,使模型能够学习到更鲁棒且更流畅的翻译,而无需自回归解码。

实验结果

研究问题

  • RQ1在 n-gram 级别而非词元级别建模重排,是否能提升非自回归翻译的质量?
  • RQ2与 OaXE 和标准交叉熵损失相比,ngram-OaXE 是否能减少词元重复并提升流畅性?
  • RQ3ngram-OaXE 是否能在原始、未经蒸馏的训练数据上实现强大的 NAT 性能,从而减少对知识蒸馏的依赖?
  • RQ4ngram-OaXE 在多大程度上提升了对长句和短语级连贯性的建模能力?

主要发现

  • 在未经蒸馏的原始 WMT14 En-De 数据上,ngram-OaXE 相较于 OaXE 最高提升 +3.8 BLEU 分数,证明了其在无知识蒸馏情况下的显著增益。
  • 在蒸馏数据上,ngram-OaXE 将词元重复率从 OaXE 的 1.56% 降低至 0.98%,表明其对多模态问题的处理能力更强。
  • 该模型在所有设置下均表现出更低的困惑度,表明其生成的翻译更具流畅性,优于 OaXE。
  • ngram-OaXE 显著提升了对长且复杂短语的生成准确性,尤其在长距离依赖任务中表现突出。
  • 该方法缩小了在原始数据与蒸馏数据上训练的性能差距,表明其能够有效支持 NAT 中的自监督学习。
  • 训练时间增加极小——仅比 OaXE 多约 3%,使其在大规模训练中具备实际可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。