Skip to main content
QUICK REVIEW

[论文解读] Neural Machine Translation with Adequacy-Oriented Learning

Xiang Kong, Zhaopeng Tu|arXiv (Cornell University)|Nov 21, 2018
Natural Language Processing Techniques参考文献 29被引用 7
一句话总结

本文提出了一种面向完备性的神经机器翻译(NMT)学习框架,通过将翻译建模为强化学习(RL)中的随机策略,其中奖励基于一种新颖的覆盖率差异比(CDR)度量,用于衡量翻译的完备性。该方法通过直接优化多个语种对和模型架构下的完整性和序列级完备性,显著提升了标准最大似然估计(MLE)和现有强化学习/对抗性基线的翻译质量。

ABSTRACT

Although Neural Machine Translation (NMT) models have advanced state-of-the-art performance in machine translation, they face problems like the inadequate translation. We attribute this to that the standard Maximum Likelihood Estimation (MLE) cannot judge the real translation quality due to its several limitations. In this work, we propose an adequacy-oriented learning mechanism for NMT by casting translation as a stochastic policy in Reinforcement Learning (RL), where the reward is estimated by explicitly measuring translation adequacy. Benefiting from the sequence-level training of RL strategy and a more accurate reward designed specifically for translation, our model outperforms multiple strong baselines, including (1) standard and coverage-augmented attention models with MLE-based training, and (2) advanced reinforcement and adversarial training strategies with rewards based on both word-level BLEU and character-level chrF3. Quantitative and qualitative analyses on different language pairs and NMT architectures demonstrate the effectiveness and universality of the proposed approach.

研究动机与目标

  • 为解决NMT中源句部分被遗漏的翻译不完整问题。
  • 克服最大似然估计(MLE)的局限性,包括暴露偏差、词级损失以及与翻译完备性相关性差的问题。
  • 设计一种序列级、面向完备性的训练目标,使其更符合人类对翻译质量的评估。
  • 设计一种新度量——覆盖率差异比(CDR),明确衡量有多少源词被翻译不足。
  • 将CDR度量整合到强化学习框架中,联合优化流畅性与完备性。

提出的方法

  • 将NMT建模为强化学习中的随机策略,通过策略梯度方法实现序列级训练。
  • 设计一种基于覆盖率差异比(CDR)的新奖励信号,量化模型输出与人类参考译文相比未充分翻译的源词比例。
  • 通过将注意力对齐作为代理,识别在生成翻译中未与任何目标词对齐的源词,计算CDR。
  • 使用基于CDR的奖励进行策略梯度优化训练NMT模型,使模型学会生成更完整的翻译。
  • 将基于CDR的奖励与对抗训练(通过判别器实现)结合,以提高训练稳定性和性能。
  • 将该方法应用于基于RNN和Transformer的NMT架构,证明其在不同架构间的泛化能力。

实验结果

研究问题

  • RQ1序列级、面向完备性的奖励是否能超越标准MLE和词级度量,显著提升神经机器翻译性能?
  • RQ2与BLEU和chrF3等标准度量相比,覆盖率差异比(CDR)度量在衡量翻译完备性方面的有效性如何?
  • RQ3将CDR整合到强化学习框架中,是否能在不同NMT架构和语种对上实现一致的性能提升?
  • RQ4基于CDR的奖励是否能优于使用判别器的对抗训练,以减少翻译不完整现象?
  • RQ5所提出的方法在多大程度上缓解了MLE训练中固有的暴露偏差和词级损失问题?

主要发现

  • 所提出的面向完备性的学习方法在中文到英文和德语到英文的翻译任务中,显著优于标准MLE基线模型和增强覆盖率的注意力模型。
  • CDR得分与人类评估的皮尔逊相关系数达到0.64,验证了其作为翻译完备性代理度量的有效性。
  • 在长句子(>45个词)上,基于CDR的模型保持了稳定的性能提升,而仅使用对抗训练的模型因奖励噪声而性能下降。
  • CDR与判别器的结合(即+D+O)取得了最佳性能,表明准确奖励信号与稳定训练具有互补优势。
  • 该方法同时提升了CDR和BLEU得分,表明优化完备性不会损害流畅性。
  • 案例研究显示,该模型能正确翻译标准模型遗漏的源句片段,如句子后半部分,而标准模型则无法处理。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。