Skip to main content
QUICK REVIEW

[论文解读] Modeling Fluency and Faithfulness for Diverse Neural Machine Translation

Yang Feng, Wanying Xie|arXiv (Cornell University)|Nov 30, 2019
Natural Language Processing Techniques参考文献 25被引用 5
一句话总结

该论文提出了一种神经机器翻译的新型训练框架,通过引入评估模块来指导预测分布,超越严格的教师强制训练,从而提升流畅性和忠实度。通过联合优化流畅性(上下文连贯性)与忠实度(语义等价性),该方法在不增加额外解码成本的情况下,实现了更高的BLEU分数以及改进的n-gram准确率和余弦相似度,优于强基线模型。

ABSTRACT

Neural machine translation models usually adopt the teacher forcing strategy for training which requires the predicted sequence matches ground truth word by word and forces the probability of each prediction to approach a 0-1 distribution. However, the strategy casts all the portion of the distribution to the ground truth word and ignores other words in the target vocabulary even when the ground truth word cannot dominate the distribution. To address the problem of teacher forcing, we propose a method to introduce an evaluation module to guide the distribution of the prediction. The evaluation module accesses each prediction from the perspectives of fluency and faithfulness to encourage the model to generate the word which has a fluent connection with its past and future translation and meanwhile tends to form a translation equivalent in meaning to the source. The experiments on multiple translation tasks show that our method can achieve significant improvements over strong baselines.

研究动机与目标

  • 为解决教师强制在神经机器翻译中的局限性,即模型被强制仅预测真实标签词,即使这些词在概率分布中并不占主导地位。
  • 通过引入更灵活的训练信号,考虑除标准参考译文外的其他有效译法,从而改进模型优化。
  • 通过在训练过程中不仅评估译文的正确性,还评估其流畅性和语义忠实度,从而提升翻译质量。
  • 开发一个统一的评估模块,在训练过程中动态平衡流畅性与忠实度,并采用自适应加权机制。

提出的方法

  • 该方法引入一个评估模块,通过计算预测词与其过去和未来翻译(自生成和真实参考)的共现概率来估计流畅性。
  • 通过计算注意力机制下的概率来评估忠实度,即利用源句上的交叉注意力计算与预测词对应的源内容的翻译概率。
  • 将流畅性与忠实度得分合并为统一损失项,用于在训练过程中引导预测分布,替代标准的0-1分布。
  • 采用复合损失进行模型训练:先进行标准交叉熵的预训练阶段,随后联合优化新引入的分布引导损失。
  • 评估模块通过可学习权重动态调整流畅性与忠实度之间的权衡,实现自适应优化。
  • 该方法集成于Transformer架构中,无需额外解码步骤,保持推理效率。

实验结果

研究问题

  • RQ1在训练阶段引入考虑流畅性与忠实度的评估模块,是否能超越标准教师强制方法,提升神经机器翻译性能?
  • RQ2通过流畅性与忠实度指标引导预测分布,是否能带来更好的模型优化与在未见数据上的泛化能力?
  • RQ3所提出方法在多大程度上提升了流畅性与忠实度指标,如n-gram准确率和与参考译文的余弦相似度?
  • RQ4该方法是否能在不增加解码复杂度的前提下,实现更高的BLEU分数?

主要发现

  • 与标准Transformer相比,该方法在训练集和验证集上均取得了更高的BLEU分数,收敛时间从基线的第9轮提前至第13轮。
  • 在CN→EN翻译任务中,1-gram准确率从79.10提升至79.82,3-gram从35.34提升至36.90,4-gram从23.82提升至25.28,表明模型在流畅性与参考n-gram覆盖方面表现更优。
  • 生成译文与参考译文之间的余弦相似度从0.873提升至0.877,表明语义忠实度得到改善。
  • 引入新损失项后,训练损失显著下降,且更低的损失与更高的BLEU分数相关,证实该损失函数是有效的优化目标。
  • 消融实验与分析验证了模型具有更好的参数拟合能力,并生成了更合理的翻译结果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。