Skip to main content
QUICK REVIEW

[论文解读] Towards Neural Machine Translation with Partially Aligned Corpora

Yining Wang, Yang Zhao|arXiv (Cornell University)|Nov 3, 2017
Natural Language Processing Techniques参考文献 30被引用 6
一句话总结

本文提出了一种新颖的神经机器翻译(NMT)方法,适用于仅拥有单语语料和短语对的低资源场景。该方法引入了一种双重生成策略和一种改进的目标函数,以利用从短语对和单语数据中提取的、部分对齐的句子对,即使在仅有极少平行双语语料的情况下,也能实现显著的性能提升。

ABSTRACT

While neural machine translation (NMT) has become the new paradigm, the parameter optimization requires large-scale parallel data which is scarce in many domains and language pairs. In this paper, we address a new translation scenario in which there only exists monolingual corpora and phrase pairs. We propose a new method towards translation with partially aligned sentence pairs which are derived from the phrase pairs and monolingual corpora. To make full use of the partially aligned corpora, we adapt the conventional NMT training method in two aspects. On one hand, different generation strategies are designed for aligned and unaligned target words. On the other hand, a different objective function is designed to model the partially aligned parts. The experiments demonstrate that our method can achieve a relatively good result in such a translation scenario, and tiny bitexts can boost translation quality to a large extent.

研究动机与目标

  • 解决一种新型的NMT场景,即仅提供单语语料和短语对,缺乏完整的句子级平行对。
  • 克服现有NMT方法依赖大规模平行双语语料进行有效训练的局限性。
  • 设计一种训练框架,有效利用部分对齐的句子对——即包含对齐翻译片段但非完全对齐的句子对。
  • 仅使用少量额外的平行双语语料,即可实现翻译质量的显著提升。
  • 开发一种与任何基于注意力的NMT架构兼容的方法,确保广泛适用性。

提出的方法

  • 使用基于信息检索的对齐方法,从单语语料和短语对中推导出部分对齐的句子对。
  • 实施双重生成策略:对对齐的目标词采用上下文感知生成(利用源语言上下文和先前的目标词),对未对齐的目标词采用自回归生成(仅利用先前的目标词)。
  • 设计一种改进的目标函数,强调对齐片段的可能性,同时仍最大化目标句子的整体对数似然。
  • 通过修改解码器的注意力机制和生成过程,将标准NMT训练流程适配于部分对齐的场景。
  • 在训练过程中整合部分对齐数据,而无需完整的句子对。
  • 通过将对齐部分与未对齐部分的生成逻辑解耦,确保与标准基于注意力的NMT框架兼容。

实验结果

研究问题

  • RQ1是否可以仅使用单语语料和短语对,而无需完整的句子级平行数据,有效训练神经机器翻译?
  • RQ2如何利用部分对齐的句子对——即包含对齐片段但并非完全对齐的句子对——来提升NMT性能?
  • RQ3为处理部分对齐并避免翻译质量下降,NMT训练流程需要进行哪些修改?
  • RQ4在该低资源设置下,少量额外的平行双语语料能在多大程度上进一步提升翻译质量?
  • RQ5所提出的方法是否可在不同语言对和NMT架构之间实现泛化?

主要发现

  • 所提方法在仅使用单语数据和短语对的低资源场景下,实现了相对良好的翻译性能。
  • 即使仅增加少量额外的平行双语语料,也能显著提升翻译质量,表明该方法对极少量平行数据具有高度敏感性。
  • 双重生成策略和改进的目标函数能有效利用部分对齐的片段,提升模型对低频翻译片段的学习能力。
  • 该方法在不同基于注意力的NMT框架中均表现有效,表明其具备广泛的兼容性和实际应用价值。
  • 在中英翻译任务上的实证结果表明,该模型在相同低资源条件下优于基线方法。
  • 该方法在低资源和零样本翻译场景中具有可行性,尤其在高质量短语对可用时表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。