Skip to main content
QUICK REVIEW

[论文解读] Target Conditioned Sampling: Optimizing Data Selection for Multilingual Neural Machine Translation

Xinyi Wang, Graham Neubig|arXiv (Cornell University)|May 20, 2019
Natural Language Processing Techniques参考文献 21被引用 4
一句话总结

本文提出目标条件采样(TCS),一种数据选择方法,通过基于目标句相关性条件性地采样源句,优化多语言神经机器翻译,最小化低资源语言的训练损失。TCS在训练开销极低的情况下,相较于强基线模型,实现了最高达2 BLEU的性能提升,显著改善了低资源翻译性能,同时保持了高效性。

ABSTRACT

To improve low-resource Neural Machine Translation (NMT) with multilingual corpora, training on the most related high-resource language only is often more effective than using all data available (Neubig and Hu, 2018). However, it is possible that an intelligent data selection strategy can further improve low-resource NMT with data from other auxiliary languages. In this paper, we seek to construct a sampling distribution over all multilingual data, so that it minimizes the training loss of the low-resource language. Based on this formulation, we propose an efficient algorithm, Target Conditioned Sampling (TCS), which first samples a target sentence, and then conditionally samples its source sentence. Experiments show that TCS brings significant gains of up to 2 BLEU on three of four languages we test, with minimal training overhead.

研究动机与目标

  • 为解决利用多语言平行语料提升低资源神经机器翻译(NMT)的挑战。
  • 设计一种智能选择相关多语言训练数据的数据选择策略,以提升NMT性能与训练速度。
  • 通过在多语言数据上构建最优采样分布,最小化低资源语言模型的训练损失。
  • 开发一种高效、目标无关的采样框架,利用条件性源不变性实现更好的泛化能力。
  • 通过多种相似性度量和模型架构,在多个低资源语言上评估TCS的有效性。

提出的方法

  • TCS构建一个采样分布 Q(X,Y),在近似真实源-目标分布 P_s(X,Y) 的同时,确保目标不变性 Q(Y) ≈ P_s(Y)。
  • 该方法首先从 Q(Y) 中采样一个目标句 y,然后从 Q(X|y) 中条件性地采样一个源句 x,其中 Q(X|y) 由源语言与目标语言之间的相似性推导得出。
  • TCS使用语言级别或句子级别的相似性度量(如语言模型得分、词汇重叠等)来估计 Q(X|y),并提供兼顾多样性的采样(TCS-S)或文档级别的相似性(TCS-D)选项。
  • 该框架设计高效,无需额外预训练,可无缝集成到标准NMT训练流程中。
  • TCS在标准NMT模型和软解耦编码(SDE)模型上均进行了评估,以检验其在不同架构上的泛化能力。
  • 该方法基于数学公式化,确保在 Q(X,Y) 上的期望损失与在 P_s(X,Y) 上的真实损失相关,从而实现有效的优化。

实验结果

研究问题

  • RQ1基于目标相关性的多语言数据采样策略,是否能超越仅使用高资源语言数据的方式,进一步提升低资源神经机器翻译性能?
  • RQ2如何构建一个采样分布 Q(X,Y),在保持目标不变性的前提下,最小化低资源语言模型的训练损失?
  • RQ3在低资源设置下,估计 Q(X|y) 时最有效的相似性度量是什么?它们对性能有何影响?
  • RQ4TCS是否在提升翻译质量的同时保持训练效率,尤其是在与全量数据训练相比时?
  • RQ5TCS在不同多语言NMT架构(如使用软解耦编码SDE的模型)上是否具有良好的泛化能力?

主要发现

  • 在四个低资源语言中的三个(aze、glg、slk)上,TCS相较于强基线模型实现了最高达2 BLEU的性能提升,第四种语言(bel)上无性能下降。
  • 在 aze 上,使用词汇级别相似性的 TCS-S 达到 12.37 BLEU,显著优于最佳基线(11.87 BLEU),p<0.05。
  • 在 bel 上,使用词汇级别相似性的 TCS-S 达到 19.83 BLEU,优于最佳基线(18.03 BLEU),p<0.05,同时减少了训练时间。
  • 在 SDE 模型设置下,TCS 在 aze 上实现了 0.5 BLEU 的提升,在 glg 和 slk 上最高达 2 BLEU,表明其在不同架构间具有强大的泛化能力。
  • TCS-D 和 TCS-S 在所有语言上均优于基线,其中 TCS-S 表现更优,得益于更高的数据多样性。
  • 开发困惑度曲线显示,TCS 在损失下降方面始终与基线相当或更快,表明其训练过程高效且有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。