Skip to main content
QUICK REVIEW

[论文解读] Transfer learning and subword sampling for asymmetric-resource one-to-many neural translation

Stig-Arne Grönroos, Sámi Virpioja|arXiv (Cornell University)|Apr 8, 2020
Natural Language Processing Techniques参考文献 100被引用 6
一句话总结

本文提出一种基于子词采样和去噪自编码器的调度多任务学习框架,以提升在非对称资源设置下的低资源多对一神经机器翻译性能。通过利用高资源目标语言进行跨语言迁移,借助回译和自编码器使用单语数据,并通过Morfessor EM+Prune优化子词分段,该方法在爱沙尼亚语、斯洛伐克/捷克语、丹麦语/瑞典语以及挪威语/北萨米语任务中实现了最高+12.7 BLEU的性能提升,其中调度训练和子词正则化带来了最一致的改进效果。

ABSTRACT

There are several approaches for improving neural machine translation for low-resource languages: Monolingual data can be exploited via pretraining or data augmentation; Parallel corpora on related language pairs can be used via parameter sharing or transfer learning in multilingual models; Subword segmentation and regularization techniques can be applied to ensure high coverage of the vocabulary. We review these approaches in the context of an asymmetric-resource one-to-many translation task, in which the pair of target languages are related, with one being a very low-resource and the other a higher-resource language. We test various methods on three artificially restricted translation tasks -- English to Estonian (low-resource) and Finnish (high-resource), English to Slovak and Czech, English to Danish and Swedish -- and one real-world task, Norwegian to North S\'ami and Finnish. The experiments show positive effects especially for scheduled multi-task learning, denoising autoencoder, and subword sampling.

研究动机与目标

  • 解决在一种目标语言的平行数据远少于另一种目标语言的非对称多对一设置下,低资源神经机器翻译的挑战。
  • 研究有效的迁移学习策略,利用相关高资源语言作为辅助目标,提升词形丰富的低资源语言的翻译质量。
  • 优化子词分段和词汇构建,以减少数据稀疏性并提升低资源场景下的泛化能力。
  • 评估通过回译和去噪自编码器进行单语数据增强对低资源翻译性能的影响。
  • 确定不同训练调度、噪声模型和词汇构建技术在低资源多语言神经机器翻译中的相对有效性。

提出的方法

  • 提出调度多任务学习:先在高资源语言任务上进行预训练,再通过同时微调高资源和低资源任务来避免过拟合。
  • 引入禁忌采样任务,通过在训练期间排除特定子词单元来建模子词分段的歧义性。
  • 采用多种噪声类型(子词正则化、重排、删除和替换)的去噪自编码器,以提升模型鲁棒性。
  • 使用Morfessor EM+Prune进行数据驱动的子词词汇学习,优先选择基于先验的分段方式,而非BPE或SentencePiece。
  • 通过目标到源的模型应用回译,从单语语料中生成合成平行数据。
  • 实现一个多任务数据加载器,能够在训练过程中采样带噪声的小批量数据并调度任务混合。

实验结果

研究问题

  • RQ1在非对称资源多对一翻译中,调度多任务学习是否优于顺序或完全并行的迁移策略?
  • RQ2低资源目标语言的去噪自编码器是否能提升翻译质量,尤其是在与回译结合时?
  • RQ3子词正则化有多有效?哪些噪声模型(如删除、重排)对低资源NMT最有益?
  • RQ4子词分段方法(如Morfessor与SentencePiece)和词汇表大小的选择是否显著影响翻译质量?
  • RQ5语言相关性以及数据量(尤其是低资源语言)如何影响跨语言迁移的有效性?

主要发现

  • 调度多任务学习带来了最高的单项目+2.4 BLEU提升,优于顺序和完全并行训练策略。
  • 通过多语言训练实现的跨语言迁移取得了最大的+12.7 BLEU提升,证明了利用高资源目标语言的强大优势。
  • 回译提供了最高+4.46 BLEU的性能提升,证实其作为低资源环境下数据增强技术的有效性。
  • Morfessor EM+Prune子词分段方法比SentencePiece高出+0.6 BLEU,表明基于先验的分段方法具有优势。
  • 子词正则化和多噪声去噪自编码器提升了模型鲁棒性,尤其对罕见词效果显著,但影响因语言对而异。
  • 即使仅有10,000句平行语料对,低资源平行数据仍能带来显著性能提升,且在此阈值后收益递减。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。