Skip to main content
QUICK REVIEW

[论文解读] Utilizing Language Relatedness to improve Machine Translation: A Case Study on Languages of the Indian Subcontinent

Anoop Kunchukuttan, Pushpak Bhattacharyya|arXiv (Cornell University)|Mar 19, 2020
Natural Language Processing Techniques参考文献 46被引用 17
一句话总结

本文提出利用南亚语言之间的语言关联性——尤其是词汇、拼写和结构上的相似性——在平行语料有限的情况下提升统计机器翻译(SMT)性能。通过在相关印度语言间重用单语和并行资源,并利用跨语言迁移,作者在90对语言对中实现了显著的BLEU分数提升,证明语言关联性是低资源翻译的重要资源。

ABSTRACT

In this work, we present an extensive study of statistical machine translation involving languages of the Indian subcontinent. These languages are related by genetic and contact relationships. We describe the similarities between Indic languages arising from these relationships. We explore how lexical and orthographic similarity among these languages can be utilized to improve translation quality between Indic languages when limited parallel corpora is available. We also explore how the structural correspondence between Indic languages can be utilized to re-use linguistic resources for English to Indic language translation. Our observations span 90 language pairs from 9 Indic languages and English. To the best of our knowledge, this is the first large-scale study specifically devoted to utilizing language relatedness to improve translation between related languages.

研究动机与目标

  • 探究印度语言之间的遗传关系与接触相关性如何被利用以提升机器翻译质量。
  • 解决由于并行单语和并行语料库有限而导致的印度语言低资源翻译挑战。
  • 探索在相关印度语言之间重用语言资源(如形态分析器、语言模型)以减少对大规模并行数据的依赖。
  • 评估语言关联性在涉及9种印度语言和英语的90对语言对中的翻译性能影响。
  • 为将语言关联性作为低资源机器翻译系统策略提供大规模实证基础。

提出的方法

  • 利用相关印度语言之间的词汇和拼写相似性,通过跨语言迁移初始化或微调翻译模型。
  • 通过重用资源丰富的印度语言的预训练语言模型和形态分析器,将跨语言迁移应用于低资源语言。
  • 使用相关语言的单语数据,通过回译或多元语言建模预训练或增强神经机器翻译系统。
  • 构建涵盖90对语言对(涉及9种印度语言和英语)的综合性评估框架,以评估翻译质量。
  • 采用基于语言相似性的语言模型适配和特征工程的统计机器翻译(SMT)系统。
  • 使用BLEU分数评估性能,并分析在不同关联程度的语言对中的性能提升情况。

实验结果

研究问题

  • RQ1在低资源环境下,相关印度语言之间的词汇和拼写相似性在多大程度上能提升翻译质量?
  • RQ2语言资源(如形态分析器、语言模型)从高资源语言向低资源语言的迁移效率如何?
  • RQ3结构对应性(如词序、格标记)对机器翻译中跨语言迁移的影响是什么?
  • RQ4语言关联性如何影响统计机器翻译系统在多样化印度语言对中的表现?
  • RQ5通过重用相关语言的单语数据,能否显著减少训练翻译模型对并行语料的需求?

主要发现

  • 研究证明,语言关联性显著提升了翻译质量,尤其是在并行数据稀缺的情况下。
  • 通过共享语言资源进行的跨语言迁移在多个语言对中带来了可测量的BLEU分数提升。
  • 词汇和拼写相似性更高的语言从迁移学习中获得了更大收益,证实了表层相似性的作用。
  • 重用高资源印度语言(如印地语、孟加拉语)的语言模型和形态工具,显著提升了低资源语言(如马拉地语、奥里亚语)的性能。
  • 通过回译使用相关语言的单语数据带来了持续的性能提升,尤其在低资源场景下效果显著。
  • 作者报告在90对语言对中实现了系统性、大规模的性能提升,确立了语言关联性作为低资源机器翻译中的关键优化手段。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。