Skip to main content
QUICK REVIEW

[论文解读] Marathi To English Neural Machine Translation With Near Perfect Corpus And Transformers

Swapnil Ashok Jadhav|arXiv (Cornell University)|Feb 26, 2020
Natural Language Processing Techniques参考文献 18被引用 10
一句话总结

本论文提出了一种基于Transformer架构和近乎完美的平行语料库的马拉地语到英语神经机器翻译系统,使用Facebook的Fairseq进行训练,并采用Hugging Face的BERT分词器。该系统在Tatoeba和Wikimedia数据集上的BLEU得分高于谷歌,即使训练数据有限,也实现了低资源印度语言的最先进性能。

ABSTRACT

There have been very few attempts to benchmark performances of state-of-the-art algorithms for Neural Machine Translation task on Indian Languages. Google, Bing, Facebook and Yandex are some of the very few companies which have built translation systems for few of the Indian Languages. Among them, translation results from Google are supposed to be better, based on general inspection. Bing-Translator do not even support Marathi language which has around 95 million speakers and ranks 15th in the world in terms of combined primary and secondary speakers. In this exercise, we trained and compared variety of Neural Machine Marathi to English Translators trained with BERT-tokenizer by huggingface and various Transformer based architectures using Facebook's Fairseq platform with limited but almost correct parallel corpus to achieve better BLEU scores than Google on Tatoeba and Wikimedia open datasets.

研究动机与目标

  • 为低资源印度语言开发高精度的马拉地语到英语神经机器翻译系统。
  • 在有限但高度准确的平行语料库上评估最先进的基于Transformer的架构在马拉地语上的表现。
  • 使用公开基准数据集与谷歌翻译等商业系统进行性能对比。
  • 证明近乎完美的平行语料库即使在数据量有限的情况下也能显著提升翻译质量。
  • 为马拉地语(约9500万使用者但商业支持有限)贡献一个可复现的开源神经机器翻译系统。

提出的方法

  • 使用Facebook的Fairseq框架,在有限但高度准确的平行语料库上训练多种基于Transformer的架构。
  • 使用Hugging Face的BERT分词器对输入序列进行分词,以改善子词表示和OOV(未登录词)处理。
  • 通过超参数调优和早停策略优化模型,防止在小规模数据集上过拟合。
  • 使用Tatoeba和Wikimedia的公开测试集上的BLEU得分评估模型性能。
  • 使用经过筛选的近乎完美的平行语料库,以减少噪声并提升低资源环境下的对齐质量。
  • 对比多种Transformer变体,以识别在马拉地语到英语翻译任务中表现最佳的架构。

实验结果

研究问题

  • RQ1尽管训练数据量有限,近乎完美的平行语料库是否能显著提升马拉地语到英语神经机器翻译的性能?
  • RQ2基于Transformer的架构是否在低资源马拉地语到英语翻译任务中优于其他神经架构?
  • RQ3微调后的自定义模型是否能在公开基准数据集上超越谷歌翻译等商业系统?
  • RQ4BERT分词在低资源环境下的翻译质量中产生何种影响?
  • RQ5在平行数据极少的情况下,马拉地语到英语翻译的最优Transformer架构是什么?

主要发现

  • 所提出的模型在Tatoeba和Wikimedia两个公开数据集上的BLEU得分均高于谷歌翻译。
  • 使用近乎完美的平行语料库即使在训练数据量有限的情况下,也显著提升了性能。
  • 经过Fairseq微调并结合BERT分词的Transformer架构在评估中优于其他神经架构。
  • 该系统表明,高质量、经筛选的平行数据可以弥补低资源语言对之间的数据稀缺问题。
  • 该模型的性能超越了现有商业系统,显示出在低资源自然语言处理应用中的巨大潜力。
  • 结果验证了将筛选后的数据与现代Transformer架构结合在印度语言翻译中的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。