QUICK REVIEW
[论文解读] Tigrinya Neural Machine Translation with Transfer Learning for Humanitarian Response
Alp Öktem, Mirko Plitt|arXiv (Cornell University)|Mar 9, 2020
Natural Language Processing Techniques参考文献 16被引用 9
一句话总结
本文提出了一种使用其他吉兹字母语言(如阿姆哈拉语、吉兹语)进行跨语言迁移学习的提格雷尼亚语-英语神经机器翻译系统,相较于标准神经基线模型,BLEU得分提升了1.3点。该方法首先在145万条句子的多语言语料上进行预训练,随后在人道主义领域数据上进行领域特定微调,最终实现一个功能完整的开源模型及公开演示应用。
ABSTRACT
We report our experiments in building a domain-specific Tigrinya-to-English neural machine translation system. We use transfer learning from other Ge'ez script languages and report an improvement of 1.3 BLEU points over a classic neural baseline. We publish our development pipeline as an open-source library and also provide a demonstration application.
研究动机与目标
- 为厄立特里亚和埃塞俄比亚约790万提格雷尼亚语使用者的低资源语言提供机器翻译支持。
- 克服提格雷尼亚语的形态复杂性,该复杂性阻碍了传统统计机器翻译方法的应用。
- 通过神经机器翻译实现双向通信,提升欧洲提格雷尼亚语难民获取信息的能力。
- 在有限平行语料基础上,开发针对人道主义语境的领域适配翻译系统。
- 发布开源处理管道与公开演示应用,以支持人道主义组织与非营利机构。
提出的方法
- 系统在来自多种吉兹字母语言(包括提格雷尼亚语和阿姆哈拉语)的混合语料上进行多语言预训练,语料总量达145万条句子。
- 通过迁移学习,先在混合多语言数据集上训练一个6层、8头注意力机制的Transformer模型,随后在提格雷尼亚语专属数据上进行微调。
- 模型进一步在自建的2,300对提格雷尼亚语-英语人道主义领域语料上进行微调,以提升领域相关性。
- 采用6,000个子词单元的字节对编码(BPE)进行吉兹字母与拉丁字母的分词处理,吉兹字母采用考虑标点符号的分词方式。
- 训练流程使用OpenNMT-py工具包,优化器为Adam,学习率预热步数为4,000步,基于验证困惑度进行早停。
- 评估采用标准指标:BLEU、ChrF和Meteor,测试集为200条句子的保留集。
实验结果
研究问题
- RQ1能否通过高资源吉兹字母语言的迁移学习提升低资源提格雷尼亚语-英语神经机器翻译性能?
- RQ2与仅使用提格雷尼亚语数据从零开始训练相比,多语言预训练在翻译质量上表现如何?
- RQ3在人道主义文本上进行领域特定微调,能在多大程度上提升提格雷尼亚语的翻译性能?
- RQ4在平行语料有限的情况下,能否在真实人道主义场景中有效部署提格雷尼亚语神经机器翻译系统?
- RQ5结合多语言预训练与领域内微调,对BLEU和ChrF等自动评估指标有何影响?
主要发现
- 多语言预训练方法使BLEU得分相比基线提升1.3分,在测试集上达到23.60 BLEU。
- 领域内微调后,ChrF得分提升3.1分(从46.51提升至49.59)。
- Meteor得分提升0.94分,从基线的26.10提升至最终模型的27.04。
- 最终模型在所有三项自动评估指标上均优于基线:BLEU(+1.32)、ChrF(+3.10)和Meteor(+0.94)。
- 该模型已成功部署为公开演示应用,网址为 http://gamayun.translatorswb.org/tigrinya,标志着首个神经网络提格雷尼亚语-英语翻译器的诞生。
- 开源的训练管道与模型权重已发布,以支持未来开发及人道主义应用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。