[论文解读] English-Catalan Neural Machine Translation in the Biomedical Domain through the cascade approach
本文提出一种基于英语-西班牙语和西班牙语-加泰罗尼亚语神经机器翻译(NMT)系统的级联pivot方法,以解决低资源英语-加泰罗尼亚语生物医学翻译任务。利用Transformer架构和新创建的英语-加泰罗尼亚语生物医学测试集,该系统取得了41.38的BLEU分数,证明了在低资源生物医学场景下,基于pivot的NMT方法具有有效性。
This paper describes the methodology followed to build a neural machine translation system in the biomedical domain for the English-Catalan language pair. This task can be considered a low-resourced task from the point of view of the domain and the language pair. To face this task, this paper reports experiments on a cascade pivot strategy through Spanish for the neural machine translation using the English-Spanish SCIELO and Spanish-Catalan El Periódico database. To test the final performance of the system, we have created a new test data set for English-Catalan in the biomedical domain which is freely available on request.
研究动机与目标
- 为解决生物医学领域中低资源英语-加泰罗尼亚语神经机器翻译的挑战。
- 评估以西班牙语作为中间语言的级联pivot策略的有效性。
- 开发并发布一个用于评估的新高质量英语-加泰罗尼亚语生物医学测试集。
- 证明Transformer架构可通过pivot方法在低资源生物医学翻译中实现优异性能。
- 为未来在资源匮乏语言对上的生物医学NMT研究提供基线。
提出的方法
- 该系统采用级联pivot策略:首先使用预训练的Transformer模型将英语翻译为西班牙语,然后将西班牙语翻译为加泰罗尼亚语。
- 英语-西班牙语模型在包含2050万段落的SCIELO生物医学平行语料库上进行训练。
- 西班牙语-加泰罗尼亚语模型在包含650万段落的El Periódico新闻语料库上进行训练。
- 最终的英语-加泰罗尼亚语翻译结果通过串联两个模型的输出获得。
- 文本预处理包括分词、句子过滤(1–50个词),以及使用Freeling对英语和西班牙语中的代词和附着词进行特殊处理。
- 通过首先将WMT 2016年西班牙语生物医学测试集自动翻译为加泰罗尼亚语,随后进行专业后期编辑,创建了新的英语-加泰罗尼亚语测试集。
实验结果
研究问题
- RQ1尽管并行数据有限,级联pivot策略是否能有效提升英语-加泰罗尼亚语生物医学神经机器翻译性能?
- RQ2在低资源设置下,级联NMT系统的性能与直接翻译系统相比如何?
- RQ3Transformer架构在生物医学文本中对有效pivot-based翻译的支持程度如何?
- RQ4能否可靠地构建一个高质量、领域特定的英语-加泰罗尼亚语测试集用于评估?
- RQ5在低资源设置下,pivot-based方法作为未来无监督或多语言NMT方法的基线,其潜力如何?
主要发现
- 英语-西班牙语NMT系统在WMT 2016年生物医学测试集上取得了46.55的BLEU分数。
- 西班牙语-加泰罗尼亚语NMT系统在El Periódico测试集上取得了86.89的BLEU分数。
- 级联的英语-西班牙语-加泰罗尼亚语系统在新创建的英语-加泰罗尼亚语生物医学测试集上取得了41.38的BLEU分数。
- BLEU分数使用t2t-bleu脚本计算,该脚本等同于Moses工具包中的mteval-v14.pl。
- 本研究为未来研究免费提供了英语-加泰罗尼亚语生物医学测试集。
- 结果证实,基于Transformer架构的pivot-based NMT是低资源生物医学翻译任务的可行解决方案。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。