[论文解读] Extended Parallel Corpus for Amharic-English Machine Translation
本论文展示了一个扩展的、高质量的阿姆哈拉语-英语双语语料库,该语料库源自报纸、杂志和教科书等经过编辑的来源,经过严格的预处理和标准化,以解决拼写变体和低资源语言的挑战。该语料库支持统计和神经机器翻译模型的训练,其中神经模型相比统计模型在BLEU分数上高出6–7分,子词模型相比词级模型高出3–4分,显著提升了低资源语言翻译的性能。
This paper describes the acquisition, preprocessing, segmentation, and alignment of an Amharic-English parallel corpus. It will be helpful for machine translation of a low-resource language, Amharic. We freely released the corpus for research purposes. Furthermore, we developed baseline statistical and neural machine translation systems; we trained statistical and neural machine translation models using the corpus. In the experiments, we also used a large monolingual corpus for the language model of statistical machine translation and back-translation of neural machine translation. In the automatic evaluation, neural machine translation models outperform statistical machine translation models by approximately six to seven Bilingual Evaluation Understudy (BLEU) points. Besides, among the neural machine translation models, the subword models outperform the word-based models by three to four BLEU points. Moreover, two other relevant automatic evaluation metrics, Translation Edit Rate on Character Level and Better Evaluation as Ranking, reflect corresponding differences among the trained models.
研究动机与目标
- 为解决阿姆哈拉语这一低资源闪米特语系语言(具有复杂的音节字母文字和拼写不一致问题)缺乏高质量双语语料库的问题。
- 从可靠且经过编辑的来源(而非网络爬取数据)构建大规模、清洗和标准化的阿姆哈拉语-英语双语语料库。
- 在新语料库上训练并评估统计和神经机器翻译模型,以基准化性能提升。
- 研究子词分词和通过回译使用单语数据对翻译质量的影响。
- 公开发布该语料库,以支持低资源语言机器翻译研究。
提出的方法
- 从报纸、杂志和教科书等来源收集双语文本,以确保语言质量高于网络来源的语料。
- 执行文本标准化和自动拼写校正,以减少阿姆哈拉语中的拼写不一致。
- 使用无监督方法进行句子对齐,避免依赖双语词典,因为缺乏全面的阿姆哈拉语-英语词典。
- 在语料库上训练基于短语的统计机器翻译(SMT)和基于Transformer的神经机器翻译(NMT)模型。
- 通过使用大规模单语英语语料库增强SMT的语言模型,通过使用单语数据进行回译来提升NMT性能。
- 在NMT中使用子词分词(BPE)以处理罕见词和未登录词,提升泛化能力。
实验结果
研究问题
- RQ1高质量、人工整理的阿姆哈拉语-英语双语语料库能否提升低资源语言的机器翻译性能?
- RQ2当在相同扩展语料库上训练时,神经机器翻译模型与统计模型相比表现如何?
- RQ3与词级分词相比,子词分词在阿姆哈拉语-英语翻译中是否提供了可测量的优势?
- RQ4通过回译引入单语数据在多大程度上能提升阿姆哈拉语神经机器翻译的性能?
- RQ5自动预处理和标准化能否有效减少阿姆哈拉语中的拼写变体并提升对齐质量?
主要发现
- 神经机器翻译模型在自动评估中相比统计模型高出约6–7 BLEU分。
- 基于子词的NMT模型相比词级NMT模型高出3–4 BLEU分,表明其在处理罕见和复杂阿姆哈拉语词形方面表现更优。
- 字符级翻译编辑率(TER-C)和更好的排名评估(BER)指标与BLEU分数观察到的性能差异一致。
- 该语料库显著提升了相较于以往小规模或低质量阿姆哈拉语-英语语料库的翻译质量,使训练具有竞争力的模型成为可能。
- 通过回译使用单语数据进一步提升了NMT性能,尤其在低资源环境下效果显著。
- 免费发布的语料库为未来阿姆哈拉语及其他低资源语言的机器翻译研究提供了宝贵资源。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。