[论文解读] Towards a parallel corpus of Portuguese and the Bantu language Emakhuwa of Mozambique
本论文介绍了葡萄牙语与埃马库瓦语(一种在莫桑比克使用的低资源班图语)的47,415组句子对平行语料库的创建,语料来源为宗教、法律和教育文本。该语料库包含699,976个埃马库瓦语词符和877,595个葡萄牙语词符,已进行标准化处理以供研究使用,并包含一个基线神经机器翻译模型,在葡萄牙语到埃马库瓦语翻译任务上达到12.42的BLEU分数。
Major advancement in the performance of machine translation models has been made possible in part thanks to the availability of large-scale parallel corpora. But for most languages in the world, the existence of such corpora is rare. Emakhuwa, a language spoken in Mozambique, is like most African languages low-resource in NLP terms. It lacks both computational and linguistic resources and, to the best of our knowledge, few parallel corpora including Emakhuwa already exist. In this paper we describe the creation of the Emakhuwa-Portuguese parallel corpus, which is a collection of texts from the Jehovah's Witness website and a variety of other sources including the African Story Book website, the Universal Declaration of Human Rights and Mozambican legal documents. The dataset contains 47,415 sentence pairs, amounting to 699,976 word tokens of Emakhuwa and 877,595 word tokens in Portuguese. After normalization processes which remain to be completed, the corpus will be made freely available for research use.
研究动机与目标
- 通过为葡萄牙语和埃马库瓦语创建大规模多语言数据集,解决低资源非洲语言平行语料稀缺的问题。
- 支持为埃马库瓦语(一种计算和语言资源有限的班图语)开发神经机器翻译(NMT)系统。
- 通过整合宗教、法律和教育材料等多样化文本来源,提升非洲语言NLP的可及性和研究潜力。
- 为未来语料库在多样化领域和改进语言标准化方面的扩展奠定基础。
- 提供一个公开可用的标准化数据集,以支持低资源翻译场景下的可复现研究和模型基准测试。
提出的方法
- 从多个来源收集平行文本:耶和华见证人网站(JW)、非洲故事书(ASB)、保罗六世教理中心(CCA)、《世界人权宣言》(HR)以及莫桑比克土地法(LL)。
- 对扫描文档执行OCR处理,随后人工校正常见的OCR错误,如将'ì'误识别为'T',将'á'误识别为'6'。
- 执行句子级别的分段与过滤,以去除识别错误或格式错误的句子。
- 人工对齐葡萄牙语与埃马库瓦语句子,以确保准确的平行句子对。
- 处理拼写不一致问题,包括动词形式中'j'与'c'的混用、'erya'与'jerya'的差异,以及'biblia'与'biibiliya'在'圣经'一词上的拼写变体。
- 使用OpenNMT-py训练基线NMT模型,采用两层LSTM编码器和解码器(隐藏单元500个),在数据的90:10随机划分上进行训练。
实验结果
研究问题
- RQ1如何为像埃马库瓦语这样的低资源非洲语言构建大规模、高质量的平行语料库?
- RQ2在收集和标准化埃马库瓦语平行文本时,主要挑战是什么,特别是拼写变体和OCR错误方面?
- RQ3在新创建的埃马库瓦语-葡萄牙语平行语料库上,使用标准NMT架构可达到的基线性能如何?
- RQ4如何将宗教、法律和教育等多样化文本来源整合到一个可用于低资源语言翻译的统一、可用的平行语料库中?
- RQ5社区驱动的倡议和开放数据共享在推动资源匮乏的非洲语言NLP发展方面发挥什么作用?
主要发现
- 最终语料库包含47,415组句子对,埃马库瓦语词符数为699,976个,葡萄牙语词符数为877,595个。
- 该数据集源自125对文档,涵盖五个不同来源,包括宗教文本(JW, CCA)、教育内容(ASB)、法律文件(LL)以及人权宣言(HR)。
- 基线NMT模型在葡萄牙语到埃马库瓦语翻译任务上获得12.42的BLEU分数,在埃马库瓦语到葡萄牙语翻译任务上获得13.09的BLEU分数。
- 识别出显著的拼写不一致问题,如动词形式中'cerya'与'jerya'的差异,以及'biblia'与'biibiliya'在'圣经'一词上的拼写变体,未来需进行标准化处理。
- OCR错误(如将'ì'误识别为'T',将'á'误识别为'6')在预处理阶段需人工校正。
- 预计在完成标准化后,该语料库将公开发布,并计划通过引入更多数据源和提升领域多样性来扩展语料库。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。