[论文解读] English-Twi Parallel Corpus for Machine Translation
本论文提出一个包含25,421个句子的英语-阿夸佩姆特威平行语料库,用于训练和评估机器翻译模型。该语料库采用基于Transformer的模型生成初始翻译,随后由母语者进行验证以消除翻译腔。该数据集可用于神经机器翻译模型的微调,并包含一个高质量的697个句子评估集,显著推动了阿夸佩姆特威语的低资源自然语言处理研究。
We present a parallel machine translation training corpus for English and Akuapem Twi of 25,421 sentence pairs. We used a transformer-based translator to generate initial translations in Akuapem Twi, which were later verified and corrected where necessary by native speakers to eliminate any occurrence of translationese. In addition, 697 higher quality crowd-sourced sentences are provided for use as an evaluation set for downstream Natural Language Processing (NLP) tasks. The typical use case for the larger human-verified dataset is for further training of machine translation models in Akuapem Twi. The higher quality 697 crowd-sourced dataset is recommended as a testing dataset for machine translation of English to Twi and Twi to English models. Furthermore, the Twi part of the crowd-sourced data may also be used for other tasks, such as representation learning, classification, etc. We fine-tune the transformer translation model on the training corpus and report benchmarks on the crowd-sourced test set.
研究动机与目标
- 为解决加纳语言(尤其是低资源语言阿夸佩姆特威语)缺乏可靠机器翻译系统的问题。
- 创建一个高质量、经人工验证的平行语料库,以支持神经机器翻译模型的训练与评估。
- 促进特威语中命名实体识别和词性标注等下游自然语言处理任务。
- 通过开放、社区驱动的数据收集方式,提升阿夸佩姆特威语在数字时代的可及性与保存水平。
- 通过提供公开可用、语言准确的资源,支持非洲自然语言处理的发展。
提出的方法
- 使用基于Transformer的神经机器翻译模型(OPUS-MT)生成初始的英-特威翻译。
- 由母语特威语者对机器生成的翻译进行验证与修正,以消除翻译腔并提升流畅度。
- 通过谷歌表单从加纳各地的母语者处收集了另一组更高品质的697对众包句子对。
- 使用训练语料库对Transformer翻译模型进行微调,并在众包测试集上评估其性能。
- 该数据集的设计兼顾模型训练与评估,同时具备在表征学习及其他自然语言处理任务中的应用潜力。
- 项目获得了微软初创企业计划和AI4D的外部支持,包括GPU资源与资金支持。
实验结果
研究问题
- RQ1如何为阿夸佩姆特威语(一种在数字领域存在感有限的加纳语言)构建一个高质量的低资源平行语料库?
- RQ2对机器生成的翻译进行人工后编辑,在多大程度上能提升阿夸佩姆特威语的流畅度与准确性?
- RQ3在专门的母语特威语翻译评估集上,微调后的Transformer模型能否实现性能提升?
- RQ4社区众包数据在提升非洲语言NLP资源的质量与文化相关性方面发挥何种作用?
- RQ5开放、公开可用的数据集如何加速阿夸佩姆特威语等低资源非洲语言的自然语言处理研究?
主要发现
- 最终的训练语料库包含25,421对英语与阿夸佩姆特威语的句子对,翻译经母语者验证,确保了流畅性与准确性。
- 评估集由697对高质量、众包收集的句子对组成,来自加纳各地的母语特威语者,适用于机器翻译模型的测试。
- 在人工验证语料库上对Transformer模型进行微调后,翻译质量得到提升,尤其体现在减少逐字翻译或非习语表达方面。
- 示例显示,尽管初始机器翻译在句法上正确,但常需人工修正以确保语义准确,例如“我变得更好”被错误翻译为“M'ani agye yiye”。
- 研究识别出特定翻译错误,如“打开煤气”被误译为“fa w'ani si gaas no so”,凸显了持续优化语料库的必要性。
- 本研究证明,人工参与的数据整理在实现低资源语言中高质量、文化适宜的翻译方面至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。