Skip to main content
QUICK REVIEW

[论文解读] Improving Yorùbá Diacritic Restoration

Iroro Orife, David Ifeoluwa Adelani|arXiv (Cornell University)|Mar 23, 2020
Agriculture and Rural Development Research被引用 5
一句话总结

该论文通过扩展训练数据至多样化、非宗教性的来源——包括OCR处理的虚构作品、新闻和对话文本——改进了约鲁巴语变音符号恢复(ADR)任务,采用Transformer模型与FastText词嵌入,取得了59.80的BLEU得分,显著优于先前模型。该方法在口语化及代码混用语言上的泛化能力得到增强,对约鲁巴语在真实场景中的自然语言处理应用具有重要意义。

ABSTRACT

Yorùbá is a widely spoken West African language with a writing system rich in orthographic and tonal diacritics. They provide morphological information, are crucial for lexical disambiguation, pronunciation and are vital for any computational Speech or Natural Language Processing tasks. However diacritic marks are commonly excluded from electronic texts due to limited device and application support as well as general education on proper usage. We report on recent efforts at dataset cultivation. By aggregating and improving disparate texts from the web and various personal libraries, we were able to significantly grow our clean Yorùbá dataset from a majority Bibilical text corpora with three sources to millions of tokens from over a dozen sources. We evaluate updated diacritic restoration models on a new, general purpose, public-domain Yorùbá evaluation dataset of modern journalistic news text, selected to be multi-purpose and reflecting contemporary usage. All pre-trained models, datasets and source-code have been released as an open-source project to advance efforts on Yorùbá language technology.

研究动机与目标

  • 解决现有ADR模型在口语化、对话式及代码混用约鲁巴语文本上泛化能力差的问题。
  • 通过提升模型在多样化语言领域中的表现,减少非变音符号约鲁巴语文本中的歧义。
  • 开发一个强大且开源的ADR系统,能够以高精度处理真实世界电子文本。
  • 通过扩展高质量训练数据(超越有限的宗教语料库),提升模型性能。
  • 实现在用户端应用与设备中部署ADR技术,推动约鲁巴语语言技术的实际应用。

提出的方法

  • 从公共领域来源收集并整理了多样化的约鲁巴语文本,包括新闻(Global Voices)、虚构作品(Háà Ènìyàn)、谚语及人权宣言。
  • 使用商业OCR软件处理扫描书籍,通过引入英文、罗马尼亚文和越南文字母,近似模拟约鲁巴文字集。
  • 实施人机协同校对流程,一名专家耗时两周校对20,038个虚构作品中的单词。
  • 在AWS p3.2xlarge实例上,使用OpenNMT-py训练软注意力seq2seq与基于Transformer的模型。
  • 引入FastText词嵌入以评估其对ADR性能的影响。
  • 在来自Global Voices的新现代测试集上,使用BLEU、困惑度与词错误率(WER)评估模型性能。

实验结果

研究问题

  • RQ1将训练数据扩展至宗教语料库之外,能否提升ADR模型在口语化与对话式约鲁巴语文本上的泛化能力?
  • RQ2预训练的FastText词嵌入在不同模型架构中,对ADR性能的提升程度如何?
  • RQ3ADR模型对罕见词、含数字或代码混用的输入词的鲁棒性如何?
  • RQ4与软注意力seq2seq模型相比,基于Transformer的架构在约鲁巴语ADR任务中性能提升多少?
  • RQ5基于新闻文本构建的新现代评估数据集,是否能比现有文学语料库更真实地反映现实世界ADR挑战?

主要发现

  • 表现最佳的模型为结合全部新训练数据与FastText词嵌入的Transformer模型,在Global Voices测试集上取得59.80的BLEU得分。
  • 加入所有新数据源(不包括JW300)后,BLEU得分从26.53提升至43.39,相对提升64.4%。
  • 与基线相比,JW300的引入带来33%的相对BLEU提升,以及11%的绝对WER降低。
  • 采用完整数据集与FastText词嵌入的Transformer模型,WER为22.42%,相比基线的58.17%实现61.4%的相对降低。
  • 模型在OOV(词汇表外)或代码混用输入上表现出优雅降级,即使在罕见词上出错,仍能为后续词语正确预测变音符号。
  • FastText词嵌入为Transformer模型带来微小但稳定的性能提升,但对软注意力模型的性能影响在不同指标间表现不一。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。