Skip to main content
QUICK REVIEW

[论文解读] NaijaNER : Comprehensive Named Entity Recognition for 5 Nigerian Languages

Wuraola Fisayo Oyewusi, Olubayo Adekanmbi|arXiv (Cornell University)|Mar 30, 2021
Natural Language Processing Techniques被引用 9
一句话总结

本文提出 NaijaNER,一个针对五种低资源尼日利亚语言——尼日利亚英语、皮钦语、约鲁巴语、豪萨语和伊博语——的全面命名实体识别系统,采用单语言模型与统一多语言模型相结合的方式。该系统基于每种语言50篇人工标注的新闻文章(使用 spaCy 训练),联合训练的 NaijaNER 模型展现出稳健的跨语言性能,在部分语言上优于单语言模型,为资源匮乏的非洲语言提供了可部署、可复用的自然语言处理工具。

ABSTRACT

Most of the common applications of Named Entity Recognition (NER) is on English and other highly available languages. In this work, we present our findings on Named Entity Recognition for 5 Nigerian Languages (Nigerian English, Nigerian Pidgin English, Igbo, Yoruba and Hausa). These languages are considered low-resourced, and very little openly available Natural Language Processing work has been done in most of them. In this work, individual NER models were trained and metrics recorded for each of the languages. We also worked on a combined model that can handle Named Entity Recognition (NER) for any of the five languages. The combined model works well for Named Entity Recognition(NER) on each of the languages and with better performance compared to individual NER models trained specifically on annotated data for the specific language. The aim of this work is to share our learning on how information extraction using Named Entity Recognition can be optimized for the listed Nigerian Languages for inclusion, ease of deployment in production and reusability of models. Models developed during this project are available on GitHub https://git.io/JY0kk and an interactive web app https://nigner.herokuapp.com/.

研究动机与目标

  • 解决低资源尼日利亚语言(包括尼日利亚皮钦语、约鲁巴语、豪萨语和伊博语)自然语言处理资源匮乏的问题。
  • 开发高质量、上下文特定的命名实体识别模型,适配尼日利亚的语言与文化背景。
  • 构建一个统一的多语言命名实体识别模型(NaijaNER),在每种语言数据量极少的情况下仍能实现良好性能。
  • 通过开源发布和交互式网页访问,确保模型可复用并适用于生产环境部署。
  • 证明尽管每种语言的训练数据较少,联合多语言训练仍可超越单语言模型在低资源语言上的表现。

提出的方法

  • 从在线来源收集每种语言50篇新闻文章(通用新闻与体育新闻比例为4:1)。
  • 使用 TagEditor(v2.3.2)并由母语专家进行标注,采用 OntoNotes 标注体系(如 PERSON、ORG、GPE 等)。
  • 将标注数据导出为 spaCy 的 gold.doc_to_json 格式,用于在 spaCy 的命名实体识别流水线中进行训练。
  • 基于 spaCy 的预训练英语模型,为尼日利亚英语和皮钦语分别训练单语言命名实体识别模型。
  • 在全部五种语言的联合数据上微调单一多语言 NaijaNER 模型,以支持跨语言推理。
  • 使用标准命名实体识别指标(F1、精确率、召回率)评估模型性能,对每类实体设置 >50 个样本的阈值以确保评分可靠性。

实验结果

研究问题

  • RQ1在标注数据有限的情况下,统一的多语言命名实体识别模型能否有效识别五种低资源尼日利亚语言中的命名实体?
  • RQ2与单语言特定的命名实体识别模型相比,联合训练的 NaijaNER 模型在 F1、精确率和召回率上的表现如何?
  • RQ3与通用英语模型相比,上下文特定的、人工标注的数据集在尼日利亚英语和皮钦语中的命名实体识别性能提升程度如何?
  • RQ4在资源匮乏的非洲语言中,命名实体识别面临哪些挑战,特别是低频实体和语言特异性词形变化的处理?
  • RQ5从高资源语言(如英语)迁移学习是否能有效提升低资源尼日利亚语言的命名实体识别性能?

主要发现

  • NaijaNER 联合模型展现出强大的跨语言性能,能够正确识别皮钦语中的实体如“Justice Tanko Muhammad”为 PERSON,其表现优于单语言皮钦语命名实体识别模型。
  • 在尼日利亚英语中,NaijaNER 模型正确识别出“Imo State”为 GPE,而标准 spaCy 英语模型则未能识别,成为其性能突破点。
  • IgboNER 模型将“Ukochukwu Eliot Ugochukwu Uko”错误分类为 GPE,而 NaijaNER 正确识别为 PERSON,显示出更强的泛化能力。
  • 在约鲁巴语中,NaijaNER 将“Lori”和“Pdp”错误分类为 PERSON,但正确识别了大多数实体,表明其在存在噪声的情况下仍具鲁棒性。
  • HausaNER 模型将“dan jaridar”错误分类为 ORG 和 GPE,但 NaijaNER 表现相当,仅有少量错误,表明模型具备良好的迁移能力。
  • 联合 NaijaNER 模型在约鲁巴语上的宏平均 F1 得分为 58.82,在尼日利亚英语的 ORG 类别上得分为 64.63,尽管每种语言的数据量较少,但在某些实体类型上仍优于单语言模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。