Skip to main content
QUICK REVIEW

[논문 리뷰] NaijaNER : Comprehensive Named Entity Recognition for 5 Nigerian Languages

Wuraola Fisayo Oyewusi, Olubayo Adekanmbi|arXiv (Cornell University)|2021. 03. 30.
Natural Language Processing Techniques인용 수 9
한 줄 요약

이 논문은 스파이시를 사용하여 개별 및 통합 다국어 모델을 모두 활용하여 5개의 저자원 네이저리아어 언어—나이지리아 영어, 피진어, 요르바어, 하우사어, 이그보어—를 위한 종합적인 명명된 실체 인식(NER) 시스템인 NaijaNER를 제시한다. 각 언어당 50개의 수동으로 주석 처리된 뉴스 기사로 훈련된 통합 NaijaNER 모델은 교차 언어 성능이 뛰어나며, 일부 언어에서는 개별 모델을 능가하고, 저자원 아프리카어를 위한 구현 가능한, 재사용 가능한 NLP 도구를 가능하게 한다.

ABSTRACT

Most of the common applications of Named Entity Recognition (NER) is on English and other highly available languages. In this work, we present our findings on Named Entity Recognition for 5 Nigerian Languages (Nigerian English, Nigerian Pidgin English, Igbo, Yoruba and Hausa). These languages are considered low-resourced, and very little openly available Natural Language Processing work has been done in most of them. In this work, individual NER models were trained and metrics recorded for each of the languages. We also worked on a combined model that can handle Named Entity Recognition (NER) for any of the five languages. The combined model works well for Named Entity Recognition(NER) on each of the languages and with better performance compared to individual NER models trained specifically on annotated data for the specific language. The aim of this work is to share our learning on how information extraction using Named Entity Recognition can be optimized for the listed Nigerian Languages for inclusion, ease of deployment in production and reusability of models. Models developed during this project are available on GitHub https://git.io/JY0kk and an interactive web app https://nigner.herokuapp.com/.

연구 동기 및 목표

  • 나이지리아 피진어, 요르바어, 하우사어, 이그보어를 포함한 저자원 나이지리아어 언어에 대한 NLP 자원의 부족을 해결한다.
  • 나이지리아의 언어적 및 문화적 맥락에 맞는 고품질의, 맥락 기반 NER 모델을 개발한다.
  • 각 언어당 최소한의 데이터로도 모든 5개 언어에서 우수한 성능을 내는 통합 다국어 NER 모델(NaijaNER)을 구축한다.
  • 오픈소스 배포 및 상호작용 웹 액세스를 통해 모델의 재사용성과 생산 환경 배포를 보장한다.
  • 작은 언어별 데이터로도 통합 다국어 훈련이 개별 모델보다 우수한 성능을 낼 수 있음을 입증한다.

제안 방법

  • 온라인 자료에서 각 언어당 50개의 뉴스 기사(일般 및 스포츠 뉴스, 비율 4:1)를 수집하였다.
  • 전문가인 원어민들이 참여한 TagEditor(v2.3.2)를 사용하여 OntoNotes 스키마(예: PERSON, ORG, GPE)를 기반으로 명명된 실체를 주석 처리하였다.
  • 스파이시의 NER 파이프라인 훈련을 위해 스파이시의 gold.doc_to_json 형식으로 주석 처리된 데이터를 내보냈다.
  • 스파이시의 사전 훈련된 영어 모델을 기반으로 나이지리아 영어 및 피진어에 대해 개별 NER 모델을 훈련시켰다.
  • 모든 5개 언어의 데이터를 통합하여 단일 다국어 NaijaNER 모델을 훈련시켜 교차 언어 추론을 가능하게 하였다.
  • 표준 NER 메트릭(정밀도, 재현율, F1)을 사용하여 모델을 평가하였으며, 신뢰할 수 있는 점수를 확보하기 위해 각 실체 유형에 대해 50개 이상의 예제를 기준으로 하였다.

실험 결과

연구 질문

  • RQ1한 개의 통합 다국어 NER 모델이 제한된 주석 처리된 데이터로 5개의 저자원 나이지리아어 언어에서 명명된 실체를 효과적으로 인식할 수 있는가?
  • RQ2NaijaNER 통합 모델의 성능은 F1, 정밀도, 재현율 측면에서 개별 언어별 NER 모델과 비교해 어떻게 다른가?
  • RQ3맥락 기반의 수동 주석 처리된 데이터셋은 일반적인 영어 모델에 비해 나이지리아 영어 및 피진어에서 NER 성능을 얼마나 향상시키는가?
  • RQ4저자원 아프리카어의 NER에서 저빈도 실체 및 언어 고유의 형태학적 특징을 다루는 데 어떤 과제가 존재하는가?
  • RQ5영어와 같은 고자원 언어에서의 전이 학습이 저자원 나이지리아어 언어의 NER 성능을 효과적으로 향상시킬 수 있는가?

주요 결과

  • NaijaNER 통합 모델은 교차 언어 성능이 뛰어나며, 피진어에서 "Justice Tanko Muhammad"를 PERSON으로 정확히 식별하여 개별 피진어 NER 모델을 뛰어넘는 성능을 보였다.
  • 나이지리아 영어에서는 NaijaNER 모델이 "Imo State"를 GPE로 정확히 인식하였고, 이는 표준 스파이시 영어 모델이 실패하는 지점이었다.
  • 이그보어에서는 IgboNER 모델이 "Ukochukwu Eliot Ugochukwu Uko"를 GPE로 잘못 분류하였지만, NaijaNER는 정확히 PERSON으로 레이블링하여 일반화 능력 향상을 보였다.
  • 요르바어에서는 NaijaNER 모델이 "Lori"와 "Pdp"를 PERSON으로 잘못 분류하였지만, 대부분의 실체를 정확히 식별하여 노이즈가 존재하더라도 강건한 성능을 보였다.
  • 하우사어에서는 HausaNER 모델이 "dan jaridar"를 ORG 및 GPE로 잘못 분류하였지만, NaijaNER는 미세한 오류가 있음에도 유사한 정확도를 보이며 이식성의 가능성을 보였다.
  • 통합 NaijaNER 모델은 요르바어에서 매크로 F1 점수 58.82점, 나이지리아 영어의 ORG 유형에서 64.63점의 성능을 기록하여, 언어별 데이터가 적음에도 불구하고 일부 실체 유형에서 개별 모델을 능가하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.