Skip to main content
QUICK REVIEW

[논문 리뷰] AsNER -- Annotated Dataset and Baseline for Assamese Named Entity recognition

Dhrubajyoti Pathak, Sukumar Nandi|arXiv (Cornell University)|2022. 07. 07.
Natural Language Processing Techniques인용 수 5
한 줄 요약

이 논문은 인도어인 아삼어의 저자원 명명된 엔터티 인식(NER) 데이터셋인 AsNER를 소개한다. 아삼어의 총 약 99,000개 토큰을 포함하며, 총리 연설과 아삼어 연극 대본에서 수집되었으며, 인물, 장소, 주소 엔터티로 주석 처리되었다. MuRIL 임bedding을 사용한 기초 Bi-LSTM-CRF 모델을 제시하여 F1 점수 80.69%를 달성하였으며, 데이터셋과 최고 성능을 낸 모델을 공개하여 아삼어의 저자원 NLP 연구를 촉진한다.

ABSTRACT

We present the AsNER, a named entity annotation dataset for low resource Assamese language with a baseline Assamese NER model. The dataset contains about 99k tokens comprised of text from the speech of the Prime Minister of India and Assamese play. It also contains person names, location names and addresses. The proposed NER dataset is likely to be a significant resource for deep neural based Assamese language processing. We benchmark the dataset by training NER models and evaluating using state-of-the-art architectures for supervised named entity recognition (NER) such as Fasttext, BERT, XLM-R, FLAIR, MuRIL etc. We implement several baseline approaches with state-of-the-art sequence tagging Bi-LSTM-CRF architecture. The highest F1-score among all baselines achieves an accuracy of 80.69% when using MuRIL as a word embedding method. The annotated dataset and the top performing model are made publicly available.

연구 동기 및 목표

  • 저자원 인디언 언어, 특히 아삼어에 대해 주석 처리된 NER 자원의 부족을 해결하기 위해.
  • 말하기 및 문학적 자료에서 유래한 다양한 아삼어 텍스트를 바탕으로 고품질의 다각적 데이터셋을 구축하여 NLP 작업을 위해 활용하기 위해.
  • 최신 시퀀스 태깅 아키텍처를 활용하여 아삼어 NER를 위한 강력한 기초 모델을 수립하기 위해.
  • 데이터셋과 훈련된 모델을 공개하여 향후 딥 러닝 기반 아삼어 NLP 연구를 가능하게 하기 위해.
  • 공정한 비교를 위해 동일한 데이터셋에서 여러 사전 훈련된 언어 모델(BERT, XLM-R, MuRIL 등)의 성능을 비교하기 위해.

제안 방법

  • 데이터셋은 인도 총리의 녹취된 연설과 아삼어 연극 대사에서 수집되어 언어적 다양성을 확보하였다.
  • 명명된 엔터티는 전문가들이 인물, 장소, 주소의 세 가지 클래스로 수동으로 주석 처리하였다.
  • NER를 위한 기초 모델로 Bi-LSTM-CRF 시퀀스 태깅 아키텍처를 사용하였다.
  • 입력 표현으로 다양한 사전 훈련된 컨텍스트 임베딩(FastText, BERT, XLM-R, FLAIR, MuRIL)을 평가하였다.
  • 표준 NER 메트릭스인 정밀도, 재현도, F1 점수를 사용하여 모델을 훈련하고 평가하였다.
  • 가장 높은 성능을 낸 모델은 MuRIL 임베딩을 사용하고 AsNER 데이터셋에서 미세조정하였다.

실험 결과

연구 질문

  • RQ1최근에 생성된 저자원 아삼어 NER 데이터셋에서 최신 기술의 NER 모델 성능은 어떠한가?
  • RQ2다양한 사전 훈련된 언어 모델은 아삼어 NER 성능 측면에서 어떻게 비교되는가?
  • RQ3제한된 훈련 데이터로 미세조정된 Bi-LSTM-CRF 모델은 저자원 NER 작업에서 강력한 성능을 낼 수 있는가?
  • RQ4아삼어 NER에 가장 적합한 아키텍처와 사전 훈련된 임베딩 조합은 무엇인가?
  • RQ5데이터셋의 품질과 다양성은 후속 NER 성능에 어떤 영향을 미치는가?

주요 결과

  • AsNER 데이터셋은 다양한 출처에서 유래한 약 99,000개 토큰을 포함하며, 인물, 장소, 주소 엔터티로 주석 처리되었다.
  • Bi-LSTM-CRF 아키텍처에서 MuRIL 임베딩을 사용한 경우 F1 점수 80.69%를 기록하여 최고 성능을 달성하였다.
  • 평가된 모델들 중 MuRIL이 BERT, XLM-R, FLAIR, FastText보다 AsNER 데이터셋에서 뛰어난 성능을 보였다.
  • 데이터셋과 최고 성능을 낸 모델은 향후 아삼어 NLP 연구 지원을 위해 공개되었다.
  • 연구 결과는 컨텍스트 임베딩(MuRIL 등)을 미세조정하는 것이 저자원 환경에서도 NER 성능을 크게 향상시킬 수 있음을 입증하였다.
  • 결과적으로 AsNER 데이터셋은 향후 아삼어 NLP 연구의 기준점으로서의 유용성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.