Skip to main content
QUICK REVIEW

[논문 리뷰] An Open-Source Dataset and A Multi-Task Model for Malay Named Entity Recognition

Yingwen Fu, Nankai Lin|arXiv (Cornell University)|2021. 09. 03.
Topic Modeling참고 문헌 24인용 수 5
한 줄 요약

이 논문은 유사어휘 언어 자료와 반복 최적화를 활용한 프레임워크를 통해 구축된 28,991개 문장과 384,000개 이상의 토큰을 포함하는 대규모 개방형 말레이어 명명된 실체 인식(NER) 데이터셋인 MYNER를 소개한다. 또한 이중 복귀(revision) 메커니즘과 게이팅 무시(gated ignoring) 기반의 경계 검출을 갖춘 다중 작업 학습 모델을 제안하여 MYNER에서 최신 기술 수준의 성능을 달성하고 저자원 말레이어 자연어 처리를 위한 기준을 설정한다.

ABSTRACT

Named entity recognition (NER) is a fundamental task of natural language processing (NLP). However, most state-of-the-art research is mainly oriented to high-resource languages such as English and has not been widely applied to low-resource languages. In Malay language, relevant NER resources are limited. In this work, we propose a dataset construction framework, which is based on labeled datasets of homologous languages and iterative optimization, to build a Malay NER dataset (MYNER) comprising 28,991 sentences (over 384 thousand tokens). Additionally, to better integrate boundary information for NER, we propose a multi-task (MT) model with a bidirectional revision (Bi-revision) mechanism for Malay NER task. Specifically, an auxiliary task, boundary detection, is introduced to improve NER training in both explicit and implicit ways. Furthermore, a gated ignoring mechanism is proposed to conduct conditional label transfer and alleviate error propagation by the auxiliary task. Experimental results demonstrate that our model achieves comparable results over baselines on MYNER. The dataset and the model in this paper would be publicly released as a benchmark dataset.

연구 동기 및 목표

  • 저자원 언어인 말레이어를 위한 고품질, 대규모 NER 자원의 부족 문제를 해결하기 위해.
  • 저자원 환경에서 고품질 NER 데이터셋을 구축하기 위한 확장 가능하고 데이터 효율적인 프레임워크를 개발하기 위해.
  • 다중 작업 학습 환경에서 경계 검출을 보조 작업으로 통합하여 말레이어 NER 성능을 향상시키기 위해.
  • 보조 작업에서 오는 오류 전파를 줄이기 위해 조건부 레이블 전이 메커니즘을 도입하기 위해.
  • 미래의 말레이어 자연어 처리 연구를 위한 공개 가능한 기준 데이터셋과 모델을 구축하기 위해.

제안 방법

  • 관련된 고자원 언어의 레이블 데이터를 활용하고 반복 최적화를 적용하여 말레이어 NER 데이터셋을 정밀화하고 확장하는 데이터셋 구축 프레임워크.
  • 6종류의 실체 유형으로 표시된 28,991개 문장과 384,000개 이상의 토큰을 포함하는 최종 데이터셋인 MYNER의 생성.
  • NER와 경계 검출을 동시에 최적화하기 위해 이중 복귀(Bi-revision) 메커니즘을 갖춘 다중 작업 모델 설계.
  • 경계 검출 작업에서의 레이블를 선택적으로 전이함으로써 오류 전파를 줄이기 위한 게이팅 무시 메커니즘 통합.
  • 공유 인코더와 작업별 전용 헤드를 사용하여 엔드 투 엔드로 모델을 훈련시키며, 경계 검출 작업이 명시적 및 암묵적 지도를 통해 NER 성능을 향상시킴.
  • 순차적 의존성을 모델링하고 태깅 정확도를 향상시키기 위해 이중 방향 LSTM 및 CRF 레이어 사용.

실험 결과

연구 질문

  • RQ1유사어휘 언어 자원과 반복 정밀화 기반의 데이터 구축 프레임워크가 저자원 언어인 말레이어를 위한 고품질, 대규모 NER 데이터셋을 생성할 수 있는가?
  • RQ2보조 작업으로서의 경계 검출을 도입함으로써 말레이어 NER 모델의 성능이 향상되는가?
  • RQ3게이팅 무시 메커니즘이 다중 작업 학습 중 보조 경계 검출 작업에서 오는 오류 전파를 효과적으로 줄일 수 있는가?
  • RQ4제안된 이중 복귀 기반 다중 작업 모델은 새로 구축된 MYNER 데이터셋에서 강력한 기준 모델과 비교해 어떻게 성능을 냈는가?
  • RQ5제안된 모델과 데이터셋이 향후 말레이어 자연어 처리 연구를 위한 실질적인 기준으로서 얼마나 유용한가?

주요 결과

  • 제안된 데이터셋 구축 프레임워크는 28,991개 문장과 384,000개 이상의 토큰을 포함하는 고품질, 대규모 말레이어 NER 데이터셋인 MYNER를 성공적으로 생성하였다.
  • 이중 복귀 및 게이팅 무시 기반의 다중 작업 모델은 MYNER 데이터셋에서 F1 스코어 측면에서 강력한 기준 모델들을 능가하는 성능을 보였다.
  • 보조 경계 검출 작업은 명시적 및 암묵적 지도 메커니즘을 통해 NER 성능 향상에 기여하였다.
  • 게이팅 무시 메커니즘이 보조 작업에서 오는 오류 전파를 효과적으로 줄여 전체 훈련의 안정성과 성능을 향상시켰다.
  • 모델은 MYNER 기준에서 최신 기술 수준의 성능을 달성하여 저자원 말레이어 자연어 처리에 효과적임을 입증하였다.
  • 데이터셋과 모델은 공개되었으며, 향후 말레이어 NER 연구를 위한 새로운 기준을 설정하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.