Skip to main content
QUICK REVIEW

[논문 리뷰] Application of a Hybrid Bi-LSTM-CRF model to the task of Russian Named Entity Recognition

Le Thi Ngoc Anh, Mikhail Arkhipov|arXiv (Cornell University)|2017. 09. 27.
Topic Modeling참고 문헌 11인용 수 9
한 줄 요약

이 논문은 외부 FastText 단어 임베딩을 통합한 하이브리드 Bi-LSTM-CRF 모델을 제안하여 러시아어 명명된 실체 인식(NER)에서 최고의 성능을 달성한다. 모델은 양방향 LSTM를 통해 문맥적 시퀀스 모델링을 수행하고, CRF를 통해 시퀀스 수준의 태깅을 수행하며, 사전 훈련된 Lenta 코퍼스 임베딩이 세 가지 러시아어 NER 데이터셋에서 정확도를 향상시키고 훈련 시간을 단축시킨다.

ABSTRACT

Named Entity Recognition (NER) is one of the most common tasks of the natural language processing. The purpose of NER is to find and classify tokens in text documents into predefined categories called tags, such as person names, quantity expressions, percentage expressions, names of locations, organizations, as well as expression of time, currency and others. Although there is a number of approaches have been proposed for this task in Russian language, it still has a substantial potential for the better solutions. In this work, we studied several deep neural network models starting from vanilla Bi-directional Long Short-Term Memory (Bi-LSTM) then supplementing it with Conditional Random Fields (CRF) as well as highway networks and finally adding external word embeddings. All models were evaluated across three datasets: Gareev's dataset, Person-1000, FactRuEval-2016. We found that extension of Bi-LSTM model with CRF significantly increased the quality of predictions. Encoding input tokens with external word embeddings reduced training time and allowed to achieve state of the art for the Russian NER task.

연구 동기 및 목표

  • 러시아어 명명된 실체 인식(NER)을 위한 딥 네트워크 모델의 효과성을 평가하기 위해.
  • CRF 레이어 통합, 하이웨이 네트워크, 외부 단어 임베딩이 러시아어 NER 성능에 미치는 영향을 조사하기 위해.
  • Gareev, Persons-1000, FactRuEval-2016 세 가지 벤치마크 러시아어 NER 데이터셋에서 다양한 모델 버전을 비교하기 위해.
  • 사전 훈련된 임베딩을 사용한 하이브리드 Bi-LSTM-CRF 아키텍처를 통해 러시아어 NER에 최고 성능 기준을 설정하기 위해.

제안 방법

  • 각 토큰의 왼쪽과 오른쪽 문맥을 모두 인코딩하기 위해 양방향 장기 단기 기억망(Bi-LSTM)을 사용하였다.
  • 라벨 간 의존성을 모델링하고 시퀀스 태깅 정확도를 향상시키기 위해 Bi-LSTM 위에 조건부 랜덤 필드(CRF) 레이어를 통합하였다.
  • 러시아어 단어의 분산 표현을 제공하기 위해 Lenta 코퍼스에서 훈련된 FastText 단어 임베딩을 사용하였다.
  • 특징 학습 및 모델 표현력 향상을 위해 문자 수준 및 단어 수준에서 하이웨이 네트워크를 기존 모델에 추가하였다.
  • 표준 평가 지표를 사용하여 Gareev의, Persons-1000, FactRuEval-2016 세 가지 러시아어 NER 데이터셋을 사용해 모델을 훈련하고 평가하였다.
  • 공유된 임베딩 레이어를 사용해 단어 수준 및 문자 수준의 임베딩을 적용하고, 과적합 방지를 위해 드롭아웃을 사용하였다.

실험 결과

연구 질문

  • RQ1Bi-LSTM 모델에 CRF 레이어를 추가하면 러시아어 텍스트에서 NER 성능이 유의미하게 향상되는가?
  • RQ2FastText에서 사전 훈련된 외부 단어 임베딩이 러시아어 NER에서 Bi-LSTM-CRF 모델의 성능과 훈련 효율성에 어느 정도 기여하는가?
  • RQ3문자 수준과 단어 수준의 하이웨이 네트워크가 러시아어 NER에서 Bi-LSTM-CRF 아키텍처의 성능에 어떤 영향을 미치는가?
  • RQ4제안된 하이브리드 Bi-LSTM-CRF 모델에 외부 임베딩을 통합하면 여러 러시아어 NER 벤치마크에서 최고 성능을 달성할 수 있는가?

주요 결과

  • Bi-LSTM + CRF 모델은 순수한 Bi-LSTM 모델보다 성능이 뛰어나, CRF 레이어 통합이 러시아어 NER에서 시퀀스 태깅 정확도를 유의미하게 향상시킨다는 것을 입증하였다.
  • Lenta 코퍼스에서 사전 훈련된 FastText 단어 임베딩을 추가함으로써 훈련 시간이 단축되었고, Gareev의 및 Persons-1000 데이터셋에서 최고 성능을 달성하였다.
  • Bi-LSTM + CRF + Lenta 임베딩 모델은 Gareev의 및 Persons-1000 데이터셋에서 가장 높은 F1 스코어를 기록하여 이전에 발표된 모델들을 능가하였다.
  • 하이웨이 네트워크를 통합한 NeuroNER 기반 모델은 혼합된 결과를 보였다: 문자 수준의 하이웨이 네트워크가 성능을 약간 향상시켰지만, 단어 수준 및 병합된 네트워크는 성능 저하를 초래하였다.
  • FactRuEval-2016 데이터셋에서는 Bi-LSTM+CRF+Lenta 및 NeuroNER 모델이 이전 모델들을 능가했지만, 문헌에서 보고된 SVM 기반 시스템에 비해 성능이 열 劣하였다.
  • 이 연구는 이전의 러시아어 NER 시스템에서 사용된 수작업 특징 공학보다, 단어 수준 및 문자 수준의 Bi-LSTM 표현을 CRF와 함께 공동 훈련하는 것이 더 효과적임을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.