Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Multi-Word Entity Recognition for Biomedical Texts

Hamada Nayel, H. L. Shashirekha|arXiv (Cornell University)|2019. 08. 15.
Biomedical Text Mining and Ontologies참고 문헌 31인용 수 10
한 줄 요약

이 논문은 생물의학 분야의 명명된 엔티티 인식(BioNER)을 위한 향상된 IOBES 태깅 체계인 FROBES를 제안한다. 생물의학 텍스트에서 다어절 엔티티 탐지 성능을 향상시키며, i2b2/VA 2010 및 JNLPBA 2004 데이터셋을 기반으로 BiLSTM 기반 모델을 사용하여 표준 IOBES 및 기준 모델보다 성능이 뛰어나며, 특히 두 개 이상의 단어로 구성된 엔티티에서 뚜렷한 향상이 나타난다. 앙상블 투표 기법을 추가로 적용함으로써 성능이 더욱 향상된다.

ABSTRACT

Biomedical Named Entity Recognition (BioNER) is a crucial step for analyzing Biomedical texts, which aims at extracting biomedical named entities from a given text. Different supervised machine learning algorithms have been applied for BioNER by various researchers. The main requirement of these approaches is an annotated dataset used for learning the parameters of machine learning algorithms. Segment Representation (SR) models comprise of different tag sets used for representing the annotated data, such as IOB2, IOE2 and IOBES. In this paper, we propose an extension of IOBES model to improve the performance of BioNER. The proposed SR model, FROBES, improves the representation of multi-word entities. We used Bidirectional Long Short-Term Memory (BiLSTM) network; an instance of Recurrent Neural Networks (RNN), to design a baseline system for BioNER and evaluated the new SR model on two datasets, i2b2/VA 2010 challenge dataset and JNLPBA 2004 shared task dataset. The proposed SR model outperforms other models for multi-word entities with length greater than two. Further, the outputs of different SR models have been combined using majority voting ensemble method which outperforms the baseline models performance.

연구 동기 및 목표

  • 임상 및 연구 텍스트에서 다어절 생물의학 엔티티, 특히 긴 엔티티를 인식하는 데 도전하는 문제를 해결하기 위해.
  • IOBES 태깅 체계를 확장하여 다어절 엔티티의 경계와 내부 구조를 더 잘 표현하기 위해.
  • 제안된 FROBES 모델의 효과성을 표준 생물의학 NER 기준 데이터셋에서 평가하기 위해.
  • 다수결 투표 기반 앙상블 기법을 통해 전체 BioNER 성능을 향상시키기 위해.

제안 방법

  • 다어절 생물의학 엔티티의 경계와 내부 구조를 더 잘 포착할 수 있도록 개선된 IOBES 태깅 체계를 적용한 FROBES를 제안한다.
  • BioNER의 시퀀스 태깅을 위한 기준 시스템으로 BiLSTM 기반 신경망 모델을 설계한다.
  • i2b2/VA 2010 및 JNLPBA 2004라는 두 가지 표준 생물의학 NER 데이터셋을 대상으로 모델을 훈련하고 평가한다.
  • IOB2, IOE2, IOBES 및 FROBES를 포함한 여러 SR 모델의 예측 결과를 조합하여 다수결 투표 앙상블을 적용함으로써 정확도와 성능을 향상시킨다.
  • 정밀도, 재현율, F1 점수와 같은 표준 평가 지표를 사용하여 다양한 태깅 체계 간의 모델 성능을 비교한다.

실험 결과

연구 질문

  • RQ1표준 IOBES와 비교해 볼 때, 향상된 IOBES 태깅 체계는 다어절 생물의학 엔티티 인식 성능을 향상시킬 수 있는가?
  • RQ2FROBES 태깅 모델은 생물의학 텍스트에서 길이가 2 이상인 다어절 엔티티에서 어떻게 성능을 발휘하는가?
  • RQ3다양한 시퀀스 표현 모델의 출력을 다수결 투표 방식으로 조합하면 전체 BioNER 성능이 향상되는가?
  • RQ4제안된 FROBES 모델은 표준 생물의학 NER 기준 벤치마크에서 기준 모델보다 더 효과적인가?

주요 결과

  • FROBES는 길이가 2 이상인 다어절 엔티티 인식에서 표준 IOBES 및 기타 SR 모델보다 뚜렷한 성능 향상을 보였다.
  • FROBES 태깅을 적용한 BiLSTM 기반 모델은 i2b2/VA 2010 및 JNLPBA 2004 데이터셋에서 기준 모델보다 높은 F1 점수를 기록했다.
  • 다양한 SR 모델의 예측 결과를 다수결 투표 방식으로 조합한 앙상블 기법은 개별 모델(포함해 FROBES 기준 모델)을 초월하는 성능 향상을 이끌어냈다.
  • 특히 긴 엔티티에서 성능 향상이 두드러져, FROBES가 복잡한 엔티티 경계를 효과적으로 포착할 수 있음을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.