Skip to main content
QUICK REVIEW

[논문 리뷰] Incorporating Dictionaries into Deep Neural Networks for the Chinese Clinical Named Entity Recognition

Qi Wang, Yuhang Xia|arXiv (Cornell University)|2018. 04. 13.
Topic Modeling참고 문헌 29인용 수 14
한 줄 요약

이 논문은 중국어 임상 명칭 엔터티 인식(CNER)을 위한 딥 뉴럴 네트워크에 임상 사전를 통합하여 희귀 및 미사전처리된 실체의 성능을 향상시킨다. Bi-LSTM-CRF를 다섯 가지 특징 표현 방식과 두 가지 아키텍처로 확장하여 문자 수준의 임베딩과 사전 기반 특징을 융합함으로써, CCKS-2017 벤치마크에서 91.24%의 F1 스코어를 기록하여 최신 기술 모델을 능가한다.

ABSTRACT

Clinical Named Entity Recognition (CNER) aims to identify and classify clinical terms such as diseases, symptoms, treatments, exams, and body parts in electronic health records, which is a fundamental and crucial task for clinical and translational research. In recent years, deep neural networks have achieved significant success in named entity recognition and many other Natural Language Processing (NLP) tasks. Most of these algorithms are trained end to end, and can automatically learn features from large scale labeled datasets. However, these data-driven methods typically lack the capability of processing rare or unseen entities. Previous statistical methods and feature engineering practice have demonstrated that human knowledge can provide valuable information for handling rare and unseen cases. In this paper, we address the problem by incorporating dictionaries into deep neural networks for the Chinese CNER task. Two different architectures that extend the Bi-directional Long Short-Term Memory (Bi-LSTM) neural network and five different feature representation schemes are proposed to handle the task. Computational results on the CCKS-2017 Task 2 benchmark dataset show that the proposed method achieves the highly competitive performance compared with the state-of-the-art deep learning methods.

연구 동기 및 목표

  • 딥 러닝 모델이 중국어 EHR에서 희귀 또는 미사전처리된 임상 실체를 인식하는 데에 한계가 있음을 해결하기 위해.
  • 학습 데이터를 초월한 일반화 능력을 향상시키기 위해 인간이 수작업으로 작성한 임상 사전를 딥 뉴럴 네트워크에 통합하기 위해.
  • 사전 지식과 문맥 기반 문자 특징을 융합하는 효과적인 특징 표현 방식을 설계하기 위해.
  • 표준 벤치마크(CCKS-2017 태스크 2)에서 제안된 방법을 평가하고 최신 기술 딥 러닝 모델들과 비교하기 위해.
  • 사전 크기와 LSTM 히든 유닛 수가 모델 성능에 미치는 영향을 조사하기 위해.

제안 방법

  • 중국어 CNER를 위해 Bi-LSTM-CRF 아키텍처를 문자 수준에서 작동하도록 확장한다.
  • 각 문자에 대한 사전 기반 특징을 인코딩하기 위한 다섯 가지 별도의 특징 표현 방식(PDET, PDET+, PDET++, PDET-1, PDET-2)을 제안한다.
  • 문자 임베딩과 사전 기반 특징 벡터를 융합하기 위한 두 가지 네트워크 아키텍처(Model-I 및 Model-II)를 도입한다.
  • LSTM 레이어의 입력으로 문자 임베딩과 사전 특징의 연결을 사용하여 시퀀스 레이블링을 수행한다.
  • 시퀀스 레이블링 정확도를 향상시키기 위해 Bi-LSTM 위에 조건부 랜덤 필드(CRF)를 적용한다.
  • 그리드 서치와 교차 검증을 사용하여 하이퍼파rameter를 튜닝하며, 사전 크기와 LSTM 히든 유닛 수를 포함한다.

실험 결과

연구 질문

  • RQ1딥 뉴럴 네트워크에 임상 사전를 통합함으로써 중국어 EHR에서 희귀 및 미사전처리된 임상 실체의 인식 성능을 향상시킬 수 있는가?
  • RQ2다양한 사전 기반 특징 표현 방식이 중국어 CNER에서 Bi-LSTM-CRF 모델의 성능에 어떤 영향을 미치는가?
  • RQ3시퀀스 레이블링 작업에서 문자 수준의 임베딩과 사전 기반 특징을 융합하기 위한 최적의 아키텍처는 무엇인가?
  • RQ4임상 사전의 크기가 CCKS-2017 벤치마크에서 모델 성능에 어떤 영향을 미치는가?
  • RQ5제안된 프레임워크에서 LSTM 히든 유닛 수는 모델 정확도와 일반화 능력에 어떤 영향을 미치는가?

주요 결과

  • 제안된 방법은 CCKS-2017 태스크 2 벤치마크에서 91.24%의 F1 스코어를 기록하여 이전 최고 성능 모델을 능가한다.
  • PDET 특징과 Model-I 아키텍처를 사용한 모델이 가장 뛰어난 성능을 보였으며, 단일 모델임에도 불구하고 허 등 [39]의 성능을 F1 스코어 0.16% 높게 달성했다.
  • 사전 크기가 커질수록 성능이 점진적으로 향상되어 더 큰 사전이 희귀 실체 인식을 향상시킨다는 것을 시사한다.
  • LSTM 레이어의 히든 유닛 수가 256에 도달할 때 성능이 최고조에 이르며, 이를 초과하면 과적합이 발생하고 성능이 저하된다.
  • 사전 통합을 통한 문자 수준 모델링은 단어 수준 접근 방식에 비해 경계 오류를 크게 감소시킨다.
  • 명시적인 인간이 수작업으로 작성한 임상 지식의 통합 덕분에, 미사전처리 실체에 대한 일반화 능력이 뛰어나다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.