Skip to main content
QUICK REVIEW

[論文レビュー] Incorporating Dictionaries into Deep Neural Networks for the Chinese Clinical Named Entity Recognition

Qi Wang, Yuhang Xia|arXiv (Cornell University)|Apr 13, 2018
Topic Modeling参考文献 29被引用数 14
ひとこと要約

本論文は、中国語臨床命名エンティティ認識(CNER)における深層ニューラルネットワークへの臨床用語集の統合を提案し、希少で未学習のエンティティの認識を向上させている。Bi-LSTM-CRFを5つの特徴表現方式と2つのアーキテクチャで拡張し、文字レベルの埋め込みと用語集由来の特徴を統合することで、CCKS-2017ベンチマークで91.24%のF1スコアを達成し、最先端のモデルを上回った。

ABSTRACT

Clinical Named Entity Recognition (CNER) aims to identify and classify clinical terms such as diseases, symptoms, treatments, exams, and body parts in electronic health records, which is a fundamental and crucial task for clinical and translational research. In recent years, deep neural networks have achieved significant success in named entity recognition and many other Natural Language Processing (NLP) tasks. Most of these algorithms are trained end to end, and can automatically learn features from large scale labeled datasets. However, these data-driven methods typically lack the capability of processing rare or unseen entities. Previous statistical methods and feature engineering practice have demonstrated that human knowledge can provide valuable information for handling rare and unseen cases. In this paper, we address the problem by incorporating dictionaries into deep neural networks for the Chinese CNER task. Two different architectures that extend the Bi-directional Long Short-Term Memory (Bi-LSTM) neural network and five different feature representation schemes are proposed to handle the task. Computational results on the CCKS-2017 Task 2 benchmark dataset show that the proposed method achieves the highly competitive performance compared with the state-of-the-art deep learning methods.

研究の動機と目的

  • 中国語電子健康記録(EHR)における深層学習モデルが希少または未学習の臨床エンティティを認識する能力に限界があることに対処すること。
  • 人間が手作業で整備した臨床用語集を深層ニューラルネットワークに統合し、学習データを超えた一般化性能を向上させること。
  • 用語集の知識と文脈的な文字特徴を組み合わせる効果的な特徴表現方式を設計すること。
  • 標準ベンチマーク(CCKS-2017タスク2)上で提案手法を評価し、最先端の深層学習モデルと比較すること。
  • 用語集のサイズとLSTMの隠れユニット数がモデル性能に与える影響を調査すること。

提案手法

  • 中国語CNERを対象に、Bi-LSTM-CRFアーキテクチャを文字レベルで動作させる拡張を実施する。
  • 各文字に対して用語集由来の特徴を符号化するための5つの異なる特徴表現方式(PDET、PDET+、PDET++、PDET-1、PDET-2)を提案する。
  • 文字埋め込みと用語集由来の特徴ベクトルを統合する2つのネットワークアーキテクチャ(Model-I と Model-II)を導入する。
  • LSTM層の入力として、文字埋め込みと用語集特徴の連結を用いることで、系列ラベリングを実現する。
  • Bi-LSTMの上位に条件付き確率場(CRF)を適用し、ラベルの依存関係をモデル化することで、系列ラベリングの精度を向上させる。
  • グリッドサーチと交差検証を用いてハイパーパrameterを最適化し、用語集のサイズやLSTMの隠れユニット数を含むパrameterを調整する。

実験結果

リサーチクエスチョン

  • RQ1臨床用語集を深層ニューラルネットワークに統合することで、中国語EHRにおける希少で未学習の臨床エンティティの認識が向上するか?
  • RQ2異なる用語集由来の特徴表現方式は、中国語CNERにおけるBi-LSTM-CRFモデルの性能にどのように影響するか?
  • RQ3系列ラベリングタスクにおいて、文字レベルの埋め込みと用語集由来の特徴を統合する最適なアーキテクチャは何か?
  • RQ4臨床用語集のサイズは、CCKS-2017ベンチマークにおけるモデル性能にどのように影響するか?
  • RQ5LSTMの隠れユニット数は、提案フレームワークにおけるモデルの精度と一般化性能にどのような影響を及ぼすか?

主な発見

  • 提案手法は、CCKS-2017タスク2ベンチマークで91.24%のF1スコアを達成し、以前の最先端モデルを上回った。
  • PDET特徴とModel-Iアーキテクチャを組み合わせたモデルが最良の性能を示し、Huら[39]の手法をF1スコアで0.16%上回ったが、単一モデルで達成した。
  • 用語集のサイズが大きくなるに従い、性能が着実に向上し、より大きな用語集が希少エンティティの認識を向上させることを示している。
  • LSTM層の隠れユニット数が256に達した時点で性能がピークに達し、それ以上の増加は過学習を引き起こし、性能の低下をもたらした。
  • 用語集統合による文字レベルモデリングは、語彙レベルのアプローチと比較して境界誤りを顕著に低減した。
  • 人間が手作業で整備した臨床知識を明示的に組み込むことで、未学習エンティティに対する一般化性能が顕著に向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。