Skip to main content
QUICK REVIEW

[論文レビュー] Unified Neural Architecture for Drug, Disease and Clinical Entity Recognition

Sunil Kumar Sahu, Ashish Anand|arXiv (Cornell University)|Aug 11, 2017
Biomedical Text Mining and Ontologies被引用数 4
ひとこと要約

本稿では、階層的双方向LSTM(BLSTM)を用いて形態的および文脈的特徴を捉え、順序付きCRF層を組み合わせた統合型ニューラルアーキテクチャ、CWBLSTMを提案する。このモデルは、ドメイン固有の特徴量や外部辞書を用いず、薬剤NER、疾患NER、臨床NERタスクで最先端の手法を上回る性能を発揮し、文字レベル埋め込みとCRFに基づくタグ依存性学習の有効性を示している。

ABSTRACT

Most existing methods for biomedical entity recognition task rely on explicit feature engineering where many features either are specific to a particular task or depends on output of other existing NLP tools. Neural architectures have been shown across various domains that efforts for explicit feature design can be reduced. In this work we propose an unified framework using bi-directional long short term memory network (BLSTM) for named entity recognition (NER) tasks in biomedical and clinical domains. Three important characteristics of the framework are as follows - (1) model learns contextual as well as morphological features using two different BLSTM in hierarchy, (2) model uses first order linear conditional random field (CRF) in its output layer in cascade of BLSTM to infer label or tag sequence, (3) model does not use any domain specific features or dictionary, i.e., in another words, same set of features are used in the three NER tasks, namely, disease name recognition (Disease NER), drug name recognition (Drug NER) and clinical entity recognition (Clinical NER). We compare performance of the proposed model with existing state-of-the-art models on the standard benchmark datasets of the three tasks. We show empirically that the proposed framework outperforms all existing models. Further our analysis of CRF layer and word-embedding obtained using character based embedding show their importance.

研究の動機と目的

  • タスク固有の特徴工学に依存しない、生物医学および臨床用語認識のための統合型ディープラーニングフレームワークの開発。
  • 低リソースでノイズの多い臨床テキストにおける、文字レベル埋め込みとCRFに基づく系列モデリングの影響の調査。
  • 1つのモデルアーキテクチャが、ドメイン固有の特徴量や外部辞書を用いずに、薬剤、疾患、臨床用語といった多様なエンティティタイプを効果的に処理できるかの評価。
  • 形態的(文字レベル)および意味的(語彙レベル)埋め込みの相補的な役割が、NER精度に与える影響の分析。

提案手法

  • モデルは2段階のBLSTM層を備えた階層的アーキテクチャを採用。1つ目の層は文字列を処理し、形態的に豊かな語彙表現を学習し、2つ目の層は語彙レベルの系列を処理し、文脈的依存性を捉える。
  • 語彙埋め込みは、文字レベルのBLSTMに続いて語彙レベルのBLSTMを用いて学習され、形態と文脈の両方を統合的にモデリング可能となる。
  • 出力層には1階層線形チェーンCRFを採用し、系列全体のラベル依存性をモデル化することで、タグ付けの一貫性を向上させる。
  • 手動で設計された特徴量、辞書、外部ツールを一切使用せず、語彙と文字の埋め込みのみを入力として使用。
  • 3つの標準的なNERベンチマーク(薬剤NER、疾患NER、臨床NER)上で、エンドツーエンドに訓練される。
  • CRF、双方向LSTM、文字レベル埋め込みの貢献度を評価するため、モデルの変種を検証する。

実験結果

リサーチクエスチョン

  • RQ1タスク固有の特徴量や外部知識を一切使用せずに、統合型ディープラーニングモデルが薬剤、疾患、臨床用語認識で最先端の性能を達成できるか?
  • RQ2標準的な語彙レベル埋め込みと比較して、文字レベル埋め込みは、生物医学的エンティティ名の形態的パターンをどの程度効果的に捉えられるか?
  • RQ3ラベル依存性をモデル化するCRFに基づく系列モデリングを組み込むことで、NER性能がどの程度向上するか?
  • RQ4生物医学的NERタスクにおいて、単方向LSTMと比較して、双方向LSTMを用いることで性能がどの程度向上するか?
  • RQ5学習された文字レベル埋め込みと語彙レベル埋め込みは、意味的および形態的性質においてどのように異なるか?

主な発見

  • 提案されたCWBLSTMモデルは、疾患NERでF1スコア83.35、薬剤NERで73.57、臨床NERで83.68を達成し、それぞれのベンチマークで既存の最先端モデルを上回った。
  • CRF層を削除した場合(BLSTM+WLLバージョン)、疾患NERでF1スコアが7.5%低下し、薬剤NERで3.4%、臨床NERで5.5%低下した。これは、ラベル依存性をモデル化することが重要であることを示している。
  • 単方向LSTMから双方向LSTMに置き換えることで、疾患NERでF1スコアが12.89%向上、薬剤NERで4.86%、臨床NERで20.83%向上した。これは、双方向的文脈の利点が顕著であることを示している。
  • 最近接近傍解析の結果、文字レベル埋め込みは形態的類似性(例:'Cefaclor' と 'Cefdinir')を捉えており、語彙レベル埋め込みは意味的類似性(例:'synergistic' と 'antagonistic')を保持していることが分かった。
  • ドメイン固有の特徴量、辞書、外部NLPツールを一切使用せず、優れた性能を達成した。これは、モデルのエンティティタイプ間での汎化能力の高さを証明している。
  • 平均エンティティ長(薬剤:1.2、臨床:2.1、疾患:2.2)とCRFによる性能向上の相関関係が確認され、より長いエンティティは系列モデリングの恩恵をより大きく受けていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。