Skip to main content
QUICK REVIEW

[論文レビュー] Comparing Rule-Based and Deep Learning Models for Patient Phenotyping

Sebastian Gehrmann, Franck Dernoncourt|arXiv (Cornell University)|Mar 25, 2017
Machine Learning in Healthcare参考文献 54被引用数 19
ひとこと要約

本研究では、臨床ノートを用いた患者の特徴抽出において、深層学習モデル、特に畳み込みニューラルネットワーク(CNN)を、ルールベースおよびn-gram手法と比較して評価している。CNNモデルは10の特徴抽出タスクにおいてすべてのベースラインを上回り、平均F1スコアは76(PPV: 83、感度: 71)を達成した。他の手法と比較して最大37ポイントも高いF1スコアを記録した一方で、臨床的洞察を得るための解釈可能でセマンティクスに基づくフレーズ抽出も可能であった。

ABSTRACT

Objective: We investigate whether deep learning techniques for natural language processing (NLP) can be used efficiently for patient phenotyping. Patient phenotyping is a classification task for determining whether a patient has a medical condition, and is a crucial part of secondary analysis of healthcare data. We assess the performance of deep learning algorithms and compare them with classical NLP approaches. Materials and Methods: We compare convolutional neural networks (CNNs), n-gram models, and approaches based on cTAKES that extract pre-defined medical concepts from clinical notes and use them to predict patient phenotypes. The performance is tested on 10 different phenotyping tasks using 1,610 discharge summaries extracted from the MIMIC-III database. Results: CNNs outperform other phenotyping algorithms in all 10 tasks. The average F1-score of our model is 76 (PPV of 83, and sensitivity of 71) with our model having an F1-score up to 37 points higher than alternative approaches. We additionally assess the interpretability of our model by presenting a method that extracts the most salient phrases for a particular prediction. Conclusion: We show that NLP methods based on deep learning improve the performance of patient phenotyping. Our CNN-based algorithm automatically learns the phrases associated with each patient phenotype. As such, it reduces the annotation complexity for clinical domain experts, who are normally required to develop task-specific annotation rules and identify relevant phrases. Our method performs well in terms of both performance and interpretability, which indicates that deep learning is an effective approach to patient phenotyping based on clinicians' notes.

研究の動機と目的

  • 自然言語処理における深層学習技術が、従来のルールベースおよびn-gramモデルと比較して、患者の特徴抽出の精度を向上させることを評価すること。
  • MIMIC-IIIデータベースの実際の臨床ノートに対して、CNN、n-gram、およびcTAKESベースのアプローチの性能を評価すること。
  • 予測に関連する顕著なフレーズを特定することで、深層学習モデルの解釈性を特徴抽出の文脈で検討すること。
  • 臨床専門家による手動アノテーションに依存するのを減らすために、関連する臨床的フレーズの自動特定を実現すること。
  • エンドツーエンドの深層学習モデルが、手作業で作成された臨床ルールと同等またはそれ以上の性能を発揮できるかどうかを検証すること。

提案手法

  • 特徴工学を伴わず、生の臨床ノートに対してエンドツーエンドで訓練された畳み込みニューラルネットワーク(CNN)を用いて、患者の特徴を分類した。
  • モデルは臨床テキストを表現するための単語埋め込みを用い、局所的なn-gramパターンを捉えるために複数のフィルターサイズを適用した。
  • 性能は、事前に定義された医療用語を抽出した後で分類を行うn-gramモデルおよびcTAKESベースのシステムと比較した。
  • 解釈性は、各予測における入力テキストで最も影響力のあるフレーズを強調するセマンティクスベースのスコアリング手法を用いて向上させた。
  • すべてのモデルは、MIMIC-IIIデータベースの1,610件の退院要約を対象に、10の異なる特徴抽出タスクで評価された。
  • 評価指標には、分類性能を評価するためのF1スコア、陽性予測値(PPV)、感度が含まれた。

実験結果

リサーチクエスチョン

  • RQ1CNNのような深層学習モデルは、ルールベースおよびn-gramモデルと比較して、患者の特徴抽出タスクで優れた性能を示せるか?
  • RQ2F1スコア、PPV、感度の観点から、CNNベースのアプローチはcTAKESベースのシステムと比較してどの程度優れているか?
  • RQ3手作業によるルール作成なしに、深層学習モデルが臨床的に関連するフレーズを自動で学習できる程度はどの程度か?
  • RQ4セマンティクスに基づくフレーズ抽出を用いることで、深層学習モデルの解釈性を向上させられるか?
  • RQ5事前に定義された医療用語に基づく特徴工学ではなく、生テキストからのエンドツーエンド学習が、特徴抽出のパフォーマンスを向上させるか?

主な発見

  • CNNベースのモデルは、すべての10の特徴抽出タスクで平均F1スコア76を達成し、すべてのベースラインを顕著に上回った。
  • CNNモデルのF1スコアは、他のアプローチと比較して最大37ポイントも高く、顕著な性能向上を示した。
  • モデルは陽性予測値(PPV)83および感度71を達成し、高い精度と再現率を示した。
  • CNNモデルは、臨床的に関連するフレーズを自動で学習し、分野の専門家による手作業によるルールアノテーションの必要性を低減した。
  • セマンティクスベースのスコアリング手法により、各特徴に関連する重要なフレーズが効果的に同定され、モデルの解釈性が向上した。
  • CNNモデルは、評価された10の特徴抽出タスクすべてにおいて、n-gramおよびcTAKESベースのシステムを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。