Skip to main content
QUICK REVIEW

[論文レビュー] Effective Representations of Clinical Notes

Sébastien Dubois, Nathanael Romano|arXiv (Cornell University)|May 19, 2017
Machine Learning in Healthcare参考文献 26被引用数 12
ひとこと要約

この論文は、限られたラベル付きデータにおける予測モデリングを改善するために、転移学習を用いた臨床ノートのニューラルネットワークベースの表現を提案する。大規模なEHRコーパス上で事前学習された埋め込み(GloVe)とRNNを活用することで、コン pact で患者単位の表現を学習し、特にラベル付きデータが少ない場合(N < 1000)に、従来のbag-of-wordsやトピックモデルよりも顕著に優れた性能を発揮する。

ABSTRACT

Clinical notes are a rich source of information about patient state. However, using them to predict clinical events with machine learning models is challenging. They are very high dimensional, sparse and have complex structure. Furthermore, training data is often scarce because it is expensive to obtain reliable labels for many clinical events. These difficulties have traditionally been addressed by manual feature engineering encoding task specific domain knowledge. We explored the use of neural networks and transfer learning to learn representations of clinical notes that are useful for predicting future clinical events of interest, such as all causes mortality, inpatient admissions, and emergency room visits. Our data comprised 2.7 million notes and 115 thousand patients at Stanford Hospital. We used the learned representations, along with commonly used bag of words and topic model representations, as features for predictive models of clinical events. We evaluated the effectiveness of these representations with respect to the performance of the models trained on small datasets. Models using the neural network derived representations performed significantly better than models using the baseline representations with small ($N &lt; 1000$) training datasets. The learned representations offer significant performance gains over commonly used baseline representations for a range of predictive modeling tasks and cohort sizes, offering an effective alternative to task specific feature engineering when plentiful labeled training data is not available.

研究の動機と目的

  • 限られたラベル付きデータを伴う高次元的かつスパースな臨床ノートから、死亡や入院などの臨床イベントを予測する課題に対処する。
  • タスク固有の特徴工学を減らすために、データ駆動型の臨床ノートの患者単位の表現を学習する。
  • 転移学習が、従来のベースライン(例:bag-of-words、トピックモデル)よりも、データが少ない状況でより効率的な表現をもたらすかどうかを評価する。
  • 学習された表現が、最小限のカスタマイズで多様な臨床予測タスクに一般化できることを示す。
  • データ量が増加した際に、学習された表現と従来の特徴(例:ワイドかつディープなモデル)を組み合わせることの有効性を評価する。

提案手法

  • 2段階の転移学習アプローチを用いる:大規模な臨床ノートコーパス(2.7M件のノート、115,000人の患者)で事前学習し、意味のある表現を学習する。
  • 「埋め込み・集約」手法を適用する:臨床概念を密度型のGloVe埋め込みにマップし、ノートおよび患者レベルで平均化することで、固定長の患者ベクトルを形成する。
  • 再帰的ニューラルネットワーク(RNN)アーキテクチャを用い、概念、ノート、患者の表現を同時に学習する。診断コードの離散的ラベルを教師信号として用いる。
  • 各患者の全ノートシーケンスをRNNで学習し、時間的順序を活用して臨床経過と文脈を捉える。
  • 下流モデル(例:ロジスティック回帰)の入力特徴として表現を評価し、死亡、入院、救急受診といったターゲットタスクに適用する。
  • 学習曲線を用いて、トレーニングセットサイズの関数としてのモデル精度を評価し、表現の性能を比較する。

実験結果

リサーチクエスチョン

  • RQ1ラベル付きデータが限られる状況で、ニューラルネットワークベースの臨床ノート表現が、希少な臨床イベントの予測性能を向上させられるか?
  • RQ2データが少ない状況で、転移学習に基づく表現が、従来のベースライン(例:bag-of-words、LDA)と比べてどのように差をつけるか?
  • RQ3トレーニングデータ量が増加した際に、学習された表現とbag-of-words特徴を組み合わせることで、単独で用いる場合よりも性能が向上するか?
  • RQ4学習された表現が、タスク固有のチューニングなしに、多様な臨床予測タスクにどの程度一般化できるか?
  • RQ5学習済み表現の性能が、トレーニングセットサイズの増加に伴ってどのように変化するか?これは、単純なベースラインと比較してどうなるか?

主な発見

  • トレーニングデータが少ない場合(N < 1000人)、ニューラルネットワークから得られる表現は、bag-of-wordsやトピックモデルのベースラインを顕著に上回った。
  • RNNベースの表現は、すべてのタスクとトレーニングセットサイズで最高の性能を示し、特にデータが少ない状況で顕著に優れた結果を出した。
  • より単純な「埋め込み・集約」手法も、RNNアプローチとほぼ同等の性能を示し、性能と計算効率の間で良好なトレードオフを実現した。
  • RNN表現とbag-of-words特徴を組み合わせることで、すべてのトレーニングセットサイズで一貫した性能向上が得られ、両方の個別成分を上回った。
  • 十分なラベル付きデータ(N > 1000)が得られた場合、TF-IDF重み付けを施したbag-of-wordsは、学習された表現の性能を同等または上回った。これは、スケールが大きくなると転移学習の利点が薄れる傾向があることを示唆している。
  • 予測時刻が将来の出来事と一致するという評価における楽観的バイアスは、核心的な結論を無効にしない。学習された表現は、データが少ない状況ではベースラインよりも効果的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。