Skip to main content
QUICK REVIEW

[論文レビュー] Learning Representations of Missing Data for Predicting Patient Outcomes

Brandon Malone, Alberto García-Durán|arXiv (Cornell University)|Nov 12, 2018
Machine Learning in Healthcare参考文献 21被引用数 7
ひとこと要約

本稿では、電子的健康記録(EHR)における欠損データを明示的にモデル化するため、観測済みおよび欠損データモダリティの別々の埋め込みを学習する、グラフベースの表現学習手法EP-mdを提案する。患者の類縁性グラフを介したメッセージパッシングにより、欠損特徴に関する情報を伝搬させることで、入院中の死亡、入院期間、退院先の予測性能が向上する。マルチモーダルデータ(時系列データ、テキスト、人口統計学的データ)を用いた場合、最先端のモデルを上回る性能を示す。

ABSTRACT

Extracting actionable insight from Electronic Health Records (EHRs) poses several challenges for traditional machine learning approaches. Patients are often missing data relative to each other; the data comes in a variety of modalities, such as multivariate time series, free text, and categorical demographic information; important relationships among patients can be difficult to detect; and many others. In this work, we propose a novel approach to address these first three challenges using a representation learning scheme based on message passing. We show that our proposed approach is competitive with or outperforms the state of the art for predicting in-hospital mortality (binary classification), the length of hospital visits (regression) and the discharge destination (multiclass classification).

研究の動機と目的

  • 電子的健康記録(EHR)における欠損および不完全なデータの課題に対処すること。これは、従来の機械学習手法の実装を妨げる要因である。
  • 時系列データ、自由記述テキスト、人口統計学的データなどの複数のデータモダリティを、統一された表現学習フレームワーク内でモデル化すること。
  • 欠損データを学習可能な埋め込みとして明示的に表現し、患者類縁性グラフを介して伝搬させることで、予測性能を向上させること。
  • 入院中の死亡、入院期間、退院先といった重要な臨床予測タスクにおける性能向上を実証すること。
  • 特に特徴量が欠損している場合でも、モデルの予測に最も影響を与える特徴を特定できる解釈可能性を提供すること。

提案手法

  • 埋め込み伝搬(EP)という自己教師付きグラフ表現学習手法を拡張し、各モダリティごとに観測済みおよび欠損データの二重表現を用いて、観測済みおよび欠損データを同時にモデル化する。
  • 臨床的類似性に基づいて患者類縁性グラフを構築し、類似した属性や診断を持つ患者同士をエッジで接続する。
  • モダリティ固有の埋め込みを学習可能にするために再構成損失を用い、一部の患者においてデータが欠損している場合でも表現学習が可能になるようにする。
  • 各患者・各モダリティについて、観測済みデータ用と欠損データ用の二つの表現を学習する。両者とも、隣接患者からのメッセージパッシングによって情報を受け取る。
  • モダリティ固有の埋め込みを統合し、下流の予測タスク用の統一された患者表現を生成する。
  • MIMIC-IIIベンチマークにモデルを適用し、時系列データ、医師ノート(テキスト)、人口統計学的データを統合してマルチモーダル学習を実施する。

実験結果

リサーチクエスチョン

  • RQ1グラフベースの表現学習フレームワークは、欠損の有無を明示的な埋め込みとして学習することで、EHRにおける欠損データを効果的にモデル化できるか?
  • RQ2欠損データを学習可能な表現としてモデル化することで、臨床予後予測性能がどのように向上するか?
  • RQ3時系列データ、テキスト、人口統計学的データといった複数のデータモダリティを、欠損データモデル化と組み合わせることで、予測性能が向上するか?
  • RQ4学習された表現が、観測されていない特徴が予測に与える影響をどの程度適切に捉えられるか?特に、特徤が欠損している場合にその影響をどのように反映するか。
  • RQ5特徴が欠損している場合でも、モデルが予測に最も影響を与える臨床的特徴を特定できるか?

主な発見

  • マルチモーダルデータ(時系列データ、テキスト、人口統計学的データ)を用いた場合、EP-mdは入院期間および退院先の予測において最先端の手法を上回る性能を示した。
  • 時系列データのみを用いた場合でも、LSTMネットワークと同等の性能を達成し、入院中の死亡予測において競争力のある結果を得た。
  • 入院期間予測において、100件のラベル付きサンプルで学習した場合、EP-mdは元の特徴量に比べて平均絶対誤差(MAE)を最大15%まで低減した。
  • 観測済みケースと欠損ケースの比較において、負のMAE差が示されたことから、EP-mdはベースラインモデルよりも欠損特徴を持つ患者の予測をより正確に実行していることが確認された。
  • 体温とpHは、観測済みであれ欠損であれ、入院期間予測に最も寄与する特徴であり、一貫した寄与度を示した。これは、欠損データに関する情報が効果的に伝搬されていることを示している。
  • Glasgow昏睡尺度の特徴は、欠損している場合に寄与度が低下する傾向を示しており、モデルが未観測の臨床指標の予測力低下を適切に反映できていることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。