Skip to main content
QUICK REVIEW

[論文レビュー] Enhancing Model Interpretability and Accuracy for Disease Progression Prediction via Phenotype-Based Patient Similarity Learning

Yue Wang, Tong Wu|arXiv (Cornell University)|Sep 26, 2019
Machine Learning in Healthcare参考文献 14被引用数 5
ひとこと要約

本稿では、縦断的電子歴史記録(EHR)を用いた非負値行列分解(NMF)に基づく表現型ベースの患者類似性学習手法を提案し、疾患進行予測の精度を向上させる。集約された患者-サービス行列から臨床的に意味のある表現型を抽出することで、モデルの解釈可能性と精度が向上し、ワイド&ディープ、ロジスティック回帰、CNNを含む複数のモデルにおいて、表現型特徴を組み込むことでPR-AUCが一貫して2%以上向上した。

ABSTRACT

Models have been proposed to extract temporal patterns from longitudinal electronic health records (EHR) for clinical predictive models. However, the common relations among patients (e.g., receiving the same medical treatments) were rarely considered. In this paper, we propose to learn patient similarity features as phenotypes from the aggregated patient-medical service matrix using non-negative matrix factorization. On real-world medical claim data, we show that the learned phenotypes are coherent within each group, and also explanatory and indicative of targeted diseases. We conducted experiments to predict the diagnoses for Chronic Lymphocytic Leukemia (CLL) patients. Results show that the phenotype-based similarity features can improve prediction over multiple baselines, including logistic regression, random forest, convolutional neural network, and more.

研究の動機と目的

  • 疾患進行パターンの異質性に起因する課題に対処し、共通する医療サービスパターンに基づいて臨床的に意味のある患者サブグループを同定すること。
  • 患者類似性計算において、通常の医療サービスが希少だが臨床的に重要なサービスを覆す問題を克服すること。
  • EHRデータから一貫性があり生物学的に妥当な臨床的特徴を表す表現型を学習することで、モデルの解釈可能性を向上させること。
  • 逐次的EHRモデリングと表現型ベースの類似性特徴を統合することで、疾患進行予測モデルの精度を向上させること。
  • ワイド&ディープ、CNN、および木ベースのモデルを含む多様な機械学習アーキテクチャにわたり、表現型特徴の汎用性を示すこと。

提案手法

  • 非負値行列分解(NMF)を、関連する医療サービスのグループを表す潜在的表現型を学習するための集約された患者-サービス行列に適用する。
  • 患者の経路を週単位で区切り、時間経過にわたるサービス回数を合算して患者レベルのベクトルを生成し、これにより患者-サービス行列を構築する。
  • 表現型特徴はNMFの基底行列として導出され、各列が共起する臨床的サービスのクラスタである表現型を表す。
  • 変更されたワイド&ディープニューラルネットワークは、深層部(デープタワー)で逐次的EHRデータ(LSTMを介して)と、ワイドタワーで非逐次的特徴(人口統計学的特徴とNMF表現型)を統合し、共同予測を実行する。
  • モデルはAdam最適化アルゴリズムを用いて訓練され、早期停止が適用され、性能評価は感度閾値を変化させた際のPR-AUCおよびF1スコアを用いて実施される。
  • 欠損データ下でも、不完全な患者記録を学習済みの表現型空間に射影することで、表現型推論が可能になる。

実験結果

リサーチクエスチョン

  • RQ1EHRから抽出した表現型ベースの患者類似性特徴は、疾患進行予測モデルの精度を向上させることができるか?
  • RQ2NMFで得られた表現型は、臨床的に意味があり一貫性のある医療サービス利用パターンを捉えているか?
  • RQ3表現型特徴の統合は、多様なアーキテクチャにおいてモデルの解釈可能性と性能にどのように影響を与えるか?
  • RQ4表現型特徴は、患者類似性計算における通常のサービスの優位性を緩和できるか?
  • RQ5表現型強化モデルは、慢性リンパ球性白血病(CLL)の診断予測において、ベースラインモデルをどれほど上回るか?

主な発見

  • NMFで得られた表現型特徴を統合することで、ロジスティック回帰、ランダムフォレスト、CNN、ワイド&ディープを含む全テストモデルで平均してPR-AUCが2%以上向上した。
  • 表現型特徴を追加すると、感度閾値のすべてのレベルでF1スコアが上昇し、特に高い感度閾値(例:0.35–0.4)で相対的に大きな増加が観察された。
  • 表現型特徴を統合したワイド&ディープモデルは、15%の感度でPR-AUC 0.2483、30%の感度でPR-AUC 0.3579を達成し、ベースラインモデルを上回った。
  • NMFで学習された表現型は臨床的に一貫しており、CLLなどの標的疾患を示唆しており、モデルの解釈可能性が向上した。
  • 学習済みの表現型空間への射影により、欠損データ下でも患者プロファイルの堅牢な推論が可能になった。
  • 本手法は多様なモデルアーキテクチャに普遍的な有用性を示し、臨床予測タスクへの広範な応用可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。