Skip to main content
QUICK REVIEW

[論文レビュー] Interpretable Survival Analysis for Heart Failure Risk Prediction

Mike Van Ness, Tomas M. Bosschieter|arXiv (Cornell University)|Oct 24, 2023
Machine Learning in Healthcare被引用数 4
ひとこと要約

本論文は、電子的健康記録(EHR)を用いた心不全リスク予測のための新規で解釈可能な生存分析パイプラインを提案する。改善された生存スタッキング、特徴量選択のためのControlBurn、および解釈可能なブースティングマシンを組み合わせることで、臨床的解釈可能性を保ちながら最先端の性能を達成し、心不全リスク要因に関する新たな知見を明らかにした。

ABSTRACT

Survival analysis, or time-to-event analysis, is an important and widespread problem in healthcare research. Medical research has traditionally relied on Cox models for survival analysis, due to their simplicity and interpretability. Cox models assume a log-linear hazard function as well as proportional hazards over time, and can perform poorly when these assumptions fail. Newer survival models based on machine learning avoid these assumptions and offer improved accuracy, yet sometimes at the expense of model interpretability, which is vital for clinical use. We propose a novel survival analysis pipeline that is both interpretable and competitive with state-of-the-art survival models. Specifically, we use an improved version of survival stacking to transform a survival analysis problem to a classification problem, ControlBurn to perform feature selection, and Explainable Boosting Machines to generate interpretable predictions. To evaluate our pipeline, we predict risk of heart failure using a large-scale EHR database. Our pipeline achieves state-of-the-art performance and provides interesting and novel insights about risk factors for heart failure.

研究の動機と目的

  • 心不全予測の生存分析において、比例ハザード仮定を満たさない場合や非線形効果を扱えない従来のコックスモデルの限界を克服すること。
  • 後処理による説明に依存せずに、高い解釈可能性を維持する機械学習ベースの生存パイプラインを開発すること。
  • 標準のコックスモデルよりも高い予測精度を実現するとともに、臨床的解釈可能性を保ち、実世界の医療現場への導入を可能にすること。
  • 大規模なEHRデータを用いた解釈可能なモデリングにより、これまでに見過ごされてきた臨床的に関連性のある心不全リスク要因を同定すること。

提案手法

  • 生存時間の推定を必要とせず、生存問題をバイナリ分類タスクに変換する、改善されたスケーラブルな生存スタッキングのバージョンを用いる。
  • 多重共線性を低減し、モデルの安定性を向上させるために、関連性の高い低相関特徴量を同定するControlBurnを特徴量選択に適用する。
  • 解釈可能な予測を内蔵する一般化加法モデルを活用するため、最終推定器として解釈可能なブースティングマシン(EBM)を採用する。
  • 生存データからのリスクセットを分類のための訓練サンプルに変換し、偽値を用いないまま時間発生情報の保持を図る。
  • 右打ち切りデータを適切に処理し、判別性能を最適化するとともにモデルの透明性を保つように、パイプライン全体をエンドツーエンドに統合する。
  • 縦断的なリスクパターンを捉えるために、複数の臨床変数における時間的特徴(例:平均値、最大値、最小値、最終測定値)を含むEHRデータを用いる。
Figure 1: A summary of our interpretable survival analysis pipeline. During training (left), we use ControlBurn for feature selection (Section 3.3 ), survival stacking with subsampling to cast the survival data to classification data (Algorithm 1 ), and EBMs for generating feature importances and sh
Figure 1: A summary of our interpretable survival analysis pipeline. During training (left), we use ControlBurn for feature selection (Section 3.3 ), survival stacking with subsampling to cast the survival data to classification data (Algorithm 1 ), and EBMs for generating feature importances and sh

実験結果

リサーチクエスチョン

  • RQ1臨床的利用に適した高い解釈可能性を維持しつつ、最先端の予測性能を達成できる生存分析パイプラインを設計できるか?
  • RQ2本パイプラインは、標準のコックスモデルや他の機械学習生存モデルと比較して、判別性能および適合度の観点でどのように異なるか?
  • RQ3解釈可能なモデリングにより、従来の手法が見過ごしてきた心不全の新たな臨床的リスク要因は何か?
  • RQ4高次元のEHRデータにおいて、ControlBurnによる特徴量選択はモデルの安定性および予測性能をどの程度向上させるか?
  • RQ5生存時間の推定を伴わない生存スタッキングは、偽値ベースのアプローチと比較して、スケーラビリティおよび解釈可能性の観点で優れているか?

主な発見

  • 提案されたパイプラインは、大規模なEHRデータベースにおいて心不全リスク予測で最先端の性能を達成し、標準のコックスモデルや他の機械学習ベースのベースラインを上回った。
  • モデルは、長期間にわたる体格変化、クレアチニン、QRS幅の傾向といった、従来あまり注目されていなかったリスク要因を、心不全の強力な予測要因として同定した。
  • ControlBurnは特徴量間の相関を効果的に低減し、モデルの安定性を向上させ、より信頼性の高い特徴量重要度の順序付けを実現した。
  • 解釈可能なブースティングマシンは、臨床的直観と整合性の高い高精度な局所的解釈可能な予測を提供し、臨床意思決定を支援した。
  • 生存スタッキングにより、生存時間の推定を必要とせず、時間発生データを正確にモデル化でき、偽値法に内在するバイアスを回避できた。
  • パイプラインは、静的ベースライン値を超えて、バイオマーカーの動的変化(例:クレアチニン上昇、eGFR低下)が予測力に顕著に寄与することを明らかにした。
Figure 2: Distribution of predicted survival probabilities $S(t\mid X_{i})=P(T_{i}>t)$ at $t=5$ across test patients. The left plot shows the survival probabilities using Eq. ( 2 ) as in (Craig et al., 2021 ) , while the right plot shows Eq. ( 5 ). Our survival prediction method gives a reasonable d
Figure 2: Distribution of predicted survival probabilities $S(t\mid X_{i})=P(T_{i}>t)$ at $t=5$ across test patients. The left plot shows the survival probabilities using Eq. ( 2 ) as in (Craig et al., 2021 ) , while the right plot shows Eq. ( 5 ). Our survival prediction method gives a reasonable d

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。