[論文レビュー] Forecasting adverse surgical events using self-supervised transfer learning for physiological signals
本論文は、生理的時系列データから深層埋め込みを抽出することで、有害な外科的イベントの予測を向上させる自己教師付き転移学習フレームワークPHASEを提案する。PHASEは、1つのデータセットで訓練された転送可能な埋め込みを、未知の外科的またはICUデータに適用することで、より高い精度と低い計算コストを実現し、最先端のモデル(生データ上のLSTMや、手作業特徴量上の勾配ブースティングツリー)を上回る性能を発揮する。
Hundreds of millions of surgical procedures take place annually across the world, which generate a prevalent type of electronic health record (EHR) data comprising time series physiological signals. Here, we present a transferable embedding method (i.e., a method to transform time series signals into input features for predictive machine learning models) named PHASE (PHysiologicAl Signal Embeddings) that enables us to more accurately forecast adverse surgical outcomes based on physiological signals. We evaluate PHASE on minute-by-minute EHR data of more than 50,000 surgeries from two operating room (OR) datasets and patient stays in an intensive care unit (ICU) dataset. PHASE outperforms other state-of-the-art approaches, such as long-short term memory networks trained on raw data and gradient boosted trees trained on handcrafted features, in predicting five distinct outcomes: hypoxemia, hypocapnia, hypotension, hypertension, and phenylephrine administration. In a transfer learning setting where we train embedding models in one dataset then embed signals and predict adverse events in unseen data, PHASE achieves significantly higher prediction accuracy at lower computational cost compared to conventional approaches. Finally, given the importance of understanding models in clinical applications we demonstrate that PHASE is explainable and validate our predictive models using local feature attribution methods.
研究の動機と目的
- 小規模・中規模病院における有害な外科的予後予測のための限られたデータと計算リソースの課題に対処すること。
- 病院間での機微な電子的健康記録(EHR)データの共有を妨げるデータプライバシーの障壁を克服すること。
- 生理的信号を用いて、転送可能で解釈可能かつ計算効率の良い有害な外科的イベントの予測手法を開発すること。
- 生データではなく訓練済みの埋め込みモデルを共有することで、病院間連携を可能にすること。
- 特に低データ環境下において、生信号や手作業特徴量を用いた従来手法よりも予測性能を向上させること。
提案手法
- 有害なイベントのラベルを必要とせず、一般化可能な埋め込みを学習するために、生理的信号上で自己教師付きLSTMネットワークを訓練する。
- 訓練済みLSTMの最終隠れ層を、生理的データの1分間のウィンドウごとに200次元の埋め込みベクトルとして使用する。
- 元の病院データセット(例:OR1またはICU_M)で訓練した上流の埋め込みモデルを、再訓練せずに別の病院データセット(例:OR0)に適用することで、転移学習を実装する。
- 埋め込み特徴量と静的患者データを組み合わせ、最終的な5つの有害な結果の予測に下流の勾配ブースティングツリー(GBT)モデルを適用する。
- ターゲットドメインのLSTMをソースドメインのモデルで初期化し、ターゲットデータ上で継続的に訓練することで、ファインチューニングを実装する。
- 15種類の生理的信号を同時に予測する、共同で訓練されたマルチシグナルLSTMを用い、信号間で共有される表現を学習する。
実験結果
リサーチクエスチョン
- RQ1生データまたは手作業特徴量で訓練されたモデルと比較して、生理的信号における自己教師付き学習が、有害な外科的イベント予測の精度を向上させるか。
- RQ21つの病院で事前訓練された埋め込みモデルを用いた転移学習が、別の病院の未知のデータに対する予測性能をどの程度向上させるか。
- RQ3PHASEフレームワークは、リソースが限られた機関における下流予測の計算コストを低減するか。
- RQ4シャープリー値のような局所的特徴寄与度手法を用いて、モデルの予測を効果的に解釈できるか。
- RQ5複数の信号を統合して1つのLSTMで埋め込みを同時に学習するのと比較して、PHASEの性能はどの程度か。
主な発見
- PHASEは、低酸素血症、低炭酸ガス血症、低血圧、高血圧、フェニルエフリン投与の5つの有害な結果を予測する際、生データ上のLSTMや生データ・手作業特徴量上のGBTと比較して顕著に優れた性能を示した。
- PHASEを用いた転移学習は、訓練時にターゲットデータにアクセスできない状況下でも、1つのデータセット(例:OR1)で訓練された埋め込みモデルを別のターゲットデータセット(例:OR0)に適用することで、従来手法よりも高い予測精度を達成した。
- 事前訓練済み埋め込みの使用により、ターゲット病院における下流予測の計算コストが低減された。これは、ターゲット施設のデータに対して訓練が必要なのは最終的なGBTモデルのみであったためである。
- PHASEは、2つの手術室(OR)データセットと1つのICUデータセットを含む多様なデータセットにおいて、一貫した性能向上を示し、優れた一般化性能を示した。
- シャープリー値を用いた局所的特徴寄与度による解釈は、個々の予測においてどの生理的信号が最も寄与しているかを臨床的に解釈可能なインサイトを提供した。
- 共同で訓練されたマルチシグナル埋め込みモデルは、個々の信号ごとの自己教師付きモデルを上回らなかった。これは、信号固有の事前学習が、下流予測のためのより優れた表現を生み出すことを示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。