Skip to main content
QUICK REVIEW

[論文レビュー] Learning Tasks for Multitask Learning: Heterogenous Patient Populations in the ICU

Harini Suresh, Jen J. Gong|arXiv (Cornell University)|Jun 7, 2018
Machine Learning in Healthcare参考文献 17被引用数 9
ひとこと要約

本稿では、最初にシーケンス・ツー・シーケンス自己オートエンコーダを用いてICUデータ内の患者サブポピュレーションを発見し、その後に各サブポピュレーションを別々のタスクとして扱うマルチタスク学習を適用する二段階フレームワークを提案する。この手法は、グローバルモデルや個別モデルと比較して、多様な患者群における入院死亡率予測性能を向上させ、異質な臨床的集団におけるサブグループに配慮した評価の重要性を示している。

ABSTRACT

Machine learning approaches have been effective in predicting adverse outcomes in different clinical settings. These models are often developed and evaluated on datasets with heterogeneous patient populations. However, good predictive performance on the aggregate population does not imply good performance for specific groups. In this work, we present a two-step framework to 1) learn relevant patient subgroups, and 2) predict an outcome for separate patient populations in a multi-task framework, where each population is a separate task. We demonstrate how to discover relevant groups in an unsupervised way with a sequence-to-sequence autoencoder. We show that using these groups in a multi-task framework leads to better predictive performance of in-hospital mortality both across groups and overall. We also highlight the need for more granular evaluation of performance when dealing with heterogeneous populations.

研究の動機と目的

  • 異質なICU集団に対してグローバルモデルを学習する際、特定の患者サブグループにおける予測性能が低い問題に対処すること。
  • 専門家が定義したコhortに依存せずに、臨床的に意味のある患者サブポピュレーションをデータ駆動で発見する手法を開発すること。
  • サブポピュレーション間で共有される知識を活用することで、マルチタスク学習を通じて予測性能を向上させること。
  • 全体の指標が特定のグループでの性能不足を隠す可能性があるため、サブグループごとの評価が不可欠であることを実証すること。
  • 結果に特化したコhort発見が、モデル性能をさらに向上させる可能性があるかどうかを評価すること。

提案手法

  • 最初の24時間のICU内での患者の生理的時系列データの密集した低次元表現を学習するために、シーケンス・ツー・シーケンス自己オートエンコーダを用いる。
  • 学習された表現に対して非教師ありクラスタリング(k-means)を適用し、明確に区別できる患者サブポピュレーションを発見する。
  • 発見された各サブポピュレーションをマルチタスク学習フレームワーク内の別々のタスクとして扱い、各グループごとに個別の予測ヘッドを訓練する。
  • 提案手法である非教師ありマルチタスクモデルを、全データで学習するグローバルモデルと、各グループごとに学習する個別モデルと比較する。
  • 評価指標としてAUC、PPV、特異度を用い、全体集団および各サブグループごとのパフォーマンスを比較する。
  • データ駆動によるタスク発見の有効性を検証するため、非教師ありコhortと専門家が定義したコhort(例:ケアユニット)を比較するアブレーションスタディを実施する。

実験結果

リサーチクエスチョン

  • RQ1生理的時系列表現の非教師ありクラスタリングは、ICUデータにおいて臨床的に意味のある患者サブポピュレーションを発見できるか?
  • RQ2このデータ駆動によるサブポピュレーションをマルチタスク学習フレームワーク内のタスクとして用いることで、グローバルモデルや個別モデルと比較して、入院死亡率予測のパフォーマンスが向上するか?
  • RQ3異なるモデルアーキテクチャを用いた場合、サブポピュレーションごとのパフォーマンスはどのように変化するか。また、予測ウィンドウ(24時間 vs 48時間)によってその傾向は変化するか?
  • RQ4全体の指標が隠している性能格差を検出するために、サブポピュレーションごとの詳細な評価は必須であるか?
  • RQ5一般の非教師ありクラスタリングと比較して、結果に特化したコhort発見は、さらなるパフォーマンス向上をもたらすか?

主な発見

  • 24時間死亡率予測において、非教師ありマルチタスクモデルは、全体的およびグループ別指標においてグローバルモデルを著しく上回り、マクロレベル評価におけるAUCおよび特異度についてp < 1e-15の有意差を示した。
  • マクロレベルのケアユニットコhortにおいて、非教師ありマルチタスクモデルはAUC(0.859 vs 0.839)およびPPV(0.187 vs 0.170)でグローバルモデルを上回り、統計的有意性(p < 1e-15)を示した。
  • 48時間死亡率予測においては、非教師ありマルチタスクモデルがグローバルモデルを著しく上回らなかったが、これはICU滞在2日目のデータのスパarsityと欠損値の影響による可能性が高い。
  • ケアユニットで定義されたコhortを用いたマルチタスクモデルのパフォーマンスは、48時間予測ウィンドウにおいて、すべての指標でグローバルモデルよりも著しく劣っており、専門家が定義したコhortが後期の予測タスクには最適でない可能性を示唆している。
  • 本研究は、全体のパフォーマンス指標のみを報告すると、特定のサブグループでの性能不足が隠されてしまう可能性があることを強調しており、サブグループレベルの評価の必要性を浮き彫りにしている。
  • 結果は、予測ターゲットに従ってガイドされた結果特化型コhort発見が、一般の非教師ありクラスタリングを上回るさらなるパフォーマンス向上をもたらす可能性があることを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。