Skip to main content
QUICK REVIEW

[论文解读] Learning Tasks for Multitask Learning: Heterogenous Patient Populations in the ICU

Harini Suresh, Jen J. Gong|arXiv (Cornell University)|Jun 7, 2018
Machine Learning in Healthcare参考文献 17被引用 9
一句话总结

本文提出一种两步框架,首先使用序列到序列自编码器在ICU数据中发现患者亚群,然后将每个亚群作为独立任务应用多任务学习。与全局模型或独立模型相比,该方法在多样化患者群体中的院内死亡率预测性能得到提升,凸显了在异质性临床人群中进行亚群感知评估的重要性。

ABSTRACT

Machine learning approaches have been effective in predicting adverse outcomes in different clinical settings. These models are often developed and evaluated on datasets with heterogeneous patient populations. However, good predictive performance on the aggregate population does not imply good performance for specific groups. In this work, we present a two-step framework to 1) learn relevant patient subgroups, and 2) predict an outcome for separate patient populations in a multi-task framework, where each population is a separate task. We demonstrate how to discover relevant groups in an unsupervised way with a sequence-to-sequence autoencoder. We show that using these groups in a multi-task framework leads to better predictive performance of in-hospital mortality both across groups and overall. We also highlight the need for more granular evaluation of performance when dealing with heterogeneous populations.

研究动机与目标

  • 解决在异质性ICU人群上训练全局模型时,对特定患者亚群预测性能较差的问题。
  • 开发一种数据驱动的方法,发现临床上有意义的患者亚群,而无需依赖专家定义的队列。
  • 通过在亚群之间共享知识的多任务学习,提升预测性能。
  • 证明在亚群之间进行精细化评估至关重要,因为整体指标可能掩盖特定群体中的性能不足。
  • 评估基于结果的队列发现是否能进一步提升模型性能。

提出的方法

  • 使用序列到序列自编码器,从ICU住院前24小时的患者生理时间序列数据中学习密集的低维表示。
  • 在学习到的表示上应用无监督聚类(k-means),以发现不同的患者亚群。
  • 将每个发现的亚群作为多任务学习框架中的独立任务,为每组训练独立的预测头。
  • 将所提出的无监督多任务模型与全局模型(在所有数据上训练)和独立模型(按组分别训练)进行比较。
  • 使用AUC、PPV和特异性作为评估指标,比较整体人群和各亚群的性能。
  • 通过消融研究比较无监督队列与专家定义队列(如护理单元)的差异,以验证数据驱动任务发现的有效性。

实验结果

研究问题

  • RQ1无监督聚类是否能从生理时间序列表示中发现ICU数据中临床上有意义的患者亚群?
  • RQ2将这些数据驱动的亚群作为多任务学习框架中的任务,是否能相比全局模型或独立模型,提升院内死亡率的预测性能?
  • RQ3在不同模型架构下,性能在亚群之间如何变化?这种差异是否随结果预测窗口(24小时 vs 48小时)而变化?
  • RQ4是否必须在亚群之间进行精细化评估,才能检测出被整体指标掩盖的性能差异?
  • RQ5与通用无监督聚类相比,基于结果的队列发现是否能带来进一步的性能提升?

主要发现

  • 在24小时死亡率预测中,无监督多任务模型在整体和各组指标上均显著优于全局模型,宏观层面评估的AUC和特异性p值均小于1e-15。
  • 在宏观层面护理单元队列中,无监督多任务模型在AUC(0.859 vs 0.839)和PPV(0.187 vs 0.170)上均显著优于全局模型,且具有统计学显著性(p < 1e-15)。
  • 在48小时死亡率预测中,无监督多任务模型未显著优于全局模型,可能由于ICU住院第二天的数据稀疏性和缺失值问题。
  • 在48小时预测窗口中,使用护理单元定义队列的多任务模型在所有指标上均显著劣于全局模型,表明专家定义的队列可能并非后期预测任务的最优选择。
  • 本研究强调,仅报告整体性能指标可能掩盖特定亚群中的性能不足,凸显了亚群层面评估的必要性。
  • 结果表明,基于预测目标引导的结果特定队列发现,可能在通用无监督聚类的基础上带来进一步的性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。