Skip to main content
QUICK REVIEW

[论文解读] Understanding Behavior of Clinical Models under Domain Shifts

Jayaraman J. Thiagarajan, Deepta Rajan|arXiv (Cornell University)|Sep 20, 2018
Machine Learning in Healthcare参考文献 7被引用 9
一句话总结

本文提出一个框架,用于在真实世界领域偏移(如人群偏差、标签分布偏移和测量差异)下评估临床深度学习模型,基于MIMIC-III电子健康记录(EHR)数据集和1D ResNet模型。研究发现,基于较老或 predominantly 白人患者训练的模型在推广到年轻或少数族裔人群时表现不佳,尤其当疾病共现模式不同时,凸显了人工智能在医疗领域中的关键可靠性缺陷。

ABSTRACT

The hypothesis that computational models can be reliable enough to be adopted in prognosis and patient care is revolutionizing healthcare. Deep learning, in particular, has been a game changer in building predictive models, thus leading to community-wide data curation efforts. However, due to inherent variabilities in population characteristics and biological systems, these models are often biased to the training datasets. This can be limiting when models are deployed in new environments, when there are systematic domain shifts not known a priori. In this paper, we propose to emulate a large class of domain shifts, that can occur in clinical settings, with a given dataset, and argue that evaluating the behavior of predictive models in light of those shifts is an effective way to quantify their reliability. More specifically, we develop an approach for building realistic scenarios, based on analysis of extit{disease landscapes} in multi-label classification. Using the openly available MIMIC-III EHR dataset for phenotyping, for the first time, our work sheds light into data regimes where deep clinical models can fail to generalize. This work emphasizes the need for novel validation mechanisms driven by real-world domain shifts in AI for healthcare.

研究动机与目标

  • 理解临床深度学习模型在训练期间未捕捉到的真实世界领域偏移下的失效机制。
  • 识别对模型泛化能力影响最严重的特定类型领域偏移——人群偏差、标签分布偏移、测量差异。
  • 开发一种系统性方法,通过多标签EHR数据中的疾病图谱分析,模拟临床相关的领域偏移。
  • 使用MIMIC-III EHR数据集,评估最先进1D ResNet模型在这些领域偏移下的鲁棒性。
  • 倡导基于真实世界领域偏移的新型验证机制,以提升人工智能在医疗领域的可靠性。

提出的方法

  • 使用MIMIC-III EHR数据集,其中每位ICU患者包含25类疾病中的76项测量指标,用于多标签表型分析。
  • 将表型分析重新定义为选定疾病子集的二分类任务,以评估模型在领域偏移下的行为。
  • 采用包含7个残差块、1D卷积、批量归一化、Dropout和Leaky ReLU激活函数的1D ResNet模型,用于时间序列建模。
  • 应用信息分解分析疾病共现模式,并构建用于领域偏移模拟的疾病图谱。
  • 通过源-目标数据划分模拟领域偏移:例如,从年长者到年轻人、从白人到少数族裔、从男性到女性、从单一疾病组到双重疾病组。
  • 通过重复最后一次观测值的方式填补缺失测量值,并在各类偏移情景下使用加权AUPRC评估性能。

实验结果

研究问题

  • RQ1人群偏差(如年龄、种族、性别)在多大程度上影响临床深度学习模型的泛化性能?
  • RQ2标签分布偏移(如出现新疾病组合或缺失疾病组合)在多大程度上影响模型的可靠性?
  • RQ3测量差异(包括标签噪声和采样率变化)如何影响临床时间序列预测中的模型性能?
  • RQ4哪些类型的领域偏移会导致最显著的性能下降?
  • RQ5简单的插补策略是否能缓解缺失测量值在领域偏移下的影响?

主要发现

  • 人群偏差(如从年长者到年轻人、从白人到少数族裔、从男性到女性)导致显著性能下降,AUPRC从0.9降至最低0.65。
  • 当疾病共现模式发生变化时,模型泛化能力差——例如,在年轻患者中,冠状动脉粥样硬化常伴随继发性高血压和慢性肾病,而老年患者中则不然。
  • 涉及源疾病子集或超集的标签分布偏移(如“单病”到“双病”:仅心脏疾病或仅肾脏疾病扩展为两者)因固有的生物学不确定性,导致显著性能下降。
  • 模型对高达10%的标签噪声具有鲁棒性,但在20%标签翻转时性能显著下降,表明标签质量存在阈值效应。
  • 采样率变化对性能产生负面影响,且简单的最后值插补无法恢复泛化能力,与缺失数据插补效果不同。
  • 在具有强共现模式(如老年患者中高血压、动脉粥样硬化、血脂异常)的数据上训练的模型,无法推广到疾病共现结构不同的群体。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。