[论文解读] Unsupervised Representation for EHR Signals and Codes as Patient Status Vector
本文提出一种两步无监督表示学习方法,通过自编码器将临床编码与生命体征信号整合为患者状态向量(PSV),并采用预测微调策略。该方法在eICU数据集上对短期和长期ICU住院患者的死亡率与再入院预测任务中均提升了泛化性能,优于先前方法,其优势源于同时利用单次就诊与多次就诊的患者数据。
Effective modeling of electronic health records presents many challenges as they contain large amounts of irregularity most of which are due to the varying procedures and diagnosis a patient may have. Despite the recent progress in machine learning, unsupervised learning remains largely at open, especially in the healthcare domain. In this work, we present a two-step unsupervised representation learning scheme to summarize the multi-modal clinical time series consisting of signals and medical codes into a patient status vector. First, an auto-encoder step is used to reduce sparse medical codes and clinical time series into a distributed representation. Subsequently, the concatenation of the distributed representations is further fine-tuned using a forecasting task. We evaluate the usefulness of the representation on two downstream tasks: mortality and readmission. Our proposed method shows improved generalization performance for both short duration ICU visits and long duration ICU visits.
研究动机与目标
- 为解决EHR建模中标签数据有限的挑战,开发一种无监督表示学习方法。
- 将多模态EHR数据——临床编码与生命体征信号——整合为统一的患者状态向量,以支持下游任务。
- 提升模型在具有不同临床动态的短期与长期ICU住院患者中的泛化能力。
- 在预训练阶段同时利用单次就诊与多次就诊的患者数据,以增强表示质量。
- 证明在多样化EHR数据上进行无监督预训练可提升死亡率与再入院预测的性能。
提出的方法
- 采用两步无监督训练流程:首先,自编码器将稀疏临床编码与时间序列生命体征信号压缩为分布式表示。
- 随后,通过预测自编码器任务对自编码器生成的拼接表示进行微调,以捕捉序列依赖关系。
- 该方法利用单次就诊自编码步骤学习个体ICU住院期间的表示,同时通过多就诊预测步骤建模纵向模式。
- 最终的患者状态向量(PSV)由编码与信号嵌入拼接而成,适用于下游分类任务。
- 模型以无监督方式预训练,随后冻结用于下游死亡率与再入院预测的微调。
- 该方法在eICU数据集上进行评估,输入特征为周期性生命体征信号与ICD-9编码。
实验结果
研究问题
- RQ1两步无监督学习框架能否有效将临床编码与生命体征信号整合为统一的患者状态向量?
- RQ2在单次就诊与多次就诊ICU数据上进行预训练,是否能提升死亡率与再入院预测的下游性能?
- RQ3所提出方法在具有不同临床动态的短期与长期ICU住院患者中,泛化性能如何?
- RQ4与联合建模相比,仅使用编码或仅使用信号的表示在性能上受到多大程度的限制?
- RQ5无监督预训练是否能降低对昂贵标签数据的依赖,同时提升EHR分析中的预测准确性?
主要发现
- 同时包含编码与信号表示的PSV模型在1小时至24小时死亡率任务中,PR-AUC达到62.46(±0.20),ROC达到90.06(±0.12),优于仅使用编码或仅使用信号的变体。
- 对于长期住院患者(24小时至720小时),PSV模型的PR-AUC为48.88(±0.13),ROC为85.90(±0.09),显示出对基线方法的显著泛化优势。
- PSV模型的半监督变体在1小时至24小时死亡率任务中,PR-AUC达到65.40(±0.35),ROC达到89.10(±0.59),表明在标签数据有限时仍具有强大性能。
- 该模型显著优于Seq2Seq与Transformer基线模型,后者在1小时至24小时死亡率任务中的PR-AUC均低于10。
- 长期住院患者的性能显著下降,表明当前EHR数据可能未能充分捕捉长期ICU护理的复杂动态。
- 消融实验确认,联合使用编码与信号表示可获得更优结果,而仅使用信号表示在再入院预测中的表现较差(PR-AUC 30.47 ±0.13)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。