[论文解读] Learning Hierarchical Representations of Electronic Health Records for Clinical Outcome Prediction
该论文提出了一种分层深度学习模型,通过双注意力机制(事件注意力与时间注意力)自适应地将不规则的电子健康记录(EHR)序列分割为短期共现组和长期时间序列,以学习具有判别性的临床结局预测表征。该模型在死亡预测和ICU入院预测任务中分别取得了0.9428和0.9016的AUC最优得分,优于以往方法,其优势在于捕捉长程依赖关系的同时,有效过滤了无序短期事件带来的噪声。
Clinical outcome prediction based on Electronic Health Record (EHR) helps enable early interventions for high-risk patients, and is thus a central task for smart healthcare. Conventional deep sequential models fail to capture the rich temporal patterns encoded in the long and irregular clinical event sequences in EHR. We make the observation that clinical events at a long time scale exhibit strong temporal patterns, while events within a short time period tend to be disordered co-occurrence. We thus propose differentiated mechanisms to model clinical events at different time scales. Our model learns hierarchical representations of event sequences, to adaptively distinguish between short-range and long-range events, and accurately capture their core temporal dependencies. Experimental results on real clinical data show that our model greatly improves over previous state-of-the-art models, achieving AUC scores of 0.94 and 0.90 for predicting death and ICU admission, respectively. Our model also successfully identifies important events for different clinical outcome prediction tasks.
研究动机与目标
- 解决传统RNN和CNN难以有效捕捉EHR数据中长且不规则的临床事件序列建模挑战。
- 区分EHR序列中的短程事件共现(无序)与长程时间依赖(有序)关系。
- 构建一种分层表征学习框架,实现对事件序列的自适应分割,并在大规模数据中捕捉有意义的时间模式。
- 通过注意力机制识别临床相关事件及其组合,提升模型可解释性并改善预测性能。
- 利用真实世界EHR数据,提升对死亡和ICU入院等关键临床结局的预测准确性。
提出的方法
- 模型采用自适应分割模块,基于时间接近度将不规则时间点的临床事件聚类为序列组,以区分短期共现与长期序列。
- 在低层级,对每组应用事件注意力机制,识别并加权关键事件,生成组级别表征。
- 在高层级,采用基于GRU的循环网络建模组表征序列的时间动态,以捕捉长程依赖。
- 双注意力机制——每组内的事件注意力与组序列的时间注意力——实现动态特征加权,提升模型可解释性。
- 模型采用端到端训练,使用交叉熵损失函数进行临床结局(死亡、ICU入院)的二分类任务。
- 消融研究验证了双注意力机制与自适应分割的必要性,以固定长度分割作为基线进行对比。
实验结果
研究问题
- RQ1分层深度学习模型能否有效区分不规则EHR序列中的短程事件共现与长程时间依赖?
- RQ2与固定长度分割或无分割相比,EHR事件的自适应分割是否能带来更优的临床结局预测性能?
- RQ3双注意力机制(事件注意力与时间注意力)在多大程度上提升了预测性能与模型可解释性?
- RQ4哪些临床事件对死亡和ICU入院最具预测性?模型能否以数据驱动方式识别这些事件?
- RQ5在关键临床结局预测任务中,该模型相较于当前最先进方法,在AUC与AUPRC指标上的表现如何?
主要发现
- 所提模型在死亡预测任务中AUC达到0.9428,在ICU入院预测中达到0.9016,显著优于先前最先进模型。
- 消融研究显示,事件注意力与时间注意力均不可或缺,其中事件注意力对性能贡献更大,尤其在死亡预测任务中表现更显著。
- 固定长度分割方法始终表现逊于自适应分割,当组大小过小或过大时,性能均明显下降。
- 模型识别出如“Blood Products”(输血制品)、“Blood PH”(血气pH值)、“Family Communication”(家属沟通)等临床意义明确的事件为死亡预测的关键因素,部分事件可能被临床医生忽略。
- 中位事件注意力得分揭示了不同结局对应的关键事件集合,证明了模型能够根据任务需求自适应捕捉特定临床模式。
- 模型成功学习到分层表征,有效过滤了无序短期事件的噪声,同时保留了长期时间动态,实现精准预测。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。