[论文解读] Improved Hierarchical Patient Classification with Language Model Pretraining over Clinical Notes
本文提出了一种带有语言模型预训练的分层循环神经网络(SHiP),以提升电子健康记录中临床病历的理解能力。通过保留序列结构并利用病历文本进行预训练,该模型在MIMIC-III数据集的分层诊断分类任务中取得了最先进性能,相较于忽略上下文或跳过预训练的基线模型,在AUROC和召回率指标上均有显著提升。
Clinical notes in electronic health records contain highly heterogeneous writing styles, including non-standard terminology or abbreviations. Using these notes in predictive modeling has traditionally required preprocessing (e.g. taking frequent terms or topic modeling) that removes much of the richness of the source data. We propose a pretrained hierarchical recurrent neural network model that parses minimally processed clinical notes in an intuitive fashion, and show that it improves performance for discharge diagnosis classification tasks on the Medical Information Mart for Intensive Care III (MIMIC-III) dataset, compared to models that treat the notes as an unordered collection of terms or that conduct no pretraining. We also apply an attribution technique to examples to identify the words that the model uses to make its prediction, and show the importance of the words' nearby context.
研究动机与目标
- 为解决电子健康记录中异质性、非结构化临床病历常被忽略或过度简化的预测建模挑战。
- 通过保留临床病历中的序列与上下文信息,实现分层患者分类,且无需大量预处理。
- 评估语言模型预训练在分层深度学习框架中提升临床病历表征学习效果的有效性。
- 利用归因技术解释模型预测,识别影响结果的关键词和短语。
- 证明预训练与分层建模相结合可显著提升下游临床预测任务的性能。
提出的方法
- 该模型使用分层注意力网络处理临床病历,保留词序,并应用注意力机制聚焦于相关文本片段。
- 在病历标记上使用双向LSTM生成上下文敏感的表征,分层注意力机制将这些表征聚合为单个病历嵌入向量。
- 在病历级LSTM上应用语言模型预训练目标,使其在端到端微调前学习预测下一个词(或双向情况下的前一个词)。
- 通过在固定时间间隔内对固定时间窗口内的特征进行袋装(bagging),将病历嵌入与结构化EHR特征(如诊断、实验室检查)整合,以减少序列长度。
- 采用路径积分梯度归因方法计算词级重要性分数,基线为零向量,积分步数为20步。
- 该架构结合了患者病史编码器(时间袋装特征上的LSTM)与病历特定编码器(LSTM + 注意力),联合优化预测损失。
实验结果
研究问题
- RQ1与非预训练或词袋基线相比,语言模型预训练是否能提升临床病历在分层分类任务中的性能?
- RQ2保留临床病历中的序列结构是否能带来优于将其视为无序词集合的预测性能?
- RQ3通过归因方法揭示,模型预测如何依赖于特定词语及其局部上下文?
- RQ4序列长度、袋装时长和预训练调度的最佳配置是什么?
- RQ5在此背景下,双向建模是否比单向建模带来更好的性能?
主要发现
- SHiP模型在加权多标签ICD-9诊断任务上的AUROC达到0.889(±0.002),优于非预训练分层模型(0.869)和词袋基线。
- 在主要CCS诊断任务中,SHiP模型在8小时袋装设置下达到0.671(±0.004)的top-1召回率,高于非预训练模型的0.591。
- 双向SHiP模型在主要CCS任务上的top-1召回率比单向变体高0.012,AUROC高0.008。
- 预训练至24小时或直至出院时性能几乎相同(AUPRC分别为0.478和0.479),表明早期预训练已足够。
- 归因分析显示,模型预测严重依赖于词语及其直接上下文,证实了局部语言结构的重要性。
- 对病历采用2500个token截断的模型性能优于1000个token截断,尤其在诊断任务中表现更优,表明更长上下文有助于提升性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。