[论文解读] Language Models Are An Effective Patient Representation Learning Technique For Electronic Health Record Data
本文提出基于临床语言模型的表示方法(CLMBR),用于电子健康记录(EHR)数据,通过大规模语言建模范式进行迁移学习,生成固定长度的患者嵌入表示。当训练数据稀缺时,CLMBR在平均AUROC上将临床预测模型性能提升19%,优于基于计数的基线模型和端到端深度学习模型,尤其在低数据场景下表现更优。
Widespread adoption of electronic health records (EHRs) has fueled the development of using machine learning to build prediction models for various clinical outcomes. This process is often constrained by having a relatively small number of patient records for training the model. We demonstrate that using patient representation schemes inspired from techniques in natural language processing can increase the accuracy of clinical prediction models by transferring information learned from the entire patient population to the task of training a specific model, where only a subset of the population is relevant. Such patient representation schemes enable a 3.5% mean improvement in AUROC on five prediction tasks compared to standard baselines, with the average improvement rising to 19% when only a small number of patient records are available for training the clinical prediction model.
研究动机与目标
- 通过利用表示学习,解决从EHR数据训练临床预测模型时面临的数据量不足的挑战。
- 探究基于语言模型的患者表示是否能优于标准基线模型和端到端深度学习模型,提升预测性能。
- 评估表示质量对模型性能的影响,特别是在不同规模的训练集下,尤其关注低数据场景。
- 确定通过临床语言建模进行迁移学习是否能优于人工特征工程和简单的计数型表示。
- 评估CLMBR在多种临床结果和数据场景下的泛化能力与可扩展性。
提出的方法
- 作者在大规模EHR语料上训练临床语言模型(CLMBR),以学习患者就诊历史中的序列模式,将EHR视为自然语言序列处理。
- CLMBR采用掩码语言建模目标,基于上下文预测缺失的医疗编码(如ICD-10、CPT、LOINC),从而捕捉EHR数据中的时间顺序与层次结构。
- 通过微调后的CLMBR模型编码每位患者完整的EHR历史,生成固定长度的嵌入表示。
- 将这些学习到的表示作为下游临床预测模型(如逻辑回归或梯度提升树)的输入特征。
- 在五个临床预测任务中,将该方法与基于计数的表示(如频率向量)和端到端深度神经网络进行对比。
- 通过在不同规模的训练集上评估AUROC,评估模型的数据效率与可扩展性。
实验结果
研究问题
- RQ1与标准基线相比,基于语言模型的表示是否能提升EHR数据中临床预测模型的性能?
- RQ2CLMBR表示的性能如何随训练数据量变化,尤其在低数据场景下?
- RQ3语言建模目标的选择是否显著影响患者表示的质量及其在下游预测任务中的表现?
- RQ4在预测准确率与数据效率方面,CLMBR表示与端到端深度学习模型相比表现如何?
- RQ5当与梯度提升树等强大下游模型结合时,基于语言模型的表示是否能优于简单的计数型特征?
主要发现
- 与标准基线相比,CLMBR表示在五个临床预测任务中平均提升了3.5%的AUROC。
- 当仅使用少量患者记录进行训练时,CLMBR表示在AUROC上实现了平均19%的性能提升。
- 即使在大数据场景下,基于CLMBR的模型也优于端到端深度神经网络,表明其潜在适用范围超出以往预期。
- 当使用基于计数的表示时,梯度提升树的性能显著优于L2正则化逻辑回归,凸显模型选择在性能差异中的关键作用。
- 在数据充足时,基于计数的表示与强大模型结合可达到接近峰值性能,仅比CLMBR低3.5%的AUROC。
- 更庞大的CLMBR模型相比先前发表的临床语言模型提供了更优的表示,凸显模型架构与目标设计的重要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。