[论文解读] Learning to Write Notes in Electronic Health Records
本文提出一种基于条件语言建模的方法,利用多模态电子健康记录(EHR)数据(如人口统计学信息、检验结果、药物记录和既往病历)预测临床病历内容,表明大型语言模型能够以高精度有效生成具有临床相关性的病历文本,从而支持人工智能辅助文档工具,如自动补全和错误检测。
Clinicians spend a significant amount of time inputting free-form textual notes into Electronic Health Records (EHR) systems. Much of this documentation work is seen as a burden, reducing time spent with patients and contributing to clinician burnout. With the aspiration of AI-assisted note-writing, we propose a new language modeling task predicting the content of notes conditioned on past data from a patient's medical record, including patient demographics, labs, medications, and past notes. We train generative models using the public, de-identified MIMIC-III dataset and compare generated notes with those in the dataset on multiple measures. We find that much of the content can be predicted, and that many common templates found in notes can be learned. We discuss how such models can be useful in supporting assistive note-writing features such as error-detection and auto-complete.
研究动机与目标
- 应对电子健康记录(EHR)系统中临床文档工作量日益增长的问题,该问题导致临床医生职业倦怠并减少与患者的互动时间。
- 提出一种新颖的语言建模任务,基于多样化EHR数据(结构化与非结构化)进行条件建模,以预测临床病历内容。
- 通过稳健的条件语言建模,提升EHR系统的可用性,支持人工智能辅助功能,如自动补全和错误检测。
- 利用定量指标和定性分析,在真实世界EHR数据上评估语言模型的预测能力。
- 证明可通过历史EHR数据学习常见病历模板和内容,从而实现可扩展且上下文感知的病历生成。
提出的方法
- 定义一个条件语言模型,根据多模态上下文 $ c = (R, T, H) $ 预测临床病历中的下一个词元,其中 $ R $ 为患者的EHR历史,$ T $ 为病历类型,$ H $ 为前10个词元的提示。
- 使用嵌入技术将异构EHR数据(人口统计学信息、检验结果、药物记录、既往病历)表示为密集的序列上下文向量。
- 在去标识化的MIMIC-III数据集上训练自回归Transformer-based语言模型,该数据集包含39,597名ICU患者,涵盖完整的EHR历史和临床病历。
- 使用交叉熵损失优化模型在给定完整上下文时预测病历序列中下一个词元的能力。
- 引入子词分词(如BPE)以处理临床文本中常见的罕见词和未登录词。
- 通过困惑度、BLEU、ROUGE以及生成病历质量与连贯性的专家评估等指标,评估模型性能。
实验结果
研究问题
- RQ1在仅使用患者EHR历史和病历类型的情况下,语言模型在多大程度上能够预测临床病历内容?
- RQ2模型能否从真实EHR数据中学习并重现常见的临床病历模板和短语模式?
- RQ3与真实医生书写的病历相比,生成的病历在流畅性、连贯性和临床相关性方面表现如何?
- RQ4多模态EHR上下文(结构化与非结构化数据)在多大程度上提升了预测准确性?
- RQ5此类模型如何在实际中应用于支持临床医生的实时病历书写工具,如自动补全和拼写检查?
主要发现
- 模型在保留的临床病历上表现出较低的困惑度,表明其在利用EHR上下文预测病历内容方面具备强大的预测能力。
- 模型成功学习并重现了常见病历模板,例如以高概率生成“GCS 15, intubated, transferred to OSH”等短语。
- 对“was”和“GCS”等词的Top-5下一个词元预测显示,模型对临床相关术语具有高度置信度(例如,“was”预测概率为0.42,“GCS”为0.25)。
- 经定性分析和人工评估验证,模型生成的病历段落语义连贯且上下文恰当。
- 与单模态基线相比,使用多模态上下文(包括病历类型和早期词元)显著提升了生成质量。
- 结果表明,此类模型可作为实用EHR辅助工具(如实时自动补全和错误检测系统)的基础,从而减轻临床医生的文档工作负担。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。