[论文解读] PromptEHR: Conditional Electronic Healthcare Records Generation with Prompt Learning
PromptEHR 提出了一种基于提示学习的条件性、文本到文本的生成框架,利用人口统计学和临床特征作为控制信号,生成逼真且多模态的纵向电子健康记录(EHR)。该方法在基线模型基础上,实现了53.1%的纵向补全困惑度降低和45.3%的跨模态困惑度降低,达到当前最优性能,同时在抵御成员身份推断攻击和属性推断攻击方面表现出优异的隐私保护能力。
Accessing longitudinal multimodal Electronic Healthcare Records (EHRs) is challenging due to privacy concerns, which hinders the use of ML for healthcare applications. Synthetic EHRs generation bypasses the need to share sensitive real patient records. However, existing methods generate single-modal EHRs by unconditional generation or by longitudinal inference, which falls short of low flexibility and makes unrealistic EHRs. In this work, we propose to formulate EHRs generation as a text-to-text translation task by language models (LMs), which suffices to highly flexible event imputation during generation. We also design prompt learning to control the generation conditioned by numerical and categorical demographic features. We evaluate synthetic EHRs quality by two perplexity measures accounting for their longitudinal pattern (longitudinal imputation perplexity, lpl) and the connections cross modalities (cross-modality imputation perplexity, mpl). Moreover, we utilize two adversaries: membership and attribute inference attacks for privacy-preserving evaluation. Experiments on MIMIC-III data demonstrate the superiority of our methods on realistic EHRs generation (53.1\% decrease of lpl and 45.3\% decrease of mpl on average compared to the best baselines) with low privacy risks. Software is available at https://github.com/RyanWangZf/PromptEHR.
研究动机与目标
- 为解决医疗机器学习研究中因隐私风险和数据访问限制导致的真实EHR难以共享的问题。
- 生成高保真度、多模态的纵向EHR,以反映诊断、药物、操作与患者人口统计学之间复杂的时序关系和跨模态关联。
- 通过结合患者人口统计学特征和既往临床事件,实现灵活的条件化EHR生成,以提升个性化程度和实用性。
- 不仅从生成质量角度评估合成EHR,还通过成员身份推断攻击和属性推断攻击评估其隐私风险。
- 证明合成EHR可有效增强真实数据,在下游机器学习任务中甚至可超越仅使用有限真实数据训练的模型表现。
提出的方法
- 将EHR生成建模为基于预训练语言模型(如T5、BART)的文本到文本翻译任务,将每次就诊视为带有特殊标记的事件标记序列。
- 通过特殊标记(如<v>、</v>表示就诊;<dx>、</dx>表示诊断)将纵向EHR转换为标记化序列,以保持时序和结构顺序。
- 设计一种提示学习机制,将人口统计学特征(如年龄、性别等)通过专用特征提取器嵌入,并注入输入标记嵌入中,以实现生成条件控制。
- 使用因果语言建模损失进行训练,以支持自回归、顺序生成事件,同时保留对先前就诊和条件提示的上下文记忆。
- 将提示微调与冻结的预训练语言模型结合,实现在保持模型泛化能力的前提下高效微调。
- 采用两阶段评估流程:(1) 基于困惑度的指标(纵向补全困惑度和跨模态补全困惑度)用于评估生成质量;(2) 通过成员身份推断攻击和属性推断攻击评估隐私安全性。
实验结果
研究问题
- RQ1基于语言模型的方法能否生成保留临床事件之间复杂时序与跨模态依赖关系的逼真、多模态纵向EHR?
- RQ2提示学习在基于患者人口统计学和既往临床事件实现灵活、条件化EHR生成方面效果如何?
- RQ3PromptEHR生成的合成EHR在下游机器学习任务中与真实EHR的质量匹配程度如何?
- RQ4合成EHR对成员身份推断和属性推断攻击的鲁棒性如何,反映出其隐私保护潜力?
- RQ5在数据量有限的情况下,合成EHR能否有效增强真实数据,甚至在性能上超越仅使用有限真实数据训练的模型?
主要发现
- 与最佳基线相比,PromptEHR在纵向补全困惑度(lpl)上平均降低53.1%,表明其在建模时序事件序列方面具有更优能力。
- PromptEHR在跨模态补全困惑度(mpl)上平均降低45.3%,证明其能更准确地捕捉诊断与实验室检查等不同EHR模态之间的关系。
- 当与真实数据结合时,PromptEHR生成的合成EHR在下游LSTM分类任务中表现与真实EHR相当甚至更优,50k份合成记录加30k份真实记录的组合优于仅使用全部40k份真实记录训练的模型。
- 该模型对成员身份推断攻击和属性推断攻击均表现出鲁棒性,表明隐私风险较低,尽管理论保障仍为开放研究方向。
- 在低资源场景下,PromptEHR仅使用5k份真实记录进行训练,仍优于基线LSTM+MLP模型,展现出强大的泛化能力,适用于低资源环境。
- PromptEHR独特支持通过补全方式实现条件化生成(如在诊断和实验室检查后生成缺失的操作),通过灵活提示实现多样化且逼真的EHR合成。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。