[论文解读] Synthetic Health-related Longitudinal Data with Mixed-type Variables Generated using Diffusion Models
本文提出了一种新颖的扩散概率模型(DPM),用于生成具有混合类型变量(数值型、二值型和分类变量)的逼真、隐私保护型纵向电子健康记录(EHR)合成数据,其在生成急性低血压和HIV抗逆转录病毒治疗数据方面优于基于GAN的方法。DPM模拟的数据在统计特性上与真实世界数据高度一致,且使强化学习智能体学习到的策略几乎与在真实数据上训练的策略相同,这是首次将DPM用于此目的。
This paper presents a novel approach to simulating electronic health records (EHRs) using diffusion probabilistic models (DPMs). Specifically, we demonstrate the effectiveness of DPMs in synthesising longitudinal EHRs that capture mixed-type variables, including numeric, binary, and categorical variables. To our knowledge, this represents the first use of DPMs for this purpose. We compared our DPM-simulated datasets to previous state-of-the-art results based on generative adversarial networks (GANs) for two clinical applications: acute hypotension and human immunodeficiency virus (ART for HIV). Given the lack of similar previous studies in DPMs, a core component of our work involves exploring the advantages and caveats of employing DPMs across a wide range of aspects. In addition to assessing the realism of the synthetic datasets, we also trained reinforcement learning (RL) agents on the synthetic data to evaluate their utility for supporting the development of downstream machine learning models. Finally, we estimated that our DPM-simulated datasets are secure and posed a low patient exposure risk for public access.
研究动机与目标
- 开发一种能够合成逼真、隐私保护型纵向EHR数据的生成模型,支持混合类型变量(数值型、二值型、分类变量)。
- 评估扩散概率模型(DPM)在生成时间序列临床数据方面的性能,其中GAN在稳定性与模式崩溃方面存在局限。
- 将DPM生成的合成数据与最先进的基于GAN的合成数据进行比较,评估其在临床决策中训练强化学习(RL)智能体的实用性。
- 评估合成数据集的统计逼真度与患者信息泄露风险,以评估其公开发布的可行性。
提出的方法
- 设计了一种条件扩散概率模型(DPM),通过学习逐渐向时间序列数据添加噪声的前向扩散过程,以处理序列EHR数据中的混合类型变量。
- 通过使用带有时间嵌入条件和分类变量嵌入层的U-Net架构,训练反向去噪过程,以从噪声中重建出干净且逼真的EHR序列。
- 在MIMIC-III(急性低血压)和EuResist(HIV抗逆转录病毒治疗)的真实纵向EHR数据上训练模型,对不同变量类型进行特定的预处理与归一化,以应对混合数据类型。
- 采用条件得分驱动的训练目标,引导去噪过程,使模型能够随时间生成多样化且逼真的患者轨迹。
- 通过K-S检验、t检验、F检验、相关性对齐以及强化学习策略模仿等方法,评估合成数据的逼真度与实用性。
- 通过再识别指标估算患者信息泄露风险,确认数据在公开发布时具有较低暴露风险。
实验结果
研究问题
- RQ1扩散概率模型能否有效生成具有混合类型变量(包括数值型、二值型和分类变量)的合成纵向EHR数据,同时保持时间依赖性?
- RQ2与最先进的基于GAN的合成数据相比,DPM生成的合成EHR数据在统计特性与相关性结构方面的逼真度如何?
- RQ3在DPM生成的合成数据上训练的强化学习智能体,能在多大程度上学习到与在真实临床数据上训练的策略几乎相同的策略?
- RQ4与GAN相比,使用DPM在合成EHR生成方面具有哪些主要优势与局限,特别是在模式崩溃与数据多样性方面?
- RQ5合成数据集的患者信息泄露风险如何?是否可安全地公开发布?
主要发现
- 与基于GAN的合成数据相比,DPM生成的急性低血压和HIV抗逆转录病毒治疗的合成数据在统计逼真度方面表现更优,其相关性结构与多模态分布的对齐更佳。
- 在DPM模拟数据上训练的强化学习智能体所学习到的策略几乎无法与在真实数据上训练的策略区分,其策略相似性与动作推荐准确性均优于在GAN生成数据上训练的智能体。
- 对于具有极长尾分布的数值型变量(如败血症中的情况),DPM难以保留分布特性,导致K-S检验、t检验与F检验均不通过,表明其在捕捉极端值分布方面存在局限。
- 估算显示,合成数据集的患者信息泄露风险较低,支持其通过PhysioNet和FigShare安全公开发布,隐私保护信心充足。
- 已将DPM模拟的急性低血压数据集(3,910名患者,187,680条记录)和HIV数据集(8,916名患者,534,960条记录)作为公开、高保真度基准数据集发布,供未来研究使用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。