Skip to main content
QUICK REVIEW

[论文解读] Generating Synthetic Clinical Data that Capture Class Imbalanced Distributions with Generative Adversarial Networks: Example using Antiretroviral Therapy for HIV

Nicholas I-Hsien Kuo, Garcia, Federico|arXiv (Cornell University)|Aug 18, 2022
Generative Adversarial Networks and Image Synthesis被引用 6
一句话总结

本文提出了一种结合 GAN-VAE 与记忆缓冲区的混合框架,用于生成保留类别不平衡分布的合成临床时间序列数据,尤其针对人类免疫缺陷病毒抗逆转录病毒治疗(HIV ART)数据中的少数患者群体。通过潜在特征重放与变分编码缓解模式崩溃,该方法生成的合成数据具有高保真度、多样性以及较低的再识别风险,显著提升了下游机器学习任务的实用性,特别是在公平性敏感的应用中。

ABSTRACT

Clinical data usually cannot be freely distributed due to their highly confidential nature and this hampers the development of machine learning in the healthcare domain. One way to mitigate this problem is by generating realistic synthetic datasets using generative adversarial networks (GANs). However, GANs are known to suffer from mode collapse thus creating outputs of low diversity. This lowers the quality of the synthetic healthcare data, and may cause it to omit patients of minority demographics or neglect less common clinical practices. In this paper, we extend the classic GAN setup with an additional variational autoencoder (VAE) and include an external memory to replay latent features observed from the real samples to the GAN generator. Using antiretroviral therapy for human immunodeficiency virus (ART for HIV) as a case study, we show that our extended setup overcomes mode collapse and generates a synthetic dataset that accurately describes severely imbalanced class distributions commonly found in real-world clinical variables. In addition, we demonstrate that our synthetic dataset is associated with a very low patient disclosure risk, and that it retains a high level of utility from the ground truth dataset to support the development of downstream machine learning algorithms.

研究动机与目标

  • 解决基于 GAN 的合成临床数据生成中模式崩溃的问题,该问题会损害少数患者群体代表性中的多样性与公平性。
  • 开发一种方法,以保留现实世界临床变量的复杂不平衡分布,特别是在 HIV 抗逆转录病毒治疗等时间序列数据中。
  • 生成与真实数据高度相似且能充分代表代表性不足的少数群体的合成数据,确保伦理与公平的机器学习应用。
  • 通过最小化再识别风险来保障患者隐私,同时保持数据在训练下游模型(如强化学习智能体)方面的实用性。
  • 为研究提供公开可访问的高质量合成数据集,支持医疗领域可复现且合乎伦理的 AI 研究。

提出的方法

  • 该方法在 WGAN-GP 的基础上扩展了变分自编码器(VAE),以学习真实临床数据的解耦且结构化的潜在表征。
  • 记忆缓冲区存储并重放训练数据中的真实潜在特征至生成器,通过强化未充分代表的模式来防止模式崩溃。
  • 生成器同时依赖于随机噪声与缓冲区中的真实潜在特征进行条件生成,从而提升多样性与分布准确性。
  • 框架采用带有梯度惩罚(G_EOT)的 WGAN-GP 损失,以稳定训练并改善模式覆盖。
  • 模型在 EuResist HIV ART 数据集上进行训练,该数据集包含 8,916 名患者,涵盖 13 种 ART 变量的 60 个月纵向记录。
  • 最终的合成数据集以 44.7 MB 的 CSV 文件形式发布,共 534,960 行,公开获取地址为 https://healthgym.ai/。

实验结果

研究问题

  • RQ1基于 GAN 的框架结合 VAE 与记忆重放,能否有效缓解不平衡临床时间序列数据合成中的模式崩溃问题?
  • RQ2所提出的方法在多大程度上保留了现实世界临床变量的分布特性,特别是在少数群体中?
  • RQ3该合成数据在支持下游机器学习任务(如训练用于治疗优化的强化学习智能体)方面的表现如何?
  • RQ4与真实数据相比,该合成数据的再识别风险如何?是否保持了足够的隐私保护?
  • RQ5记忆缓冲区的引入是否显著提升了合成数据集中队列的多样性与代表性不足人群的体现?

主要发现

  • 所提出的 WGAN-GP+G_EOT+VAE+Buffer 模型成功缓解了模式崩溃,生成的合成数据在队列多样性方面显著优于基线 GAN 模型。
  • 合成数据集准确捕捉了临床变量的不平衡分布,包括低频药物使用模式和少数群体的代表性(如非洲裔与亚洲裔患者)。
  • 在合成数据集($\mathfrak{D}_{\text{alt}}$)上训练的强化学习智能体生成的治疗策略与在真实数据集($\mathfrak{D}_{\text{real}}$)上训练的策略几乎完全一致,尤其在少数群体中表现优异。
  • 相比之下,在基线合成数据集($\mathfrak{D}_{\text{null}}$)上训练的智能体(来自 Kuo 等人,2022 年),因存在模式崩溃,其对少数群体的治疗建议出现了显著偏差。
  • 合成数据集实现了高度相似性与代表性,未发现任何患者再识别的证据,并已公开发布于 https://healthgym.ai/ 供研究使用。
  • 与现有基于 GAN 的基线方法相比,该方法在保留纵向 HIV ART 数据中变量相关性与时间动态方面表现出更优性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。