Skip to main content
QUICK REVIEW

[论文解读] Multi-Label Clinical Time-Series Generation via Conditional GAN

Chang Lü, Chandan K. Reddy|arXiv (Cornell University)|Apr 10, 2022
Machine Learning in Healthcare被引用 5
一句话总结

该论文提出 MTGAN,一种用于生成多标签临床时间序列数据的条件生成对抗网络(GAN)框架,能够保留时间相关性并提升罕见疾病的生成质量。通过使用带有平滑条件矩阵的门控循环单元(GRU)以及带有时间特征正则化的Wasserstein判别器,MTGAN 在生成真实 EHR 序列方面优于当前最先进的 GAN 模型,尤其在罕见疾病方面表现更优,这一结果通过下游预测任务和统计指标得到验证。

ABSTRACT

In recent years, deep learning has been successfully adopted in a wide range of applications related to electronic health records (EHRs) such as representation learning and clinical event prediction. However, due to privacy constraints, limited access to EHR becomes a bottleneck for deep learning research. To mitigate these concerns, generative adversarial networks (GANs) have been successfully used for generating EHR data. However, there are still challenges in high-quality EHR generation, including generating time-series EHR data and imbalanced uncommon diseases. In this work, we propose a Multi-label Time-series GAN (MTGAN) to generate EHR and simultaneously improve the quality of uncommon disease generation. The generator of MTGAN uses a gated recurrent unit (GRU) with a smooth conditional matrix to generate sequences and uncommon diseases. The critic gives scores using Wasserstein distance to recognize real samples from synthetic samples by considering both data and temporal features. We also propose a training strategy to calculate temporal features for real data and stabilize GAN training. Furthermore, we design multiple statistical metrics and prediction tasks to evaluate the generated data. Experimental results demonstrate the quality of the synthetic data and the effectiveness of MTGAN in generating realistic sequential EHR data, especially for uncommon diseases.

研究动机与目标

  • 解决由于隐私和数据稀缺性限制,生成具有时间一致性的多标签 EHR 序列的挑战。
  • 改善在类别不平衡的 EHR 数据集中罕见疾病生成质量,这些疾病在合成数据中常被欠采样。
  • 为稀疏的就诊级别 EHR 数据设计稳定的 GAN 训练策略,以保持时间相关性。
  • 设计全面的评估指标,超越分布差异度量,以评估合成数据质量,尤其针对罕见疾病。
  • 证明合成 EHR 数据在提升下游临床预测模型性能方面的实用性,尤其在罕见疾病方面。

提出的方法

  • 提出一种多标签时间序列 GAN(MTGAN),通过建模就诊之间的时序依赖关系,生成患者级别的 EHR 序列。
  • 在生成器中使用门控循环单元(GRU)并结合平滑条件矩阵,以多标签诊断为条件,改善罕见疾病的采样。
  • 实现带有梯度惩罚的Wasserstein判别器(WGAN-GP),同时评估数据特征和时间特征,以区分真实与合成样本。
  • 引入一种时间特征学习策略,将就诊级别的时序相关性计算并融入判别器中,以提升训练稳定性。
  • 采用两阶段训练流程:先用真实数据预训练生成器,然后联合训练生成器与判别器,使用条件噪声和疾病标签。
  • 使用编码多标签诊断向量的条件矩阵,引导生成器生成多样化且逼真的就诊序列。

实验结果

研究问题

  • RQ1MTGAN 是否能够生成保留就诊间时间相关性的多标签临床时间序列数据,而不同于现有的就诊级别 GAN?
  • RQ2与当前最先进的 GAN 相比,MTGAN 在类别不平衡的 EHR 数据集中对罕见疾病生成质量的提升程度如何?
  • RQ3MTGAN 生成的合成数据在提升下游临床预测模型性能方面有多有效,尤其在罕见疾病方面?
  • RQ4在稀疏 EHR 数据上,判别器中引入时间特征正则化是否能带来更稳定的 GAN 训练?
  • RQ5统计指标与下游预测任务是否能够联合验证合成 EHR 数据质量,超越传统的分布差异度量?

主要发现

  • MTGAN 在生成具有更好统计特性的 EHR 序列方面优于 WGAN-GP、TimeGAN、T-CGAN 等 GAN 模型,尤其在罕见疾病表征方面表现更优。
  • 在下游诊断预测任务中,MTGAN 生成的数据在 F1 分数和 AUC 上均带来最大提升,尤其在帕金森病和结核病等罕见疾病上。
  • 当在合成数据上预训练预测模型(Dipole 和 GRAM)时,MTGAN 在所有任务中均持续实现更高的性能增益,尤其在帕金森病预测中提升最为显著。
  • 增加合成数据比例(从 0.5 倍真实数据增至 2 倍)可提升下游模型性能,且 MTGAN 展现出最一致且显著的增益,表明其合成数据更具信息量。
  • 判别器中提出的时序特征正则化显著提升了训练稳定性,并增强了对真实与合成样本的判别能力。
  • 生成器中的平滑条件矩阵显著提升了多标签疾病生成的多样性与真实性,尤其在低频疾病上。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。