Skip to main content
QUICK REVIEW

[论文解读] Adversarial Training for Disease Prediction from Electronic Health Records with Missing Data

Uiwon Hwang, Sung‐Woon Choi|arXiv (Cornell University)|Nov 11, 2017
Machine Learning in Healthcare参考文献 40被引用 15
一句话总结

本文提出了一种两阶段框架,用于从存在缺失数据的电子健康记录(EHRs)中进行疾病预测,采用堆叠自编码器进行缺失值填补,并利用辅助分类器生成对抗网络(AC-GAN)进行疾病分类。该方法在准确率97.77%、AUC-ROC 98.89%和F-score 96.88%方面达到当前最优性能,相较于传统方法,展现出对缺失数据和类别不平衡的更强鲁棒性。

ABSTRACT

Electronic health records (EHRs) have contributed to the computerization of patient records and can thus be used not only for efficient and systematic medical services, but also for research on biomedical data science. However, there are many missing values in EHRs when provided in matrix form, which is an important issue in many biomedical EHR applications. In this paper, we propose a two-stage framework that includes missing data imputation and disease prediction to address the missing data problem in EHRs. We compared the disease prediction performance of generative adversarial networks (GANs) and conventional learning algorithms in combination with missing data prediction methods. As a result, we obtained a level of accuracy of 0.9777, sensitivity of 0.9521, specificity of 0.9925, area under the receiver operating characteristic curve (AUC-ROC) of 0.9889, and F-score of 0.9688 with a stacked autoencoder as the missing data prediction method and an auxiliary classifier GAN (AC-GAN) as the disease prediction method. The comparison results show that a combination of a stacked autoencoder and an AC-GAN significantly outperforms other existing approaches. Our results suggest that the proposed framework is more robust for disease prediction from EHRs with missing data.

研究动机与目标

  • 为解决电子健康记录(EHRs)中缺失数据的挑战,该挑战在真实临床环境中阻碍了准确的疾病预测。
  • 开发一种鲁棒的疾病预测框架,能够同时处理缺失数据和类别不平衡,且不依赖于过采样技术。
  • 评估生成对抗网络(GANs),特别是AC-GANs,在与基于深度学习的填补方法结合时,在疾病预测中的表现。
  • 将所提出的框架与传统填补和分类方法(包括均值填补和多层感知机)进行比较。
  • 探究对抗训练是否能增强在稀疏且类别不平衡的EHRs中的疾病预测性能。

提出的方法

  • 提出一种两阶段框架:首先,使用堆叠自编码器(一种深度无监督学习模型)对EHR中的缺失值进行填补,该模型学习数据的低维表示。
  • 将填补后的EHR数据用作输入,训练辅助分类器生成对抗网络(AC-GAN),该网络联合学习生成逼真的EHR样本并分类疾病状态。
  • AC-GAN的判别器被训练以区分真实与生成的EHR样本,同时预测正确的疾病类别,从而实现具有类别监督的端到端对抗训练。
  • 堆叠自编码器在缺失率高于阈值(例如0.1)的EHR数据上进行训练,使用重建损失最小化输入与重建数据之间的差异。
  • 通过验证数据进行模型选择,基于最小验证误差确定最优训练轮数。
  • 该框架通过生成器合成逼真少数类样本的能力,避免了过采样技术,从而在不增加内存开销的情况下缓解了类别不平衡问题。

实验结果

研究问题

  • RQ1堆叠自编码器能否在高稀疏性的EHR中有效填补缺失值,且优于均值或零值填补等简单填补方法?
  • RQ2将AC-GAN的对抗训练与基于深度学习的填补方法结合,是否能提升疾病预测性能,优于传统模型如多层感知机?
  • RQ3在同时处理缺失数据和类别不平衡的EHR中,该框架在准确率、敏感性、特异性、AUC-ROC和F-score方面的表现如何?
  • RQ4GAN的生成器能否生成与真实数据几乎无法区分的EHR样本,经t-SNE可视化验证?
  • RQ5对抗训练是否能隐式平衡类别分布,而无需显式过采样,从而降低内存和计算成本?

主要发现

  • 堆叠自编码器用于填补、AC-GAN用于分类的组合实现了最高性能,准确率达到97.77%。
  • 模型达到95.21%的敏感性、99.25%的特异性,以及98.89%的AUC-ROC分数,表明其具有强大的判别能力。
  • F-score达到96.88%,表明在正负疾病类别之间,精确率与召回率均保持良好平衡。
  • t-SNE可视化证实,生成的EHR样本与真实样本几乎无法区分,表明数据合成质量极高。
  • AC-GAN在相同架构下优于标准多层感知机,表明对抗训练显著提升了预测性能。
  • 该框架在不使用过采样技术的情况下表现出对类别不平衡的鲁棒性,避免了内存和训练时间的增加。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。