Skip to main content
QUICK REVIEW

[论文解读] GAN-based Data Augmentation for Chest X-ray Classification

Shobhita Sundaram, Neha Hulkund|arXiv (Cornell University)|Jul 7, 2021
COVID-19 diagnosis using AI参考文献 22被引用 5
一句话总结

本文提出一种基于生成对抗网络(GAN)的数据增强方法,以解决使用CheXpert数据集进行胸部X光片分类时的类别不平衡问题。通过为低频病理生成合成图像,该方法提升了模型性能,尤其是在小样本设置下,减少了过拟合现象,并在曲线下面积(AUC)提升方面优于标准数据增强或无增强方法。

ABSTRACT

A common problem in computer vision -- particularly in medical applications -- is a lack of sufficiently diverse, large sets of training data. These datasets often suffer from severe class imbalance. As a result, networks often overfit and are unable to generalize to novel examples. Generative Adversarial Networks (GANs) offer a novel method of synthetic data augmentation. In this work, we evaluate the use of GAN- based data augmentation to artificially expand the CheXpert dataset of chest radiographs. We compare performance to traditional augmentation and find that GAN-based augmentation leads to higher downstream performance for underrepresented classes. Furthermore, we see that this result is pronounced in low data regimens. This suggests that GAN-based augmentation a promising area of research to improve network performance when data collection is prohibitively expensive.

研究动机与目标

  • 解决医学影像数据集中类别不平衡的挑战,特别是在小规模、多样化的训练集中的问题。
  • 探究基于GAN生成的合成数据是否能够提升深度学习模型在胸部X光片分类中对低频病理的性能表现。
  • 在不同数据配置下,比较基于GAN的增强方法与传统数据增强及无增强方法的有效性。
  • 评估基于GAN的增强方法是否在小样本设置下最具优势,因为在这些场景中过拟合和泛化能力差的问题最为严重。
  • 提供证据表明,来自GAN的合成数据可使临床应用中的模型更具鲁棒性和泛化能力。

提出的方法

  • 微调一个预训练的GAN,以生成特定低频病理的合成胸部X光片图像,包括肺部病变(Lung Lesion)、胸膜其他异常(Pleural Other)和骨折(Fracture)。
  • 将生成的GAN图像整合到训练集中,以平衡各类别分布,特别是针对患病率低于5%的病理。
  • 在CheXpert数据集的子集上训练DenseNet模型,分别使用1%、10%、50%和100%的数据量,采用GAN增强、标准增强和无增强的数据。
  • 通过将不确定标签(-1)映射为1,对不确定标签应用标签平滑处理,此方法已在先前研究中被验证可提升性能。
  • 将标准数据增强技术(如随机水平翻转)作为基线进行比较。
  • 使用AUC分数评估模型性能,并通过分析训练/验证损失曲线以及类别激活图(CAMs)来增强可解释性并评估过拟合现象。

实验结果

研究问题

  • RQ1与标准增强和无增强相比,基于GAN的数据增强是否能提升CheXpert数据集中低频病理的分类性能?
  • RQ2在不同数据配置下,GAN增强的有效性如何变化,特别是在小样本设置下?
  • RQ3在小规模、类别不平衡的数据集中,GAN增强在多大程度上减少了过拟合?
  • RQ4通过类别激活图(CAMs)判断,GAN增强模型所学习到的特征是否具有可解释性且与真实数据一致?
  • RQ5标准数据增强是否会导致大规模数据集中的性能下降?如果是,原因是什么?

主要发现

  • 在1%数据设置下,与无增强相比,基于GAN的增强使肺部病变(Lung Lesion)的AUC提升了0.08,胸膜其他异常(Pleural Other)提升了0.06,骨折(Fracture)提升了0.07。
  • 在10%数据设置下,GAN增强在所有三种低频病理上的AUC均得到提升,且增益超过标准增强方法。
  • 在1%设置下,过拟合现象显著减少:GAN增强模型的训练损失与验证损失之差为0.03,而无增强模型的差值为0.06。
  • 在100%数据设置下,标准增强在所有病理上的性能均劣于无增强设置,可能由于翻转操作导致的结构不变性问题。
  • 类别激活图(CAMs)显示,真实图像与GAN生成图像的激活模式相似,表明模型学习到了一致且局部化的特征,未对合成数据产生过拟合。
  • 即使在大规模数据设置下,GAN增强仍为最不平衡的类别——胸膜其他异常(Pleural Other)带来了0.006的AUC增益,表明其在高度偏态分布中仍具持续价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。