Skip to main content
QUICK REVIEW

[论文解读] Selective Synthetic Augmentation with Quality Assurance

Yuan Xue, Jiarong Ye|arXiv (Cornell University)|Dec 9, 2019
AI in cancer detection参考文献 34被引用 4
一句话总结

本文提出了一种选择性合成增强框架,通过在将图像添加到训练数据之前筛选出高质量、经过置信度验证的条件生成对抗网络(cGAN)生成图像,从而提升医学图像和自然图像分类的性能。该方法结合蒙特卡洛丢弃法进行标签置信度估计,以及与真实数据中心点的特征空间距离,确保仅使用高质量的合成样本,分别在组织病理学、CIFAR10和SVHN数据集上实现了6.8%、3.9%和1.6%的准确率提升。

ABSTRACT

Supervised training of an automated medical image analysis system often requires a large amount of expert annotations that are hard to collect. Moreover, the proportions of data available across different classes may be highly imbalanced for rare diseases. To mitigate these issues, we investigate a novel data augmentation pipeline that selectively adds new synthetic images generated by conditional Adversarial Networks (cGANs), rather than extending directly the training set with synthetic images. The selection mechanisms that we introduce to the synthetic augmentation pipeline are motivated by the observation that, although cGAN-generated images can be visually appealing, they are not guaranteed to contain essential features for classification performance improvement. By selecting synthetic images based on the confidence of their assigned labels and their feature similarity to real labeled images, our framework provides quality assurance to synthetic augmentation by ensuring that adding the selected synthetic images to the training set will improve performance. We evaluate our model on a medical histopathology dataset, and two natural image classification benchmarks, CIFAR10 and SVHN. Results on these datasets show significant and consistent improvements in classification performance (with 6.8%, 3.9%, 1.6% higher accuracy, respectively) by leveraging cGAN generated images with selective augmentation.

研究动机与目标

  • 解决医学图像数据集规模有限且类别不平衡的问题,通过引入高质量合成数据实现稳健的模型训练。
  • 克服在训练集中盲目添加视觉逼真但质量低下的合成图像导致性能下降的风险。
  • 开发一种经过质量验证的合成增强流水线,仅选择高置信度、具有代表性的合成样本。
  • 在医学和自然图像分类任务中验证该方法的有效性与泛化能力。

提出的方法

  • 训练一个条件生成对抗网络(cGAN),以生成高保真度的合成组织病理学切片,模型选择基于平滑的弗雷歇 inception 距离(FID)分数。
  • 使用预训练的ResNet34网络结合蒙特卡洛丢弃法,从真实训练数据中提取特征,并计算类别特定的中心点。
  • 基于多次前向传播的预测熵(蒙特卡洛采样)对合成图像进行过滤,仅保留熵值较低(标签置信度高)的样本。
  • 进一步根据合成图像在特征空间中与真实数据类别中心点的L2距离进行过滤,仅保留最接近真实类别分布的样本。
  • 最终的合成样本选择由增强比例 $ r $ 决定,确保训练集得到受控的、以质量为导向的扩展。
  • 该框架在宫颈组织病理学数据集和标准基准(CIFAR10、SVHN)上进行评估,采用ResNet34作为主干分类器以保证公平比较。

实验结果

研究问题

  • RQ1使用cGAN生成的图像进行选择性合成增强,能否提升小样本、类别不平衡的医学图像数据集上的分类性能?
  • RQ2基于标签置信度和与真实数据中心点的特征相似性对合成图像进行过滤,是否能带来比简单增强更好的模型泛化性能?
  • RQ3与传统数据增强和非选择性合成增强相比,所提出方法在准确率和鲁棒性方面表现如何?
  • RQ4为最大化性能增益且避免引入噪声或误导性样本,最优的增强比例 $ r $ 是多少?
  • RQ5所提出的这种选择性增强流水线是否具有跨多样化图像领域(包括医学和自然图像)的泛化能力?

主要发现

  • 在宫颈组织病理学数据集上,所提方法相比基线模型(无任何增强)实现了6.8%的绝对准确率提升。
  • 在仅使用10%训练数据的CIFAR10数据集中,选择性增强方法相比基线模型准确率提升了3.9个百分点。
  • 在SVHN数据集上,该方法比非选择性GAN增强高出1.6%,表明在不同数据集上均表现出一致的性能增益。
  • 使用非选择性GAN增强训练的模型性能甚至低于基线,证实了盲目使用合成数据会损害模型性能。
  • 消融实验表明,当增强比例 $ r $ 超过0.5时性能开始下降,凸显了选择性过滤的重要性。
  • 利用蒙特卡洛丢弃法进行不确定性估计,以及通过特征空间距离实现分布对齐,被证明是合成数据集成中质量保障的关键因素。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。