Skip to main content
QUICK REVIEW

[论文解读] Exploring Bias in GAN-based Data Augmentation for Small Samples

Mengxiao Hu, Jinlong Li|arXiv (Cornell University)|May 21, 2019
Generative Adversarial Networks and Image Synthesis参考文献 36被引用 14
一句话总结

本文研究了小样本机器学习数据集中的生成对抗网络(GAN)数据增强偏差问题,提出了一套评估数据集是否适合进行 GAN 增强的流程。研究发现,更长的训练时间并不总能减少偏差,更大的增强数据集反而可能增加偏差,并建议通过迭代采样和 GAN 变体选择来缓解偏差。

ABSTRACT

For machine learning task, lacking sufficient samples mean the trained model has low confidence to approach the ground truth function. Until recently, after the generative adversarial networks (GAN) had been proposed, we see the hope of small samples data augmentation (DA) with realistic fake data, and many works validated the viability of GAN-based DA. Although most of the works pointed out higher accuracy can be achieved using GAN-based DA, some researchers stressed that the fake data generated from GAN has inherent bias, and in this paper, we explored when the bias is so low that it cannot hurt the performance, we set experiments to depict the bias in different GAN-based DA setting, and from the results, we design a pipeline to inspect specific dataset is efficiently-augmentable with GAN-based DA or not. And finally, depending on our trial to reduce the bias, we proposed some advice to mitigate bias in GAN-based DA application.

研究动机与目标

  • 调查小样本机器学习任务中 GAN 生成的合成数据的偏差存在及其影响。
  • 开发一种实用流程,以确定给定数据集是否可通过 GAN 方法高效地进行增强。
  • 识别在稀疏或高维数据中,由于偏差导致 GAN 增强失败的条件。
  • 为减少 GAN 增强工作流中的偏差,提供可操作的建议。

提出的方法

  • 提出一种基于代理任务分类准确率的偏差度量方法,以量化增强数据中的偏差。
  • 在合成数据集和真实世界数据集(如 SCADI、Amazon 评论、CIFAR-100)上进行实验,跟踪训练迭代次数和样本数量下的偏差变化。
  • 采用一次采样和混合采样策略,估算不同训练周期下的偏差趋势。
  • 设计了一套流程(图 13),基于样本数与特征数之比(RSF)和有信息量特征数与总特征数之比(RIF)来评估数据集的可增强性。
  • 探索多种 GAN 变体(如 softmax GAN、条件 GAN、边界搜索 GAN)在不同数据集上偏差传播的表现。
  • 应用迭代采样并结合动态停止条件:若新一次采样中的偏差增加,则重新估计最优训练周期。

实验结果

研究问题

  • RQ1GAN 生成数据中的偏差在训练过程中如何演变?更长的训练是否始终能减少偏差?
  • RQ2即使生成器看起来已收敛,增大增强数据集的规模是否仍会成比例地增加偏差?
  • RQ3数据集特征(如样本数与特征数之比、有信息量特征数)如何影响增强数据中的偏差?
  • RQ4在某些数据集中,特定 GAN 变体(如条件 GAN)是否相比其他变体能更有效地减少偏差传播?
  • RQ5在何种条件下,由于合成样本中固有的偏差,GAN 增强方法会失效?

主要发现

  • GAN 生成器的更长训练时间并不能保证减少偏差;在某些情况下,偏差在收敛后保持稳定甚至增加。
  • 更大的增强数据集可能表现出比小数据集更高的偏差,尤其是在生成器分布出现偏斜时(例如,图 3c 所示)。
  • 即使样本与特征比相似,有信息量特征占总特征比更高的数据集,在增强数据中表现出更低的偏差。
  • 某些 GAN 变体(如条件 GAN)在特定数据集(如 SCADI)上不会传播偏差,而其他变体则会,表明其行为具有变体特异性。
  • 所提出的基于 RSF 和 RIF 比值的流程可帮助预测数据集是否适合进行 GAN 增强。
  • 通过偏差监控进行的迭代采样可实现最优训练周期的动态选择,从而减少一次采样中的偏差。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。