Skip to main content
QUICK REVIEW

[论文解读] Efficient Augmentation via Data Subsampling

Michael Kuchnik, Virginia Smith|arXiv (Cornell University)|Oct 11, 2018
Machine Learning and Data Classification被引用 10
一句话总结

本文提出通过战略性地子采样训练数据来实现高效的数据增强,利用影响度和损失度指标选择高影响力的样本进行增强。在CIFAR10和MNIST数据集上,该方法将增强数据量减少90%,同时保持了完整增强设置下99.86%的准确率,显著降低了训练成本,且未牺牲模型性能。

ABSTRACT

Data augmentation is commonly used to encode invariances in learning methods. However, this process is often performed in an inefficient manner, as artificial examples are created by applying a number of transformations to all points in the training set. The resulting explosion of the dataset size can be an issue in terms of storage and training costs, as well as in selecting and tuning the optimal set of transformations to apply. In this work, we demonstrate that it is possible to significantly reduce the number of data points included in data augmentation while realizing the same accuracy and invariance benefits of augmenting the entire dataset. We propose a novel set of subsampling policies, based on model influence and loss, that can achieve a 90% reduction in augmentation set size while maintaining the accuracy gains of standard data augmentation.

研究动机与目标

  • 解决深度学习中完整数据增强带来的高计算与存储成本问题。
  • 识别出一个较小的训练样本子集,当对这些样本进行增强时,其性能可与对整个数据集进行增强相媲美。
  • 开发可泛化的、与模型无关的子采样策略,不依赖支持向量或特定模型的假设。
  • 通过减少对变换集的启发式调参需求,提升数据增强的效率与可用性。
  • 评估影响度、损失度和多样性驱动的选择策略在最小化增强集大小方面的有效性。

提出的方法

  • 提出一种基于损失的子采样策略,优先选择训练损失较高的样本进行增强。
  • 引入一种基于影响度的策略,利用影响函数识别对模型预测影响最大的样本。
  • 在k-DPP核中结合影响度与基于特征的多样性(瓶颈特征),以平衡选择结果的质量与多样性。
  • 采用样本重加权和在线学习方法,进一步提升所选增强子集的性能。
  • 使用公开可用的DPP子采样实现,通过归一化和缩放处理以解决数值不稳定性问题。
  • 在受控训练环境下,于多个数据集(MNIST、CIFAR10、NORB)和模型(ResNet、Xception、SVM)上评估所提方法。

实验结果

研究问题

  • RQ1是否可以通过大幅减少需增强的样本数量,实现与完整数据增强相当的性能?
  • RQ2影响度和损失度指标在选择增强候选样本时,相较于随机采样或启发式方法表现如何?
  • RQ3通过DPP实现的多样性感知选择,在与影响度或损失度结合时,能在多大程度上提升性能?
  • RQ4基于子采样的增强方法是否保持了训练时间与数据集大小的线性缩放关系?
  • RQ5基于影响度的策略是否能在SVM之外的不同模型和数据模态上实现泛化?

主要发现

  • 所提出的基于影响度和损失度的子采样策略,在将增强数据集规模减少90%的同时,准确率仍达到完整增强设置的99.86%或以上。
  • 在CIFAR10数据集上使用平移增强时,仅需增强10%的数据即可达到完整增强的准确率。
  • 在所有评估的数据集和模型上,基于影响度的采样策略均优于随机采样和简单基线方法。
  • 影响度加权的DPP方法在性能上与纯影响度驱动的选择相当,证明了质量与多样性结合的价值。
  • 训练时间与数据集大小呈线性关系,证实子采样可带来成比例的训练成本降低。
  • 该方法在ResNet和Xception模型上依然有效,表明其适用范围不仅限于SVM。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。