[论文解读] KeepAugment: A Simple Information-Preserving Data Augmentation Approach
KeepAugment 提出了一种简单但高效的数据增强方法,通过利用显著性图来保留图像中显著且信息丰富的区域。通过避免对高重要性区域进行切割或重新粘贴,该方法在不增加计算成本的前提下提升了增强样本的保真度,进而在多个基准测试中实现了图像分类、目标检测和多摄像头跟踪任务的最先进性能。
Data augmentation (DA) is an essential technique for training state-of-the-art deep learning systems. In this paper, we empirically show data augmentation might introduce noisy augmented examples and consequently hurt the performance on unaugmented data during inference. To alleviate this issue, we propose a simple yet highly effective approach, dubbed \emph{KeepAugment}, to increase augmented images fidelity. The idea is first to use the saliency map to detect important regions on the original images and then preserve these informative regions during augmentation. This information-preserving strategy allows us to generate more faithful training examples. Empirically, we demonstrate our method significantly improves on a number of prior art data augmentation schemes, e.g. AutoAugment, Cutout, random erasing, achieving promising results on image classification, semi-supervised image classification, multi-view multi-camera tracking and object detection.
研究动机与目标
- 解决现有数据增强技术可能因引入噪声或模糊样本而降低模型性能的问题。
- 通过利用显著性图识别出的语义重要区域,提升增强训练样本的保真度。
- 开发一种通用、轻量级的方法,无需额外监督或复杂训练,即可同时增强区域级和图像级数据。
- 在多种视觉任务中展示一致的性能提升,包括图像分类、半监督学习、多视角跟踪和目标检测。
提出的方法
- 该方法使用显著性图识别输入图像中的高重要性区域,显著性图通过基于梯度的归因方法(如显著性图)计算。
- 在区域级增强(如 Cutout)中,KeepAugment 避免对显著性分数高的区域进行切割或掩码,以保留关键特征。
- 在图像级增强(如 RandAugment、AutoAugment)中,采用“重新粘贴”策略,将原始图像中的高重要性区域重新插入到增强后的图像中。
- 该方法被实现为一个即插即用的模块,可直接应用于现有数据增强流程,无需修改主干网络。
- 显著性图在训练过程中每张图像仅计算一次,且根据重要性图动态调整每一样本的增强策略。
- 该方法兼容标签不变和标签混合型增强技术,并在 CutMix 等方法上进行了实证验证。
实验结果
研究问题
- RQ1在数据增强过程中保留显著图像区域是否能提升模型泛化能力并减少训练中的噪声?
- RQ2增强样本的保真度如何影响图像分类和目标检测任务的下游性能?
- RQ3一种基于显著性图的简单无监督方法是否能超越 AutoAugment 和 CutMix 等强基线方法?
- RQ4所提出的方法是否能在不同类型的数据增强和学习范式(包括半监督学习和多视角跟踪)中实现泛化?
主要发现
- 当应用于 AutoAugment 之上时,KeepAugment 在 CIFAR-10 上实现了 98.7% 的测试准确率,使用 PyramidNet-ShakeDrop 模型,显著优于基线模型。
- 在 COCO 2017 目标检测基准上,该方法将 RetinaNet(ResNet-50)的 mAP 从 37.9 提升至 39.1,将 ResNet-101 的 mAP 从 39.9 提升至 41.2,甚至超过了 Detectron2 的基线性能。
- 在 Market1501 上的多视角多摄像头跟踪任务中,KeepAugment 改进了近期最先进的结果。
- 该方法在半监督学习中也提升了性能,使 ImageNet 预训练模型能更有效地迁移到 COCO 检测任务。
- 使用 KeepCutMix 预训练的模型优于使用 CutMix 训练的模型,且在某些设置下,CutMix 甚至表现不如 Detectron2 的基线。
- 该方法在多种架构和任务中均有效,展现出一致的性能提升,且无需额外训练或监督。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。