Skip to main content
QUICK REVIEW

[论文解读] Scale-aware Automatic Augmentation for Object Detection

Yukang Chen, Yanwei Li|arXiv (Cornell University)|Mar 31, 2021
Advanced Neural Network Applications参考文献 49被引用 8
一句话总结

本文提出 Scale-aware AutoAug,一种用于目标检测的自动化数据增强方法,通过在新型尺度感知搜索空间内联合优化图像级(缩放进/出)和框级(自适应面积比)增强,实现性能提升。通过引入一种高效的 Pareto Scale Balance 评估指标,其搜索成本仅为先前方法的 1/40,同时在 COCO 上实现最高性能,mAP 提升最高达 1.0%,并能有效迁移至实例分割和关键点检测任务。

ABSTRACT

We propose Scale-aware AutoAug to learn data augmentation policies for object detection. We define a new scale-aware search space, where both image- and box-level augmentations are designed for maintaining scale invariance. Upon this search space, we propose a new search metric, termed Pareto Scale Balance, to facilitate search with high efficiency. In experiments, Scale-aware AutoAug yields significant and consistent improvement on various object detectors (e.g., RetinaNet, Faster R-CNN, Mask R-CNN, and FCOS), even compared with strong multi-scale training baselines. Our searched augmentation policies are transferable to other datasets and box-level tasks beyond object detection (e.g., instance segmentation and keypoint estimation) to improve performance. The search cost is much less than previous automated augmentation approaches for object detection. It is notable that our searched policies have meaningful patterns, which intuitively provide valuable insight for human data augmentation design. Code and models will be available at https://github.com/Jia-Research-Lab/SA-AutoAug.

研究动机与目标

  • 通过开发一种显式考虑图像级与框级尺度变化的数据增强策略,解决目标检测中的尺度可变性挑战。
  • 克服人工设计与先前学习型增强策略的局限性,使其无法充分挖掘图像空间与目标框空间中的尺度感知能力。
  • 在保持或提升性能的前提下,降低目标检测中自动增强搜索的高计算成本。
  • 设计一种搜索空间与评估指标,实现跨检测器与任务的高效、可扩展且可迁移的增强策略。
  • 提供可解释、有意义的增强模式,为人工设计的数据增强策略提供洞见。

提出的方法

  • 提出一种尺度感知搜索空间,包含可学习概率与幅度的图像级缩放进/出操作,以及基于自适应面积比的框级增强。
  • 提出一种新搜索指标——Pareto Scale Balance,基于多尺度验证准确率与累积损失评估策略,提升与实际性能的相关性,优于代理准确率。
  • 在尺度感知搜索空间上使用强化学习或类似 NAS 的优化方法进行神经架构搜索,以识别高性能增强策略。
  • 通过高斯图映射对增强图像进行泛化,以在增强过程中保留空间上下文信息,提升对尺度变化的鲁棒性。
  • 在目标检测基准(如 MS COCO、Pascal VOC)上使用基于锚点与无锚点检测器(如 RetinaNet、Faster R-CNN、FCOS、Mask R-CNN)训练并验证策略。
  • 将学习到的策略无架构修改地迁移至相关框级任务,如实例分割与关键点估计。

实验结果

研究问题

  • RQ1是否可通过统一的搜索空间,将图像级与框级增强结合并引入尺度感知参数,从而提升目标检测性能?
  • RQ2基于多尺度下性能平衡的新搜索指标是否优于传统代理准确率,从而更高效地引导增强搜索?
  • RQ3所搜索到的增强策略是否可在不同目标检测器与数据集之间泛化,包括目标检测之外的任务?
  • RQ4学习到的增强策略中是否涌现出有意义的模式?这些模式能否为人工设计的数据增强策略提供参考?
  • RQ5Scale-aware AutoAug 在在多大程度上可替代架构组件(如 FPN)以实现尺度不变性?

主要发现

  • 在使用 ResNet-50 的情况下,Scale-aware AutoAug 在 MS COCO 上实现 41.3% AP(RetinaNet)、41.8% AP(Faster R-CNN)与 42.6% AP(FCOS),显著优于强基线模型。
  • 在强基线 FCOS(ResNeXt-32x8d-101-DCN)上,Scale-aware AutoAug 在单尺度测试下将 mAP 从 47.5% 提升至 48.5%(+1.0%),在更大训练图像下进一步提升至 49.6%。
  • 在多尺度测试下,改进后的 FCOS 模型达到 51.4% mAP,超过 SNIPER 的 46.1% 与 SNIP 的 47.0%,且使用相同主干网络。
  • 该方法将搜索成本降低至 20 GPU 天,相比先前工作(如 AutoAug-det)所需的 400 TPU 天,降低 40 倍。
  • 学习到的策略展现出可解释的模式:更倾向于使用缩放操作(更高概率与幅度),面积比随目标尺度减小,几何操作主导于颜色操作。
  • Scale-aware AutoAug 可在不修改网络结构的前提下替代 Faster R-CNN 中的 FPN,将 mAP 从 34.7% 提升至 36.8%(在干净的 ResNet-50-C4 基线之上)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。