Skip to main content
QUICK REVIEW

[论文解读] RecursiveMix: Mixed Learning with History

Lingfeng Yang, Xiang Li|arXiv (Cornell University)|Mar 14, 2022
Domain Adaptation and Few-Shot Learning被引用 10
一句话总结

RecursiveMix (RM) 是一种新颖的数据增强方法,通过递归重用前一训练迭代中的历史输入-预测-标签三元组,生成多样化、多尺度的混合样本,以极低的计算开销提升模型泛化能力。该方法在性能上达到当前最先进水平,在 CIFAR-100 上将 ResNet-50 准确率提升 3.2%,在 ImageNet 上提升 2.8%,在 COCO 目标检测任务上比 CutMix 提升 1.4 AP 点。

ABSTRACT

Mix-based augmentation has been proven fundamental to the generalization of deep vision models. However, current augmentations only mix samples at the current data batch during training, which ignores the possible knowledge accumulated in the learning history. In this paper, we propose a recursive mixed-sample learning paradigm, termed "RecursiveMix" (RM), by exploring a novel training strategy that leverages the historical input-prediction-label triplets. More specifically, we iteratively resize the input image batch from the previous iteration and paste it into the current batch while their labels are fused proportionally to the area of the operated patches. Further, a consistency loss is introduced to align the identical image semantics across the iterations, which helps the learning of scale-invariant feature representations. Based on ResNet-50, RM largely improves classification accuracy by $\sim$3.2\% on CIFAR100 and $\sim$2.8\% on ImageNet with negligible extra computation/storage costs. In the downstream object detection task, the RM pretrained model outperforms the baseline by 2.1 AP points and surpasses CutMix by 1.4 AP points under the ATSS detector on COCO. In semantic segmentation, RM also surpasses the baseline and CutMix by 1.9 and 1.1 mIoU points under UperNet on ADE20K, respectively. Codes and pretrained models are available at \url{https://github.com/megvii-research/RecursiveMix}.

研究动机与目标

  • 解决现有基于混合的数据增强方法仅使用当前批次样本、忽略训练历史中积累的宝贵知识的局限性。
  • 探索如何递归重用历史输入-预测-标签三元组以提升模型泛化能力和特征学习。
  • 开发一种显式学习跨迭代空间-语义一致性的训练范式,以增强尺度不变性和空间感知表征。
  • 在显著提升图像分类、检测和分割基准性能的同时,将额外计算和内存开销最小化。
  • 在目标检测和语义分割等对空间理解至关重要的下游任务中,证明递归混合的有效性。

提出的方法

  • RecursiveMix 在每次训练迭代中,将前一迭代的输入图像批次递归地缩放并粘贴到当前批次中,形成一种递归数据混合范式。
  • 通过混合系数 λ,按粘贴区域的比例融合历史样本和当前样本的标签。
  • 引入一致性损失,对齐当前混合输入与历史输入中对应感兴趣区域(ROI)的特征表示,强制实现空间语义一致性。
  • 该方法使用轻量级 RoI 操作器和可选的全连接层计算一致性损失,确保计算开销极低。
  • 历史三元组(输入、预测、标签)仅以小批量形式存储一个迭代周期,因此存储成本可忽略不计。
  • 递归混合过程增加了数据多样性,为同一实例提供了多尺度和多空间视角,丰富了监督信号。

实验结果

研究问题

  • RQ1利用历史输入-预测-标签三元组是否能够超越仅基于当前批次的混合增强方法,进一步提升深度视觉模型的泛化能力?
  • RQ2使用历史数据进行递归混合在特征学习方面有何提升,特别是在尺度不变性和空间感知表征方面?
  • RQ3RecursiveMix 在图像分类、目标检测和语义分割任务中,能在多大程度上以极低的计算和内存开销实现性能提升?
  • RQ4历史样本与当前混合样本之间的一致性损失是否相比标准混合方法,能带来更准确、更鲁棒的特征学习?
  • RQ5RecursiveMix 是否可作为简单但高效的基线方法,超越现有的 SOTA 混合增强技术(如 CutMix 和 Mixup)?

主要发现

  • 在 CIFAR-100 上,RecursiveMix 将 ResNet-50 的准确率提升 3.2%,在 ImageNet 上提升 2.8%,显著优于基线模型和 CutMix。
  • 在使用 ATSS 检测器的 COCO 目标检测基准上,RM 预训练的 ResNet-50 模型相比基线模型提升 2.1 AP 点,相比 CutMix 提升 1.4 AP 点。
  • 在 ADE20K 语义分割任务中使用 UperNet 时,RM 在 mIoU 上相比基线模型提升 1.9,相比 CutMix 提升 1.1,证明其在密集预测任务中具有强大的泛化能力。
  • 该方法仅带来可忽略的内存增加(5887.0 MB vs. 5832.0 MB)和训练时间增加(73.8 小时),展现出极高的效率。
  • 类别激活图可视化结果表明,RM 生成了更多样化、多目标的输入样本,并在定位有意义区域方面优于 Mixup 和 CutMix。
  • 有效类别分析显示,RM 平均每张图像提供 4–5 个对象的监督,证实其相比基线方法提供了更丰富、更多样化的监督信号。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。