Skip to main content
QUICK REVIEW

[论文解读] Mixup Regularization for Region Proposal based Object Detectors

Shahine Bouabid, Vincent Delaitre|arXiv (Cornell University)|Mar 4, 2020
Advanced Neural Network Applications参考文献 43被引用 4
一句话总结

本文提出了一种针对基于区域建议的目标检测器的新型混合正则化方法,通过在图像对之间对锚框及其关联标签进行线性插值,实现了在计算开销极小的前提下提升模型的鲁棒性与泛化能力。该方法显著提升了小目标检测性能,并在深层网络中实现了更平坦、更稳定的特征表示。

ABSTRACT

Mixup - a neural network regularization technique based on linear interpolation of labeled sample pairs - has stood out by its capacity to improve model's robustness and generalizability through a surprisingly simple formalism. However, its extension to the field of object detection remains unclear as the interpolation of bounding boxes cannot be naively defined. In this paper, we propose to leverage the inherent region mapping structure of anchors to introduce a mixup-driven training regularization for region proposal based object detectors. The proposed method is benchmarked on standard datasets with challenging detection settings. Our experiments show an enhanced robustness to image alterations along with an ability to decontextualize detections, resulting in an improved generalization power.

研究动机与目标

  • 将已在图像分类中证明有效的混合正则化方法扩展至目标检测任务,尽管边界框插值具有非线性与复杂性挑战。
  • 解决在区域建议(锚框)数量、位置与类别各不相同的情况下,定义有意义的混合样本的难题。
  • 通过结构化的混合策略,提升模型对对抗性扰动、图像变换与分布偏移的鲁棒性。
  • 在标准基准数据集(Pascal VOC、MS COCO)上,基于SSD架构验证该方法的有效性。
  • 分析混合正则化对特征空间几何结构的影响,特别是通过隐藏层表示的主成分分析(PCA)研究。

提出的方法

  • 该方法在锚框级别执行混合正则化,通过线性插值方式对两幅图像对之间的锚框坐标及其对应标签(分类与回归)进行混合。
  • 对于每个训练批次,通过两个输入图像的加权平均生成混合图像,混合系数λ从Beta(α, α)分布中采样。
  • 模型采用联合损失函数进行训练:在原始锚框上使用标准检测损失,在插值锚框上使用混合正则化损失,且仅对混合锚框的logits进行反向传播。
  • 该方法利用预定义的锚框网格结构,确保混合锚框与原始锚框之间的一致映射,从而保证回归与分类的有效性。
  • 消融研究通过仅在特定锚框尺度(如仅A₁)上应用混合正则化,隔离其影响,以分析尺度依赖的性能表现。
  • 特征空间分析通过在倒数第二层特征上进行PCA,比较混合正则化与基线模型的可解释方差,评估表示的平坦化程度。

实验结果

研究问题

  • RQ1尽管边界框具有非线性与可变性,混合正则化是否可被有意义地适配至基于区域建议的目标检测器?
  • RQ2锚框级混合正则化是否能提升模型对图像级扰动与分布偏移的鲁棒性?
  • RQ3混合正则化如何影响学习到的特征表示的几何结构,特别是主成分方差的变化?
  • RQ4混合正则化是否能提升小目标检测性能,即SSD模型的一个已知弱点?
  • RQ5混合正则化的收益是否在不同锚框尺度间保持一致,还是在某些特征层级上更有效?

主要发现

  • 所提出的混合方法在Pascal VOC07上将平均平均精度(mAP)提升了0.7–1.3个百分点,当仅对最小锚框(A₁)应用时,最终mAP达到66.5%。
  • 混合正则化显著增强了模型对图像变换与对抗性补丁攻击的鲁棒性,降低了对局部扰动的敏感性。
  • PCA分析表明,混合正则化使特征表示更平坦,尤其在较大锚框尺度(A₄–A₆)上,第一主成分所解释的方差比例显著降低。
  • 当仅在最小锚框层级(A₁)应用混合正则化时,mAP相比基线模型提升了0.7个百分点,表明其在小目标检测上的能力得到增强。
  • 在较大锚框(A₄–A₆)上应用混合正则化会降低性能,表明正则化效果具有尺度依赖性,需谨慎调参。
  • 该方法在几乎不增加计算成本的前提下实现了更好的泛化能力,因为混合仅在训练阶段应用,不影响推理阶段。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。