[论文解读] Unsupervised Pretraining for Object Detection by Patch Reidentification.
本文提出了一种名为补丁重识别(Re-identification, Re-ID)的对比自监督掩蔽任务,通过匹配图像在不同增强视图下的补丁来学习位置判别性表征,从而提升目标检测性能。该方法在 COCO 数据集上取得了最先进(SOTA)的性能,相较于 MoCo v2 甚至全监督基线方法,在多种训练设置下 mAP 提升最高达 2.1。
Unsupervised representation learning achieves promising performances in pre-training representations for object detectors. However, previous approaches are mainly designed for image-level classification, leading to suboptimal detection performance. To bridge the performance gap, this work proposes a simple yet effective representation learning method for object detection, named patch re-identification (Re-ID), which can be treated as a contrastive pretext task to learn location-discriminative representation unsupervisedly, possessing appealing advantages compared to its counterparts. Firstly, unlike fully-supervised person Re-ID that matches a human identity in different camera views, patch Re-ID treats an important patch as a pseudo identity and contrastively learns its correspondence in two different image views, where the pseudo identity has different translations and transformations, enabling to learn discriminative features for object detection. Secondly, patch Re-ID is performed in Deeply Unsupervised manner to learn multi-level representations, appealing to object detection. Thirdly, extensive experiments show that our method significantly outperforms its counterparts on COCO in all settings, such as different training iterations and data percentages. For example, Mask R-CNN initialized with our representation surpasses MoCo v2 and even its fully-supervised counterparts in all setups of training iterations (e.g. 2.1 and 1.1 mAP improvement compared to MoCo v2 in 12k and 90k iterations respectively). Code will be released at this https URL.
研究动机与目标
- 通过设计一种检测专用的掩蔽任务,弥合无监督预训练在图像分类与目标检测之间存在的性能差距。
- 通过聚焦于局部、与目标相关的特征,克服图像级对比学习的局限性,实现基于补丁级别的表征学习。
- 开发一种自监督方法,学习多层级、位置判别性特征,适用于目标检测,且无需边界框标注。
- 通过建模不同增强视图间补丁的对应关系,提升目标检测器的泛化能力和特征判别性。
- 在 COCO 上实现优于现有无监督甚至部分全监督预训练方法的检测性能。
提出的方法
- 将每个重要图像补丁视为伪身份,并学习其在同张图像的两个增强视图之间的对应关系。
- 将补丁 Re-ID 定义为对比学习任务,其中正样本对为同一补丁在不同变换下的表征,负样本对为来自不同补丁的表征。
- 以深度无监督方式执行 Re-ID 任务,在 CNN 主干网络的多个特征层级上进行,以学习分层表征。
- 使用实例级对比损失优化模型,使嵌入空间中的正样本对更接近,负样本对更远离。
- 将预训练的特征直接集成到标准目标检测器(如 Mask R-CNN)中,无需在检测特定标签上进行微调。
- 仅使用图像级增强和无边界框标注,以端到端的自监督方式训练表征学习器。
实验结果
研究问题
- RQ1基于补丁级对应关系的自监督掩蔽任务是否能相比图像级对比学习显著提升目标检测性能?
- RQ2在不同训练调度下,补丁 Re-identification 与 MoCo v2 等现有无监督预训练方法相比,在检测 mAP 上表现如何?
- RQ3纯粹无监督预训练方法在多大程度上能够超越甚至全监督预训练基线方法?
- RQ4通过补丁 Re-identification 实现的多层级特征学习是否能带来目标检测器在定位与分类性能上的提升?
- RQ5该方法在不同数据比例和训练迭代次数下是否具备泛化能力,并保持一致的性能增益?
主要发现
- 所提出的补丁 Re-identification 方法在所有训练设置下均在 COCO 目标检测基准上达到最先进(SOTA)性能。
- 当训练 12k 次迭代时,使用该表征初始化的 Mask R-CNN 比 MoCo v2 提升 2.1 mAP。
- 在训练 90k 次迭代时,该方法相比 MoCo v2 提升 1.1 mAP,表明在不同训练调度下均保持一致的性能增益。
- 即使在低数据场景下,该方法仍保持强劲性能,表明其对数据稀缺具有鲁棒性。
- 在某些设置下,该方法甚至优于全监督预训练基线,凸显了自监督掩蔽任务的有效性。
- 该方法在预训练阶段完全未使用任何边界框标注,却实现了显著性能提升,证明了位置判别性表征学习的价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。