[论文解读] Spatially Consistent Representation Learning
本文提出空间一致表征学习(SCRL),一种自监督方法,通过在几何变换下的图像裁剪区域之间对齐,增强特征表征的局部空间一致性。通过利用RoIAlign匹配空间对应特征,并采用类似BYOL的框架优化其相似性,SCRL在目标检测和实例分割任务上达到最先进性能,优于ImageNet预训练及先前的自监督方法,在多个基准测试中表现更优。
Self-supervised learning has been widely used to obtain transferrable representations from unlabeled images. Especially, recent contrastive learning methods have shown impressive performances on downstream image classification tasks. While these contrastive methods mainly focus on generating invariant global representations at the image-level under semantic-preserving transformations, they are prone to overlook spatial consistency of local representations and therefore have a limitation in pretraining for localization tasks such as object detection and instance segmentation. Moreover, aggressively cropped views used in existing contrastive methods can minimize representation distances between the semantically different regions of a single image. In this paper, we propose a spatially consistent representation learning algorithm (SCRL) for multi-object and location-specific tasks. In particular, we devise a novel self-supervised objective that tries to produce coherent spatial representations of a randomly cropped local region according to geometric translations and zooming operations. On various downstream localization tasks with benchmark datasets, the proposed SCRL shows significant performance improvements over the image-level supervised pretraining as well as the state-of-the-art self-supervised learning methods. Code is available at https://github.com/kakaobrain/scrl
研究动机与目标
- 解决现有对比自监督学习方法在几何变换下产生不一致局部表征的局限性,尤其针对定位任务。
- 提升多目标及定位感知视觉任务(如目标检测与实例分割)中特征的空间一致性。
- 减轻对比学习中激进裁剪带来的负面影响,该问题可能在语义不同的图像区域间诱导虚假相似性。
- 开发一种自监督目标,强制局部特征在平移、缩放等几何增强下保持不变性。
- 证明表征的空间一致性可带来更优的下游性能,尤其在边界框回归任务中。
提出的方法
- 提出一种新颖的自监督目标,通过平移、缩放等几何变换,在同一图像的不同增强视图之间匹配空间对应的局部区域。
- 应用RoIAlign从两个增强视图的特征图中提取空间对齐区域的等尺寸局部特征表征。
- 将BYOL框架适配为最小化对齐局部表征之间的距离,无需负样本对。
- 采用类似对比的损失函数,促使网络在几何扰动下对同一空间区域产生一致的特征。
- 采用动量更新的在线与目标骨干网络以稳定训练,类似于BYOL。
- 在ImageNet上进行训练,并在标准检测与分割基准上评估下游定位任务的性能。
实验结果
研究问题
- RQ1在目标检测与实例分割等定位任务中,强制局部表征的空间一致性是否能提升性能?
- RQ2基于空间对齐裁剪的自监督目标是否优于全局对比学习,以更好地保留空间结构?
- RQ3在数据量有限及长训练周期下,SCRL与ImageNet预训练及最先进自监督方法相比表现如何?
- RQ4空间一致性在边界框回归与分类准确率方面分别带来多大程度的提升?
- RQ5空间一致表征是否能在多样数据集与检测头架构间实现良好泛化?
主要发现
- 在COCO目标检测任务上,SCRL优于ImageNet预训练及所有最先进自监督方法,即使仅使用200个上游预训练周期,仍取得更高的AP。
- 在COCO检测任务中,不同下游训练周期(0.5×至7×)下,SCRL始终优于随机初始化、监督预训练及BYOL,所有设置下表现一致更优。
- 在COCO真实框上的RoI线性评估中,SCRL达到74.8%的准确率,显著优于BYOL(71.5%)和监督ImageNet预训练(72.7%)。
- 定性分析表明,与BYOL相比,SCRL生成的边界框更紧凑、更精确,尤其在BYOL因平移不变性特征而无法检测完整物体的情况下表现更优。
- 在数据稀缺场景下(如仅使用COCO训练数据的1/10),SCRL仍保持性能优势,证明了空间一致特征的鲁棒性与可迁移性。
- 该方法在全局与空间受限线性评估之间表现出权衡,表明空间一致性对定位任务至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。