[论文解读] Self-Supervised Ranking for Representation Learning
该论文提出S2R2,一种自监督表示学习框架,将表示学习建模为对多种随机图像增强的全局排序问题,在MS-COCO等多样化数据集上优于对比方法(如SimCLR和SwAV),尤其在杂乱、非整理的场景中表现更优,通过优化所有视图的平均精度(AP)而非依赖成对对比损失实现。
We present a new framework for self-supervised representation learning by formulating it as a ranking problem in an image retrieval context on a large number of random views (augmentations) obtained from images. Our work is based on two intuitions: first, a good representation of images must yield a high-quality image ranking in a retrieval task; second, we would expect random views of an image to be ranked closer to a reference view of that image than random views of other images. Hence, we model representation learning as a learning to rank problem for image retrieval. We train a representation encoder by maximizing average precision (AP) for ranking, where random views of an image are considered positively related, and that of the other images considered negatives. The new framework, dubbed S2R2, enables computing a global objective on multiple views, compared to the local objective in the popular contrastive learning framework, which is calculated on pairs of views. In principle, by using a ranking criterion, we eliminate reliance on object-centric curated datasets. When trained on STL10 and MS-COCO, S2R2 outperforms SimCLR and the clustering-based contrastive learning model, SwAV, while being much simpler both conceptually and at implementation. On MS-COCO, S2R2 outperforms both SwAV and SimCLR with a larger margin than on STl10. This indicates that S2R2 is more effective on diverse scenes and could eliminate the need for an object-centric large training dataset for self-supervised representation learning.
研究动机与目标
- 解决局部成对对比学习目标在视觉多样性与杂乱场景中表现不佳的局限性。
- 通过将表示学习建模为随机图像视图的全局排序问题,消除对以物体为中心的整理数据集的依赖。
- 通过使用全局平均精度(AP)目标替代局部对比损失,提升优化稳定性和性能。
- 证明基于排序的自监督方法在非整理、复杂数据集(如MS-COCO)上的泛化能力优于对比学习。
- 验证更简单的全局排序目标可在无需复杂多阶段训练或聚类的情况下超越最先进对比模型。
提出的方法
- 该框架将图像表示学习视为检索任务,同一图像的不同随机增强为正样本,其他图像的增强为负样本。
- 在小批量中优化所有正负样本视图的平均精度(AP)指标,使用表示向量之间的余弦相似度计算排序得分。
- 损失基于AP公式中指示函数的可微近似,支持通过反向传播进行端到端训练。
- 在编码器特征上使用非线性投影头,模型从头开始训练,采用ADAM优化器,固定1e-4学习率。
- 所有数据集均使用96×96大小的随机裁剪,采用ResNet18和ResNet50主干网络,并在下游分类任务中评估线性探测准确率。
- 该方法通过仅依赖视图间的相对排序,避免了SimCLR和SwAV所需的实例级标签或聚类分配。
实验结果
研究问题
- RQ1在自监督表示学习中,对多个图像增强的全局排序目标是否能优于局部成对对比学习?
- RQ2所提出的基于排序的方法在非整理、多样化的数据集(如MS-COCO)上是否比对比学习泛化能力更强?
- RQ3S2R2在不同数据集和主干网络架构下与最先进对比模型(如SimCLR和SwAV)相比性能如何?
- RQ4小批量大小和每张图像的视图数量对基于排序的目标性能有何影响?
- RQ5排序目标是否能缓解成对对比学习中固有的优化冲突(如正样本对间相互冲突的拉力)?
主要发现
- 在MS-COCO-Train和MS-COCO-Val上,S2R2使用ResNet50分别取得81.2%和70.2%的top-1线性分类准确率,优于SimCLR(74.9%和59.4%)和SwAV(77.5%和59.4%)。
- 在STL10上,S2R2在200个周期内达到89.7%准确率,超过SimCLR(85.2%)和SwAV(85.9%)的相同设置。
- S2R2在COCO-Val上的收敛速度优于SwAV,且在更长训练周期下性能保持稳定或进一步提升,而SwAV在长训练周期下性能下降。
- 当小批量中图像数量超过某一阈值后,性能下降,可能由于图像间视觉相似性增加导致排序信号减弱。
- 与STL10相比,S2R2在MS-COCO上的性能提升幅度更大,表明其在复杂、非整理场景中表现更优。
- S2R2在无需聚类分配或实例级标签的情况下达到最先进性能,证明了全局排序目标的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。