[论文解读] Why Do Self-Supervised Models Transfer? Investigating the Impact of Invariance on Downstream Tasks
本文通过分析数据增强如何塑造模型的不变性,探究了自监督模型为何能在不同任务间迁移。研究发现,不同下游任务需要相反的不变性——空间不变性与外观不变性——并提出融合经过特定增强策略训练的表征,可在多样化任务上实现一致且最先进的性能,优于标准的默认增强策略。
Self-supervised learning is a powerful paradigm for representation learning on unlabelled images. A wealth of effective new methods based on instance matching rely on data-augmentation to drive learning, and these have reached a rough agreement on an augmentation scheme that optimises popular recognition benchmarks. However, there is strong reason to suspect that different tasks in computer vision require features to encode different (in)variances, and therefore likely require different augmentation strategies. In this paper, we measure the invariances learned by contrastive methods and confirm that they do learn invariance to the augmentations used and further show that this invariance largely transfers to related real-world changes in pose and lighting. We show that learned invariances strongly affect downstream task performance and confirm that different downstream tasks benefit from polar opposite (in)variances, leading to performance loss when the standard augmentation strategy is used. Finally, we demonstrate that a simple fusion of representations with complementary invariances ensures wide transferability to all the diverse downstream tasks considered.
研究动机与目标
- 通过分析数据增强在塑造学习到的不变性方面的作用,理解自监督模型为何能在下游任务间泛化。
- 探究不同视觉任务是否需要相互冲突的不变性(例如空间不变性与外观不变性),以及标准增强方案是否对所有任务都最优。
- 评估在不同增强类型(空间或外观)上训练的专用表征是否能在特定任务类别上超越通用模型。
- 探索是否可通过融合具有互补不变性的表征,获得在多样化下游任务中表现更稳健、更具通用性的特征。
提出的方法
- 仅使用空间风格或外观风格增强训练对比自监督模型(MoCo-v2+ResNet50),以隔离每类增强的影响。
- 通过测量对合成与真实世界变换(如视角、光照、模糊)的不变性,评估学习到的不变性在训练增强之外的泛化能力。
- 在多样化的下游任务(包括图像分类、目标检测和关键点估计,如300W数据集)上评估表征性能,以比较不同任务类型的表现。
- 将使用空间和外观增强训练的模型的特征进行融合(Spa+App),并进一步与默认模型结合(Def+Spa+App),以构建统一且高性能的表征。
- 通过L2正则化的线性探测超参数搜索,公平比较各模型的表征质量。
- 将融合模型与更宽的ResNet50(×3)基线模型及3× Default模型进行比较,以评估可扩展性与性能权衡。
实验结果
研究问题
- RQ1自监督模型是否能从合成增强中学到泛化到真实世界分布偏移的不变性?
- RQ2学习空间不变性与外观不变性之间是否存在权衡?最先进模型是否表现出这种权衡?
- RQ3不同下游任务是否从不同类型不变性(如空间敏感性或外观鲁棒性)中获益?
- RQ4是否可通过融合针对不同不变性专门设计的表征,实现在多样化任务上的稳定高性能?
主要发现
- 使用空间风格增强训练的模型学习到对视角和空间位移的不变性,能泛化到真实世界的视角变化,在300W关键点估计等空间敏感任务上表现更优。
- 使用外观风格增强训练的模型学习到对光照、色彩和模糊变化的不变性,在需要外观鲁棒性的任务(如物体颜色估计)中表现最佳。
- 标准默认增强策略在姿态相关任务上表现较差,表明其在识别任务上过度优化,而在空间敏感性任务上表现不佳。
- 融合空间与外观专用模型的表征(Spa+App)在所有任务上均表现强劲,优于默认模型在300W任务上的表现,并展现出一致的性能提升。
- 三重融合(Def+Spa+App)实现了最一致的性能,在姿态估计任务上甚至超越了更宽的3× ResNet50(×3)模型,同时在分类任务中保持了强大的准确率。
- 结果表明,通过互补的不变性专用表征融合生成的单一统一特征,可为多样化下游视觉任务提供稳健且通用的表征。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。