Skip to main content
QUICK REVIEW

[论文解读] Rethinking Self-Supervised Learning: Small is Beautiful

Yun-Hao Cao, Jianxin Wu|arXiv (Cornell University)|Mar 25, 2021
Domain Adaptation and Few-Shot Learning参考文献 37被引用 10
一句话总结

本文提出缩放版自监督学习(S3L),通过采用小分辨率、小模型架构和小数据量,实现自监督学习范式的革新。在有限数据上以降低模型复杂度和输入分辨率的方式训练,S3L在显著更低的计算成本下实现了比标准自监督学习方法更高的准确率,甚至在CUB200和Cars等小数据集上超越了ImageNet预训练模型的性能。

ABSTRACT

Self-supervised learning (SSL), in particular contrastive learning, has made great progress in recent years. However, a common theme in these methods is that they inherit the learning paradigm from the supervised deep learning scenario. Current SSL methods are often pretrained for many epochs on large-scale datasets using high resolution images, which brings heavy computational cost and lacks flexibility. In this paper, we demonstrate that the learning paradigm for SSL should be different from supervised learning and the information encoded by the contrastive loss is expected to be much less than that encoded in the labels in supervised learning via the cross entropy loss. Hence, we propose scaled-down self-supervised learning (S3L), which include 3 parts: small resolution, small architecture and small data. On a diverse set of datasets, SSL methods and backbone architectures, S3L achieves higher accuracy consistently with much less training cost when compared to previous SSL learning paradigm. Furthermore, we show that even without a large pretraining dataset, S3L can achieve impressive results on small data alone. Our code has been made publically available at https://github.com/CupidJay/Scaled-down-self-supervised-learning.

研究动机与目标

  • 挑战自监督学习(SSL)应模仿监督学习的大规模、高分辨率和长训练周期范式的假设。
  • 探究降低输入分辨率、模型规模和预训练数据量是否能提升自监督学习的效率与性能。
  • 证明在小下游数据集上直接进行自监督预训练(无需大规模预训练)可获得更优结果。
  • 探索在数据有限时,特定网络组件(如最后的残差块)在自监督学习中的作用。
  • 证明自监督学习在小数据上比监督学习更具鲁棒性,尤其是在延长训练周期时。

提出的方法

  • 提出S3L:一种新型自监督学习范式,采用小输入分辨率(例如112×112而非224×224)、更小的主干网络架构(例如移除最后的残差块),并在小下游数据集上直接进行预训练。
  • 采用标准对比学习与InfoNCE损失,但在缩放后的设置下应用,以降低计算成本并提升小数据上的泛化能力。
  • 引入两项关键架构修改:'移除conv5权重'与'移除conv5',两者均被证明可通过减少对对比损失的过拟合来提升小数据集上的性能。
  • 使用SimCLR框架在小数据集上进行800至1600个周期的预训练,随后采用标准学习率调度策略进行微调。
  • 将S3L与标准自监督学习(如MoCov2、SimCLR)及ImageNet上的监督预训练进行比较,评估其在7个小型基准数据集(包括CUB200、pets和flowers)上的表现。
  • 在小规模ImageNet子集(10k和50k张图像)上评估性能,以评估自监督学习在数据稀缺情况下的鲁棒性。

实验结果

研究问题

  • RQ1降低输入分辨率和模型规模是否能提升小数据集上自监督表示学习的性能?
  • RQ2在小下游数据集上直接预训练(无需大规模预训练)是否优于标准自监督学习范式?
  • RQ3在数据有限时,如移除最后的残差块等架构修改如何影响自监督学习性能?
  • RQ4在小数据集上训练时,自监督学习与监督学习在泛化能力和过拟合方面有何差异?
  • RQ5S3L是否能在不依赖ImageNet预训练的情况下,实现在小数据集上的最先进性能?

主要发现

  • 在CUB200、pets和flowers数据集上,采用'移除conv5'策略时,S3L相较于基线模型分别实现了17.3%、32.7%和25.5%的相对准确率提升。
  • 在CUB200数据集上,S3L在从零开始训练时达到最先进性能,优于在ImageNet上预训练的模型。
  • 在小规模ImageNet(10,000张图像)上,使用112×112分辨率的MoCov2实现了强大的下游检测性能,而监督学习因过拟合而失败。
  • 延长预训练时间(最多1600个周期)可提升自监督学习在小数据上的性能,但会损害监督学习的表现,表明自监督学习具有更高的数据效率。
  • '移除conv5'策略在更低的训练成本下优于'移除conv5权重',表明最后几层在小数据上容易过度拟合对比损失。
  • S3L在CUB200、Cars、Aircraft和pets数据集上均实现了最先进性能,且无需任何大规模数据集的预训练,证明了直接小数据自监督学习的可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。