Skip to main content
QUICK REVIEW

[论文解读] Self-supervised Pretraining of Visual Features in the Wild

Priya Goyal, Mathilde Caron|arXiv (Cornell University)|Mar 2, 2021
Advanced Image and Video Retrieval Techniques参考文献 53被引用 139
一句话总结

SEER 在1B张随机图像上使用 SwAV 和 RegNetY(1.3B 参数)预训练,在 ImageNet 的 Top-1 达到 84.2%,并展现出强烈的少样本迁移能力(用 ImageNet 的 10% 达到 77.9%)。

ABSTRACT

Recently, self-supervised learning methods like MoCo, SimCLR, BYOL and SwAV have reduced the gap with supervised methods. These results have been achieved in a control environment, that is the highly curated ImageNet dataset. However, the premise of self-supervised learning is that it can learn from any random image and from any unbounded dataset. In this work, we explore if self-supervision lives to its expectation by training large models on random, uncurated images with no supervision. Our final SElf-supERvised (SEER) model, a RegNetY with 1.3B parameters trained on 1B random images with 512 GPUs achieves 84.2% top-1 accuracy, surpassing the best self-supervised pretrained model by 1% and confirming that self-supervised learning works in a real world setting. Interestingly, we also observe that self-supervised models are good few-shot learners achieving 77.9% top-1 with access to only 10% of ImageNet. Code: https://github.com/facebookresearch/vissl

研究动机与目标

  • 证明在大型、未经过筛选的图像集合上进行自监督预训练能够产生具有竞争力的视觉表征。
  • 评估高容量架构(RegNetY)在对数十亿张图像进行自监督预训练时的可扩展性。
  • 评估向 ImageNet、低样本学习和其他下游任务的迁移性能。
  • 将野外数据上的自监督预训练与监督学习和弱监督基线进行比较。

提出的方法

  • 使用 SwAV 在线聚类自监督来训练无标签的特征。
  • 采用 RegNetY 架构(以 RegNetY-256GF 为重点)进行可扩展的高容量预训练。
  • 在 1B 张随机、公开的 Instagram 图像上进行训练,批量大小为 8,704,使用 512 张 V100 GPU。
  • 采用混合精度、梯度检查点和 SyncBatchNorm 以实现大规模训练。
  • 每张图像使用 6 个裁剪和一个 3 层的 MLP 头,配有 16K 原型和 Sinkhorn 迭代进行聚类。
  • 在 ImageNet 上对预训练模型进行微调,并以标准 Top-1 精度进行评估。

实验结果

研究问题

  • RQ1自监督学习是否能从野外的数十亿张随机、未经过筛选的图像中学习到高质量的视觉特征?
  • RQ2在野外进行预训练时,模型容量(RegNetY 规模)如何影响下游性能?
  • RQ3在未筛选数据上进行预训练的自监督模型是否像有监督或弱监督对比那样有效地迁移到 ImageNet 和其他基准?
  • RQ4在低样本迁移场景中 SEER 是否有效,且在数据有限时与基线相比如何?
  • RQ5数据规模与更新次数对表征质量的影响是什么?

主要发现

  • SEER 在微调后达到 ImageNet 的 84.2% Top-1 精度,超过先前最佳的自监督模型 1 个百分点。
  • SEER 在仅使用 ImageNet 的 10% 时,在低数据微调设置下达到 77.9% Top-1,表明强烈的少样本迁移。
  • 对未筛选数据的自监督预训练在若干下游任务(包括 COCO 的检测/分割,APBox +1.5–2,APMask +1–2)方面具有与 ImageNet 的有监督预训练相当甚至更好的迁移表现。
  • 增加模型容量在迁移性能上带来更大比例的提升,尤其在低样本场景下。
  • 在对若干任务(iNaturalist、OpenImages、Places、VOC)的线性评估中,SEER 的自监督特征优于有监督的特征。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。