Skip to main content
QUICK REVIEW

[论文解读] Masked Siamese Networks for Label-Efficient Learning

Mahmoud Assran, Mathilde Caron|arXiv (Cornell University)|Apr 14, 2022
Domain Adaptation and Few-Shot Learning被引用 8
一句话总结

Masked Siamese Networks (MSN) 提出了一种自监督学习框架,通过训练视觉变换器(Vision Transformers)对掩码图像视图及其未掩码对应视图生成相似的表征,避免了像素级重建。该方法在标签高效学习中达到最先进性能,在仅使用 1% 标签的情况下,模型参数量仅为先前最先进方法的十分之一,ImageNet-1K 上达到 75.7% 的 top-1 准确率。

ABSTRACT

We propose Masked Siamese Networks (MSN), a self-supervised learning framework for learning image representations. Our approach matches the representation of an image view containing randomly masked patches to the representation of the original unmasked image. This self-supervised pre-training strategy is particularly scalable when applied to Vision Transformers since only the unmasked patches are processed by the network. As a result, MSNs improve the scalability of joint-embedding architectures, while producing representations of a high semantic level that perform competitively on low-shot image classification. For instance, on ImageNet-1K, with only 5,000 annotated images, our base MSN model achieves 72.4% top-1 accuracy, and with 1% of ImageNet-1K labels, we achieve 75.7% top-1 accuracy, setting a new state-of-the-art for self-supervised learning on this benchmark. Our code is publicly available.

研究动机与目标

  • 开发一种自监督学习方法,以提升小样本图像分类中的可扩展性和性能。
  • 在掩码自编码中避免像素级或 token 级重建,同时保持语义表征质量。
  • 通过 patch 掩码减少计算和内存开销,实现视觉变换器的高效预训练。
  • 探究视图不变性与数据增强在小样本表征学习中的作用。
  • 证明联合嵌入架构可在无需显式重建损失的情况下实现具有竞争力的性能。

提出的方法

  • MSN 使用孪生架构,其中图像的一个视图被随机掩码(70% 的 patch 被丢弃),另一个视图保持未掩码状态。
  • 模型通过对比损失被训练为对两个视图生成相同的表征,从而在表征层面隐式地对掩码视图进行去噪。
  • 编码器为视觉变换器(ViT),仅处理未掩码的 patch,显著降低了预训练期间的计算成本。
  • 在两个视图上应用数据增强(颜色抖动、裁剪、翻转、模糊),以防止基于颜色统计的捷径学习。
  • 预训练采用全局视图进行随机掩码,并引入焦点视图(小裁剪)进行对比学习,不使用重建损失。
  • 该框架具有可扩展性:激进的掩码策略可减少内存使用并加快训练速度,支持在更少 GPU 上进行预训练。

实验结果

研究问题

  • RQ1一种自监督方法能否在避免像素级重建的同时仍学习到高质量的语义表征?
  • RQ2在小样本图像分类中,掩码孪生学习与掩码自编码相比表现如何?
  • RQ3在基于 ViT 的架构中,激进的 patch 掩码是否能提升训练效率和模型可扩展性?
  • RQ4通过数据增强实现的视图不变性在小样本泛化中起到什么作用?
  • RQ5联合嵌入架构是否能在无重建损失的情况下实现标签高效学习中的最先进性能?

主要发现

  • 在仅使用 1% 标签(13,000 张图像)的 ImageNet-1K 上,使用 ViT-B/4 模型的 MSN 达到 75.7% 的 top-1 准确率,创下新 SOTA 记录。
  • 仅使用 5,000 张标注图像时,基础 MSN 模型即达到 72.4% 的 top-1 准确率,展现出强大的小样本性能。
  • MSN 在参数量接近前人 SOTA 方法 10 倍少的情况下,超越了此前 SOTA 方法(后者需 800M 参数)。
  • 采用激进掩码(70% patch 丢弃)后,每张 GPU 的 GPU 显存使用从 26G 降低至 17G,吞吐量从每秒 415 张图像提升至 600 张图像。
  • 对锚点和目标视图使用不同的增强方式(颜色抖动、裁剪、翻转、模糊)后,1% ImageNet 上的准确率从 7.0% 提升至 52.3%,凸显视图不变性的重要性。
  • 更大的模型在更高掩码比例下表现更优:ViT-L/16 在 50% 掩码下达到 70.1% 的 top-1 准确率,且在激进掩码下性能保持稳定。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。