[论文解读] Adversarial Masking for Self-Supervised Learning
ADIOS 提出了一种新颖的自监督学习框架,通过对抗性目标联合训练掩码函数和图像编码器,其中编码器最小化原始图像与掩码图像之间的表征距离,而掩码函数则最大化该距离。该方法生成语义上合理的掩码,在 ImageNet100、CIFAR 和 iNaturalist 等多个基准上持续优于当前最先进(SOTA)的自监督学习方法,且无需依赖视觉 Transformer 或图像解码器,可与卷积主干网络配合使用。
We propose ADIOS, a masked image model (MIM) framework for self-supervised learning, which simultaneously learns a masking function and an image encoder using an adversarial objective. The image encoder is trained to minimise the distance between representations of the original and that of a masked image. The masking function, conversely, aims at maximising this distance. ADIOS consistently improves on state-of-the-art self-supervised learning (SSL) methods on a variety of tasks and datasets -- including classification on ImageNet100 and STL10, transfer learning on CIFAR10/100, Flowers102 and iNaturalist, as well as robustness evaluated on the backgrounds challenge (Xiao et al., 2021) -- while generating semantically meaningful masks. Unlike modern MIM models such as MAE, BEiT and iBOT, ADIOS does not rely on the image-patch tokenisation construction of Vision Transformers, and can be implemented with convolutional backbones. We further demonstrate that the masks learned by ADIOS are more effective in improving representation learning of SSL methods than masking schemes used in popular MIM models. Code is available at https://github.com/YugeTen/adios.
研究动机与目标
- 为解决掩码图像建模(MIM)中随机或按块掩码的局限性,后者依赖局部像素相关性而非语义推理。
- 通过学习遮挡整个语义实体的掩码来改进自监督表征学习,类似于自然语言处理中的词掩码。
- 开发一种兼容 ViT 和卷积主干网络的框架,避免对基于块的标记化方法的依赖。
- 证明语义上合理的掩码显著优于随机掩码或固定形状掩码,从而提升自监督学习性能。
- 表明掩码函数的对抗性训练可为表征学习提供更有效的数据增强。
提出的方法
- ADIOS 采用双分支对抗性框架,包含两个组件:推理模型(编码器)和遮挡模型(掩码生成器)。
- 遮挡模型使用基于 U-Net 的架构,生成值在 [0,1] 范围内的图像尺寸掩码,其中 1 表示被掩码区域。
- 推理模型通过最小化原始图像与掩码图像表征之间的对比损失进行训练。
- 遮挡模型通过对抗性方式训练,以最大化相同的对比损失,从而使编码器更难区分原始输入与掩码输入。
- 使用全连接条件随机场(CRF)对掩码进行优化,以提升空间一致性和语义一致性。
- 该框架实现为仅编码器模型,无需解码器或视觉分词器,从而实现与卷积主干网络的兼容性。
实验结果
研究问题
- RQ1与随机或固定形状掩码相比,通过对抗性训练生成的、语义上合理的掩码函数是否能提升自监督表征学习?
- RQ2语义掩码带来的性能增益是否在包括 ImageNet100、CIFAR 和 iNaturalist 在内的多样化数据集和下游任务中保持一致?
- RQ3ADIOS 是否能有效应用于卷积神经网络主干网络,避免对视觉 Transformer 的依赖?
- RQ4在表征学习性能方面,所学习掩码的质量与真实对象掩码相比如何?
- RQ5对抗性掩码目标函数在自监督学习中是否在功能上优于生成式重建目标函数?
主要发现
- ADIOS 在 ImageNet100 分类任务上达到最先进性能,优于现有 MIM 方法(包括 MAE 和 BEiT)。
- 在 CIFAR-10 和 CIFAR-100 上,ADIOS 相较基线 MIM 方法将线性探测准确率提升最高达 2.5%。
- 在 iNaturalist 和 Flowers102 上的迁移学习实验显示一致增益,iNaturalist-2021 的性能提升超过 3%。
- ADIOS 生成的掩码具有语义意义,其在提升表征学习方面的效果几乎与真实对象掩码相当。
- 消融实验证实,语义掩码显著优于随机或固定形状掩码,验证了掩码设计在 MIM 中的重要性。
- ADIOS 在多种自监督学习目标(包括对比和非对比方法)上均提升性能,证明了其通用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。