Skip to main content
QUICK REVIEW

[论文解读] Architecture-Agnostic Masked Image Modeling -- From ViT back to CNN

Siyuan Li, Di Wu|arXiv (Cornell University)|May 27, 2022
Advanced Neural Network Applications被引用 16
一句话总结

本文提出 A²MIM,一种新型的与架构无关的掩码图像建模框架,通过增强中间阶图像块之间的交互,提升了视觉变换器(Vision Transformers)和卷积神经网络(CNNs)的自监督表示学习性能。通过在中间特征图上应用掩码标记并引入傅里叶域损失,A²MIM 在 ImageNet-1K 及下游任务上实现了最先进性能,在标准 CNN 上超越对比学习和先前的 MIM 方法,且无需 ViT 特定设计。

ABSTRACT

Masked image modeling, an emerging self-supervised pre-training method, has shown impressive success across numerous downstream vision tasks with Vision transformers. Its underlying idea is simple: a portion of the input image is masked out and then reconstructed via a pre-text task. However, the working principle behind MIM is not well explained, and previous studies insist that MIM primarily works for the Transformer family but is incompatible with CNNs. In this work, we observe that MIM essentially teaches the model to learn better middle-order interactions among patches for more generalized feature extraction. We then propose an Architecture-Agnostic Masked Image Modeling framework (A$^2$MIM), which is compatible with both Transformers and CNNs in a unified way. Extensive experiments on popular benchmarks show that A$^2$MIM learns better representations without explicit design and endows the backbone model with the stronger capability to transfer to various downstream tasks.

研究动机与目标

  • 探究掩码图像建模(MIM)在重建质量之外的潜在机制。
  • 解决先前限制其在 ViTs 之外应用的视觉变换器与 CNN 之间 MIM 性能差距问题。
  • 设计一种统一的、与架构无关的 MIM 框架,以增强 CNN 和视觉变换器中的中间阶交互。
  • 证明 MIM 的成功源于通过改进图像块交互学习到的通用且复杂的特征表示,而非重建保真度。
  • 仅使用标准的 CNN 和 ViT 主干网络,在 ImageNet-1K 和多种基准上实现优越的下游迁移性能。

提出的方法

  • 在中间特征图而非输入图像块上应用掩码标记,以改善特征交互学习。
  • 使用均值 RGB 值进行掩码,以保留空间上下文并避免分布偏移。
  • 引入傅里叶域损失,以显式增强图像块之间的中间阶交互。
  • 设计一种通用框架,兼容 CNN 和视觉变换器,且无需架构修改。
  • 采用线性解码器进行重建,可选地使用深度可分离卷积或高级预测目标进行消融实验。
  • 在 ImageNet-1K 和下游任务上验证框架性能,使用 ResNet、ConvNeXt 和 ViT 主干网络。

实验结果

研究问题

  • RQ1掩码图像建模通过何种真正底层机制提升表示学习?
  • RQ2为何现有 MIM 方法在 CNN 上表现不佳,尽管其在视觉变换器上已获成功?
  • RQ3能否设计一种统一的 MIM 框架,以增强 CNN 和视觉变换器中的中间阶图像块交互?
  • RQ4改进中间阶交互是否能带来更鲁棒且更具泛化能力的视觉表示?
  • RQ5A²MIM 是否能在无 ViT 特定组件的标准 CNN 上超越对比学习和先前的 MIM 方法?

主要发现

  • MIM 的成功源于增强图像块之间的中间阶交互,而非重建质量或架构设计。
  • A²MIM 在使用 ResNet-50 时于 ImageNet-1K 上达到 79.0% 的 top-1 准确率,超越了对比学习和 CNN 上的先前 MIM 方法。
  • ViT-B 在更长的预训练时间(如 800 个周期)下获益更多,而 ResNet-50 在超过 300 个周期后无进一步增益,表明架构归纳偏置限制了 CNN 的 MIM 提升。
  • A²MIM 改进了交互强度分布,捕捉到比基线方法更均衡、更复杂的中间阶交互(0.2n 至 0.6n)。
  • 使用高级目标(如 DINO 特征或 HoG)可将 A²MIM 性能提升至 79.0%(ResNet-50)和 82.7%(ViT-B),证实其可扩展性。
  • 傅里叶域损失和中间掩码显著提升了性能,尤其在 CNN 上,通过增强特征交互学习实现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。