Skip to main content
QUICK REVIEW

[论文解读] A Unified View of Masked Image Modeling

Zhiliang Peng, Dong Li|arXiv (Cornell University)|Oct 19, 2022
Advanced Neural Network Applications被引用 14
一句话总结

该论文提出了一种简单而有效的掩码图像建模方法 MaskDistill,通过在掩码图像块上从基于 CLIP 的教师模型重建归一化语义特征,使用带有全连接 MIM 头和 Smooth-$\ell_1$ 损失的学生视觉 Transformer 模型实现。该方法在 ImageNet-1k 上达到 88.3% 的 top-1 准确率,在 ADE20k 上达到 58.8% 的 mIoU,使用 ViT-H/14 模型经过 300 个周期的预训练,性能达到当前最先进水平。

ABSTRACT

Masked image modeling has demonstrated great potential to eliminate the label-hungry problem of training large-scale vision Transformers, achieving impressive performance on various downstream tasks. In this work, we propose a unified view of masked image modeling after revisiting existing methods. Under the unified view, we introduce a simple yet effective method, termed as MaskDistill, which reconstructs normalized semantic features from teacher models at the masked positions, conditioning on corrupted input images. Experimental results on image classification and semantic segmentation show that MaskDistill achieves comparable or superior performance than state-of-the-art methods. When using the huge vision Transformer and pretraining 300 epochs, MaskDistill obtains 88.3% fine-tuning top-1 accuracy on ImageNet-1k (224 size) and 58.8% semantic segmentation mIoU metric on ADE20k (512 size). The code and pretrained models will be available at https://aka.ms/unimim.

研究动机与目标

  • 为解决大规模视觉 Transformer 训练中的标签饥渴问题,提出一种统一的掩码图像建模(MIM)框架。
  • 识别现有 MIM 方法中的关键组件,并建立其设计空间的系统性、统一视图。
  • 开发一种简单而有效的 MIM 方法 MaskDistill,无需复杂架构修改即可提升性能。
  • 证明从强教师模型蒸馏归一化语义特征可带来更好的泛化能力和下游性能。

提出的方法

  • 该方法基于一个统一的 MIM 框架,包含教师模型、归一化层、学生模型、MIM 头和损失函数。
  • MaskDistill 使用 CLIP 的 ViT-B/16 作为教师模型,为掩码图像块提供高层级的归一化特征表示。
  • 学生模型是一个视觉 Transformer(ViT),接收被破坏的输入图像块,并预测教师模型对应的归一化特征。
  • 全连接的 MIM 头将学生模型的表示解码,以匹配教师模型在掩码位置的归一化特征向量。
  • 对教师模型输出的特征应用层归一化,以稳定训练并改善对齐效果。
  • 采用 Smooth-$\ell_1$ 损失函数衡量预测特征与目标归一化特征之间的差异,提升对异常值的鲁棒性。

实验结果

研究问题

  • RQ1如何将现有掩码图像建模方法的多样化设计统一到一个共同框架中?
  • RQ2教师模型的选择在掩码图像建模性能中起到什么作用?
  • RQ3一种仅重建强教师模型归一化语义特征的简单 MIM 方法,能否超越具有专用设计的复杂架构?
  • RQ4与原始像素或离散标记相比,蒸馏归一化特征是否能带来更好的泛化能力和下游性能?

主要发现

  • 使用 ViT-H/14 模型经过 300 个周期的预训练,MaskDistill 在 ImageNet-1k 上达到 88.3% 的 top-1 准确率,优于或匹配当前最先进方法。
  • 在 ADE20k 语义分割基准上,MaskDistill 达到 58.8% 的 mIoU,表明其在密集预测任务中具有强大的迁移能力。
  • 消融实验证实,使用 CLIP 教师模型的归一化特征比使用原始像素或其他监督信号更有效。
  • MaskDistill 在不同模型尺寸(基线、大、超大)上均表现出一致的性能提升,表明其具备良好的可扩展性和鲁棒性。
  • 尽管 CLIP 是多模态模型,该方法在下游任务中仍表现出良好的泛化能力,且无需语言监督。
  • 学习表征中的形状偏差得到提升,如在风格化 ImageNet 变体上的泛化能力更好,这可能解释了其鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。