Skip to main content
QUICK REVIEW

[论文解读] Improving Pixel-based MIM by Reducing Wasted Modeling Capability

Yuan Liu, Songyang Zhang|arXiv (Cornell University)|Aug 1, 2023
Advanced Neural Network Applications被引用 4
一句话总结

本文提出多层级特征融合(MFF),通过显式整合视觉变换器(Vision Transformer)浅层的低层级特征,减少基于像素的掩码图像建模(MIM)中的建模能力浪费。通过采用可学习的、动态加权平均策略,融合来自多个编码器层的特征,MFF 提升了训练效率和下游性能,在 ViT-S 上实现了最先进结果,线性探测准确率提升 2.8%,语义分割性能提升 2.6%,微调准确率提升 1.2%。

ABSTRACT

There has been significant progress in Masked Image Modeling (MIM). Existing MIM methods can be broadly categorized into two groups based on the reconstruction target: pixel-based and tokenizer-based approaches. The former offers a simpler pipeline and lower computational cost, but it is known to be biased toward high-frequency details. In this paper, we provide a set of empirical studies to confirm this limitation of pixel-based MIM and propose a new method that explicitly utilizes low-level features from shallow layers to aid pixel reconstruction. By incorporating this design into our base method, MAE, we reduce the wasted modeling capability of pixel-based MIM, improving its convergence and achieving non-trivial improvements across various downstream tasks. To the best of our knowledge, we are the first to systematically investigate multi-level feature fusion for isotropic architectures like the standard Vision Transformer (ViT). Notably, when applied to a smaller model (e.g., ViT-S), our method yields significant performance gains, such as 1.2\% on fine-tuning, 2.8\% on linear probing, and 2.6\% on semantic segmentation. Code and models are available at https://github.com/open-mmlab/mmpretrain.

研究动机与目标

  • 解决如 MAE 等基于像素的 MIM 方法对高频细节和低层级特征的固有偏好问题。
  • 通过利用浅层的多层级特征,减少像素重建过程中建模能力的浪费。
  • 系统性地研究在同质架构(如视觉变换器)中多层级特征融合的机制。
  • 在不增加模型复杂度的前提下,提升下游性能和训练效率。

提出的方法

  • 提出多层级特征融合(MFF),一种即插即用的解决方案,将视觉变换器编码器的输出层与选定的浅层/中间层特征进行融合。
  • 采用可学习的、动态加权平均池化策略组合特征,其中各层权重在预训练过程中根据重建重要性动态更新。
  • 在融合前添加一个简单的线性投影层,以对齐各层之间的特征分布,避免领域差距问题。
  • 采用轻量级融合机制,与标准 MAE 相比,计算开销几乎可忽略。
  • 通过频域分析验证,浅层(如第 0 层)因富含高频内容,是主要贡献者,因此被优先选择。
  • 将方法扩展至 PixMIM,证明其在不同基于像素的 MIM 框架中的泛化能力。

实验结果

研究问题

  • RQ1为何基于像素的 MIM 方法(如 MAE)未能充分利用高层语义表征?
  • RQ2多层级特征融合如何影响视觉变换器中的学习动态与损失曲面?
  • RQ3在提升像素重建与下游性能方面,最优的层集合与融合策略是什么?
  • RQ4融合浅层特征是否能减少模型对低层级细节的过度依赖,同时不损失重建保真度?
  • RQ5多层级融合是否能提升模型在分布外数据上的泛化能力与鲁棒性?

主要发现

  • 与标准 MAE 相比,将浅层特征(如第 0 层)与输出层特征融合,使 ViT-S 的线性探测准确率提升 2.8%。
  • ViT-S 的语义分割准确率提升 2.6%,微调准确率提升 1.2%。
  • 使用 MFF 进行预训练,仅用 300 个周期即可达到标准 MAE 1600 个周期的性能,训练时间减少约 5 倍。
  • 该方法降低了学习特征中的高频信息,并使损失曲面更平坦,从而提升了优化稳定性。
  • 分布外鲁棒性得到改善,MFFMAE 在 ImageNet-S 上达到 37.8% 的 top-1 准确率,较 MAE 提升 2.3%。
  • 消融实验表明,线性投影与加权平均池化在性能与效率之间实现了最佳平衡,优于非线性投影与基于注意力的融合方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。