Skip to main content
QUICK REVIEW

[论文解读] Exploring Long-Sequence Masked Autoencoders

Ronghang Hu, Shoubhik Debnath|arXiv (Cornell University)|Oct 13, 2022
Multimodal Machine Learning Applications被引用 7
一句话总结

本文提出一种长序列掩码自编码器(MAE),通过将掩码大小与图像块大小解耦,实现在不增加下游推理计算量的前提下,对更长输入序列的有效预训练。通过联合掩码相邻图像块(如2×2块组),该方法保持了重建难度,并在多个数据集上实现了目标检测、实例分割和语义分割任务的一致性能提升,尤其在COCO和ADE20K数据集上表现显著,且在使用长序列时,ImageNet-1K分类结果也表现强劲。

ABSTRACT

Masked Autoencoding (MAE) has emerged as an effective approach for pre-training representations across multiple domains. In contrast to discrete tokens in natural languages, the input for image MAE is continuous and subject to additional specifications. We systematically study each input specification during the pre-training stage, and find sequence length is a key axis that further scales MAE. Our study leads to a long-sequence version of MAE with minimal changes to the original recipe, by just decoupling the mask size from the patch size. For object detection and semantic segmentation, our long-sequence MAE shows consistent gains across all the experimental setups without extra computation cost during the transfer. While long-sequence pre-training is discerned most beneficial for detection and segmentation, we also achieve strong results on ImageNet-1K classification by keeping a standard image size and only increasing the sequence length. We hope our findings can provide new insights and avenues for scaling in computer vision.

研究动机与目标

  • 探究输入序列长度对计算机视觉中掩码自编码的影响,特别是针对长序列、高分辨率输入的情况。
  • 识别将序列长度扩展至标准图像分辨率之外是否能在不增加下游推理成本的前提下,提升表征学习效果。
  • 开发对标准MAE的最小化修改,通过将掩码大小与图像块大小解耦,实现长序列预训练。
  • 在多个基准数据集上,对多样化视觉任务(包括目标检测、分割和图像分类)评估该方法。
  • 证明长序列预训练在丰富场景、高上下文依赖任务(如实例分割和语义分割)中具有显著优势。

提出的方法

  • 通过将相邻图像块(如2×2)组合为单一掩码单元,实现掩码大小与图像块大小的解耦,从而在长序列长度下仍保持任务难度。
  • 修改数据加载器,联合生成掩码图像块索引,而非独立生成,以维持一致的掩码比例和难度。
  • 为ViT-B模型使用更小的解码器(隐藏层尺寸384,12头),以在长序列设置下保持与编码器的架构平衡。
  • 采用联合掩码策略,即使在序列长度从196增至784个图像块(如224×224图像增至512×512图像)时,也能维持重建难度。
  • 在需要时,使用可学习的2×2卷积层下采样解码器序列长度,以保留重建过程中的空间分辨率。
  • 在扩展数据集(如COCO的unlabeled2017子集,共241,690张图像)上进行预训练,数据量翻倍,显著提升下游迁移性能。

实验结果

研究问题

  • RQ1在掩码自编码中增加输入序列长度是否能提升计算机视觉中的表征学习效果?
  • RQ2长序列MAE是否能在不增加下游推理成本的前提下,实现目标检测和分割等密集预测任务的更好性能?
  • RQ3将掩码大小与图像块大小解耦对长序列MAE的稳定性和性能有何影响?
  • RQ4长序列预训练的优势是否在高上下文、复杂场景任务中比标准图像分类任务中更为显著?
  • RQ5长序列MAE是否能在不增加输入分辨率的前提下,实现与ImageNet-1K竞争的准确率?

主要发现

  • 与基线相比,长序列MAE在COCO目标检测任务上实现1.3 APb和1.2 APm的提升,在ADE20K语义分割任务上实现2.6 mIoU的提升,且无额外推理成本。
  • 在COCO数据集上,ViT-B模型使用长序列MAE时达到51.0 APb和45.3 APm,优于基线的49.7和44.1。
  • 对于ViT-L模型,性能提升更为显著:APb达52.3,APm达46.4(基线为50.7和44.9),ADE20K上mIoU提升3.0。
  • 在COCO的train2017 + unlabeled2017组合数据集(241,690张图像)上进行预训练,显著提升了下游性能,证实了长序列MAE在更大数据集上的可扩展性。
  • 在ImageNet-1K上,使用512×512输入的长序列MAE达到83.4%的top-1准确率,与使用448×448评估的224×224标准输入性能相当。
  • 性能增益在密集预测任务中最为明显,表明长序列能更有效地捕捉复杂场景中的上下文与空间依赖关系。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。