Skip to main content
QUICK REVIEW

[论文解读] Masked Autoencoders as Image Processors

Huiyu Duan, Wei Shen|arXiv (Cornell University)|Mar 30, 2023
Image Processing Techniques and Applications被引用 5
一句话总结

本文提出了一种基于掩码自编码器的图像处理方法(MAEIP),这是一种用于图像复原任务的自监督预训练框架,采用了一种新颖的基于Transformer的架构CSformer,该架构结合了通道注意力和移位窗口自注意力机制。MAEIP通过联合重建被掩码的图像块和完整图像,在高斯去噪、真实图像去噪、运动模糊去除、散焦模糊去除和图像去雨任务中实现了最先进性能,显著优于监督和自监督基线方法。

ABSTRACT

Transformers have shown significant effectiveness for various vision tasks including both high-level vision and low-level vision. Recently, masked autoencoders (MAE) for feature pre-training have further unleashed the potential of Transformers, leading to state-of-the-art performances on various high-level vision tasks. However, the significance of MAE pre-training on low-level vision tasks has not been sufficiently explored. In this paper, we show that masked autoencoders are also scalable self-supervised learners for image processing tasks. We first present an efficient Transformer model considering both channel attention and shifted-window-based self-attention termed CSformer. Then we develop an effective MAE architecture for image processing (MAEIP) tasks. Extensive experimental results show that with the help of MAEIP pre-training, our proposed CSformer achieves state-of-the-art performance on various image processing tasks, including Gaussian denoising, real image denoising, single-image motion deblurring, defocus deblurring, and image deraining.

研究动机与目标

  • 探究掩码自编码器(MAE)是否可有效扩展至低层次视觉任务,如图像复原。
  • 设计一种高效的基于Transformer的架构CSformer,结合通道注意力和移位窗口自注意力机制,以提升图像处理中的性能与效率。
  • 开发一种基于MAE的新型预训练框架MAEIP,专为图像处理任务设计,通过重建被掩码的图像块和完整图像实现。
  • 证明通过MAEIP进行自监督预训练可显著提升多种图像复原基准测试的性能。

提出的方法

  • 提出CSformer,一种具有分层设计的U形Transformer,结合通道注意力与移位窗口自注意力机制,以更好地建模长距离依赖关系并提升计算效率。
  • 设计MAEIP,一种掩码自编码框架,其中随机掩码图像块,模型通过编码器重建被掩码的图像块,同时通过解码器重建完整图像。
  • 采用U-Net风格架构并引入跳跃连接,以保留空间细节并提升重建质量。
  • 使用直接像素重建作为预训练目标,类似于SIMMIM,被掩码的图像块直接输入编码器。
  • 采用两阶段预训练策略以提升效率,先预训练编码器,再微调完整模型。
  • 通过标准监督损失函数对预训练的CSformer进行微调,应用于下游图像复原任务。

实验结果

研究问题

  • RQ1掩码自编码器在高层视觉任务中表现优异,能否有效推广至低层次图像处理任务,如去噪和去模糊?
  • RQ2通道注意力与移位窗口自注意力机制的结合如何提升图像复原Transformer的性能与效率?
  • RQ3通过MAEIP联合重建被掩码的图像块与完整图像,是否能带来优于单目标预训练的特征学习效果?
  • RQ4预训练长度与训练策略对图像复原任务下游性能有何影响?

主要发现

  • 所提出的CSformer-T2在SIDD测试集上达到39.77 dB PSNR,性能与Uformer-S相当,但计算成本从43.86 GMACs降低至13.50 GMACs。
  • 与无预训练相比,MAEIP预训练使CSformer-T在Rain100L和Test100数据集上的平均性能提升0.5 dB。
  • 同时重建编码器与解码器输出(即MAEIP)的性能优于仅预训练编码器或仅预训练解码器,证明了联合重建的优势。
  • 采用两阶段预训练策略可节省25%的训练时间,同时达到与完整60轮预训练相当的性能。
  • 60轮预训练比30轮预训练获得更优的下游性能,证实了更长预训练周期的优势。
  • MAEIP框架在更大模型上也表现出良好的泛化能力,在高斯去噪、真实图像去噪、运动模糊去除、散焦模糊去除和图像去雨任务中均达到最先进性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。