[论文解读] Masked Autoencoders as Image Processors
本文提出了一种基于掩码自编码器的图像处理方法(MAEIP),这是一种用于图像复原任务的自监督预训练框架,采用了一种新颖的基于Transformer的架构CSformer,该架构结合了通道注意力和移位窗口自注意力机制。MAEIP通过联合重建被掩码的图像块和完整图像,在高斯去噪、真实图像去噪、运动模糊去除、散焦模糊去除和图像去雨任务中实现了最先进性能,显著优于监督和自监督基线方法。
Transformers have shown significant effectiveness for various vision tasks including both high-level vision and low-level vision. Recently, masked autoencoders (MAE) for feature pre-training have further unleashed the potential of Transformers, leading to state-of-the-art performances on various high-level vision tasks. However, the significance of MAE pre-training on low-level vision tasks has not been sufficiently explored. In this paper, we show that masked autoencoders are also scalable self-supervised learners for image processing tasks. We first present an efficient Transformer model considering both channel attention and shifted-window-based self-attention termed CSformer. Then we develop an effective MAE architecture for image processing (MAEIP) tasks. Extensive experimental results show that with the help of MAEIP pre-training, our proposed CSformer achieves state-of-the-art performance on various image processing tasks, including Gaussian denoising, real image denoising, single-image motion deblurring, defocus deblurring, and image deraining.
研究动机与目标
- 探究掩码自编码器(MAE)是否可有效扩展至低层次视觉任务,如图像复原。
- 设计一种高效的基于Transformer的架构CSformer,结合通道注意力和移位窗口自注意力机制,以提升图像处理中的性能与效率。
- 开发一种基于MAE的新型预训练框架MAEIP,专为图像处理任务设计,通过重建被掩码的图像块和完整图像实现。
- 证明通过MAEIP进行自监督预训练可显著提升多种图像复原基准测试的性能。
提出的方法
- 提出CSformer,一种具有分层设计的U形Transformer,结合通道注意力与移位窗口自注意力机制,以更好地建模长距离依赖关系并提升计算效率。
- 设计MAEIP,一种掩码自编码框架,其中随机掩码图像块,模型通过编码器重建被掩码的图像块,同时通过解码器重建完整图像。
- 采用U-Net风格架构并引入跳跃连接,以保留空间细节并提升重建质量。
- 使用直接像素重建作为预训练目标,类似于SIMMIM,被掩码的图像块直接输入编码器。
- 采用两阶段预训练策略以提升效率,先预训练编码器,再微调完整模型。
- 通过标准监督损失函数对预训练的CSformer进行微调,应用于下游图像复原任务。
实验结果
研究问题
- RQ1掩码自编码器在高层视觉任务中表现优异,能否有效推广至低层次图像处理任务,如去噪和去模糊?
- RQ2通道注意力与移位窗口自注意力机制的结合如何提升图像复原Transformer的性能与效率?
- RQ3通过MAEIP联合重建被掩码的图像块与完整图像,是否能带来优于单目标预训练的特征学习效果?
- RQ4预训练长度与训练策略对图像复原任务下游性能有何影响?
主要发现
- 所提出的CSformer-T2在SIDD测试集上达到39.77 dB PSNR,性能与Uformer-S相当,但计算成本从43.86 GMACs降低至13.50 GMACs。
- 与无预训练相比,MAEIP预训练使CSformer-T在Rain100L和Test100数据集上的平均性能提升0.5 dB。
- 同时重建编码器与解码器输出(即MAEIP)的性能优于仅预训练编码器或仅预训练解码器,证明了联合重建的优势。
- 采用两阶段预训练策略可节省25%的训练时间,同时达到与完整60轮预训练相当的性能。
- 60轮预训练比30轮预训练获得更优的下游性能,证实了更长预训练周期的优势。
- MAEIP框架在更大模型上也表现出良好的泛化能力,在高斯去噪、真实图像去噪、运动模糊去除、散焦模糊去除和图像去雨任务中均达到最先进性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。