Skip to main content
QUICK REVIEW

[论文解读] Scale-MAE: A Scale-Aware Masked Autoencoder for Multiscale Geospatial Representation Learning

Colorado Reed, Ritwik Gupta|arXiv (Cornell University)|Dec 30, 2022
Domain Adaptation and Few-Shot Learning被引用 11
一句话总结

Scale-MAE 是一种尺度感知的掩码自编码器,通过引入基于地面采样距离(GSD)的位置编码和拉普拉斯金字塔解码器,在多尺度遥感图像上预训练视觉变换器,以在多个尺度上重建低频和高频特征。它在 8 个遥感数据集上的非参数 kNN 分类任务中实现了 2.4–5.6% 的平均性能提升,在 SpaceNet 建筑物分割任务中实现了 0.9–1.7 mIoU 的增益,优于包括原始 MAE、SatMAE 和 ConvMAE 在内的最先进方法。

ABSTRACT

Large, pretrained models are commonly finetuned with imagery that is heavily augmented to mimic different conditions and scales, with the resulting models used for various tasks with imagery from a range of spatial scales. Such models overlook scale-specific information in the data for scale-dependent domains, such as remote sensing. In this paper, we present Scale-MAE, a pretraining method that explicitly learns relationships between data at different, known scales throughout the pretraining process. Scale-MAE pretrains a network by masking an input image at a known input scale, where the area of the Earth covered by the image determines the scale of the ViT positional encoding, not the image resolution. Scale-MAE encodes the masked image with a standard ViT backbone, and then decodes the masked image through a bandpass filter to reconstruct low/high frequency images at lower/higher scales. We find that tasking the network with reconstructing both low/high frequency images leads to robust multiscale representations for remote sensing imagery. Scale-MAE achieves an average of a $2.4 - 5.6\%$ non-parametric kNN classification improvement across eight remote sensing datasets compared to current state-of-the-art and obtains a $0.9$ mIoU to $1.7$ mIoU improvement on the SpaceNet building segmentation transfer task for a range of evaluation scales.

研究动机与目标

  • 为了解决现有自监督预训练方法在遥感领域中缺乏尺度感知性的问题,这些方法在不同空间尺度间泛化能力差。
  • 使单个预训练模型能够在无需按尺度微调的情况下,有效泛化于从 0.3m 到 1km 的多种地面采样距离(GSD)上。
  • 通过在预训练过程中显式建模尺度关系,提升在多尺度遥感任务(如分类和语义分割)中的下游性能。
  • 通过在预训练阶段学习鲁棒且可迁移的跨尺度表征,减少对尺度特定微调的需求。
  • 提出一种新型架构,结合基于 GSD 的位置编码与多阶段拉普拉斯金字塔解码器,实现渐进式的多尺度重建。

提出的方法

  • Scale-MAE 使用带有地面采样距离位置编码(GSDPE)的视觉变换器(ViT)编码器,其中位置嵌入根据输入图像实际覆盖的区域进行缩放,而非其分辨率。
  • 模型对输入图像的图像块进行掩码,并通过三阶段解码器进行重建:(1) 轻量级 ViT 解码器,(2) 渐进式转置卷积以升采样特征图,(3) 拉普拉斯模块以提取低频和高频分量。
  • 解码器输出两个结果:一个低频图像(平滑化)和一个高频残差(边缘丰富),并使用不同的损失函数:高频分量使用 L1 损失,低频分量使用 L2 损失。
  • 模型通过多尺度重建目标进行预训练,同一编码器处理具有不同已知 GSD 的图像,使网络能够学习尺度不变的表征。
  • GSDPE 确保 ViT 同时关注空间位置和尺度,使模型能够理解图像在地球上的物理覆盖范围。
  • 拉普拉斯金字塔结构在参数更少的情况下实现了高效的多尺度特征重建,相比标准 MAE 表现更强。

实验结果

研究问题

  • RQ1自监督预训练方法是否能够显式学习不同已知空间尺度图像之间的关系,从而提升遥感领域下游任务的泛化能力?
  • RQ2基于图像覆盖地面面积的尺度感知位置编码,对模型在多个 GSD 下的性能有何影响?
  • RQ3通过拉普拉斯金字塔解码器同时重建低频和高频分量,是否能比标准 MAE 或近期变体获得更鲁棒的多尺度表征?
  • RQ4Scale-MAE 在多尺度遥感基准测试中,与 SatMAE 和 ConvMAE 等最先进方法相比,优势有多大?
  • RQ5单个预训练模型是否能在无需按尺度微调的情况下,在多种评估尺度上实现优异性能?

主要发现

  • 与最先进方法相比,Scale-MAE 在 8 个多样化的遥感数据集上的非参数 kNN 分类准确率平均提升了 2.4–5.6%。
  • 在 SpaceNet 建筑物分割基准上,Scale-MAE 在多个评估尺度下实现了 0.9 至 1.7 的 mIoU 提升,证明了其卓越的泛化能力。
  • 消融实验证明,同时重建低频和高频分量的性能优于仅重建单一成分,联合损失函数的表现优于单独使用任一损失。
  • 较少的解码器层数(如 2–4 层)比更深的解码器表现更优,表明在结合多尺度重建时,轻量级解码器已足够。
  • 基于 GSD 的位置编码显著提升了尺度泛化能力,缺乏该模块的模型无法在不同尺度间有效适应。
  • 尽管由于高分辨率重建导致 GPU 显存使用量增加,Scale-MAE 仍保持了良好的效率和泛化能力,优于原始 MAE 和近期 SOTA 方法如 SatMAE 和 ConvMAE。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。