Skip to main content
QUICK REVIEW

[论文解读] Feature Guided Masked Autoencoder for Self-supervised Learning in Remote Sensing

Yi Wang, Hugo Hernández Hernández|arXiv (Cornell University)|Oct 28, 2023
Image Processing Techniques and Applications被引用 5
一句话总结

本文提出特征引导掩码自编码器(FG-MAE),一种用于遥感的自监督学习方法,将MAE中的原始图像重建替换为语义图像特征重建——多光谱数据使用HOG和NDI,SAR数据仅使用HOG。FG-MAE在性能上达到当前最先进水平,尤其在噪声较大的SAR图像上表现优异,并能高效扩展至参数量达0.7B的ViT-Huge模型。

ABSTRACT

Self-supervised learning guided by masked image modelling, such as Masked AutoEncoder (MAE), has attracted wide attention for pretraining vision transformers in remote sensing. However, MAE tends to excessively focus on pixel details, thereby limiting the model's capacity for semantic understanding, in particular for noisy SAR images. In this paper, we explore spectral and spatial remote sensing image features as improved MAE-reconstruction targets. We first conduct a study on reconstructing various image features, all performing comparably well or better than raw pixels. Based on such observations, we propose Feature Guided Masked Autoencoder (FG-MAE): reconstructing a combination of Histograms of Oriented Graidents (HOG) and Normalized Difference Indices (NDI) for multispectral images, and reconstructing HOG for SAR images. Experimental results on three downstream tasks illustrate the effectiveness of FG-MAE with a particular boost for SAR imagery. Furthermore, we demonstrate the well-inherited scalability of FG-MAE and release a first series of pretrained vision transformers for medium resolution SAR and multispectral images.

研究动机与目标

  • 解决标准MAE在遥感中因过度关注像素级噪声和伪影(尤其在具有斑点噪声的SAR图像中)而存在的局限性。
  • 探究专家设计的图像特征是否可作为掩码自编码中比原始像素更优的重建目标。
  • 开发一种统一、高效且可扩展的方法,以增强视觉变换器在多光谱和SAR遥感中的语义理解能力。
  • 证明特征引导重建可提升在场景分类和语义分割任务中的下游性能。
  • 发布一系列预训练视觉变换器模型,涵盖多光谱和SAR图像,最大至ViT-Huge(0.7B参数),以支持未来基础模型研究。

提出的方法

  • 将标准MAE的重建目标(原始图像块)替换为语义图像特征:在多光谱数据中,使用HOG表示空间结构,NDI表示光谱信息。
  • 对于SAR图像,仅使用HOG特征以降低对斑点噪声的敏感性,同时保留空间语义。
  • 采用MAE的非对称编码器-解码器架构,掩码75%的图像块,并仅使用独立的解码器头重建被掩码的特征。
  • 通过预测特征与真实特征之间的重建损失(MSE)端到端训练模型,在多光谱设置中为HOG和NDI分别设置独立的预测头。
  • 将方法扩展至不同尺寸的ViT架构(从Small到Huge),保持MAE的效率,并支持线性评估和微调协议。
  • 通过手工设计的特征引入领域特定知识,以指导表示学习,而无需额外监督。

实验结果

研究问题

  • RQ1能否通过用语义图像特征(如HOG、NDI)替代原始图像重建,提升遥感中的自监督表示学习?
  • RQ2在多光谱和SAR图像上,特征引导重建与标准MAE相比,其下游性能如何?
  • RQ3在多光谱图像预训练中,空间特征与光谱特征的何种组合能取得最佳性能?
  • RQ4FG-MAE在大型视觉变换器架构(如ViT-Huge)上是否能有效扩展,特别是在线性评估下?
  • RQ5与标准MAE相比,FG-MAE能否有效缓解SAR图像中斑点噪声的负面影响?

主要发现

  • FG-MAE在所有三项下游任务中均优于标准MAE:BigEarthNet-MM上的场景分类、EuroSAT上的场景分类,以及DFC2020上的语义分割,表现出一致的性能提升。
  • 在EuroSAT数据集上,FG-MAE在语义分割中达到85.4%的mIoU,较MAE的80.4%绝对提升4.5个百分点。
  • 在DFC2020的SAR图像上,FG-MAE将mIoU从MAE的38.9%提升至39.3%,尽管SAR数据极具挑战性,仍显示出可测量的性能增益。
  • FG-MAE能有效扩展至ViT-Huge(0.7B参数),在线性评估下于BigEarthNet-MM上达到80.7%的top-1准确率,优于MAE的79.3%。
  • 该方法保持了MAE的计算效率,使大规模基础模型的训练与评估无需显著增加开销。
  • FG-MAE中重建的特征常比噪声较大的真实SAR图像更清晰,表明其在去斑点等低层次图像恢复任务中具有潜在应用价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。