Skip to main content
QUICK REVIEW

[論文レビュー] Feature Guided Masked Autoencoder for Self-supervised Learning in Remote Sensing

Yi Wang, Hugo Hernández Hernández|arXiv (Cornell University)|Oct 28, 2023
Image Processing Techniques and Applications被引用数 5
ひとこと要約

本稿では、リモートセンシングのための自己教師付き学習手法として、特徴ガイドドマスクド自己オートエンコーダー(FG-MAE)を提案する。FG-MAEは、MAEにおける生画像再構成を、マルチスペクトル画像ではHOGとNDI、SAR画像ではHOGのみの画像特徴の再構成に置き換える。FG-MAEは、特にノイズの多いSAR画像において最先端の性能を達成し、0.7Bパラメータを有するViT-Hugeモデルに対しても効率的にスケーリング可能である。

ABSTRACT

Self-supervised learning guided by masked image modelling, such as Masked AutoEncoder (MAE), has attracted wide attention for pretraining vision transformers in remote sensing. However, MAE tends to excessively focus on pixel details, thereby limiting the model's capacity for semantic understanding, in particular for noisy SAR images. In this paper, we explore spectral and spatial remote sensing image features as improved MAE-reconstruction targets. We first conduct a study on reconstructing various image features, all performing comparably well or better than raw pixels. Based on such observations, we propose Feature Guided Masked Autoencoder (FG-MAE): reconstructing a combination of Histograms of Oriented Graidents (HOG) and Normalized Difference Indices (NDI) for multispectral images, and reconstructing HOG for SAR images. Experimental results on three downstream tasks illustrate the effectiveness of FG-MAE with a particular boost for SAR imagery. Furthermore, we demonstrate the well-inherited scalability of FG-MAE and release a first series of pretrained vision transformers for medium resolution SAR and multispectral images.

研究の動機と目的

  • 標準的なMAEが、特にスペックルノイズを含むSAR画像においてピクセルレベルのノイズやアーティファクトに過剰に注目するという限界に対処すること。
  • 自己教師付き事前学習のマスクドオートエンコーディングにおいて、生ピクセルの代わりにエキスパートが設計した画像特徴(例:HOG、NDI)がより優れた再構成ターゲットとなるかどうかを検証すること。
  • マルチスペクトルおよびSARリモートセンシングのためのビジョントランスフォーマーにおける意味的理解を向上させる、統一的で効率的かつスケーラブルな手法を開発すること。
  • 特徴ガイドド再構成が、シーン分類およびセマンティックセグメンテーションタスクにおける下流性能を向上させることを実証すること。
  • マルチスペクトルおよびSAR画像のための事前学習済みビジョントランスフォーマーのシリーズ(最大ViT-Huge、0.7Bパラメータ)をリリースし、将来のファウンデーションモデル研究を支援すること。

提案手法

  • 標準的なMAEの再構成ターゲット(生画像パッチ)を、マルチスペクトルデータでは空間的構造を表すHOG、スペクトル情報を表すNDIという意味特徴に置き換える。
  • SAR画像の場合、スペックルノイズへの感受性を低減しつつ空間的意味を保持するため、HOG特徴のみを用いる。
  • MAEの非対称エンコーダ・デコーダアーキテクチャを適応し、75%のパッチをマスクし、別個のデコーダヘッドを用いてマスクされた特徴のみを再構成する。
  • 予測値と真値特徴間のMSE損失を用いて、エンドツーエンドでモデルを学習する。マルチスペクトル設定では、HOGおよびNDI用に別個の予測ヘッドを用意する。
  • SmallからHugeまでのさまざまなサイズのViTアーキテクチャにこの手法をスケーリングし、MAEと同等の効率性を維持するとともに、線形評価および微調整プロトコルを可能にする。
  • 手作業で設計された特徴を介してドメイン固有の知識を統合し、追加の教師信号を必要とせずに表現学習をガイドする。

実験結果

リサーチクエスチョン

  • RQ1生画像再構成を意味特徴(例:HOG、NDI)に置き換えることで、リモートセンシングにおける自己教師付き表現学習が向上するか?
  • RQ2マルチスペクトルおよびSAR画像における下流性能の観点から、特徴ガイドド再構成は標準的なMAEと比べてどのように異なるか?
  • RQ3マルチスペクトル画像の事前学習において、空間的特徴とスペクトル的特徴の組み合わせのうち、最も優れた性能を達成するのはどれか?
  • RQ4FG-MAEは、線形評価下で、ViT-Hugeのような大規模なビジョントランスフォーマーアーキテクチャに効果的にスケーリングできるか?
  • RQ5標準的なMAEと比較して、FG-MAEはSAR画像におけるスペックルノイズの悪影響を軽減できるか?

主な発見

  • FG-MAEは、BigEarthNet-MM、EuroSAT、DFC2020の3つの下流タスクすべてにおいて、標準的なMAEを上回る性能を示し、一貫した向上を確認した。
  • EuroSATデータセットでは、FG-MAEがセマンティックセグメンテーションで85.4%のmIoUを達成し、MAEの80.4%と比較して4.5%の絶対的向上を示した。
  • DFC2020のSAR画像では、FG-MAEがmIoUをMAEの38.9%から39.3%へと向上させ、SARデータの難易度の高さにもかかわらず明確な改善を示した。
  • FG-MAEはViT-Huge(0.7Bパラメータ)に対しても効果的にスケーリング可能であり、線形評価下でBigEarthNet-MMで80.7%のトップ1正答率を達成し、MAEの79.3%を上回った。
  • この手法はMAEと同等の計算効率を維持しており、大規模なファウンデーションモデルのトレーニングおよび評価に顕著なオーバーヘッドを追加せずに可能である。
  • FG-MAEにおける再構成特徴は、ノイジーな真値SAR画像よりも明確に見えることが多く、デスペックリングなどの低レベル画像修復タスクへの応用可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。