[論文レビュー] SkySense: A Multi-Modal Remote Sensing Foundation Model Towards Universal Interpretation for Earth Observation Imagery
SkySenseは、因子化された時空間エンコーダーとクロスモーダルアライメントを用いて、光学画像、SAR、時系列データを統合するマルチモーダルなリモートセンシング基盤モデルを提案する。これにより、地球観測画像のユニバーサルな解釈が可能となる。シーン分類、オブジェクト検出、セマンティックセグメンテーションといった下流タスクにおいて、最先端の性能を達成し、限られた微調整データでも優れた汎化性能、高速な収束、高いロバスト性を示す。AID(20%の訓練データ)において、SatLas、Scale-MAE、GFMといった先行モデルを最大28.09%の正確性向上で上回った。
Prior studies on Remote Sensing Foundation Model (RSFM) reveal immense potential towards a generic model for Earth Observation. Nevertheless, these works primarily focus on a single modality without temporal and geo-context modeling, hampering their capabilities for diverse tasks. In this study, we present SkySense, a generic billion-scale model, pre-trained on a curated multi-modal Remote Sensing Imagery (RSI) dataset with 21.5 million temporal sequences. SkySense incorporates a factorized multi-modal spatiotemporal encoder taking temporal sequences of optical and Synthetic Aperture Radar (SAR) data as input. This encoder is pre-trained by our proposed Multi-Granularity Contrastive Learning to learn representations across different modal and spatial granularities. To further enhance the RSI representations by the geo-context clue, we introduce Geo-Context Prototype Learning to learn region-aware prototypes upon RSI's multi-modal spatiotemporal features. To our best knowledge, SkySense is the largest Multi-Modal RSFM to date, whose modules can be flexibly combined or used individually to accommodate various tasks. It demonstrates remarkable generalization capabilities on a thorough evaluation encompassing 16 datasets over 7 tasks, from single- to multi-modal, static to temporal, and classification to localization. SkySense surpasses 18 recent RSFMs in all test scenarios. Specifically, it outperforms the latest models such as GFM, SatLas and Scale-MAE by a large margin, i.e., 2.76%, 3.67% and 3.61% on average respectively. We will release the pre-trained weights to facilitate future research and Earth Observation applications.
研究の動機と目的
- 多様なリモートセンシングタスクとモダリティに一般化可能な地球観測用ユニバーサル基盤モデルの開発を目的とする。
- マルチモーダル(光学、SAR、時系列)およびマルチスケール(高、中、小)入力を統合することで、リモートセンシングにおける特徴表現学習を向上させることを目的とする。
- 新しい因子化された時空間エンコーダーと注目ベースの地理的文脈統合を用いて、モデルの効率性と収束速度を向上させることを目的とする。
- 統一された事前学習フレームワークを用いて、ゼロショットおよびフェイントショットの転移学習のベンチマークを確立することを目的とする。
- 主要なディープラーニングフレームワークと互換性があり、多様な下流応用に適した柔軟で再利用可能かつ相互運用可能な事前学習モデルを提供することを目的とする。
提案手法
- 空間的および時系列的ダイナミクスを別々にモデル化する因子化された時空間エンコーダーを採用し、効率性と表現品質の向上を図る。
- 対照的学習を用いたクロスモーダルアライメントを導入し、光学、SAR、時系列モダリティ間の特徴をアライメントすることで、マルチモーダル統合を強化する。
- 地域固有のプロトタイプを組み込む注目型地理的文脈統合モジュールを採用し、空間的特徴に文脈的認識を付加する。
- 時間的・空間的に整合されたSentinel-2、Sentinel-1およびその他の地球観測データを統合した大規模かつ多様なデータセットを用いて事前学習を行う。
- マスクされた自己符号化と対照的学習を用いた段階的な事前学習戦略を採用し、強固で汎化可能な表現を学習する。
- MMCv、PyTorch、TIMMと互換性のあるモジュラーな事前学習コンponents(空間エンコーダー、統合トランスフォーマー、地理的文脈モジュール)を提供し、下流の展開を柔軟に可能にする。
実験結果
リサーチクエスチョン
- RQ1マルチモーダルな基盤モデルは、シーン分類、オブジェクト検出、セマンティックセグメンテーションといった多様な地球観測タスクにおいて、優れた汎化性能を達成できるか?
- RQ2フェイントショットおよびフルショットの設定下で、SkySenseモデルはSatLas、Scale-MAE、GFMといった既存のリモートセンシング基盤モデルと比較して、収束速度と性能においてどのように差をつけるか?
- RQ3光学、SAR、時系列データの統合は、単一モダリティまたは二モダリティのベースラインと比較して、特徴表現と下流タスクの正確性をどの程度向上させるか?
- RQ4因子化された時空間エンコーダーは、計算効率を維持しつつ、時空間的依存関係を効果的に捉えられるか?
- RQ5モデルのスケールとパラメータ数は性能にどのような影響を与えるか?また、スケールが小さいバージョン(例:Swin-L)は、完全なスケールの事前学習なしでも強力な汎化性能を維持できるか?
主な発見
- AIDデータセット(20%の訓練データ)において、SkySenseは全体の正確性が94.07%を達成し、SatLasを28.09%、Scale-MAEを17.64%上回った。
- DIORにおけるオブジェクト検出では、SkySenseがmAP50で72.54%を達成し、次善の手法(Scale-MAE:60.46%)を12.08%上回った。
- iSAIDにおけるセマンティックセグメンテーションでは、SkySenseがmIoUで65.40%を達成し、他の手法と比較して平均9.69%の向上を示し、強力な汎化性能を実証した。
- AID(1%の訓練データ)において、SkySenseはたった20エポックで収束したが、他のモデルは最低でも140エポックを要し、低い性能で不安定な結果にとどまった。
- 大規模なSwin-Hバックボーンを小規模なSwin-Lに置き換えても、SkySenseは強力な性能(例:RESISC-45では88.74%のOA)を維持した。これはスケーラビリティと効率性を裏付ける。
- BigEarthNet-MMでは、マルチモーダル(光学+SAR)シーン分類で最先端の性能を達成し、複雑な実世界のマルチセンサーシナリオにおけるロバスト性を検証した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。