Skip to main content
QUICK REVIEW

[論文レビュー] Incomplete Multimodal Learning for Remote Sensing Data Fusion

Yuxing Chen, Maofan Zhao|arXiv (Cornell University)|Apr 22, 2023
Remote-Sensing Image Classification被引用数 4
ひとこと要約

本論文は、欠損または部分的なモダリティが存在する状況下でも推論時に高い性能を発揮できる、不完全なマルチモーダルリモートセンシングデータ統合のための新規なトランスフォーマー基盤フレームワークを提案する。MultiMAEに類似した構成において、Bi-LSTMアテンション、マスクド自己注意機構、および対照的/再構成事前学習を統合することで、インスタンスセグメンテーションおよびランドカバーマッピングタスクにおいて、DFC2023およびquadrupletsデータセットで最先端の結果を達成した。単一モダリティ入力でも同様の性能を発揮する。

ABSTRACT

The mechanism of connecting multimodal signals through self-attention operation is a key factor in the success of multimodal Transformer networks in remote sensing data fusion tasks. However, traditional approaches assume access to all modalities during both training and inference, which can lead to severe degradation when dealing with modal-incomplete inputs in downstream applications. To address this limitation, our proposed approach introduces a novel model for incomplete multimodal learning in the context of remote sensing data fusion. This approach can be used in both supervised and self-supervised pretraining paradigms and leverages the additional learned fusion tokens in combination with Bi-LSTM attention and masked self-attention mechanisms to collect multimodal signals. The proposed approach employs reconstruction and contrastive loss to facilitate fusion in pre-training while allowing for random modality combinations as inputs in network training. Our approach delivers state-of-the-art performance on two multimodal datasets for tasks such as building instance / semantic segmentation and land-cover mapping tasks when dealing with incomplete inputs during inference.

研究の動機と目的

  • 推論時にモダリティが不完全な状況下で失敗する既存のマルチモーダルリモートセンシングモデルの限界を是正すること。
  • 訓練時および推論時における利用可能なモダリティのすべての可能な部分集合に一般化可能な統一された学習フレームワークの開発。
  • 監視ありおよび自己教師ありの両方の枠組みで、不完全な入力でも性能を維持することができる効果的な事前学習および微調整を可能にすること。
  • 標準的なマルチモーダル統合で見られる、支配的モダリティに過剰に適合する過学習を回避し、モダリティに依存しない表現学習を促進すること。

提案手法

  • 再構成損失および対照的損失を用いたMultiMAEベースの事前学習戦略を導入し、強固なマルチモーダル表現を学習する。
  • 訓練時に入力モダリティをランダムにマスクし、それらを予測することで、欠損モダリティに対処するためのマスクド自己注意機構を採用する。
  • モダリティ間の順序的依存関係をモデル化するため、Bi-LSTMアテンションを用い、特徴の相互作用および統合能力を向上させる。
  • マルチモーダル信号を集約し、表現学習を向上させるために、学習可能な統合トークンを統合する。
  • 一般化を向上させるために、訓練時に異なるモダリティのサブセットを入力として使用するランダムなモダリティ組み合わせ戦略を採用する。
  • 監視あり微調整および自己教師あり事前学習の両方をサポートし、多様な下流タスクへの展開を可能にする。
Figure 1: Overview of the proposed framework. The input to our model is optical images, SAR images, DEM and Maps. Each of those inputs is patched using 2D convolution and projected to feature vectors. All inputs are concatenated with a set of learnable fusion tokens and added to the position embeddi
Figure 1: Overview of the proposed framework. The input to our model is optical images, SAR images, DEM and Maps. Each of those inputs is patched using 2D convolution and projected to feature vectors. All inputs are concatenated with a set of learnable fusion tokens and added to the position embeddi

実験結果

リサーチクエスチョン

  • RQ1統一されたマルチモーダルトランスフォーマー・モデルは、推論時に不完全または欠損したモダリティが存在する状況下でも高い性能を維持できるか?
  • RQ2Bi-LSTMアテンションとマスクド自己注意機構の組み合わせが、不完全なマルチモーダル学習におけるロバストネスをどのように向上させるか?
  • RQ3再構成損失および対照的損失による事前学習が、多様なモダリティの組み合わせにわたる一般化をどの程度向上させるか?
  • RQ4本手法は、単一モダリティ入力も含む、すべてのモダリティサブセットにおいて、既存手法を上回る性能の一貫性を示すか?
  • RQ5モダリティ固有の微調整を必要とせずに、異なるリモートセンシングデータセットに効果的に一般化できるか?

主な発見

  • DFC2023 track2データセットにおいて、本手法は3つのモダリティ(SAR、RGB、DSM)をすべて使用した場合、インスタンスセグメンテーションで0.333 AP@50、セマンティックセグメンテーションで0.851 mIoUを達成し、すべてのベースラインを上回った。
  • SARとRGBの2モダリティでの入力でも、モデルは0.296 AP@50および0.809 mIoUを維持し、欠損モダリティに対する強いロバストネスを示した。
  • 単一モダリティ推論において、SARオンリーモードでは0.040 AP@50および0.552 mIoUを達成し、ベースラインの0.028 AP@50および0.509 mIoUを顕著に上回った。
  • quadrupletsデータセットでは、4つのモダリティ(S1、S2、DEM、DNW)をすべて使用した場合、0.244 mIoUを達成し、2モダリティまたは単一モダリティ入力時でも0.220 mIoU以上を維持した。
  • 微調整パラダイムにおいて、完全な入力では0.300 AP@50および0.849 mIoUを達成したが、SAR+RGB入力時でも0.260 AP@50および0.798 mIoUを達成し、さまざまな設定において一貫した性能を示した。
  • 監視ありおよび自己教師あり事前学習の両方の設定において、既存手法を上回った。特に不完全な入力において顕著な一般化能力を確認した。
Figure 2: DFC2023 track2 data sample.
Figure 2: DFC2023 track2 data sample.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。