Skip to main content
QUICK REVIEW

[논문 리뷰] Incomplete Multimodal Learning for Remote Sensing Data Fusion

Yuxing Chen, Maofan Zhao|arXiv (Cornell University)|2023. 04. 22.
Remote-Sensing Image Classification인용 수 4
한 줄 요약

이 논문은 부족한 다중모달 원격 감지 데이터 융합을 위한 새로운 트랜스포머 기반 프레임워크를 제안하며, 결측 또는 부분적인 모달리티가 존재하는 상황에서도 추론 시 강건한 성능을 보장한다. MultiMAE 유사 구조에서 Bi-LSTM 어텐션, 마스킹된 자기어텐션, 그리고 대비/재구성 사전학습을 통합함으로써, 인스턴스 세그멘테이션 및 지형 지도 제작 작업에서 DFC2023 및 쿼드럽렛츠 데이터셋에서 최신 기술(SOTA) 성능을 달성한다. 단일 모달리티 입력 조건에서도 성능이 뛰어나다.

ABSTRACT

The mechanism of connecting multimodal signals through self-attention operation is a key factor in the success of multimodal Transformer networks in remote sensing data fusion tasks. However, traditional approaches assume access to all modalities during both training and inference, which can lead to severe degradation when dealing with modal-incomplete inputs in downstream applications. To address this limitation, our proposed approach introduces a novel model for incomplete multimodal learning in the context of remote sensing data fusion. This approach can be used in both supervised and self-supervised pretraining paradigms and leverages the additional learned fusion tokens in combination with Bi-LSTM attention and masked self-attention mechanisms to collect multimodal signals. The proposed approach employs reconstruction and contrastive loss to facilitate fusion in pre-training while allowing for random modality combinations as inputs in network training. Our approach delivers state-of-the-art performance on two multimodal datasets for tasks such as building instance / semantic segmentation and land-cover mapping tasks when dealing with incomplete inputs during inference.

연구 동기 및 목표

  • 기존의 다중모달 원격 감지 모델이 추론 시 모달리티가 불완전한 조건에서 실패하는 한계를 해결하기 위해.
  • 학습 및 추론 과정에서 이용 가능한 모든 모달리티 조합에 대해 일반화 가능한 통합 학습 프레임워크를 개발하기 위해.
  • 모달리티가 불완전한 입력에서도 성능을 유지하면서, 지도학습 및 비지도학습 모두에서 효과적인 사전학습 및 미세조정을 가능하게 하기 위해.
  • 기본적인 다중모달 융합에서 흔히 관찰되는 주로 우세한 모달리티에 대한 과적합 문제를 해결하기 위해, 모달리티 불변 표현 학습을 촉진하기 위해.

제안 방법

  • 재구성 및 대비 손실을 포함한 MultiMAE 기반 사전학습 전략을 도입하여 강건한 다중모달 표현을 학습한다.
  • 학습 중에 입력 모달리티를 무작위로 마스킹하고 이를 예측함으로써, 결측 모달리티를 처리하기 위해 마스킹된 자기어텐션을 활용한다.
  • 모달리티 간의 순차적 의존성을 모델링하기 위해 Bi-LSTM 어텐션을 사용하여 특징 상호작용 및 융합 능력을 향상시킨다.
  • 다중모달 신호를 집계하고 표현 학습을 향상시키기 위해 학습 가능한 융합 토큰을 통합한다.
  • 일반화 능력을 향상시키기 위해 학습 중에 다양한 모달리티 조합을 입력으로 사용하는 무작위 모달리티 조합 전략을 적용한다.
  • 지도학습 미세조정 및 비지도학습 사전학습을 모두 지원하여 다양한 후행 작업에 적용 가능하도록 한다.
Figure 1: Overview of the proposed framework. The input to our model is optical images, SAR images, DEM and Maps. Each of those inputs is patched using 2D convolution and projected to feature vectors. All inputs are concatenated with a set of learnable fusion tokens and added to the position embeddi
Figure 1: Overview of the proposed framework. The input to our model is optical images, SAR images, DEM and Maps. Each of those inputs is patched using 2D convolution and projected to feature vectors. All inputs are concatenated with a set of learnable fusion tokens and added to the position embeddi

실험 결과

연구 질문

  • RQ1일관되지 않은 또는 결측된 모달리티가 존재하는 상황에서 테스트되는 통합 다중모달 트랜스포머 모델이 높은 성능을 유지할 수 있는가?
  • RQ2Bi-LSTM 어텐션과 마스킹된 자기어텐션의 조합이 결측 다중모달 학습에서 강건성을 어떻게 향상시키는가?
  • RQ3재구성 및 대비 손실을 통한 사전학습이 다양한 모달리티 조합 간의 일반화 능력을 얼마나 향상시키는가?
  • RQ4제안된 방법이 단일 모달리티 입력 포함 모든 모달리티 조합에 대해 기존 방법보다 성능 일관성을 높이는가?
  • RQ5모달리티 특화 미세조정 없이도 다양한 원격 감지 데이터셋 간에 효과적으로 일반화할 수 있는가?

주요 결과

  • DFC2023 트랙2 데이터셋에서, 제안된 방법은 세 가지 모달리티(SAR, RGB, DSM)를 모두 사용할 경우 인스턴스 세그멘테이션에서 0.333 AP@50, 의미 세그멘테이션에서 0.851 mIoU를 달성하여 모든 베이스라인을 초월했다.
  • SAR와 RGB만을 입력으로 사용할 경우에도 모델는 0.296 AP@50와 0.809 mIoU를 유지하여 결측 모달리티에 대한 강건성을 입증했다.
  • 단일 모달리티 추론 상황에서는 SAR 전용 입력에서 0.040 AP@50와 0.552 mIoU를 기록했으며, 베이스라인(0.028 AP@50, 0.509 mIoU)보다 뚜렷이 뛰어난 성능을 보였다.
  • 쿼드럽렛츠 데이터셋에서는 네 가지 모달리티(S1, S2, DEM, DNW)를 모두 사용할 경우 0.244 mIoU를 달성했고, 두 모달리티 또는 단일 모달리티 입력 조건에서도 0.220 mIoU 이상을 유지했다.
  • 미세조정 파라다임에서, 전체 입력 조건에서는 0.300 AP@50와 0.849 mIoU를 기록했고, SAR+RGB 입력 조건에서도 0.260 AP@50와 0.798 mIoU를 달성하여 다양한 설정 간 일관된 성능을 보였다.
  • 지도학습 및 비지도학습 사전학습 환경 모두에서 기존 방법보다 뛰어난 성능을 보였으며, 특히 결측 입력 조건에서 그 일반화 능력이 확인되었다.
Figure 2: DFC2023 track2 data sample.
Figure 2: DFC2023 track2 data sample.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.