[논문 리뷰] SkySense: A Multi-Modal Remote Sensing Foundation Model Towards Universal Interpretation for Earth Observation Imagery
SkySense는 광학, SAR, 시간적 데이터를 인코딩하는 인코더와 교차 모달 정렬을 통해 통합하는 다중 모odal 원격 감지 기초 모델을 제안한다. 이는 지구 관측 영상의 보편적 해석을 가능하게 하며, 시나리오 분류, 객체 검출, 의미적 세그멘테이션 등의 후행 작업에서 최신 기술 수준의 성능을 달성한다. 이는 제한된 미세조정 데이터로도 뛰어난 일반화 능력, 더 빠른 수렴 속도, 높은 강인성을 보이며, SatLas, Scale-MAE, GFM 등의 이전 모델보다 AID 데이터셋(20% 학습 데이터)에서 전체 정확도 최대 28.09% 향상.
Prior studies on Remote Sensing Foundation Model (RSFM) reveal immense potential towards a generic model for Earth Observation. Nevertheless, these works primarily focus on a single modality without temporal and geo-context modeling, hampering their capabilities for diverse tasks. In this study, we present SkySense, a generic billion-scale model, pre-trained on a curated multi-modal Remote Sensing Imagery (RSI) dataset with 21.5 million temporal sequences. SkySense incorporates a factorized multi-modal spatiotemporal encoder taking temporal sequences of optical and Synthetic Aperture Radar (SAR) data as input. This encoder is pre-trained by our proposed Multi-Granularity Contrastive Learning to learn representations across different modal and spatial granularities. To further enhance the RSI representations by the geo-context clue, we introduce Geo-Context Prototype Learning to learn region-aware prototypes upon RSI's multi-modal spatiotemporal features. To our best knowledge, SkySense is the largest Multi-Modal RSFM to date, whose modules can be flexibly combined or used individually to accommodate various tasks. It demonstrates remarkable generalization capabilities on a thorough evaluation encompassing 16 datasets over 7 tasks, from single- to multi-modal, static to temporal, and classification to localization. SkySense surpasses 18 recent RSFMs in all test scenarios. Specifically, it outperforms the latest models such as GFM, SatLas and Scale-MAE by a large margin, i.e., 2.76%, 3.67% and 3.61% on average respectively. We will release the pre-trained weights to facilitate future research and Earth Observation applications.
연구 동기 및 목표
- 다양한 원격 감지 작업과 모달리티에 걸쳐 일반화 가능한 지구 관측을 위한 보편적 기초 모델 개발.
- 다중 모달(광학, SAR, 시간적) 및 다중 스케일(고, 중, 소) 입력을 통합하여 원격 감지의 특징 표현 학습 향상.
- 새로운 분할된 시공간 인코더와 주목적 기반 지오컨텍스트 통합을 통해 모델 효율성 및 수렴 속도 향상.
- 통합 사전 훈련 프레임워크를 사용하여 원격 감지 분야의 제로샷 및 희소샷 전이 학습에 대한 벤치마크 수립.
- 다양한 후행 응용 분야에서 사용 가능한 모듈식, 재사용 가능하고 상호 운용 가능한 사전 훈련 모델 제공 (주로 MMCV, PyTorch, TIMM와 호환)
제안 방법
- 공간적 및 시간적 동역학을 별도로 모델링하여 효율성과 표현 품질 향상을 위한 분할된 시공간 인코더 활용.
- 광학, SAR, 시간적 모달 간 특징 정렬을 위한 대비 학습 기반 교차 모달 정렬 도입으로 다중 모달 융합 향상.
- 지역별 프로토타입을 통합하여 공간적 특징에 맥락 인식을 강화하는 주목적 기반 지오컨텍스트 통합 모듈 사용.
- 시간적 및 공간적 정렬이 동기화된 Sentinel-2, Sentinel-1 및 기타 지구 관측 데이터를 조합한 대규모 다각도 데이터셋에서 사전 훈련.
- 마스킹된 오토에코딩과 대비 학습을 활용한 다단계 사전 훈련 전략을 통해 강력하고 일반화 가능한 표현 학습.
- 모듈식 사전 훈련 컴포onent(공간 인코더, 융합 트랜스포머, 지오컨텍스트 모듈)를 통해 MMCV, PyTorch, TIMM와 호환되는 후행 작업에 대한 탄력적 구현 지원.
실험 결과
연구 질문
- RQ1다중 모달 기초 모델이 시나리오 분류, 객체 검출, 의미적 세그멘테이션 등의 다양한 지구 관측 작업에서 뛰어난 일반화 성능를 달성할 수 있는가?
- RQ2희소샷 및 전샷 설정에서 SatLas, Scale-MAE, GFM 등의 기존 원격 감지 기초 모델과 비교해 본다면, 제안된 SkySense 모델의 수렴 속도 및 성능는 어떠한가?
- RQ3광학, SAR, 시간적 데이터의 융합은 단일 모달리티 또는 이중 모달리티 기반 모델 대비 특징 표현 품질 및 후행 작업 정확도 향상에 얼마나 기여하는가?
- RQ4분할된 시공간 인코더는 계산 효율성을 유지하면서도 시공간 의존성을 효과적으로 포착할 수 있는가?
- RQ5모델 규모 및 파라미터 수는 성능에 어떤 영향을 미치며, 전체 스케일 사전 훈련 없이도 Swin-L과 같은 소규모 변형이 강력한 일반화 능력을 유지할 수 있는가?
주요 결과
- AID 데이터셋에서 20% 학습 데이터로 테스트한 결과, SkySense는 전체 정확도 94.07%를 기록하여 SatLas보다 28.09% 향상되었고, Scale-MAE보다는 17.64% 향상되었다.
- DIOR에서의 객체 검출 성능은 mAP50 72.54%를 기록하여, 다음으로 우수한 성능을 보인 Scale-MAE(60.46%) 대비 12.08% 향상되었다.
- iSAID에서의 의미적 세그멘테이션 성능은 mIoU 65.40%를 달성하여 다른 방법들 평균 대비 9.69% 향상되었으며, 강력한 일반화 능력을 입증했다.
- AID 데이터셋에서 1% 학습 데이터로 테스트한 결과, SkySense는 단 20 에포크 만에 수렴했고, 다른 모델들은 최소 140 에포크가 걸려도 낮고 불안정한 성능에 머물렀다.
- 큰 Swin-H 백본을 더 작은 Swin-L로 교체한 경우에도 SkySense는 높은 성능(예: RESISC-45에서 OA 88.74%)을 유지하여 확장성과 효율성을 입증했다.
- BigEarthNet-MM에서 다중 모달(광학 + SAR) 시나리오 분류 작업에서 최신 기술 수준의 성능 기록하여, 복잡한 실세계 다센서 환경에서도 뛰어난 강인성을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.