[논문 리뷰] RingMo-lite: A Remote Sensing Multi-task Lightweight Network with CNN-Transformer Hybrid Framework
RingMo-lite는 원격 감지 영상 해석을 위한 경량형 CNN-Transformer 하이브리드 기초 모델로, 주파수 도메인 모델링을 활용하여 전역적이고 국소적인 특징 추출을 균형 잡는다. 이중 브랜치 아키텍처와 주파수 인식 마스크 이미지 모델링(FD-MIM) 사전학습 전략을 통해 RingMo 대비 파rameter를 60% 이상 감소시켰으며, 다양한 작업에서 SOTA 수준의 성능을 유지하면서 평균 정확도 저하가 2% 미만이다.
In recent years, remote sensing (RS) vision foundation models such as RingMo have emerged and achieved excellent performance in various downstream tasks. However, the high demand for computing resources limits the application of these models on edge devices. It is necessary to design a more lightweight foundation model to support on-orbit RS image interpretation. Existing methods face challenges in achieving lightweight solutions while retaining generalization in RS image interpretation. This is due to the complex high and low-frequency spectral components in RS images, which make traditional single CNN or Vision Transformer methods unsuitable for the task. Therefore, this paper proposes RingMo-lite, an RS multi-task lightweight network with a CNN-Transformer hybrid framework, which effectively exploits the frequency-domain properties of RS to optimize the interpretation process. It is combined by the Transformer module as a low-pass filter to extract global features of RS images through a dual-branch structure, and the CNN module as a stacked high-pass filter to extract fine-grained details effectively. Furthermore, in the pretraining stage, the designed frequency-domain masked image modeling (FD-MIM) combines each image patch's high-frequency and low-frequency characteristics, effectively capturing the latent feature representation in RS data. As shown in Fig. 1, compared with RingMo, the proposed RingMo-lite reduces the parameters over 60% in various RS image interpretation tasks, the average accuracy drops by less than 2% in most of the scenes and achieves SOTA performance compared to models of the similar size. In addition, our work will be integrated into the MindSpore computing platform in the near future.
연구 동기 및 목표
- 고성능 원격 감지 기초 모델을 엣지 디바이스 및 위성 궤도 플랫폼에 배포하는 데 도전하는 문제를 해결하기 위해.
- 다양한 원격 감지 비전 작업에서 높은 정확도를 유지하면서도 경량이면서도 일반화 능력이 뛰어난 기초 모델을 설계하기 위해.
- 원격 감지 영상의 복잡한 스펙트럼적 및 공간적 특성을 다루는 데에 한계가 있는 단일 아키텍처 모델(CNN 또는 비전 트랜스포머)의 한계를 극복하기 위해.
- 저자원 환경에서 표현 학습을 향상시키기 위해 주파수 도메인 특징을 효율적으로 활용하는 자율학습(pretraining) 방법을 개발하기 위해.
- 분류, 검출, 세분화, 변화 감지 등 다양한 원격 감지 응용 분야에 적합한 통합적이고 경량화된 프레임워크를 개발하기 위해.
제안 방법
- 모델은 이중 브랜치 아키텍처를 사용한다: 트랜스포머 기반 브랜치는 전역적이고 저주파 특징을 추출하기 위해 저통과 필터로 작용하고, CNN 기반 브랜치는 세밀한 고주파 세부 정보를 캡처하기 위해 다중 고통과 필터로 기능한다.
- 이중 주파수 성분을 동시에 마스킹하고 재구성함으로써 특징 표현 학습을 향상시키는 새로운 주파수 도메인 마스크 이미지 모델링(FD-MIM) 사전학습 방법을 도입한다.
- 주파수 정보를 반영한 특징 블록(FIFB) 모듈은 주파수 도메인에서 저주파 및 고주파 콘텐츠를 분리하여 처리함으로써 스펙트럼 성분을 명시적으로 모델링한다.
- 대규모 원격 감지 데이터셋에서 자기지도 학습을 통해 사전학습한 후, 하류 작업에서 미세조정을 수행함으로써 네트워크를 엔드 투 엔드로 훈련시킨다.
- 지식 distillation이나 신경망 아키텍처 탐색을 통해가 아니라 아키텍처 설계를 통해 모델 압축을 달성하여 추가 훈련 단계 없이 파rameter를 감소시킨다.
- 향후 배포를 고려해 MindSpore 컴퓨팅 플랫폼과의 호환성을 고려해 설계되었다.

실험 결과
연구 질문
- RQ1경량 원격 감지 기초 모델은 파rameter를 크게 줄였음에도 불구하고 근접한 SOTA 성능을 달성할 수 있는가?
- RQ2원격 감지 영상의 주파수 도메인 특징은 하이브리드 CNN-Transformer 아키텍처에서 어떻게 효과적으로 활용될 수 있는가?
- RQ3주파수 인식 사전학습 방법(FD-MIM)은 저자원 및 다중 작업 원격 감지 환경에서 표현 학습을 향상시킬 수 있는가?
- RQ4이중 브랜치 설계는 다양한 원격 감지 작업에서 전역적 및 국소적 특징 추출을 얼마나 잘 균형 잡는가?
- RQ5기존의 경량 모델 및 더 큰 기초 모델인 RingMo와 비교해 제안된 모델은 효율성과 정확도 측면에서 어떻게 비교되는가?
주요 결과
- RingMo-lite는 원래 RingMo 기초 모델 대비 파rameter를 60% 이상 감소시켰으며, 여러 원격 감지 작업에서 평균 정확도 저하가 2% 미만이다.
- LEVIR-CD 데이터셋에서 RingMo-lite는 RingMo의 FLOPs의 17%에 불과한 17%의 FLOPs로 변화 감지 작업에서 F1-스코어 99.15%를 달성하여 높은 효율성을 보였다.
- 유사한 크기의 모델들 중에서 SOTA 성능을 달성하였으며, Swin Tiny 및 DiFormer 기반 모델들보다 정확도와 파rameter 효율성 측면에서 뛰어난 성능을 보였다.
- FD-MIM 사전학습 방법은 일반화 능력을 향상시켰으며, LEVIR-CD 데이터셋에서 기준 방법 대비 전체 정확도(OA)가 0.06% 향상되었다.
- FIFB 모듈은 특징 학습을 향상시켜 Swin Tiny를 백본으로 사용할 경우 기준 방법 대비 OA가 0.03% 향상되었다.
- 작은 크기임에도 불구하고 RingMo-lite는 분류, 객체 검출, 세분화, 변화 감지 작업 전반에 걸쳐 강력한 일반화 능력을 유지하고 있으며, 표 XIV에서 이를 확인할 수 있다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.