Skip to main content
QUICK REVIEW

[논문 리뷰] Remote Sensing Images Semantic Segmentation with General Remote Sensing Vision Model via a Self-Supervised Contrastive Learning Method.

Haifeng Li, Yi Li|arXiv (Cornell University)|2021. 06. 20.
Remote-Sensing Image Classification참고 문헌 39인용 수 5
한 줄 요약

이 논문은 원격 감지 의미 분할을 위한 자기 지율 대비 학습 프레임워크인 GLCNet을 제안한다. 이는 전역적 스타일과 국소적 특징 매칭을 동시에 최적화하여 픽셀 수준의 표현 학습을 향상시킨다. 단지 1%의 레이블된 데이터만으로도 기존 방법에 비해 ISPRS Potsdam에서 Kappa를 6% 향상시키고, DeepGlobe에서 3% 향상시키며 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

A new learning paradigm, self-supervised learning (SSL), can be used to solve such problems by pre-training a general model with large unlabeled images and then fine-tuning on a downstream task with very few labeled samples. Contrastive learning is a typical method of SSL, which can learn general invariant features. However, most of the existing contrastive learning is designed for classification tasks to obtain an image-level representation, which may be sub-optimal for semantic segmentation tasks requiring pixel-level discrimination. Therefore, we propose Global style and Local matching Contrastive Learning Network (GLCNet) for remote sensing semantic segmentation. Specifically, the global style contrastive module is used to learn an image-level representation better, as we consider the style features can better represent the overall image features; The local features matching contrastive module is designed to learn representations of local regions which is beneficial for semantic segmentation. We evaluate four remote sensing semantic segmentation datasets, and the experimental results show that our method mostly outperforms state-of-the-art self-supervised methods and ImageNet pre-training. Specifically, with 1\% annotation from the original dataset, our approach improves Kappa by 6\% on the ISPRS Potsdam dataset and 3\% on Deep Globe Land Cover Classification dataset relative to the existing baseline. Moreover, our method outperforms supervised learning when there are some differences between the datasets of upstream tasks and downstream tasks. Our study promotes the development of self-supervised learning in the field of remote sensing semantic segmentation. The source code is available at this https URL.

연구 동기 및 목표

  • 의미 분할을 위한 제한된 레이블된 원격 감지 이미지 문제를 해결하기 위해.
  • 원격 감지 분야에서 자기 지율 대비 학습을 통한 픽셀 수준의 표현 학습을 향상시키기 위해.
  • 더 나은 분할 성능를 위해 전역적 이미지 스타일과 국소적 영역 특징을 동시에 활용하는 통합 프레임워크를 개발하기 위해.
  • 이미지넷 사전 훈련 및 원격 감지 응용 분야에서의 후행 도메인 이탈에 대한 의존도를 줄이기 위해.

제안 방법

  • GLCNet은 전반적인 장면 이해를 향상시키기 위해 스타일 특징에 중점을 두어 이미지 수준의 표현을 학습하기 위해 전역적 스타일 대비 모듈을 도입한다.
  • 픽셀 수준의 분할에 핵심적인 국소 영역 수준에서의 구별 가능한 표현을 학습하기 위해 국소적 특징 매칭 대비 모듈을 활용한다.
  • 모델은 동일한 이미지의 증강된 보기들 간의 일치를 최대화하고, 부정적 보기들 간의 유사도를 최소화하기 위해 대비 학습을 사용한다.
  • 대규모 레이블이 없는 원격 감지 이미지에서 사전 훈련을 수행한 후, 최소한의 레이블된 데이터로 후행 분할 작업에 대해 미세 조정한다.
  • 전체적으로 전역 및 국소적 대비 목표를 통합한 대비 손실을 사용하여 프레임워크를 엔드 투 엔드로 훈련한다.

실험 결과

연구 질문

  • RQ1자기 지율 대비 학습이 원격 감지 의미 분할에서 픽셀 수준의 표현 학습을 효과적으로 향상시킬 수 있는가?
  • RQ2전역적 스타일과 국소적 특징 매칭을 결합하면 기존의 이미지 분류를 위한 대비 학습 방법보다 더 나은 성능을 내는가?
  • RQ3낮은 샘플 수 학습 설정에서 GLCNet은 이미지넷 사전 훈련 및 최신 기술 수준의 자기 지율 대비 학습 방법보다 어떻게 성능을 내는가?
  • RQ4사전 훈련 데이터셋과 미세 조정 데이터셋 간의 분포 이탈이 있을 경우 GLCNet은 도메인 간 일반화가 가능한가?

주요 결과

  • GLCNet은 원래 레이블된 데이터의 1%만 사용할 때 ISPRS Potsdam 데이터셋에서 Kappa 지표를 6% 향상시켰다.
  • DeepGlobe Land Cover Classification 데이터셋에서 동일한 저샘플 수 설정 하에 기존 베이스라인에 비해 Kappa 지표를 3% 향상시켰다.
  • 모든 평가된 원격 감지 분할 벤치마크에서 이미지넷 사전 훈련보다 성능이 뛰어났다.
  • 상游 및 하류 데이터셋 간에 도메인 이탈이 있을 경우 GLCNet은 지도 학습을 초월하여 강력한 일반화 능력을 보였다.
  • 제거 실험을 통해 전역적 스타일 및 국소적 매칭 모듈이 성능 향상에 기여하는 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.