Skip to main content
QUICK REVIEW

[논문 리뷰] Remote Sensing Image Scene Classification with Self-Supervised Paradigm under Limited Labeled Samples

Chao Tao, Ji Qi|arXiv (Cornell University)|2020. 10. 02.
Remote-Sensing Image Classification참고 문헌 18인용 수 5
한 줄 요약

이 논문은 레이블이 제한된 환경에서 원격 감지 영상(RSI)의 장면 분류를 위한 자기지도 학습(SSL) 프레임워크를 제안한다. 이는 사전 학습을 위해 대규모 레이블이 없는 RSI 데이터를 사용하는 전문 과제를 통해 ImageNet 사전 학습보다 뛰어난 성능을 내며, 특히 레이블이 부족한 상황에서 도메인 차이를 줄이고 특징의 일반화 능력을 향상시킨다. 이 방법은 세 가지 벤치마크 데이터셋에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

With the development of deep learning, supervised learning methods perform well in remote sensing images (RSIs) scene classification. However, supervised learning requires a huge number of annotated data for training. When labeled samples are not sufficient, the most common solution is to fine-tune the pre-training models using a large natural image dataset (e.g. ImageNet). However, this learning paradigm is not a panacea, especially when the target remote sensing images (e.g. multispectral and hyperspectral data) have different imaging mechanisms from RGB natural images. To solve this problem, we introduce new self-supervised learning (SSL) mechanism to obtain the high-performance pre-training model for RSIs scene classification from large unlabeled data. Experiments on three commonly used RSIs scene classification datasets demonstrated that this new learning paradigm outperforms the traditional dominant ImageNet pre-trained model. Moreover, we analyze the impacts of several factors in SSL on RSIs scene classification tasks, including the choice of self-supervised signals, the domain difference between the source and target dataset, and the amount of pre-training data. The insights distilled from our studies can help to foster the development of SSL in the remote sensing community. Since SSL could learn from unlabeled massive RSIs which are extremely easy to obtain, it will be a potentially promising way to alleviate dependence on labeled samples and thus efficiently solve many problems, such as global mapping.

연구 동기 및 목표

  • 딥 러닝 기반의 장면 분류에서 레이블이 제한된 원격 감지 영상(RSI) 문제를 해결한다.
  • 다중스펙트럼/하이퍼스펙트럼 RSI에 대해 ImageNet 사전 학습 모델을 미세조정할 때 발생하는 도메인 차이 문제를 극복한다.
  • 레이블이 없는 RSI 데이터를 사용하여 강력하고 이식 가능한 표현을 학습하는 자기지도 사전 학습 프레임워크를 개발한다.
  • 자기지도 신호, 도메인 차이, 사전 학습 데이터 양이 RSI 장면 분류 성능에 미치는 영향을 조사한다.
  • 비용이 많이 들는 인간 주석이 필요한 데이터에 의존도를 줄이는 새로운, 더 효과적인 RSI 장면 분류 프레임워크를 수립한다.

제안 방법

  • 동일한 이미지의 증강된 시각에서 양성 및 음성 샘플 쌍을 대비시켜 자기지도 학습의 핵심 전문 과제로 인스턴스 구분을 활용한다.
  • 대규모 레이블이 없는 RSI 데이터셋(EuroSAT, AID, NR 등)에서 대비 학습 목표를 사용해 ResNet 기반 인코더를 사전 학습한다.
  • 사전 학습된 인코더 가중치를 고정하고, 소규모 레이블이 있는 타겟 데이터셋에서 마지막 완전 연결 계층만 미세조정한다.
  • 랜덤 크롭, 색상 왜곡, 가우시안 블러와 같은 데이터 증강 전략을 사용해 양성 및 음성 시각을 생성한다.
  • 200 에포크 동안 코스 인용 감소 스케줄과 배치 크기가 64인 Adam 옵timizer를 사용해 모델을 최적화한다.
  • 다양한 분석에서 SSL 기반 방법을 ImageNet 사전 학습 및 MATAR GAN과 비교하고, 추출된 특징에 대해 SVM을 사용해 분류한다.

실험 결과

연구 질문

  • RQ1레이블이 제한된 환경에서, 레이블이 없는 RSI 데이터에 대해 자기지도 학습을 수행할 경우, ImageNet 사전 학습보다 더 나은 표현을 얻을 수 있는가?
  • RQ2예를 들어 인스턴스 구분과 같은 자기지도 신호의 선택이, 후속 RSI 장면 분류 작업 성능에 어떤 영향을 미치는가?
  • RQ3원천(사전 학습) 데이터셋과 타겟(미세조정) 데이터셋 간의 도메인 불일치가 자기지도 학습 모델의 성능에 얼마나 큰 영향을 미치는가?
  • RQ4사전 학습 데이터의 양이 RSI 장면 분류에서 자기지도 표현의 일반화 능력에 어떤 영향을 미치는가?
  • RQ5기존의 사전 학습 접근 방식에 비해 제안된 SSL 방법은 소규모 레이블 데이터 환경에서 더 강건한가?

주요 결과

  • 제안된 인스턴스 구분 기반 SSL 방법은 모든 세 가지 데이터셋(EuroSAT, AID, NR)에서 ImageNet 사전 학습보다 뛰어난 성능을 보이며, 특히 레이블이 극히 적은 경우 두드러진다.
  • 클래스당 레이블이 5개뿐인 NR 데이터셋에서 IDSSL은 전체 정확도 80.63%를 달성했고, ImageNet 사전 학습된 ResNet50는 59.63%에 그쳤다.
  • 클래스당 레이블 수가 20에서 5로 감소했을 때, IDSSL의 성능 저하율은 6.02%에 그쳤지만, ImageNet과 MATAR GAN은 각각 19.13%와 26.24% 감소했다.
  • NR 데이터셋의 25,200개의 레이블이 없는 샘플을 사용해 사전 학습하면 전체 정확도 80.63%를 기록했으며, 이는 제한된 감독 하에서도 뛰어난 성능을 보임을 시사한다.
  • AID, NR, EuroSAT의 세 데이터셋에서의 사전 학습 데이터를 통합하면, AID에서 84.20%의 OA, NR에서 81.13%의 OA를 달성했다.
  • 연구는 사전 학습 데이터와 타겟 데이터 간의 도메인 일치가 매우 중요하며, SSL이 ImageNet 사전 학습보다 도메인 차이를 더 효과적으로 완화함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.