Skip to main content
QUICK REVIEW

[논문 리뷰] Multiscale Convolutional Transformer with Center Mask Pretraining for Hyperspectral Image Classification

Sen Jia, Yifan Wang|arXiv (Cornell University)|2022. 03. 09.
Remote-Sensing Image Classification인용 수 8
한 줄 요약

이 논문은 고분광 영상(HSI) 분류를 위한 다중 척도 컨volutional 트랜스포머 백본과 새로운 중심 마스크 사전학습 전략을 제안한다. 중심 픽셀의 토큰만 마스킹하고 그 스펙트럼을 재구성함으로써 국소-글로벌 특징 학습을 향상시키고 성능을 향상시킨다. Salinas 데이터셋에서 전체 정확도 92.04%를 기록하며, 최신 기술 대비 최대 2.14% 향상되었다.

ABSTRACT

Hyperspectral images (HSI) not only have a broad macroscopic field of view but also contain rich spectral information, and the types of surface objects can be identified through spectral information, which is one of the main applications in hyperspectral image related research.In recent years, more and more deep learning methods have been proposed, among which convolutional neural networks (CNN) are the most influential. However, CNN-based methods are difficult to capture long-range dependencies, and also require a large amount of labeled data for model training.Besides, most of the self-supervised training methods in the field of HSI classification are based on the reconstruction of input samples, and it is difficult to achieve effective use of unlabeled samples. To address the shortcomings of CNN networks, we propose a noval multi-scale convolutional embedding module for HSI to realize effective extraction of spatial-spectral information, which can be better combined with Transformer network.In order to make more efficient use of unlabeled data, we propose a new self-supervised pretask. Similar to Mask autoencoder, but our pre-training method only masks the corresponding token of the central pixel in the encoder, and inputs the remaining token into the decoder to reconstruct the spectral information of the central pixel.Such a pretask can better model the relationship between the central feature and the domain feature, and obtain more stable training results.

연구 동기 및 목표

  • CNN이 장거리 상관관계를 포착하는 데 한계가 있으며, 레이블이 부족한 HSI 데이터의 문제를 해결한다.
  • 기존 자기지도 사전학습 방법의 불안정성과 비효율성을 해결하기 위해 더 효과적인 전조업무를 설계한다.
  • 고분광 데이터에 특화된 다중 척도 컨볼루션 임bedding 모듈을 통해 공간-스펙트럼 특징 추출을 향상시킨다.
  • 새로운 중심 마스크 재구성 사전학습 전략을 통해 저샷 시나리오에서 모델의 일반화 능력과 성능을 향상시킨다.

제안 방법

  • 3D 컨볼루션과 스펙트럼 분할을 사용하여 다중 척도에서 공간-스펙트럼 특징을 추출하는 다중 척도 컨볼루션 임베딩(MCE) 모듈을 도입한다.
  • 오직 중심 픽셀의 토큰만 마스킹되고, 주변 특징에서 그 스펙트럼 서명을 재구성하는 중심 마스크 사전학습(CMR) 작업을 설계한다.
  • MCE 모듈을 표준 트랜스포머 인코더와 조합하여 공간 및 스펙트럼 차원 전반의 장거리 의존성을 모델링한다.
  • 중심 픽셀의 스펙트럼을 재구성하는 데 중점을 둔 마스크된 오토인코더 스타일의 목적함수를 사용하여 특징 표현과 학습 안정성을 향상시킨다.
  • 소량의 레이블 데이터만을 사용하여 최종 HSI 분류 작업에 대해 사전학습된 모델을 미세조정한다.
  • 입력 고분광 큐브에 스펙트럼 분할을 적용하여 효율적인 선형 임베딩을 가능하게 하고 스펙트럼 정보를 유지한다.

실험 결과

연구 질문

  • RQ1중심 픽셀 재구성 기반 자기지도 사전학습 전략이 고분광 영상 분류에서 특징 학습을 향상시키는가?
  • RQ2표준 선형 임베딩 대비 다중 척도 컨볼루션 임베딩 모듈이 공간-스펙트럼 표현 학습을 향상시키는가?
  • RQ3기본 재구성 또는 대조적 사전학습과 비교해 제안된 중심 마스크 사전학습 전략은 안정성과 정확도 측면에서 어떻게 성능을 내는가?
  • RQ4제한된 레이블 데이터로 저샷 학습 시나리오에서 제안된 방법이 성능 변동을 얼마나 줄이는가?

주요 결과

  • 제안된 방법은 Salinas 데이터셋에서 전체 정확도 92.04%를 기록하여 두 번째로 우수한 성능을 보인 CNNHSI(89.90%)보다 2.14% 높게 기록했다.
  • YRE 데이터셋에서는 전체 정확도 90.72%를 달성하여 기준 모델(86.24%)보다 4.48% 높았다.
  • 제거 실험 결과, MCE 모듈 내 IIE 브랜치의 포함으로 Salinas에서 정확도가 0.47% 향상되고 YRE에서 2.12% 향상됨을 확인했다.
  • 중심 마스크 전략으로 사전학습한 결과, 초기 학습 대비 Salinas에서 2.97% 향상되고 YRE에서 2.20% 향상되었다.
  • 사전학습 전략은 뚜렷한 강건성을 보였으며, IIE 브랜치를 포함한 백본 여부에 관계없이 사전학습 모델에 대한 미세조정이 경쟁적인 성능을 내었다.
  • 시각화 결과, 제안된 방법이 참조 지도와 유사한 분류 지도를 생성했으며, 경쟁 모델 대비 오분류가 적었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.