[논문 리뷰] Revisiting pre-trained remote sensing model benchmarks: resizing and normalization matters
이 논문은 원격 감지 이미지를 단순히 ImageNet 미사전 훈련 시 사용된 전처리 방식에 맞게 크기 조정하고 정규화함으로써 상당한 성능 향상을 이룰 수 있음을 보여준다. 특히 224×224 입력 크기와 ImageNet 스타일 정규화를 적용할 경우, 후행 전이 학습 작업에서 뛰어난 성능을 기록한다. 주요 기여는 적절한 전처리를 적용할 경우 ImageNet 미사전 훈련이 전문화된 자기지도 학습 모델보다도 강력한 기준 성능을 제공함을 입증한 것이다. 이는 다양한 벤치마크에서 성능을 뛰어넘었다.
Research in self-supervised learning (SSL) with natural images has progressed rapidly in recent years and is now increasingly being applied to and benchmarked with datasets containing remotely sensed imagery. A common benchmark case is to evaluate SSL pre-trained model embeddings on datasets of remotely sensed imagery with small patch sizes, e.g., 32x32 pixels, whereas standard SSL pre-training takes place with larger patch sizes, e.g., 224x224. Furthermore, pre-training methods tend to use different image normalization preprocessing steps depending on the dataset. In this paper, we show, across seven satellite and aerial imagery datasets of varying resolution, that by simply following the preprocessing steps used in pre-training (precisely, image sizing and normalization methods), one can achieve significant performance improvements when evaluating the extracted features on downstream tasks -- an important detail overlooked in previous work in this space. We show that by following these steps, ImageNet pre-training remains a competitive baseline for satellite imagery based transfer learning tasks -- for example we find that these steps give +32.28 to overall accuracy on the So2Sat random split dataset and +11.16 on the EuroSAT dataset. Finally, we report comprehensive benchmark results with a variety of simple baseline methods for each of the seven datasets, forming an initial benchmark suite for remote sensing imagery.
연구 동기 및 목표
- 원격 감지에서 입력 이미지 크기 조정 및 정규화가 전이 학습 성능에 미치는 영향을 조사하는 것.
- ImageNet 미사전 훈련 모델을 소형 패치 원격 감지 데이터셋에 적용할 때 성능 저하를 유발하는 간과된 전처리 불일치 사항을 밝혀내는 것.
- 미래의 원격 감지 자기지도 학습 벤치마크를 위한 강력하고 단순한 기준 성능을 설정하는 것.
- 일곱 가지 다양한 원격 감지 데이터셋을 통틀어 표준화된 평가 프로토콜을 적용한 투명하고 재현 가능한 벤치마크 세트를 제공하는 것.
제안 방법
- 원래의 작은 크기(예: 32×32, 64×64)에서 시작하는 입력 이미지를 ImageNet 미사전 훈련 시 사용된 입력 크기와 동일하게 224×224로 크기 조정하는 것.
- ImageNet 스타일 정규화 적용: [0,1]로 최소-최대 스케일링 후, ImageNet 평균 및 표준편차를 사용한 채널별 표준화.
- 일곱 개인 원격 감지 데이터셋에서 ImageNet 미사전 훈련된 ResNet-50 및 비전 트랜스포머 모델의 특징을 K-최근접 이웃(KNN) 및 선형 프로빙을 통해 평가하는 것.
- 랜덤 컨볼루션 특징(RCF), 이미지 통계, MOSAIKS 및 Scale-MAE와 같은 최신 자기지도 학습 모델과의 성능 비교.
- 모든 데이터셋에 대해 일관된 전처리, 모델 아키텍처, 평가 프로토콜을 적용하여 공정한 비교를 보장하는 표준화된 평가 절차.
- 일반화성과 내구성을 평가하기 위해 다양한 분할 방식(예: So2Sat의 무작위 분할 및 문화 기반 분할)을 활용해 결과를 보고하는 것.

실험 결과
연구 질문
- RQ1ImageNet 미사전 훈련 모델을 사용할 때, 원격 감지 이미지를 32×32 또는 64×64에서 224×224로 크기 조정하면 후행 전이 학습 성능이 향상되는가?
- RQ2ImageNet 스타일 정규화(최소-최대 스케일링 + 채널별 표준화)를 사용할 경우, 원격 감지 데이터셋에 특화된 정규화보다 특징 품질이 얼마나 향상되는가?
- RQ3ImageNet 미사전 훈련, RCF, 이미지 통계와 같은 단순 기준 성능이 원격 감지 벤치마크에서 최신 자기지도 학습 모델보다 어떻게 비교되는가?
- RQ4일부 원격 감지 데이터셋에서는 RGB 입력에 다중스펙트럼 밴드를 추가할 경우 성능이 떨어지는 이유는 무엇이며, 이는 미사전 훈련 모델과 랜덤 모델 간에 어떻게 다를까?
- RQ5원격 감지 전이 학습에서 표현 품질 평가에 있어 KNN이 선형 프로빙보다 더 신뢰할 수 있는 평가 지표인가?
주요 결과
- 64×64에서 224×224로 이미지 크기 조정 시 EuroSAT에서 ResNet-50 정확도가 0.82에서 0.91로 상승하여 절대 성능 향상 9.1%를 기록했다.
- 크기 조정 후 ImageNet 정규화를 적용하면 EuroSAT 정확도가 0.66에서 0.91로 상승하여, 정규화가 크기 조정만큼 중요한 영향을 미친다는 것을 입증했다.
- So2Sat의 무작위 분할에서 ImageNet 미사전 훈련이 전문화된 자기지도 학습 모델인 SSL4EO MoCo-v2를 능가했으며, 전체 정확도 향상 폭이 +32.28%에 달했다.
- 이미지 통계 기준 성능은 유일한 다중스펙트럼 데이터셋을 제외한 모든 데이터셋에서 ImageNet 미사전 훈련을 뛰어넘었으며, 가장 열악한 경우 데이터셋에서 뿐다 0.25% 낮은 점수를 기록했다.
- SAT-6에서는 랜덤 초기화를 제외한 모든 방법이 99% 이상의 정확도를 기록하여, 이 데이터셋은 의미 있는 비교에 부적합할 정도로 단순하다는 것을 시사했다.
- MOSAIKS(RCF에 경험적 가중치를 적용한 모델)는 다중스펙트럼 데이터셋 5개 중 4개에서 상위 2위 이내로 랭크되었으며, ImageNet 및 원격 감지 자기지도 학습 모델을 모두 능가했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.