Skip to main content
QUICK REVIEW

[논문 리뷰] Simpler is Better: Few-shot Semantic Segmentation with Classifier Weight Transformer

Zhihe Lu, Sen He|arXiv (Cornell University)|2021. 08. 06.
Domain Adaptation and Few-Shot Learning참고 문헌 38인용 수 14
한 줄 요약

이 논문은 사전에 학습된 인코더-디코더 백본을 고정하면서 메타학습을 통해 오직 분류기 헤드만을 학습하는 더 간단한 few-shot 세분화 방법을 제안한다. 쿼리 이미지별로 분류기 가중치를 동적으로 조정하기 위해 Classifier Weight Transformer (CWT)를 도입함으로써, COCO-20 및 PASCAL-20 벤치마크에서 최신 기술을 초월하는 성능을 달성하였으며, 모델 복잡도가 감소한 상태에서도 큰 성능 향상을 이룬다.

ABSTRACT

A few-shot semantic segmentation model is typically composed of a CNN encoder, a CNN decoder and a simple classifier (separating foreground and background pixels). Most existing methods meta-learn all three model components for fast adaptation to a new class. However, given that as few as a single support set image is available, effective model adaption of all three components to the new class is extremely challenging. In this work we propose to simplify the meta-learning task by focusing solely on the simplest component, the classifier, whilst leaving the encoder and decoder to pre-training. We hypothesize that if we pre-train an off-the-shelf segmentation model over a set of diverse training classes with sufficient annotations, the encoder and decoder can capture rich discriminative features applicable for any unseen classes, rendering the subsequent meta-learning stage unnecessary. For the classifier meta-learning, we introduce a Classifier Weight Transformer (CWT) designed to dynamically adapt the supportset trained classifier's weights to each query image in an inductive way. Extensive experiments on two standard benchmarks show that despite its simplicity, our method outperforms the state-of-the-art alternatives, often by a large margin.Code is available on https://github.com/zhiheLu/CWT-for-FSS.

연구 동기 및 목표

  • 새로운 클래스에 대해 단 한 장 또는 소수의 애너테이션된 지원 이미지만 제공되는 최소한의 감독 하에 few-shot 세분화 문제를 해결하기 위해.
  • 사전에 학습된 인코더-디코더 백본을 고정함으로써 모델 적응의 복잡도를 줄이기 위해, 메타학습을 오직 분류기만을 대상으로 집중하기 위해.
  • 지원 이미지와 쿼리 이미지 간의 개체 외관 내부 변동성을 동적으로 분류기 가중치 적응을 통해 극복하기 위해.
  • 사전에 강력한 클래스 무관 특징 추출기를 학습시킴으로써, 백본에 대한 메타학습 없이도 뛰어난 few-shot 일반화 성능을 달성할 수 있음을 보여주기 위해.

제안 방법

  • 다양한 훈련 클래스에 대해 세분화 백본(예: ResNet-50)을 사전에 학습시켜 클래스에 관계없는 분류 가능한 특징을 학습한다.
  • 추론 시, 지원셋 특징을 통해 학습된 프로젝션 헤드를 이용해 분류기를 초기화하여 초기 분류기 가중치를 형성한다.
  • Classifier Weight Transformer (CWT)는 쿼리 이미지의 특징을 참조하여 초기 가중치를 동적으로 조정함으로써, 유도 방식으로 분류기 가중치를 개선한다.
  • CWT는 쿼리 특징을 쿼리로 사용하고, 지원셋 특징을 키와 값으로 사용하여 쿼리에 특화된 분류기 가중치를 생성하는 자기주의 메커니즘을 사용한다.
  • 모델 전체는 에피소드 기반으로 학습되며, 메타학습은 오직 분류기 헤드와 CWT 모듈에만 적용된다.
  • 메타학습 및 추론 중에 인코더와 디코더는 고정되어 있어 최적화 복잡도가 크게 감소한다.

실험 결과

연구 질문

  • RQ1사전에 학습된 인코더와 디코더를 고정하면서 오직 분류기 헤드만을 메타학습함으로써 최신 기술 수준의 few-shot 세분화 성능를 달성할 수 있는가?
  • RQ2사전에 학습된 인코더-디코더 백본은 미세조정 없이도 새로운 클래스로 일반화하는 데 얼마나 효과적인가?
  • RQ3쿼리에 적응하는 분류기 헤드(예: CWT)는 few-shot 세분화에서 내부 클래스 변동성을 효과적으로 완화할 수 있는가?
  • RQ4정적 분류기 적응 대비 쿼리 이미지에 특화된 적응을 명시적으로 모델링함으로써 얻는 성능 향상은 어느 정도인가?

주요 결과

  • 제안된 방법은 1-shot 설정에서 COCO-20 데이터셋에서 평균 mIoU 32.9%를 달성하여 이전 최신 기술보다 유의미한 성능 향상을 보였다.
  • 메타학습 없이 백본을 사전 학습하고 지원셋에 기반해 분류기를 훈련시키는 단순한 베이스라인도 28.6% mIoU를 기록하여 PPNet를 2.9% 초월했다.
  • 전체 CWT 모델은 베이스라인 대비 4.3% 향상되어 쿼리 기반 분류기 적응의 효과성을 입증했다.
  • CWT에서 쿼리 이미지 조건을 제거함(즉, 주로 지원셋 특징만을 사용해 주목을 적용함)하면 mIoU가 14.0점 감소하여 쿼리 인식 적응의 필요성을 입증했다.
  • 실패 사례는 주로 극단적인 외관 변화(예: 부분 시야, 자세, 가림)에서 기인하여 공간적 및 외관 변동성의 더 나은 모델링이 필요함을 시사한다.
  • 이 방법은 교차 도메인 few-shot 세분화로도 잘 일반화되어 도메인 이동에 대해 강건함을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.