[논문 리뷰] Generating Representative Samples for Few-Shot Classification
이 논문은 기본 클래스의 클래스 대표 샘플을 기반으로 훈련된 조건부 Variational Autoencoder (CVAE)를 사용하여 소수 샘플 분류를 위한 대표 샘플 생성 방법을 제안한다. 다변량 정규분포 모델링을 통해 비대표 샘플을 필터링하고, 높은 대표성 데이터에 대해서만 CVAE를 훈련시킴으로써 더 정확한 프로토타입을 생성하여, miniImageNet과 tieredImageNet에서 최신 기술 수준의 성능을 달성하며, 1-shot 정확도에서 최대 6% 향상을 이룬다.
Few-shot learning (FSL) aims to learn new categories with a few visual samples per class. Few-shot class representations are often biased due to data scarcity. To mitigate this issue, we propose to generate visual samples based on semantic embeddings using a conditional variational autoencoder (CVAE) model. We train this CVAE model on base classes and use it to generate features for novel classes. More importantly, we guide this VAE to strictly generate representative samples by removing non-representative samples from the base training set when training the CVAE model. We show that this training scheme enhances the representativeness of the generated samples and therefore, improves the few-shot classification results. Experimental results show that our method improves three FSL baseline methods by substantial margins, achieving state-of-the-art few-shot classification performance on miniImageNet and tieredImageNet datasets for both 1-shot and 5-shot settings. Code is available at: https://github.com/cvlab-stonybrook/fsl-rsvae.
연구 동기 및 목표
- 제한된 지원 샘플로 인해 발생하는 소수 샘플 분류 프로토타입의 편향 문제를 해결하기 위해.
- 의미 임베딩에서 유도된 고품질의 시각적 특징을 생성함으로써 프로토타입의 대표성을 향상시키기 위해.
- 더 나은 VAE 훈련을 위해 비대표 훈련 샘플을 필터링하는 샘플 선택 전략을 개발하기 위해.
- 다양한 벤치마크와 설정에서 소수 샘플 분류 성능을 최신 기술 수준으로 달성하기 위해.
제안 방법
- 기본 클래스에 대해 조건부 VAE(SVAE)를 훈련시어 의미 임베딩을 조건으로 하는 시각적 특징을 생성한다.
- 다변량 정규분포 모델링을 사용하여 각 기본 클래스 샘플의 특징이 클래스 중심으로부터의 거리에 기반해 대표성을 추정한다.
- 클래스 정규분포 하에서 낮은 확률을 가지는 샘플(예: 낮은 대표성)을 제거하여 대표성 있는 훈련 세트를 구성한다.
- 선택된 대표성 있는 샘플들에만 전적으로 CVAE를 훈련시어 더 충실하고 프로토타입에 맞는 특징을 생성한다.
- 소수 샘플 지원 샘플과 생성된 특징을 모두 사용해 클래스 프로토타입을 구성함으로써 분류의 강건성을 향상시킨다.
- 핵밀도 추정과 t-SNE 시각화를 사용해 특징 분포와 프로토타입이 진짜 데이터에 얼마나 가까운지 분석한다.

실험 결과
연구 질문
- RQ1조건부 VAE를 통해 대표적인 시각적 특징을 생성하면 소수 샘플 분류 정확도가 향상되는가?
- RQ2기본 훈련 세트에서 비대표 샘플을 필터링하면 생성된 특징의 품질과 프로토타입 추정의 정확도가 향상되는가?
- RQ3훈련 데이터의 대표성은 소수 샘플 분류 모델의 성능에 어떤 영향을 미치는가?
- RQ4제안된 방법은 다양한 의미 임베딩 소스(예: CLIP 대비 Word2Vec) 간에도 일반화 가능한가?
- RQ5기본 방법 대비 R-SVAE로 생성된 프로토타입은 진짜 프로토타입에 얼마나 가까운가?
주요 결과
- 제안된 R-SVAE 방법은 miniImageNet과 tieredImageNet 양쪽에서 최신 기술 수준의 성능을 달성하며, 베이스라인 대비 1-shot 정확도에서 6.1%p의 절대적 향상을 보였다.
- 기본 훈련 세트의 10%만(가장 대표성 있는 샘플들)을 사용해 CVAE를 훈련시킬 경우 성능이 가장 우수하여 샘플 필터링의 효과를 입증했다.
- R-SVAE로 생성된 특징을 사용할 경우 추정된 프로토타입과 진짜 프로토타입 간의 거리가 유의미하게 감소하여 프로토타입 정확도 향상이 확인되었다.
- R-SVAE는 세 가지 다른 FSL 베이스라인(Meta-Baseline, ProtoNet 등)을 대상으로 대표성 측면에서 1–2%, 1-shot 정확도에서 5–6% 향상시켰다.
- t-SNE 시각화 결과 R-SVAE로 생성된 특징는 표준 SVAE에 비해 진짜 데이터 분포에 더 가까이 위치해 있으며, 더 컴팩트한 분포를 보였다.
- CLIP 대신 Word2Vec 임베딩을 사용할 경우에도 성능이 유지되어 의미 임베딩 소스에 대한 강건성을 입증했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.