[논문 리뷰] Few-Shot Object Detection via Variational Feature Aggregation
이 논문은 기반 클래스에 대한 편향을 줄이고 소수의 예제에서의 변동성에 대한 강건성을 향상시키기 위해 클래스 무관 응집(Class-Agnostic Aggregation, CAA)과 변동형 특징 응집(Variational Feature Aggregation, VFA)을 사용하는 메타학습 프레임워크를 제안한다. 기반 데이터에서 훈련된 변동형 오토인코더를 통해 클래스 분포를 모델링하고 분류와 회귀를 분리함으로써 VFA는 더 정확하고 안정적인 특징 응집을 가능하게 하며, PASCAL VOC와 COCO에서 강력한 기준 모델 대비 최대 16%의 상대적 향상으로 최신 기술 수준의 성능을 달성한다.
As few-shot object detectors are often trained with abundant base samples and fine-tuned on few-shot novel examples,the learned models are usually biased to base classes and sensitive to the variance of novel examples. To address this issue, we propose a meta-learning framework with two novel feature aggregation schemes. More precisely, we first present a Class-Agnostic Aggregation (CAA) method, where the query and support features can be aggregated regardless of their categories. The interactions between different classes encourage class-agnostic representations and reduce confusion between base and novel classes. Based on the CAA, we then propose a Variational Feature Aggregation (VFA) method, which encodes support examples into class-level support features for robust feature aggregation. We use a variational autoencoder to estimate class distributions and sample variational features from distributions that are more robust to the variance of support examples. Besides, we decouple classification and regression tasks so that VFA is performed on the classification branch without affecting object localization. Extensive experiments on PASCAL VOC and COCO demonstrate that our method significantly outperforms a strong baseline (up to 16\%) and previous state-of-the-art methods (4\% in average). Code will be available at: \url{https://github.com/csuhan/VFA}
연구 동기 및 목표
- 훈련 데이터의 클래스 불균형으로 인해 소수의 예제 객체 검출기가 기반 클래스에 대해 편향을 가지는 문제를 해결한다.
- 다른 클래스 간의 특징 상호작용을 통해 클래스에 무관한 표현을 장려함으로써 신규 클래스와 기반 클래스 간의 혼동을 줄인다.
- 소수의 예제에서의 내부 클래스 변동성에 대한 강건성을 향상시키기 위해 변동형 오토인코더를 사용해 클래스 분포를 모델링한다.
- 분류와 회귀를 분리함으로써 특징 응집이 국소화에 영향을 주지 않는 이동 불변 표현에 집중할 수 있도록 한다.
- 제한된 지원 예제가 있는 소수의 예제 객체 검출 벤치마크에서 최신 기술 수준의 성능을 달성한다.
제안 방법
- 클래스 아이덴티티에 관계없이 쿼리 및 지원 특징 간의 특징 상호작용을 가능하게 하는 Class-Agnostic Aggregation (CAA)을 제안한다. 이는 클래스 편향을 줄이고 일반화 능력을 향상시킨다.
- 기반 클래스에서 사전 훈련된 공유된 변동형 오토인코더(Variational Autoencoder, VAE)를 사용해 소수의 예제에서의 클래스 수준 분포를 모델링하는 Variational Feature Aggregation (VFA)을 도입한다.
- VAE를 사용해 지원 특징을 잠재 분포(평균 μ 및 분산 σ)로 인코딩한 후, 응집에 사용하기 위해 z = μ + ε·σ로 샘플링한 강건한 프로토타입을 생성한다.
- 신규 클래스에서 VAE를 미세조정하는 동안 클래스 고유의 정보를 유지하기 위해 일관성 손실 ℒcons를 적용한다. 이는 의미 있는 분포 추정을 보장한다.
- 분류 및 회귀 헤드를 분리하여 VFA가 분류 브랜치에서만 작동하도록 하며, 국소화 정확도를 유지한다.
- 메타학습 훈련 프레임워크를 사용하여 모델을 먼저 기반 클래스에서 사전 훈련하고, K-샷 지원 세트로 소수의 예제 신규 클래스에서 미세조정한다.

실험 결과
연구 질문
- RQ1다른 클래스 간 특징 상호작용은 소수의 예제 객체 검출에서 기반 클래스에 대한 편향을 줄일 수 있는가?
- RQ2변동형 오토인코더를 통해 클래스 분포를 모델링하면 소수의 예제에서 내부 클래스 변동성에 대한 강건성을 향상시킬 수 있는가?
- RQ3분류와 회귀를 분리하면 국소화 성능이 저하되지 않으면서도 더 효과적인 특징 응집이 가능한가?
- RQ4풍부한 기반 클래스에서 학습된 분포를 소수의 예제로만 이루어진 새로운 클래스로 효과적으로 전이할 수 있는가?
- RQ5특징 표현의 선택(예: 원본, 재구성, 잠재)이 프로토타입의 강건성과 정확도에 어떤 영향을 미치는가?
주요 결과
- 제안된 VFA 방법은 강력한 Meta R-CNN++ 기준 모델을 1-shot 검출에서 최대 16% 향상시켜 저샷 환경에서 뚜렷한 성과 향상을 보였다.
- PASCAL VOC에서 ℒcons를 재구성된 특징 S′에 적용했을 경우, VFA는 1-shot 검출에서 57.7% nAP를 달성했으며, VFA 없이 51.3%를 기록한 기준 모델을 초월했다.
- CAA 및 VFA 적용으로 인해 신규 클래스와 기반 클래스 간의 혼동이 감소했다. 예를 들어, '소'라는 신규 클래스와 '말'이나 '양' 같은 기반 클래스 간의 유사도가 크게 감소했다.
- VFA를 통해 추정된 클래스 프로토타입은 샷 수 감소에 더 강건하다. 지원 예제 수가 감소함에 따라 실제 클래스 중심과의 거리 증가 폭이 더 작다.
- VAE에서 유도된 잠재 표현 μ 및 σ는 원본 특징 S와 재구성된 특징 S′보다 프로토타입 정확도 및 강건성 측면에서 뛰어나다.
- 일관성 손실 ℒcons는 필수적이다. 재구성된 특징 S′에 적용했을 경우 최고의 성능(1-shot에서 57.7% nAP)을 기록했으며, 이는 분포 학습 과정에서 클래스 고유 정보를 유지하는 데서 그 역할을 확인시켰다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.