[논문 리뷰] BaseTransformers: Attention over base data-points for One Shot Learning
이 논문은 기반 데이터셋의 특징 공간에서 의미적으로 유사하고 잘 표현된 영역에 주의를 기울여 새로운 클래스를 위한 더 견고한 프로토타ип을 구성함으로써 일시적 분류 성능을 향상시키는 새로운 소수의 학습 방법인 BaseTransformers를 제안한다. 교차 어텐션을 사용하고 사전 훈련된 낮은 노이즈 특징을 활용함으로써, 유도적 일시적 학습 설정에서 mini-ImageNet(70.88%), tiered-ImageNet(72.46%), CUB(82.27%)에서 최신 기술 성능을 달성한다.
Few shot classification aims to learn to recognize novel categories using only limited samples per category. Most current few shot methods use a base dataset rich in labeled examples to train an encoder that is used for obtaining representations of support instances for novel classes. Since the test instances are from a distribution different to the base distribution, their feature representations are of poor quality, degrading performance. In this paper we propose to make use of the well-trained feature representations of the base dataset that are closest to each support instance to improve its representation during meta-test time. To this end, we propose BaseTransformers, that attends to the most relevant regions of the base dataset feature space and improves support instance representations. Experiments on three benchmark data sets show that our method works well for several backbones and achieves state-of-the-art results in the inductive one shot setting. Code is available at github.com/mayug/BaseTransformers
연구 동기 및 목표
- 새로운 클래스의 단일 표본 표현이 노이즈가 많아 일시적 학습에서 프로토타입 추정이 열악해지는 문제를 해결하기 위해.
- 대규모 기반 데이터셋에서 잘 훈련된 낮은 노이즈 특징 표현을 활용하여 소수의 학습 분류 성능을 향상시키기 위해.
- 지원 샘플과 의미적으로 유사한 기반 샘플 간의 국소적 의미적 대응 관계를 학습하여 프로토타입의 부분 기반 조합을 가능하게 하기 위해.
- 가우스 분포나 특징의 전역 이동 가능성에 대한 가정을 제거하고, 대신 국소적이고 공간적으로 의미 있는 특징 정렬에 초점을 맞추기 위해.
제안 방법
- BaseTransformers는 지원 샘플의 특징 맵을 쿼리로 사용하고, 의미적으로 유사한 기반 샘플의 특징을 키와 값으로 사용하는 교차 어텐션 메커니즘을 사용한다.
- 사전 훈련된 인코더의 잠재 공간에서 특징 공간 적응을 수행하여 픽셀 공간 연산을 피하고 더 나은 의미 전달을 달성한다.
- 클래스 레이블 정보를 통해 의미적 유사도를 이용해 가장 가까운 기반 클래스를 식별함으로써 관련 기반 특징을 타겟팅하여 쿼리할 수 있도록 한다.
- 모델은 메타학습을 통해 엔드 투 엔드로 훈련되며, 인코더와 BaseTransformer를 함께 최적화하여 새로운 클래스의 프로토타입을 정교화한다.
- 사전 훈련은 대비 손실(예: SimCLR 및 InfoNCE)을 사용하여 감독 붕괴를 방지하고 견고한 기반 특징을 생성한다.
- 어텐션 맵을 시각화하여 모델이 기반 이미지의 의미적으로 유의미한 국소 영역, 특히 부분 수준의 영역에 주의를 기울인다는 것을 확인한다.
실험 결과
연구 질문
- RQ1단일 노이즈가 많은 지원 샘플에 의존하는 대신, 기반 데이터셋의 잘 표현된 특징을 활용함으로써 일시적 학습에서 프로토타입 추정을 향상시킬 수 있는가?
- RQ2새로운 지원 샘플과 의미적으로 유사한 기반 샘플 간의 국소적 부분 기반 대응 관계를 학습하면 더 견고한 프로토타입 표현이 되는가?
- RQ3교차 어텐션 메커니즘이 기반 특징 공간에서 관련 영역을 효과적으로 탐지하고 집계하여 새로운 클래스의 더 나은 프로토타입을 구성할 수 있는가?
- RQ4쿼리 함수의 선택(시각적, 의미적, 오라클)이 제안된 방법의 성능에 어떤 영향을 미치는가?
- RQ5이 방법은 다양한 백본과 소수의 학습 벤치마크 간에 얼마나 일반화되는가?
주요 결과
- BaseTransformers는 1-shot 정확도 70.88%로 mini-ImageNet에서 최신 기술 성능을 달성하며 이전 방법을 초월한다.
- tiered-ImageNet에서는 1-shot 설정에서 72.46%의 정확도를 기록하여 다양한 소수의 학습 벤치마크에 대한 강력한 일반화 능력을 보여준다.
- CUB 데이터셋에서는 1-shot 정확도 82.27%를 달성하여 미세한 분류 작업에서의 효과성을 입증한다.
- 제거 실험 결과, SimCLR 사전 훈련과 의미적 쿼리의 조합이 기본 모델인 Prototypical Networks보다 약 2% 성능 향상을 이룬다.
- 모델의 성능은 쿼리 함수에 의해 제한되며, 오라클 쿼리(진짜 클래스 프로토타입 사용)를 적용하면 tiered-ImageNet에서 정확도가 76.55%로 상승하여 쿼리 전략 개선 여지가 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.