[논문 리뷰] Collaboration of Pre-trained Models Makes Better Few-shot Learner
이 논문은 소수의 예시 학습을 위한 프레임워크인 CoMo를 제안한다. CoMo는 언어-대비 기반의 CLIP, 시각-대비 기반의 DINO, 언어 생성 기반의 DALL-E라는 사전 훈련된 모델들을 협업시켜 소수의 예시 학습 분류 성능을 향상시킨다. DALL-E를 통해 제로샷으로 합성 이미지를 생성하고, 학습 가능한 다중지식 어댑터를 통해 예측을 적응적으로 앙상블함으로써, 추가적인 레이블 데이터 없이도 11개 데이터셋에서 최신 기술 수준(SOTA)의 성능을 달성한다.
Few-shot classification requires deep neural networks to learn generalized representations only from limited training images, which is challenging but significant in low-data regimes. Recently, CLIP-based methods have shown promising few-shot performance benefited from the contrastive language-image pre-training. Based on this point, we question if the large-scale pre-training can alleviate the few-shot data deficiency and also assist the representation learning by the pre-learned knowledge. In this paper, we propose CoMo, a Collaboration of pre-trained Models that incorporates diverse prior knowledge from various pre-training paradigms for better few-shot learning. Our CoMo includes: CLIP's language-contrastive knowledge, DINO's vision-contrastive knowledge, and DALL-E's language-generative knowledge. Specifically, CoMo works in two aspects: few-shot data expansion and diverse knowledge ensemble. For one, we generate synthetic images via zero-shot DALL-E to enrich the few-shot training data without any manpower. For the other, we introduce a learnable Multi-Knowledge Adapter (MK-Adapter) to adaptively blend the predictions from CLIP and DINO. By such collaboration, CoMo can fully unleash the potential of different pre-training methods and unify them to perform state-of-the-art for few-shot classification. We conduct extensive experiments on 11 datasets to demonstrate the superiority and generalization ability of our approach.
연구 동기 및 목표
- 다양한 사전 훈련 파라다임을 융합하는 것이 소수의 예시 학습에서 데이터 부족 문제를 완화할 수 있는가를 조사하는 것.
- CLIP, DINO, DALL-E의 상호보완적인 지식을 활용하여 소수의 예시 분류 성능을 향상시키는 것.
- 레이블이 제한된 데이터와 사전 훈련된 모델들만을 사용하여 표현 학습을 향상시키는 방법을 개발하는 것.
- 다양한 사전 훈련된 모델의 예측을 적응적으로 융합할 수 있는 학습 가능한 어댑터를 설계하는 것.
제안 방법
- CoMo는 클래스 기반 텍스트 프롬프트에 조건을 두어 제로샷 DALL-E를 사용해 합성 이미지를 생성함으로써 소수의 예시 학습 데이터를 확장한다.
- CoMo는 이중 키 캐시를 갖춘 다중지식 어댑터(MK-Adapter)를 활용하여 CLIP과 DINO의 로짓을 생성하고 적응적으로 조합한다.
- MK-Adapter는 사전 훈련된 모델의 출력과 CLIP의 제로샷 로짓 간의 분포 유사도를 사용하여 예측을 재가중한다.
- 최종 예측은 CLIP의 제로샷 로짓, DINO의 시각-대비 로짓, 그리고 MK-Adapter의 융합 출력의 앙상블이다.
- 사전 훈련된 모델의 가중치는 동결된 상태를 유지하고, 유일하게 경량의 MK-Adapter만 확장된 소수의 예시 데이터에 대해 미세조정된다.
- 프레임워크는 확장된 데이터에서 교차 엔트로피 손실을 사용하여 엔드 투 엔드로 훈련되며, 효과적인 지식 정착을 가능하게 한다.
실험 결과
연구 질문
- RQ1다른 사전 훈련 목표를 가진 사전 훈련된 모델들을 융합하는 것이 단일 모델 기반 베이스라인을 초월하여 소수의 예시 분류 성능을 향상시킬 수 있는가?
- RQ2DALL-E의 제로샷 이미지 생성이 수동 레이블링 없이도 소수의 예시 학습 데이터를 효과적으로 확장할 수 있는가?
- RQ3다양한 사전 훈련된 모델의 예측을 적응적으로 융합하는 것이 고정된 앙상블 전략보다 더 나은 일반화 성능을 낼 수 있는가?
- RQ4CLIP, DINO, DALL-E의 협업 방식이 다양한 데이터셋에서 기존의 소수의 예시 학습 방법과 비교해 어떻게 성능을 냈는가?
주요 결과
- CoMo는 11개의 소수의 예시 분류 데이터셋에서 최신 기술 수준의 성능을 달성하며, CLIP-Adapter 및 Tip-Adapter-F와 같은 기존 방법들을 모두 능가한다.
- 16-shot ImageNet에서 CoMo는 ViT-B/16를 사용해 74.48%의 top-1 정확도를 기록했으며, 두 번째로 우수한 성능을 낸 방법(Tip-Adapter-F)보다 0.79%포인트 높다.
- 클래스당 최적의 합성 이미지 수는 4개이며, 이 이상으로 늘일 경우 저품질 샘플이 포함되어 성능이 저하된다.
- 적응적 앙상블의 기준으로 CLIP의 제로샷 로짓을 사용할 경우 가장 우수한 성능을 기록했으며, 평균 또는 최대 풀링 전략보다 뛰어나다.
- t-SNE 시각화 결과 CoMo는 Tip-Adapter-F보다 더 분리되고 대비가 뚜렷한 클래스 클러스터를 생성함으로써 클래스 오버랩 문제를 줄였다.
- 학습 곡선 분석 결과 CoMo는 20 에포크 동안 훈련했을 때 단일 모델 기반 베이스라인보다 더 빠르게 수렴하고 더 높은 정확도를 달성한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.