Skip to main content
QUICK REVIEW

[논문 리뷰] CLIP model is an Efficient Continual Learner

Vishal Thengane, Salman Khan|arXiv (Cornell University)|2022. 10. 06.
Multimodal Machine Learning Applications인용 수 14
한 줄 요약

이 논문은 피지컬화된 CLIP 모델이 파라미터 미세조정, 메모리 재생, 하이퍼파라미터 튜닝 없이 ImageNet-100/1K, CIFAR-100, TinyImageNet, CORe50에서 클래스 인크리멘탈, 도메인 인크리멘탈, 작업 무관 설정 등 다양한 환경에서 제로샷 지속적 학습 성능에서 최고 성능을 달성함을 보여준다. 강력한 일반화 능력은 4억 개의 이미지-텍스트 쌍으로 사전 훈련된 CLIP의 대비 학습에서 기인하며, 간단한 프롬프트 엔지니어링을 통해 성능이 더욱 향상된다.

ABSTRACT

The continual learning setting aims to learn new tasks over time without forgetting the previous ones. The literature reports several significant efforts to tackle this problem with limited or no access to previous task data. Among such efforts, typical solutions offer sophisticated techniques involving memory replay, knowledge distillation, model regularization, and dynamic network expansion. The resulting methods have a retraining cost at each learning task, dedicated memory requirements, and setting-specific design choices. In this work, we show that a frozen CLIP (Contrastive Language-Image Pretraining) model offers astounding continual learning performance without any fine-tuning (zero-shot evaluation). We evaluate CLIP under a variety of settings including class-incremental, domain-incremental and task-agnostic incremental learning on five popular benchmarks (ImageNet-100 & 1K, CORe50, CIFAR-100, and TinyImageNet). Without any bells and whistles, the CLIP model outperforms the state-of-the-art continual learning approaches in the majority of the settings. We show the effect on the CLIP model's performance by varying text inputs with simple prompt templates. To the best of our knowledge, this is the first work to report the CLIP zero-shot performance in a continual setting. We advocate the use of this strong yet embarrassingly simple baseline for future comparisons in the continual learning tasks.

연구 동기 및 목표

  • 파라미터 재학습이나 작업별 설계 없이도, 지속적 학습을 위한 강력하고 일반적인 기준선으로 동결된 CLIP 모델이 활용될 수 있는지 평가하는 것.
  • 클래스 인크리멘탈, 도메인 인크리멘탈, 작업 무관 학습 등 다양한 지속적 학습 프로토콜에서 CLIP의 제로샷 성능을 평가하는 것.
  • 다양한 텍스트 프롬프트 템플릿과 풀링 전략을 사용해 프롬프트 엔지니어링이 CLIP의 지속적 학습 정확도에 미치는 영향을 조사하는 것.
  • 기존 지속적 학습 방법들이 설정 기반 제약을 초월하는 단순하고 확장 가능하며 메모리가 없는 기준선을 수립하는 것.
  • 지속적 학습 분야의 현재 분열된 환경을 도전하기 위해, 기초 시각-언어 모델을 통합적이고 일반화 가능한 솔루션으로 제안하는 것.

제안 방법

  • 모델의 파라미터를 동결한 채로, 파라미터 업데이트 없이 제로샷 추론을 사용해 지속적 학습 벤치마크에서 사전 훈련된 CLIP 모델을 평가하는 것.
  • 텍스트 프롬프트 템플릿을 사용해 CLIP의 분류기 헤드를 조정하며, 클래스 이름은 ImageNet 원본 레이블, 수거된 레이블, WordNet 동의어를 기반으로 한다.
  • 두 가지 프롬프트 풀링 전략 적용: 의사결정 기반 풀링(프롬프트 간 로짓 평균화) 및 임베딩 풀링(텍스트 임베딩 스택킹).
  • 다섯 가지 주요 벤치마크에서 테스트: ImageNet-100/1K, CORe50, CIFAR-100, TinyImageNet, 그리고 다양한 지속적 학습 프로토콜에 따른 가우시안 스케줄링 기반 CIFAR-100.
  • 모든 설정에서 최고 성능을 기록한 지속적 학습 방법들과의 성능 비교를 통해 동결된 CLIP 기준선의 효과성을 검증하는 것.
  • 혼동 행렬 분석을 통해 주로 의미적으로 유사한 클래스 간 오분류가 발생하는 실패 모드를 규명하는 것.

실험 결과

연구 질문

  • RQ1파라미터 미세조정이나 메모리 재생 없이도, 동결된 CLIP 모델이 다양한 프로토콜에서 경쟁 가능한 지속적 학습 성능을 달성할 수 있는가?
  • RQ2프롬프트 엔지니어링(특히 클래스 이름 선택 및 풀링 전략)이 CLIP의 제로샷 지속적 학습 정확도에 미치는 영향은 무엇인가?
  • RQ34억 개의 이미지-텍스트 쌍으로 사전 훈련된 CLIP이, 일부 다운스트림 클래스가 사전 훈련 중에 존재했더라도 지속적 학습 시나리오로의 일반화 능력을 제공하는가?
  • RQ4다양한 벤치마크와 설정에서 CLIP의 성능는 최고 수준의 지속적 학습 방법들과 비교해 어떻게 나타나는가?
  • RQ5단일의 통합적이고 동결된 시각-언어 모델이 클래스 인크리멘탈, 도메인 인크리멘탈, 작업 무관 지속적 학습 전반에서 강력한 기준선이 될 수 있는가?

주요 결과

  • ImageNet-100에서, 임베딩 풀링과 수거된 클래스 이름을 사용한 Continual-CLIP는 84.85%의 정확도를 기록하며, 동일한 설정에서 최고 성능을 기록한 기존 방법들을 초월했다.
  • ImageNet-1K의 클래스 인크리멘탈 설정에서, 동결된 CLIP 모델은 어떤 미세조정 없이도 경쟁 가능한 성능을 달성했으며, 대규모 데이터셋에 대한 확장성도 입증했다.
  • CORe50의 도메인 인크리멘탈 설정에서, CLIP는 강력한 일반화 능력을 보이며 재학습 없이 도메인 이동에 대비한 안정성을 입증했다.
  • 수거된 클래스 이름(Type b)이 가장 높은 정확도를 기록했으며, 이는 클래스 간 의미적 모호성을 최소화했기 때문이다. 원본 ImageNet 레이블 및 동의어 기반 이름보다 성능이 뛰어났다.
  • ImageNet-100에서 임베딩 풀링(84.85%)이 의사결정 기반 풀링(82.24%)을 略로 뛰어넘었으며, 둘 다 프롬프트 엔지니어링과 추가 계산이 수반된다.
  • 혼동 행렬 분석 결과, 오류는 주로 의미적으로 유사한 클래스 간에 발생했으며(예: 'mouse'가 'shrew'로 잘못 분류됨), 이는 세분화된 시각-의미 일치의 한계를 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.