[논문 리뷰] Don't Stop Learning: Towards Continual Learning for the CLIP Model
이 논문은 CLIP 모델을 위한 새로운 지속적 학습 방법인 VR-LwF를 제안하며, 임의로 생성된 가짜 클래스에 대한 예측을 정규화하여 미세조정 중 치명적인 잊음 현상을 완화한다. 이 방법은 CLIP의 제로샷 및 이미지-텍스트 매칭 성능을 유지하면서도 미세조정 정확도를 향상시켜, LwF 및 RKR와 같은 기존 지속적 학습 방법의 직접적 적용보다 제로샷 및 검색 벤치마크에서 모두 뛰어난 성능을 보인다.
The Contrastive Language-Image Pre-training (CLIP) Model is a recently proposed large-scale pre-train model which attracts increasing attention in the computer vision community. Benefiting from its gigantic image-text training set, the CLIP model has learned outstanding capabilities in zero-shot learning and image-text matching. To boost the recognition performance of CLIP on some target visual concepts, it is often desirable to further update the CLIP model by fine-tuning some classes-of-interest on extra training data. This operation, however, raises an important concern: will the update hurt the zero-shot learning or image-text matching capability of the CLIP, i.e., the catastrophic forgetting issue? If yes, could existing continual learning algorithms be adapted to alleviate the risk of catastrophic forgetting? To answer these questions, this work conducts a systemic study on the continual learning issue of the CLIP model. We construct evaluation protocols to measure the impact of fine-tuning updates and explore different ways to upgrade existing continual learning methods to mitigate the forgetting issue of the CLIP model. Our study reveals the particular challenges of CLIP continual learning problem and lays a foundation for further researches. Moreover, we propose a new algorithm, dubbed Learning without Forgetting via Replayed Vocabulary (VR-LwF), which shows exact effectiveness for alleviating the forgetting issue of the CLIP model.
연구 동기 및 목표
- 특정 시각적 카테고리에 대해 CLIP를 미세조정할 경우 그 제로샷 및 이미지-텍스트 매칭 능력이 치명적인 잊음 현상에 걸리는가를 조사하는 것.
- 기존 지속적 학습 알고리즘인 LwF, GeoDL, IMM, RKR가 CLIP 모델의 지속적 학습 환경에 어떻게 적응 가능한지 평가하는 것.
- CLIP에 특화된 새로운 지속적 학습 방법을 설계하고 검증하여 사전학습된 능력을 유지하면서도 효과적인 미세조정을 가능하게 하는 것.
- CLIP에서의 지속적 학습을 체계적으로 평가할 수 있는 평가 프로토콜을 수립하여 잊음과 성능 향상의 재현 가능성을 확보하는 것.
제안 방법
- VR-LwF는 미세조정 중에 임의의 가짜 문장을 생성함으로써 가짜 클래스를 표현하는 재생된 어휘(재생된 어휘)를 활용해 지식 정규화를 수행한다.
- 모델은 새로운 데이터를 업데이트하기 전과 후에 동일한 예측 로짓을 유지하도록 훈련되어 표현 공간의 안정성을 확보한다.
- 정규화는 업데이트된 클래스가 아닌 재생된 어휘에 적용되며, 이는 일반화 능력 향상과 잊음 감소에 기여한다.
- 이 방법은 다중 지속적 학습 시나리오인 OST(일괄 스트림), MST(다중 스트림), 그리고 COCO/Flickr 검색 작업을 포함해 평가된다.
- 제거 분석을 통해 랜덤 샘플링과 자연어 캡션 재생을 비교하고, 샘플링 길이와 재생 크기를 변화시켜 복원성과 효율성을 평가한다.
- 평가에는 표준 메트릭이 사용된다: UT-Acc(과제 정확도), ZS-Acc(제로샷 정확도), Bwt(역방향 전이), TR@1/IR@1(검색 성능).
실험 결과
연구 질문
- RQ1CLIP를 새로운 시각적 카테고리에 대해 미세조정하면 제로샷 및 이미지-텍스트 매칭 능력이 치명적인 잊음 현상에 걸리는가?
- RQ2LwF, GeoDL, IMM, RKR와 같은 기존 지속적 학습 방법들이 CLIP 모델에 효과적으로 적용되어 잊음 현상을 줄일 수 있는가?
- RQ3정규화 타겟으로서 업데이트된 클래스와 재생된 가짜 클래스 중 어떤 선택이 CLIP의 성능과 잊음에 영향을 미치는가?
- RQ4다른 재생 전략(랜덤 샘플링 대 캡션 재생)과 하이퍼파라미터(샘플링 길이, 재생 크기)가 CLIP의 지속적 학습 성능에 어떤 영향을 미치는가?
주요 결과
- CLIP는 다중 세션 설정에서 원본 모델의 제로샷 정확도 62.62%에서 미세조정 후 39.80%로 급격히 감소하여 치명적인 잊음 현상을 겪는다.
- 기존 지속적 학습 방법의 직접적 적용(예: LwF 확장)은 잊음을 줄이지만, 미세조정 성능을 희생시켜 OST에서 UT-Acc 72.82%와 ZS-Acc 58.75%를 기록한다.
- VR-LwF는 OST에서 UT-Acc 74.41%와 ZS-Acc 62.03%를 달성하여 LwF 확장보다 미세조정 및 제로샷 성능 모두에서 뛰어난 성능을 보인다.
- 다중 세션 설정(MST)에서 VR-LwF-WM은 A-Acc 61.13%와 TR@1 68.32%를 기록하여 다양한 데이터셋 간의 높은 안정성과 전이 가능성 확보를 보였다.
- OST에서는 캡션 재생이 랜덤 샘플링보다 略적으로 더 나은 성능을 보였지만, MST에서는 반대로 성능이 열 劣하므로 어순 구조가 성능에 주요 요인으로 작용하지 않는 것으로 나타났다.
- 재생 크기(Ks)를 50에서 400으로 늘일 경우 A-Acc는 약간 향상되지만 학습 비용이 증가하고, Ks=200을 초과하면 수익 감소 현상이 나타난다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.