[논문 리뷰] Preventing Zero-Shot Transfer Degradation in Continual Learning of Vision-Language Models
이 논문은 시각-언어 모델의 지속적 학습을 위한 새로운 방법 ZSCL을 제안한다. ZSCL은 의미적으로 다양한 참조 데이터셋에서 초기 미사전학습 모델을 토대로 특성 공간에서 소프트 라벨을 통한 distillation을 수행하고, 가중치 앙상블 기법을 사용하여 파라미터 업데이트의 안정성을 확보함으로써 제로샷 전이 성능 저하를 방지한다. ZSCL은 새로운 다중 도메인 작업 증분 학습 벤치마크에서 기존 방법 대비 평균 정확도를 9.7% 향상시켜 최신 기술 수준을 달성한다.
Continual learning (CL) can help pre-trained vision-language models efficiently adapt to new or under-trained data distributions without re-training. Nevertheless, during the continual training of the Contrastive Language-Image Pre-training (CLIP) model, we observe that the model's zero-shot transfer ability significantly degrades due to catastrophic forgetting. Existing CL methods can mitigate forgetting by replaying previous data. However, since the CLIP dataset is private, replay methods cannot access the pre-training dataset. In addition, replaying data of previously learned downstream tasks can enhance their performance but comes at the cost of sacrificing zero-shot performance. To address this challenge, we propose a novel method ZSCL to prevent zero-shot transfer degradation in the continual learning of vision-language models in both feature and parameter space. In the feature space, a reference dataset is introduced for distillation between the current and initial models. The reference dataset should have semantic diversity but no need to be labeled, seen in pre-training, or matched image-text pairs. In parameter space, we prevent a large parameter shift by averaging weights during the training. We propose a more challenging Multi-domain Task Incremental Learning (MTIL) benchmark to evaluate different methods, where tasks are from various domains instead of class-separated in a single dataset. Our method outperforms other methods in the traditional class-incremental learning setting and the MTIL by 9.7% average score. Our code locates at https://github.com/Thunderbeee/ZSCL.
연구 동기 및 목표
- 사전 학습된 시각-언어 모델의 지속적 학습에서 치명적인 기억 상실 문제를 해결하고, 특히 제로샷 전이 능력 저하를 방지한다.
- CLIP 사전 학습 데이터셋의 비공개 성격으로 인해 리플레이 기반 방법의 한계를 극복한다.
- 증분 학습 과정에서 특성 공간 지식과 파라미터 안정성을 동시에 유지하는 방법을 개발한다.
- 일반화 능력과 내구성을 더 잘 평가하기 위해 다양한 도메인(예: 음식, 차량, 경관 등)에서 온 작업을 포함한 더 도전적인 다중 도메인 작업 증분 학습(MTIL) 벤치마크를 제안한다.
- 특히 제로샷 일반화 성능을 고려할 때, 다양한 학습 순서와 작업 분포에 대해 강건한 성능을 달성한다.
제안 방법
- 라벨이나 쌍으로 구성된 이미지-텍스트 데이터가 없는 의미적으로 다양한 참조 데이터셋을 도입하여 특성 공간에서의 distillation을 수행한다.
- 현재 미세조정된 모델이 아닌 원본 사전 학습된 CLIP 모델을 교사 모델로 사용하여 지식 distillation을 수행한다.
- 참조 이미지와 텍스트 임베딩 간의 상대적 유사도를 유지하기 위해 지식 distillation 손실을 적용함으로써 특성 공간의 편차를 최소화한다.
- 학습 단계 간 가중치 앙상블 전략을 도입하여 큰 파라미터 이동을 방지하고, 초기 모델과 미세조정된 모델 가중치 사이의 효과적 보간을 실현한다.
- 특성 공간 distillation과 파라미터 공간 정규화를 결합하여 표현 공간과 모델 가중치 공간 양쪽에서 기억 상실을 동시에 완화한다.
- 일반화 능력과 내구성을 테스트하기 위해 다양한 도메인(예: 음식, 차량, 경관 등)에서 온 작업을 포함한 다중 도메인 작업 증분 학습(MTIL) 벤치마크를 설계한다.
실험 결과
연구 질문
- RQ1사전 학습 데이터셋에 접근할 수 없는 상황에서 시각-언어 모델의 지속적 학습에서 제로샷 전이 성능 저하를 방지할 수 있는가?
- RQ2라벨이 없고 다양한 의미를 가진 참조 데이터셋을 활용해 초기 사전 학습된 모델에서 지식 distillation을 수행할 경우, 제로샷 성능 유지에 얼마나 효과적인가?
- RQ3가중치 앙상블를 통한 파라미터 공간 정규화가 지속적 시각-언어 학습에서 안정성과 일반화 능력을 향상시키는가?
- RQ4제안된 방법은 도전적인 실생활과 유사한 학습 순서와 다중 도메인 작업 순서에서 어떻게 성능을 발휘하는가?
- RQ5MTIL과 같은 새로운 벤치마크는 시각-언어 모델의 지속적 학습 방법의 내구성과 일반화 능력을 더 잘 평가할 수 있는가?
주요 결과
- 제안된 다중 도메인 작업 증분 학습(MTIL) 벤치마크에서 ZSCL은 기존 방법 대비 평균 정확도를 9.7% 향상시켰다.
- 클래스 증분 학습에서 CIFAR100을 대상으로 할 경우, ZSCL은 평균 정확도 82.15%와 최종 작업 정확도 73.65%를 기록했으며, 두 번째로 우수한 성능을 보인 iCaRL 대비 각각 +7.68%와 +7.73% 향상되었다.
- TinyImageNet에서 ZSCL은 평균 정확도 80.27%와 최종 작업 정확도 73.57%를 달성했으며, 이는 이전 최신 기술(iCaRL) 대비 각각 +10.65%와 +8.27% 향상된 성과이다.
- ZSCL은 다양한 학습 순서(예: Order-I 대비 Order-II)에서도 일관된 성능을 유지하며, 마지막 점수에서 뿐다 0.2% 감소에 그쳐 높은 내구성을 입증했다.
- 특히 큰 단계 수가 적용될 경우, 제로샷 전이와 후속 작업 성능 모두에서 치명적인 기억 상실을 크게 감소시켰다.
- 제거 분석 결과, 원본 CLIP 모델을 교사로 사용하고 의미적으로 다양한 참조 데이터셋을 활용하는 것이 성능 향상에 핵심적임을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.