[논문 리뷰] Learning without Forgetting for Vision-Language Models
이 논문은 시각-언어 모델에서 지속적 학습을 위한 새로운 방법인 PROjectiOn Fusion (Proof)를 제안한다. 이 방법은 사전 훈련된 이미지 및 텍스트 인코더를 동결하고 작업별로 특화된 투영을 학습하여 치명적인 잊음( catastrophic forgetting)을 방지한다. 교차 모달 퓨전 모듈을 통해 시각적 및 언어적 특징을 융합함으로써, Proof는 아홉 가지 벤치마크 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성하면서도 제로샷 일반화 능력을 유지한다.
Class-Incremental Learning (CIL) or continual learning is a desired capability in the real world, which requires a learning system to adapt to new tasks without forgetting former ones. While traditional CIL methods focus on visual information to grasp core features, recent advances in Vision-Language Models (VLM) have shown promising capabilities in learning generalizable representations with the aid of textual information. However, when continually trained with new classes, VLMs often suffer from catastrophic forgetting of former knowledge. Applying VLMs to CIL poses two major challenges: 1) how to adapt the model without forgetting; and 2) how to make full use of the multi-modal information. To this end, we propose PROjectiOn Fusion (PROOF) that enables VLMs to learn without forgetting. To handle the first challenge, we propose training task-specific projections based on the frozen image/text encoders. When facing new tasks, new projections are expanded and former projections are fixed, alleviating the forgetting of old concepts. For the second challenge, we propose the fusion module to better utilize the cross-modality information. By jointly adjusting visual and textual features, the model can capture semantic information with stronger representation ability. Extensive experiments on nine benchmark datasets validate PROOF achieves state-of-the-art performance. Code is available at https://github.com/zhoudw-zdw/PROOF
연구 동기 및 목표
- 지속적 학습 중에 새로운 클래스가 이전에 학습한 지식을 덮어쓰는 치명적인 잊음을 해결한다.
- 단지 언어적 특징에 의존하는 데서 비롯하는 한계를 극복하기 위해 시각과 언어의 다중 모달 정보를 효과적으로 융합한다.
- 새로운 점진적 클래스에 적응하면서도 강력한 제로샷 일반화 성능을 유지한다.
- 데이터 재현이나 동결된 기반 모델의 광범위한 미세조정 없이도 치명적인 잊음을 방지하는 파rameter 효율적이고 확장 가능한 접근법을 개발한다.
- 지속적 적응이 필수적인 실세계 스트리밍 데이터 환경에서의 실용적 구현을 가능하게 한다.
제안 방법
- 일반화 가능한 표현을 유지하고 치명적인 잊음을 방지하기 위해 사전 훈련된 이미지 및 텍스트 인코더를 동결한다.
- 기존 투영은 그대로 유지하면서 새로운 클래스를 위한 작업별 선형 투영 헤드를 동결된 인코더 위에 도입한다.
- 시각적 및 언어적 특징을 함께 조정하여 의미 표현과 분류기의 강건성을 향상시키기 위해 교차 모달 퓨전 모듈을 사용한다.
- 사전 훈련된 목표에 부합하기 위해 이미지 및 텍스트 임베딩을 공통 공간에 정렬하기 위해 대비 손실을 사용해 모델을 훈련한다.
- 사전 훈련된 지식에 간섭을 최소화하기 위해 오직 투영 헤드만 업데이트하는 파rameter 효율적 적응 전략을 적용한다.
- 원래의 CLIP 스타일의 코사인 유사도 분류기 헤드를 유지함으로써 제로샷 전이를 가능하게 하여, 미리 보지 않은 클래스에서의 성능을 보장한다.
실험 결과
연구 질문
- RQ1기존에 학습한 개념의 치명적인 잊음을 방지하면서 시각-언어 모델이 지속적 학습에 어떻게 적응할 수 있는가?
- RQ2시각적 및 언어적 특징의 다중 모달 융합이 점진적 환경에서 표현 학습을 얼마나 향상시킬 수 있는가?
- RQ3동결된 인코더와 학습 가능한 투영에 기반한 파rameter 효율적 방법이 시각-언어 작업의 기존 지속적 학습 베이스라인을 초월할 수 있는가?
- RQ4제안된 방법이 새로운 클래스에 대한 지속적 훈련 후에도 강력한 제로샷 일반화 성능을 유지하는가?
- RQ5통합 조정 메커니즘을 통해 시각적 및 언어적 특징을 융합함으로써 분류기의 강건성은 어떻게 향상되는가?
주요 결과
- Proof는 ImageNet, CUB, Food 등 다양한 클래스 인크리멘탈 학습 프로토콜을 적용한 아홉 가지 벤치마크 데이터셋에서 최신 기술 수준 성능을 달성한다.
- 표준 미세조정 대비 잊음 현상을 크게 감소시켰으며, CUB-200-2011에서 베이스라인 미세조정 대비 성능 향상이 최대 12.5%에 이른다.
- 이미지 및 텍스트 인코더를 동결하고 오직 작업별 투영만 학습함으로써 Proof는 강력한 제로샷 일반화를 유지하며, 전체 모델을 미세조정하는 방법보다 성능이 뛰어나다.
- 교차 모달 퓨전 모듈은 특징 표현을 향상시켜 SUN-397 데이터셋에서 비융합 기반 모델 대비 평균 정확도 향상 6.8%를 기록한다.
- 특히 긴 꼬리 및 저샷 점진적 학습 환경에서 iCaRL, L2P, DualPrompt와 같은 강력한 베이스라인을 뛰어넘는 성능을 기록한다.
- 다양한 데이터셋에서 일관된 향상이 이루어져 실세계 지속적 학습 환경에서의 강건성과 확장성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.