[논문 리뷰] AttriCLIP: A Non-Incremental Learner for Incremental Knowledge Learning
AttriCLIP는 파rameter 확장이나 리プレイ 메모리가 필요 없도록 고정된 CLIP 백본을 활용하고 고정된 속성어 단어집에서 작업별 속성 프롬프트를 학습하는 비증분적 지속학습 프레임워크를 제안한다. 동적이고 속성 기반의 텍스트 프롬프트를 사용하여 zero-shot 분류를 수행함으로써 장기적 순차적, 도메인 이동 지속학습 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성한다.
Continual learning aims to enable a model to incrementally learn knowledge from sequentially arrived data. Previous works adopt the conventional classification architecture, which consists of a feature extractor and a classifier. The feature extractor is shared across sequentially arrived tasks or classes, but one specific group of weights of the classifier corresponding to one new class should be incrementally expanded. Consequently, the parameters of a continual learner gradually increase. Moreover, as the classifier contains all historical arrived classes, a certain size of the memory is usually required to store rehearsal data to mitigate classifier bias and catastrophic forgetting. In this paper, we propose a non-incremental learner, named AttriCLIP, to incrementally extract knowledge of new classes or tasks. Specifically, AttriCLIP is built upon the pre-trained visual-language model CLIP. Its image encoder and text encoder are fixed to extract features from both images and text. Text consists of a category name and a fixed number of learnable parameters which are selected from our designed attribute word bank and serve as attributes. As we compute the visual and textual similarity for classification, AttriCLIP is a non-incremental learner. The attribute prompts, which encode the common knowledge useful for classification, can effectively mitigate the catastrophic forgetting and avoid constructing a replay memory. We evaluate our AttriCLIP and compare it with CLIP-based and previous state-of-the-art continual learning methods in realistic settings with domain-shift and long-sequence learning. The results show that our method performs favorably against previous state-of-the-arts. The implementation code can be available at https://github.com/bhrqw/AttriCLIP.
연구 동기 및 목표
- 모델 파라미터 확장을 방지하면서 지속학습에서 치명적 잊음과 분류기 편향을 해결한다.
- 사전 훈련된 시각-언어 모델과 동적 프롬프트 튜닝을 활용하여 리플레이 메모리가 필요 없는 학습을 실현한다.
- 초기 사전 훈련 이후 모델 파라미터가 고정된 상태에서 증분적 지식 학습을 비증분적 방식으로 가능하게 한다.
- 속성 인식 텍스트 지도를 활용하여 장기적 순차적, 도메인 이동 지속학습 시나리오에서 일반화 능력과 안정성을 향상시킨다.
- 시각 또는 텍스트 인코더를 미세조정 없이도 새로운 클래스에 적응할 수 있는 프롬프트 기반 프레임워크를 개발한다.
제안 방법
- CLIP의 고정된 이미지 및 텍스트 인코더를 고정된 특징 추출기로 활용한다.
- 키(속성)와 프롬프트 쌍으로 구성된 학습 가능한 속성어 단어집을 도입하며, 여기서 키는 이미지 속성을 나타내고 프롬프트는 조정 가능한 텍스트 기술이다.
- 각 입력 이미지에 대해 이미지 속성 특징과 키 임베딩 간의 유사도를 기반으로 상위-k 프롬프트를 선택한다.
- 선택된 프롬프트를 클래스 이름과 연결하여 대비 분류를 위한 동적 텍스트 기술을 구성한다.
- CLIP 인코더는 고정된 채로 프롬프트 파라미터만으로 종단 간 훈련을 수행한다.
- 이미지 특징과 결합된 텍스트 표현(클래스 이름 + 선택된 프롬프트) 간의 대비 손실을 사용하여 분류를 수행한다.
실험 결과
연구 질문
- RQ1비증분적 학습자가 파라미터 확장을 방지하고 리플레이 메모리 없이도 안정적인 지속학습을 달성할 수 있는가?
- RQ2속성 기반 프롬프트 튜닝이 장기적 순차적, 도메인 이동 지속학습에서 치명적 잊음을 효과적으로 완화할 수 있는가?
- RQ3AttriCLIP의 성능은 zero-shot 및 few-shot 지속학습 설정에서 최신 기술 수준(SOTA) 방법들과 비교해 어떻게 되는가?
- RQ4학습된 프롬프트가 다양한 이미지 카테고리 간에 의미 있고 클래스 구별 능력을 갖춘 속성을 얼마나 잘 포착하는가?
- RQ5고정된 크기의 속성어 단어집이 치명적 잊음 없이 순차적으로 도착하는 다양한 데이터셋에 일반화될 수 있는가?
주요 결과
- ImageNet100 훈련 후 CIFAR100에 대해 증분적으로 학습한 AttriCLIP은 리플레이 메모리 없이도 평균 정확도 82.3%를 달성하여 CLIP 기반 및 이전 최신 기술 수준(SOTA) 방법들을 능가한다.
- ImageNet100 + CIFAR100 장기적 순차적 벤치마크에서 AttriCLIP은 78.3%의 정확도를 기록하여 DualPrompt(67.1%) 및 L2P(64.6%)를 크게 앞서며 성능을 뛰어넘는다.
- ImageNet100 벤치마크에서 AttriCLIP는 ImageNet100에서 미세조정 후 90.3%의 정확도를 달성하여 강력한 안정성과 낮은 잊음 수준을 보여준다.
- 새로운 데이터셋에 대해 우수한 일반화 능력을 보이며, 이전에 본 적 없는 도메인에서도 성능 저하가 최소한이다.
- Grad-CAM 시각화 결과, 학습된 프롬프트가 '모자' 또는 '잔디 위에 누운'과 같이 의미 있는 이미지 속성에 주목하고 있음을 확인한다.
- AttriCLIP는 분류기 편향과 파라미터 증가를 방지하여 지속학습 전반에 걸쳐 고정된 모델 크기를 유지한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.