[논문 리뷰] Improving Vision Transformers for Incremental Learning
이 논문은 시각 트랜스포머(ViT)의 클래스 증분 학습(CIL)을 향상시키기 위해 세 가지 핵심 문제를 해결하는 ViTIL이라는 방법을 제안한다: 느린 수렴, 새로운 클래스에 대한 편향, 분류기 레이어의 과소적합. 복합형 스템, 클래스 균형 잡힌 미세조정, 분류기용 큰 학습률을 조합함으로써 ViTIL은 모든 증분 학습 설정에서 CIFAR-100과 ImageNet-1000에서 새로운 최고 성능을 달성하여 이전 방법들보다 명확한 격차로 앞서나간다.
This paper proposes a working recipe of using Vision Transformer (ViT) in class incremental learning. Although this recipe only combines existing techniques, developing the combination is not trivial. Firstly, naive application of ViT to replace convolutional neural networks (CNNs) in incremental learning results in serious performance degradation. Secondly, we nail down three issues of naively using ViT: (a) ViT has very slow convergence when the number of classes is small, (b) more bias towards new classes is observed in ViT than CNN-based architectures, and (c) the conventional learning rate of ViT is too low to learn a good classifier layer. Finally, our solution, named ViTIL (ViT for Incremental Learning) achieves new state-of-the-art on both CIFAR and ImageNet datasets for all three class incremental learning setups by a clear margin. We believe this advances the knowledge of transformer in the incremental learning community. Code will be publicly released.
연구 동기 및 목표
- 시각 트랜스포머(ViT)를 직접 클래스 증분 학습(CIL)에 적용할 경우, CNN에 비해 성능이 크게 떨어지는 이유를 조사하는 것.
- ViT의 CIL 성능 저하를 가로막는 세 가지 핵심 문제를 특정하고 진단하는 것: 적은 클래스 수에서의 느린 수렴, 새로운 클래스에 대한 증가하는 편향, 분류기 레이어의 과소적합.
- 기존 기법을 활용하여 구조적 혁신 없이도 실용적이고 효과적인 해결책을 개발하는 것.
- 여러 CIL 프로토콜에 걸쳐 CIFAR-100과 ImageNet-1000에서 ViT 기반 CIL의 새로운 최고 성능 기준을 설정하는 것.
제안 방법
- 초기 최적화를 향상시키고, 특히 적은 클래스 수에서의 초기 증분 단계에서 수렴 속도를 높이기 위해 ViT의 표준 패치파이 스템을 복합형 스템으로 교체한다.
- ViT가 새로운 클래스에 대해 내재된 편향을 보정하기 위해 클래스 균형 잡힌 미세조정(CBF)을 적용하며, 이는 MixUp 및 CutMix와 같은 데이터 증강 기법과도 호환된다.
- 특징 추출기보다 분류기 헤드에 훨씬 큰 학습률을 사용함으로써 소프트맥스 온도를 증가시키고 분류기의 과소적합을 완화한다.
- 복합형 스템, CBF, 큰 분류기 학습률을 모두 조합하여 증분 학습에 최적화된 통합 학습 레시피인 ViTIL을 개발한다.
- B50, B0, T20K 설정을 포함한 표준 CIL 평가 프로토콜을 사용하며, 분석 연구 동안 일관된 초모수를 유지한다.
실험 결과
연구 질문
- RQ1왜 시각 트랜스포머를 클래스 증분 학습에 직접 적용할 경우 CNN에 비해 성능 저하가 심각하게 발생하는가?
- RQ2특히 적은 클래스 수에서의 초기 단계에서, ViT 기반 모델의 성능 저하의 근본 원인은 무엇인가?
- RQ3기존 기법을 어떻게 효과적으로 조합하여 ViT의 수렴 속도, 클래스 편향, 분류기 과소적합 문제를 해결할 수 있는가?
- RQ4기존의 복잡한 최고 성능 CIL 모델들을 능가하는 간단한 기법 조합이 CIFAR-100과 ImageNet-1000 벤치마크에서 모두 성능을 뛰어올릴 수 있는가?
주요 결과
- 500개의 초기 클래스와 단계당 100개의 새로운 클래스를 가진 CIL 설정에서 ViTIL은 ImageNet-1000에서 69.20%의 top-1 정확도를 달성하여 LUCIR+DDE를 1.69% 뛰어넘었다.
- 10단계 CIL 설정에서 단계당 100개의 새로운 클래스와 이전 클래스당 20개의 예시를 가진 조건에서 ViTIL은 평균 증분 정확도 65.13%를 기록하여 PODNet을 7.27% 뛰어넘었다.
- 전체 예시 제약 조건(T20K) 설정에서 ViTIL은 68.75%의 정확도를 달성하여 BiC를 6.28% 뛰어넘었다.
- 분석 연구 결과, 복합형 스템, CBF, 큰 분류기 학습률 각각이 모든 CIL 프로토콜에서 독립적이고 일관되게 성능 향상에 기여하는 것으로 확인되었다.
- LUCIR에 비해 ViTIL은 평균 증분 망각이 현저히 낮아 안정성이 향상되었으며, 유연성은 손상되지 않았다.
- 복합형 스템 없이도, 편향 보정과 큰 분류기 학습률을 적용한 ViTIL은 B50 C10 R20 설정에서 평균 증분 정확도 3.66% 높은 성능을 기록하여 LUCIR를 능가했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.