[논문 리뷰] BiRT: Bio-inspired Replay in Vision Transformers for Continual Learning
BiRT는 시각 트랜스포머를 위한 생물학적 영감을 받은 지속적 학습 방법을 제안하며, 표현 재연 중 제어된 노이즈 주입을 통해 치명적인 잊음 문제를 완화한다. 작업 모델과 그의 지수이동평균(EMA)으로 생성된 의미 기억 간 예측 일致성을 강제화함으로써, CIFAR-100, ImageNet-100, 그리고 TinyImageNet 벤치마크에서 원본 이미지 및 일반적인 표현 재연 대비 뛰어난 정확도, 노이즈에 대한 강건성, 메모리 효율성을 달성한다.
The ability of deep neural networks to continually learn and adapt to a sequence of tasks has remained challenging due to catastrophic forgetting of previously learned tasks. Humans, on the other hand, have a remarkable ability to acquire, assimilate, and transfer knowledge across tasks throughout their lifetime without catastrophic forgetting. The versatility of the brain can be attributed to the rehearsal of abstract experiences through a complementary learning system. However, representation rehearsal in vision transformers lacks diversity, resulting in overfitting and consequently, performance drops significantly compared to raw image rehearsal. Therefore, we propose BiRT, a novel representation rehearsal-based continual learning approach using vision transformers. Specifically, we introduce constructive noises at various stages of the vision transformer and enforce consistency in predictions with respect to an exponential moving average of the working model. Our method provides consistent performance gain over raw image and vanilla representation rehearsal on several challenging CL benchmarks, while being memory efficient and robust to natural and adversarial corruptions.
연구 동기 및 목표
- 지속적 학습에서 시각 트랜스포머에 대한 치명적인 잊음 문제를 해결하는 것, 이는 수명 주기 AI의 주요 과제이다.
- 메모리 비효율성과 개인정보 우려 문제를 야기하는 원본 이미지 재연의 한계를 극복하는 것.
- 생물학적으로 영감을 받은 노이즈 메커니즘을 도입하여 표현 재연의 일반화 능력을 향상시키는 것.
- 뇌의 이중 기억 시스템을 모방하여 메모리 효율적이고 강건한 지속적 학습 프레임워크를 개발하는 것.
- 자연적 및 악성 노이즈 공격에 강건하고, 작업 시퀀스 전반에 걸쳐 안정적인 성능을 유지하며, 강력한 전방 이행 능력을 확보하는 것.
제안 방법
- BiRT는 작업 모델과 작업 모델의 가중치에 대한 지수이동평균(EMA)으로 생성된 의미 기억으로 구성된 이중 기억 시스템을 사용한다.
- 혼합된 표현, 노이즈가 첨가된 어텐션 맵, 노이즈가 첨가된 의미 기억 출력, 노이즈가 첨가된 타깃에 다중 단계에서 구성적 노이즈를 주입한다.
- 일致성 정규화는 노이즈 변형에 대해 작업 모델의 예측이 의미 기억의 예측과 일致하도록 강제한다.
- 이전 작업의 고수준 표현을 버퍼에 저장하여 원본 이미지 저장 없이도 효율적인 재연을 가능하게 한다.
- 노이즈 유형은 생물학적 시험-시험 변동성을 모방하도록 설계되어 재연 중 과적합을 줄이고 일반화를 향상시킨다.
- 자기주의 어텐션 메커니즘을 활용하여 종단 간 시각 트랜스포머에서 효과적으로 특징 학습을 수행하는 데 응용된다.
실험 결과
연구 질문
- RQ1표현 재연에 제어된 노이즈 주입이 시각 트랜스포머의 지속적 학습에서 일반화 능력을 향상시키고 과적합을 줄일 수 있는가?
- RQ2EMA 기반 의미 기억을 갖는 생물학적 영감을 받은 이중 기억 시스템이 안정성 향상과 치명적인 잊음 감소에 기여하는가?
- RQ3정확도, 강건성, 메모리 효율성 측면에서 BiRT는 원본 이미지 재연 및 일반적인 표현 재연과 비교해 어떻게 다를까?
- RQ4노이즈 주입이 자연적 및 악성 노이즈 공격에 대한 강건성을 얼마나 향상시키는가?
- RQ5제안된 방법이 작업 시퀀스 전반에 걸쳐 중요한 이미지 영역의 어텐션 맵을 유지할 수 있는가, 이는 잊음 감소를 시사하는가?
주요 결과
- BiRT는 CIFAR-100, ImageNet-100, 그리고 TinyImageNet 벤치마크에서 원본 이미지 재연 및 일반적인 표현 재연 대비 일관된 성능 향상을 달성한다.
- 버퍼 크기가 500인 CIFAR-100에서 BiRT는 모든 지표에서 DyTox를 초월하는 상위 1위 정확도를 기록하여 우수한 안정성과 유연성(플라스티시티)을 입증한다.
- BiRT는 자연적 및 악성 노이즈 공격에 강건하며, 다양한 공격 강도에서도 높은 성능을 유지한다.
- 어텐션 맵 분석 결과, BiRT는 첫 번째 작업에서의 중요 영역 어텐션을 DyTox보다 더 잘 유지함을 확인하여 잊음 감소를 시사한다.
- 이 방법은 메모리 효율적이며 원본 이미지를 저장하지 않기 때문에 개인정보 우려가 발생하지 않으며, 고수준 표현만 저장한다.
- 실험 결과 BiRT는 하이퍼파rameter에 크게 민감하지 않음을 보여, 강건성과 실용적 구현 가능성을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.