Skip to main content
QUICK REVIEW

[논문 리뷰] NISPA: Neuro-Inspired Stability-Plasticity Adaptation for Continual Learning in Sparse Networks

Mustafa Burak Gürbüz, Constantine Dovrolis|arXiv (Cornell University)|2022. 06. 18.
Domain Adaptation and Few-Shot Learning인용 수 15
한 줄 요약

NISPA는 고정 밀도 희소 신경망을 사용하여 뇌에 영감을 받은 지속적 학습 프레임워크를 제안한다. 이 프레임워크는 지속적인 시냅스 경로를 통해 안정성을 유지하면서 동적 연결 재구성으로 유연성을 확보한다. EMNIST, FashionMNIST, CIFAR10, CIFAR100에서 최신 기준 성능을 달성하며, 기준 모델 대비 학습 가능한 파rameter 수를 최대 10배 줄였고, 재현 또는 모델 확장 없이 치명적 기억 상실을 크게 감소시킨다.

ABSTRACT

The goal of continual learning (CL) is to learn different tasks over time. The main desiderata associated with CL are to maintain performance on older tasks, leverage the latter to improve learning of future tasks, and to introduce minimal overhead in the training process (for instance, to not require a growing model or retraining). We propose the Neuro-Inspired Stability-Plasticity Adaptation (NISPA) architecture that addresses these desiderata through a sparse neural network with fixed density. NISPA forms stable paths to preserve learned knowledge from older tasks. Also, NISPA uses connection rewiring to create new plastic paths that reuse existing knowledge on novel tasks. Our extensive evaluation on EMNIST, FashionMNIST, CIFAR10, and CIFAR100 datasets shows that NISPA significantly outperforms representative state-of-the-art continual learning baselines, and it uses up to ten times fewer learnable parameters compared to baselines. We also make the case that sparsity is an essential ingredient for continual learning. The NISPA code is available at https://github.com/BurakGurbuz97/NISPA.

연구 동기 및 목표

  • 희소 연결과 시냅스 재구성과 같은 생물학적 뇌 메커니즘을 모방하여 지속적 학습에서 치명적 기억 상실 문제를 해결한다.
  • 모델 크기를 늘리거나 재학습이 필요 없이 이전에 학습한 과제에서 높은 성능를 유지하면서 새로운 과제를 효율적으로 학습한다.
  • 희소성이 깊이 신경망에서 효과적인 지속적 학습을 가능하게 하는 핵심 요소임을 입증한다.
  • 원시 데이터 재현이나 지속적인 모델 확장을 포함하지 않는 지속적 학습 프레임워크를 개발한다.

제안 방법

  • NISPA는 학습 전반에 걸쳐 고정된 연결 밀도를 유지하는 희소 신경망을 사용하여 시간이 지나도 구조적 희소성을 유지한다.
  • 특정 히든 유닛의 입력 가중치를 동결시켜 안정 경로를 형성함으로써 이전 과제에서의 지식을 장기적으로 유지한다.
  • 유연성 경로는 연결 재구성으로 생성되며, 존재하는 안정 경로를 손상시키지 않고 새로운 지식을 통합할 수 있도록 한다.
  • 유연성이 필요한 경우, 과제별 분류 헤드를 기반으로 랜덤 성장 메커니즘을 사용해 동적으로 새로운 연결을 생성한다.
  • 클래스 인크리멘탈 학습에서는 NISPA-Replay가 작은 버퍼에 원시 예제를 재현하지만, 최종 레이어만 업데이트하여 파rameter 업데이트를 최소화한다.
  • 모델 전체 재학습을 피하고 생성적 재현이나 복잡한 샘플링 전략에 의존하지 않아 효율성을 향상시킨다.

실험 결과

연구 질문

  • RQ1고정 밀도 희소 네트워크가 뇌에서 영감을 받은 안정성과 탄력성 메커니즘을 조합함으로써 뛰어난 지속적 학습 성능를 달성할 수 있는가?
  • RQ2모델 용량을 늘리지 않고도 희소성이 지속적 학습에서 치명적 기억 상실을 어떻게 완화하는가?
  • RQ3연결 재구성과 안정 경로 형성 방식이 전통적인 재현 또는 파rameter 정규화 방법보다 얼마나 뛰어나게 성능를 높일 수 있는가?
  • RQ4고정된 크기와 희소성, 동적 연결성을 가진 뇌에 영감을 받은 아키텍처가 조밀하거나 성장하거나 정제된 모델보다 지속적 학습에서 뛰어난 성능를 낼 수 있는가?
  • RQ5클래스 인크리멘탈 학습에서 다양한 데이터셋과 버퍼 크기에서 NISPA의 성능가 최신 기준 기준 모델과 비교해 어떻게 되는가?

주요 결과

  • NISPA는 평가된 모든 설정에서 EMNIST, FashionMNIST, CIFAR10, CIFAR100에서 최신 기준 지속적 학습 기준 모델을 뛰어넘는 성능를 보였다.
  • 평균적으로 NISPA는 기준 모델보다 높은 정확도를 달성했으며, 특히 CIFAR10과 CIFAR100에서 성능 향상이 두드러졌다.
  • NISPA는 유사한 기준 모델 대비 학습 가능한 파rameter 수를 최대 10배 줄여 높은 파rameter 효율성을 입증했다.
  • NISPA-Replay는 대부분의 데이터셋과 버퍼 크기에서 ER, DER, iCaRL, A-GEM을 능가했으며, EF-MNIST에서 DER와 CIFAR10에서 iCaRL의 작은 버퍼 설정을 제외한 모든 경우에서 승리했다.
  • 비인크리멘탈 상한선과 NISPA-Replay 사이의 성능 격차는 여전히 크며, 원시 데이터 재현 없이 클래스 인크리멘탈 학습에서의 향상 여지가 있음을 시사한다.
  • DER이 EF-MNIST에서 뛰어난 성능를 보인 것은 로짓을 추가 신호로 사용하기 때문이며, NISPA는 이를 활용하지 않기 때문에, 작은 버퍼 환경에서 보조 신호의 이점이 드러난다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.