Skip to main content
QUICK REVIEW

[논문 리뷰] Training Networks in Null Space of Feature Covariance for Continual Learning

Shipeng Wang, Xiaorong Li|arXiv (Cornell University)|2021. 03. 12.
Domain Adaptation and Few-Shot Learning참고 문헌 53인용 수 10
한 줄 요약

이 논문은 깊은 신경망을 훈련하기 위해 이전 태스크의 특징 공분산 행렬의 근사 영공간에 애덤의 파라미터 업데이트를 투영하는 새로운 지속적 학습 알고리즘인 Adam-NSCL을 제안한다. 이는 기억 상실 없이 안정적인 학습을 가능하게 한다. 이 방법은 태스크를 단계적으로 처리하면서 중심이 없는 공분산 행렬을 계산하고, SVD를 사용하여 계층별로 영공간을 근사함으로써 CIFAR-100 및 TinyImageNet 벤치마크에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

In the setting of continual learning, a network is trained on a sequence of tasks, and suffers from catastrophic forgetting. To balance plasticity and stability of network in continual learning, in this paper, we propose a novel network training algorithm called Adam-NSCL, which sequentially optimizes network parameters in the null space of previous tasks. We first propose two mathematical conditions respectively for achieving network stability and plasticity in continual learning. Based on them, the network training for sequential tasks can be simply achieved by projecting the candidate parameter update into the approximate null space of all previous tasks in the network training process, where the candidate parameter update can be generated by Adam. The approximate null space can be derived by applying singular value decomposition to the uncentered covariance matrix of all input features of previous tasks for each linear layer. For efficiency, the uncentered covariance matrix can be incrementally computed after learning each task. We also empirically verify the rationality of the approximate null space at each linear layer. We apply our approach to training networks for continual learning on benchmark datasets of CIFAR-100 and TinyImageNet, and the results suggest that the proposed approach outperforms or matches the state-ot-the-art continual learning approaches.

연구 동기 및 목표

  • 지속적 학습에서 네트워크가 새로운 태스크를 학습하면서 이전 태스크를 망각하는 '탄력성-안정성 딜레마'를 해결하기 위해.
  • 기존 태스크에 대해 네트워크의 안정성을 유지하면서도 새로운 태스크 학습을 위한 탄력성을 보장하는 방법을 개발하기 위해.
  • 이전 태스크 데이터에 접근할 필요 없이 치명적인 망각을 방지하는 효율적이고 점진적인 알고리즘을 설계하기 위해.
  • 깊은 신경망에서 안정성과 탄력성을 균형 있게 유지하기 위해 영공간 투영의 이론적 근거를 제시하기 위해.
  • 제안된 방법의 효과성을 표준 지속적 학습 벤치마크에서 경험적으로 검증하기 위해.

제안 방법

  • 이 방법은 안정성(파라미터 업데이트가 이전 특징 기울기와 수직이 되도록)과 탄력성(파라미터 업데이트가 현재 기울기 방향과 일치하도록)을 위한 두 가지 이론적 조건을 도입한다.
  • 각 계층에서 애덤의 후보 파라미터 업데이트를 이전 태스크의 입력 특징의 중심이 없는 공분산 행렬의 근사 영공간에 투영한다.
  • 근사 영공간은 중심이 없는 공분산 행렬의 특이값 분해(SVD)를 통해 계산되며, 가장 작은 특이값에 해당하는 특이 벡터들만 유지한다.
  • 계산 효율성을 확보하고 모든 이전 데이터를 저장하지 않기 위해 각 태스크 이후 중심이 없는 공분산 행렬을 점진적으로 갱신한다.
  • 네트워크 가중치에 업데이트를 적용하기 전에 계층별로 기울기 업데이트를 이 투영에 통합함으로써 애덤 최적화기와 이 알고리즘을 통합한다.
  • 영공간 근사의 정도를 조절하는 하이퍼파rameter가 존재하여 실무에서 안정성과 탄력성 간의 균형을 조절할 수 있다.

실험 결과

연구 질문

  • RQ1이전 태스크의 특징 공분산의 영공간에 파라미터 업데이트를 투영하는 것이 지속적 학습 성능 향상에 기여하는가?
  • RQ2특징 공분산을 활용하여 지속적 학습에서 안정성과 탄력성을 이론적으로 어떻게 균형 잡을 수 있는가?
  • RQ3이전 데이터를 저장하지 않고도 특징 공분산의 영공간을 효율적이고 점진적으로 계산할 수 있는가?
  • RQ4제안된 방법은 최신 기술 수준의 지속적 학습 접근법과 정확도 및 역방향 전이 측면에서 어떻게 비교되는가?
  • RQ5중심이 없는 공분산 행렬의 SVD로부터 유도된 근사 영공간은 망각 방지를 위한 합리적이고 효과적인 부분공간인가?

주요 결과

  • Adam-NSCL은 CIFAR-100 및 TinyImageNet에서 최신 기술 수준의 방법들을 능가하며, 세 가지 벤치마크에서 OWM보다 각각 4.88%, 7.48%, 8.3% 높은 정확도를 기록했고, 비슷한 역방향 전이 성능을 확보했다.
  • 이 방법은 이전 태스크 데이터에 접근할 필요 없이도 뛰어난 성능을 달성하여 실세계 지속적 학습 환경에 적합하다.
  • SVD를 통한 중심이 없는 공분산 행렬의 근사 영공간은 경험적으로 이전 태스크 지식을 유지하는 데 합리적이고 효과적임을 입증했다.
  • 중심이 없는 공분산 행렬의 점진적 계산은 과거 특징이나 데이터를 저장하지 않으면서도 효율적인 온라인 적응을 가능하게 한다.
  • 영공간 근사 정도를 조절하는 하이퍼파rameter는 안정성과 탄력성 간의 효과적인 트레이드오���을 가능하게 하며, OWM와 같은 유사한 방법보다 조정이 더 쉽다.
  • 안정성과 탄력성에 대한 이론적 조건은 수학적 분석과 경험적 결과를 통해 검증되었으며, 알고리즘 설계를 이끄는 데 타당함을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.