Skip to main content
QUICK REVIEW

[논문 리뷰] Wide Neural Networks Forget Less Catastrophically

Seyed Iman Mirzadeh, Arslan Chaudhry|arXiv (Cornell University)|2021. 10. 21.
Domain Adaptation and Few-Shot Learning참고 문헌 57인용 수 4
한 줄 요약

이 논문은 지속적 학습에서 신경망의 너비를 늘임으로써 치명적인 기억 상실(catastrophic forgetting)을 크게 감소시킴을 보여주며, 더 깊지만 좁은 아키텍처보다 뛰어난 성능을 발휘한다. 이 이점은 개선된 기울기 수직성, 희소성, 그리고 게으른 학습 제도 덕분이며, 기존의 지속적 학습 알고리즘에 비해 추가적인 성능 향상을 가져다준다. 알고리즘적 수정 없이도 성능 향상이 가능하다.

ABSTRACT

A primary focus area in continual learning research is alleviating the "catastrophic forgetting" problem in neural networks by designing new algorithms that are more robust to the distribution shifts. While the recent progress in continual learning literature is encouraging, our understanding of what properties of neural networks contribute to catastrophic forgetting is still limited. To address this, instead of focusing on continual learning algorithms, in this work, we focus on the model itself and study the impact of "width" of the neural network architecture on catastrophic forgetting, and show that width has a surprisingly significant effect on forgetting. To explain this effect, we study the learning dynamics of the network from various perspectives such as gradient orthogonality, sparsity, and lazy training regime. We provide potential explanations that are consistent with the empirical results across different architectures and continual learning benchmarks.

연구 동기 및 목표

  • 지속적 학습에서 아키텍처적 특성, 특히 너비와 깊이가 치명적인 기억 상실에 미치는 영향을 조사하는 것.
  • 너비를 통한 과다 매개변수화가 깊이를 통한 과다 매개변수화보다 기억 상실을 더 효과적으로 줄이는지 확인하는 것.
  • 기울기 수직성, 희소성, 게으른 학습 제도와 같은 내재된 메커니즘이 왜 넓은 네트워크가 더 적게 기억 상실하는지 설명하는 것.
  • 너비의 이점이 리플레이나 정규화와 같은 기존의 지속적 학습 알고리즘과 함께 추가적으로 작용하는지 평가하는 것.
  • 알고리즘적 간섭 없이 아키텍처 설계가 지속적 학습 성능에 미치는 영향을 기초적으로 이해하는 것.

제안 방법

  • MLP와 WideResNets를 사용하여 두 가지 지속적 학습 벤치마크인 Rotated MNIST와 Split CIFAR-100에서 너비의 영향을 실증적으로 평가한다.
  • 깊이를 일정하게 유지하면서 다양한 너비(예: 32에서 2048 단위)의 네트워크를 비교하여 과제 간 기억 상실과 평균 정확도를 측정한다.
  • 기울기 역학을 기울기 수직성 및 희소성 지표를 통해 분석하여 기억 상실 감소의 원인을 설명한다.
  • 기본 매개변수에서 갱신된 매개변수의 거리 측정을 통해 게으른 학습 제도를 조사하고, 이와 기억 상실 감소의 연관성을 규명한다.
  • 기존의 지속적 학습 알고리즘(예: ER, A-GEM, LwF, EWC)과 함께 너비의 영향을 평가하여 추가적 이점이 있는지 테스트한다.
  • 고정된 매개변수 수를 가진 제어 실험을 통해 너비와 깊이의 영향을 분리하고, 浅-넓은 대비 깊-좁은 아키텍처를 비교한다.

실험 결과

연구 질문

  • RQ1신경망의 너비를 늘임으로써 지속적 학습에서 치명적인 기억 상실이 감소하는가? 만약 그렇다면 얼마나 감소하는가?
  • RQ2너비와 깊이 중 어느 것이 기억 상실을 더 효과적으로 완화하는가? 깊이를 늘임으로써 유사하거나 반대 방향의 이점이 발생하는가?
  • RQ3기울기 수직성, 희소성, 또는 게으른 학습 제도와 같은 내재된 학습 역학이 넓은 네트워크의 성능 향상에 기여하는 이유는 무엇인가?
  • RQ4리플레이나 정규화와 같은 기존의 지속적 학습 알고리즘과 함께 너비의 이점이 추가로 작용하는가?
  • RQ5너비를 통한 아키텍처 과다 매개변수화가 치명적인 기억 상실에 대한 근본적이고 알고리즘에 종속되지 않는 해결책이 될 수 있는가?

주요 결과

  • 2층 MLP의 너비를 32에서 2048로 늘임으로써 Rotated MNIST에서 다섯 과제를 학습한 후 기억 상실률이 62%에서 48%로 감소했다.
  • Split CIFAR-100에서 WideResNet-10의 너비 인자(Width Factor)를 1에서 8로 늘임으로써 20개의 과제 후 첫 번째 과제의 기억 상실률이 42%에서 31%로 감소했다.
  • 리플레이 버퍼 없이도 넓은 네트워크의 성능가 장기적으로 리플레이 버퍼 크기가 125 또는 250인 좁은 네트워크와 유사하거나 뛰어난 성능을 보였다.
  • 얕고 넓은 네트워크(예: 깊이 10, 너비 8)는 평균 정확도 59.7%와 기억 상실률 29.4%를 기록했고, 유사한 매개변수 수를 가진 깊고 좁은 변형(예: 깊이 28, 너비 3)의 경우 평균 정확도 49.4%와 기억 상실률 36.2%를 기록하며 더 뛰어난 성능를 보였다.
  • ER, A-GEM, LwF, EWC와 같은 여러 지속적 학습 알고리즘에 대해 너비의 이점은 일관되게 추가적인 효과를 보였으며, 평균 정확도 향상과 기억 상실 감소를 동시에 이끌어냈다.
  • 너비를 일정하게 유지하면서 깊이를 늘여도 기억 상실에 긍정적 또는 부정적인 영향을 미치지 않았으며, 이는 너비가 치명적인 기억 상실을 완화하는 데 유일무이한 역할을 한다는 것을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.