Skip to main content
QUICK REVIEW

[논문 리뷰] Flattening Sharpness for Dynamic Gradient Projection Memory Benefits Continual Learning

Danruo Deng, Guangyong Chen|arXiv (Cornell University)|2021. 10. 09.
Domain Adaptation and Few-Shot Learning참고 문헌 45인용 수 24
한 줄 요약

논문은 FS-DGPM을 소개합니다. 이는 Flattening Sharpness와 Dynamic Gradient Projection Memory를 결합하여 잊힘을 완화하고 연속 학습에서 새로운 과제의 학습을 개선하기 위해 과거 과제의 그래디언트 기본(Base)을 적응적으로 재가중하고 손실 지형의 완만함을 조절합니다.

ABSTRACT

The backpropagation networks are notably susceptible to catastrophic forgetting, where networks tend to forget previously learned skills upon learning new ones. To address such the 'sensitivity-stability' dilemma, most previous efforts have been contributed to minimizing the empirical risk with different parameter regularization terms and episodic memory, but rarely exploring the usages of the weight loss landscape. In this paper, we investigate the relationship between the weight loss landscape and sensitivity-stability in the continual learning scenario, based on which, we propose a novel method, Flattening Sharpness for Dynamic Gradient Projection Memory (FS-DGPM). In particular, we introduce a soft weight to represent the importance of each basis representing past tasks in GPM, which can be adaptively learned during the learning process, so that less important bases can be dynamically released to improve the sensitivity of new skill learning. We further introduce Flattening Sharpness (FS) to reduce the generalization gap by explicitly regulating the flatness of the weight loss landscape of all seen tasks. As demonstrated empirically, our proposed method consistently outperforms baselines with the superior ability to learn new skills while alleviating forgetting effectively.

연구 동기 및 목표

  • 지속 학습에서 가중치 손실 지형이 안정성 및 민감성에 어떻게 관계하는지 조사한다.
  • 더 평탄한 손실 지형이 더 나은 지속 학습 성능과의 상관관계를 특징지운다.
  • 과거 과제의 그래디언트 기반의 중요성을 동적으로 조정하는 방법을 개발하여 새로운 과제의 학습을 개선한다.
  • Flattening Sharpness와 적응적으로 덜 중요한 기반을 해제하는 메커니즘으로 GPM을 확장하여 잊힘과 적응 사이의 균형을 맞춘다.

제안 방법

  • 과거 과제의 그래디언트 부분공간을 기저 행렬 M과 중요도 행렬 Λ로 모델링한다.
  • 현재 과제에서의 샤프니스를 평가하고 감소시키기 위해 과거 과제 부분공간 내에서 가중치를 섭동시켜 적대적 섭동 v를 계산한다.
  • 현재 및 기억 데이터의 그래디언트를 기반으로 Λ를 업데이트하여 각 기저의 업데이트를 동적으로 해제하거나 조인다.
  • 과거 과제 부분공간에서의 업데이트를 멀리 projection하여 오래된 지식을 보존하면서 새로운 과제에 적응하도록 가중치 w를 업데이트한다.
  • 재생 데이터에 대해 SVD를 통해 기저 M을 재계산하여 과거 과제를 대표하는 부분공간을 최신 상태로 유지한다.
  • 손실의 평평함, 손실 및 지속 학습 성과를 연결하는 PAC-Bayes 경계로 이론적 근거를 제공한다.

실험 결과

연구 질문

  • RQ1가중치 손실 지형이 지속 학습의 안정성과 민감성에 어떻게 영향을 미치는가?
  • RQ2더 평탄한 손실 지형과 낮은 샤프니스가 일반화와 잊음을 줄이는 지속 학습에 기여하는가?
  • RQ3과거 과제의 그래디언트 기본을 적응적으로 가중하여 오래된 과제를 해치지 않으면서 새로운 과제의 학습을 개선할 수 있는가?
  • RQ4Flattening Sharpness와 Dynamic Gradient Projection Memory(FS-DGPM)를 결합하면 기존 방법과 비교해 지속 학습 성능이 우수하게 나타나는가?

주요 결과

  • FS-DGPM은 평균 정확도 측면에서 PMNIST, CIFAR-100 Split, CIFAR-100 Superclass 및 TinyImageNet 전반에서 일관되게 기준 방법을 능가한다.
  • 이 방법은 오래된 과제에서의 강한 성능을 달성하면서 새로운 과제의 학습 속도와 정확도를 유지하거나 향상시켜 안정성을 해치지 않으면서 민감성을 개선함을 시사한다.
  • 배치 연구를 통해 평평함을 줄이고 기저의 적응적 소프트 가중치를 부여하는 것이 GPM 및 관련 변형들보다 성능 향상에 기여함을 보여준다.
  • FS-DGPM은 잊힘(BWT)을 줄이고 여러 벤치마크에서 경쟁 방법보다 더 높은 전체 정확도를 달성한다.
  • 이 접근법은 단일 헤드 및 다중 헤드 설정에서 견고하게 작동하며 일부 기준 방법에 비해 기억 효율 측면에서 우수한 편이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.