[논문 리뷰] Generalisation Guarantees for Continual Learning with Orthogonal Gradient Descent
이 논문은 신경 탄성 커널(NTK) 영역에서 연속 학습의 스토케스틱 그래디언트 디센트(SGD)와 수직 그래디언트 디센트(OGD)에 대한 최초의 일반화 경계를 수립한다. OGD가 임의의 수의 작업에 걸쳐 치명적인 잊음에 대해 강건함을 증명하고, NTK 공간 내 작업 유사도에 의존하는 일반화 경계를 유도하며, 과도하게 파rameter화되지 않은 설정에서 NTK가 변할 경우의 한계도 밝혀낸다.
In Continual Learning settings, deep neural networks are prone to Catastrophic Forgetting. Orthogonal Gradient Descent was proposed to tackle the challenge. However, no theoretical guarantees have been proven yet. We present a theoretical framework to study Continual Learning algorithms in the Neural Tangent Kernel regime. This framework comprises closed form expression of the model through tasks and proxies for Transfer Learning, generalisation and tasks similarity. In this framework, we prove that OGD is robust to Catastrophic Forgetting then derive the first generalisation bound for SGD and OGD for Continual Learning. Finally, we study the limits of this framework in practice for OGD and highlight the importance of the Neural Tangent Kernel variation for Continual Learning with OGD.
연구 동기 및 목표
- 신경 탄성 커널(NTK) 영역에서 연속 학습 알고리즘을 분석하기 위한 이론적 프레임워크를 개발하는 것.
- 무한한 메모리 조건 하에서 임의의 수의 작업에 걸쳐 수직 그래디언트 디센트(OGD)가 치명적인 잊음에 대해 강건함을 증명하는 것.
- 연속 학습에서 SGD와 OGD에 대한 최초의 일반화 경계를 도출하여, NTK 공간 내 작업 유사도에 의존함을 보여주는 것.
- NTK 기반 프레임워크의 실용적 한계를 조사하며, 특히 NTK가 일정하지 않은 경우를 중심으로 분석하는 것.
제안 방법
- NTK 영역 내에서 연속 학습을 순차적 커널 회귀로 공식화하여, 작업 간에 폐쇄형 모델 업데이트를 가능하게 한다.
- NTK 프레임워크 내에서 전이 학습, 일반화, 작업 유사도, 커리큘럼 학습의 대체 지표를 도입한다.
- 커널 정렬성과 기울기 수직성의 특성을 활용하여, 무한한 메모리 조건 하에서 OGD가 이전 작업의 성능을 유지함을 증명한다.
- SGD와 OGD 모두에 대해 NTK 공간 내 작업 표현 간 내적곱에 의존하는 일반화 경계를 유도한다.
- 실용적이고 과도하게 파rameter화되지 않은 설정에서 NTK의 변화가 OGD의 잊음에 대한 강건성에 미치는 영향을 분석하며, OGD의 성능 저하를 보여준다.
- 과도하게 파arameter화된 네트워크의 동역학에서 유도된 이론적 도구를 활용하며, NTK와 기울기 하강법의 선형 수렴 성질을 포함한다.
실험 결과
연구 질문
- RQ1연속 학습에서 OGD의 치명적인 잊음에 대한 강건성에 대해 이론적 보장을 제공할 수 있는가?
- RQ2NTK 공간 내 작업 유사도는 SGD와 OGD를 사용한 연속 학습에서 일반화에 어떻게 영향을 미치는가?
- RQ3연속 학습에서 SGD와 OGD에 대한 최초의 일반화 경계는 무엇이며, 그 구조는 어떻게 되는가?
- RQ4실용적이고 과도하게 파arameter화되지 않은 설정에서 신경 탄성 커널(NTK)의 변화는 OGD의 성능에 어떻게 영향을 미치는가?
- RQ5학습 중 커널이 일정하지 않은 경우 NTK 기반 프레임워크의 유효성은 어느 정도 유지되는가?
주요 결과
- NTK 영역에서 무한한 메모리 조건 하에서 OGD가 임의의 수의 작업에 걸쳐 치명적인 잊음에 대해 강건함이 증명되었다.
- 연속 학습에서 SGD와 OGD에 대한 최초의 일반화 경계가 도출되었으며, 이 경계는 NTK를 통한 작업 유사도 측정에 의존함을 보여주었다.
- 일반화 경계는 NTK 특성 공간에서 이전 작업이 더 유사할수록 향후 작업에서 더 나은 성능을 달성함을 드러냈다.
- 과도하게 파arameter화되지 않은 설정에서는 NTK의 변화가 OGD의 잊음에 대한 강건성에 악영향을 미치며, 이는 프레임워크의 실용적 적용 가능성을 제한한다.
- 실험 결과, OGD+는 Permuted MNIST에서 평균 정확도와 역방향 전이 측면에서 OGD와 Stable SGD를 모두 초월하지만, Split CIFAR100과 CUB200에서는 과도한 파arameter화로 인해 성능이 저하된다.
- Rotated MNIST에서는 OGD+가 평균 정확도와 역방향 전이에서 OGD를 능가하지만, 정방향 전이에서는 Stable SGD에 열등하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.