Skip to main content
QUICK REVIEW

[논문 리뷰] Beyond Not-Forgetting: Continual Learning with Backward Knowledge Transfer

Sen Lin, Li Yang|arXiv (Cornell University)|2022. 11. 01.
Domain Adaptation and Few-Shot Learning인용 수 7
한 줄 요약

이 논문은 CUBER를 제안하며, 기존 작업 모델을 선택적으로 업데이트함으로써 후방 지식 전이를 가능하게 하는 지속적 학습 방법이다. 새로운 작업을 학습할 때 기울기 투영을 사용하여 상호 긍정적으로 관련된 작업을 식별한다. 기존 방법들이 잊히는 것을 방지하기 위해 이전 모델을 동결하는 반면, CUBER는 데이터 재생 없이도 표준 벤치마크에서 후방 지식 전이를 긍정적으로 달성하여 새로운 작업과 이전 작업 모두에서 성능을 향상시킨다.

ABSTRACT

By learning a sequence of tasks continually, an agent in continual learning (CL) can improve the learning performance of both a new task and `old' tasks by leveraging the forward knowledge transfer and the backward knowledge transfer, respectively. However, most existing CL methods focus on addressing catastrophic forgetting in neural networks by minimizing the modification of the learnt model for old tasks. This inevitably limits the backward knowledge transfer from the new task to the old tasks, because judicious model updates could possibly improve the learning performance of the old tasks as well. To tackle this problem, we first theoretically analyze the conditions under which updating the learnt model of old tasks could be beneficial for CL and also lead to backward knowledge transfer, based on the gradient projection onto the input subspaces of old tasks. Building on the theoretical analysis, we next develop a ContinUal learning method with Backward knowlEdge tRansfer (CUBER), for a fixed capacity neural network without data replay. In particular, CUBER first characterizes the task correlation to identify the positively correlated old tasks in a layer-wise manner, and then selectively modifies the learnt model of the old tasks when learning the new task. Experimental studies show that CUBER can even achieve positive backward knowledge transfer on several existing CL benchmarks for the first time without data replay, where the related baselines still suffer from catastrophic forgetting (negative backward knowledge transfer). The superior performance of CUBER on the backward knowledge transfer also leads to higher accuracy accordingly.

연구 동기 및 목표

  • 기존 지속적 학습 방법이 잊히는 것을 방지하기 위해 이전 모델을 동결함으로써 후방 지식 전이를 제한하는 한계를 해결하기 위해.
  • 새로운 작업과 이전 작업이 상호 긍정적으로 관련되어 있을 때, 언제이고 어떻게 이전 작업 모델을 업데이트하면 학습 성능을 향상시킬 수 있는지 조사하기 위해.
  • 데이터 재생 없이 고정 용량의 신경망에서 후방 지식 전이를 가능하게 하는 방법을 개발하기 위해.
  • 기울기 정렬을 기반으로 한 작업 부분공간 내 조건을 이론적으로 규명하여, 이전 작업에 대한 모델 업데이트가 유익한 조건을 규명하기 위해.

제안 방법

  • CUBER는 이전 작업의 입력 부분공간에 기울기를 투영하여 작업 간 상관관계를 정량화하고, 상호 긍정적으로 관련된 작업을 식별한다.
  • 임계치를 기반으로 한 프로젝션 강도에 따라 두 가지 제도를 도입한다: 제도 1(업데이트 없음)과 제도 3(선택적 모델 업데이트).
  • 기울기 투영 강도가 임계치를 초과할 경우에만 선택된 이전 작업의 모델에만 직교 투영을 적용하여 간섭을 최소화한다.
  • 층별 분석을 통해 새로운 작업과 강하게 관련된 이전 작업을 식별하여, 타겟된 모델 업데이트를 가능하게 한다.
  • 이 방법은 SVD를 사용해 작업 부분공간 기저를 추출하고, 투영 기반 상관관계 지표를 계산하여 업데이트 결정을 안내한다.
  • 긍정적으로 관련된 이전 작업의 부분공간에서 기울기 제약을 완화함으로써, 새로운 작업에 대한 전방 지식 전이를 향상시킨다.

실험 결과

연구 질문

  • RQ1기존 작업 모델의 업데이트가 치명적인 忘却로 인해 해로운 대신, 지속적 학습에서 언제나 이점이 되는가?
  • RQ2고정 용량의 신경망에서 데이터 재생 없이 어떻게 후방 지식 전이를 달성할 수 있는가?
  • RQ3이전 작업의 입력 부분공간에서 기울기 정렬은 어떤 역할을 하여 이전 작업에 대한 유익한 모델 업데이트를 가능하게 하는가?
  • RQ4선택적으로 이전 작업 모델을 업데이트하는 방법을 통해 새로운 작업과 이전 작업 모두에서 성능을 동시에 향상시킬 수 있는가?
  • RQ5지속적 학습에서 선택적 모델 업데이트를 안내하기 위해 작업 상관관계를 정량적으로 어떻게 측정할 수 있는가?

주요 결과

  • CUBER는 Split CIFAR-100, Split MiniImageNet, Permuted MNIST 벤치마크에서 데이터 재생 없이도 긍정적인 후방 지식 전이를 달성하였으며, 이는 이러한 전이가 데이터 재생 없이 처음으로 입증된 사례이다.
  • Split CIFAR-100에서 CUBER는 후방 지식 전이(BWT)가 0.01%를 기록했으며, GPM의 0.22%와 TRGP의 0.03%보다 낮아 잊히는 정도가 최소화되고 효과적인 후방 전이가 이루어졌음을 시사한다.
  • Split CIFAR-100에서 CUBER는 전방 지식 전이(FWT)를 2.79% 향상시켰고, Split MiniImageNet에선 3.13% 향상시켜 TRGP와 GPM를 능가한다.
  • CUBER의 성능은 임계치 ε₂에 대해 뛰어난 안정성을 보이며, ε₂가 0.0에서 0.5로 증가함에 따라 BWT가 0.22%에서 0.01%로 감소함으로써 제어되고 효과적인 모델 업데이트가 이루어짐을 보여준다.
  • CUBER는 긍정적으로 관련된 이전 작업 모델의 업데이트를 통해 기울기 제약을 완화함으로써 전체 정확도 향상과 더불어 학습 효율성 향상을 이룬다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.