Skip to main content
QUICK REVIEW

[논문 리뷰] Gradient Episodic Memory with a Soft Constraint for Continual Learning

Guannan Hu, Wu Zhang|arXiv (Cornell University)|2020. 11. 16.
Domain Adaptation and Few-Shot Learning참고 문헌 20인용 수 9
한 줄 요약

이 논문은 평균 기울기 에피소딕 메모리(A-GEM)를 향상시키기 위해 새로운 연속 학습 방법인 ε-SOFT-GEM을 제안한다. 이 방법은 학습 신규 작업과 이전 지식을 유지하는 데 균형을 이루기 위해 [0,1] 범위 내의 부드러운 제약 조건 ε를 도입한다. 에피소딕 메모리 기울기와 업데이트된 기울기 간의 기울기 각도 제약을 적용함으로써, ε-SOFT-GEM은 최소한의 계산 및 메모리 오버헤드로 최신 기술 성능을 달성하며, 단일 에포크 학습에서 A-GEM 및 기타 기준 성능을 초월한다.

ABSTRACT

Catastrophic forgetting in continual learning is a common destructive phenomenon in gradient-based neural networks that learn sequential tasks, and it is much different from forgetting in humans, who can learn and accumulate knowledge throughout their whole lives. Catastrophic forgetting is the fatal shortcoming of a large decrease in performance on previous tasks when the model is learning a novel task. To alleviate this problem, the model should have the capacity to learn new knowledge and preserve learned knowledge. We propose an average gradient episodic memory (A-GEM) with a soft constraint $ε\in [0, 1]$, which is a balance factor between learning new knowledge and preserving learned knowledge; our method is called gradient episodic memory with a soft constraint $ε$ ($ε$-SOFT-GEM). $ε$-SOFT-GEM outperforms A-GEM and several continual learning benchmarks in a single training epoch; additionally, it has state-of-the-art average accuracy and efficiency for computation and memory, like A-GEM, and provides a better trade-off between the stability of preserving learned knowledge and the plasticity of learning new knowledge.

연구 동기 및 목표

  • 신규 작업을 학습할 때 이전 작업에서 성능이 저하되는 치명적인 잊음 현상을 해결하기 위해 연속 학습에서의 치명적인 잊음 문제를 해결한다.
  • 학습 신규 지식과 이전 지식을 균형 있게 유지하기 위해 A-GEM을 개선하기 위해 부드러운 제약 조건 ε를 도입한다.
  • 모델이 이전 작업의 손실을 증가시키지 않고 오히려 감소시키는 방식으로, 에피소딕 메모리에서 새로운 지식을 적극적으로 습득할 수 있도록 한다.
  • 성능 향상을 높이면서도 A-GEM과 유사한 계산 및 메모리 효율성을 유지한다.
  • 다중 학습 반복을 통해 히우리스틱 검색을 통한 ε 최적화 전략을 탐색한다.

제안 방법

  • 학습의 유연성(신규 작업 학습)과 안정성(이전 작업 유지) 간의 상충 관계를 균형 잡기 위해 [0,1] 범위 내의 부드러운 제약 조건 ε를 도입한다.
  • 기울기 업데이트 규칙을 수정하여, 에피소딕 메모리 기울기와 업데이트된 기울기 간의 각도가 90도 이내가 되도록 보장함으로써 이전 작업의 손실 감소를 확보한다.
  • 에피소딕 메모리에서의 기준 기울기를 사용하고 최적화 과정에서 부드러운 제약 조건을 적용하는 A-GEM의 변종으로 ε-SOFT-GEM을 제안한다.
  • 에피소딕 메모리와 신규 작업 데이터의 기울기를 평균화한 A-A-GEM을 제안하며, 동일한 각도 제약 조건을 적용하여 이전 작업 성능을 유지한다.
  • 다중 학습 반복 동안 최적의 ε 값을 탐색하기 위해 히우리스틱 최적화 전략을 도입하고, 성능 추세에 따라 ε를 업데이트한다.
  • 기울기 정규화 및 제약 조건 적용에 최소한의 추가 계산을 사용하여 A-GEM의 효율성을 유지한다.

실험 결과

연구 질문

  • RQ1고정된 제약 조건과 비교해 부드러운 제약 조건 ε가 연속 학습에서 학습의 기민성과 안정성 간의 균형을 향상시키는가?
  • RQ2에피소딕 메모리 기울기와 업데이트된 기울기 간의 기울기 각도 제약 조건을 90도 이내로 유지할 경우, 이전 작업에서의 지식 습득이 활성화되는가?
  • RQ3ε-SOFT-GEM이 A-GEM 및 기타 기준 성능을 유지하면서도 평균 정확도에서 더 높은 성능을 달성할 수 있는가?
  • RQ4에피소딕 메모리 크기가 ε-SOFT-GEM, A-GEM, A-A-GEM의 성능에 미치는 영향은 어떠한가?
  • RQ5Permuted MNIST 및 Split-CIFAR와 같은 다양한 연속 학습 기준에서 최적의 ε 값은 무엇인가?

주요 결과

  • ε-SOFT-GEM은 단일 학습 에포크에서 A-GEM 및 여러 연속 학습 기준보다 평균 정확도와 잊음 감소 측면에서 뛰어난 성능을 보였다.
  • 히우리스틱 최적화 전략을 사용해 다섯 번의 학습 반복 후, Permuted MNIST에선 최적의 ε 값이 0.07185로, Split-CIFAR에선 0.5로 도출되었다.
  • ε-SOFT-GEM은 EWC 및 MAS와 같은 정규화 기반 방법보다 더 뛰어난 안정성(낮은 잊음)과 기민성(빠른 학습)을 확보했다.
  • A-A-GEM은 ε를 사용하지 않아도 ε-SOFT-GEM과 거의 유사한 성능을 보였으며, 이는 각도 제약 조건 자체가 ε 없이도 효과적이라는 것을 시사한다.
  • 에피소딕 메모리 크기가 커질수록 ε-SOFT-GEM, A-GEM, A-A-GEM의 성능이 향상되었으며, 이는 이전 작업 기울기 표현의 향상으로 인해 A-T 및 F-T 지표가 증가했기 때문이다.
  • 기존 A-GEM과 거의 동일한 계산 및 메모리 효율성을 유지하였으며, 추가로 한 개의 기울기 정규화 단계만 추가되었기 때문이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.