Skip to main content
QUICK REVIEW

[논문 리뷰] Few-Shot Self Reminder to Overcome Catastrophic Forgetting

Junfeng Wen, Yanshuai Cao|arXiv (Cornell University)|2018. 12. 03.
Domain Adaptation and Few-Shot Learning참고 문헌 31인용 수 16
한 줄 요약

Few-Shot Self Reminder (FSR)는 이전 작업의 샘플을 소규모 에피소딕 메모리에 저장하고, 이에 대한 로짓 매칭을 수행함으로써 지속적 학습에서 치명적인 잊음 문제를 효과적으로 완화하는 단순하면서도 효과적인 방법이다. EWC의 5%에 불과한 메모리 비용으로도 뛰어난 지식 유지 성능을 달성하며, 클래스당 단 한 개의 샘플만 기억해도 이전 방법들을 능가한다.

ABSTRACT

Deep neural networks are known to suffer the catastrophic forgetting problem, where they tend to forget the knowledge from the previous tasks when sequentially learning new tasks. Such failure hinders the application of deep learning based vision system in continual learning settings. In this work, we present a simple yet surprisingly effective way of preventing catastrophic forgetting. Our method, called Few-shot Self Reminder (FSR), regularizes the neural net from changing its learned behaviour by performing logit matching on selected samples kept in episodic memory from the old tasks. Surprisingly, this simplistic approach only requires to retrain a small amount of data in order to outperform previous methods in knowledge retention. We demonstrate the superiority of our method to the previous ones in two different continual learning settings on popular benchmarks, as well as a new continual learning problem where tasks are designed to be more dissimilar.

연구 동기 및 목표

  • 지속적 학습에서 새로운 작업을 학습할 때 기존 작업의 성능이 급격히 떨어지는 치명적인 잊음을 해결하기 위해.
  • EWC와 같은 매개변수 기반 정규화 방법의 한계를 극복하기 위해, 대규모 모델을 저장하고 높은 메모리 비용을 유발하는 문제를 해결하기 위해.
  • 클래스당 몇 개의 샘플만으로도 소규모 에피소딕 메모리를 활용해 잊음 현상을 크게 줄일 수 있음을 보여주어, 복잡한 방법이 반드시 필요하다는 가정을 도전하기 위해.
  • 낮은 메모리 환경에서 기능 수준의 정규화(로짓 매칭)가 매개변수 수준의 제약이나 지식 전이보다 더 효과적임을 보여주기 위해.
  • 더 높은 작업 이질성 조건에서 평가할 수 있도록 비선형적으로 변환된 MNIST를 포함한 새로운 벤치마크를 제안하기 위해.

제안 방법

  • FSR는 이전 작업의 각 클래스에서 하나 또는 몇 개의 샘플과 그에 대한 모델 예측 로짓을 소규모 에피소딕 메모리에 유지한다.
  • 새로운 작업을 학습하는 동안, FSR은 오래된 작업 샘플에 대한 모델 출력 로짓과 저장된 로짓 간의 L2 손실을 최소화함으로써 로짓 매칭을 수행한다.
  • 정규화는 네트워크의 매개변수가 아니라 기능적 행동에 직접 적용되므로, 최소한의 저장 공간으로도 효과적인 지식 유지가 가능하다.
  • 표준 최적화(예: Adam)를 사용하며 복잡한 아키텍처 수정이나 하이퍼파라미터 튜닝이 필요하지 않다.
  • 표준 학습 프로토콜과 호환되며, 클래스 인크리멘탈 및 도메인 인크리멘탈 지속적 학습 설정 모두에 적용 가능하다.
  • 성능 향상을 위해 예측된 진짜 레이블과 저장된 진짜 레이블 간의 KL 발산을 추가로 고려한다.

실험 결과

연구 질문

  • RQ1클래스당 몇 개의 샘플만으로도 소규모 에피소딕 메모리를 활용해 지속적 학습에서 치명적인 잊음을 크게 줄일 수 있는가?
  • RQ2낮은 메모리 환경에서 로짓 매칭을 통한 기능 수준의 정규화가 매개변수 수준의 정규화(EWC 등)나 지식 전이보다 우수한가?
  • RQ3메모리 예산과 작업 유사도가 다양할 때 FSR은 HAT, iCaRL, EWC와 같은 최신 기법들과 비교해 어떻게 성능을 내는가?
  • RQ4비선형적으로 변환된 MNIST와 같이 작업 간 이질성이 높은 경우에도 FSR은 높은 성능을 유지할 수 있는가?
  • RQ5로짓 매칭을 사용할 경우 다른 정규화 기법과 비교해 메모리 효율성과 성능 간의 상충 관계가 존재하는가?

주요 결과

  • FSR는 5개의 Permuted MNIST 작업에서 EWC와 유사한 성능을 달성하면서도 EWC의 5%에 불과한 메모리 비용을 사용한다.
  • 클래스당 단 한 개의 샘플만으로도 FSR은 잊음률을 느리고 점진적으로 유지하여 치명적인 잊음을 완전히 방지한다.
  • CIFAR100 인크리멘탈 학습 벤치마크에서, 로짓 매칭을 사용한 FSR은 평균 잊음 비율 ρ 측면에서 HAT와 EWC를 모두 능가한다.
  • 작업 간 지식 공유가 높은 경우(예: CIFAR100), FSR은 주로 특징 재사용을 차단하는 주의 기반 게이팅 메커니즘으로 어려움을 겪는 HAT를 능가한다.
  • 모든 메모리 크기에서 로짓 매칭은 전이 및 iCaRL보다 일관되게 뛰어난 성능을 보이며, 특히 낮은 메모리 예산에서 성능 격차가 가장 크게 나타난다.
  • 예측된 레이블과 진짜 레이블 간의 KL 발산을 추가함으로써 FSR의 성능이 더욱 향상되며, 이는 하이브리드 정규화의 잠재적 가능성을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.