Skip to main content
QUICK REVIEW

[논문 리뷰] Overcoming Catastrophic Forgetting by Generative Regularization

Patrick H. Chen, Wei Wei|arXiv (Cornell University)|2019. 12. 03.
Domain Adaptation and Few-Shot Learning참고 문헌 40인용 수 4
한 줄 요약

이 논문은 기존 데이터에 재접근할 수 없는 메모리 없는 고정 모델 설정에서 치명적인 잊음 문제를 완화하기 위해 변분 베이지안 추론과 에너지 기반 생성 모델링을 융합한 메모리 없는 지속적 학습 방법인 베이지안 생성 정규화(BGR)를 제안한다. 에너지 기반 모델에서 대조 손실을 통해 다양성 있는 특징 학습을 강제화함으로써 BGR는 사후 분포 근사의 정확도를 향상시키고, Fashion-MNIST에서 기존 방법보다 15% 향상되고 CUB에서 10% 향상되는 최신 기준 성능을 달성한다.

ABSTRACT

In this paper, we propose a new method to overcome catastrophic forgetting by adding generative regularization to Bayesian inference framework. Bayesian method provides a general framework for continual learning. We could further construct a generative regularization term for all given classification models by leveraging energy-based models and Langevin-dynamic sampling to enrich the features learned in each task. By combining discriminative and generative loss together, we empirically show that the proposed method outperforms state-of-the-art methods on a variety of tasks, avoiding catastrophic forgetting in continual learning. In particular, the proposed method outperforms baseline methods over 15% on the Fashion-MNIST dataset and 10% on the CUB dataset

연구 동기 및 목표

  • 기존 데이터에 재접근할 수 없는 메모리 없는 고정 모델 설정에서 지속적 학습의 치명적인 잊음 문제를 해결한다.
  • 특히 다양한 안정적인 특징을 태스크 간 유지하지 못하는 한계를 보이는 평균장 변분 추론의 한계를 규명한다.
  • 생성 정규화를 통해 충분하고 통합적인 특징 표현을 강제화하여 베이지안 신경망의 사후 분포 근사 품질을 향상시킨다.
  • 과거 데이터를 저장하거나 모델 크기를 확장하지 않으면서도 강력한 지속적 학습을 가능하게 하여 GDPR과 같은 개인정보 보호 규정과 부합한다.
  • 생성 모델링이 특징의 다양성과 안정성을 향상시켜 점진적 태스크 학습에서의 잊음 감소에 기여함을 입증한다.

제안 방법

  • 에너지 기반 모델(EBM)을 통한 암시적 생성 모델링과 분류 학습을 융합한 베이지안 생성 정규화(BGR) 프레임워크를 도입한다.
  • 랜지에빈 역동성 샘플링을 사용하여 생성 손실을 근사함으로써 모델이 입력 데이터의 모든 부분에서 다양한 특징을 학습할 수 있도록 한다.
  • EBM에 대조 손실을 통합하여 모델이 입력 데이터를 정확히 재구성하도록 유도함으로써 통합적인 특징 학습을 촉진한다.
  • 생성 정규화 항을 변분 추론 목표 함수에 통합하여 안정적이고 다양한 사후 분포 근사가 이루어지도록 보장한다.
  • 지속적 학습 전반에 걸쳐 고정된 모델 아키텍처를 유지하여 파rameter 확장이나 데이터 재재생을 방지한다.
  • 생성 능력을 활용하여 특징이 분류에 유리한 부분에 집중되어 있지 않고 전체 입력 구조에 걸쳐 분포되어 있음을 검증한다.

실험 결과

연구 질문

  • RQ1왜 메모리 없는 지속적 학습에서 평균장 변분 추론은 스트리밍 업데이트 성질을 지닌다 해도 치명적인 잊음을 방지하지 못하는가?
  • RQ2생성 모델링이 베이지안 신경망의 사후 분포 근사 품질 향상에 기여하는가?
  • RQ3생성 정규화를 통해 통합적인 특징 학습을 강제하면 점진적 태스크 학습에서 잊음이 감소하는가?
  • RQ4제안된 방법은 정확도와 안정성 측면에서 최신 기준의 메모리 없는 및 메모리 기반 지속적 학습 접근법과 비교해 어떻게 성능을 내는가?
  • RQ5기존의 메모리 기반 방법과 효과적으로 융합하여 성능 향상을 더 높일 수 있는가?

주요 결과

  • 제안된 BGR 방법은 생성 정규화를 통해 다양성 있는 특징 학습을 촉진함으로써 치명적인 잊음을 감소시키며, 입력 스트로크 전반에 걸쳐 균일하게 분포된 주요 특징을 통해 이를 입증한다.
  • Fashion-MNIST 데이터셋에서 BGR는 최신 기준 방법 대비 정확도를 15% 향상시켜 지속적 학습에서 뛰어난 성능을 보였다.
  • CUB 데이터셋에서 BGR는 기준 방법 대비 정확도를 10% 향상시켜 미세 분류 태스크에서의 효과성을 입증했다.
  • 통합 기울기 분석을 통한 정성적 분석 결과, BGR 모델은 숫자 스트로크 전반에 걸쳐 주요 특징을 균일하게 분포시키는 반면, 표준 SGD 모델은 고립된 분류에 유리한 부분에만 집중하는 것으로 나타났다.
  • 새로운 태스크를 학습한 후 정확도 감소 폭이 BGR 적용 시 54.2%에서 95.0%로 크게 감소하여 이전 지식의 유지 능력이 향상됨을 보였다.
  • BGR는 iTAML과 같은 메모리 기반 방법과 효과적으로 융합되어 split-MNIST에서 정확도를 97.8%에서 98.4%로 향상시켜 광범위한 호환성과 향상 잠재력을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.