Skip to main content
QUICK REVIEW

[논문 리뷰] Bayesian Structure Adaptation for Continual Learning

Abhishek Kumar, Sunabha Chatterjee|arXiv (Cornell University)|2019. 12. 08.
Domain Adaptation and Few-Shot Learning참고 문헌 43인용 수 4
한 줄 요약

이 논문은 인도 버거 프로세스(IBP)를 사용하여 신경망 아키텍처를 동적으로 적응시키는 베이지안 비모수적 지속적 학습 프레임워크를 제안한다. 이는 과제별 희소 가중치 부분집합을 가능하게 하면서도 과제 간에 구조를 공유한다. 구조 학습을 변분 베이지안 추론과 통합함으로써 모델은 치명적인 잊음 문제를 완화하고, 지도 및 비지도 지속적 학습 벤치마크에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Continual Learning is a learning paradigm where learning systems are trained with sequential or streaming tasks. Two notable directions among the recent advances in continual learning with neural networks are ($i$) variational Bayes based regularization by learning priors from previous tasks, and, ($ii$) learning the structure of deep networks to adapt to new tasks. So far, these two approaches have been orthogonal. We present a novel Bayesian approach to continual learning based on learning the structure of deep neural networks, addressing the shortcomings of both these approaches. The proposed model learns the deep structure for each task by learning which weights to be used, and supports inter-task transfer through the overlapping of different sparse subsets of weights learned by different tasks. Experimental results on supervised and unsupervised benchmarks shows that our model performs comparably or better than recent advances in continual learning setting.

연구 동기 및 목표

  • 지속적 학습에서 치명적인 잊음을 해결하기 위해 동적 신경망 아키텍처 적응을 가능하게 한다.
  • 베이지안 비모수적 사전분포(IBP)를 변분 추론과 통합하여 점진적인 모델 확장을 지원하고 과제별 가중치 희박성을 달성한다.
  • 과제 간 상호 전이를 가능하게 하기 위해 겹치는 과제별 희소 가중치 부분집합을 유지하면서 이전 과제의 성능을 유지한다.
  • 지도 학습을 넘어서 비지도 생성 모델링(예: VAEs)까지 확장하여 베이지안 지속적 학습의 적용 가능성을 넓힌다.
  • 과제 조절형 마스크 신경망을 통해 과제 간 공유 잠재 공간에서 효과적인 표현 학습을 달성한다.

제안 방법

  • 각 은닉층의 연결성을 인도 버거 프로세스(IBP) 사전분포로 모델링하여 무한한 잠재적 특징과 새로운 과제에 따른 동적 증가를 허용한다.
  • 구조적 평균장 변분 후행분포를 사용하여 가중치, 마스크, 잠재 변수의 공동 후행분포를 근사함으로써 엔드 투 엔드 학습을 가능하게 한다.
  • 이중 마스크 행렬 $\bm{B}^l$ 을 사용하여 각 층에서 활성 연결을 희박하게 선택하며, $\bm{W}^l = \bm{B}^l \odot \bm{V}^l$ 로 정의한다. 여기서 $\bm{V}^l$ 은 가중치 값이다.
  • 신경망을 통해 암시적 추론을 적용하여 잠재 변수와 모델 매개변수의 후행분포를 매개변수화함으로써 확장 가능한 추론을 가능하게 한다.
  • 분류적(베이지안 신경망) 및 생성적(VAEs) 모델 모두에 대해 기초 하한값(ELBO)을 제안하고, 확률적 경사 하강법을 통해 최적화한다.
  • 과제별 마스킹을 적용하여 동일한 프레임워크를 베이지안 신경망과 변분 오토인코더에 적용함으로써 지도 및 비지도 지속적 학습을 지원한다.

실험 결과

연구 질문

  • RQ1베이지안 비모수적 접근을 통해 새로운 과제를 수용하기 위해 신경망 아키텍처를 동적으로 확장하면서도 이전 과제의 성능을 유지할 수 있는가?
  • RQ2IBP 기반의 희소 가중치 선택은 과제 간 전이와 치명적인 잊음 감소에 얼마나 효과적인가?
  • RQ3제안된 방법은 공유된 아키텍처 및 추론 메커니즘을 통해 지도 및 비지도 지속적 학습 환경 모두에 일반화될 수 있는가?
  • RQ4과제 간 공유 잠재 공간 학습을 가능하게 하면서도 과제별 표현을 얼마나 잘 유지하는가?
  • RQ5기준 데이터셋에서 기존 최신 기술 수준의 방법과 비교해 볼 때, 모델은 잊음 완화 및 표현 품질 측면에서 얼마나 우수한가?

주요 결과

  • 비지도 지속적 학습에서 MNIST에서는 3-KNN 오차 0.37%, notMNIST에서는 0.08%를 기록하여 EwC 및 VCL를 크게 능가한다.
  • MNIST에서 모델은 과제 간 테스트 로그우도가 최소한의 감소로 유지되며, 치명적인 잊음에 강한 저항성을 보인다.
  • t-SNE 시각화 결과는 MNIST의 경우 notMNIST보다 잠재 공간에서 더 명확한 클래스 간 분리가 이루어졌음을 보여주며, 보다 균일한 데이터에서 더 나은 표현 학습이 이루어졌음을 반영한다.
  • 모든 과제 이후의 최종 사전에서 생성된 샘플은 고품질의 이미지를 생성하여 효과적인 잠재 공간 모델링을 확인한다.
  • 잠재 코드에 대한 KNN 분류를 통한 표현 학습 결과, 기준 대비 오차가 한 단계 낮은 성능을 보이며 뛰어난 성능을 입증한다.
  • MNIST 및 notMNIST의 재구성 이미지는 모델 제약 조건에도 불구하고 높은 품질을 유지하며, 효과적인 생성 능력과 안정적인 학습을 나타낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.