Skip to main content
QUICK REVIEW

[논문 리뷰] Variational Prototype Replays for Continual Learning

Mengmi Zhang, Tao Wang|arXiv (Cornell University)|2019. 05. 23.
Domain Adaptation and Few-Shot Learning참고 문헌 38인용 수 12
한 줄 요약

이 논문은 극히 적은 메모리 사용량으로도 강력한 기억 유지와 일반화 성능를 달성하기 위해 변동형 프로토타입(잠재 공간 내 평균과 분산으로 학습된 분포로 표현되는)을 사용하는 지속적 학습 방법인 Variational Prototype Replays를 제안한다. 이 방법은 이전 태스크의 각 클래스에서 하나의 대표 샘플만을 재생하고, 새로운 임bedding을 가장 가까운 프로토타입 분포와 매칭시음으로써, 기존의 상태최고 기법들보다 MNIST, CIFAR10, miniImageNet에서 소수의 예시가 주어진 지속적 학습 환경에서 뛰어난 성능을 기록한다.

ABSTRACT

Continual learning refers to the ability to acquire and transfer knowledge without catastrophically forgetting what was previously learned. In this work, we consider \emph{few-shot} continual learning in classification tasks, and we propose a novel method, Variational Prototype Replays, that efficiently consolidates and recalls previous knowledge to avoid catastrophic forgetting. In each classification task, our method learns a set of variational prototypes with their means and variances, where embedding of the samples from the same class can be represented in a prototypical distribution and class-representative prototypes are separated apart. To alleviate catastrophic forgetting, our method replays one sample per class from previous tasks, and correspondingly matches newly predicted embeddings to their nearest class-representative prototypes stored from previous tasks. Compared with recent continual learning approaches, our method can readily adapt to new tasks with more classes without requiring the addition of new units. Furthermore, our method is more memory efficient since only class-representative prototypes with their means and variances, as well as only one sample per class from previous tasks need to be stored. Without tampering with the performance on initial tasks, our method learns novel concepts given a few training examples of each class in new tasks.

연구 동기 및 목표

  • 소수의 예시, 점진적인 클래스 및 도메인 설정에서 지속적 학습에서 발생하는 기술적 기억 상실 문제를 해결하기 위해.
  • 모델 가중치나 대규모 생성 모델을 저장하는 대신, 각 클래스당 하나의 샘플과 클래스 대표 변동형 프로토타입만 저장하여 메모리 오버헤드를 최소화하기 위해.
  • 학습된 평균과 분산을 가진 확률적 분포로 클래스 표현을 모델링하여 일반화 성능와 기억 유지 성능를 향상시키기 위해.
  • 기존 네트워크 아키텍처의 변경 없이도 소수의 예시로 새로운 태스크에 효율적으로 적응할 수 있도록 하기 위해.
  • 정규화 및 생성 모델 재생 기법의 대안으로서 확장 가능하고 파라미터 효율적인 지속적 학습 방법을 제공하기 위해.

제안 방법

  • 모델은 각 클래스에 대해 잠재 공간 내 분포로 표현되는 변동형 프로토타입을 평균과 분산으로 매개변수화하여 클래스 수준의 특징을 표현한다.
  • 새로운 태스크의 각 클래스에 대해, 모델은 임베딩을 예측하고 저장된 변동형 분포에서 가장 가까운 프로토타입을 찾아 분류한다.
  • 기억 상실을 방지하기 위해, 이전 태스크의 각 클래스에서 하나의 샘플을 재생하고, 새로 예측한 변동형 프로토타입 분포가 저장된 프로토타입 분포와 일치하도록 회귀한다.
  • 변동형 프로토타입의 분산은 신뢰도 측도로 작용하여, 새로운 태스크 학습 시에 부족하게 표현되거나 신뢰도가 낮은 특징에 대해 선택적 기억 상실을 가능하게 한다.
  • 각 변동형 프로토타입에서 다수의 몬테카를로 샘플을 추출하여 가장 가까운 프로토타입 분류 전략을 적용함으로써 정확도를 향상시킨다.
  • 분류 손실과 예측된 프로토타입 분포와 저장된 프로토타입 분포 간의 일치를 유도하는 프로토타입 복원 손실을 조합하여 엔드 투 엔드로 모델을 훈련시킨다.

실험 결과

연구 질문

  • RQ1학습된 평균과 분산을 가진 변동형 프로토타입으로 클래스 표현을 모델링하면 지속적 학습에서 기억 유지 성능가 향상되는가?
  • RQ2단일 점 프로토타입 대비 확률적 프로토타입 사용이 기술적 기억 상실 방지에 어떤 영향을 미치는가?
  • RQ3이전 태스크의 각 클래스에서 하나의 샘플만 재생하고 프로토타입 매칭을 수행하는 것이 이전 태스크 성능 유지와 새로운 태스크 적응 능력 유지를 위한 데 효과적인가?
  • RQ4프로토타입 평균의 변화 동역학은 태스크 간에 어떻게 변화하며, 이는 시각적 특징 유사성과 어떤 관계가 있는가?
  • RQ5기존 아키텍처 변경 없이도 파라미터 정규화 없이 소수의 학습 예시로 새로운 클래스에 일반화할 수 있는가?

주요 결과

  • 이 방법은 소수의 예시가 주어진 환경에서 MNIST, CIFAR10, miniImageNet에서 상태최고 기법들보다 뚜렷한 성능 향상을 기록하며, 기억 유지 성능도 향상된다.
  • 분산 가중 거리 대비 균일한 가중치를 사용할 경우 평균 정확도가 1.2% 감소하여, 불확실성 인식 프로토타입 매칭의 중요성을 입증한다.
  • 프로토타입을 반대로 재생(최근 태스크부터)할 경우 성능이 1% 감소하고, 가장 최근 프로토타입만 재생할 경우 추가로 0.3% 감소함으로써, 오래된 태스크 지식이 안정성 유지를 위해 필수적임을 시사한다.
  • 부족하게 표현된 특징의 기억 상실은 분산 성분 덕분에 완화되며, 평균 또는 분산만 매칭하는 방법은 둘 다 사용하는 방법보다 유의미하게 성능이 열 劣하다.
  • 잠재 차원을 100에서 1000으로 늘일 경우 정확도가 0.7% 향상되고, 10으로 줄일 경우 성능 저하가 발생함으로써 표현 능력에 민감함을 보여준다.
  • 태스크 간 프로토타입 평균의 궤적은 시각적 특징 유사성과 상관관계가 있음(r = 0.44)을 보이며, 이는 방법이 클래스 간 분리성을 유지하는 위상적으로 구조화된 잠재 공간을 개발하고 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.