Skip to main content
QUICK REVIEW

[논문 리뷰] Continual Deep Learning by Functional Regularisation of Memorable Past

Pingbo Pan, Siddharth Swaroop|arXiv (Cornell University)|2020. 04. 29.
Domain Adaptation and Few-Shot Learning참고 문헌 31인용 수 32
한 줄 요약

FROMP는 Gaussian-process 형식의 DNNs를 통해 식별된 기억에 남는 과거 예제의 작은 집합에 대해 네트워크 출력을 정규화함으로써 연속 학습을 위한 기능적 정규화 접근법을 도입하고, 표준 벤치마크에서 최첨단 성능을 달성한다.

ABSTRACT

Continually learning new skills is important for intelligent systems, yet standard deep learning methods suffer from catastrophic forgetting of the past. Recent works address this with weight regularisation. Functional regularisation, although computationally expensive, is expected to perform better, but rarely does so in practice. In this paper, we fix this issue by using a new functional-regularisation approach that utilises a few memorable past examples crucial to avoid forgetting. By using a Gaussian Process formulation of deep networks, our approach enables training in weight-space while identifying both the memorable past and a functional prior. Our method achieves state-of-the-art performance on standard benchmarks and opens a new direction for life-long learning where regularisation and memory-based methods are naturally combined.

연구 동기 및 목표

  • 연속 학습에서의 재앙적 망각을 해결하기 위해 가중치 정규화만이 아니라 출력 수준의 정규화에 중점을 둬야 한다.
  • 다음 작업을 정규화하기 위해 DNN에서 파생된 Gaussian Process 기반의 기능적 사전(FP)을 도입한다.
  • 계산 비용을 최소화하면서 성능을 유지하기 위해 기억할 만한 과거 예제의 작고 정보가 풍부한 세트를 식별한다.
  • 메모리 공간에서 훈련하되 기억할 만한 과거 예제 간의 상관관계를 활용하는 기능적 사전을 이용한다.

제안 방법

  • 깊은 네트워크를 Gaussian Processes로 전환(DNN2GP)하여 네트워크 출력에 대한 기능적 사전을 얻는다.
  • 메모able 과거 예제를 레퍼런스 손실 Hessian/이차도함수(Lambda)로 데이터 포인트를 순위를 매겨 관련성 지표를 사용해 식별한다.
  • 현재 작업을 정규화하기 위해 표준 작업 손실과 기억된 과거 출력에 대한 GP 포스트eriors로부터 도출된 닫힌 형태의 기능적 정규화 항을 결합한 손실 함수를 최소화한다.
  • Adam과 같은 확장 가능한 학습이 가능하도록 평균 필드(mean-field), 블록 대각 커널, 결정론적 최적화와 같은 근사들을 사용하여 기능적 사전을 관리 가능한 방식으로 근사한다.
  • 메모리된 과거 예제에 대한 출력을 과거 예측에 가깝게 유지하도록 가중 기능 정규화처럼 보이는 목표를 형성하되 계산 효율성을 유지한다.

실험 결과

연구 질문

  • RQ1작은 집합의 기억 가능한 과거 예제에 대한 기능적 정규화가 전통적인 가중치 정규화보다 연속 학습 과제에서 더 나은 성능을 내는가?
  • RQ2네트워크 출력에 대한 GP 기반의 기능적 사전을 활용하면 기존의 기능적 정규화 방법과 비교해 과거 작업의 보존이 향상되는가?
  • RQ3기억 가능한 과거 입력의 자동 선택이 연속 학습에서 성능과 계산 비용에 어떤 영향을 미치는가?
  • RQ4확장 가능한 근사를 사용한 FROMP 구현 시 Practical 계산 트레이드오프는 무엇인가?

주요 결과

  • FROMP 접근법은 표준 연속 학습 벤치마크에서 최첨단 성능을 달성한다(초록에 명시된 바와 같이).
  • 손실 Hessian과 연계된 관련성 지표에 의해 선택된 기억 가능한 과거 예제는 대개 의사결정 경계 근처에 있으며 망각을 방지하는 데 중요하다.
  • GP 기반의 기능적 사전은 기억 가능한 예제 간의 상관관계를 활용하여 출력 정규화를 수행하고 전체 데이터 보유를 필요로 하지 않으면서 가중치 공간에서의 훈련을 가능하게 한다.
  • 이전의 기능적 정규화 방법과 비교했을 때 FROMP은 기억 가능한 과에 대한 커널을 도입하고 과거 예측으로 평균을 정규화하여 일관성과 성능을 향상시킨다.
  • 블록 대각 커널 및 평균 필드 가정과 같은 근사를 통해 계산 오버헤드를 소폭 증가시키며 표준 옵티마이저(Adam)를 활용하는 것이 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.