Skip to main content
QUICK REVIEW

[논문 리뷰] Meta-learnt priors slow down catastrophic forgetting in neural networks

Giacomo Spigler|arXiv (Cornell University)|2019. 09. 09.
Domain Adaptation and Few-Shot Learning참고 문헌 28인용 수 9
한 줄 요약

이 논문은 순차적인 작업 시퀀스에 대해 신경망을 사전 훈련함으로써 치명적인 잊음(catastrophic forgetting)을 완화하는 메타러닝 알고리즘인 SeqFOMAML을 제안한다. 개별 작업이 아닌 순차적 작업 시퀀스에 대해 초기 파라미터를 최적화함으로써 신속한 적응과 이전 작업에 대한 지속적 유지 능력을 동시에 확보함으로써, Omniglot 및 MiniImageNet 벤치마크에서 이전에 학습한 작업의 정확도 감쇠 속도가 둔화됨을 보여, 잊음 현상이 크게 감소함을 확인한다.

ABSTRACT

Current training regimes for deep learning usually involve exposure to a single task / dataset at a time. Here we start from the observation that in this context the trained model is not given any knowledge of anything outside its (single-task) training distribution, and has thus no way to learn parameters (i.e., feature detectors or policies) that could be helpful to solve other tasks, and to limit future interference with the acquired knowledge, and thus catastrophic forgetting. Here we show that catastrophic forgetting can be mitigated in a meta-learning context, by exposing a neural network to multiple tasks in a sequential manner during training. Finally, we present SeqFOMAML, a meta-learning algorithm that implements these principles, and we evaluate it on sequential learning problems composed by Omniglot and MiniImageNet classification tasks.

연구 동기 및 목표

  • 단일 작업에 대해 훈련하는 표준 메타러닝의 한계를 해결하기 위해, 순차적 학습에서 치명적인 잊음을 방지하지 못하는 문제를 해결한다.
  • 지속적 학습을 개별 작업이 아닌 작업 시퀀스에 대한 메타러닝 문제로 수식화한다.
  • 순차적으로 제시되는 작업들에 대해 빠른 적응과 장기적 유지 능력을 동시에 최적화한 초기 모델 파라미터를 학습하는 방법을 개발한다.
  • 전체 작업 시퀀스에 대한 메타훈련이 단일 작업 메타훈련보다 더 나은 일반화 성능과 간섭 감소를 이끌어내는지 실험적으로 입증한다.
  • Split-Omniglot 및 Split-MiniImageNet에서의 실험을 통해 기존 작업의 잊음 비율 감소와 성능 향상을 보여준다.

제안 방법

  • 개별 작업이 아닌 작업 시퀀스로 구성된 메타배치를 사용하는 FOMAML의 변종인 SeqFOMAML을 제안한다.
  • 다양한 작업 시퀀스의 분포를 사용하여 초기 모델 파라미터를 최적화함으로써, 새로운 작업에 대한 신속한 적응과 이전에 학습한 지식의 유지 능력을 확보한다.
  • 메타훈련 이후 실제 작업 시퀀스에 대해 표준 확률적 경사 하강법을 사용하여 미세조정하며, 모델이나 훈련 제약 조건을 수정하지 않는다.
  • 메타훈련을 생명체의 학습과 유사한 수준의 사전 지식 진화 과정으로 모델링함으로써 벨드윈 효과를 활용한다.
  • 신규 작업과 이전에 본 작업의 성능을 동시에 최대화하는 목표를 설정하고, 통합 최적화 기준을 사용하여 수식화한다.
  • 계산 비용을 줄이기 위해 일阶 근사(approximation)를 적용함으로써 효율성을 유지하면서도 효과적인 순차적 학습을 가능하게 한다.

실험 결과

연구 질문

  • RQ1표준 메타러닝이 단일 작업에 대해 훈련하는 것과 비교해, 작업 시퀀스에 대한 메타러닝이 치명적인 잊음을 줄일 수 있는가?
  • RQ2전체 작업 시퀀스에 대한 사전 훈련이 순차적 학습 중 이전에 학습한 작업의 지식 유지에 어떤 영향을 미치는가?
  • RQ3SeqFOMAML가 학습한 표현은 얼마나 다양한 작업 간에 일반화되며, 이후 작업의 간섭에 얼마나 저항하는가?
  • RQ4제안된 방법은 긴 작업 시퀀스를 포함한 복잡한 실제 세계의 지속적 학습 시나리오에 어떻게 스케일링되는가?
  • RQ5SeqFOMAML은 기존의 지속적 학습 기법인 탄성 가중치 통합(Elastic Weight Consolidation)과 효과적으로 조합될 수 있는가?

주요 결과

  • SeqFOMAML은 분할된 MiniImageNet에서 치명적인 잊음을 크게 감소시켰으며, 길이 10인 시퀀스의 경우 정확도 감쇠 시간 상수 τ₁₀ = 200.9로 측정되었다.
  • 길이 20인 시퀀스의 경우 감쇠 시간 상수가 τ₂₀ = 273.8로 증가하여, 짧은 시퀀스보다 더 느린 잊음 속도를 보였다.
  • 기본 모델로 사용된 표준 FOMAML조차도 상대적으로 낮은 잊음 비율(τ₁ = 91.5)을 보이며, 메타학습된 표현이 이미 간섭에 대해 어느 정도 내재된 저항성을 지닌다는 것을 시사한다.
  • FOMAML 파라미터로 초기화된 다중 헤드 네트워크의 성능이 낮은 잊음 수준을 보였으며, 이는 메타학습된 특징이 본질적으로 이식 가능하고 안정적임을 나타낸다.
  • SeqFOMAML는 작업 시퀀스 전반에 걸쳐 지속적 유지 능력을 명시적으로 최적화함으로써, 순차적 학습 환경에서 표준 메타러닝을 능가하는 성능을 보였다.
  • 이 방법은 모델에 종속되지 않으며, 탄성 가중치 통합과 같은 다른 지속적 학습 기법과 조합하여 성능 향상을 더욱 향상시킬 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.