Skip to main content
QUICK REVIEW

[논문 리뷰] Meta Learning Backpropagation And Improving It

Louis Kirsch, Jürgen Schmidhuber|arXiv (Cornell University)|2020. 12. 29.
Domain Adaptation and Few-Shot Learning참고 문헌 52인용 수 8
한 줄 요약

이 논문은 신경망 가중치를 공유되고 희소적인 LSTMs로 대체함으로써 백프로파게이션 유사 학습 알고리즘을 엔드 투 엔드로 미분 가능한 방식으로 학습할 수 있도록 하는 새로운 메타학습 프레임워크인 변수 공유 메타학습(VSML)을 소개한다. 이 방법은 단순히 정방향 동역학을 통해 일반화 가능한, 기울기 없는 학습 규칙을 학습하며, 기울기 계산을 명시적으로 수행하지 않아도 되므로, Fashion MNIST와 같은 새로운 데이터셋에 대해 뛰어난 샘플 효율성과 일반화 성능을 달성한다.

ABSTRACT

Many concepts have been proposed for meta learning with neural networks (NNs), e.g., NNs that learn to reprogram fast weights, Hebbian plasticity, learned learning rules, and meta recurrent NNs. Our Variable Shared Meta Learning (VSML) unifies the above and demonstrates that simple weight-sharing and sparsity in an NN is sufficient to express powerful learning algorithms (LAs) in a reusable fashion. A simple implementation of VSML where the weights of a neural network are replaced by tiny LSTMs allows for implementing the backpropagation LA solely by running in forward-mode. It can even meta learn new LAs that differ from online backpropagation and generalize to datasets outside of the meta training distribution without explicit gradient calculation. Introspection reveals that our meta learned LAs learn through fast association in a way that is qualitatively different from gradient descent.

연구 동기 및 목표

  • 백프로파게이션과 같은 고정된 인간 설계 요소에 의존하지 않고도 일반적인 학습 알고리즘(LA)을 학습할 수 있는 메타학습 프레임워크를 개발하는 것.
  • 기존 메타학습 방법이 과적합되는 문제를 해결하기 위해, 가중치 공유와 희소성에 의해 $|V_L| \gg |V_M|$ 비율을 강제함으로써 임의의 과제에 특화된 해결책에 과도하게 기울이는 것을 방지하는 것.
  • 백프로파게이션과 같은 강력하고 재사용 가능한 학습 알고리즘들이 기호 프로그래밍이나 하드코딩된 계산 그래프 없이도 순환 동역학 내에 암묵적으로 인코딩될 수 있음을 보여주는 것.
  • 다양한 데이터셋 간에 일반화되며, 메타학습 분포를 초월하여 분포 외 과제(예: MNIST에서 Fashion MNIST로의 전이)에도 일반화되는 메타 최적화 학습 알고리즘을 가능하게 하는 것.

제안 방법

  • 표준 신경망 가중치를 작은 공유 LSTM으로 대체하여 변수 공유 메타학습(VSML) 아키텍처를 구성하는 것.
  • 가중치 행렬의 희소 연결을 사용하여 파라미터 수를 줄이면서도 표현력을 유지함으로써 효율적인 파라미터 재사용을 가능하게 하는 것.
  • RNN이 정방향 동역학을 통해 학습 규칙을 학습하도록 엔드 투 엔드로 최적화하는 메타최적화를 사용하는 것.
  • 시스템을 단일한 희소적이고 공유된 가중치 RNN 또는 메시지를 주고받는 다수의 RNN으로 해석함으로써 순환 동역학을 통해 잠재적인 신용 할당 메커니즘이 유도되도록 하는 것.
  • RNN이 과제 분포에서 훈련되어 일반적인 학습 알고리즘을 학습하도록 메타최적화 루프를 사용하는 것.
  • 내성 분석과 학습 알고리즘 클로닝을 적용하여 학습된 학습 알고리즘이 기울기 하강법과는 질적으로 다른 빠르고 연상 기반의 학습을 수행하는지 확인하는 것.

실험 결과

연구 질문

  • RQ1신경망이 명시적인 기울기 계산 없이도 정방향 동역학만으로 백프로파게이션을 구현할 수 있는가?
  • RQ2메타학습 분포 외의 데이터셋(예: MNIST에서 Fashion MNIST로의 전이)에 대해 메타학습된 학습 알고리즘이 일반화되는가?
  • RQ3메타학습된 학습 알고리즘은 확률적 기울기 하강법과 질적으로 다른 학습 역학을 보이는가?
  • RQ4RNN 아키텍처에서의 가중치 공유와 희소성은 일반적인, 재사용 가능한 학습 알고리즘의 발견을 가능하게 하는가?
  • RQ5샘플 효율성과 일반화 성능 측면에서 VSML의 성능는 표준 백프로파게이션과 비교해 어떻게 되는가?

주요 결과

  • VSML은 명시적인 기울기 계산이나 기호 프로그래밍 없이도 정방향 동역학만으로 백프로파게이션 유사 학습 알고리즘을 성공적으로 학습한다.
  • 메타학습 중에 MNIST에서만 훈련된 학습 알고리즘이 Fashion MNIST와 같은 새로운 데이터셋으로도 일반화되며, 이는 분포 외 일반화 능력이 뛰어나다는 것을 보여준다.
  • 내성 분석 결과, 학습된 학습 알고리즘은 기울기 하강법이 아닌 빠르고 연상 기반의 메커니즘에 의존함을 확인하여 질적으로 다른 학습 과정임을 시사한다.
  • 특히 소수의 샘플 또는 지속적 학습 환경에서 표준 백프로파게이션보다 뛰어난 샘플 효율성으로 MNIST에서 경쟁적인 성능을 달성한다.
  • 다양한 환경과 과제 간에 일반화되며, 지속적이고 샘플 효율적인 학습 분야에 광범위한 적용 가능성을 시사한다.
  • 다른 결과들에 비해 유망하지만, 현재 구현은 조기 수렴 현상과 표준 백프로파게이션보다 높은 계산 비용을 보이며, 최적화 및 확장 가능성에 여전히 개선 여지가 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.