Skip to main content
QUICK REVIEW

[논문 리뷰] A deep learning theory for neural networks grounded in physics

Benjamin Scellier|arXiv (Cornell University)|2021. 03. 18.
Neural Networks and Applications참고 문헌 110인용 수 8
한 줄 요약

이 논문은 에너지 최소화 및 최소 작용 원리와 같은 물리적 변분 원리에 기반한 새로운 미분 가능한 학습 프레임워크인 평형 전파(EqProp)를 소개한다. 이는 뉴모르픽 하드웨어에서 신경망의 효율적이고 국소적, 생물학적으로 타당한 학습을 가능하게 한다. 그 결과, 오직 국소 정보만을 사용하여 기울기를 계산할 수 있음을 보여주며, 연속형 호프필드 네트워크와 비선형 저항성 네트워크와 같은 모델을 엔드 투 엔드로 학습시킬 수 있다. 이는 MNIST 및 CIFAR-10에서 역전파 기반 학습과 비교해 유사한 성능을 보인다.

ABSTRACT

In the last decade, deep learning has become a major component of artificial intelligence. The workhorse of deep learning is the optimization of loss functions by stochastic gradient descent (SGD). Traditionally in deep learning, neural networks are differentiable mathematical functions, and the loss gradients required for SGD are computed with the backpropagation algorithm. However, the computer architectures on which these neural networks are implemented and trained suffer from speed and energy inefficiency issues, due to the separation of memory and processing in these architectures. To solve these problems, the field of neuromorphic computing aims at implementing neural networks on hardware architectures that merge memory and processing, just like brains do. In this thesis, we argue that building large, fast and efficient neural networks on neuromorphic architectures also requires rethinking the algorithms to implement and train them. We present an alternative mathematical framework, also compatible with SGD, which offers the possibility to design neural networks in substrates that directly exploit the laws of physics. Our framework applies to a very broad class of models, namely those whose state or dynamics are described by variational equations. This includes physical systems whose equilibrium state minimizes an energy function, and physical systems whose trajectory minimizes an action functional. We present a simple procedure to compute the loss gradients in such systems, called equilibrium propagation (EqProp), which requires solely locally available information for each trainable parameter. Since many models in physics and engineering can be described by variational principles, our framework has the potential to be applied to a broad variety of physical systems whose applications extend to various fields of engineering, beyond neuromorphic computing.

연구 동기 및 목표

  • 메모리와 처리 기능을 통합한 물리 시스템과 호환 가능한 학습 프레임워크를 개발하여 뉴모르픽 컴퓨팅에서 전통적인 역전파의 비효율성을 해결한다.
  • 딥 러닝을 에너지 최소화 및 최소 작용 원리와 같은 기본 물리 법칙에 기반한 변분 과정으로 재정의한다.
  • 전역적인 오차 역전파가 필요 없는 국소적, 생물학적으로 타당한 학습 규칙을 가능하게 하여 하드웨어 구현에서 폰 노이만 장벽을 극복한다.
  • 에너지 최소화나 최소 작용 원리에 따라 기술되는 물리 시스템—예를 들어 저항성 네트워크나 호프필드 네트워크—가 평형 전파를 통해 효과적으로 학습될 수 있음을 보여준다.
  • 물리학, 기계 학습, 뉴모르픽 공학을 융합하기 위해 물리 원리와 국소 학습 규칙에 뿌리를 둔 통합 수학적 프레임워크를 제안한다.

제안 방법

  • 각 매개변수에서만 가용한 국소 정보를 사용하여 손실 기울기를 계산하는 기울기 추정 방법인 평형 전파(EqProp)를 제안한다.
  • 에너지 기반 모델(에너지 함수 최소화)과 작용 기반 모델(작용 함수 최소화)으로 기술되는 변분 원리에 따라 제어되는 시스템에 이 프레임워크를 적용한다.
  • 시스템의 평형 상태에 대한 미소 변화를 기반으로 일반적인 기울기 공식을 유도하여, 전역적인 역전파 없이도 역전파 유사 오차 신호 전파를 가능하게 한다.
  • 연속 시간 동적 시스템, 예를 들어 기울기 시스템과 순환 네트워크에 대해 평형 상태 주변의 일시적 동역학을 분석함으로써 EqProp가 적용 가능함을 보여준다.
  • 라운지엔 동역학을 사용하여 확률적 시스템으로 이 프레임워크를 확장함으로써 노이즈가 있는 물리 시스템에서의 학습을 가능하게 한다.
  • 비선형 저항성 네트워크와 연속형 호프필드 네트워크와 같은 물리 기반 기초 시설에서 방법을 검증하여 아날로그 및 뉴모르픽 하드웨어와의 호환성을 입증한다.

실험 결과

연구 질문

  • RQ1에너지 최소화 또는 최소 작용 원리와 같은 변분 원리에 따라 제어되는 물리 시스템과 호환되는 학습 규칙을 유도할 수 있는가?
  • RQ2각 매개변수에서만 가용한 국소 정보를 사용하여 기울기를 추정할 수 있는가? 이는 뉴모르픽 하드웨어에서의 효율적 학습을 가능하게 한다.
  • RQ3평형 전파가 연속형 호프필드 네트워크나 저항성 네트워크와 같은 모델에서 역전파와 유사한 성능을 달성할 수 있는가?
  • RQ4평형 전파가 대trastive 허브시안 학습이나 순환 역전파와 같은 기존 학습 규칙과 어떻게 관련이 있는가?
  • RQ5이 프레임워크를 확률적 시스템과 시간에 따라 변화하는 입력에까지 확장할 수 있는가? 이는 물리적 및 신경 동역학에 대한 더 넓은 적용 가능성을 제공한다.

주요 결과

  • 평형 전파를 통해 연속형 호프필드 네트워크를 MNIST에서 엔드 투 엔드로 학습시켰으며, 테스트 정확도가 97.5%에 도달하여 역전파 기반 학습과 유사한 성능을 보였다.
  • EqProp를 통해 학습된 비선형 저항성 네트워크는 MNIST에서 95.2%의 정확도, CIFAR-10에서는 78.1%의 정확도를 기록하여 깊은 아날로그 아키텍처에서의 실현 가능성을 입증했다.
  • 기울기 시스템에서 순환 역전파의 역학을 성공적으로 복원하여, EqProp가 기존 학습 철학과 일관성을 유지함을 검증했다.
  • EqProp는 오직 국소 정보에 의존하는 수학적으로 엄밀한 기울기 추정기로서, 뉴모르픽 하드웨어에서의 물리적 구현에 적합하다.
  • 라운지엔 동역학을 통해 이 프레임워크를 확률적 시스템으로 일반화하여 노이즈가 있는 물리적 기초 시설에서의 학습을 가능하게 했다.
  • 이론적 분석을 통해 EqProp가 최소 작용 원리와 에너지 최소화 원리와 일관됨을 확인하였으며, 이는 딥 러닝을 기본 물리 법칙에 기반시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.