Skip to main content
QUICK REVIEW

[논문 리뷰] Updates of Equilibrium Prop Match Gradients of Backprop Through Time in an RNN with Static Input

Maxence Ernoult, Julie Grollier|arXiv (Cornell University)|2019. 05. 31.
Neural Networks and Applications인용 수 8
한 줄 요약

이 논문은 RNN의 전이 함수가 원시 함수에서 유도되고 평정상태가 유지되는 특정 조건 하에서, Backpropagation Through Time (BPTT)와 정확한 기울기 일치를 달성하는 등급 시간 공식화된 평형 전파(Equilibrium Propagation, EP)를 제안한다. EP는 완전히 연결된 네트워크와 컨볼루션 네트워크를 학습시키며 BPTT와 비교할 만한 성능을 보이며, MNIST에서 약 1%의 테스트 오차를 달성하여 지금까지 보고된 바 중 EP를 사용한 최저 수준이다.

ABSTRACT

Equilibrium Propagation (EP) is a biologically inspired learning algorithm for convergent recurrent neural networks, i.e. RNNs that are fed by a static input x and settle to a steady state. Training convergent RNNs consists in adjusting the weights until the steady state of output neurons coincides with a target y. Convergent RNNs can also be trained with the more conventional Backpropagation Through Time (BPTT) algorithm. In its original formulation EP was described in the case of real-time neuronal dynamics, which is computationally costly. In this work, we introduce a discrete-time version of EP with simplified equations and with reduced simulation time, bringing EP closer to practical machine learning tasks. We first prove theoretically, as well as numerically that the neural and weight updates of EP, computed by forward-time dynamics, are step-by-step equal to the ones obtained by BPTT, with gradients computed backward in time. The equality is strict when the transition function of the dynamics derives from a primitive function and the steady state is maintained long enough. We then show for more standard discrete-time neural network dynamics that the same property is approximately respected and we subsequently demonstrate training with EP with equivalent performance to BPTT. In particular, we define the first convolutional architecture trained with EP achieving ~ 1% test error on MNIST, which is the lowest error reported with EP. These results can guide the development of deep neural networks trained with EP.

연구 동기 및 목표

  • 실용적인 기계 학습을 위한 계산 효율성이 높은 이산 시간 평형 전파(EP) 버전을 개발하기.
  • RNN 전이 함수가 원시 함수에서 유도되고 평정상태가 오랫동안 유지될 경우, EP 업데이트가 BPTT 기울기와 정확히 일치함을 이론적으로 및 수치적으로 증명하기.
  • 완전히 연결된 네트워크와 컨볼루션 네트워크를 포함한 표준 신경망 아키텍처로 EP를 확장하여 BPTT와 비교할 만한 성능을 달성하기.
  • 실시간 EP 대비 3~5배의 시뮬레이션 시간 단축을 통해 EP의 시뮬레이션 시간을 크게 줄이기.
  • EP를 사용하여 MNIST에서 지금까지 보고된 바 중 가장 낮은 테스트 오차를 달성하여, 깊은 학습 잠재력 검증하기.

제안 방법

  • 연속 시간 역학을 이산 시간 반복 업데이트 규칙으로 대체하는 EP의 이산 시간 공식화를 제안한다.
  • 두 단계 과정을 도입: 첫 번째 단계는 입력 x 하에서 평정상 활성화를 계산하고, 두 번째 단계는 기울기 유사 업데이트를 위한 외부 힘(탄성력)을 도입하여 가중치 업데이트를 계산한다.
  • EP의 가중치 업데이트를 수정된 에너지 함수의 기울기 차이로 유도하며, 이는 BPTT의 역전파 기울기와 유사하다.
  • GDU(Gradient-Descending Updates) 조건 하에서 EP의 정방향 시간 신경 업데이트와 BPTT의 역방향 시간 기울기 사이에 단계별 대응 관계를 수립한다.
  • 전이 함수가 GDU 성질을 만족하도록 원시 함수를 활용하여 정확한 기울기 일치를 가능하게 한다.
  • 에너지 기반 및 프로토타입 설정을 통해 안정화된 학습을 보장하며, 표준 활성화 함수와 하이퍼파라미터를 사용해 완전히 연결된 네트워크와 컨볼루션 아키텍처에 적용한다.

실험 결과

연구 질문

  • RQ1평형 전파가 Backpropagation Through Time의 가중치 업데이트와 정확히 일치하는 조건은 무엇인가?
  • RQ2EP의 이산 시간 공식화가 이론적·실제로 BPTT 기울기를 정확히 따라잡을 수 있는가?
  • RQ3표준 비이상적인 신경망 동역학에서 GDU 성질은 어느 정도 유지되는가?
  • RQ4EP는 깊고 컨볼루션 신경망을 BPTT와 비교할 만한 성능으로 성공적으로 학습시킬 수 있는가?
  • RQ5학습 정확도를 손상시키지 않고 EP의 시뮬레이션 시간을 크게 줄일 수 있는가?

주요 결과

  • 이론적 분석을 통해 RNN 전이 함수가 원시 함수에서 유도되고 평정상태가 충분히 오래 유지될 경우, EP 업데이트가 BPTT 기울기와 정확히 일치함을 증명한다.
  • 수치 실험을 통해 이상화된 설정에서는 GDU 성질이 정확히 유지되고, 표준 프로토타입 네트워크에서는 근사적으로 유지됨을 확인한다.
  • 이산 시간 EP 공식화는 실시간 EP 대비 3~5배의 시뮬레이션 시간 단축을 이룩하여 더 큰 규모의 학습을 가능하게 한다.
  • EP는 MNIST에서 컨볼루션 신경망을 성공적으로 학습시켜 약 1%의 테스트 오차를 달성하였으며, 지금까지 보고된 바 중 EP를 사용한 최저 수준이다.
  • 에너지 기반 및 프로토타입 설정 모두에서, 하나에서 세 개의 은닉층을 가진 완전히 연결된 아키텍처에서 EP 학습이 BPTT 성능과 비교할 만큼 유사한 성능을 보였다.
  • 이 방법은 EP가 표준 딥 러닝 아키텍처로 확장 가능하며, 백프로파게이션의 생물학적으로 타당하고 에너지 효율적인 대안을 제공할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.