Skip to main content
QUICK REVIEW

[논문 리뷰] Never look back - A modified EnKF method and its application to the training of neural networks without back propagation

Eldad Haber, Felix Lucka|arXiv (Cornell University)|2018. 05. 21.
Model Reduction and Neural Networks참고 문헌 19인용 수 15
한 줄 요약

이 논문은 역전파 없이 딥 뉴럴 네트워크를 유도하지 않는 파생도구가 없는 훈련을 가능하게 하는 수정된 엔semble 칼만 필터(EnKF) 방법을 제안한다. 이 방법은 전방 전파 평가와 무작위 표본을 통한 자코비안 근사치를 활용한다. 강凸 문제에 대해 부분선형 수렴성을 증명하였으며, MNIST에서 ADAM보다 더 빠른 수렴 속도를 보이며, 더 적은 전방 전파 횟수와 낮은 메모리 사용량을 기록한다.

ABSTRACT

In this work, we present a new derivative-free optimization method and investigate its use for training neural networks. Our method is motivated by the Ensemble Kalman Filter (EnKF), which has been used successfully for solving optimization problems that involve large-scale, highly nonlinear dynamical systems. A key benefit of the EnKF method is that it requires only the evaluation of the forward propagation but not its derivatives. Hence, in the context of neural networks, it alleviates the need for back propagation and reduces the memory consumption dramatically. However, the method is not a pure "black-box" global optimization heuristic as it efficiently utilizes the structure of typical learning problems. Promising first results of the EnKF for training deep neural networks have been presented recently by Kovachki and Stuart. We propose an important modification of the EnKF that enables us to prove convergence of our method to the minimizer of a strongly convex function. Our method also bears similarity with implicit filtering and we demonstrate its potential for minimizing highly oscillatory functions using a simple example. Further, we provide numerical examples that demonstrate the potential of our method for training deep neural networks.

연구 동기 및 목표

  • 역전파를 피하고 메모리 소비를 줄이는 파생도구가 없는 최적화 방법을 개발하여 신경망을 훈련시키는 것.
  • 강凸 함수에 대해 전역 최소값으로 수렴하는 것을 증명함으로써 기존 EnKF 기반 방법을 향상시키는 것.
  • 대규모 신경망 훈련을 위한 고성능 컴퓨팅 환경에서 효율적인 병렬 처리와 확장성을 제공하는 것.
  • MNIST 분류와 같은 비凸 깊이 학습 문제에서 방법의 효과성을 입증하는 것.
  • 매끄러움 효과를 통해 진동하거나 매우 비선형적인 목적 함수를 다룰 수 있는 능력을 탐색하는 것.

제안 방법

  • 방법은 전방 전파 평가를 사용하여 변동성 감소된 무작위 자코비안 근사치를 도입함으로써 EnKF를 수정한다.
  • 현재 반복값 주변의 무작위 표본을 사용한 입자에서의 전방 전파 출력만을 사용하여 전방 연산자의 자코비안을 추정하며, 명시적 기울기 계산을 피한다.
  • 변수 투영 전략을 사용하여 고정된 θ에 대해 최종 레이어 가중치(W)를 뉴턴 방법으로 정확히 해결함으로써 차원을 줄이고 효율성을 향상시킨다.
  • 부정확한 뉴턴 방법과 공액 기울기 방법을 사용하여 W에 대한 하위 문제를 효율적으로 해결하며, 각 단계에서 제한된 반복 횟수를 사용한다.
  • 전방 전파만을 사용하고 역전파를 사용하지 않는 방식으로, 파rameter θ에 대한 선형 검색과 반복 업데이트를 구현한다.
  • 낮은 차원의 부분공간 근사치를 활용하여 수렴성을 향상시키며, 암묵적 필터링과 유사하지만 무작위로 파생도구가 없는 방식으로 적용한다.

실험 결과

연구 질문

  • RQ1수정된 EnKF 방법이 기울기를 사용하지 않고 강凸 함수의 전역 최소값으로 수렴할 수 있는가?
  • RQ2제안된 파생도구가 없는 방법이 딥 뉴럴 네트워크의 수렴 속도와 메모리 효율성 측면에서 확률적 경사 하강법(SGD)과 비교해 어떻게 성능을 내는가?
  • RQ3이 방법은 딥 러닝에서 흔한 비凸, 고주파 진동 손실 곡면을 효과적으로 다룰 수 있는가?
  • RQ4역전파가 없는 것이 더 깊거나 더 큰 네트워크의 훈련을 더 낮은 메모리 오버헤드로 가능하게 하는가?
  • RQ5이 방법의 내재된 매끄러움 특성이 고주파 진동을 포함한 손실 함수에서 최적화 성능을 얼마나 향상시키는가?

주요 결과

  • 제안된 방법은 강凸 함수의 전역 최소값으로 부분선형 속도로 수렴하며, 이는 이전 EnKF 변형이 낮은 차원 부분공간에서 투영된 해로만 수렴하는 것과 대비된다.
  • MNIST 데이터셋에서, 이 방법은 ADAM보다 더 빠른 수렴 속도를 기록하여 테스트 정확도 98.38%를 달성했으며, 훈련 완료 시간은 238.5초로 ADAM의 1,751초보다 훨씬 빠르게 이루어졌다.
  • 약 50,000개의 가중치를 최적화하기 위해 단지 4개의 입자만을 사용하여 높은 샘플 효율성과 확장성을 입증했다.
  • ADAM보다 약간 낮은 일반화 성능(99.12% 대 98.38% 테스트 정확도)을 보였지만, 훨씬 적은 전방 전파 횟수로 더 낮은 손실 값을 달성했다.
  • 이 방법은 진동하는 목적 함수에 대해 매끄러움 효과를 보이며, 비凸, 고주파 곡면에서의 강건성을 시사한다.
  • 알고리즘이 매우 병렬화 가능하며, 역전파를 피하기 때문에 깊은 네트워크의 훈련 시 메모리 제약 없이 수행할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.