Skip to main content
QUICK REVIEW

[논문 리뷰] Inexact Newton Methods for Stochastic Nonconvex Optimization with Applications to Neural Network Training

Thomas O’Leary-Roseberry, Nick Alger|arXiv (Cornell University)|2019. 05. 16.
Stochastic Gradient Optimization Techniques참고 문헌 42인용 수 12
한 줄 요약

이 논문은 딥러닝에서 비볼록 최적화를 위한 확률적 비정확 뉴턴 방법을 제안하며, 부분 샘플링된 헤시안과 기울기 근사값을 사용하고 카르마르-크릴로프 해법기를 결합하여 뉴턴 시스템을 효율적으로 해결한다. 이 방법들이 MNIST 및 CIFAR10 오토에인코더 학습에서 일阶 방법인 Adam보다 빠르게 수렴하고 일반화 성능이 뛰어나며, 특히 헤시안 스펙트럼 군집화가 존재할 경우에 우수한 성능을 보임을 입증한다.

ABSTRACT

We study stochastic inexact Newton methods and consider their application in nonconvex settings. Building on the work of [R. Bollapragada, R. H. Byrd, and J. Nocedal, IMA Journal of Numerical Analysis, 39 (2018), pp. 545--578] we derive bounds for convergence rates in expected value for stochastic low rank Newton methods, and stochastic inexact Newton Krylov methods. These bounds quantify the errors incurred in subsampling the Hessian and gradient, as well as in approximating the Newton linear solve, and in choosing regularization and step length parameters. We deploy these methods in training convolutional autoencoders for the MNIST and CIFAR10 data sets. Numerical results demonstrate that, relative to first order methods, these stochastic inexact Newton methods often converge faster, are more cost-effective, and generalize better.

연구 동기 및 목표

  • 딥러닝에서 발생하는 대규모 비볼록 문제를 위한 효율적인 이阶 최적화 방법을 개발하는 것.
  • 부분 샘플링과 비정확 해법을 고려할 때, 확률적 비정확 뉴턴 방법의 수렴 속도를 분석하는 것.
  • 수렴 속도, 일반화 능력, 내구성 측면에서 신경망 학습에 대한 이러한 방법의 성능을 평가하는 것.
  • 헤시안 배치 크기와 스펙트럼 군집화가 최적화 성능에 미치는 영향을 조사하는 것.

제안 방법

  • 논문은 뉴턴 유형 방법의 계산 비용을 줄이기 위해 확률적 저랭크 헤시안 근사값을 사용한다.
  • 헤시안을 명시적으로 구성하지 않고도 뉴턴 시스템을 해결하기 위해 비정확한 카르마르 부분공간 방법(GMRES, MINRES)을 사용한다.
  • 비볼록 환경에서 내림내림과 안정성을 확보하기 위해 정규화 및 선 탐색 전략을 통합한다.
  • 첨도 방법을 통해 부분 샘플링된 기울기와 헤시안-벡터 곱을 결합하여 반복마다 $O(dN_X)$ 복잡도를 유지한다.
  • 부정의 곡률 방향을 이용해 안정점에서 벗어나기 위해 안정점 자유 뉴턴(SFN) 변종을 사용한다.
  • 이 방법은 텐서플로우를 사용한 파이썬 라이브러리로 구현되어 있어 스케일러블한 이계 최적화를 가능하게 한다.

실험 결과

연구 질문

  • RQ1기울기와 헤시안 추정치의 부분 샘플링 오차가 확률적 비정확 뉴턴 방법의 수렴에 어떤 영향을 미치는가?
  • RQ2비볼록 문제에서 헤시안-벡터 곱의 수를 제한할 때 비정확한 카르마르 해법기가 뉴턴 스텝을 효과적으로 근사할 수 있는가?
  • RQ3헤시안의 스펙트럼 군집화가 딥러닝에서 비정확 뉴턴 방법의 성능에 어떤 영향을 미치는가?
  • RQ4확률적 비정확 뉴턴 방법이 이미지 복원 작업에서 Adam 및 SGD와 같은 일계 방법보다 더 잘 일반화되는가?
  • RQ5빠른 수렴과 양호한 일반화를 달성하기 위해 헤시안 배치 크기와 계산 비용 사이의 최적 균형은 무엇인가?

주요 결과

  • 비정확 뉴턴-카르마르 해법기(INGMRES, INMINRES)는 CIFAR10에서 가장 뛰어난 일반화 성능을 보였으며, Adam과 SGD를 모두 능가하는 테스트 손실을 기록했다.
  • 고정된 스텝 길이 조건에서 완전히 확률적인 LRSFN 방법은 CIFAR10에서 가장 낮은 훈련 오차를 기록했지만, 카르마르 기반 변종보다 과적합이 더 심했다.
  • MNIST에서는 INCG 및 INGMRES 방법이 기울기 하강법과 Adam보다 더 빠르게 수렴했고, 더 낮은 테스트 오차를 달성했다.
  • 헤시안 배치 크기가 성능에 크게 영향을 미쳤다: 너무 적은 정보는 과적합을 유도했고, 너무 많은 정보는 계산 부담을 증가시켰다.
  • 실험에서 헤시안의 스펙트럼 군집화가 관찰되었으며, 이는 카르마르 기반 방법이 이러한 구조를 활용함으로써 뛰어난 성능을 내는 이유를 설명한다.
  • 선 탐색 하에서 LRSFN은 스텝 길이 선택에 민감하여 성능이 열악했지만, 고정된 스텝 길이를 사용한 반확률적 변종은 안정성과 성능이 향상된 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.