Skip to main content
QUICK REVIEW

[논문 리뷰] Taming neural networks with TUSLA: Non-convex learning via adaptive stochastic gradient Langevin algorithms

Attila Lovas, Iosif Lytras|arXiv (Cornell University)|2020. 06. 25.
Stochastic Gradient Optimization Techniques인용 수 5
한 줄 요약

이 논문은 깊이 있는 신경망에서 비볼록 학습을 위한 새로운 적응형 확률적 경량 미분 랑주비안 알고리즘인 TUSLA(Tamed Unadjusted Stochastic Langevin Algorithm)를 소개한다. SGLD에 테이밍 기법을 결합함으로써 TUSLA는 기울기가 초선형적으로 증가하는 경우에도 안정성과 수렴성을 보장하며, 고차원 비볼록 설정에서 경험 위험과 인구 위험을 최소화하기 위한 유한 시간 보장을 제공한다.

ABSTRACT

Artificial neural networks (ANNs) are typically highly nonlinear systems which are finely tuned via the optimization of their associated, non-convex loss functions. In many cases, the gradient of any such loss function has superlinear growth, making the use of the widely-accepted (stochastic) gradient descent methods, which are based on Euler numerical schemes, problematic. We offer a new learning algorithm based on an appropriately constructed variant of the popular stochastic gradient Langevin dynamics (SGLD), which is called tamed unadjusted stochastic Langevin algorithm (TUSLA). We also provide a nonasymptotic analysis of the new algorithm's convergence properties in the context of non-convex learning problems with the use of ANNs. Thus, we provide finite-time guarantees for TUSLA to find approximate minimizers of both empirical and population risks. The roots of the TUSLA algorithm are based on the taming technology for diffusion processes with superlinear coefficients as developed in \citet{tamed-euler, SabanisAoAP} and for MCMC algorithms in \citet{tula}. Numerical experiments are presented which confirm the theoretical findings and illustrate the need for the use of the new algorithm in comparison to vanilla SGLD within the framework of ANNs.

연구 동기 및 목표

  • 기울기가 초선형적으로 증가하여 전통적인 확률적 경량 미분(Stochastic Gradient Descent, SGD)과 SGLD가 불안정해지는 깊이 있는 신경망에서의 문제를 해결하기 위해.
  • 비볼록이고 고차원적인 손실 표면에서 비소산성 및 전역 리프시츠 연속성의 부재로 인해 고전적인 오일러 기반 방법이 실패하는 문제를 극복하기 위해.
  • 경험 위험과 인구 위험의 근사 최소화점으로의 유한 시간 수렴을 보장하는 안정적이고 적응적인 알고리즘을 개발하기 위해.
  • 원래 SDE와 MCMC에 사용된 테이밍 기법을 비볼록 최적화를 위한 확률적 경량 랑주비안 역학으로 확장하기 위해.
  • 국소 리프시츠 조건과 초선형 기울기 성장 조건 하에서 비점근적 수렴 분석을 제공하고, 명시적인 유한 시간 경계를 도출하기 위해.

제안 방법

  • 고차원 비볼록 설정에서 기울기의 폭발적 성장을 제어하기 위해 기울기 이동 항에 테이밍을 적용한 SGLD의 변종인 TUSLA를 제안한다.
  • 랑주비안 SDE에 대한 테이밍된 오일러 이산화를 도입하여 표준 기울기를 테이밍된 형태로 대체함으로써 모멘트 안정성과 유한 시간 수렴을 보장한다.
  • 기울기가 초선형적으로 증가할 경우에도 발산을 방지하기 위해 고차원 정규화와 적응형 스텝 사이즈 제어를 활용하여 안정성을 유지한다.
  • Eberle 등(2019a)의 모멘트 추정과 수축 추론을 이용하여 워샤르슈타인-1 및 워샤르슈타인-2 거리에서 비점근적 수렴 경계를 유도한다.
  • 진짜 기울기 $ \nabla u(\theta) $ 와 일치하는 불편한 확률적 기울기 추정자 $ H(\theta, X_n) $ 를 사용하여 일관성을 확보한다.
  • 수렴 상수에 영향을 주는 핵심 매개변수 $ \beta $, $ \eta $, $ d $, $ \lambda $ 의 영향을 분석하여, $ d/\beta $ 와 $ 1/\eta $ 가 불안정성을 감소시킨다는 것을 보여준다.

실험 결과

연구 질문

  • RQ1기울기가 초선형적으로 증가하고 전역 리프시츠 조건을 위반하는 깊이 있는 신경망에서 테이밍 기법이 SGLD의 안정성을 확보할 수 있는가?
  • RQ2국소 리프시츠 연속성과 초선형 기울기 성장 조건 하에서 SGLD 변종에 대해 어떤 유한 시간 수렴 보장을 확보할 수 있는가?
  • RQ3차원 $ d $, 온도 $ \beta $, 정규화 $ \eta $ 간의 상호작용이 알고리즘의 안정성과 수렴성에 어떤 영향을 미치는가?
  • RQ4이론적 복잡성에 비해 실질적으로 보편적인 SGLD보다 TUSLA 알고리즘이 성능을 뛰어넘을 수 있는가?
  • RQ5수렴 경계의 이론적 상수들이 문제 특성에 따라 결정되는 매개변수들, 즉 $ d $, $ \beta $, $ \eta $ 에 얼마나 의존하는가?

주요 결과

  • TUSLA는 비볼록 설정에서 경험 위험과 인구 위험을 최소화하기 위해 워샤르슈타인-1 및 워샤르슈타인-2 거리에서 비점근적 유한 시간 수렴 보장을 제공한다.
  • 기울기가 초선형적으로 증가하는 경우에도 안정성과 모멘트 제어를 보장하여, 이러한 영역에서 표준 SGLD가 겪는 발산 문제를 해결한다.
  • 수렴 상수 $ z_1 $ 과 $ z_2 $ 는 주로 Eberle 등(2019a)의 수축 추정에서 유래한 $ \hat{c} $ 로 인해 차원 $ d $ 에 대해 지수적 의존성을 보이지만, $ \beta $ 를 증가시킴으로써 이 의존성을 완화할 수 있다.
  • $ C'_p $, $ \dot{c} $, $ \hat{c} $ 는 $ d/\beta $ 와 $ 1/\eta $ 에 따라 달라지며, 이는 더 높은 $ \beta $ 또는 강한 정규화 $ \eta $ 가 불안정성을 감소시킬 수 있음을 시사한다.
  • 수치 실험 결과 실제 상수는 이론적 추정보다 훨씬 낮게 나타나 TUSLA가 실세계 신경망 훈련에 대해 안정적이고 실용적임을 확인한다.
  • 기울기 성장률이 오일러 스킴의 표준 가정을 위반하는 경우에도 TUSLA는 보편적인 SGLD보다 더 뛰어난 안정성을 확보한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.