Skip to main content
QUICK REVIEW

[논문 리뷰] True Asymptotic Natural Gradient Optimization

Yann Ollivier|arXiv (Cornell University)|2017. 12. 22.
Stochastic Gradient Optimization Techniques참고 문헌 12인용 수 7
한 줄 요약

이 논문은 Fisher 정보 매트릭스를 명시적으로 계산하거나 역행렬을 구하지 않고도 정확한 자연 경사 하강법에 점점 수렴하는 경량 최적화 알고리즘인 TANGO를 제안한다. 작은 학습률의 극한에서 모델 예측에서 유도된 가짜 샘플을 사용하는 모멘텀 유사 업데이트를 통해 TANGO는 자연 경사 흐름을 암묵적으로 근사하며, 파rameterization에 대한 불변성과 비제곱 및 제곱 모델 모두에서 최적의 점근적 수렴성을 달성한다.

ABSTRACT

We introduce a simple algorithm, True Asymptotic Natural Gradient Optimization (TANGO), that converges to a true natural gradient descent in the limit of small learning rates, without explicit Fisher matrix estimation. For quadratic models the algorithm is also an instance of averaged stochastic gradient, where the parameter is a moving average of a "fast", constant-rate gradient descent. TANGO appears as a particular de-linearization of averaged SGD, and is sometimes quite different on non-quadratic models. This further connects averaged SGD and natural gradient, both of which are arguably optimal asymptotically. In large dimension, small learning rates will be required to approximate the natural gradient well. Still, this shows it is possible to get arbitrarily close to exact natural gradient descent with a lightweight algorithm.

연구 동기 및 목표

  • Fisher 매트릭스 추정의 계산 비용 없이 점점 자연 경사 하강법의 성능을 달성하는 실용적인 최적화 알고리즘을 개발하는 것.
  • 제곱 모델의 경우 평균화된 확률적 경사 하강법과 자연 경사 하강법이 동치임을 보여주고, 비제곱 모델의 경우 부드러운 보간을 통해 이론적 격차를 메우는 것.
  • 단순한 일阶 도함수와 간단한 업데이트를 사용하면서도 자연 경사의 핵심 성질인 파rameterization에 대한 불변성을 유지하는 방법을 제공하는 것.
  • 약한 정규성 조건 하에 학습률이 점점 줄어들 때 진정한 자연 경사 궤적으로의 이론적 수렴을 확립하는 것.

제안 방법

  • TANGO는 실제 및 가짜 샘플 데이터 포인트의 기울기를 포함하는 모멘텀 유사 반복을 통해 업데이트되는 속도 변수 $v_k$를 사용한다.
  • 알고리즘은 $\tilde{y}_k \sim p_\theta(\cdot|x_k)$로부터 가짜 출력을 생성하고, 기울기 $g_k = \partial \ell(y_k|x_k)/\partial\theta$ 및 $\tilde{g}_k = \partial \ell(\tilde{y}_k|x_k)/\partial\theta$를 계산한다.
  • 속도 업데이트 $v_k = (1 - \delta t_{k-1})v_{k-1} + \gamma g_k - \gamma(1 - \delta t_{k-1})(v_{k-1}^\top \tilde{g}_k)\tilde{g}_k$는 스트로스틱 추정을 통해 Fisher 매트릭스를 암묵적으로 역행렬화한다.
  • 파라미터 업데이트는 $\theta_k = \theta_{k-1} - \delta t_k v_k$이며, $\delta t_k$는 작은 학습률로, 자연 경사 방향으로의 수렴을 보장한다.
  • 제곱 손실의 경우, TANGO는 특정 노이즈 모델을 가진 평균화된 확률적 경사 하강법과 수학적으로 동치이며, 알려진 최적 방법과 연결된다.
  • 학습률 $\gamma$가 $\gamma \leq \mathbb{E}[\|\tilde{g}\|^2] / \mathbb{E}[\|\tilde{g}\|^4]$를 만족하도록 선택될 경우 알고리즘이 안정해지며, 경험적 모멘트 추정치를 기반으로 한 더 안전한 선택도 가능하다.

실험 결과

연구 질문

  • RQ1명시적인 Fisher 매트릭스 계산 없이도 간단하고 가벼운 알고리즘이 자연 경사 하강법을 근사할 수 있는가?
  • RQ2제곱 모델의 경우 TANGO는 평균화된 확률적 경사 하강법과 어떻게 관련이 있는가?
  • RQ3학습률이 0으로 수렴할 때 TANGO는 진정한 자연 경사 궤적으로 수렴하는가?
  • RQ4가짜 샘플링은 어떻게 암묵적인 Fisher 매트릭스 역행렬화를 가능하게 하는가?
  • RQ5TANGO는 명시적인 헤시안 또는 Fisher 매트릭스 계산 없이도 파rameterization에 대한 불변성을 유지할 수 있는가?

주요 결과

  • 정리 3에 의해 증명된 lin, $\delta t \to 0$일 때 TANGO는 학습률이 점점 줄어들고 $\gamma$가 고정된 상태에서 정확한 자연 경사 궤적으로 수렴한다.
  • 학습률 $\delta t = 1$일 때 TANGO는 일정한 학습률 $\gamma$를 가진 표준 경사 하강법으로 줄어들며, 이는 표준 및 자연 경사 하강법 사이를 보간함을 보여준다.
  • 제곱 모델의 경우 TANGO는 평균화된 확률적 경사 하강법과 동치이며, $\theta_k$는 $v_k$에 대한 빠른 경사 하강법의 이동 평균이다.
  • TANGO의 속도 업데이트는 Fisher 매트릭스 $J = \mathbb{E}[\tilde{g} \tilde{g}^\top]$를 갖는 선형 시스템 $J v = \mathbb{E}[g]$를 $v$에 대한 스트로스틱 경사 하강법으로 해결한다.
  • TANGO는 명시적인 Fisher 매트릭스 계산 없이도 파rameterization에 대한 불변성을 달성한다.
  • 학습률 $\gamma$가 $\mathbb{E}[\|\tilde{g}\|^2] / \mathbb{E}[\|\tilde{g}\|^4]$로 제한될 경우 이론적 안정성이 확보되며, 경험적 모멘트 추정치를 기반으로 한 더 안전한 선택도 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.