Skip to main content
QUICK REVIEW

[논문 리뷰] Stochastic natural gradient descent draws posterior samples in function space

Samuel Smith, Daniel Duckworth|arXiv (Cornell University)|2018. 06. 25.
Machine Learning and Algorithms인용 수 4
한 줄 요약

이 논문은 모델 예측이 진짜 조건부 분포에 수렴할 때, 미니배치 자연 경사 하강법(NGD)이 기능 공간에서 베이지안 사후분포로부터 渐近적으로 표본을 추출함을 증명한다. 이때 온도는 $ T \approx \epsilon N / (2B) $이다. 또한, 제프레즈 사전을 통합하여 매개변수화에 대한 의존성을 보정함으로써 전체 매개변수 공간에서 유효한 사후 표본 추출을 보장하는 새로운 최적화기인 확률적 NGD를 제안한다.

ABSTRACT

Recent work has argued that stochastic gradient descent can approximate the Bayesian uncertainty in model parameters near local minima. In this work we develop a similar correspondence for minibatch natural gradient descent (NGD). We prove that for sufficiently small learning rates, if the model predictions on the training set approach the true conditional distribution of labels given inputs, the stationary distribution of minibatch NGD approaches a Bayesian posterior near local minima. The temperature $T = \\epsilon N / (2B)$ is controlled by the learning rate $\\epsilon$, training set size $N$ and batch size $B$. However minibatch NGD is not parameterisation invariant and it does not sample a valid posterior away from local minima. We therefore propose a novel optimiser, "stochastic NGD", which introduces the additional correction terms required to preserve both properties.

연구 동기 및 목표

  • 미니배치 자연 경사 하강법과 기능 공간에서의 베이지안 사후 표본 추출 간 이론적 대응 관계를 확립하기 위해.
  • NGD의 정적 분포가 국소 최소점 근처에서 베이지안 사후분포에 근사하는 조건을 규명하기 위해.
  • 기존의 미니배치 NGD에서 매개변수화 불변성의 결여를 해결하기 위해 수정된 업데이트 규칙을 유도하기 위해.
  • 매개변수화 불변성과 유효한 사후 표본 추출을 모두 유지하는 새로운 최적화기인 확률적 NGD를 제안하고 검증하기 위해.
  • NGD의 최적 일반화가 $ B \approx \epsilon N / 2 $에서 발생함을 경험적으로 검증하기 위해.

제안 방법

  • 모델 예측이 진짜 조건부 분포에 수렴할 때, $ \epsilon \to 0 $ 근처에서 미니배치 NGD의 정적 분포를 유도하여, 이가 온도 $ T = \epsilon N / (2B) $에서 베이지안 사후분포로 수렴함을 보였다.
  • 표준 미니배치 NGD가 피셔 정보 행렬의 매개변수 의존성으로 인해 매개변수화 불변성이 결여되어 있음을 규명하였다.
  • 매개변수화 불변성을 복원하기 위해 피셔 정보 행렬의 도함수로부터 유도된 보정 항을 추가한 확률적 NGD(SNGD)를 제안하였다.
  • 제프레즈 사전에 해당하는 곱셈형 편향 항을 도입하여, 매개변수 공간 전역에서 정적 분포가 유효한 사후분포로 유지되도록 보장하였다.
  • 학습 중 분산을 줄이기 위해 피셔 정보의 이동 평균과 적응형 스무딩을 사용하였다.
  • 최종 기울기 업데이트에 대한 앙상블을 활용하여 사후 예측 분포를 추정하고 일반화 성능을 평가하였다.

실험 결과

연구 질문

  • RQ1미니배치 NGD가 기능 공간에서 베이지안 사후분포로부터 渐近적으로 표본을 추출하는 조건은 무엇인가?
  • RQ2온도 $ T \approx \epsilon N / (2B) $가 NGD의 정적 분포를 어떻게 조절하는가?
  • RQ3표준 미니배치 NGD가 왜 매개변수화 불변성이 없으며, 이를 어떻게 보완할 수 있는가?
  • RQ4수정된 NGD 업데이트 규칙이 확률적 기울기 하에서 매개변수화 불변성과 유효한 사후 표본 추출을 모두 유지할 수 있는가?
  • RQ5NGD의 최적 배치 크기 일반화가 $ B \approx \epsilon N / 2 $에서 베이지안 예측과 일치하는가?

주요 결과

  • 모델 예측 $ f_{\omega}(x_i) \to P(Y|x_i) $일 때, 국소 최소점 근처에서 미니배치 NGD의 정적 분포는 온도 $ T \approx \epsilon N / (2B) $에서 베이지안 사후분포로 수렴한다.
  • 경험 결과, NGD 앙상블의 테스트 교차 엔트로피는 $ B \approx \epsilon N / 2 $일 때 최소가 되며, 이는 예측된 최적 비율과 일치함을 확인하였다.
  • N=4096일 때, 최소 테스트 교차 엔트로피는 $ B=256 $에서 발생하였으며, 이는 $ B \propto N $ 방향의 베이지안 예측과 일치한다.
  • N이 16384로 증가함에 따라, 테스트 교차 엔트로피의 최소점이 더 평탄해졌으며, 이는 이론적 예측과 일치한다.
  • MNIST에 대한 CNN 실험에서, 온도 T가 일정할 때 테스트 교차 엔트로피는 학습률에 거의 영향을 받지 않았으며, 이는 선형 스케일링 법칙 $ B \propto \epsilon $을 확인한다.
  • 온도 $ T \gtrsim 1 $이 초과되면 테스트 교차 엔트로피가 급격히 증가하여 일반화 성능이 악화됨을 확인하였으며, 이는 베이지안 이론과 일치한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.