Skip to main content
QUICK REVIEW

[논문 리뷰] Quasi-Monte Carlo Variational Inference

Alexander Buchholz, Florian Wenzel|arXiv (Cornell University)|2018. 07. 04.
Gaussian Processes and Bayesian Inference참고 문헌 7인용 수 13
한 줄 요약

이 논문은 몬테카를로 변분 추론(MCVI)에서 i.i.d. 몬테카를로 샘플 대신 저이분산성(Quasi-Monte Carlo, QMC) 수열을 사용하여 확률적 최적화에서 기울기 분산을 줄이는 Quasi-Monte Carlo 변분 추론(QMCVI)을 제안한다. 랜덤화된 QMC(RQMC)를 사용함으로써 표준 SGD보다 수렴 속도가 빠르고 渐近 수렴 속도가 더 빠르며, 실험 결과 대규모 모델에서 수개의 속도 향상이 관찰된다.

ABSTRACT

Many machine learning problems involve Monte Carlo gradient estimators. As a prominent example, we focus on Monte Carlo variational inference (MCVI) in this paper. The performance of MCVI crucially depends on the variance of its stochastic gradients. We propose variance reduction by means of Quasi-Monte Carlo (QMC) sampling. QMC replaces N i.i.d. samples from a uniform probability distribution by a deterministic sequence of samples of length N. This sequence covers the underlying random variable space more evenly than i.i.d. draws, reducing the variance of the gradient estimator. With our novel approach, both the score function and the reparameterization gradient estimators lead to much faster convergence. We also propose a new algorithm for Monte Carlo objectives, where we operate with a constant learning rate and increase the number of QMC samples per iteration. We prove that this way, our algorithm can converge asymptotically at a faster rate than SGD. We furthermore provide theoretical guarantees on QMC for Monte Carlo objectives that go beyond MCVI, and support our findings by several experiments on large-scale data sets from various domains.

연구 동기 및 목표

  • 현재 i.i.d. 샘플링에 의존하여 높은 노이즈를 겪고 있는 몬테카를로 변분 추론(MCVI)에서 기울기 추정기의 분산을 줄이기 위해.
  • 베이지안 추론에서 몬테카를로 목표 함수에 대해 Quasi-Monte Carlo(QMC) 수열을 i.i.d. 샘플 대신 사용할 경우의 이론적 및 실험적 이점을 조사하기 위해.
  • 일관된 학습률을 유지하면서 반복 횟수에 따라 QMC 샘플 수를 증가시키는 최적화 알고리즘을 개발하여 더 빠른 渐近 수렴을 달성하기 위해.
  • MCVI 및 그 외 분야에서 QMC 기반 기울기 추정기의 분산 감소 및 수렴 속도에 대한 이론적 보장을 제공하기 위해.
  • 기존의 확률적 프로그래밍 프레임워크인 STAN과 Edward에 QMC를 최소한의 코드 변경으로 쉽게 통합할 수 있도록 하기 위해.

제안 방법

  • 단위 초입체 [0,1]^d 위에 있는 결정적이고 저이분산성 QMC 수열로 MCVI의 i.i.d. 균일 랜덤 샘플을 대체하여 커버리지 향상과 분산 감소를 도모하기 위해.
  • 기울기 추정기의 비편향성을 유지하면서도 표준 몬테카를로보다 더 낮은 渐近 분산을 달성하기 위해 랜덤화된 QMC(RQMC)를 사용하기 위해.
  • 일관된 학습률을 사용하지만 반복마다 RQMC 샘플 수를 증가시키는 새로운 최적화 알고리즘을 도입하여 수렴 속도 향상을 달성하기 위해.
  • 강한 볼록성과 온건한 정규성 조건을 가정할 때, RQMC 기반 알고리즘이 표준 몬테카를로를 사용하는 SGD보다 渐近 수렴 속도가 더 빠르다는 것을 증명하기 위해.
  • 변분 추론에서 스코어 함수 및 재구성 기반 기울기 추정기 모두에 적용하여 광범위한 적용 가능성을 입증하기 위해.
  • 대상 분포에서 샘플링하기 위해 표준 재구성 기법을 적용하고 균일 랜덤 수 생성을 RQMC 수열로 대체함으로써 방법을 구현하기 위해.

실험 결과

연구 질문

  • RQ1Quasi-Monte Carlo 샘플링이 i.i.d. 샘플링보다 몬테카를로 변분 추론에서 기울기 추정기의 분산을 더 효과적으로 줄일 수 있는가?
  • RQ2랜덤화된 QMC(RQMC)를 사용할 경우, 몬테카를로 목표 함수에서 표준 SGD보다 증명 가능한 더 빠른 渐近 수렴 속도를 달성할 수 있는가?
  • RQ3일관된 학습률과 증가하는 샘플 크기를 갖는 최적화 알고리즘이 RQMC 샘플을 사용할 경우 SGD보다 더 나은 수렴 성능을 보일 수 있는가?
  • RQ4복잡한 모델, 예를 들어 베이지안 신경망과 대규모 데이터셋에서 QMCVI는 실제로 어떻게 성능을 내는가?
  • RQ5QMCVI는 기존의 분산 감소 기법(예: 제어 변수)과 얼마나 잘 조합될 수 있으며, 잠재적인 상충 관계는 무엇인가?

주요 결과

  • N=10 및 N=50 샘플에서 QMCVI는 표준 몬테카를로와 제어 변수 기반 기준보다 기울기 분산이 한두 개에서 세 개의 주기수 낮게 나타났다.
  • d=653개의 파라미터를 가진 베이지안 신경망에서 QMCVI는 N=10일 때 표준 MCVI보다 더 높은 ELBO 값을 달성했으며, N=50일 땐 더 빠른 속도로 동일한 ELBO에 도달했다.
  • 증가하는 RQMC 샘플 크기와 일관된 학습률을 갖는 제안된 알고리즘은 이중 정규 분포를 대상으로 한 실험을 통해 SGD보다 더 빠른 渐近 수렴 속도를 확보했다.
  • 데이터 서브샘플링 노이즈가 없는 조건에서 QMCVI는 수렴 속도 측면에서 SGD를 능가했으며, 최적 ELBO와의 로그 차이가 반복 횟수에 따라 더 빠르게 감소했다.
  • 이론적 분석 결과, RQMC 하에서 반복의 정적 분산은 표준 몬테카를로 대비 N 배 감소함을 보여주었으며, 이는 최적값에 더 가까운 수렴을 가능하게 했다.
  • QMCVI는 STAN과 Edward와 같은 기존의 확률적 프로그래밍 도구에 균일 랜덤 수 생성을 RQMC 수열로 대체함으로써 쉽게 통합될 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.