[논문 리뷰] Distributed Bayesian Learning with Stochastic Natural-gradient Expectation Propagation and the Posterior Server
이 논문은 베이지안 학습을 위한 수렴 가능한 블랙박스 변분 추론 방법인 Stochastic Natural Gradient Expectation Propagation (SNEP)을 소개한다. SNEP는 확률적 자연 경사 하강법과 몬테카를로 샘플링을 사용하여 사후 분포를 근사한다. 또한, SNEP를 통해 모멘트 기반 메시지를 동기화함으로써 클러스터 전역에서 확장 가능하고 분산된 베이지안 학습을 가능하게 하는 사후 서버 아키텍처를 제안한다. 이는 통신 오버헤드가 최소화된 로지스틱 회귀와 딥 네ural 네트워크에서 효과를 입증한다.
This paper makes two contributions to Bayesian machine learning algorithms. Firstly, we propose stochastic natural gradient expectation propagation (SNEP), a novel alternative to expectation propagation (EP), a popular variational inference algorithm. SNEP is a black box variational algorithm, in that it does not require any simplifying assumptions on the distribution of interest, beyond the existence of some Monte Carlo sampler for estimating the moments of the EP tilted distributions. Further, as opposed to EP which has no guarantee of convergence, SNEP can be shown to be convergent, even when using Monte Carlo moment estimates. Secondly, we propose a novel architecture for distributed Bayesian learning which we call the posterior server. The posterior server allows scalable and robust Bayesian learning in cases where a data set is stored in a distributed manner across a cluster, with each compute node containing a disjoint subset of data. An independent Monte Carlo sampler is run on each compute node, with direct access only to the local data subset, but which targets an approximation to the global posterior distribution given all data across the whole cluster. This is achieved by using a distributed asynchronous implementation of SNEP to pass messages across the cluster. We demonstrate SNEP and the posterior server on distributed Bayesian learning of logistic regression and neural networks. Keywords: Distributed Learning, Large Scale Learning, Deep Learning, Bayesian Learn- ing, Variational Inference, Expectation Propagation, Stochastic Approximation, Natural Gradient, Markov chain Monte Carlo, Parameter Server, Posterior Server.
연구 동기 및 목표
- 사후 분포에 대한 단순화된 가정이 필요 없는, 수렴 가능한 블랙박스 변분 추론 알고리즘을 개발하는 것.
- 데이터가 클러스터에 분할 배포되어 있을 때, 각 노드가 로컬 데이터 부분집합만 처리하는 조건에서 확장 가능하고 강건한 분산 베이지안 학습을 가능하게 하는 것.
- 기존 Expectation Propagation(EP)의 수렴 불안정 문제를 해결하기 위해 확률적 자연 경사 하강법 설정을 도입하는 것.
- 지속적인 모멘트 공유를 통해 로컬 MCMC 샘플러를 조율하는 사후 서버를 활용하여 통신 효율적인 분산 학습 시스템을 설계하는 것.
- 대규모 모델인 로지스틱 회귀와 딥 네럴 네트워크에서 분산된 데이터를 바탕으로 이 방법이 효과적으로 작동하는지 입증하는 것.
제안 방법
- 기울기 기반 메시지의 근사치를 얻기 위해 기울어진 분포의 모멘트에 대한 몬테카를로 추정치를 사용하는 SNEP를 제안한다. 이는 Expectation Propagation의 확률적 자연 경사 하강법 변형이다.
- 로컬 사후 근사에 효율적으로 샘플링하기 위해 적응형 질량 행렬(Adam과 유사)을 사용하는 확률적 경사 하강 라운지 동역학(SGLD)을 적용한다.
- 모든 워커에게 전역 모멘트 업데이트(θ−i)를 집계하고 방송하는 사후 서버를 도입하여 로컬 사후 근사치를 동기화한다.
- 각 통신 후 MCMC 체인의 효율성을 유지하기 위해 MCMC 상태를 새로운 목표 분포에 대해 재위치 조정하는 상태 이동 기법을 적용한다.
- 로컬 데이터의 미니배치로부터 유도된 비편향 확률적 경사 하강법을 사용하여 변분 매개변수에 자연 경사 하강 업데이트를 적용한다.
- 통신 빈도를 최소화하고 강건성을 확보하기 위해 SNEP의 분산 비동기 구현을 통해 클러스터 전역에서 메시지를 전달한다.
실험 결과
연구 질문
- RQ1몬테카를로 모멘트 추정치를 사용할 때조차도 수렴 가능한 확률적 자연 경사 하강법 기반 EP의 설정을 만들 수 있는가?
- RQ2데이터가 클러스터에 분할 배포되어 있을 때, 분산 베이지안 학습을 어떻게 확장 가능하고 통신 효율적으로 만들 수 있는가?
- RQ3완전한 데이터 복제 없이도 통신 주기를 줄이며 로컬 MCMC 샘플러를 워커 간에 동기화할 수 있는가?
- RQ4사후 서버 아키텍처는 대규모 베이지안 모델에서 정확하고 효율적인 사후 근사치를 제공할 수 있는가?
- RQ5SNEP는 분산된 데이터를 가진 복잡한 모델, 예를 들어 딥 네럴 네트워크에서도 수렴성과 성능을 유지할 수 있는가?
주요 결과
- SNEP는 약간의 조건 하에서 조차, 기울어진 분포의 모멘트에 대한 노이즈 있는 몬테카를로 추정치를 사용할 때도 증명 가능한 수렴성을 보인다.
- 사후 서버는 메시지 교환 빈도가 낮고, 공유되는 것이 모멘트뿐인 조건에서 통신을 최소화한 분산 베이지안 학습을 가능하게 한다.
- 상태 이동 기법 덕분에 각 통신 후 MCMC 샘플러가 효율적으로 재시작될 수 있어, 버닝 인 기간이 필요 없어진다.
- 분산된 데이터와 로컬 샘플링 조건에서도 로지스틱 회귀와 딥 네럴 네트워크에서 중심화된 추론과 비교해 경쟁 가능한 사후 근사 정확도를 달성한다.
- 대각 질량 행렬과 비편향 처리(Adam과 유사)를 적용한 적응형 SGLD는 훈련의 안정성과 수렴 속도를 크게 향상시킨다.
- 실험 결과는 이 방법이 대규모 데이터셋에 대해 효과적으로 확장 가능하며, 데이터 분할 및 통신 지연에 대해 강건한 성능을 보임을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.