Skip to main content
QUICK REVIEW

[논문 리뷰] Markovian Score Climbing: Variational Inference with KL(p||q)

Christian A. Naesseth, Fredrik Lindsten|arXiv (Cornell University)|2020. 03. 23.
Gaussian Processes and Bayesian Inference참고 문헌 61인용 수 12
한 줄 요약

이 논문은 비편향 확률적 경사 하강을 사용하여 포함형 KL 발산 $\mathrm{KL}(p \| q)$를 안정적으로 최소화하는 새로운 변분 추론 알고리즘인 마코프 점수 기반 상승(MSC)을 제안한다. MCMC 샘플링과 스코어 함수 업데이트를 결합함으로써, 이전 방법들인 재가중 각성수면(Reweighted Wake-Sleep)과 신경망 적응형 SMC와는 달리 체계적인 편향 없이 국소 최적해에 수렴한다.

ABSTRACT

Modern variational inference (VI) uses stochastic gradients to avoid intractable expectations, enabling large-scale probabilistic inference in complex models. VI posits a family of approximating distributions q and then finds the member of that family that is closest to the exact posterior p. Traditionally, VI algorithms minimize the "exclusive Kullback-Leibler (KL)" KL(q || p), often for computational convenience. Recent research, however, has also focused on the "inclusive KL" KL(p || q), which has good statistical properties that makes it more appropriate for certain inference problems. This paper develops a simple algorithm for reliably minimizing the inclusive KL using stochastic gradients with vanishing bias. This method, which we call Markovian score climbing (MSC), converges to a local optimum of the inclusive KL. It does not suffer from the systematic errors inherent in existing methods, such as Reweighted Wake-Sleep and Neural Adaptive Sequential Monte Carlo, which lead to bias in their final estimates. We illustrate convergence on a toy model and demonstrate the utility of MSC on Bayesian probit regression for classification as well as a stochastic volatility model for financial data.

연구 동기 및 목표

  • 기존의 배타형 KL 발산 $\mathrm{KL}(q \| p)$를 최소화하는 전통적 변분 추론의 한계를 해결하되, 이는 사후 불확실성을 과소평가한다.
  • 이전 방법들인 재가중 각성수면과 신경망 적응형 SMC처럼 포함형 KL 발산 $\mathrm{KL}(p \| q)$를 목표로 하지만 편향된 경사를 사용함으로써 체계적인 편향을 유발하는 문제를 해결한다.
  • 최소한의 계산 오버헤드로 비편향 확률적 경사를 사용하여 $\mathrm{KL}(p \| q)$를 최소화하는 신뢰할 수 있고 수렴 보장이 되는 알고리즘을 개발한다.
  • 합성 및 실제 모델에서 MSC의 수렴성과 사후 분포 근사 품질 측면에서의 우수성을 입증한다.

제안 방법

  • 정적 분포가 $p$인 마코프 체인에서 유도된 샘플을 사용하여 경사를 추정하는 확률적 최적화 방법인 마코프 점수 기반 상승(MSC)을 제안한다.
  • 스코어 함수 $\nabla_\lambda \log q(\mathbf{z}[k])$ 기반으로 변분 매개변수를 갱신하기 위해 Robbins-Monro 단계 크기 스케줄을 사용한다.
  • MCMC 커널이 현재 변분 근사에 적응적으로 의존하도록 설계하여, VI가 수렴함에 따라 MCMC의 성능이 점진적으로 향상되도록 한다.
  • 경우적 중요도 샘플링(CIS) 또는 조건부 순차 몬테카를로(CSMC)를 MCMC 커널로 활용하여 경사 추정을 위한 샘플을 생성한다.
  • 이전 방법에서 중요도 샘플링으로 인해 발생하는 편향을 피하기 위해 변분 제안 분포의 스코어 함수를 사용함으로써 경사 추정이 비편향이 되도록 보장한다.
  • 포함형 KL 발산 $\mathrm{KL}(p \| q)$의 국소 최적해로 수렴하는 것을 보장하는 확률적 최적화 프레임워크에 이 방법을 통합한다.

실험 결과

연구 질문

  • RQ1비편향 경사를 사용하고 수렴 보장이 되는 알고리즘을 통해 포함형 KL 발산 $\mathrm{KL}(p \| q)$를 최소화할 수 있는가?
  • RQ2재가중 각성수면과 신경망 적응형 SMC와 같은 기존 방법들은 왜 $\mathrm{KL}(p \| q)$를 목표로 하면서도 편향된 사후 근사를 생성하는가?
  • RQ3IS 기반 및 SMC 기반 방법과 비교해 MSC는 수렴성과 주변 가능도 추정 측면에서 어떻게 다른가?
  • RQ4불확실성 과소평가 문제가 알려진 모델에서 MSC는 더 강건한 사후 근사를 제공할 수 있는가?
  • RQ5금융 시계열 모델링과 같은 실제 응용 분야에서 MSC는 SMC 기반 최적화를 능가하는가?

주요 결과

  • MSC는 이전의 편향 있는 방법들이 하위 최적해로 수렴하는 것과 달리, 포함형 KL 발산 $\mathrm{KL}(p \| q)$의 국소 최적해로 수렴한다.
  • 테스트용 비대칭 정규 분포 모델에서 MSC는 재가중 각성수면과 신경망 적응형 SMC에서 관찰된 체계적 편향을 피하며, 항상 사후 분산을 과소평가하지 않는다.
  • 베이지안 프로빗 회귀에서 MSC는 IS 기반 최적화보다 더 나은 주변 가능도 추정을 달성했으며, 기준 데이터셋에서 EP 성능을 따라하거나 능가한다.
  • 18개의 외환 환율 데이터셋에서 MSC는 SMC 기반 방법 [22]보다 유의미하게 높은 로그-주변 가능도를 기록했으며, 평가 시 $S=10$ 및 $S=10,000$의 입자 수를 사용했다.
  • MSC는 입자 수 $S$의 선택에 대해 강건하며, Heart 및 Ionos 데이터셋에서 다양한 $S$ 값에 대해 유사한 평균 수렴값을 보였고, 반면 IS는 낮은 $S$에서 강한 편향을 보였다.
  • 다양한 모델에서 일관된 성능을 보였으며, 특히 변동성 모델에서 MSC는 주변 가능도 추정 측면에서 SMC 기반 최적화를 능가했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.