Skip to main content
QUICK REVIEW

[논문 리뷰] High-dimensional Bayesian inference via the Unadjusted Langevin Algorithm

Alain Durmus, Éric Moulines|arXiv (Cornell University)|2016. 05. 05.
Markov Chains and Monte Carlo Methods인용 수 10
한 줄 요약

이 논문은 고차원 베이지안 추론에서 비점근 수렴 한계를 제공하며, 강한 볼록성과 리프시츠 기울기 조건 하에서 워셔슈타인 거리와 총 변동 거리에 대해 차원에 명시적인 의존성을 갖는다. 기존의 결과를 향상시키고, 고정 정밀도 또는 고정 예산 조건에서 단계 크기와 반복 횟수를 최적화한다.

ABSTRACT

We consider in this paper the problem of sampling a high-dimensional probability distribution $π$ having a density with respect to the Lebesgue measure on $\mathbb{R}^d$, known up to a normalization constant $x \mapsto π(x)= \mathrm{e}^{-U(x)}/\int_{\mathbb{R}^d} \mathrm{e}^{-U(y)} \mathrm{d} y$. Such problem naturally occurs for example in Bayesian inference and machine learning. Under the assumption that $U$ is continuously differentiable, $ abla U$ is globally Lipschitz and $U$ is strongly convex, we obtain non-asymptotic bounds for the convergence to stationarity in Wasserstein distance of order $2$ and total variation distance of the sampling method based on the Euler discretization of the Langevin stochastic differential equation, for both constant and decreasing step sizes. The dependence on the dimension of the state space of these bounds is explicit. The convergence of an appropriately weighted empirical measure is also investigated and bounds for the mean square error and exponential deviation inequality are reported for functions which are measurable and bounded. An illustration to Bayesian inference for binary regression is presented to support our claims.

연구 동기 및 목표

  • 고차원 설정에서 비조정 랑비용 알고리즘(Underdamped Langevin Algorithm, ULA)의 목표 사후 분포로의 비점근 수렴 속도를 확립하는 것.
  • 워셔슈타인 거리와 총 변동 거리에서 수렴에 대한 명시적인 차원 $d$ 의존성을 갖는 명시적 경계를 유도하는 것.
  • 고정 및 감소하는 단계 크기 모두를 분석하여 고정 정밀도 및 고정 계산 예산 조건에서 최적화하는 것.
  • 강한 볼록성과 리프시츠 기울기 조건 하에서 기존 문헌의 결과를 향상시켜 총 변동 거리에 대한 더 낫지 않은 경계를 도출하는 것.
  • 가중치를 부여한 경험 측도의 수렴 성질을 조사하고, 평균 제곱 오차 및 지수적 편차에 대한 경계를 제공하는 것.

제안 방법

  • ULA는 과다 감쇠 랑비용 SDE의 옐러-마르야모 이산화로 공식화된다: $X_{k+1} = X_k - \gamma_{k+1} \nabla U(X_k) + \sqrt{2\gamma_{k+1}} Z_{k+1}$.
  • 수렴 분석은 $U$ 가 연속 미분 가능하고, $\nabla U$ 가 전역적으로 리프시츠이며, $U$ 가 강한 볼록성 조건을 만족한다고 가정한다.
  • 목표 분포 $\pi$ 와 $n$-번째 반복 간의 총 변동 거리를 경계하기 위해 커플링 기법을 사용한다.
  • 오차 전파를 위해 가우시안 尾 꼬리 경계와 $V$-노름을 활용한 커플링 시간에 대한 역순환 추론 기법을 적용한다.
  • 분산의 $\Xi_{k_1,k_2}$-형 합과 단계 크기 수열을 사용하여 워셔슈타인 거리와 총 변동 거리에 대한 명시적 경계를 도출한다.
  • 고정 단계 크기와 감소하는 단계 크기 계획을 모두 포함하며, 고정 정밀도 또는 고정 예산 조건에서 단계 크기와 반복 횟수를 최적화한다.

실험 결과

연구 질문

  • RQ1강한 볼록성과 리프시츠 기울기 조건 하에서 워셔슈타인 거리와 총 변동 거리에서 ULA의 비점근 수렴 속도는 무엇인가?
  • RQ2고정 및 감소하는 단계 크기 모두에 대해 수렴 속도가 차원 $d$ 에 대해 명시적으로 어떻게 의존하는가?
  • RQ3동일한 가정 조건 하에서 이전 작업보다 더 낫지 않은 총 변동 거리 경계를 도출할 수 있는가?
  • RQ4총 변동 거리에서 고정 정밀도 $\varepsilon$ 를 달성하기 위해 단계 크기와 반복 횟수 사이의 최적의 트레이드오프는 무엇인가?
  • RQ5ULA가 생성한 가중치를 부여한 경험 측도의 수렴 성질은 평균 제곱 오차 및 지수적 편차 측면에서 어떻게 되는가?

주요 결과

  • 논문은 고정 정밀도 $\varepsilon$ 에 대해 총 변동 거리에 대해 $\mathcal{O}(d\varepsilon^{-2})$ 의 비점근 경계를 확립하며, 이는 이전 결과를 향상시킨다.
  • 고정 단계 크기 $\gamma$ 에 대해 강한 볼록성 조건 하에서 총 변동 거리의 수렴 속도는 $\mathcal{O}(d\gamma^{-1}e^{-\mu \gamma n})$ 로 경계되며, 이는 명시적인 차원 의존성을 갖는다.
  • 감소하는 단계 크기 $\gamma_k$ 가 $\sum_{k=1}^\infty \gamma_k = \infty$ 와 $\gamma_k \to 0$ 를 만족할 경우, 워셔슈타인 거리에서 정상 상태 수렴이 명시적인 차원 의존성과 함께 확립된다.
  • 리프시츠 함수에 대해 가중치를 부여한 경험 측도의 평균 제곱 오차는 $\mathcal{O}(\gamma + \gamma^{1/2} \sqrt{d/n})$ 로 경계되며, 지수적 편차 부등식이 함께 제공된다.
  • 분석 결과, 총 변동 거리에서 $\mathcal{O}(d\varepsilon^{-2})$ 의 반복 복잡도를 달성하기 위해 웜 스타트가 필요하지 않음을 보여주며, 이는 이전 결과에서 요구했던 조건을 개선했다.
  • 고정 단계 크기 하에서 $\pi$ 와 ULA의 정상 분포 $\pi_\gamma$ 간의 거리 경계는 $\gamma \to 0$ 일 때 $\mathcal{O}(\gamma^{1/2})$ 로 스케일링되며, 이는 알려진 점근적 행동과 일치한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.