Skip to main content
QUICK REVIEW

[논문 리뷰] Posterior inference unchained with EL_2O

Uroš Seljak, Byeonghee Yu|arXiv (Cornell University)|2019. 01. 14.
Image and Object Detection Techniques참고 문헌 26인용 수 10
한 줄 요약

이 논문은 샘플링된 점들에서 근사 사후분포 $q$와 비정규화된 사후분포 $p$ 사이의 L² 거리 직접 최소화를 위해 새로운 $t(\ln t)^2$ f-분산을 최소화하는 최적화 기반의 근사 베이지안 추론 방법인 EL₂O를 소개한다. 스토하스틱 KL 분산 방법과는 달리 EL₂O는 샘플링 노이즈가 없어 더 빠른 수렴과 더 높은 정확도를 달성하며, 비정규분포이거나 고차원적인 사후분포일지라도 MCMC 수준의 결과를 3개의 지수 차수 적은 가능도 평가 횟수로 달성한다.

ABSTRACT

Statistical inference of analytically non-tractable posteriors is a difficult problem because of marginalization of correlated variables and stochastic methods such as MCMC and VI are commonly used. We argue that stochastic KL divergence minimization used by MCMC and VI is noisy, and we propose instead EL_2O, expectation optimization of L_2 distance squared between the approximate log posterior q and the un-normalized log posterior of p. When sampling from q the solutions agree with stochastic KL divergence minimization based VI in the large sample limit, however EL_2O method is free of sampling noise, has better optimization properties, and requires only as many sample evaluations as the number of parameters we are optimizing if q covers p. As a consequence, increasing the expressivity of q improves both the quality of results and the convergence rate, allowing EL_2O to approach exact inference. Use of automatic differentiation methods enables us to develop Hessian, gradient and gradient free versions of the method, which can determine M(M+2)/2+1, M+1 and 1 parameter(s) of q with a single sample, respectively. EL_2O provides a reliable estimate of the quality of the approximating posterior, and converges rapidly on full rank gaussian approximation for q and extensions beyond it, such as nonlinear transformations and gaussian mixtures. These can handle general posteriors, while still allowing fast analytic marginalizations. We test it on several examples, including a realistic 13 dimensional galaxy clustering analysis, showing that it is several orders of magnitude faster than MCMC, while giving smooth and accurate non-gaussian posteriors, often requiring a few to a few dozen of iterations only.

연구 동기 및 목표

  • 고차원적이고 비처리 가능한 사후분포를 위한 스케일러블하고 노이즈 없는 스토하스틱 변분 추론과 MCMC의 대안을 개발하기 위해.
  • MCMC와 VI에서 사용되는 KL 분산 최소화에 내재된 샘플링 노이즈를 극복하기 위해.
  • 특히 비용이 많이 들는 과학적 응용 분야에서 가능도 평가 횟수를 최소화하면서 정확한 사후분포 근사화를 가능하게 하기 위해.
  • EL₂O 값이라는 신뢰할 수 있는 분석적 추정치를 통해 사후분포 품질을 정량화하기 위해.
  • 표현력이 뛰어난 모델(예: 가우시안 믹스처와 비선형 변환)을 사용할 수 있도록 기반으로 하는 기울기 기반 및 헤시안 기반 최적화를 지원하기 위해.

제안 방법

  • 샘플링된 점에서 $q$와 $p$ 사이의 제곱 L² 거리를 평가하는 새로운 f-분산인 $t(\ln t)^2$를 제안하여 최적화 과정에서의 샘플링 노이즈를 제거한다.
  • 샘플링된 점들에서 $\ln q$와 $\ln p$ 사이의 기대 L² 거리를 최소화함으로써 근사 사후분포 $q$를 최적화하며, $q$의 매개변수 업데이트에 단일 샘플을 사용한다.
  • 기울기 없음, 기울기 기반, 헤시안 기반의 EL₂O 버전을 도입하며, 헤시안 기반 버전은 전체 랭크 가우시안 피팅을 위해 샘플당 $M(M+3)/2+1$개의 제약 조건을 제공한다.
  • 지점별 비선형 변환과 가우시안 믹스처를 사용하여 $q$의 표현력을 높여 비정규분포 사후분포의 정확한 근사화를 가능하게 한다.
  • 모든 매개변수의 부분집합에 대해 분석적 최적화를 수행하여 계산 효율성을 유지한다.
  • 백프로파게이션 등을 통해 이용 가능한 분석적 기울기와 헤시안을 활용하여 수렴 속도를 가속화하며, 특히 고차원 문제에서 유리하다.

실험 결과

연구 질문

  • RQ1로그사후분포 간 L² 거리 기반의 분산이 KL 분산보다 최적화 안정성과 수렴 속도 측면에서 뛰어나다고 할 수 있는가?
  • RQ2사후분포 근사화 과정에서 샘플링 노이즈를 제거하면 고차원적이거나 비정규분포 설정에서 더 빠르고 정확한 추론이 가능할까?
  • RQ3실제 과학적 응용에서 EL₂O가 가능도 평가 횟수를 3개의 지수 차수 적게 하면서도 MCMC 수준의 정확도를 달성할 수 있는가?
  • RQ4표현력이 뛰어난 모델(예: 가우시안 믹스처와 비선형 변환)과 결합했을 때 EL₂O는 복잡한 사후분포의 구조를 얼마나 잘 포착할 수 있는가?
  • RQ5EL₂O는 모델 증거 $p(x)$를 신뢰할 수 있는 분석적 추정치로 제공할 수 있는가? 이를 통해 전체 MCMC 샘플링 없이도 모델 비교가 가능할까?

주요 결과

  • EL₂O는 13차원의 은하 군집 분석에서 단지 25회의 반복과 약 125회의 가능도 평가로 정확하고 비정규분포 사후분포 근사화를 달성했으며, 이는 MCMC의 $10^5$회의 반복에 비해 훨씬 적은 수치이다.
  • 이 방법은 MCMC보다 3개의 지수 차수 빠르고, ADVI보다 2개의 지수 차수 더 빠르며, 더 부드럽고 정확한 사후분포를 생성했다.
  • 동일한 천체물리학적 예제에서 ADVI는 200배 더 많은 계산 비용($2\times10^4$회 호출)을 요구했지만, KL 분산 최소화 과정에서의 노이즈로 인해 더 나쁜 결과를 냈다.
  • EL₂O의 헤시안 기반 버전은 매우 빠른 수렴을 보였으며, 샘플당 $M(M+3)/2+1$개의 제약 조건을 사용하여 반복 최적화 없이도 전체 랭크 가우시안 성분을 피팅할 수 있었다.
  • EL₂O 값 자체가 사후분포 근사화의 품질을 노이즈 없이 신뢰할 수 있는 추정치로 제공되어 최적화 과정 중 신뢰도 모니터링이 가능했다.
  • 비정규분포 사후분포의 경우, 전체 랭크 가우시안 믹스처와 1차원 비선형 변환을 조합함으로써 도전적인 고차원 설정에서도 MCMC 결과와 뛰어난 일치를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.