Skip to main content
QUICK REVIEW

[논문 리뷰] Sparse Gaussian Processes Revisited: Bayesian Approaches to Inducing-Variable Approximations

Símone Rossi, Heinonen, Markus|Aaltodoc (Aalto University)|2020. 03. 06.
Gaussian Processes and Bayesian Inference인용 수 4
한 줄 요약

이 논문은 변분 희소 가우시안 프로세스에서 유도 입력을 최적화하는 기존 관행을 도전하며, 유도 입력과 초모수를 모두 완전한 베이지안 처리 방식으로 적용하는 스토하스틱 그래디언트 하밀턴 몬테카를로(SG-HMC)를 제안한다. 고도로 발전된 샘플링 기법을 활용해 완전히 독립된 훈련 조건부 근사(FITC)를 재검토함으로써, 회귀 및 분류 벤치마크 전반에서 최신 기술 수준의 성능을 달성하며, 점추정치를 사용하는 표준 변분 추론 대비 예측 정확도와 불확실성 정량화를 크게 향상시킨다.

ABSTRACT

Variational inference techniques based on inducing variables provide an elegant framework for scalable posterior estimation in Gaussian process (GP) models. Besides enabling scalability, one of their main advantages over sparse approximations using direct marginal likelihood maximization is that they provide a robust alternative for point estimation of the inducing inputs, i.e. the location of the inducing variables. In this work we challenge the common wisdom that optimizing the inducing inputs in the variational framework yields optimal performance. We show that, by revisiting old model approximations such as the fully-independent training conditionals endowed with powerful sampling-based inference methods, treating both inducing locations and GP hyper-parameters in a Bayesian way can improve performance significantly. Based on stochastic gradient Hamiltonian Monte Carlo, we develop a fully Bayesian approach to scalable GP and deep GP models, and demonstrate its state-of-the-art performance through an extensive experimental campaign across several regression and classification problems.

연구 동기 및 목표

  • 변분 희소 가우시안 프로세스에서 유도 입력을 최적화하는 일반적인 관행을 도전하며, 이를 고정된 변분 매개변수로 간주하는 것이 아니라 랜덤 변수로 간주하는 것에 대한 도전.
  • 유도 입력과 GP 초모수를 모두 완전한 베이지안 처리 방식으로 적용할 경우, 점추정치 대비 뛰어난 성능을 낼 수 있는지 조사.
  • 대규모 GP 및 딥 GP 모델에서 고차원 유도 입력에 대한 사후 추론을 가능하게 하는 확장 가능한 샘플링 기반 추론 프레임워크 개발.
  • 오래된 근사 기법(예: FITC)을 현대적인 베이지안 샘플링 기법과 함께 재검토함으로써 성능 향상이 가능함을 입증.
  • 유도 입력을 결정론적 최적화 가능한 매개변수로 간주하는 표준 변분 추론 프레임워크에 대한 원칙적인 대안 제공.

제안 방법

  • 스토하스틱 그래디언트 하밀턴 몬테카를로(SG-HMC)를 사용하여 유도 입력과 초모수 모두에 사전 분포를 할당하고 샘플링하는 희소 가우시안 프로세스를 위한 완전한 베이지안 추론 프레임워크 제안.
  • 효율적인 계산을 유지하면서도 모델링의 유연성을 유지하기 위해 기초적인 GP 근사로 완전히 독립된 훈련 조건부(FITC) 근사를 채택.
  • 스토하스틱 그래디언트 마르코프 체인 몬테카를로(SG-MCMC)와 변분 추론을 통합하여 대규모 데이터셋에 대한 사후 샘플링을 스케일업하며, 효율성을 위해 미니배치 그래디언트를 활용.
  • 유도 입력을 사전 분포를 가진 랜덤 변수로 간주하여 점추정 대신 위치에 대한 완전한 사후 추론을 가능하게 함.
  • 유도 변수와 GP 초모수의 사후 분포를 동시에 샘플링하는 공동 사후 추론 기법을 적용하여 별도의 최적화 단계가 필요 없도록 함.
  • 재패arameterization 기법과 효율적인 커널 근사를 활용하여 계산의 확장성을 유지하면서도 유도 입력에 대한 완전한 베이지안 처리를 가능하게 함.

실험 결과

연구 질문

  • RQ1변분 프레임워크에서 유도 입력을 최적화하는 것이 진정으로 최적의 성능을 낼 수 있는가, 아니면 이들의 완전한 베이지안 처리가 더 낫단 말인가?
  • RQ2FITC와 같은 오래된 GP 근사 기법이 현대적인 샘플링 기반 추론 기법을 통해 재활용될 수 있는가, 그리고 이를 통해 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ3대규모 GP 모델에서 고차원 유도 입력에 대해 완전한 베이지안 추론을 수행하는 것이 실현 가능하고 유익한가?
  • RQ4다양한 회귀 및 분류 작업에서, 점추정치를 사용하는 표준 변분 추론 대비 완전한 베이지안 접근 방식의 성능은 어떻게 비교되는가?
  • RQ5유도 입력과 초모수를 모두 랜덤 변수로 간주할 경우, 불확실성 정량화와 예측 정확도에 어떤 영향을 미치는가?

주요 결과

  • 제안된 SG-HMC를 사용한 완전한 베이지안 접근 방식은 모든 벤치마크 데이터셋에서 최적화된 유도 입력을 사용하는 표준 변분 추론을 초월하여, 회귀 및 분류 작업 모두에서 최신 기술 수준의 성능을 달성한다.
  • 낮은 음의 로그 예측 밀도(NLPD)와 확률적 예측의 더 나은 커버리지로 인해 예측 불확실성의 校정이 크게 향상됨을 입증.
  • 보스턴 주택 데이터셋에서 베이지안 희소 GP(bsgp)는 정규화된 RMSE 0.36 (±0.07)을 기록하여, SVG-P(0.33)와 다른 베이스라인들을 능가하는 정확도와 불확실성 추정 성능을 확보.
  • 단백질 데이터셋에서 bsgp는 정규화된 RMSE 0.65 (±0.01)을 달성하여 IPVI-GP(0.65)와 SGLD-GP(0.69)에 비해 뛰어난 일반화 능력과 더 나은 불확실성 보정을 보였다.
  • 항공우주 데이터셋에서 5번의 반복 전반에 걸쳐 bsgp는 테스트 오차 0.01 (±0.00)과 NLPD -6.55 (±0.09)를 기록하며 SVG-P와 SGLD-GP를 모두 압도했으며, 일관되게 낮은 테스트 오차와 NLPD를 기록.
  • 결과는 유도 입력을 사전 분포를 가진 랜덤 변수로 간주하고 사후 샘플링을 수행할 경우, 수천 개의 유도 포인트를 포함한 고차원 환경에서도 점추정보다 더 견고하고 신뢰할 수 있는 예측이 가능함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.