Skip to main content
QUICK REVIEW

[논문 리뷰] Conditioning Sparse Variational Gaussian Processes for Online Decision-making

Wesley J. Maddox, Samuel C. Stanton|arXiv (Cornell University)|2021. 10. 28.
Gaussian Processes and Bayesian Inference인용 수 5
한 줄 요약

이 논문은 증거 하한(lower bound)를 통해 재학습 없이 실시간으로 새로운 데이터를 조건부로 설정할 수 있도록 하는 온라인 변분 조건부(OVC)를 소개한다. OVC는 확률적 변분 가우시안 프로세스(SVGPs)의 확장성과 닫힘 형태의 사후 분포 갱신을 유지함으로써, 베이지안 최적화, 능동 학습, 강화 학습에서 실시간 의사결정에 응용 가능성을 크게 향상시킨다.

ABSTRACT

With a principled representation of uncertainty and closed form posterior updates, Gaussian processes (GPs) are a natural choice for online decision making. However, Gaussian processes typically require at least $\\mathcal{O}(n^2)$ computations for $n$ training points, limiting their general applicability. Stochastic variational Gaussian processes (SVGPs) can provide scalable inference for a dataset of fixed size, but are difficult to efficiently condition on new data. We propose online variational conditioning (OVC), a procedure for efficiently conditioning SVGPs in an online setting that does not require re-training through the evidence lower bound with the addition of new data. OVC enables the pairing of SVGPs with advanced look-ahead acquisition functions for black-box optimization, even with non-Gaussian likelihoods. We show OVC provides compelling performance in a range of applications including active learning of malaria incidence, and reinforcement learning on MuJoCo simulated robotic control tasks.

연구 동기 및 목표

  • 온라인 의사결정 환경에서 새로운 데이터에 대해 가우시안 프로세스를 효율적으로 조건부로 설정하는 문제를 해결한다.
  • 정확한 GPs(이차 비용)와 SVGPs(닫힘 형태의 조건부 설정 불가)의 한계를 극복하여 스트리밍 데이터에 적합하게 한다.
  • 블랙박스 최적화에서 배치 지식 기반 기반(예: qKG)과 같은 고급 봉인된 탐색 획득 함수를 SVGPs와 함께 사용할 수 있도록 한다.
  • 가우시안 커플라를 통한 변동성 모델링 등 비가우시안 우도를 온라인 학습에서 지원한다.
  • 새로운 데이터 도착 시 ELBO 최적화를 통한 재학습 대안으로 안정적이고 스케일러블한 솔루션을 제공한다.

제안 방법

  • ELBO 최적화를 통한 사전 분포 재최적화 없이도 새로운 데이터 포인트에 대해 SVGPs를 조건부로 설정할 수 있는 새로운 절차인 OVC를 개발한다.
  • 스트리밍 스퍼스 GPs(O-SGPR)의 재유도를 활용하여 SVGPs에서 닫힘 형태의 사후 갱신을 가능하게 한다.
  • 안정적인 유도점 초기화를 유지하고, 새로운 데이터에 따라 유도점과 변분 매개변수를 적응적으로 갱신할 수 있도록 한다.
  • 예측 사후 샘플링과 효율적인 공분산 갱신을 사용하여 전체 재학습 없이도 불확실성 추정을 유지한다.
  • 온라인 베이지안 최적화에서 qKG와 톰슨 샘플링과 같은 획득 함수와 OVC를 통합한다.
  • 잠재 변수에 조건부로 설정함으로써 비가우시안 우도를 지원하여 변동성 모델링 및 기타 비가우시안 설정에서 활용 가능하게 한다.

실험 결과

연구 질문

  • RQ1ELBO를 통해 재학습 없이 SVGPs가 새로운 데이터에 대해 실시간으로 조건부로 설정될 수 있는가?
  • RQ2OVC는 온라인 베이지안 최적화에서 qKG와 같은 고급 봉인된 탐색 획득 함수의 효과적인 사용을 가능하게 하는가?
  • RQ3OVC는 변동성 모델링과 같은 비가우시안 우도 설정에서 성능과 안정성을 유지할 수 있는가?
  • RQ4온라인 제어 및 능동 학습에서 OVC는 정확한 GPs와 표준 SVGPs에 비해 자료 효율성과 계산 비용 측면에서 어떻게 비교되는가?
  • RQ5유도점 선택 및 학습 목표함수(ELBO 대 PLL)가 온라인 환경에서 OVC 성능에 미치는 영향은 무엇인가?

주요 결과

  • OVC는 SVGPs가 닫힘 형태의 갱신을 통해 새로운 데이터에 조건부로 설정되도록 하여 ELBO 재학습이 필요 없고 계산 비용을 감소시킨다.
  • Hartmann-6 테스트 문제에서 OVC 기반 SVGPs는 qKG와 노이즈 수준 0.1 조건에서 평균 최적값 3.18(±0.03)을 달성하여 NEI를 능가하고 정확한 GP 성능과 동등하게 유지했다.
  • MuJoCo 로버 제어 작업에서 OVC를 사용한 SVGPs는 정확한 GPs와 유사한 자료 효율성을 보였으며, 특히 대용량 배치 최적화에서 정확한 모델보다 두 배 빠른 성능을 보였다.
  • SVGPs 학습에 예측 로그우도(PLL)를 사용할 경우 ELBO 대비 약간 더 빠른 수렴과 더 나은 봉인된 트리 탐색(LTS) 성능을 보였다.
  • OVC는 특히 롤아웃에서 학습 데이터 공분산 행렬의 조건부 설정을 향상시켜 다양한 트리 깊이(예: 깊이 4가 성능 향상에 충분함)에서 안정적인 성능을 제공했다.
  • 피봇된 코レス키 분해를 사용한 SGPR는 OVC와 경쟁 가능했지만, OVC는 온라인 스트리밍 데이터에 더 스케일러블하고 안정적인 솔루션을 제공했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.