Skip to main content
QUICK REVIEW

[논문 리뷰] Variational Inference for Gaussian Process Models with Linear Complexity

Ching-An Cheng, Byron Boots|arXiv (Cornell University)|2017. 11. 28.
Gaussian Processes and Bayesian Inference참고 문헌 12인용 수 21
한 줄 요약

이 논문은 재생 커널 힐버트 공간에서 평균 함수와 공분산 함수의 표현을 분리하는 변분 추론 프레임워크인 분리된 가우시안 프로세스(DGPs)를 제안한다. 평균과 공분산에 사용되는 기저 함수를 분리함으로써, 평균 함수 매개수의 수에 대해 선형 시간 및 공간 복잡도를 가지는 확률적 경사상승법을 가능하게 하여, 기존의 희소 변분 GP 방법보다 예측 정확도를 크게 향상시키면서도 확장성을 유지한다.

ABSTRACT

Large-scale Gaussian process inference has long faced practical challenges due to time and space complexity that is superlinear in dataset size. While sparse variational Gaussian process models are capable of learning from large-scale data, standard strategies for sparsifying the model can prevent the approximation of complex functions. In this work, we propose a novel variational Gaussian process model that decouples the representation of mean and covariance functions in reproducing kernel Hilbert space. We show that this new parametrization generalizes previous models. Furthermore, it yields a variational inference problem that can be solved by stochastic gradient ascent with time and space complexity that is only linear in the number of mean function parameters, regardless of the choice of kernels, likelihoods, and inducing points. This strategy makes the adoption of large-scale expressive Gaussian process models possible. We run several experiments on regression tasks and show that this decoupled approach greatly outperforms previous sparse variational Gaussian process inference procedures.

연구 동기 및 목표

  • 대규모 데이터셋에서 표준 가우시안 프로세스 추론의 초선형 시간 및 공간 복잡도를 해결한다.
  • 작은 유도점 집합으로 인해 발생하는 희소 변분 GP 모델의 표현력 제한을 극복한다.
  • 평균 함수와 공분산 함수 표현을 분리하는 확장 가능한 변분 추론 프레임워크를 개발한다.
  • 선형 복잡도 최적화를 통해 대규모이고 복잡한 데이터셋을 사용한 고정확도 GP 회귀를 가능하게 한다.
  • 더 큰 평균 함수 기저 수를 사용할수록 계산 효율성을 희생시키지 않고도 예측 성능이 향상됨을 입증한다.

제안 방법

  • GP에서 평균 함수와 공분산 함수 모델링에 사용되는 기저 함수를 분리하는 새로운 매개수화 방법을 제안한다.
  • 이 분리된 표현을 사용하여 변분 추론 문제를 설정하며, 유도점을 변분 매개수로 간주한다.
  • 시간 복잡도 O(DNmα + Nmβ² + mβ³)와 공간 복잡도 O(Nmα + mβ²)를 가지는 확률적 경사상승 알고리즘(svdgp)을 유도한다. 여기서 mα와 mβ는 각각 평균 함수와 공분산 함수의 기저 수이다.
  • 커널, 가능도 또는 유도점 선택에 관계없이 mα에 대해 선형 복잡도를 보장하여, 더 큰 mα를 사용해 표현력을 향상시킬 수 있다.
  • 완전히 미분 가능한 프레임워크를 사용해 확률적 경사하강법을 통한 엔드 투 엔드 최적화를 가능하게 한다.
  • 로봇 제어 및 센서 데이터를 포함한 실제 데이터셋에서의 가우시안 프로세스 회귀 과제에 이 방법을 적용하고 평가한다.

실험 결과

연구 질문

  • RQ1GP 모델에서 평균 함수와 공분산 함수 표현을 분리하면 선형 시간 변분 추론이 가능할 수 있는가?
  • RQ2평균 함수 기저 수를 늘리면 계산 비용 증가 없이도 예측 정확도가 향상되는가?
  • RQ3제안된 방법은 선형 복잡도를 유지하면서도 기존의 희소 변분 GP 알고리즘보다 더 우수한 성능을 달성할 수 있는가?
  • RQ4온라인 및 배치 변분 GP 방법과 비교해 볼 때, 분리된 프레임워크는 수렴 속도와 안정성 측면에서 어떻게 다른가?
  • RQ5온라인 학습 환경에서 하이퍼파rameter 초기화 및 학습률 선택에 대해 제안된 방법은 얼마나 강인한가?

주요 결과

  • kuka 1 데이터셋에서 svdgp 알고리즘은 변분 하한(VLB)을 1.262×10⁵로 기록하여, svi(0.391×10⁵), i vsgpr(0.649×10⁵), vsgpr(0.472×10⁵)보다 뚜렷이 뛰어나다.
  • kuka 1 데이터셋에서 svdgp는 정규화된 평균 제곱오차(nMSE)를 0.037로 기록하여, svi(0.169), i vsgpr(0.128), vsgpr(0.139)보다 유의미하게 낮게 유지한다.
  • mujoco 1 데이터셋에서 svdgp는 VLB를 6.007×10⁵로 기록하여, svi(2.178×10⁵), i vsgpr(4.543×10⁵), vsgpr(2.822×10⁵)보다 훨씬 뛰어나다.
  • svdgp는 mujoco 1에서 nMSE를 0.072로 기록하여, svi(0.163), i vsgpr(0.099), vsgpr(0.118)보다 유의미하게 낮게 유지한다.
  • svi보다 수렴 속도가 더 빠르고 안정성이 뛰어나며, i vsgpr와 유사한 수렴 속도를 보이지만, 초기에 느려지고 성능이 열 劣하는 svi와는 대조된다.
  • mα = 1024로 큰 평균 함수 기저 수를 사용하면서도 mβ를 작게 유지(예: 256)함으로써, 시간 및 공간 복잡도를 mα에 대해 선형으로 유지하면서도 고정확도를 달성할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.