Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Structured Mixtures of Gaussian Processes

Martin Trapp, Robert Peharz|TU/e Research Portal|2019. 10. 10.
Gaussian Processes and Bayesian Inference참고 문헌 29인용 수 12
한 줄 요약

이 논문은 깊이 구조화된 가우시안 프로세스 혼합모형(Deep Structured Mixtures of Gaussian Processes, DSMGPs)을 소개한다. 이는 합-곱 네트워크(Sum-Product Networks, SPNs)와 가우시안 프로세스(GP) 전문가를 결합하여 정확하고 효율적인 사후 추론을 가능하게 하는 새로운 스토케스틱 프로세스 모델이다. SPN 유사한 계층적 혼합 구조를 통해 GPs를 구성함으로써, DSMGPs는 낮은 계산 비용, 확장 가능한 초모수 최적화, 기존의 전문가 기반 GP 근사법보다 뛰어난 불확실성 측정 능력을 달성한다. 기존의 전통적 GP와 변분 근사법보다 예측 정확도와 불확실성 캘리브레이션 측면에서 뛰어나다.

ABSTRACT

Gaussian Processes (GPs) are powerful non-parametric Bayesian regression models that allow exact posterior inference, but exhibit high computational and memory costs. In order to improve scalability of GPs, approximate posterior inference is frequently employed, where a prominent class of approximation techniques is based on local GP experts. However, local-expert techniques proposed so far are either not well-principled, come with limited approximation guarantees, or lead to intractable models. In this paper, we introduce deep structured mixtures of GP experts, a stochastic process model which i) allows exact posterior inference, ii) has attractive computational and memory costs, and iii) when used as GP approximation, captures predictive uncertainties consistently better than previous expert-based approximations. In a variety of experiments, we show that deep structured mixtures have a low approximation error and often perform competitive or outperform prior work.

연구 동기 및 목표

  • 대규모 회귀 과제에서 전체 가우시안 프로세스(GPs)의 높은 계산 비용과 메모리 소비 문제를 해결하기 위해.
  • 기존 국소 전문가 기반 GP 근사법의 한계를 극복하기 위해, 정확한 추론이 불가능하거나 불확실성 캘리브레이션이 열악하거나 추론이 비가역적인 문제를 해결하기 위해.
  • 정확한 사후 추론을 가능하게 하면서도 낮은 계산 비용과 메모리 소비를 유지하는 원리적인, 확장 가능한 GP 근사 모델을 개발하기 위해.
  • 합-곱 네트워크(SPNs)에서 영감을 얻은 계층적 혼합 구조를 활용하여 GP 모델의 불확실성 측정 능력을 향상시키기 위해.
  • 구조화된 계산과 공유된 코レス키 분해를 통해 효율적인 초모수 최적화와 비정상 모델링을 가능하게 하기 위해.

제안 방법

  • 모델은 잎 노드가 입력 공간의 서로 다른 영역에서 국소 전문가를 나타내는 가우시안 프로세스(GPs)인 계층적 SPN 구조를 사용한다.
  • 모델은 SPNs의 측도 이론적 확장에 기반하여 정의되며, 이는 연속 영역에서의 스토케스틱 프로세스를 표현할 수 있도록 한다.
  • 사후 추론은 SPN 추론 알고리즘을 사용하여 정확히 계산되며, 이는 조건부 독립성과 국소 계산을 활용하여 전체 GP 역행렬 계산을 피한다.
  • 모델은 나머지 국소 전문가(Naive-Local-Expert, NLE) 구성의 지수적 크기의 범위에서 베이지안 모델 평균화를 가능하게 하며, 암시적으로 GPs의 혼합을 인코딩한다.
  • 공유된 코レス키 분해가 GP 잎 노드들 간에 사용되어 계산을 가속화하며, 특히 여러 전문가가 입력 분할을 공유할 경우에 유리하다.
  • 이 구조는 SPN의 계층적 라우팅 메커니즘을 통해 국소적으로 GP 초모수를 조정함으로써 비정상 모델링을 가능하게 한다.

실험 결과

연구 질문

  • RQ1계층적 혼합 GP 전문가 구조가 정확한 사후 추론을 유지하면서도 계산 효율성을 확보할 수 있는가?
  • RQ2구조화된 혼합 GP의 불확실성 캘리브레이션 능력은 기존의 국소 전문가 기반 및 변분 GP 근사법과 비교해 어떻게 되는가?
  • RQ3공유된 코レス키 분해가 혼합 GP에서 계산 비용을 얼마나 줄일 수 있는가?
  • RQ4모델의 구조가 국소 초모수 적응을 통해 비정상 시계열 모델링을 지원할 수 있는가?
  • RQ5전문가의 수와 그들의 분할 방식은 예측 성능 및 불확실성 추정에 어떤 영향을 미치는가?

주요 결과

  • DSMGPs는 예측 정확도와 불확실성 캘리브레이션 측면에서 다른 전문가 기반 GP 근사법보다 항상 뛰어나며, 평균 절대 오차(MAE)와 음의 로그 예측 밀도(NLPD) 측정치에서 높은 성능을 보였다.
  • 단백질과 연도 데이터셋에서 DSMGPs는 전체 GP보다 낮은 NLPD를 기록하여, 근사 모델임에도 불구하고 더 나은 불확실성 측정 능력을 보였다.
  • DSMGPs에서 효과적인 혼합 성분 수는 매우 클 수 있으며, 예를 들어 연도 데이터셋의 경우 암시적 SPN 구조에 의해 4.3 × 10^18까지 도달할 수 있었으며, 명시적 나열 없이도 가능했다.
  • 초모수 최적화에 대해 경쟁적인 런타임을 달성했으며, 최신 변분 GP 방법과 유사한 시간을 소요했고, 분산 컴퓨팅을 통해 추가 가속화가 가능했다.
  • 공유된 코レス키 분해는 시뮬레이션 실험에서 계산 속도를 두 배로 높였으며, 이는 입력 분할의 수를 두 배로 탐색할 수 있도록 했다.
  • 합 노드의 자식 수(K_S)를 늘림으로써 전문가의 능력이 낮을 경우(예: M이 낮을 경우)의 성능을 보완할 수 있었으며, 이는 초모수 설정에 대한 강건성을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.