[논문 리뷰] Deep Gaussian Processes for Regression using Approximate Expectation Propagation
이 논문은 희소 FITC 근사, 연결된 요소로 인한 EP 기반 에너지 최적화, 및 확률적 역전파를 이용하여 Deep Gaussian Processes (DGPs)을 학습하기 위한 확장 가능한 근사 베이지안 방법을 제시하고, GP 및 다수의 베이지안 NN 접근법에 비해 더 우수한 회귀 성능을 제공합니다.
Deep Gaussian processes (DGPs) are multi-layer hierarchical generalisations of Gaussian processes (GPs) and are formally equivalent to neural networks with multiple, infinitely wide hidden layers. DGPs are nonparametric probabilistic models and as such are arguably more flexible, have a greater capacity to generalise, and provide better calibrated uncertainty estimates than alternative deep models. This paper develops a new approximate Bayesian learning scheme that enables DGPs to be applied to a range of medium to large scale regression problems for the first time. The new method uses an approximate Expectation Propagation procedure and a novel and efficient extension of the probabilistic backpropagation algorithm for learning. We evaluate the new method for non-linear regression on eleven real-world datasets, showing that it always outperforms GP regression and is almost always better than state-of-the-art deterministic and sampling-based approximate inference methods for Bayesian neural networks. As a by-product, this work provides a comprehensive analysis of six approximate Bayesian methods for training neural networks.
연구 동기 및 목표
- 회귀에서 Deep Gaussian Processes (DGPs)에 대한 확장 가능한 베이지안 학습을 동기부여하고 가능하게 한다.
- FITC 희소 GP, 근사 EP와 결합된 타일드 팩터 제약 조건, 및 확률적 역전파를 결합한 새로운 추론 체계를 개발한다.
- GP 회귀 및 베이지안 NN 방법과 비교하여 다양한 실제 데이터세트에서 예측 성능 및 불확실성 보정이 개선되었음을 입증한다.
제안 방법
- Fully Independent Training Conditional (FITC)를 사용하여 GP 계층을 희소화하고 inducing outputs u를 도입하여 계산의 3차 복잡도를 줄인다.
- 타일드 팩터 제약 조건을 갖는 근사 기대 전파(EP)로 포스트에 대해 inducing outputs와 하이퍼파라미터의 포스터리를 추론한다.
- 확률적 역전파(가우시안 근사 전달)를 사용하여 깊은 GP 계층을 통해 가우시안 근사를 전달하고 로그 Z와 그래디언트를 계산한다.
- 비용이 많이 드는 이중 루프 EP 절차 없이 EP 에너지를 직접 최적화하여 확장 가능한 추론을 얻는다.
- 데이터 배치의 기여를 모아가는 목표를 가진 스토캐스틱 최적화를 가능하게 하여 확장 가능한 학습을 수행한다.
- 레이어를 통한 순전파 가우시안 분포를 통해 확률적 예측 분포를 제공한다.
실험 결과
연구 질문
- RQ1희소 근사 및 EP 기반 추론을 사용하여 중간 규모에서 대규모로 Deep Gaussian Processes를 효율적으로 학습할 수 있는가?
- RQ2제안된 FITC-DGP가 근사 EP 및 확률적 역전파를 사용하는 경우 표준 GP 및 베이지안 NN에 비해 회귀 성능 및 불확실성 정량화를 개선하는가?
- RQ3레이어 추가, 차원 수 증가, 유도 포인트 증가가 DGP의 예측 성능 및 불확실성에 어떻게 영향을 미치는가?
- RQ4변분적 접근 방식과 비교하여 계산 및 메모리 측면에서 방법이 확장 가능하면서도 정확성을 유지하는가?
주요 결과
- 제안된 추론 체계를 갖춘 DGP는 모든 테스트 데이터세트에서 GP 회귀를 능가한다.
- 추가 계층이나 더 높은 차원의 숨겨진 계층을 가진 DGP가 대체 기준보다 추가적인 예측 이점을 제공하는 경우가 많다.
- 평가된 작업에서 베이지안 신경망의 상태-최첨단 결정적 및 샘플링 기반 근사 추론 방법을 종종 능가한다.
- DGP는 잘 보정된 불확실성 추정 및 경쟁력 있는 RMSE를 제공하며, VI 기반 BNN 방법은 일반적으로 불확실성 정량화에서 저성능을 보인다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.