Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Gaussian Processes with Decoupled Inducing Inputs

Marton Havasi, José Miguel Hernández-Lobato|arXiv (Cornell University)|2018. 01. 09.
Gaussian Processes and Bayesian Inference참고 문헌 3인용 수 3
한 줄 요약

이 논문은 딥 가우시안 프로세스(DGPs)에서 평균과 분산 계산을 위한 별도의 유도 점 집합을 사용하는 분리된 유도 입력을 도입한다. 분산 추정을 위한 유도 점 수를 줄이고 평균 추정을 위한 유도 점 수를 유지함으로써, 예측 성능을 향상시키면서도 불확실성 캘리브레이션을 훼손하지 않고 더 빠른 학습을 달성한다.

ABSTRACT

Deep Gaussian Processes (DGP) are hierarchical generalizations of Gaussian Processes (GP) that have proven to work effectively on a multiple supervised regression tasks. They combine the well calibrated uncertainty estimates of GPs with the great flexibility of multilayer models. In DGPs, given the inputs, the outputs of the layers are Gaussian distributions parameterized by their means and covariances. These layers are realized as Sparse GPs where the training data is approximated using a small set of pseudo points. In this work, we show that the computational cost of DGPs can be reduced with no loss in performance by using a separate, smaller set of pseudo points when calculating the layerwise variance while using a larger set of pseudo points when calculating the layerwise mean. This enabled us to train larger models that have lower cost and better predictive performance.

연구 동기 및 목표

  • 딥 가우시안 프로세스(DGPs)의 학습 계산 비용을 줄이되, 예측 성능에 영향을 주지 않도록 하는 것.
  • 기존 표준 GP에서 효과적으로 입증된 평균과 분산 계산을 위한 유도 입력의 분리가 딥 GP 환경으로 확장될 수 있는지 조사하는 것.
  • 더 큰 DGP 아키텍처를 더 낮은 계산 오버헤드로 가능하게 하여 모델의 확장성을 향상시키는 것.
  • 분리된 접근 방식이 표준 DGPs에 비해 더 나은 일반화 및 불확실성 추정을 이끌어내는지 평가하는 것.
  • 유도 점 최적화 과정에서의 점점 줄어드는 기울기 문제를 개선된 파rameterization으로 해결하는 것.

제안 방법

  • 표준 GP에서의 분리된 GP 프레임워크(Cheng & Boots, 2017)를 DGPs에 적용하기 위해, 평균 계산을 위한 $\bm{Z}_a$와 분산 계산을 위한 $\bm{Z}_b$라는 두 개의 별도 유도 입력 집합을 사용한다.
  • 표준 GP의 평균과 공분산 계산을 이중 파rameterization으로 대체한다: $\tilde{\mu} = \bm{K}_{\bm{X}\bm{Z}_a}\bm{a}$ 와 $\tilde{\Sigma} = \bm{K}_{\bm{X}\bm{X}} - \bm{K}_{\bm{X}\bm{Z}_b}(\bm{B}^{-1} + \bm{K}_{\bm{Z}_b\bm{Z}_b})^{-1}\bm{K}_{\bm{X}\bm{Z}_b}^T$.
  • 모든 층에서 별도의 유도 입력 집합을 고려하여 ELBO를 조정한 변분 추론 프레임워크를 DGPs에 유지한다.
  • 최적화 중 수치적 안정성을 확보하기 위해 $\bm{S}$와 $\bm{B}$에 대한 콜레스키 분해를 사용한다.
  • 5000 에포크 동안 고정된 학습률 0.01로 미니배치를 사용한 확률적 경량 최적화(Adam)를 적용한다.
  • 학습 안정성 확보와 공분산 행렬의 열악한 형태 방지를 위해 각 층에 정적 평균 함수를 적용한다.

실험 결과

연구 질문

  • RQ1평균과 분산 계산을 위한 유도 입력의 분리를 딥 가우시안 프로세스에 성공적으로 확장할 수 있는가?
  • RQ2유사한 계산 비용을 가진 표준 DGP에 비해 분리된 DGP가 더 높은 예측 성능을 달성하는가?
  • RQ3특히 더 깊은 아키텍처에서 분리된 DGP가 더 계산 효율적인가?
  • RQ4평균($M_a$)과 분산($M_b$)을 위한 유도 점 집합 크기의 선택이 모델 성능과 학습 시간에 어떤 영향을 미치는가?
  • RQ5분리된 접근 방식이 DGP 최적화 과정에서 발생하는 점점 줄어드는 기울기 문제를 완화하는가?

주요 결과

  • 모든 세 데이터셋(kin8nm, protein, molecules)에서 분리된 DGP는 표준 DGP보다 더 높은 테스트 로그우도를 달성했다.
  • kin8nm에서 이중층 모델를 제외한 모든 데이터셋에서 분리된 DGP는 표준 DGP보다 더 낮은 테스트 루트 평균 제곱 오차(RMSE)를 기록했다.
  • 최소한 하나의 은닉층을 가진 모델에서는 분리된 DGP가 더 빠른 학습 속도를 보였으며, molecules 데이터셋에서 중앙값 실행 시간이 최대 30% 감소했다.
  • 분리된 모델에서 $M_a = 500$, $M_b = 100$일 경우, 깊은 모델(예: molecules에서 $L=4$)의 경우 표준 DGP($M = 200$)보다 훨씬 낮은 런타임(1017초 대비 1601초)을 기록했다.
  • 성능 향상은 특히 $M_b$를 줄임으로써 계산적 이점이 가장 크게 작용하는 더 깊은 아키텍처에서 두드러졌다.
  • 분리된 접근 방식은 복잡도 상한 $O\big{(}L(DNM_a + M_a^3 + DNM_b^2 + M_b^3)\big{)}$을 달성하였으며, 큰 배치 크기에서 이론적 최적에 가까운 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.