Skip to main content
QUICK REVIEW

[논문 리뷰] Scalable Gaussian Processes with Billions of Inducing Inputs via Tensor Train Decomposition

Pavel Izmailov, Alexander Novikov|arXiv (Cornell University)|2017. 10. 19.
Gaussian Processes and Bayesian Inference참고 문헌 4인용 수 10
한 줄 요약

이 논문은 고차원 입력에 대해 수십억 개의 유도 입력을 사용할 수 있도록 허용하는 확장 가능한 가우시안 프로세스 방법인 TT-GP를 소개한다. 이는 텐서 트레이스(TT) 분해를 사용하여 회귀 및 분류 벤치마크에서 최고 성능을 달성한다. TT 형식의 변환 매개변수와 크로네커 구조의 공분산, 딥 커널 학습을 조합함으로써 TT-GP는 특성 공간 차원에 대해 선형 스케일링을 달성하여 기존 GP 프레임워크를 수정하지 않고도 고차원 데이터의 효과적인 모델링을 가능하게 한다.

ABSTRACT

We propose a method (TT-GP) for approximate inference in Gaussian Process (GP) models. We build on previous scalable GP research including stochastic variational inference based on inducing inputs, kernel interpolation, and structure exploiting algebra. The key idea of our method is to use Tensor Train decomposition for variational parameters, which allows us to train GPs with billions of inducing inputs and achieve state-of-the-art results on several benchmarks. Further, our approach allows for training kernels based on deep neural networks without any modifications to the underlying GP model. A neural network learns a multidimensional embedding for the data, which is used by the GP to make the final prediction. We train GP and neural network parameters end-to-end without pretraining, through maximization of GP marginal likelihood. We show the efficiency of the proposed approach on several regression and classification benchmark datasets including MNIST, CIFAR-10, and Airline.

연구 동기 및 목표

  • 기존 가우시안 프로세스 방법이 최대 10^4개의 유도 입력으로 제한되는 확장성 한계를 극복하기 위해.
  • 딥 뉴럴 네트워크 기반 커널을 사용하는 대규모 고차원 데이터셋에서 가우시안 프로세스의 효율적 훈련을 가능하게 하기 위해.
  • 낮은 랭크 텐서 분해를 통해 메모리 및 계산 비용을 크게 줄이면서도 예측 정확도를 유지하는 변분 추론 프레임워크를 개발하기 위해.
  • GP 모델의 아키텍처를 수정하지 않고도 딥 커널 가우시안 프로세스의 엔드 투 엔드 훈련을 지원하기 위해.
  • 대규모 데이터셋에서 깊이 있는 커널 GPs를 사용하여 확장 가능한 불확실성 추정과 구조화된 예측을 가능하게 하기 위해.

제안 방법

  • 방법은 유도점 기능 값에 대한 변분 분포의 평균 벡터를 파arameter화하기 위해 텐서 트레이스(TT) 분해를 사용하여 고차원 벡터의 압축 표현을 가능하게 한다.
  • 유도 변수의 공분산 행렬에 크로네커 곱의 구조를 적용하여 저장 및 계산 비용을 감소시킨다.
  • 스토하스틱 그래디언트 디센트를 사용하여 변분 추론 절차를 최적화하여 대규모 데이터셋에서의 확장 가능한 훈련을 가능하게 한다.
  • 딥 뉴럴 네트워크의 출력을 GP의 입력으로 사용함으로써 딥 커널 학습을 지원하며, GP 모델에 대한 수정 없이도 가능하다.
  • 특성 공간에 정규 격자를 형성하고, 낮은 랭크 텐서 형식을 사용하여 이 격자 위에서 GP 사후분포를 추론한다.
  • 모델 복잡도와 일반화 능력을 제어하기 위해 TT-랭크를 사용하며, 랭크 선택은 교차 검증 또는 히우리스틱 초기화를 통해 수행된다.

실험 결과

연구 질문

  • RQ1예측 정확도를 유지하면서도 수십억 개의 유도 입력을 사용할 수 있는 가우시안 프로세스 모델을 확장시킬 수 있는가?
  • RQ2텐서 트레이스 분해가 GP 추론에서 변분 분포를 효과적으로 파arameter화하여 메모리 및 계산 비용을 줄일 수 있는가?
  • RQ3평균 벡터에 대해 TT 형식을, 공분산 행렬에 대해 크로네커 구조를 조합함으로써 특성 공간 차원에 대해 선형 스케일링이 가능한가?
  • RQ4GP 모델의 아키텍처를 수정하지 않고도 TT-GP가 원시 데이터로부터 깊이 있는 커널 함수를 효과적으로 학습할 수 있는가?
  • RQ5고차원 데이터셋에서 기존 방법인 KISS-GP 및 SV-DKL과 비교해 TT-GP의 정확도 및 훈련 효율성은 어떠한가?

주요 결과

  • TT-GP는 600만 개의 훈련 예제를 사용하여 항공사 데이터셋에서 0.788±0.002의 분류 정확도로 최고 성능을 달성했다.
  • CIFAR-10에서 TT-GP는 9차원 임베딩을 사용한 딥 커널을 통해 0.908±0.003의 정확도를 달성했으며, 독립적인 DNN보다 뛰어나거나 동등한 SV-DKL 결과를 초월했다.
  • MNIST에서는 10차원 임베딩을 사용해 0.9936±0.0004의 정확도를 기록했으며, 독립적인 DNN 성능을 따라했지만 전체 GP 불확실성 정량화 기능을 제공했다.
  • TT-GP는 효율적으로 훈련되며, Tesla K80 GPU를 사용할 경우 MNIST에서는 1에포크당 64초, CIFAR-10에서는 1에포크당 220초가 소요되었다.
  • TT-GP는 DNN 임베딩의 비선형 변환을 효과적으로 학습하여 같은 클래스의 샘플들을 임베딩 공간에서 조밀한 영역으로 그룹화했다.
  • 이 방법은 수십억 개의 유도 입력으로 확장 가능하여 이전 방법이 실패하는 대규모 고차원 데이터셋에서 고정밀도 GP 근사 모델링을 가능하게 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.