Skip to main content
QUICK REVIEW

[논문 리뷰] Randomly Projected Additive Gaussian Processes for Regression

Ian Delbridge, David Bindel|arXiv (Cornell University)|2019. 12. 30.
Gaussian Processes and Bayesian Inference참고 문헌 37인용 수 12
한 줄 요약

이 논문은 고차원 입력의 무작위 또는 결정적 투영에 적용된 일변수 커널의 합을 사용하는 랜덤 프로젝션 가감성 가우시안 프로세스(RPA-GP)와 결정적 프로젝션 가감성 GP(DPA-GP)를 제안한다. 놀랍게도, 단일 차원 투영조차도 전체 차원 커널 성능에 빠르게 수렴하며, 프로젝션을 학습할 필요 없이 빠르고 확장 가능한 회귀가 가능하다.

ABSTRACT

Gaussian processes (GPs) provide flexible distributions over functions, with inductive biases controlled by a kernel. However, in many applications Gaussian processes can struggle with even moderate input dimensionality. Learning a low dimensional projection can help alleviate this curse of dimensionality, but introduces many trainable hyperparameters, which can be cumbersome, especially in the small data regime. We use additive sums of kernels for GP regression, where each kernel operates on a different random projection of its inputs. Surprisingly, we find that as the number of random projections increases, the predictive performance of this approach quickly converges to the performance of a kernel operating on the original full dimensional inputs, over a wide range of data sets, even if we are projecting into a single dimension. As a consequence, many problems can remarkably be reduced to one dimensional input spaces, without learning a transformation. We prove this convergence and its rate, and additionally propose a deterministic approach that converges more quickly than purely random projections. Moreover, we demonstrate our approach can achieve faster inference and improved predictive accuracy for high-dimensional inputs compared to kernels in the original input space.

연구 동기 및 목표

  • 학습 가능한 프로젝션을 요구하지 않고 가우시안 프로세스 회귀에서 차원의 극복 문제를 해결하기 위해.
  • 학습 비용을 극도로 줄이며 예측 정확도를 유지하는 학습 불필요 방법을 개발하기 위해.
  • 무작위 투영을 통한 가감성 커널이 최소한의 투영으로 전체 차원 커널을 근사할 수 있는지 보여주기 위해.
  • 투영된 입력에서의 가감성 구조를 활용하여 구조적 커널 보간(SKI)을 통해 효율적인 추론을 가능하게 하기 위해.
  • 고차원 및 대규모 데이터셋에서 표준 GP 커널과 가감성 모델에 비해 RPA-GP와 DPA-GP의 성능을 비교하기 위해.

제안 방법

  • RPA-GP는 입력 데이터의 다수의 무작위 투영에 일변수 커널을 적용하여 가감성 GP를 구성한다.
  • 각 커널은 독립적으로 무작위 투영에 작용하며, 이들의 합이 전체 커널 함수를 형성한다.
  • 이 방법은 고차원 커널을 가감성 투영을 통해 근사하기 위해 트링 밴드 방법(TBM)을 활용한다.
  • DPA-GP는 부정확도를 최소화하고 한계 커널에 빠르게 수렴하는 결정적 투영 기법을 도입한다.
  • 이 접근법은 문제를 J개의 일변수 하위 문제로 분해함으로써 구조적 커널 보간(SKI)의 사용을 가능하게 한다.
  • 이론적 분석을 통해 RPA-GP가 투영 수 J가 증가함에 따라 O(J−1/2) 속도로 역 다항 커널로 수렴함을 증명하였다.

실험 결과

연구 질문

  • RQ1학습 프로젝션 없이 저차원 공간으로의 무작위 투영이 전체 차원 GP 커널과 비교해 예측 성능을 유사하게 달성할 수 있는가?
  • RQ2투영 수가 증가함에 따라 RPA-GP의 예측 성능이 전체 차원 커널로 수렴하는 속도는 어떠한가?
  • RQ3결정적 투영 기법(DPA-GP)이 순수 무작위 투영보다 수렴 속도와 정확도에서 뛰어나게 성능을 높일 수 있는가?
  • RQ4투영된 입력에서의 가감성 구조를 활용하면 고차원 환경에서 SKI를 통해 확장 가능한 추론이 가능할 수 있는가?
  • RQ5대규모 또는 고차원 데이터셋에서 RPA-GP는 표준 GP 커널과 가감성 모델(GAM GP 등)에 비해 정확도와 확장성 측면에서 어떻게 비교되는가?

주요 결과

  • RPA-GP는 단일 차원으로 투영하는 경우조차도 전체 차원 커널과 유사한 예측 성능을 달성하며, 다양한 데이터셋에서 수렴이 관찰되었다.
  • RPA-GP가 역 다항 커널로 수렴하는 속도는 투영 수 J에 대해 O(J−1/2)로 증명되었다.
  • 결정적 투영 방법인 DPA-GP는 RPA-GP보다 더 빠른 수렴 속도를 보이며, 특히 대규모 데이터셋에서 예측 정확도를 향상시켰다.
  • SKI를 사용한 RPA-GP는 선형 시간 학습과 일정 시간 예측을 가능하게 하여 계산 복잡도를 O(n³)에서 O(Jc(n + m))로 감소시켰다. 여기서 m은 유도점 수이다.
  • 고차원 데이터(D=1935)에서는 훈련 포인트 수 n이 입력 차원 d에 비해 작을 때 DPA-GP-ARD가 RBF 및 GAM GPs를 능가했다.
  • 실험 결과 RPA-GP와 DPA-GP는 1000개 이상의 입력 차원에 대해 효과적으로 확장 가능하며, n에 대해 선형적으로 훈련 시간이 증가하는 반면, 코レス키 기반 추론은 그렇지 않다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.