Skip to main content
QUICK REVIEW

[논문 리뷰] Scalable Multi-Class Gaussian Process Classification using Expectation Propagation

Carlos Villacampa-Calvo, Daniel Hernández-Lobato|arXiv (Cornell University)|2017. 06. 22.
Gaussian Processes and Bayesian Inference참고 문헌 16인용 수 7
한 줄 요약

이 논문은 유도점과 확률적 최적화를 사용한 기대치법(EP)을 활용한 확장 가능한 다중 분류 가우시안 프로세스 분류 방법을 제안한다. 로그-우도를 데이터 인스턴스별로 합산하도록 재구성함으로써 확률적 그래디언트와 미니배치 학습이 가능해지며, 계산 비용은 $Ó(CM^3)$, 메모리 비용은 $Ó(CM^2)$로 줄여, 수백만 개의 인스턴스를 포함한 데이터셋에서도 효율적인 학습이 가능해지며, 예측 정확도와 수렴 속도에서 변분 추론보다 뛰어난 성능을 보인다.

ABSTRACT

This paper describes an expectation propagation (EP) method for multi-class classification with Gaussian processes that scales well to very large datasets. In such a method the estimate of the log-marginal-likelihood involves a sum across the data instances. This enables efficient training using stochastic gradients and mini-batches. When this type of training is used, the computational cost does not depend on the number of data instances $N$. Furthermore, extra assumptions in the approximate inference process make the memory cost independent of $N$. The consequence is that the proposed EP method can be used on datasets with millions of instances. We compare empirically this method with alternative approaches that approximate the required computations using variational inference. The results show that it performs similar or even better than these techniques, which sometimes give significantly worse predictive distributions in terms of the test log-likelihood. Besides this, the training process of the proposed approach also seems to converge in a smaller number of iterations.

연구 동기 및 목표

  • 대규모 데이터셋에 대한 다중 분류 가우시안 프로세스 분류의 확장성 한계를 해결하기 위해.
  • EP 기반 추론에서 확률적 그래디언트와 미니배치를 활용한 효율적인 학습을 가능하게 하기 위해.
  • 유도점과 근사 우도를 통해 다중 분류 GP 분류의 메모리 및 계산 비용을 줄이기 위해.
  • 기존의 변분 추론 방법과 비교해 예측 성능과 수렴 속도를 향상시키기 위해.
  • EP 기반 방법이 테스트 로그-우도 측면에서 변분 추론보다 더 신뢰할 수 있는 예측 분포를 제공함을 입증하기 위해.

제안 방법

  • 유도점의 수가 $M \ll N$ 인 $M$개의 유도점을 사용하여 잠재 변수의 수를 $Ó(N)$에서 $Ó(M)$으로 줄이는 FITC(Fully Independent Training Conditional) 근사를 적용한다.
  • 로그-우도를 데이터 인스턴스별 합산으로 재구성함으로써, 미니배치를 사용한 확률적 최적화가 가능해진다.
  • 우도 계산에서 비용이 많이 드는 1차원 적분을 피하기 위해 새로운 근사 우도를 사용한다.
  • 데이터를 미니배치 단위로 처리함으로써 메모리 사용량을 더 줄이기 위해 확률적 EP(SEP)을 도입한다.
  • 학습률 하이퍼파rameter가 필요로 하지 않는 EP 업데이트를 사용하여 사후 분포를 근사함으로써 더 빠른 수렴을 가능하게 한다.
  • 각 잠재 함수는 공분산 함수를 가진 가우시안 프로세스로 모델링되며, 분류 규칙은 각 입력에서 잠재 함수의 argmax에 기반한다.

실험 결과

연구 질문

  • RQ1기대치법(EP)이 다중 분류 가우시안 프로세스 분류에서 확률적 최적화를 가능하게 하도록 어떻게 적응시킬 수 있는가?
  • RQ2제안된 방법이 대규모 데이터셋에서 테스트 로그-우도 측면에서 변분 추론보다 더 나은 예측 성능을 보일 수 있는가?
  • RQ3계산 비용과 메모리 비용을 각각 $Ó(CM^3)$ 및 $Ó(CM^2)$로 줄일 수 있는가? 이를 통해 수백만 개의 인스턴스로도 확장 가능한가?
  • RQ4왜 변분 추론은 때로 나쁜 예측 분포를 생성하는가? EP 기반 방법은 이 문제를 피할 수 있는가?
  • RQ5EP와 변분 추론 간의 유도점 배치 방식은 어떻게 다른가? 이는 모델 성능에 어떤 영향을 미치는가?

주요 결과

  • 제안된 EP 기반 방법은 MNIST 데이터셋에서 테스트 오차 2.08%와 음성 테스트 로그-우도 0.0725를 기록하며, 예측 정확도에서 변분 추론을 능가한다.
  • 210만 개의 인스턴스를 포함한 대규모 항공기 지연 데이터셋에서, 변분 추론보다 빠르게 수렴하며, 로지스틱 회귀 기반 모델을 신속히 능가한다.
  • 변분 추론의 음성 테스트 로그-우도는 학습 중에 증가하는 경향을 보이며, 이는 예측 분포의 품질이 열 劣하다는 것을 시사한다. 반면 EP와 SEP는 안정적이고 더 우수한 성능을 유지한다.
  • 확률적 EP(SEP)는 학습률에 의존하지 않는 더 효율적인 EP 업데이트 덕분에 변분 추론보다 더 빠르게 수렴한다.
  • 이 방법은 유도점을 유도점 배치 전략이 자르기 전략과 유사하게 배치하는 반면, 변분 추론은 결정 경계 근처에 집중하는 경향이 있다.
  • 이러한 접근은 다중 분류 GP 분류에서 확률적 최적화를 지원하고 수백만 개의 인스턴스로도 확장 가능한 첫 번째 EP 기반 방법이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.