Skip to main content
QUICK REVIEW

[論文レビュー] Sparse Orthogonal Variational Inference for Gaussian Processes

Jiaxin Shi, Michalis K. Titsias|arXiv (Cornell University)|Oct 23, 2019
Gaussian Processes and Bayesian Inference参考文献 37被引用数 6
ひとこと要約

本稿では、誘導点を介してガウス過程を低ランク成分と直交なフルランクの残差過程に分解する、新しいフレームワークであるスパース直交変分ベイズ推論(SOLVE-GP)を提案する。これにより、よりスケーラブルで柔軟な推論が可能になる。直交成分のための第二の誘導変数の導入により、よりタイトな変分下界が達成され、完全にガウス過程ベースのモデルとしてCIFAR-10で最先端の性能を発揮し、1層あたり384+384個の誘導点を用いて80.30%の精度を達成した。

ABSTRACT

We introduce a new interpretation of sparse variational approximations for Gaussian processes using inducing points, which can lead to more scalable algorithms than previous methods. It is based on decomposing a Gaussian process as a sum of two independent processes: one spanned by a finite basis of inducing points and the other capturing the remaining variation. We show that this formulation recovers existing approximations and at the same time allows to obtain tighter lower bounds on the marginal likelihood and new stochastic variational inference algorithms. We demonstrate the efficiency of these algorithms in several Gaussian process models ranging from standard regression to multi-class classification using (deep) convolutional Gaussian processes and report state-of-the-art results on CIFAR-10 among purely GP-based models.

研究の動機と目的

  • 誘導点数に比例して立方的に増加する計算コストのボトル neck を解消すること。
  • 現行の手法が、著しく高価なコストを伴わずに誘導点数を柔軟に増やすことの制限を克服すること。
  • GP事前分布を2つの独立な成分に構造的・直交的に分解することで、変分推論の質を向上させること。
  • 二重誘導点定式化により、周辺尤度のよりタイトな下界を実現すること。
  • ニューラルネットワーク部品を一切含まない完全にGPベースのモデルで、CIFAR-10のような大規模なビジョンベンチマークで最先端の性能を達成すること。

提案手法

  • GP事前分布を、誘導点で張られる低ランク成分と、それと直交するフルランクの残差過程に分解する。
  • 直交残差過程を要約するための第二の誘導変数集合 $\mathbf{v}_\perp$ を導入し、効率的な推論を可能にする。
  • 標準的なSVGPをこの分解の特殊ケースとして再解釈することで、既存のスパースGP手法を統一的に理解する。
  • 両方の誘導点集合の集合にわたる構造的共分散近似を定式化し、よりタイトな変分下界を可能にする。
  • サブサンプリングと効率的なコレスキー更新を活用する確率的変分ベイズ推論アルゴリズムを開発し、$M_2$ の増加に伴うコストを $O(M_2^3)$ から $O(M_2)$ に削減する。
  • 特にベースラインSVGPにおける大きな共分散行列の最適化安定性を向上させるために、ホワイトニングトリックを用いる。

実験結果

リサーチクエスチョン

  • RQ1GP事前分布の直交成分への分解は、スパース変分ベイズ推論のスケーラビリティと柔軟性を向上させることができるか?
  • RQ2直交残差過程のための第二の誘導変数の導入により、周辺尤度の下界がタイトになるか?
  • RQ3このフレームワークにより、計算コストが立方的に増加することなく、有効な誘導点数を大幅に増やすことができるか?
  • RQ4回帰および分類ベンチマークにおける予測精度と学習効率の観点から、SOLVE-GPは標準的なSVGPおよびODVGPと比較してどのように性能を発揮するか?
  • RQ5完全にGPベースのモデルが、ニューラルネットワーク部品を一切含まずにCIFAR-10で最先端の性能を達成できるか?

主な発見

  • SOLVE-GPは、1層あたり384+384個の誘導点を用いた3層の深層畳み込みGPを用いて、CIFAR-10で80.30%のテスト精度を達成し、先行する完全にGPベースのモデルを上回った。
  • 同じ計算予算において、SOLVE-GPは $M=768, 768, 2K$ の誘導点を用いるが、SVGPは $M=1536, 1536, 2K$ を用いる場合に比べ、テスト精度と対数尤度の両面で優れた性能を発揮した。
  • SOLVE-GPは、$M=2048$ の誘導点を用いるSVGPと同等の性能を達成したが、コレスキー分解コストは半分に抑えられた。
  • 回帰ベンチマークにおいて、SOLVE-GPは $M_2=8096$ の誘導点を用いるODVGPを上回った。これは、変分分布における柔軟な共分散モデリングが、誘導点数の多さよりも重要であることを示している。
  • ホワイトニングトリックを用いることで、$M=2048$ のSVGPはSOLVE-GPに非常に近い性能にまで到達した。これは、大きな共分散行列における最適化の難易度が、SVGPの効果を制限している可能性を示唆している。
  • この手法により、標準的なSVGPと比較して、コレスキーコストが2倍に増加する一方で、誘導点数は2倍に増加でき、これは優れたスケーラビリティを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。