Skip to main content
QUICK REVIEW

[論文レビュー] Scalable Gaussian Processes with Billions of Inducing Inputs via Tensor Train Decomposition

Pavel Izmailov, Alexander Novikov|arXiv (Cornell University)|Oct 19, 2017
Gaussian Processes and Bayesian Inference参考文献 4被引用数 10
ひとこと要約

この論文では、高次元の入力空間におけるガウス過程(GP)のスケーラビリティを向上させるため、Tensor Train(TT)分解を用いたスケーラブルなガウス過程手法TT-GPを提案する。TT-GPは、10億個の誘導入力(inducing inputs)を用いた学習を可能にし、回帰および分類ベンチマークで最先端の性能を達成する。TT形式の変分パラメータとKronecker構造をもつ共分散行列、およびディープカーネル学習を組み合わせることで、特徴空間次元に対して線形スケーリングを実現し、GPフレームワークを変更せずに高次元データの有効なモデリングを可能にする。

ABSTRACT

We propose a method (TT-GP) for approximate inference in Gaussian Process (GP) models. We build on previous scalable GP research including stochastic variational inference based on inducing inputs, kernel interpolation, and structure exploiting algebra. The key idea of our method is to use Tensor Train decomposition for variational parameters, which allows us to train GPs with billions of inducing inputs and achieve state-of-the-art results on several benchmarks. Further, our approach allows for training kernels based on deep neural networks without any modifications to the underlying GP model. A neural network learns a multidimensional embedding for the data, which is used by the GP to make the final prediction. We train GP and neural network parameters end-to-end without pretraining, through maximization of GP marginal likelihood. We show the efficiency of the proposed approach on several regression and classification benchmark datasets including MNIST, CIFAR-10, and Airline.

研究の動機と目的

  • 既存のガウス過程手法が最大で10^4個の誘導入力に制限されているスケーラビリティの限界を克服すること。
  • 大規模かつ高次元のデータセット、特にディープニューラルネットワークベースのカーネルを用いたガウス過程の効率的学習を可能にすること。
  • メモリおよび計算コストを大幅に削減するため、コンactなテンソル分解を用いた予測精度を維持する変分推論フレームワークの開発。
  • GPモデルのアーキテクチャを変更せずに、ディープカーネルガウス過程のエンドツーエンド学習を可能にすること。
  • 大規模データセット上で、深層カーネルGPを用いたスケーラブルな不確実性推定と構造的予測を可能にすること。

提案手法

  • 本手法は、誘導点関数値の変分分布の平均ベクトルをパラメータライズするためにTensor Train(TT)分解を用い、高次元ベクトルのコンact表現を可能にする。
  • 誘導変数の共分散行列にKronecker積構造を採用することで、記憶容量と計算コストを削減する。
  • 変分推論手順は確率的勾配降下法を用いて最適化され、大規模データセットにおけるスケーラブルな学習を可能にする。
  • GPモデルに変更を加えずに、ディープニューラルネットワークの出力をGPの入力として使用することで、ディープカーネル学習をサポートする。
  • 特徴空間に規則的な誘導入力のグリッドを構築し、低ランクテンソル形式を用いてこのグリッド上でのGP事後分布を推論する。
  • モデルの複雑さと一般化性能を制御するためにTTランクを用い、ランク選択には交差検証またはヒューリスティックな初期化を用いる。

実験結果

リサーチクエスチョン

  • RQ1予測精度を維持したまま、10億個の誘導入力を用いたガウス過程モデルをスケーリングできるか?
  • RQ2Tensor Train分解が、GP推論における変分分布のパラメータ化に有効に機能し、メモリおよび計算コストを削減できるか?
  • RQ3平均ベクトルにTT形式を、共分散行列にKronecker構造を組み合わせることで、特徴空間次元に対して線形スケーリングが可能になるか?
  • RQ4GPモデルのアーキテクチャを変更せずに、TT-GPが生のデータからディープカーネル関数を効果的に学習できるか?
  • RQ5高次元データセットにおいて、TT-GPはKISS-GP や SV-DKL といった既存手法と比較して、精度および学習効率の面で優れているか?

主な発見

  • TT-GPはAirlineデータセットで最先端の性能を達成し、600万件の訓練例を用いて分類精度0.788±0.002を達成した。
  • CIFAR-10では、9次元の埋め込みを用いたディープカーネルにより、0.908±0.003の精度に到達し、単独のDNNやSV-DKLの結果を上回った。
  • MNISTでは、10次元の埋め込みを用いて0.9936±0.0004の精度を達成し、単独のDNNと同等の性能を発揮したが、GPの不確実性評価を完全に保持した。
  • MNISTでは1エポックあたり64秒、CIFAR-10では1エポックあたり220秒の高速な学習が、Tesla K80 GPUを用いて実現された。
  • TT-GPはDNN埋め込みの非線形変換を効果的に学習し、同じクラスに属するサンプルを埋め込み空間内でコンパクトな領域にグループ化した。
  • 本手法は10億個の誘導入力へスケーリング可能であり、従来の手法が失敗する大規模かつ高次元のデータセットに対しても、高精度なGP近似を実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。