Skip to main content
QUICK REVIEW

[論文レビュー] Variational Inference in Sparse Gaussian Process Regression and Latent Variable Models - a Gentle Tutorial

Yarin Gal, Mark van der Wilk|arXiv (Cornell University)|Feb 6, 2014
Gaussian Processes and Bayesian Inference参考文献 7被引用数 7
ひとこと要約

本チュートリアルでは、スパースガウス過程回帰およびガウス過程潜在変数モデル(GPLVM)における変分推論の包括的な導出を提示し、大規模データセットにおける分散型でスケーラブルな推論を可能にする再パラメータライゼーションを導入する。主な貢献は、ハイパーパramータ、誘導点、潜在変数の明示的偏微分を備えた統一的で完全に導出可能なフレームワークであり、これにより並列GPモデルの拡張と実装が可能になる。

ABSTRACT

In this tutorial we explain the inference procedures developed for the sparse Gaussian process (GP) regression and Gaussian process latent variable model (GPLVM). Due to page limit the derivation given in Titsias (2009) and Titsias & Lawrence (2010) is brief, hence getting a full picture of it requires collecting results from several different sources and a substantial amount of algebra to fill-in the gaps. Our main goal is thus to collect all the results and full derivations into one place to help speed up understanding this work. In doing so we present a re-parametrisation of the inference that allows it to be carried out in parallel. A secondary goal for this document is, therefore, to accompany our paper and open-source implementation of the parallel inference scheme for the models. We hope that this document will bridge the gap between the equations as implemented in code and those published in the original papers, in order to make it easier to extend existing work. We assume prior knowledge of Gaussian processes and variational inference, but we also include references for further reading where appropriate.

研究の動機と目的

  • スパースガウス過程モデルの公開された数式とそのコード実装との間のギャップを埋めること。
  • 文献でしばしば省略されることがあるスパースGP回帰およびGPLVMの変分下界の完全で自己完結的な導出を提供すること。
  • データを条件付きに分離する再パラメータライゼーションにより、大規模データセットにおける効率的な最適化を可能にする分散型でスケーラブルな推論を可能にすること。
  • カーネルハイパーパramータ、誘導点の位置、および潜在入力(埋め込み)のすべての主要変数に対する明示的な解析的偏微分を提供すること。
  • 数式をオープンソースソフトウェア内の計算対応物に直接リンクすることで、コードの拡張と実装を支援すること。

提案手法

  • 本論文は、データを条件付きに分離する再パラメータライゼーションを用いて、スパースGP回帰およびGPLVMの変分下界を導出する。
  • 関数値上でのガウス近似 $ q(F|X) $ と、潜在入力上での変分分布 $ q(X_i) = \mathcal{N}(X_i; \mu_i, S_i) $ を採用する。
  • 下界 $ \mathcal{F} $ は、潜在関数を統合し、入力分布上の期待値をモーメントマッチングで近似することで導出される。
  • 主な構成要素には、カーネル行列の期待値 $ \langle K_{mi}^{X_i} \rangle_{q(X_i)} $、$ \langle K_{mi}^{X_i}K_{im}^{X_i} \rangle_{q(X_i)} $、および入力上の変分分布と事前分布のKLダイバージェンスが含まれる。
  • すべてのパramータ—$ \mu_i $、$ S_i $、カーネルハイパーパramータ(例:ARD付きRBF)、$ \beta $、および誘導点の位置—に対する解析的偏微分が導出される。
  • 正確な勾配を用いた最適化により、カーネルハイパーパramータと潜在変数の両方をエンドツーエンドで訓練可能になる。

実験結果

リサーチクエスチョン

  • RQ1スパースGP回帰およびGPLVMの変分下界は、すべての中間ステップを含めてどのように完全に導出できるか?
  • RQ2どのような再パラメータライゼーションが、これらのモデルにおける分散型でスケーラブルな推論を可能にするか?
  • RQ3すべてのモデルパラメータ(潜在入力および誘導点を含む)に対する正確な偏微分をどのように計算できるか?
  • RQ4変分目的関数におけるノイズ精度 $ \beta $ に対する勾配の解析的形は何か?
  • RQ5潜在入力上の変分分布と事前分布のKLダイバージェンスを効率的に計算・微分する方法は何か?

主な発見

  • 導出された変分下界は、Titsias & Lawrence (2010) のものと数学的に同等であるが、分散推論を可能にする再パラメータライゼーションが施されている。
  • $ \mu_{iq} $、$ S_{iq} $、$ \beta $ に対する下界の偏微分が明示的に導出されており、すべてのモデルパラメータの勾配ベース最適化が可能になる。
  • $ \mu_{iq} $ に対する勾配には、$ \alpha_q(\mu_{iq} - Z_{mq}) / (\alpha_q S_{iq} + 1) $ に比例する項が含まれ、潜在入力位置への感度を捉えている。
  • KLダイバージェンス $ KL(q(X_i) || p(X_i)) $ の $ \mu_i $ に対する微分は $ \mu_i $ であり、$ S_{iq} $ に対する微分は $ \frac{1}{2}(1 - 1/S_{iq}) $ である。
  • $ \beta $ に対する勾配には、行列逆行列のトレースと積の項が含まれており、行列微分の恒等式を用いて導出される。
  • 完全な導出により、カーネルハイパーパラメータと潜在変数の両方のスケーラブルで並列最適化が可能となり、大規模データセットへの応用が可能になる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。