Skip to main content
QUICK REVIEW

[論文レビュー] Scaling Gaussian Processes with Derivative Information Using Variational Inference

Misha Padidar, Xinran Zhu|arXiv (Cornell University)|Jul 8, 2021
Gaussian Processes and Bayesian Inference参考文献 39被引用数 9
ひとこと要約

本稿では、誘導的勾配微分を用いて勾配観測値をスパース化することで、スケーラブルなガウス過程の変分推論手法を導入する。この手法により、訓練の計算量が O(M³p³) に削減され、高次元・大規模な設定でも効率的な推論が可能となり、驚くべきことに、微分データが存在しない場合でも、方向微分による構造的情報をエンコードすることで回帰性能が向上する。

ABSTRACT

Gaussian processes with derivative information are useful in many settings where derivative information is available, including numerous Bayesian optimization and regression tasks that arise in the natural sciences. Incorporating derivative observations, however, comes with a dominating $O(N^3D^3)$ computational cost when training on $N$ points in $D$ input dimensions. This is intractable for even moderately sized problems. While recent work has addressed this intractability in the low-$D$ setting, the high-$N$, high-$D$ setting is still unexplored and of great value, particularly as machine learning problems increasingly become high dimensional. In this paper, we introduce methods to achieve fully scalable Gaussian process regression with derivatives using variational inference. Analogous to the use of inducing values to sparsify the labels of a training set, we introduce the concept of inducing directional derivatives to sparsify the partial derivative information of a training set. This enables us to construct a variational posterior that incorporates derivative information but whose size depends neither on the full dataset size $N$ nor the full dimensionality $D$. We demonstrate the full scalability of our approach on a variety of tasks, ranging from a high dimensional stellarator fusion regression task to training graph convolutional neural networks on Pubmed using Bayesian optimization. Surprisingly, we find that our approach can improve regression performance even in settings where only label data is available.

研究の動機と目的

  • 高次元・大規模な設定において、微分観測値を伴うガウス過程の学習にかかる O(N³D³) の計算コストを軽減すること。
  • データセットサイズ N と入力次元 D の両方と効率的にスケーリングする変分推論フレームワークを構築すること。
  • 関数値のための誘導点と同様に、勾配情報のためのスパース近似メカニズムとして、誘導的方向微分を導入すること。
  • グラフニューラルネットワークの学習や核融合エネルギーモデリングといった、現実世界の高次元問題への有効性を実証すること。
  • 訓練データに微分データが存在しない場合でも、微分情報を含むモデルが性能向上を達成できるかどうかを調査すること。

提案手法

  • 本手法は、学習可能な誘導的方向微分を用いて微分情報を組み込んだ変分事後分布を導入し、N や D に依存するのを軽減する。
  • 尤度下限界(ELBO)をラベル観測値と部分微分観測値の和として定式化し、ラベルと勾配の混合ミニバッチを用いた確率的勾配降下法を可能にする。
  • 主な革新点は、ランダムな方向における方向微分を十分統計量として用いることで、微分情報を低次元表現に圧縮できること。
  • 訓練の計算量は1イテレーションあたり O(M³p³) に削減され、M ≪ N かつ p ≪ D であるため、大規模な N や D に対してもスケーラブルである。
  • 標準的なスパースGP手法を一般化し、方向微分を介して誘導点フレームワークを微分観測値へと拡張する。
  • 微分データの有無にかかわらず、本手法は対応可能であり、後者では構造的エンコードによって予期しない性能向上が見られる。

実験結果

リサーチクエスチョン

  • RQ1誘導的方向微分を用いた変分推論は、高次元・大規模な設定において、微分情報付きのスケーラブルなガウス過程回帰を達成できるか?
  • RQ2方向微分を誘導変数として用いることで、微分付きの正確なGP推論と比較して予測精度を保持できるか?
  • RQ3微分データが存在しない学習でさえ、微分情報を含む変分パラメータを組み込むことで回帰性能が向上するか?
  • RQ4本手法は、星間プラズマ融合データやグラフニューラルネットワーク最適化といった現実世界の高次元データセットにおいて、実際のスケーリング特性を示すか?
  • RQ5誘導的方向微分の数(p)と誘導点の数(M)が、モデル性能と計算コストに与える影響は何か?

主な発見

  • 本手法は N と D の両方において完全なスケーラビリティを達成し、訓練の計算量を O(M³p³) に削減することで、従来の正確なGP推論では不可能だった大規模な問題への応用を可能にした。
  • 星間プラズマ融合回帰タスクにおいて、微分情報付きのスケーラブルな回帰を成功裏に実行し、ベースライン手法を上回った。
  • PubMedにおけるグラフ畳み込みニューラルネットワークのベイズ最適化において、不確実性評価を伴うエンドツーエンドのスケーラブルな学習を実現した。
  • 微分データが存在しないUCI回帰ベンチマークにおいて、DSVGP1 と DPPGPR1 は、標準的な SVGP や PPGPR よりも低い MSE と NLL を達成し、微分情報を含む構造的エンコードによる予期しない性能向上を示した。
  • 合成データおよび表面再構築タスクにおいて、DSKI [5] よりも優れた近似品質とスケーラビリティを示した。
  • 驚くべきことに、微分観測値が存在しない場合でも、誘導的方向微分を含むモデルは回帰性能を向上させた。これは、方向微分によるエンコードが、新たな形のインダクティブバイアスをもたらす可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。