Skip to main content
QUICK REVIEW

[論文レビュー] Deep Gaussian Covariance Network

Kevin Cremanns, Dirk Roos|arXiv (Cornell University)|Oct 17, 2017
Gaussian Processes and Bayesian Inference参考文献 34被引用数 14
ひとこと要約

本稿では、入力に依存するハイパーパramータ(特に相関長スケールθおよびノイズ分散σ²)を学習するための深層ニューラルネットワークを用いる、新しいフレームワークであるDeep Gaussian Covariance Network(DGCN)を提案する。非定常的で適応可能な共分散関数を可能にし、バッチ/オンライン学習をサポートすることで、DGCNは多様な回帰および時系列タスクにおいて予測精度を向上させ、すべてのテストベンチマークで最先端の手法、特にDeep Gaussian Processesを上回る性能を発揮した。

ABSTRACT

The correlation length-scale next to the noise variance are the most used hyperparameters for the Gaussian processes. Typically, stationary covariance functions are used, which are only dependent on the distances between input points and thus invariant to the translations in the input space. The optimization of the hyperparameters is commonly done by maximizing the log marginal likelihood. This works quite well, if the distances are uniform distributed. In the case of a locally adapted or even sparse input space, the prediction of a test point can be worse dependent of its position. A possible solution to this, is the usage of a non-stationary covariance function, where the hyperparameters are calculated by a deep neural network. So that the correlation length scales and possibly the noise variance are dependent on the test point. Furthermore, different types of covariance functions are trained simultaneously, so that the Gaussian process prediction is an additive overlay of different covariance matrices. The right covariance functions combination and its hyperparameters are learned by the deep neural network. Additional, the Gaussian process will be able to be trained by batches or online and so it can handle arbitrarily large data sets. We call this framework Deep Gaussian Covariance Network (DGCP). There are also further extensions to this framework possible, for example sequentially dependent problems like time series or the local mixture of experts. The basic framework and some extension possibilities will be presented in this work. Moreover, a comparison to some recent state of the art surrogate model methods will be performed, also for a time dependent problem.

研究の動機と目的

  • 入力空間が非一様または疎な領域において、相関長スケールθが最適でない場合に生じる定常的ガウス過程の限界を解消すること。
  • 各テストポイントに対して最適な共分散関数の組み合わせとハイパーパrameterを自動で学習できる、スケーラブルでエンドツーエンドトレーニング可能なフレームワークを構築すること。
  • ガウス過程における大規模データ応用における計算ボトル neck を克服するため、バッチおよびオンライン学習を可能にするフレームワークの構築。
  • 時系列などの逐次的かつ非定常的問題における予測性能を向上させること。具体的には、深層ニューラルネットワークを用いて動的ハイパーパrameterを学習することで実現する。

提案手法

  • テストポイントx*ごとに、入力に依存するハイパーパrameterθ*(x*)およびσ²*(x*)を予測するための深層ニューラルネットワーク(DNN)を訓練する。
  • 複数の共分散関数が予測において加法的に組み合わされ、それぞれのハイパーパラメータがDNNによって同時に最適化される。
  • 完全な共分散行列の逆行列計算を回避することで、大規模なデータセットにおいても効率的な学習が可能なミニバッチおよびオンライン学習をサポートする。
  • ハイパーパラメータの最適化にはADAMなどの標準的な深層学習最適化手法を用い、目的関数として対数尤度を採用する。
  • 過去の入力/出力を特徴量として含めることで、時系列問題への拡張が可能となり、時間的依存性のモデリングが可能になる。
  • DNNはハイパーパラメータの学習に加え、一般化性能の向上に寄与する異なるカーネルタイプの最適な組み合わせの学習も行う。

実験結果

リサーチクエスチョン

  • RQ1深層ニューラルネットワークは、非定常的または疎な入力領域におけるガウス過程の入力に依存するハイパーパラメータを効果的に学習でき、予測性能の向上に寄与するか?
  • RQ2提案されたDGCNフレームワークは、多様な回帰および時系列タスクにおいて、最先端の代替手法(特にDeep Gaussian Processes)と比較して、どの程度優れた性能を示すか?
  • RQ3DGCNフレームワークは、ミニバッチまたはオンライン学習を用いることで、大規模データセットに対するスケーラブルな学習をどの程度実現できるか?
  • RQ4手動チューニングなしに、DGCNフレームワークは複数の共分散関数を自動で選択・組み合わせることができるか?その結果、一般化性能が向上するか?
  • RQ5学習された空間的に変化する長スケールθ*により、局所的な感度推定が改善されるか?

主な発見

  • ボストン住宅データセットでは、DGCNがすべての比較手法より低いRMSEを達成し、平均RMSEは0.259 ± 0.01(次善の手法は0.285)であった。
  • UCI回帰ベンチマークにおいて、DGCNは5つの例のうち4つでDeep Gaussian Processes(DGP)を上回った。RMSEはそれぞれ、コンクリートで3.67 ± 0.06、エネルギー1で0.37 ± 0.01、エネルギー2で0.54 ± 0.01、kin8nmで0.06 ± 0.00であった。
  • パワーデータセットでは、DGCNが2.91 ± 0.00のRMSEを達成し、DGPの2.95 ± 0.30よりもわずかに優れていたが、後者の方が分散が高かった。
  • フレームワークは、時系列および回帰問題を含むさまざまな問題タイプにおいて一貫した性能を示し、DNNアーキテクチャの再チューニングを必要としなかった。
  • バッチ処理によるスケーラブルな学習が可能となり、kin8nm(8,192サンプル)やpower(9,568サンプル)といった大規模データセットを効率的に処理できるようになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。