[論文レビュー] Deep Gaussian Processes with Decoupled Inducing Inputs
この論文は、平均と分散の計算に別々の誘導点を用いるデカップルド・インダクティング・インプットをディープガウス過程(DGPs)に導入する。分散推定に必要な誘導点の数を減らし、平均推定にはより多くの誘導点を維持することで、不確実性のキャリブレーションを損なわずに、トレーニング速度を向上させるとともに予測性能を向上させた。
Deep Gaussian Processes (DGP) are hierarchical generalizations of Gaussian Processes (GP) that have proven to work effectively on a multiple supervised regression tasks. They combine the well calibrated uncertainty estimates of GPs with the great flexibility of multilayer models. In DGPs, given the inputs, the outputs of the layers are Gaussian distributions parameterized by their means and covariances. These layers are realized as Sparse GPs where the training data is approximated using a small set of pseudo points. In this work, we show that the computational cost of DGPs can be reduced with no loss in performance by using a separate, smaller set of pseudo points when calculating the layerwise variance while using a larger set of pseudo points when calculating the layerwise mean. This enabled us to train larger models that have lower cost and better predictive performance.
研究の動機と目的
- ディープガウス過程(DGPs)のトレーニングにおける計算コストを削減するが、予測性能に影響を与えないようにする。
- 従来のガウス過程で有効であることが示された平均と分散の計算における誘導点のデカップリングが、ディープGP設定へと拡張可能かどうかを調査する。
- より大きなDGPアーキテクチャを、低い計算オーバーヘッドで可能にするために、スケーラビリティを向上させる。
- デカップルド・アプローチが、標準DGPと比較して、一般化性能および不確実性推定において優れているかどうかを評価する。
- 誘導点最適化における勾配の消失問題に対処するため、より優れたパrameterizationを提供する。
提案手法
- 標準的なGPのデカップルド・フレームワーク(Cheng & Boots, 2017)をDGPsに適応し、平均計算用の$\bm{Z}_a$と分散計算用の$\bm{Z}_b$という2つの別々の誘導入力セットを用いる。
- 標準的なGPの平均と共分散計算を、二重パrameterizationに置き換える:$\tilde{\mu} = \bm{K}_{\bm{X}\bm{Z}_a}\bm{a}$ および $\tilde{\Sigma} = \bm{K}_{\bm{X}\bm{X}} - \bm{K}_{\bm{X}\bm{Z}_b}(\bm{B}^{-1} + \bm{K}_{\bm{Z}_b\bm{Z}_b})^{-1}\bm{K}_{\bm{X}\bm{Z}_b}^T$。
- DGPsにおける変分推論フレームワークを維持し、各層で別々の誘導入力セットを考慮するようにELBOを適応させる。
- 最適化中の数値的安定性を確保するため、$\bm{S}$および$\bm{B}$のコレスキー分解を用いる。
- 5000エポックにわたり、固定学習率0.01でミニバッチを用いた確率的勾配降下法(Adam)を採用する。
- 各層ごとに静的な平均関数を適用し、トレーニングの安定性を高め、退化した共分散行列を回避する。
実験結果
リサーチクエスチョン
- RQ1平均と分散の計算における誘導点のデカップリングが、ディープガウス過程にうまく適用可能か?
- RQ2同等の計算コストのもとで、デカップルドDGPは標準DGPよりも優れた予測性能を達成するか?
- RQ3特に深層アーキテクチャにおいて、デカップルドDGPはより計算効率的か?
- RQ4平均用($M_a$)と分散用($M_b$)の誘導点セットサイズの選択が、モデル性能とトレーニング時間にどのように影響するか?
- RQ5デカップルド・アプローチは、DGP最適化における勾配の消失問題を緩和するか?
主な発見
- すべての3つのデータセット(kin8nm、protein、molecules)において、デカップルドDGPは標準DGPよりも高いテスト対数尤度を達成した。
- kin8nmの2層モデルを除き、すべてのデータセットでデカップルドDGPは標準DGPよりも低いテストルート・マンハッタン平均二乗誤差(RMSE)を達成した。
- 少なくとも1つの隠れ層を有するモデルでは、デカップルドDGPが標準DGPよりもトレーニングが速く、moleculesデータセットでは最大で30%の中央値ランタイム短縮が見られた。
- $M_a = 500$、$M_b = 100$のデカップルドモデルは、深層モデル(例:moleculesデータセットの$L=4$)において、$M = 200$の標準DGP(1017秒対1601秒)よりも著しく短いランタイムを達成した。
- 性能向上は、特に深層アーキテクチャで顕著であり、$M_b$の削減による計算の節約が最も効果的であった。
- デカップルド・アプローチは、大きなバッチサイズにおいて理論的最適に近い複雑度境界$O\big{(}L(DNM_a + M_a^3 + DNM_b^2 + M_b^3)\big{)}$を達成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。