[論文レビュー] Randomly Projected Additive Gaussian Processes for Regression
本稿では、高次元入力をランダムまたは決定的投影に適用した1次元カーネルの和を用いる、ランダムに投影された加法的ガウス過程(RPA-GP)および決定的投影された加法的ガウス過程(DPA-GP)を提案する。驚くべきことに、性能は1次元の投影ですでにフル次元カーネルに急速に収束する。これにより、投影の学習を必要とせず、高速でスケーラブルな回帰が可能になる。
Gaussian processes (GPs) provide flexible distributions over functions, with inductive biases controlled by a kernel. However, in many applications Gaussian processes can struggle with even moderate input dimensionality. Learning a low dimensional projection can help alleviate this curse of dimensionality, but introduces many trainable hyperparameters, which can be cumbersome, especially in the small data regime. We use additive sums of kernels for GP regression, where each kernel operates on a different random projection of its inputs. Surprisingly, we find that as the number of random projections increases, the predictive performance of this approach quickly converges to the performance of a kernel operating on the original full dimensional inputs, over a wide range of data sets, even if we are projecting into a single dimension. As a consequence, many problems can remarkably be reduced to one dimensional input spaces, without learning a transformation. We prove this convergence and its rate, and additionally propose a deterministic approach that converges more quickly than purely random projections. Moreover, we demonstrate our approach can achieve faster inference and improved predictive accuracy for high-dimensional inputs compared to kernels in the original input space.
研究の動機と目的
- トレーニング可能な投影を必要とせずに、ガウス過程回帰における次元の呪いに対処すること。
- 学習を伴わない方法を構築し、予測精度を維持しながら計算複雑性を著しく低減すること。
- ランダムな投影における加法的カーネルが、最小限の投影でフル次元カーネルを近似できることを示すこと。
- 投影された入力における加法的構造を活用して、構造的カーネル補間(SKI)によるスケーラブルな推論を可能にすること。
- RPA-GPおよびDPA-GPの性能を、高次元および大規模データセットにおける標準的なGPカーネルおよび加法的モデルと比較すること。
提案手法
- RPA-GPは、入力データの複数のランダムな投影に1次元カーネルを適用することで、加法的ガウス過程を構築する。
- 各カーネルは独立にランダムな投影上で作用し、それらの和が全体のカーネル関数を形成する。
- 本手法は、高次元カーネルを加法的投影によって近似するためのターニングバンド法(TBM)を活用する。
- DPA-GPは、冗長性を最小限に抑える決定的投影方式を導入し、極限カーネルへの収束を加速する。
- 本アプローチにより、問題をJ個の1次元サブ問題に分解することで、構造的カーネル補間(SKI)の利用が可能になる。
- 理論的分析により、RPA-GPが、投影数Jが増加するにつれて、O(J−1/2)のレートで逆多重二次カーネルに収束することが証明されている。
実験結果
リサーチクエスチョン
- RQ1トレーニングのための投影を学習せず、低次元空間へのランダムな投影によって、フル次元カーネルと同等の予測性能を達成できるか?
- RQ2RPA-GPの予測性能が、投影数が増加するにつれて、フル次元カーネルにどの程度の速さで収束するか?
- RQ3決定的投影方式(DPA-GP)が、純粋にランダムな投影よりも収束速度と精度で優れているか?
- RQ4投影された入力における加法的構造を活用することで、高次元設定においてSKIによるスケーラブルな推論が可能になるか?
- RQ5大規模または高次元データセットにおいて、RPA-GPは標準的なGPカーネルおよび加法的モデル(例:GAM GP)と比較して、精度とスケーラビリティの面で優れているか?
主な発見
- RPA-GPは、1次元への投影ですでにフル次元カーネルと同等の予測性能を達成しており、多様なデータセットで収束が観察された。
- RPA-GPが逆多重二次カーネルに収束するレートは、O(J−1/2)であることが理論的に証明された。ここでJは投影数である。
- 決定的投影手法であるDPA-GPは、RPA-GPよりも収束が早く、特に大規模データセットにおいて予測精度が向上した。
- SKIを用いたRPA-GPは、線形時間の学習と定数時間の予測を実現し、計算複雑性をO(n³)からO(Jc(n + m))に低減した。ここでmは誘導点の数である。
- 高次元データ(例:d=1935)において、DPA-GP-ARDは、トレーニング点数nが入力次元dに対して小さい場合、RBFおよびGAM GPsを上回った。
- 実験的結果から、RPA-GPおよびDPA-GPは1000以上の入力次元に対しても効果的にスケーリング可能であり、nに比例して学習時間が線形に増加する一方、コレスキー分解に基づく推論とは異なり、計算時間は非線形に増加しないことが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。