Skip to main content
QUICK REVIEW

[論文レビュー] Faster Kernel Ridge Regression Using Sketching and Preconditioning

Haim Avron, Kenneth L. Clarkson|arXiv (Cornell University)|Nov 10, 2016
Sparse and Compressive Sensing Techniques参考文献 30被引用数 5
ひとこと要約

この論文は、ランダム特徴マップ(例:ランダムフーリエ特徴)を用いて、カーネルリッジ回帰(KRR)の反復的解法を高速化する、新しいプリコンディショニング技術を提案する。少数のランダム特徴からプリコンディショナを構築することで、カーネル行列の条件数を低減し、実用的には近似的に線形時間計算量で正確なKRRシステムを高速に解けるようにする。100万件のデータ例までを扱うデータセットにおいて、最先端の性能を達成する。

ABSTRACT

Kernel Ridge Regression (KRR) is a simple yet powerful technique for non-parametric regression whose computation amounts to solving a linear system. This system is usually dense and highly ill-conditioned. In addition, the dimensions of the matrix are the same as the number of data points, so direct methods are unrealistic for large-scale datasets. In this paper, we propose a preconditioning technique for accelerating the solution of the aforementioned linear system. The preconditioner is based on random feature maps, such as random Fourier features, which have recently emerged as a powerful technique for speeding up and scaling the training of kernel-based methods, such as kernel ridge regression, by resorting to approximations. However, random feature maps only provide crude approximations to the kernel function, so delivering state-of-the-art results by directly solving the approximated system requires the number of random features to be very large. We show that random feature maps can be much more effective in forming preconditioners, since under certain conditions a not-too-large number of random features is sufficient to yield an effective preconditioner. We empirically evaluate our method and show it is highly effective for datasets of up to one million training examples.

研究の動機と目的

  • n 個のデータポイントに対して O(n³) のコストを要する、密行列かつ悪条件な線形システムを解く必要があるカーネルリッジ回帰(KRR)の計算ボトル neck を解消すること。
  • 特に多数のランダム特徴を用いる場合に精度を犠牲にして速度を上げる既存の近似手法の限界を克服すること。
  • ランダム特徴マップを直接カーネル関数の近似に使うのではなく、正確なKRRシステムにおける反復的解法の収束を改善するために活用するプリコンディショニング戦略を開発すること。
  • 少数のランダム特徴を用いてカーネル行列の条件数を制限することで、大幅に短縮された実行時間で高精度なKRR解を得ること。
  • 100万件のトレーニング例を含む大規模データセットにおいて、一般化性能を損なわずに本手法の有効性を示すこと。

提案手法

  • カーネル関数そのものの近似に使うのではなく、カーネル行列にランダム特徴マップ(例:ランダムフーリエ特徴)を適用してプリコンディショナを構築する。
  • ランダム特徴マップを用いてカーネル行列の低ランク近似を生成し、これを線形システム (K + λI)c = y のプリコンディショニングに用いる。
  • Krylov部分空間法(例:共役勾配法)を用いてプリコンディショニングされたシステムを解き、条件数の改善により収束が著しく速くなる。
  • 理論的分析により、多項式カーネルの場合、ランダム特徴の数を統計的次元(有効自由度)に比例させると、プリコンディショニングされたカーネル行列の条件数が定数で有界になることが示される。
  • プリコンディショナは O(ns²) 時間で効率的に計算可能であり、s は n よりもはるかに小さい。
  • スケッチ(ランダム特徴による)とプリコンディショニングを組み合わせることで、O(n²) から O(n³) の間の実行時間となり、実用的にはしばしば O(n²) のように動作する。

実験結果

リサーチクエスチョン

  • RQ1ランダム特徴マップをカーネルの直接的近似としてではなく、正確なKRRの反復的解法を高速化するためのプリコンディショナとして効果的に使用できるか?
  • RQ2ランダム特徴の数とプリコンディショニングされたカーネル行列の条件数との間には、理論的にどのような関係があるか?
  • RQ3少数のランダム特徴をプリコンディショナとして使用することで、多数の特徴を用いた直接近似手法よりも収束が速く、一般化性能が優れているか?
  • RQ4本手法は、100万例までのデータセットにおいて、どのようにスケーリングするか?
  • RQ5悪条件なカーネル行列に対して、非プリコンディショニング手法と比較して、本手法のプリコンディショニングアプローチは反復的解法の収束性とロバスト性を向上させるか?

主な発見

  • 提案手法は実用的に近似的に線形時間計算量で動作し、しばしば O(n²) のスケーリングを示す。標準的な O(n³) 直接法よりも顕著に優れている。
  • 多項式カーネルの場合、統計的次元に比例するランダム特徴の数を用いることで、プリコンディショニングされたシステムの条件数が定数で有界になる。
  • 最大100万例のデータセットにおいて、非プリコンディショニング共役勾配法および最先端のランダム特徴ベースのソルバーを上回るテスト誤差率を達成した。
  • 非プリコンディショニング共役勾配法が MNIST-200K および MNIST-300K で収束に失敗したのに対し、本手法は成功し、より低い誤差率を達成した。
  • 許容誤差 10⁻³ であっても、10⁻² とほぼ同一の一般化誤差が得られた。これは、より厳密な許容誤差がほとんど利益をもたらさないことを示しており、高精度結果を得る際の 10⁻³ の使用が妥当であることを裏付けている。
  • 多数のランダム特徴を必要としないにもかかわらず、高いモデル精度を維持でき、直接的ランダム特徴近似手法でよく見られる性能劣化を回避した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。