Skip to main content
QUICK REVIEW

[論文レビュー] Distributed Adaptive Sampling for Kernel Matrix Approximation

Daniele Calandriello, Alessandro Lazaric|arXiv (Cornell University)|Mar 27, 2018
Gaussian Processes and Bayesian Inference参考文献 5被引用数 3
ひとこと要約

本稿では、非正規化リッジリーディングスコア(RLS)を用いて代表点の小型で高精度な辞書を構築することで、カーネル行列近似のための新規分散型適応的サンプリングアルゴリズムSQUEAKを提案する。SQUEAKは、辞書からのみRLSを推定し、データを1回のパスで処理することで、O~(nd_eff(γ)^3)の線形時間計算量を達成し、完全なカーネル行列を構築しないまま効率的なストリーミング処理および分散処理を可能にし、最小限のオーバーヘッドで正確なRLSサンプリングと同等の精度を達成する。

ABSTRACT

Most kernel-based methods, such as kernel or Gaussian process regression, kernel PCA, ICA, or $k$-means clustering, do not scale to large datasets, because constructing and storing the kernel matrix $\mathbf{K}_n$ requires at least $\mathcal{O}(n^2)$ time and space for $n$ samples. Recent works show that sampling points with replacement according to their ridge leverage scores (RLS) generates small dictionaries of relevant points with strong spectral approximation guarantees for $\mathbf{K}_n$. The drawback of RLS-based methods is that computing exact RLS requires constructing and storing the whole kernel matrix. In this paper, we introduce SQUEAK, a new algorithm for kernel approximation based on RLS sampling that sequentially processes the dataset, storing a dictionary which creates accurate kernel matrix approximations with a number of points that only depends on the effective dimension $d_{eff}(γ)$ of the dataset. Moreover since all the RLS estimations are efficiently performed using only the small dictionary, SQUEAK is the first RLS sampling algorithm that never constructs the whole matrix $\mathbf{K}_n$, runs in linear time $\widetilde{\mathcal{O}}(nd_{eff}(γ)^3)$ w.r.t. $n$, and requires only a single pass over the dataset. We also propose a parallel and distributed version of SQUEAK that linearly scales across multiple machines, achieving similar accuracy in as little as $\widetilde{\mathcal{O}}(\log(n)d_{eff}(γ)^3)$ time.

研究の動機と目的

  • 完全なカーネル行列の構築を要するため、O(n²)のメモリと計算時間を要するカーネル法のスケーラビリティのボトル neck を解消すること。
  • 従来のリッジリーディングスコア(RLS)サンプリングは、常に全カーネル行列の計算と保存を必要としているという制限を克服すること。
  • 高精度な近似を維持しつつ、最小限のメモリおよび計算オーバーヘッドで、ストリーミング処理および分散処理を可能にするアルゴリズムを設計すること。
  • 従来の適応的サンプリング手法が抱える極端な固有値(例:最小または最大固有値)に依存する問題を排除すること。
  • 動的または大規模なデータセットに対して、1パス処理および逐次的更新が可能な仕組みを提供すること。

提案手法

  • SQUEAKは、非正規化リッジリーディングスコア(RLS)をサンプリング確率として用い、全カーネル行列の計算を避けるために、現在の選択済み点の辞書からのみRLSを推定する。
  • アルゴリズムはデータを逐次的に1パスで処理し、推定されたRLSに基づいて動的に辞書を更新することで、スペクトル近似の保証を維持する。
  • 複雑な連続的なリサンプリングステップ間の依存関係を扱うために、新規なマルティングルに基づく解析を採用し、理論的精度バインディングを保証する。
  • データパーティションを独立して処理できるため、分散実装が可能であり、局所的辞書の階層的マージを可能にする。
  • カーネル行列は選択された列と正則化逆行列計算を用いたNyström型低ランク近似フレームワークで近似する。
  • 新規データを再計算なしに段階的に統合できるため、オンライン学習を自然にサポートする。

実験結果

リサーチクエスチョン

  • RQ1完全なカーネル行列を構築せずに、リッジリーディングスコアサンプリングを用いて高精度なカーネル行列近似を達成できるか?
  • RQ2理論的精度保証を維持しつつ、1パス処理およびストリーミング処理が可能なカーネル近似のアルゴリズムを設計できるか?
  • RQ3RLSに基づく適応的サンプリングを、メモリ効率的かつ分散システムにスケーラブルに実装できるか?
  • RQ4オンラインリサンプリングによって生じる複雑な逐次的依存関係をどのように解析できるか?
  • RQ5与えられたスペクトル近似精度を達成するために必要な最小辞書サイズは何か? また、固有値に依存しない形でそのサイズを達成できるか?

主な発見

  • SQUEAKは、サンプル数nに線形に依存する計算量 Õ(n d_eff(γ)^3) を達成し、大規模データセットへのスケーラビリティを実現する。
  • アルゴリズムは、全カーネル行列K_nを一度も構築せず、RLS推定にローカルな辞書情報のみに依存する。
  • SQUEAKは、正確なRLSサンプリングと同等の理論的スペクトル近似保証を提供し、辞書サイズは有効次元d_eff(γ)に比例する。
  • SQUEAKの分散版は複数のマシンに線形にスケーリングされ、Õ(log(n) d_eff(γ)^3)の時間で近似を達成する。
  • SQUEAKはストリーミングおよび分散環境を両方サポートし、1パス処理と完全再計算なしのインクリメンタル更新を可能にする。
  • 非正規化RLSの使用と新規なマルティングルに基づく解析により、SQUEAKは極端な固有値に依存せず、従来の手法よりもロバスト性が向上する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。