Skip to main content
QUICK REVIEW

[論文レビュー] Randomized Clustered Nystrom for Large-Scale Kernel Machines

Farhad Pourkamali‐Anaraki, Stephen Becker|arXiv (Cornell University)|Dec 20, 2016
Stochastic Gradient Optimization Techniques被引用数 5
ひとこと要約

本稿では、ランダム射影を用いてランドマーク点をクラスタリングし、より良い低ランク近似を計算するための新しいQRベースのアルゴリズムを採用することで、大規模なカーネル機械学習の効率性と正確性を向上させる確率的クラスタリングNyström法を提案する。この手法は、特に高次元データにおいて、計算コストを著しく削減しつつ、ほぼSVDに近い正確性を達成する。

ABSTRACT

The Nystrom method has been popular for generating the low-rank approximation of kernel matrices that arise in many machine learning problems. The approximation quality of the Nystrom method depends crucially on the number of selected landmark points and the selection procedure. In this paper, we present a novel algorithm to compute the optimal Nystrom low-approximation when the number of landmark points exceed the target rank. Moreover, we introduce a randomized algorithm for generating landmark points that is scalable to large-scale data sets. The proposed method performs K-means clustering on low-dimensional random projections of a data set and, thus, leads to significant savings for high-dimensional data sets. Our theoretical results characterize the tradeoffs between the accuracy and efficiency of our proposed method. Extensive experiments demonstrate the competitive performance as well as the efficiency of our proposed method.

研究の動機と目的

  • 大規模なカーネル機械学習におけるNyströmに基づく低ランク近似の正確性と効率性を向上させること。
  • 既存のクラスタリングNyström法における高次元データにおけるK-meansクラスタリングの高い計算コストを解消すること。
  • ランドマーク点の数がターゲットランクrを上回る場合でも、最適なランク-r近似を可能にする手法を開発すること。
  • ランダム射影に基づくランドマーク選択により、近似正確性と計算効率の間で調整可能なトレードオフを提供すること。

提案手法

  • m > r の場合に、最適なランク-r近似を計算するための新アルゴリズム「QR分解によるNyström」を提案。QR分解を用いて最適な低ランク因子を抽出する。
  • 低次元のランダム射影の上でK-meansクラスタリングを実行することで、計算コストとメモリ使用量を削減する確率的ランドマーク選択戦略を導入。
  • 高次元データをp′ ≈ 10次元に圧縮するためにランダム射影(Achlioptas, 2003)を用い、データを2パスで処理可能にする。
  • 圧縮係数γを用いて調整可能であり、これは射影空間の次元を制御し、正確性と効率性のバランスを取る。
  • 理論的分析(定理2)により、フルクラスタリングNyströmと比較して正確性の損失がほとんどない低ランク近似が得られることを示す。
  • ガウスカーネル関数を用い、カーネルリッジ回帰およびカーネル行列近似のタスクで性能を評価。

実験結果

リサーチクエスチョン

  • RQ1ランドマーク点の数がターゲットランクを上回る場合、カーネル行列の低ランク近似をより正確かつ効率的に計算できるか?
  • RQ2高次元データのK-meansクラスタリングの前段階として、ランダム射影を用いて次元を低減することが有効に機能するか?
  • RQ3提案された確率的クラスタリングNyström法は、計算コストとメモリ使用量を著しく削減しながらも、高い近似正確性を維持できるか?
  • RQ4精度と実行時間の観点から、本手法は一様抽出、コラムノルム抽出、およびフルクラスタリングNyströmと比較してどのように性能を発揮するか?

主な発見

  • 提案された「QR分解によるNyström」手法は、標準的なNyström法よりも優れた近似正確性を達成しており、特にm > rの場合に顕著で、同じ正確性を達成するためのランドマーク点の数が少ない。
  • cpusmallデータセット(n=8,192, p=48)では、m=644で近似誤差0.074を達成し、m=966で実行時間と同等の性能を発揮したが、誤差は0.187にまで低下した。
  • E2006-tfidfデータセット(n=5,363, p=150,360)では、フルクラスタリングNyströmと比較して計算複雑度を2桁低減しながら、ほぼ同一の正確性を維持した。
  • r=82の場合、m=2rのランドマーク点でSVDに近い正確性を達成し、一様抽出およびコラムノルム抽出を上回った。
  • p′=10のランダム射影次元で、SVDや固有値分解による最良のランク-r近似に非常に近い近似品質が得られた。
  • 理論的分析により、確率的手法が高確率で、フルクラスタリングNyström法と比較して最小限の正確性損失を伴う低ランク近似を生成することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。