Skip to main content
QUICK REVIEW

[論文レビュー] Ridge Leverage Scores for Low-Rank Approximation

Michael B. Cohen, Cameron Musco|arXiv (Cornell University)|Nov 23, 2015
Stochastic Gradient Optimization Techniques参考文献 50被引用数 15
ひとこと要約

この論文は、入力行列の $\alpha$-正則化版上で計算されるリッジレバレッジスコアを導入し、重要度サンプリングを用いた一様でロバストな低ランク近似を可能にする。正則化を活用することで、入力スパarsity時間の反復的カラムサブセット選択アルゴリズムと、ストリーム長に依存しないメモリ空間の単一パスストリーミングカラムサブセット選択という、長年の未解決問題を解決する。

ABSTRACT

Often used as importance sampling probabilities, leverage have become indispensable in randomized algorithms for linear algebra, optimization, graph theory, and machine learning. A major body of work seeks to adapt these to approximation problems. However, existing low-rank leverage scores can be difficult to compute, often work for just a single application, and are sensitive to matrix perturbations. We show how to avoid these issues by exploiting connections between approximation and regularization. Specifically, we employ ridge leverage scores, which are simply standard leverage computed with respect to an $\ell_2$ regularized input. Importance sampling by these gives the first unified solution to two of the most important sampling problems: $(1+\epsilon)$ error column subset selection and $(1+\epsilon)$ error projection-cost preservation. Moreover, ridge leverage satisfy a key monotonicity property that does not hold for any prior leverage scores. Their resulting robustness leads to two sought-after results in randomized linear algebra. 1) We give the first input-sparsity time approximation algorithm based on iterative column sampling, resolving an open question posed in [LMP13], [CLM+15], and [AM15]. 2) We give the first single-pass streaming column subset selection algorithm whose real-number space complexity has no dependence on stream length.

研究の動機と目的

  • 既存の低ランクレバレッジスコアの限界を解決する。それらは計算が困難であり、アプリケーションに特化している上に摂動に対して感受性が強い。
  • $(1+\epsilon)$ の誤差を持つカラムサブセット選択と、$(1+\epsilon)$ の誤差を持つ射影コスト保存性の2つの根本的なサンプリング問題を統一すること。
  • 行列の摂動に対してロバストであり、従来のレバレッジスコアが満たさない新しい単調性の性質を満たす方法を開発すること。
  • 特に、入力スパarsity時間での反復的カラムサブセット選択と、空間複雑度がストリーム長に依存しない単一パスストリーミングアルゴリズムという、ランダム化線形代数分野における未解決問題を解決すること。
  • 低ランク近似における標準レバレッジスコアの理論的裏付けが強く、計算的にも効率的な代替手法を提供すること。

提案手法

  • リッジレバレッジスコアを、行列 $A + \alpha I$ に対して $\ell_2$ 正則化を施した上で標準レバレッジスコアを計算することで定義する。
  • 低ランク近似におけるカラム選択のための重要度サンプリング確率としてリッジレバレッジスコアを用いる。
  • 正則化と近似の関係を活用し、行列の摂動に対して安定性と単調性を保証する。
  • リッジレバレッジスコアを用いてカラム選択を誘導することで、入力スパarsity時間で実行される反復的カラムサブセット選択アルゴリズムを設計する。
  • ストリーム長に依存しない空間複雑度で、$(1+\epsilon)$ の誤差を持つカラムサブセットを選択する単一パスストリーミングアルゴリズムを構築する。
  • リッジレバレッジスコアが単調性の性質を満たすことを証明し、行列の更新やノイズに対して一貫性のある挙動を示すことを保証する。

実験結果

リサーチクエスチョン

  • RQ1リッジレバレッジスコアは、$(1+\epsilon)$ の誤差を持つカラムサブセット選択と射影コスト保存性の両方を統一的フレームワークで解決できるか?
  • RQ2標準レバレッジスコアと比較して、正則化はレバレッジスコアの行列摂動に対するロバスト性を向上させるか?
  • RQ3リッジレバレッジスコアは、入力スパarsity時間での反復的カラムサブセット選択アルゴリズムを可能にし、ランダム化線形代数分野における未解決問題を解消できるか?
  • RQ4リッジレバレッジスコアを用いて、ストリーム長に依存しない空間複雑度を持つ単一パスストリーミングアルゴリズムを設計できるか?
  • RQ5リッジレバレッジスコアは、従来のレバレッジスコア定義では見られない単調性の性質を満たすか?

主な発見

  • リッジレバレッジスコアは、従来のいかなるレバレッジスコア定義でも満たさない、新しい単調性の性質を満たしており、摂動に対して安定性が向上する。
  • 提案手法は、単一の統一されたサンプリングフレームワークを用いて、カラムサブセット選択および射影コスト保存性の両方で $(1+\epsilon)$ の誤差を達成する。
  • 入力スパarsity時間で動作する、レバレッジスコアに基づく最初の反復的カラムサブセット選択アルゴリズムが達成され、[LMP13]、[CLM+15]、[AM15] で提起された未解決問題が解決された。
  • ストリーム長に依存しない実数空間複雑度を持つ単一パスストリーミングアルゴリズムが開発され、従来手法に比べて顕著な改善が達成された。
  • リッジレバレッジスコアは、正則化と重要度サンプリングを組み合わせることで、ロバストかつ効率的な低ランク近似を可能にし、理論的にも優れた保証を得られる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。