Skip to main content
QUICK REVIEW

[論文レビュー] Iterative Row Sampling

Mu Li, Gary L. Miller|arXiv (Cornell University)|Nov 12, 2012
Stochastic Gradient Optimization Techniques参考文献 4被引用数 5
ひとこと要約

本稿では、高さが広がった行列($n \gg d$)の回帰問題を解くための反復的行サンプリングアルゴリズムを提案する。このアルゴリズムは、入力スパarsity時間計算量 $O(\mathrm{nnz}(A) + d^{\omega+\theta}\epsilon^{-2})$ を達成する。低ランク近似の計算とリービングスコアの更新を交互に繰り返すことで、反復ごとに行列サイズが幾何的に減少し、従来の1パス法よりも理論的保証が向上した、保証付きの高精度な解を得る。

ABSTRACT

There has been significant interest and progress recently in algorithms that solve regression problems involving tall and thin matrices in input sparsity time. These algorithms find shorter equivalent of a n*d matrix where n >> d, which allows one to solve a poly(d) sized problem instead. In practice, the best performances are often obtained by invoking these routines in an iterative fashion. We show these iterative methods can be adapted to give theoretical guarantees comparable and better than the current state of the art. Our approaches are based on computing the importances of the rows, known as leverage scores, in an iterative manner. We show that alternating between computing a short matrix estimate and finding more accurate approximate leverage scores leads to a series of geometrically smaller instances. This gives an algorithm that runs in $O(nnz(A) + d^{ω+ θ} ε^{-2})$ time for any $θ> 0$, where the $d^{ω+ θ}$ term is comparable to the cost of solving a regression problem on the small approximation. Our results are built upon the close connection between randomized matrix algorithms, iterative methods, and graph sparsification.

研究の動機と目的

  • 高さが広がった行列の回帰において、実用的な反復的手法と理論的保証のギャップを埋めること。
  • 動的リービングスコア推定を活用して、精度を維持しながら行列サイズを反復的に縮小する手法の設計。
  • 特に $\ell_2$ および $\ell_1$ 回帰設定において、最先端の1パス法と同等またはそれ以上の実行時間の達成。
  • ランダム化行列アルゴリズム、反復的手法、グラフスパース化の間の関係を回帰の文脈で形式化すること。
  • 実際の反復的サンプリングの経験的成功の背後にある理論的基盤を提供すること、特に大規模データ解析において。

提案手法

  • アルゴリズムは、$\mathbf{A}$ からの行サンプリングによる短い行列近似 $\mathbf{B}$ の構築と、$\mathbf{B}$ を用いた近似リービングスコアの更新を交互に繰り返す。
  • リービングスコアは $\ell_p$-ノルム近似($p \in [1,2]$)を用いて推定され、サンプリング確率の計算が強固かつ効率的に行える。
  • $\tilde{\mathbf{A}}$ と $\mathbf{C}$ を用いて、well-conditioned 基底を構築し、$\|\mathbf{A}\mathbf{C}\mathbf{x}\|_p \approx \|\tilde{\mathbf{A}}\mathbf{C}\mathbf{x}\|_p$ が定数倍の誤差内で保たれることを保証する。
  • 固定点反復プロセスを用い、反復ごとに行数が幾何的に減少することで、行列サイズの二重指数的収束が達成される。
  • 最終的な行列 $\mathbf{B}$ は、任意の $\theta > 0$ に対して $O(d^{4\sqrt{2}-2+\theta})$ 行を含み、$p=2$ の場合の漸近的行数を最小化する。
  • 行列濃度とノルム同値性を用いた理論的保証により、$\|\mathbf{A}\mathbf{x} - \mathbf{b}\|_p$ が $1+\epsilon$ 要因内で保持されることを示す。

実験結果

リサーチクエスチョン

  • RQ1適応的リービングスコア推定を伴う反復的行サンプリングは、1パス法と同等またはそれ以上の理論的実行時間境界を達成できるか?
  • RQ2$\ell_p$ 回帰の精度を保つために必要な最小の行数は、$p \in [1,2]$ の場合にどの程度か?
  • RQ3ランダム化行列アルゴリズム、反復的手法、グラフスパース化の間の関係を形式化することで、回帰性能の向上を図れるか?
  • RQ4リービングスコアの反復的精製による幾何的行削減は、既存の入力スパarsity法よりも保証付きで高速なアルゴリズムを実現できるか?
  • RQ5$\ell_2$ および $\ell_1$ 回帰において、理論的保証を伴う反復的サンプリングで達成可能な最小行数はどの程度か?

主な発見

  • アルゴリズムは、任意の $\theta > 0$ に対して $O(\mathrm{nnz}(A) + d^{\omega+\theta}\epsilon^{-2})$ 時間で実行され、既知の最良の理論的境界と一致またはそれを上回る。
  • $\ell_2$ 回帰では、任意の $\theta > 0$ に対して $O(d^{4\sqrt{2}-2+\theta})$ 行を達成し、$p' = \sqrt{2}$ で最小化される。
  • 反復ごとに行列サイズが二重指数的に減少し、$\mathrm{poly}(d)$ サイズのインスタンスへの急速な収束が達成される。
  • $\ell_2$ および $\ell_1$ 回帰の両方に対して理論的保証が確立され、$\ell_1$ の場合では $p \in [1,2]$ の $\ell_p$-ノルム近似に依存する。
  • フレームワークはすべての $p \in [1,2]$ に一般化可能であり、$p \geq 4$ の場合の行数は $O(d^{\sqrt{8/p} - 2})$ として導出される。
  • 実際の反復的サンプリングの経験的成功を形式化し、大規模データ解析におけるその使用の理論的根拠を提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。