Skip to main content
QUICK REVIEW

[論文レビュー] Efficient volume sampling for row/column subset selection

Amit Deshpande, Luis Rademacher|arXiv (Cornell University)|Apr 23, 2010
Sparse and Compressive Sensing Techniques参考文献 14被引用数 10
ひとこと要約

この論文は、行列からk行の部分集合を選択する際、それらが原点と形成する単体の平方体積に比例する確率で選択するボリュームサンプリングの効率的なアルゴリズムを提示している。これにより、フロベニウスノルム下での近似的に最良の低ランク行列近似が可能になる。本手法は、O(kmn^ω log n) 時間で、最良のランク-k近似に対する √(k+1)-近似を達成し、既知の下界と一致しており、従来の手法を改善する。

ABSTRACT

We give efficient algorithms for volume sampling, i.e., for picking $k$-subsets of the rows of any given matrix with probabilities proportional to the squared volumes of the simplices defined by them and the origin (or the squared volumes of the parallelepipeds defined by these subsets of rows). This solves an open problem from the monograph on spectral algorithms by Kannan and Vempala. Our first algorithm for volume sampling $k$-subsets of rows from an $m$-by-$n$ matrix runs in $O(kmn^ω \log n)$ arithmetic operations and a second variant of it for $(1+ε)$-approximate volume sampling runs in $O(mn \log m \cdot k^{2}/ε^{2} + m \log^ω m \cdot k^{2ω+1}/ε^{2ω} \cdot \log(k ε^{-1} \log m))$ arithmetic operations, which is almost linear in the size of the input (i.e., the number of entries) for small $k$. Our efficient volume sampling algorithms imply several interesting results for low-rank matrix approximation.

研究の動機と目的

  • 原点と形成する単体の平方体積に比例してk行の部分集合を選択するボリュームサンプリングのための効率的アルゴリズムの開発。
  • 低ランク行列近似におけるボリュームサンプリングの効率的計算に関するスペクトルアルゴリズム分野の未解決問題の解決。
  • フロベニウスノルムおよびスペクトルノルムの両方において、低ランク行列近似における行/列サブセット選択の近似的に最良の近似保証を達成すること。
  • 確率的バージョンと同一の計算量を達成する条件付き期待値の方法を用いた決定的アルゴリズムの提供。
  • スペクトルノルム近似において1行のみを用いる場合の近似品質の根本的限界を特定すること。

提案手法

  • 本論文は、部分行列の特徴多項式を活用することで、O(kmn^ω log n) の算術演算でボリュームサンプリングを計算する確率的アルゴリズムを導入している。
  • 条件付き期待値の方法に基づく変種を用いてアルゴリズムを決定的化し、同じ時間計算量で決定的かつ再現可能な結果を得ている。
  • 2番目のアルゴリズムは、小さなkに対して入力サイズにほぼ線形な時間で(1+ε)-近似ボリュームサンプリングを実現し、高度な行列集中とサンプリング技術を用いている。
  • 選択された行が形成する平行多面体の平方体積に対応するGram行列A_S A_S^Tの行列式を計算することに依存している。
  • A_S A_S^Tの特徴多項式とA_S^T A_Sの関係を活用することで、計算コストを削減している。
  • 射影後の残差行列の特異値を分析することで、スペクトルノルム近似に対してもこの手法を拡張している。

実験結果

リサーチクエスチョン

  • RQ1大規模行列に対して、低ランク近似における理論的優位性を示すボリュームサンプリングを効率的に計算できるか?
  • RQ2ボリュームサンプリングによる行サブセット選択で達成可能な最良の近似要因は何か? そして、その要因をアルゴリズム的に達成できるか?
  • RQ3入力サイズにほぼ線形な時間で(1+ε)-近似ボリュームサンプリングを実現できるアルゴリズムは存在するか? また、その近似保証は強いか?
  • RQ4スペクトルノルム近似において、行サブセット選択の根本的限界は何か? そして、kとnにどのように依存するか?
  • RQ5近似品質と計算効率の観点から、ボリュームサンプリングは、二乗長さサンプリングやSVDに基づくサンプリングと比べてどのように差がつくか?

主な発見

  • 本論文は、O(kmn^ω log n) の算術演算で実行される正確なボリュームサンプリングの確率的アルゴリズムを提示しており、実用的用途においても効率的である。
  • フロベニウスノルム下で最良のランク-k近似に対する √(k+1)-近似を達成しており、既知の下界と一致しており、従来のO(k√log k)-近似を改善している。
  • 条件付き期待値の方法を用いた決定的バージョンは、同じ近似度と実行時間を持つため、再現性が保証される。
  • スペクトルノルム近似において、同じ行サブセットは √((k+1)(n−k))-近似を与える。また、k=1の場合でもΩ(√n)の下界が証明されている。
  • 1行のみを用いたスペクトルノルム近似において、Ω(√n)のタイトな下界を確立しており、最悪ケースではいかなる1行でもこれより良い近似を達成できないことが示されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。