Skip to main content
QUICK REVIEW

[論文レビュー] A Subspace Learning Approach to High-Dimensional Matrix Decomposition with Efficient Information Sampling

Mostafa Rahmani, George Atia|arXiv (Cornell University)|Feb 1, 2015
Sparse and Compressive Sensing Techniques参考文献 74被引用数 9
ひとこと要約

この論文は、小さな効率的なデータスケッチを用いて問題を部分空間学習タスクに変換することで、低ランク+スパース行列分解のスケーラブルな部分空間追求手法を提案する。計算コストを削減するため、O(rμ)個の列/行のみをサンプリングし、構造的データに対して非一様サンプリングを用いることで効率を向上させ、オンライン実装を可能にする。

ABSTRACT

This paper is concerned with the problem of low-rank plus sparse matrix decomposition for big data. Conventional algorithms for matrix decomposition use the entire data to extract the low-rank and sparse components, and are based on optimization problems that scale with the dimension of the data, which limit their scalability. Furthermore, the existing randomized approaches mostly rely on uniform random sampling, which can be quite inefficient for many real world data matrices that exhibit additional structures (e.g. clustering). In this paper, a scalable subspace-pursuit approach that transforms the decomposition problem to a subspace learning problem is proposed. The decomposition is carried out using a small data sketch formed from sampled columns/rows. Even when the data is sampled uniformly at random, it is shown that the sufficient number of sampled columns/rows is roughly O(r \mu), where \mu is the coherency parameter and r the rank of the low-rank component. In addition, efficient sampling algorithms are proposed to address the problem of column/row sampling from structured data. The proposed sampling algorithms can be independently used for feature selection from high-dimensional data. The proposed approach is amenable to online implementation and an online scheme is proposed.

研究の動機と目的

  • 全データ行列を処理する従来の低ランク+スパース行列分解アルゴリズムのスケーラビリティ制限に対処すること。
  • クラスタリングなどの固有構造を示すデータにおいて特に非効率な均一ランダムサンプリングを有する既存のランダム化アプローチの非効率性を克服すること。
  • 行列分解を部分空間学習問題に変換することで、小さなデータスケッチを用いた効率的な計算を可能にすること。
  • 構造的データに適した効率的なサンプリングアルゴリズムを開発し、高次元特徴選択に再利用可能なものとする。
  • ストリーミングまたは進化するデータ向けに、分解プロセスのオンライン実装を可能にすること。

提案手法

  • 全データ処理に依存しないように、低ランク+スパース行列分解を部分空間学習問題に再定式化すること。
  • サンプリングされた列または行を用いて小さなデータスケッチを構築し、最適化問題の次元を著しく低減すること。
  • 理論的分析により、O(rμ)個のサンプル列/行が、正確な分解に十分であることが示され、ここでrは低ランク成分、μはコherエンスパラメータである。
  • クラスタリングなどのデータ構造に特化した非一様サンプリング戦略を提案し、均一サンプリングよりも効率を向上させること。
  • 新規データの到着に伴い段階的に分解を更新するオンライン版アルゴリズムを設計すること。
  • サンプリングと分解パイプラインを統合し、高次元データにおける特徴選択のためのサンプリングアルゴリズムを分解パイプラインとは独立して使用可能にする。

実験結果

リサーチクエスチョン

  • RQ1行列分解を部分空間学習問題に効果的に再定式化することで、スケーラビリティが向上するか?
  • RQ2均一サンプリング下で、正確な低ランク+スパース分解に必要な最小サンプル数は何か?
  • RQ3クラスタリングやその他のパターンを示す構造的データ行列に対して、どのようにしてサンプリングを効率化できるか?
  • RQ4提案手法はオンラインまたはインクリメンタルデータ処理に適応可能か?
  • RQ5実世界の構造的データにおいて、非一様サンプリング戦略は均一サンプリングに比べてどの程度性能を向上させるか?

主な発見

  • 提案手法は、O(rμ)個のサンプル列または列のみを用いて正確な低ランク+スパース行列分解を達成し、計算負荷を顕著に低減する。
  • 均一サンプリングでさえも、サンプルサイズがO(rμ)に達すると、回復精度に関する理論的保証を維持する。
  • 非一様サンプリング戦略は、クラスタリングパターンを示すデータに対して均一サンプリングを上回る性能を示す。
  • 開発されたサンプリングアルゴリズムは高次元特徴選択に効果的であり、分解パイプラインとは独立して使用可能である。
  • アルゴリズムのオンライン版は、分解の段階的更新を可能にし、ストリーミングデータ応用に適している。
  • 全体的なアプローチは高次元データに効率的にスケーリングされ、ビッグデータ応用における実用的妥当性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。