Skip to main content
QUICK REVIEW

[論文レビュー] Implementing Randomized Matrix Algorithms in Parallel and Distributed Environments

Jiyan Yang, Xiangrui Meng|arXiv (Cornell University)|Feb 10, 2015
Stochastic Gradient Optimization Techniques参考文献 94被引用数 11
ひとこと要約

本論文は、大規模な並列および分散システムにおけるℓ₁およびℓ₂回帰のための、通信を回避するフレームワークを提示する。ランダム射影およびサンプリングを活用して、事前処理付きまたはサブサンプルされた問題を構築することで、強い相対誤差保証を得つつ、入力スパarsityに近い実行時間で、I/Oおよびネットワーク遅延がFLOPSを上回る分散環境における通信コストを顕著に削減する。

ABSTRACT

In this era of large-scale data, distributed systems built on top of clusters of commodity hardware provide cheap and reliable storage and scalable processing of massive data. Here, we review recent work on developing and implementing randomized matrix algorithms in large-scale parallel and distributed environments. Randomized algorithms for matrix problems have received a great deal of attention in recent years, thus far typically either in theory or in machine learning applications or with implementations on a single machine. Our main focus is on the underlying theory and practical implementation of random projection and random sampling algorithms for very large very overdetermined (i.e., overconstrained) $\ell_1$ and $\ell_2$ regression problems. Randomization can be used in one of two related ways: either to construct sub-sampled problems that can be solved, exactly or approximately, with traditional numerical methods; or to construct preconditioned versions of the original full problem that are easier to solve with traditional iterative algorithms. Theoretical results demonstrate that in near input-sparsity time and with only a few passes through the data one can obtain very strong relative-error approximate solutions, with high probability. Empirical results highlight the importance of various trade-offs (e.g., between the time to construct an embedding and the conditioning quality of the embedding, between the relative importance of computation versus communication, etc.) and demonstrate that $\ell_1$ and $\ell_2$ regression problems can be solved to low, medium, or high precision in existing distributed systems on up to terabyte-sized data.

研究の動機と目的

  • 通信コストが計算コストを上回る分散環境において、テラバイト規模のデータセットにおける行列アルゴリズムのスケーリングという、増大する課題に取り組むこと。
  • 従来、単一マシンのRAM環境に適用されてきたランダム化数値線形代数(RandNLA)技術を、大規模な並列および分散アーキテクチャに拡張すること。
  • ランダム化アルゴリズムが、効率的なスケッチと事前処理を通じて通信を最小限に抑えつつ、高精度の解と強い理論的保証を達成できることを示すこと。
  • 実際の分散システムにおける、埋め込み構築時間、条件数の質、通信と計算のバランスのトレードオフを評価すること。

提案手法

  • 大きな過決定行列の低次元スケッチを、構造的行列(例:カウチ分布、正規分布)を用いたランダム射影、またはデータ依存の重要度サンプリングによるランダムサンプリングで作成する。
  • スケッチを、正確にサブプロブレムを解くか、LSQRのような反復ソルバーのための事前処理として適用し、分散環境における収束を改善する。
  • I/Oおよびネットワークオーバーヘッドを低減するため、通信を回避する反復手法(例:チェビシェフ半反復法)およびMapReduceにおける複数初期クエリを採用する。
  • LSRNやDatabricksのようなシステムを用いて、大規模データ上でPROJ CW、PROJ GAUSSIAN、SAMP APPRといった複数の埋め込み戦略を実装および評価する。
  • 異なる埋め込み次元およびデータスケールにおいて、目的関数値および解ベクトルの両方の相対誤差メトリクスを用いて、近似の質を評価する。
  • 条件数が最大5まで、サイズが10⁷ × 1000の行列を用いた実験的評価を複数試行にわたり実施し、収束速度、精度、実行時間を測定する。

実験結果

リサーチクエスチョン

  • RQ1単一マシンのRAM環境を想定したランダム化行列アルゴリズムを、通信コストが高い大規模分散システムに効果的に適応できるか?
  • RQ2分散回帰において、埋め込み品質、構築時間、通信効率性という観点から、異なるランダム射影およびサンプリング戦略はどのように比較されるか?
  • RQ3より高価な射影(例:より高コストのプロキシ)を追加することで、分散ソルバーにおける条件数の改善と通信の削減はどの程度達成できるか?
  • RQ4分散ℓ₂およびℓ₁回帰において、解の精度、埋め込み次元、実行時間のトレードオフはどのようなものか?
  • RQ5MapReduceにおける複数初期クエリやチェビシェフ反復といった通信を回避する戦略は、標準的な反復手法に比べて顕著にパフォーマンスを向上させられるか?

主な発見

  • 構造的ランダム射影(例:カウチ分布や正規分布)を用いたランダム化事前処理により、大きな不適切な条件数を持つ行列の条件数が低下し、分散環境におけるLSQRのような反復ソルバーの収束が加速される。
  • MapReduce上でのMIE(複数初期推定器)フレームワークにおける複数初期クエリの使用により、初期探索領域が著しく改善され、収束に必要な反復回数が削減される。
  • 条件数5、サイズ1e7 × 1000の行列に対して、提案手法はデータを数回読み込むだけで、解ベクトルの相対誤差を1%未満、目的関数誤差を0.5%未満に抑えることに成功した。
  • MPIベースのシステムでは、チェビシェフ半反復法がLSQRを上回る通信効率性を示し、通信を回避する設計がFLOPSベースの最適化を上回ることを実証した。
  • 大きな埋め込み次元(例:カウチ射影では3e5)は、より良い条件数とより速い収束をもたらしたが、埋め込み構築時間の増加を伴った。
  • テラバイト規模のデータに対する実験的結果から、ℓ₁およびℓ₂回帰問題が、入力スパarsityに近い時間と少数のデータパスで、低・中・高精度に、強い理論的保証とともに解けることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。