Skip to main content
QUICK REVIEW

[論文レビュー] LSRN: A Parallel Iterative Solver for Strongly Over- or Under-Determined Systems

Xiangrui Meng, Michael A. Saunders|arXiv (Cornell University)|Sep 27, 2011
Stochastic Gradient Optimization Techniques被引用数 13
ひとこと要約

LSRN は、大規模で強く過剰または不足している、かつランク落ちする可能性のある最小二乗問題を並列で反復的に解くためのソルバである。ランダム正規分布による射影を前処理に用いることで、LSQR やチェビシェフ半反復法による収束を高速化し、共有メモリ系およびクラスタ環境において予測可能な性能と優れた拡張性を達成する。スパースおよび密行列の両方の問題において、LAPACK や MATLAB ソルバーよりも優れた性能を発揮する。

ABSTRACT

We describe a parallel iterative least squares solver named exttt{LSRN} that is based on random normal projection. exttt{LSRN} computes the min-length solution to $\min_{x \in \mathbb{R}^n} \|A x - b\|_2$, where $A \in \mathbb{R}^{m imes n}$ with $m \gg n$ or $m \ll n$, and where $A$ may be rank-deficient. Tikhonov regularization may also be included. Since $A$ is only involved in matrix-matrix and matrix-vector multiplications, it can be a dense or sparse matrix or a linear operator, and exttt{LSRN} automatically speeds up when $A$ is sparse or a fast linear operator. The preconditioning phase consists of a random normal projection, which is embarrassingly parallel, and a singular value decomposition of size $\lceil γ\min(m,n) ceil imes \min(m,n)$, where $γ$ is moderately larger than 1, e.g., $γ= 2$. We prove that the preconditioned system is well-conditioned, with a strong concentration result on the extreme singular values, and hence that the number of iterations is fully predictable when we apply LSQR or the Chebyshev semi-iterative method. As we demonstrate, the Chebyshev method is particularly efficient for solving large problems on clusters with high communication cost. Numerical results demonstrate that on a shared-memory machine, exttt{LSRN} outperforms LAPACK's DGELSD on large dense problems, and MATLAB's backslash (SuiteSparseQR) on sparse problems. Further experiments demonstrate that exttt{LSRN} scales well on an Amazon Elastic Compute Cloud cluster.

研究の動機と目的

  • 大規模な線形最小二乗問題(強く過剰または不足している、かつランク落ちする可能性がある)を、スケーラブルで並列な反復的ソルバとして開発すること。
  • ランダム射影に基づく前処理によって、システムの条件数を理論的に良好に保証することで、実行時間の予測可能性を確保すること。
  • 並列処理と自動的なスパarsity認識機能を活用することで、密行列およびスパース行列(複雑なスパarsityパターンを有するものも含む)において高い性能を達成すること。
  • 特に不足問題やスパース問題において、LAPACK の DGELSD や MATLAB の backslash と比較して優れた性能を発揮すること。
  • チェビシェフ半反復法を反復ソルバとして用いることで、分散クラスタ環境における強力な拡張性と通信効率を示すこと。

提案手法

  • LSRN はランダム正規分布射影を用いて前処理行列を構築し、これにより $ Ax \approx b $ のシステムの条件数を改善する。
  • 前処理ステップでは、サイズ $ \lceil \gamma \min(m,n) \rceil \times \min(m,n) $ のランダム射影を実行し、$ \gamma \approx 2 $ とする。この処理は、容易に並列化可能な計算を可能にする。
  • 射影された行列の特異値分解(SVD)を断片的に行うことで、前処理済みシステムの極端な特異値が集中するようになり、収束が高速化される。
  • 反復フェーズでは LSQR やチェビシェフ半反復法(CS)が使用され、後者は通信コストが低いことから、高通信環境下で好まれる。
  • この手法は、Tikhonov正則化をネイティブにサポートしており、コード変更なしにスパース行列や高速線形作用素に自動的に適応する。
  • LSRN はスレーディングや MPI を用いた簡単なデプロイを想定しており、通信量と負荷分散のオーバーヘッドが最小限である。

実験結果

リサーチクエスチョン

  • RQ1ランダム化された前処理戦略を用いて、過剰および不足問題の両方において、理論的に良好な条件数を持つシステムを構築できるか?
  • RQ2ランダム正規分布射影の使用により、共有メモリ系および分散クラスタ環境において、性能の予測可能性とスケーラビリティが達成できるか?
  • RQ3LSRN は、LAPACK の DGELSD や MATLAB の backslash といった既存の直接ソルバーよりも、大規模なスパースまたは密行列問題において優れた性能を発揮できるか?
  • RQ4高通信環境下では、チェビシェフ半反復法が LSQR よりも効率的であるか?
  • RQ5Amazon EC2 のような異種クラスタ環境において、問題サイズとコア数を比例的に増加させた場合、LSRN の性能はどのようにスケーリングするか?

主な発見

  • 大規模な密行列問題において、LSRN は LAPACK の DGELSD を上回り、特に DGELSD が著しく遅くなる不足問題の領域で顕著な性能向上を示す。
  • スパース問題において、LSRN は MATLAB の backslash(SuiteSparseQR)よりも著しく高速である。後者はスパarsityパターンに敏感で、性能が予測不能である。
  • Amazon EC2 クラスタにおいて、LSRN は良好なスケーリングを示す。問題サイズを 10 倍に増やし、コア数も比例的に増加させた場合、合計実行時間はたった 50% の増加にとどまる。
  • チェビシェフ半反復法は、通信コストが低いことから、クラスタ環境で LSQR よりも優れた性能を発揮する。ただし、反復回数は 106 回(LSQR は 84 回)とやや多い。
  • ランク落ち問題においても、LSRN は一貫して最小長の解を提供し、予測可能である。他のソルバーよりも失敗するか、非最小解を生成する可能性がある。
  • LSRN の性能はスパarsityパターンに強く依存せず、スパースまたは高速線形作用素では自動的に高速化される。一方、構造的性質に依存するソルバーよりも優れた柔軟性を有する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。