Skip to main content
QUICK REVIEW

[論文レビュー] Effective Dimension Adaptive Sketching Methods for Faster Regularized Least-Squares Optimization

Jonathan Lacotte, Mert Pilancı|arXiv (Cornell University)|Jun 10, 2020
Face and Expression Recognition被引用数 5
ひとこと要約

本稿では、正則化最小二乗最適化のための適応的スケッチアルゴリズムを提案し、埋め込み次元を全データ次元ではなく問題の有効次元にまで低減する。ガウス分布およびSRHT埋め込みに対する鋭い行列の乖離バウンドを導出することで、計算複雑性を改善しつつ、高い確率的保証のもとで収束を高速化し、ベンチマークデータセット上で標準的なソルバーよりも優れた性能を発揮する。

ABSTRACT

We propose a new randomized algorithm for solving L2-regularized least-squares problems based on sketching. We consider two of the most popular random embeddings, namely, Gaussian embeddings and the Subsampled Randomized Hadamard Transform (SRHT). While current randomized solvers for least-squares optimization prescribe an embedding dimension at least greater than the data dimension, we show that the embedding dimension can be reduced to the effective dimension of the optimization problem, and still preserve high-probability convergence guarantees. In this regard, we derive sharp matrix deviation inequalities over ellipsoids for both Gaussian and SRHT embeddings. Specifically, we improve on the constant of a classical Gaussian concentration bound whereas, for SRHT embeddings, our deviation inequality involves a novel technical approach. Leveraging these bounds, we are able to design a practical and adaptive algorithm which does not require to know the effective dimension beforehand. Our method starts with an initial embedding dimension equal to 1 and, over iterations, increases the embedding dimension up to the effective one at most. Hence, our algorithm improves the state-of-the-art computational complexity for solving regularized least-squares problems. Further, we show numerically that it outperforms standard iterative solvers such as the conjugate gradient method and its pre-conditioned version on several standard machine learning datasets.

研究の動機と目的

  • 大規模な正則化最小二乗問題における計算コストを、スケッチ次元を最小化することで低減すること。
  • 全データ次元ではなく有効次元を活用することで収束保証を改善すること。
  • 事前の知識がなくても、有効次元まで動的に埋め込みサイズを増加させる実用的で適応的なアルゴリズムを設計すること。
  • 最新のソルバーよりも優れた計算複雑性を達成するとともに、高い確率的誤差バウンドを維持すること。

提案手法

  • Hessianスケッチを用い、ガウスまたはSRHT埋め込みによるランダム射影でヘッセ行列を近似する。
  • 両方の埋め込みに対して、楕円体上での鋭い行列の乖離不等式を導出し、近似誤差を制限する。
  • SRHT埋め込みに対して、より緊密な集中バウンドを確立するための新しい技術的アプローチを導入する。
  • 埋め込み次元を1から始め、有効次元に達するまで反復的に増加させる適応的アルゴリズムを設計する。
  • 収束を加速するために、近似ヘッセ行列 $ H_S = (SA)^T SA + \nu^2 I $ を用いたPolyak-IHS法を採用する。
  • 誤差評価基準として、予測ノルム $ \frac{1}{2}\|\overline{A}(\widetilde{x}-x^*)\|_2^2 $ を使用する。

実験結果

リサーチクエスチョン

  • RQ1ランダム化最小二乗ソルバーにおける埋め込み次元を、収束保証を損なわずに有効次元にまで低減できるか。
  • RQ2楕円体集合に対して、ガウス分布とSRHT埋め込みの行列の乖離バウンドはどのように比較できるか。
  • RQ3有効次元に動的に適合させる実用的で適応的なアルゴリズムを設計できるか。
  • RQ4データ次元ではなく有効次元を用いることで、計算複雑性と収束速度にどのような影響があるか。
  • RQ5提案手法は実際の応用において、共役勾配法のような標準的な反復的ソルバーを上回るか。

主な発見

  • 埋め込み次元を有効次元 $ d_e \leq d $ にまで低減可能であり、ガウス分布およびSRHT埋め込みの両方において、高い確率的収束保証が維持される。
  • ガウス埋め込みの場合、古典的な集中バウンドの定数を改善し、より緊密な誤差バウンドが得られる。
  • SRHT埋め込みの場合、新しい技術的アプローチを用いて、新たな乖離不等式を導出し、期待外れの高い性能を示す。
  • 提案された適応的アルゴリズムは、フル次元のスケッチを回避し、有効次元まで次元を動的に増加させることで、計算複雑性を改善する。
  • 数値実験により、標準的な機械学習データセットにおいて、共役勾配法およびそのプリコンディショニング版を上回る性能を発揮する。
  • 誤差率は $ (d_e/m)^t $ のスケーリングを示し、$ m \approx d_e $ が高速収束に十分であることを確認する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。