Skip to main content
QUICK REVIEW

[論文レビュー] On the Randomized Complexity of Minimizing a Convex Quadratic Function

Max Simchowitz|arXiv (Cornell University)|Jul 24, 2018
Stochastic Gradient Optimization Techniques参考文献 26被引用数 10
ひとこと要約

本稿は、凸二次関数を最小化するためのランダム化勾配クエリ複雑度に対する最初のタイトな下界を確立し、ランダム化でさえも、定数因子の相対誤差を達成するには $\Omega(\sqrt{\kappa})$ のクエリが必要であることを示している。これはネステロフの加速手法の性能と一致する。この結果は、確率的行列理論と最小平均二乗誤差解析の道具を用いて、変形されたウィグナー・モデルにおける埋め込まれたベクトルの推定問題への還元によって得られる。

ABSTRACT

Minimizing a convex, quadratic objective of the form $f_{\mathbf{A},\mathbf{b}}(x) := \frac{1}{2}x^ op \mathbf{A} x - \langle \mathbf{b}, x angle$ for $\mathbf{A} \succ 0 $ is a fundamental problem in machine learning and optimization. In this work, we prove gradient-query complexity lower bounds for minimizing convex quadratic functions which apply to both deterministic and \emph{randomized} algorithms. Specifically, for $κ> 1$, we exhibit a distribution over $(\mathbf{A},\mathbf{b})$ with condition number $\mathrm{cond}(\mathbf{A}) \le κ$, such that any \emph{randomized} algorithm requires $Ω(\sqrtκ)$ gradient queries to find a solution $\hat x$ for which $\|\hat x - \mathbf x_\star\| \le ε_0\|\mathbf{x}_{\star}\|$, where $\mathbf x_{\star} = \mathbf{A}^{-1}\mathbf{b}$ is the optimal solution, and $ε_0$ a small constant. Setting $κ=1/ε$, this lower bound implies the minimax rate of $T = Ω(λ_1(\mathbf{A})\|\mathbf x_\star\|^2/\sqrtε)$ queries required to minimize an arbitrary convex quadratic function up to error $f(\hat{x}) - f(\mathbf x_\star) \le ε$. Our lower bound holds for a distribution derived from classical ensembles in random matrix theory, and relies on a careful reduction from adaptively estimating a planted vector $\mathbf u$ in a deformed Wigner model. A key step in deriving sharp lower bounds is demonstrating that the optimization error $\mathbf x_\star - \hat x$ cannot align too closely with $\mathbf{u}$. To this end, we prove an upper bound on the cosine between $\mathbf x_\star - \hat x$ and $\mathbf u$ in terms of the MMSE of estimating the plant $\mathbf u$ in a deformed Wigner model. We then bound the MMSE by carefully modifying a result due to Lelarge and Miolane 2016, which rigorously establishes a general replica-symmetric formula for planted matrix models.

研究の動機と目的

  • 凸二次関数を最小化するための一次元法の最悪ケースと平均ケースの複雑度のギャップを埋める。
  • 決定的アルゴリズムに限らない、ランダム化アルゴリズムにも適用可能な勾配クエリ複雑度の下界を確立する。
  • 最悪ケースの最小最大レート $\Omega(\sqrt{\kappa})$ のクエリが、ランダム化でさえも避けられないことを示し、ネステロフの手法による既知の上界と一致することを示す。
  • 二次関数最小化の本質的難易度を捉えるために、確率的行列理論から問題インスタンスの分布を導出する。
  • 最適化誤差が埋め込まれた信号にあまりにも密接に一致できないことを、変形されたウィグナー・モデルにおける最小平均二乗誤差への新しい接続を用いて証明する。

提案手法

  • 凸二次関数の最小化問題を、変形されたウィグナー行列モデル $\mathbf{M} = \mathbf{W} + \lambda \mathbf{u}\mathbf{u}^\top$ における埋め込まれたベクトル $\mathbf{u}$ の推定問題に還元する。
  • 最適化誤差 $\mathbf{x}_\star - \widehat{\mathsf{x}}$ と埋め込まれたベクトル $\mathbf{u}$ の重なりを制限するために、条件付きクロス項 $\mathrm{Cross}(\mathbf{u}\mathbf{u}^\top \mid \mathbf{b})$ を用いる。
  • 漸近的MMSE解析の枠組みに合わせるため、変形パラメータ $\lambda \leftarrow \sqrt{\rho}$ の再パrameter化を適用する。
  • 切断と回転不変性の議論を用いて、平均パrameter化されたクロス項 $\check{\mathrm{Cross}}_d(\rho; \mu)$ で表される期待重なり $\mathtt{ovlap}_{d,\lambda}(\tau_0)$ を上界で抑え込む。
  • LelargeとMiolane(2016)の漸近的MMSE式を、問題の特定の条件付き分布と期待値構造に適合させるために変更する。
  • 極限式 $\lim_{d\to\infty} \mathbb{E}_{\bm{\alpha}}[\mathbb{I}(|\bm{\alpha}-1|\leq d^{-1/4})\check{\mathrm{Cross}}_d(\rho; \mu\bm{\alpha})] \leq 1 + \mu^2 - \frac{1}{\rho} + \frac{|\mu|}{\sqrt{\rho}}$ を用いて、重なりの均一な上界を導出する。

実験結果

リサーチクエスチョン

  • RQ1凸二次関数を最小化するためのランダム化一次元アルゴリズムは、決定的アルゴリズムよりも優れた勾配クエリ複雑度を達成できるか?
  • RQ2相対誤差 $\|\widehat{\mathsf{x}} - \mathbf{x}_\star\| \leq \epsilon_0 \|\mathbf{x}_\star\|$ のための最悪ケース下界 $\Omega(\sqrt{\kappa})$ クエリが、ランダム化アルゴリズムに対しても下界として成立するか?
  • RQ3ヘッセ行列 $\mathbf{A}$ が変形されたウィグナー行列であるとき、最適化誤差における埋め込まれたベクトル $\mathbf{u}$ の役割は何か?
  • RQ4変形されたウィグナー・モデルにおける最小平均二乗誤差(MMSE)は、最適化誤差と真の解との一致度を上界で抑え込むのに用いることができるか?
  • RQ5ランダム化のもとでも、二次関数最小化の最小最大クエリ複雑度は、ネステロフの加速手法が達成するレートと一致するか?

主な発見

  • 本稿は、任意のランダム化アルゴリズムが $\|\widehat{\mathsf{x}} - \mathbf{x}_\star\| \leq \epsilon_0 \|\mathbf{x}_\star\|$ を達成するためには $\Omega(\sqrt{\kappa})$ の勾配クエリが必要であることを示しており、$\kappa = \mathrm{cond}(\mathbf{A})$ である。ここで $\epsilon_0 > 0$ は普遍定数である。
  • この下界は、ネステロフの加速手法から知られている上界 $\widetilde{\Theta}(\sqrt{\kappa})$ と一致しており、レートのタイトさを示している。
  • この下界は、古典的ランダム行列理論のアンサンブルである変形されたウィグナー・モデルから導出された $\mathbf{A}, \mathbf{b}$ の分布に対して成り立つ。
  • 最適化誤差 $\mathbf{x}_\star - \widehat{\mathsf{x}}$ は、埋め込まれたベクトル $\mathbf{u}$ にあまりにも密接に一致できない。このことは重なり $\mathtt{ovlap}_{d,\lambda}(\tau_0)$ を用いて定量的に示される。
  • LelargeとMiolane(2016)のMMSE式を変更したものを用いて、漸近的下界 $\lim_{d\to\infty} \mathtt{ovlap}_{d,\lambda}(\tau_0) \leq 1 - \frac{1}{\lambda^2} + \tau_0 - \frac{\sqrt{\tau_0}}{\lambda}$ を導出する。
  • $\kappa = 1/\epsilon$ とおくことで、目的関数値の $\epsilon$-精度に対して、条件なしの下界 $\Omega(\lambda_1(\mathbf{A})\|\mathbf{x}_\star\|^2 / \sqrt{\epsilon})$ クエリが得られる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。