Skip to main content
QUICK REVIEW

[論文レビュー] Zeroth-order Nonconvex Stochastic Optimization: Handling Constraints, High-Dimensionality and Saddle-Points

Krishnakumar Balasubramanian, Saeed Ghadimi|arXiv (Cornell University)|Sep 17, 2018
Stochastic Gradient Optimization Techniques被引用数 6
ひとこと要約

本稿は、関数評価のみを用いて、非凸性、制約、高次元性、鞍点回避を伴う最適化問題に対して、零番目の順序の確率的最適化アルゴリズムを提案する。制約付き最適化のための零番目の順序の条件付き勾配法、次元数に多対数的依存性を示す打ち切り確率的勾配法、および2次スティーブの恒等式を用いた新たなヘシアン推定器を導入し、立方則正則化ニュートン法を実現。この手法により、ρ-正確な2次停留点を達成するためのオракル複雑度は$\tilde{\rm O}(d/\rho^{7/2})$ に達する。

ABSTRACT

In this paper, we propose and analyze zeroth-order stochastic approximation algorithms for nonconvex and convex optimization, with a focus on addressing constrained optimization, high-dimensional setting and saddle-point avoiding. To handle constrained optimization, we first propose generalizations of the conditional gradient algorithm achieving rates similar to the standard stochastic gradient algorithm using only zeroth-order information. To facilitate zeroth-order optimization in high-dimensions, we explore the advantages of structural sparsity assumptions. Specifically, (i) we highlight an implicit regularization phenomenon where the standard stochastic gradient algorithm with zeroth-order information adapts to the sparsity of the problem at hand by just varying the step-size and (ii) propose a truncated stochastic gradient algorithm with zeroth-order information, whose rate of convergence depends only poly-logarithmically on the dimensionality. We next focus on avoiding saddle-points in non-convex setting. Towards that, we interpret the Gaussian smoothing technique for estimating gradient based on zeroth-order information as an instantiation of first-order Stein's identity. Based on this, we provide a novel linear-(in dimension) time estimator of the Hessian matrix of a function using only zeroth-order information, which is based on second-order Stein's identity. We then provide an algorithm for avoiding saddle-points, which is based on a zeroth-order cubic regularization Newton's method and discuss its convergence rates.

研究の動機と目的

  • 非凸的で制約付きかつ高次元の最適化問題における零番目の順序最適化の理論的保証の欠如に対処する。
  • 勾配やヘシアン情報へのアクセスが限られているにもかかわらず、1次最適化の収束速度に一致または近づく零番目の順序のアルゴリズムを開発する。
  • 関数評価のみを用いて、構造的スパarsityを考慮した効率的な最適化を実現し、非凸設定における鞍点を回避する。
  • 2次スティーブの恒等式による零番目の順序ヘシアン推定を用いて、2次停留点の収束レートを提供する。
  • 高次元最適化における制約の幾何構造、スパarsity、および零番目の順序情報の相乗効果を調査する。

提案手法

  • 制約付き最適化のための零番目の順序の条件付き勾配法を提案し、零番目の順序情報のもとで、確率的勾配降下法と同等の収束速度を達成する。
  • 零番目の順序情報に基づく打ち切り確率的勾配法を導入し、次元数に多対数的依存性を示す。これにより、標準的な零番目の順序手法における線形依存性を改善する。
  • 零番目の順序勾配降下法において、ステップサイズの変更によってスパarsityが自動的に捉えられる、暗黙の正則化効果を特定する。
  • 2次スティーブの恒等式を用いて、次元数に線形に依存するヘシアン推定器を導出。これにより、関数クエリのみから効率的なヘシアン近似が可能になる。
  • 鞍点回避を目的とした零番目の順序の立方則正則化ニュートン法を設計。ヘシアン推定器を活用し、2次停留性を達成する。
  • ガウス平滑化を1次スティーブの恒等式の特別なケースとして用い、勾配推定を正当化。さらに、2次スティーブの恒等式を拡張してヘシアン推定を実現する。

実験結果

リサーチクエスチョン

  • RQ1関数評価のみが利用可能な状況下で、条件付き勾配法が確率的勾配降下法と同等の収束速度を達成できるか?
  • RQ2高次元における零番目の順序最適化は、構造的スパarsityを活用することで効率化可能であり、ステップサイズ選択はその役割を果たすか?
  • RQ3非凸最適化における鞍点回避のため、関数クエリからの2次情報はどのように推定可能か?
  • RQ4非凸確率的最適化において、関数評価のみを用いて2次停留点に到達するためのオラクル複雑度は何か?
  • RQ5制約の幾何構造、スパarsity、および零番目の順序情報の相乗効果は、高次元設定における収束速度の向上に寄与できるか?

主な発見

  • 零番目の順序の条件付き勾配法は、次元数に線形に依存する複雑度を示し、関数クエリのみで効率的な制約付き最適化を実現。収束速度は確率的勾配降下法と類似。
  • 零番目の順序情報に基づく打ち切り確率的勾配法は、次元数に多対数的要因のみに依存する収束速度を達成。標準的手法の線形依存性に比べて顕著に改善。
  • 零番目の順序勾配降下法には、明示的なスパarsity誘導ペナルティを導入しないまま、ステップサイズの調整によってスパarsityが自動的に捉えられる暗黙の正則化効果が観察された。
  • 2次スティーブの恒等式に基づく新規のヘシアン推定器により、関数評価のみで次元数に線形に依存するヘシアン近似が可能となり、2次最適化手法の基盤を形成。
  • 提案された零番目の順序の立方則正則化ニュートン法は、ρ-正確な2次停留点を達成するためのオラクル複雑度が$\tilde{\rm O}(d/\rho^{7/2})$ に達し、ヘシアン推定の総サンプル複雑度は$\tilde{\rm O}(d^4/\rho^{5/2})$ となる。
  • 零番目のオラクル呼び出し総数は$\tilde{\rm O}(d/\rho^{7/2})$ に比例し、非凸問題における高精度収束のための2次情報の利点を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。