Skip to main content
QUICK REVIEW

[論文レビュー] Oracle Complexity in Nonsmooth Nonconvex Optimization

Guy Kornowski, Ohad Shamir|arXiv (Cornell University)|Apr 14, 2021
Stochastic Gradient Optimization Techniques参考文献 34被引用数 6
ひとこと要約

この論文は、非滑らかで非凸な最適化におけるオракル複雑度を調査し、局所的情報へのアクセスに内在する制限のため、近似的に近い停留立点を効率的に見つけることは根本的になされないことを証明している。さらに、滑らかさの技術を用いる際の滑らかさの質とオラクル複雑度の間のトレードオフを確立し、弱い仮定の下で確率的スムージングが最適であることを示しているが、次元依存要因がオラクルコストが指数関数的に高くなるまで効率を制限する。

ABSTRACT

It is well-known that given a smooth, bounded-from-below, and possibly nonconvex function, standard gradient-based methods can find $ε$-stationary points (with gradient norm less than $ε$) in $\mathcal{O}(1/ε^2)$ iterations. However, many important nonconvex optimization problems, such as those associated with training modern neural networks, are inherently not smooth, making these results inapplicable. In this paper, we study nonsmooth nonconvex optimization from an oracle complexity viewpoint, where the algorithm is assumed to be given access only to local information about the function at various points. We provide two main results: First, we consider the problem of getting near $ε$-stationary points. This is perhaps the most natural relaxation of finding $ε$-stationary points, which is impossible in the nonsmooth nonconvex case. We prove that this relaxed goal cannot be achieved efficiently, for any distance and $ε$ smaller than some constants. Our second result deals with the possibility of tackling nonsmooth nonconvex optimization by reduction to smooth optimization: Namely, applying smooth optimization methods on a smooth approximation of the objective function. For this approach, we prove under a mild assumption an inherent trade-off between oracle complexity and smoothness: On the one hand, smoothing a nonsmooth nonconvex function can be done very efficiently (e.g., by randomized smoothing), but with dimension-dependent factors in the smoothness parameter, which can strongly affect iteration complexity when plugging into standard smooth optimization methods. On the other hand, these dimension factors can be eliminated with suitable smoothing methods, but only by making the oracle complexity of the smoothing process exponentially large.

研究の動機と目的

  • 局所的オラクルアクセスを用いた非滑らかで非凸な最適化において、近似的に近い停留立点を探索する可能性を分析すること。
  • 非滑らかな関数をスムージングすることで、標準的な滑らかな最適化手法を効率的に利用可能にするかを調査すること。
  • スムージングプロセスにおける滑らかさの質とオラクル複雑度の間の根本的トレードオフを確立すること。
  • 弱い仮定の下で、確率的スムージングが滑らかさとオラクルコストのバランスにおいて最適であるかどうかを評価すること。
  • 最適化誤差と勾配の最小化が達成できない場合に、標準的な停留立点の代替として有効なものは何かを同定すること。

提案手法

  • ブラックボックス最適化をモデル化するためのオラクル複雑度フレームワークを用い、関数値とClarkeの理論による一般化勾配へのアクセスを仮定する。
  • 関数が局所的に定数だが大域的には非定数であるような難易度の高い例を構築し、近い停留立点の回復が不可能であることを証明する。
  • 確率的スムージングを、非滑らかな関数を滑らかなものに近似する手法として分析し、滑らかさの質とオラクルコストの間のトレードオフを定量化する。
  • 滑らかにした関数の勾配リプシッツ定数に関する境界を導出し、オラクル複雑度が指数関数的に増加しない限り、次元依存要因が生じることを示す。
  • 集中不等式と確率的議論を用いて、定義域内の経路に沿った元の関数と滑らかにした関数の差をバウンディングする。
  • 任意のスムージング手法が有界なクエリ距離と平行移動不変性を満たす場合、オラクルコストが指数的に高くなるまで、次元依存の滑らかさパラメータを避けられないことを証明する。

実験結果

リサーチクエスチョン

  • RQ1局所的オラクルアクセスのみを用いて、非滑らかで非凸な最適化において近似的に近い停留立点を効率的に見つけられるか?
  • RQ2滑らかさの滑らかさの質と、それを構築するためのオラクル複雑度の間には、根本的なトレードオフがあるか?
  • RQ3弱い仮定の下で、確率的スムージングは滑らかさとオラクルコストのバランスにおいて最適と見なせるか?
  • RQ4標準的な近似的停留立点が非滑らかケースで達成できない場合、どのような代替の停留立点の概念が有効か?
  • RQ5滑らかさにおける次元依存要因は、オラクル複雑度が指数的に高くなることなく排除できるか?

主な発見

  • 局所的に定数だが大域的には非定数である関数が存在するため、最悪ケースでは近似的に近い停留立点を効率的に見つけることは不可能であり、ε-停留立点までの距離が有界であっても同様である。
  • 次元に依存しない滑らかさパラメータを維持する任意のスムージング手法は、指数的高価なオラクル複雑度を伴う必要があり、高次元問題では実用的でない。
  • 確率的スムージングは、滑らかさとオラクルコストの最適なトレードオフを達成し、多項式オラクル複雑度で次元依存の滑らかさパラメータを提供する。
  • 滑らかにした関数の勾配リプシッツ定数は、O(Lr√(log((M+1)(T+1)))/√d) のオーダーで増加し、オラクルコストが指数的に高くなるまで、次元依存の劣化が生じる。
  • 翻訳不変性と有界クエリ距離といった弱い仮定の下でも、不可能性の結果が成り立つため、制限は問題構造そのものに内在している。
  • 本論文は、(δ,ε)-停留立点のような代替の停留立点概念を検討する理論的根拠を提供するが、その定義が直感的な停留立点の概念と常に一致するとは限らないと警告している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。