Skip to main content
QUICK REVIEW

[論文レビュー] Complexity of Finding Stationary Points of Nonsmooth Nonconvex Functions

Jingzhao Zhang, Hongzhou Lin|arXiv (Cornell University)|Feb 10, 2020
Stochastic Gradient Optimization Techniques参考文献 42被引用数 15
ひとこと要約

本稿では、滑らかでない非凸最適化における $\epsilon$-停留点を求めることが非効率である問題に対処するため、$(\delta,\epsilon)$-停留性フレームワークを導入する。決定的および確率的設定において、それぞれ $\tilde{\mathcal{O}}(\epsilon^{-3}\delta^{-1})$ および $\tilde{\mathcal{O}}(\epsilon^{-4}\delta^{-1})$ の複雑さを持つ確率的勾配型アルゴリズムを提案し、$\Omega(\delta^{-1})$ の下界を確立することで、ReLUネットワークのようなハダールト半微分可能関数に対する、初めての非漸近的解析を提供する。

ABSTRACT

We provide the first non-asymptotic analysis for finding stationary points of nonsmooth, nonconvex functions. In particular, we study the class of Hadamard semi-differentiable functions, perhaps the largest class of nonsmooth functions for which the chain rule of calculus holds. This class contains examples such as ReLU neural networks and others with non-differentiable activation functions. We first show that finding an $ε$-stationary point with first-order methods is impossible in finite time. We then introduce the notion of $(δ, ε)$-stationarity, which allows for an $ε$-approximate gradient to be the convex combination of generalized gradients evaluated at points within distance $δ$ to the solution. We propose a series of randomized first-order methods and analyze their complexity of finding a $(δ, ε)$-stationary point. Furthermore, we provide a lower bound and show that our stochastic algorithm has min-max optimal dependence on $δ$. Empirically, our methods perform well for training ReLU neural networks.

研究の動機と目的

  • 滑らかでない非凸最適化における非漸近的収束解析の根本的ギャップ、特にReLUのような非微分可能活性化関数を有する関数に対して、これを解決すること。
  • リプシッツ連続かつ方向微分可能関数において、従来の $\epsilon$-停留点を有限時間内に見つけることは不可能であることを示すこと。
  • 緩い条件下でも有限時間収束解析を可能にする、$(\delta,\epsilon)$-停留性という改良された停留性の概念を導入すること。
  • 決定的および確率的設定において、$(\delta,\epsilon)$-停留点を探索するための最適な複雑さを達成する確率的勾配型アルゴリズムの設計と解析を行うこと。
  • 実験的に理論的枠組みを検証し、ReLU活性化関数を用いたResNetの学習において、競争力のある性能を示すこと。

提案手法

  • $(\delta,\epsilon)$-停留性を導入:点 $\bar{x}$ が $(\delta,\epsilon)$-停留点であるとは、$\bar{x}$ の $\delta$-近傍内にある点における一般化勾配の凸結合が、原点を $\epsilon$-ボール内に含むこと。
  • 決定的設定向けに、正規化勾配降下型のアルゴリズムを提案し、$(\delta,\epsilon)$-停留点の探索において $\tilde{\mathcal{O}}(\epsilon^{-3}\delta^{-1})$ の複雑さを達成。
  • 有限分散設定向けに、モーメンタムに基づく確率的アルゴリズムを設計し、$\tilde{\mathcal{O}}(\epsilon^{-4}\delta^{-1})$ の複雑さを達成。
  • 現在の反復点から $\delta$ 離れた点における部分勾配を返す一般化勾配オラクルを用い、停留性の局所的近似を可能にする。
  • オラクル呼び出し回数に対する $\Omega(\delta^{-1})$ の下界を確立し、$\delta$ 依存性において最小最大最適性を証明。
  • PyTorchの自動微分を用いて実際の一般化勾配オラクルを近似する、確率的バージョンの Stochastic-Ingd を実装。

実験結果

リサーチクエスチョン

  • RQ1滑らかでない非凸関数において、従来の $\epsilon$-停留点は有限時間内に見つけることができるか?
  • RQ2滑らかでない非凸問題における有限時間・非漸近的収束解析を可能にする、改良された停留性の概念は存在するか?
  • RQ3決定的および確率的設定において、$(\delta,\epsilon)$-停留点を探索するための最適な複雑さは何か?
  • RQ4モーメンタムや適応的技術は、実験的に有効であるが、滑らかでない設定において理論的に正当化できるか?
  • RQ5提案された枠組みは、深層ReLUネットワークの学習における理論と実装のギャップを埋められるか?

主な発見

  • リプシッツ連続かつ方向微分可能関数において、一般化勾配オラクルにアクセスできる場合でさえ、$\epsilon$-停留点の探索は有限時間内に不可能である。
  • 提案された $(\delta,\epsilon)$-停留性の概念は、有限時間解析に必要かつ十分であり、$\delta > 0$ が不具合を回避するための必須条件である。
  • 決定的アルゴリズムは、$(\delta,\epsilon)$-停留点の探索において $\tilde{\mathcal{O}}(\epsilon^{-3}\delta^{-1})$ の複雑さを達成し、$\delta$ 依存性において $\Omega(\delta^{-1})$ の下界と一致する。
  • 確率的モーメンタムベースのアルゴリズムは、$\tilde{\mathcal{O}}(\epsilon^{-4}\delta^{-1})$ の複雑さを達成し、対数要因を除いて最適である。
  • 実験結果から、提案された Stochastic-Ingd アルゴリズムはSGD with momentumと同等の性能を示し、CIFAR-10におけるResNetの学習でADAMを上回ることを示した。
  • 結果から、滑らかでない設定ではモーメンタムや適応的手法が理論的にも必要である可能性が示唆され、滑らかな非凸理論とは対照的に、これらが収束速度を低下させる可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。