[論文レビュー] Deterministic Nonsmooth Nonconvex Optimization
この論文は、非滑らかで非凸な最適化における決定的アルゴリズムが次元に依存しない複雑度を達成できるかという未解決の問題を解決し、任意の決定的1次元アルゴリズムに対して$Ω(d)$の下界を証明することで、次元に依存しないレートを達成するには確率的化が必要であることを示している。さらに、決定的設定における有限時間収束の観点から、0次オラクルアクセスが不可欠であることを確立し、ReLUネットワーク向けに新たなホワイトボックス決定的スムージングを提案することで、実際には下界を回避する次元に依存しない最適化を可能にしている。
We study the complexity of optimizing nonsmooth nonconvex Lipschitz functions by producing $(δ,ε)$-stationary points. Several recent works have presented randomized algorithms that produce such points using $ ilde O(δ^{-1}ε^{-3})$ first-order oracle calls, independent of the dimension $d$. It has been an open problem as to whether a similar result can be obtained via a deterministic algorithm. We resolve this open problem, showing that randomization is necessary to obtain a dimension-free rate. In particular, we prove a lower bound of $Ω(d)$ for any deterministic algorithm. Moreover, we show that unlike smooth or convex optimization, access to function values is required for any deterministic algorithm to halt within any finite time. On the other hand, we prove that if the function is even slightly smooth, then the dimension-free rate of $ ilde O(δ^{-1}ε^{-3})$ can be obtained by a deterministic algorithm with merely a logarithmic dependence on the smoothness parameter. Motivated by these findings, we turn to study the complexity of deterministically smoothing Lipschitz functions. Though there are efficient black-box randomized smoothings, we start by showing that no such deterministic procedure can smooth functions in a meaningful manner, resolving an open question. We then bypass this impossibility result for the structured case of ReLU neural networks. To that end, in a practical white-box setting in which the optimizer is granted access to the network's architecture, we propose a simple, dimension-free, deterministic smoothing that provably preserves $(δ,ε)$-stationary points. Our method applies to a variety of architectures of arbitrary depth, including ResNets and ConvNets. Combined with our algorithm, this yields the first deterministic dimension-free algorithm for optimizing ReLU networks, circumventing our lower bound.
研究の動機と目的
- 非滑らかで非凸なリプシッツ関数を最適化する際、決定的アルゴリズムが次元に依存しない複雑度を達成できるかどうかを明らかにすること。
- この問題クラスにおいて、確率的化の必要性と0次オラクルアクセスの役割を、決定的アルゴリズムの観点から調査すること。
- $(\delta,\epsilon)$-ゴールドスタイン停留点を保持し、次元に依存しない最適化を可能にするReLUニューラルネットワーク向けの決定的スムージング法を開発すること。
- 一般のリプシッツ関数に対して、効率的な決定的ブラックボックススムージングが存在するかという未解決の問題を解決すること。
提案手法
- 任意の決定的1次元アルゴリズムに対して、次元に依存する下界$\Omega(d)$を証明し、次元に依存しないレートを達成するには確率的化が必要であることを示している。
- 勾配オラクルのみを用いる決定的アルゴリズムでは、$(\delta,\epsilon)$-ゴールドスタイン停留点への有限時間収束を保証できないこと、関数値のアクセス(0次オラクル)が必要であることを確立している。
- アーキテクチャの知識を活用して、ホワイトボックス設定下でのReLUネットワーク向けに決定的スムージング手順を導入し、$(\delta,\epsilon)$-ゴールドスタイン停留性を保持している。
- 一般のリプシッツ関数に対して、効率的なブラックボックス決定的スムージングが意味のある保証を提供できないことを、スムージングの複雑度を解析することで証明している。
- 提案された決定的スムージングを、やや滑らかな関数向けの次元に依存しないアルゴリズムと組み合わせることで、$\widetilde{O}(\delta^{-1}\epsilon^{-3})$のオラクル複雑度を達成し、滑らかさパラメータに対して対数的依存性を示している。
- 帰納的解析と部分勾配ノルムおよび近傍半径に関する再帰的境界を用いて、提案されたスムージング下での収束保証を確立している。
実験結果
リサーチクエスチョン
- RQ1決定的非滑らかで非凸最適化において、次元に依存しないレートを達成することは可能か?
- RQ20次オラクルの使用が、この問題における決定的アルゴリズムの有限時間収束を可能にするか?
- RQ3決定的ブラックボックススムージング手順が、一般のリプシッツ関数を意味的にスムージングできるか?
- RQ4アーキテクチャの知識を用いて、ReLUニューラルネットワーク向けに決定的かつ次元に依存しないアルゴリズムを構築できるか?
- RQ5決定的最適化における非滑らかで非凸関数の滑らかさと次元依存性のトレードオフは何か?
主な発見
- $(\delta,\epsilon)$-ゴールドスタイン停留点を探索する任意の決定的1次元アルゴリズムは、$\Omega(d)$のオラクル呼び出し回数の下界を負担しなければならず、次元に依存しない複雑度を達成するには確率的化が必要であることを証明している。
- 関数値のアクセスがなければ、決定的アルゴリズムは$(\delta,\epsilon)$-ゴールドスタイン停留点への有限時間収束を保証できないため、0次オラクルの必要性が確立されている。
- わずかに滑らかな関数に対しては、決定的アルゴリズムが最適な次元に依存しないレート$\widetilde{O}(\delta^{-1}\epsilon^{-3})$を達成し、滑らかさパラメータに対して対数的依存性を示している。
- 一般のリプシッツ関数に対して、効率的な決定的ブラックボックススムージング手順は意味的にスムージングを提供できないため、文脈文献における未解決の問題が解決された。
- 任意の深さのReLUネットワーク(ResNets や ConvNets を含む)向けに、$(\delta,\epsilon)$-ゴールドスタイン停留性を保持する、新たなホワイトボックス決定的スムージングが提案された。
- 提案されたホワイトボックススムージングとやや滑らかなアルゴリズムを組み合わせることで、ReLUネットワーク最適化のための、初めての決定的かつ次元に依存しないアルゴリズムが得られ、一般の下界を回避している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。