[論文レビュー] A General Family of Stochastic Proximal Gradient Methods for Deep Learning
本稿では、任意の正のプレコンディショナと下半連続(非凸を含む)正則化子をサポートする深層学習のための一般化された確率的近位勾配法、ProxGen を提案する。標準的な確率的近位勾配降下法と同等の収束保証を確立し、ℓq 正則化(0 ≤ q ≤ 1)および量子化のための修正版 ProxQuant に対して新たな閉形式の近位写像を導入する。実験により、近位法は特に非凸正則化子を用いる場合、部分勾配法を上回ることを示している。
We study the training of regularized neural networks where the regularizer can be non-smooth and non-convex. We propose a unified framework for stochastic proximal gradient descent, which we term ProxGen, that allows for arbitrary positive preconditioners and lower semi-continuous regularizers. Our framework encompasses standard stochastic proximal gradient methods without preconditioners as special cases, which have been extensively studied in various settings. Not only that, we present two important update rules beyond the well-known standard methods as a byproduct of our approach: (i) the first closed-form proximal mappings of $\ell_q$ regularization ($0 \leq q \leq 1$) for adaptive stochastic gradient methods, and (ii) a revised version of ProxQuant that fixes a caveat of the original approach for quantization-specific regularizers. We analyze the convergence of ProxGen and show that the whole family of ProxGen enjoys the same convergence rate as stochastic proximal gradient descent without preconditioners. We also empirically show the superiority of proximal methods compared to subgradient-based approaches via extensive experiments. Interestingly, our results indicate that proximal methods with non-convex regularizers are more effective than those with convex regularizers.
研究の動機と目的
- 深層学習における任意の正のプレコンディショナと滑らかでない非凸正則化子をサポートする、統一された確率的近位勾配降下のフレームワークの開発。
- プレコンディショナと非凸正則化子を用いた適応的確率的近位勾配法に対して、理論的収束保証が不足している問題の解決。
- ℓq 正則化(0 ≤ q ≤ 1)のための閉形式近位写像の導出により、適応的手法における効率的実装を可能にする。
- ネットワーク量子化のための ProxQuant 法の欠陥を、ProxGen フレームワークに統合することで是正する。
- 近位法が非凸正則化子を用いる場合、部分勾配ベースの手法や標準的な近位法を実験的に上回ることの検証。
提案手法
- 任意の正のプレコンディショナと下半連続正則化子を統合する、確率的近位勾配降下の一般化フレームワークである ProxGen を提案する。
- 損失関数における勾配降下と正則化子における正確な近位写像の組み合わせによる、新たな更新則を導出。非凸および滑らかでない正則化子に対しても有効である。
- リャプノフ関数を用いた解析と確率的勾配の分散のバウンディングにより、定常点までの距離を評価し、収束速度を確立する。
- ℓq 正則化(0 ≤ q ≤ 1)のための閉形式近位写像を導入。計算効率が高く、適応的手法への適用を可能にする。
- 量子化に適した学習のための更新則を是正することで、ProxQuant を改訂。正しく近位降下が行われるようになり、安定性と収束性が向上する。
- モーメンタムに基づく更新と適応的学習率、勾配の指数移動平均を用いる。非凸および滑らかでない設定下でも収束を保証する。
実験結果
リサーチクエスチョン
- RQ1任意の正のプレコンディショナと非凸正則化子をサポートする統一的確率的近位勾配フレームワークを、深層学習に設計可能か?
- RQ2ℓq 正則化(0 ≤ q ≤ 1)のための閉形式近位写像は、適応的最適化におけるより効率的かつ安定した学習を可能にするか?
- RQ3ProxGen フレームワークは、元の ProxQuant 法における収束問題を是正できるか?
- RQ4ProxGen の収束速度は、プレコンディショナを用いない標準的な確率的近位勾配降下と同等か?
- RQ5実際の応用において、非凸正則化子を用いた近位法は、部分勾配ベース手法や凸正則化子を用いた手法を上回るか?
主な発見
- ProxGen は、適応的学習率と一般正則化子を組み込むにもかかわらず、プレコンディショナなしの標準的な確率的近位勾配降下と同等の収束速度を達成する。
- 本フレームワークは、先行研究では得られなかった ℓq 正則化(0 ≤ q ≤ 1)のための閉形式近位写像を可能にし、計算効率を向上させる。
- ProxGen 内の改訂版 ProxQuant は、元の手法における重大な欠陥を是正し、より安定的かつ正確な量子化に適した学習を実現する。
- 実験的結果により、非凸正則化子を用いた近位法は、部分勾配ベース手法や凸正則化子を用いた手法に比べ、収束速度と最終的なモデル性能の両面で顕著に優れていることが示された。
- 理論的解析により、収束速度が確率的勾配の分散とプレコンディショナの安定性に依存することが確認され、反復回数 T に依存しない定数に依存する。
- 本フレームワークは一般性に富んでおり、プレコンディショニングや特定の正則化子を使用しない場合、AdaGrad や RMSProp、Adam といった既存手法を特別なケースとして含むことができる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。