[論文レビュー] DeepZero: Scaling up Zeroth-Order Optimization for Deep Model Training
DeepZeroは、深層ニューラルネットワーク(DNN)のスケーラブルなゼロ次(ZO)最適化フレームワークを導入し、従来の精度と効率性の制限を克服した。座標単位の勾配推定、スパarsity誘導型プルーニング、および前方並列化による特徴再利用を活用することで、CIFAR-10のResNet-20において最先端の精度を達成し、1次最適化の性能に近づいた。同時に、敵対的防御やPDE誤差補正における実用的なブラックボックス応用を可能にした。
Zeroth-order (ZO) optimization has become a popular technique for solving machine learning (ML) problems when first-order (FO) information is difficult or impossible to obtain. However, the scalability of ZO optimization remains an open problem: Its use has primarily been limited to relatively small-scale ML problems, such as sample-wise adversarial attack generation. To our best knowledge, no prior work has demonstrated the effectiveness of ZO optimization in training deep neural networks (DNNs) without a significant decrease in performance. To overcome this roadblock, we develop DeepZero, a principled ZO deep learning (DL) framework that can scale ZO optimization to DNN training from scratch through three primary innovations. First, we demonstrate the advantages of coordinatewise gradient estimation (CGE) over randomized vector-wise gradient estimation in training accuracy and computational efficiency. Second, we propose a sparsityinduced ZO training protocol that extends the model pruning methodology using only finite differences to explore and exploit the sparse DL prior in CGE. Third, we develop the methods of feature reuse and forward parallelization to advance the practical implementations of ZO training. Our extensive experiments show that DeepZero achieves state-of-the-art (SOTA) accuracy on ResNet-20 trained on CIFAR-10, approaching FO training performance for the first time. Furthermore, we show the practical utility of DeepZero in applications of certified adversarial defense and DL-based partial differential equation error correction, achieving 10-20% improvement over SOTA. We believe our results will inspire future research on scalable ZO optimization and contribute to advancing DL with black box. Codes are available at https://github.com/OPTML-Group/DeepZero.
研究の動機と目的
- 深層学習におけるゼロ次(ZO)最適化のスケーラビリティギャップを解消すること。これまでは大規模なモデルの学習が効果的にできなかった。
- 高次元DNNにおける有限差分ベースのZO勾配推定の高いバイアスと計算コストを克服すること。
- 計算グラフやバックプロパゲーションにアクセスできない状況でも、エンドツーエンドのZO学習を可能にすること。ブラックボックスやハードウェア制約のある環境での利用を想定する。
- ZO学習の実用的有用性を、例えば認証可能な敵対的防御や物理的制約付きPDE誤差補正といった実世界の応用事例で示すこと。
- スパarsityを活用することで、クエリ効率性とモデルの解釈可能性を保ちながら、1次手法に近い精度を達成すること。
提案手法
- ランダムベクトル単位の推定(RGE)ではなく、座標単位の勾配推定(CGE)を採用することで、深層ネットワークにおける分散の低減と収束の向上を実現した。
- 有限差分勾配推定中に深層ニューラルネットワークに内在するスパarsityを活用する、スパarsity誘導型ZO学習プロトコルを導入した。
- 冗長な前方パスを削減し、複数のパラメータにわたるZO学習を高速化するため、特徴再利用と前方並列化を実装した。
- 計算グラフに依存せず、モデルクエリのみに依存する、ブラックボックスやリソース制約のある環境でも利用可能な、計算グラフフリーの学習パイプラインを設計した。
- Adam最適化子内にZO最適化フレームワークを統合し、適応的学習率と安定した学習ダイナミクスを実現した。
- 統一された損失定式化により、教師あり学習(例:CIFAR-10)および物理的制約付き学習(例:PDE誤差補正)の両方への適用を可能にした。

実験結果
リサーチクエスチョン
- RQ1座標単位の勾配推定(CGE)は、深層ZO最適化において、ランダムベクトル単位の推定(RGE)よりも、学習精度と計算効率の面で優れていると言えるか?
- RQ2モデルのスパarsityは、高次元DNNにおけるZO学習の収束性と安定性を向上させるために、どのように活用できるか?
- RQ3特徴再利用と前方並列化は、大規模DNN学習におけるZO最適化のクエリコストをどの程度削減できるか?
- RQ4ZO最適化は、深層モデルのスクラッチ学習において、1次手法と同等の性能を達成できるか?
- RQ5提案されたZOフレームワークは、認証可能な敵対的防御やPDE誤差補正といった実用的ブラックボックス学習タスクに効果的に応用できるか?
主な発見
- DeepZeroは、CIFAR-10で学習されたResNet-20に対して、ZO最適化を用いて最先端の精度を達成し、1次最適化手法の性能に近づいた。
- 座標単位の勾配推定(CGE)は、特に深層ネットワークにおいて、ランダムベクトル単位の推定よりも顕著に学習精度を向上させるとともに、計算コストを削減した。
- スパarsity誘導型学習プロトコルにより、有限差分推定中に深層モデルに内在するスパarsityを活用することで、安定的かつ効率的なZO学習が可能になった。
- 特徴再利用と前方並列化により、冗長なモデルクエリが削減され、実用的設定ではZO学習が最大3.5倍高速化された。
- 認証可能な敵対的防御および物理的制約付きPDE誤差補正タスクにおいて、従来の最先端手法比で10–20%の向上を達成した。
- 計算グラフやバックプロパゲーションが不要なエンドツーエンドのZO学習が可能であることを実証し、ブラックボックス環境やオンチップ学習シナリオへの展開を可能にした。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。