Skip to main content
QUICK REVIEW

[論文レビュー] Nonconvex Zeroth-Order Stochastic ADMM Methods with Lower Function Query Complexity

Feihu Huang, Shangqian Gao|arXiv (Cornell University)|Jul 30, 2019
Stochastic Gradient Optimization Techniques参考文献 45被引用数 5
ひとこと要約

本稿では、複数の滑らかでない正則化項を伴う有限和およびオンライン最適化問題を解くために、非凸ゼロ次最適化のための新しい非確率的ADMM手法、ZO-SPIDER-ADMMおよびZOO-ADMM+を提案する。分散低減による勾配推定と座標単位の平滑化を活用することで、それぞれ$O(nd + dn^{1/2}\rho^{-1})$および$O(d\rho^{-3/2})$の関数クエリ複雑度が達成され、先行研究より$O(d^{1/3}n^{1/6})$および$O(\rho^{-1/2})$の要因で優れている。本手法はブラックボックスの敵対的攻撃において実証され、効率性と低クエリコストを示している。

ABSTRACT

Zeroth-order (a.k.a, derivative-free) methods are a class of effective optimization methods for solving complex machine learning problems, where gradients of the objective functions are not available or computationally prohibitive. Recently, although many zeroth-order methods have been developed, these approaches still have two main drawbacks: 1) high function query complexity; 2) not being well suitable for solving the problems with complex penalties and constraints. To address these challenging drawbacks, in this paper, we propose a class of faster zeroth-order stochastic alternating direction method of multipliers (ADMM) methods (ZO-SPIDER-ADMM) to solve the nonconvex finite-sum problems with multiple nonsmooth penalties. Moreover, we prove that the ZO-SPIDER-ADMM methods can achieve a lower function query complexity of $O(nd+dn^{\frac{1}{2}}ε^{-1})$ for finding an $ε$-stationary point, which improves the existing best nonconvex zeroth-order ADMM methods by a factor of $O(d^{\frac{1}{3}}n^{\frac{1}{6}})$, where $n$ and $d$ denote the sample size and data dimension, respectively. At the same time, we propose a class of faster zeroth-order online ADMM methods (ZOO-ADMM+) to solve the nonconvex online problems with multiple nonsmooth penalties. We also prove that the proposed ZOO-ADMM+ methods achieve a lower function query complexity of $O(dε^{-\frac{3}{2}})$, which improves the existing best result by a factor of $O(ε^{-\frac{1}{2}})$. Extensive experimental results on the structure adversarial attack on black-box deep neural networks demonstrate the efficiency of our new algorithms.

研究の動機と目的

  • 複雑な滑らかでない正則化項を伴う非凸設定において、既存のゼロ次最適化ADMM手法の高い関数クエリ複雑度と適用範囲の制限を解決すること。
  • 複数の滑らかでない正則化項を伴う有限和およびオンライン最適化に適した、より高速なゼロ次最適化確率的ADMMアルゴリズムの開発。
  • 非凸問題における$\epsilon$-停留点を求める際の理論的収束速度を向上させるとともに、関数クエリ複雑度を低減すること。
  • 必要な関数クエリ数を削減することで、深層ニューラルネットワークに対する効率的なブラックボックスの敵対的攻撃を可能にすること。

提案手法

  • 座標単位の勾配推定器(CooGE)とSPIDERフレームワークによる分散低減を用いて、勾配推定誤差を低減する非凸有限和問題向けのZO-SPIDER-ADMMを提案。
  • ADMMフレームワークに確率的経路統合微分推定(SARAH/SPIDER)を統合し、非凸有限和最適化における関数クエリ複雑度を低減。
  • 類似した分散低減技術を用いて、オンライン非凸問題向けのZOO-ADMM+を設計し、クエリコストを削減しつつ高速収束を実現。
  • 勾配の存在が制限される状況でも、ガウス平滑化と一様平滑化勾配推定器(GauGE, UniGE)に加え、座標単位推定(CooGE)を用いて勾配近似の精度を向上。
  • 収束性と安定性をバランスさせるために、ハイブリッドステップサイズとペナルティパラメータ戦略($\eta = \frac{\alpha\sigma_{\min}(G)}{4L}$ および $\rho = \frac{2\sqrt{237}\kappa_GL}{\sigma^{A}_{\min}\alpha}$)を採用。
  • 期待される部分勾配ノルムと制約違反に基づく理論的分析を用い、KKT点からの距離をバウンドすることで、$\epsilon$-停留点への収束を保証。

実験結果

リサーチクエスチョン

  • RQ1複数の滑らかでない正則化項を伴う非凸有限和問題において、ゼロ次最適化ADMM手法がより低い関数クエリ複雑度を達成できるか。
  • RQ2SPIDERスタイルの推定による分散低減は、勾配が得られない最適化におけるゼロ次最適化ADMMの収束にどのように寄与するか。
  • RQ3既存手法より、理論的に低いクエリ複雑度を達成できるオンラインゼロ次最適化ADMM手法を設計できるか。
  • RQ4これらの手法は、深層ニューラルネットワークに対するブラックボックスの敵対的攻撃において、関数クエリ数をどの程度削減できるか。

主な発見

  • ZO-SPIDER-ADMMは、非凸有限和問題における$\epsilon$-停留点を求めるにあたり、関数クエリ複雑度$O(nd + dn^{1/2}\epsilon^{-1})$を達成し、先行手法より$O(d^{1/3}n^{1/6})$の要因で改善された。
  • ZOO-ADMM+は、オンライン非凸問題において関数クエリ複雑度$O(d\epsilon^{-3/2})$を達成し、最良の既存結果より$O(\epsilon^{-1/2})$の要因で改善された。
  • 理論的分析により、期待される部分勾配ノルムと制約違反が$O(1/K) + O(d^2\nu^2) + O(d\mu^2) + O(1/b_1)$に収束することが確認され、$\epsilon$-停留点への収束が保証された。
  • 提案手法はブラックボックスの敵対的攻撃において実証的に検証され、ベースラインのゼロ次最適化手法と比較して優れた効率性と低クエリコストを示した。
  • ステップサイズとペナルティパラメータを慎重にバランスさせることで、非凸かつ滑らかでない設定下でも安定性と収束性を維持した。
  • 解析により、$\beta_{\max}$、$\gamma$、および$\vartheta_1, \vartheta_2$といった重要なパラメータが$n$および$K$に依存せずに有界であることが示され、スケーラビリティが保証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。