Skip to main content
QUICK REVIEW

[論文レビュー] Zeroth-Order Hybrid Gradient Descent: Towards A Principled Black-Box Optimization Framework

Pranay Sharma, Kaidi Xu|arXiv (Cornell University)|Dec 21, 2020
Stochastic Gradient Optimization Techniques参考文献 41被引用数 4
ひとこと要約

本稿では、ランダムおよび座標ごとの勾配推定を組み合わせることで分散を低減しつつ関数クエリ数を最小限に抑える、新規の零次微分ハイブリッド勾配推定器(HGE)を提案する。得られる ZO-HGD 法は、座標の重要度サンプリングとハイブリッド勾配分散低減を用いて、凸ケースでは最適な境界に一致し、非凸ケースの先行研究を一般化する、改善された収束速度を達成する。

ABSTRACT

In this work, we focus on the study of stochastic zeroth-order (ZO) optimization which does not require first-order gradient information and uses only function evaluations. The problem of ZO optimization has emerged in many recent machine learning applications, where the gradient of the objective function is either unavailable or difficult to compute. In such cases, we can approximate the full gradients or stochastic gradients through function value based gradient estimates. Here, we propose a novel hybrid gradient estimator (HGE), which takes advantage of the query-efficiency of random gradient estimates as well as the variance-reduction of coordinate-wise gradient estimates. We show that with a graceful design in coordinate importance sampling, the proposed HGE-based ZO optimization method is efficient both in terms of iteration complexity as well as function query cost. We provide a thorough theoretical analysis of the convergence of our proposed method for non-convex, convex, and strongly-convex optimization. We show that the convergence rate that we derive generalizes the results for some prominent existing methods in the nonconvex case, and matches the optimal result in the convex case. We also corroborate the theory with a real-world black-box attack generation application to demonstrate the empirical advantage of our method over state-of-the-art ZO optimization approaches.

研究の動機と目的

  • ブラックボックス設定における既存の零次(ZO)最適化手法の高い分散とクエリ非効率性を解消すること。
  • ランダムおよび座標ごとの勾配推定を組み合わせることで、クエリ効率と分散低減の両立を図るハイブリッド勾配推定器(HGE)を開発すること。
  • 固定クエリ予算下での勾配推定器の分散低減をさらに高めるために、座標の重要度サンプリングを導入すること。
  • 標準的な滑らかさおよび有界性仮定の下で、非凸、凸、強い凸問題に対する理論的収束保証を確立すること。
  • 深層ニューラルネットワークにおける実世界のブラックボックス攻撃生成タスクにおいて、提案手法の経験的優位性を示すこと。

提案手法

  • ランダム勾配推定(クエリ効率が良い)と座標ごとの勾配推定(分散が小さい)を線形結合することで、ハイブリッド勾配推定器(HGE)を提案する。
  • 勾配の大きさが大きい座標を優先するように、座標の重要度サンプリング戦略を設計し、クエリコストを増加させることなく推定器の分散を低減する。
  • HGE を零次ハイブリッド勾配降下法(ZO-HGD)フレームワークに統合し、ランダムおよび座標ベースの推定値の重み付き組み合わせを用いる。
  • 徐々に小さくなるステップサイズルールと、適応的な組み合わせ係数を用いて、2種類の推定タイプのバランスを保ち、収束を保証する。
  • 理論的分析では、関数の滑らかさ、勾配の有界性、およびサブガウスノイズの仮定を用い、収束速度を導出する。
  • 関数値のみの勾配に適応した、第一階層手法(例:SVRG、SPIDER)の分散低減技術を模倣し、ZO設定に適合させる。

実験結果

リサーチクエスチョン

  • RQ1零次最適化において、分散低減とクエリ効率の両立を図れるハイブリッド勾配推定器を設計できるか?
  • RQ2固定クエリ予算下で、座標の重要度サンプリングは ZO 勾配推定器の性能をどのように向上させるか?
  • RQ3提案された ZO-HGD 法の理論的収束速度は、非凸、凸、強い凸設定でそれぞれどのように振る舞うか?
  • RQ4最先端の ZO 手法と比較して、提案手法は最適または近似最適な収束速度を達成できるか?
  • RQ5ZO-HGD フレームワークは、実用的なブラックボックス攻撃生成タスクにおいて、既存の ZO 手法を上回ることができるか?

主な発見

  • 凸関数に対して、提案された ZO-HGD 法は収束速度 $ Oig((G^2 + \rho^2)/(ar{\rho} T) \frac{1 + d/n_r}{1 + \bar{c}(1 + d/n_r)}ig) $ を達成し、第一階層手法の最適境界と一致する。
  • 非凸問題においては、既存の ZO-SGD や ZO-SVRG 手法よりも一般化され、特に高次元設定で優れた性能を示す。
  • 強い凸ケースでは最適な収束が達成され、収束速度はランダムおよび座標ベースの勾配推定のバランスに依存する。
  • 理論的分析により、ハイブリッド推定器が分散を低減しつつ低クエリ複雑度を維持していることが確認され、期待勾配ノルムおよび反復点の境界を通じて妥当性が裏付けられる。
  • 深層ニューラルネットワークにおけるブラックボックス敵対的攻撃生成タスクにおける経験的結果から、ZO-HGD は最先端の ZO 手法をクエリ効率および攻撃成功確率の両面で上回る。
  • $ \bar{c} $(最小サンプリング確率)と $ \bar{\rho} $(滑らかさパラメータ)の選定が収束に顕著に影響し、最適なチューニングにより近似最適な収束速度が得られる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。