Skip to main content
QUICK REVIEW

[論文レビュー] Zeroth-order Asynchronous Doubly Stochastic Algorithm with Variance Reduction

Bin Gu, Zhouyuan Huo|arXiv (Cornell University)|Dec 5, 2016
Advanced Bandit Algorithms Research参考文献 18被引用数 11
ひとこと要約

本稿では、分散低減を統合した非同期二重確率的零番目の最適化手法 AsyDSZOVR を提案する。この手法は $O(1/T)$ の収束速度を達成し、従来の非同期および逐次的な確率的零番目最適化手法の $O(1/\sqrt{T})$ の速度を著しく上回る。本手法は、ロックフリーな並列環境において、同時にデータのミニバッチと座標部分集合をサンプリングすることで、勾配情報が不要な設定下での大規模最適化を効率的に行うことを可能にする。

ABSTRACT

Zeroth-order (derivative-free) optimization attracts a lot of attention in machine learning, because explicit gradient calculations may be computationally expensive or infeasible. To handle large scale problems both in volume and dimension, recently asynchronous doubly stochastic zeroth-order algorithms were proposed. The convergence rate of existing asynchronous doubly stochastic zeroth order algorithms is $O(\frac{1}{\sqrt{T}})$ (also for the sequential stochastic zeroth-order optimization algorithms). In this paper, we focus on the finite sums of smooth but not necessarily convex functions, and propose an asynchronous doubly stochastic zeroth-order optimization algorithm using the accelerated technology of variance reduction (AsyDSZOVR). Rigorous theoretical analysis show that the convergence rate can be improved from $O(\frac{1}{\sqrt{T}})$ the best result of existing algorithms to $O(\frac{1}{T})$. Also our theoretical results is an improvement to the ones of the sequential stochastic zeroth-order optimization algorithms.

研究の動機と目的

  • 大規模で勾配なしの機械学習問題に対して、高速収束を示す非同期零番目最適化手法の不足を補う。
  • 逐次的および非同期的両設定下で、既存の $O(1/\sqrt{T})$ 速度の確率的零番目最適化手法の遅い収束を克服する。
  • 勾配情報が不要な高次元・高ボリュームのデータを処理できる、スケーラブルでロックフリーな並列アルゴリズムを開発する。
  • 非同期で二重確率的フレームワーク内に分散低減技術を適用し、収束を加速する。

提案手法

  • 非同期的かつ二重確率的な零番目最適化手法 AsyDSZOVR を提案し、並列にデータのミニバッチと座標部分集合をランダムにサンプリングする。
  • 制御変数メカニズムを用いた分散低減勾配推定器を採用し、勾配近似のノイズを低減する。
  • 適応的ステップサイズ $\gamma = \frac{u_0 b}{\widetilde{L} l^\alpha}$ とモーメンタムに類似した項を用いた再帰的更新ルールを導入し、収束を加速する。
  • 非同期更新の下での収束を保証するために、リャプノフ関数に基づく解析を導入し、勾配の期待ノルムをバインドする。
  • 1イテレーションあたりの進捗の下界 $\widetilde{\Gamma}$ を導出し、$O(1/T)$ の収束速度を確立する。
  • スレッドが同期をとらずに共有パラメータを独立して読み取り、計算し、更新できるロックフリーな並列計算モデルを適用する。

実験結果

リサーチクエスチョン

  • RQ1分散低減技術は、非同期的・零番目の最適化に効果的に適応可能であり、より高速な収束を達成できるか?
  • RQ2分散低減を施した非同期的二重確率的零番目最適化アルゴリズムの理論的収束速度は何か?
  • RQ3逐次的および非同期的両設定下で、$O(1/\sqrt{T})$ を超える収束速度を達成できるか?
  • RQ4提案手法は、データ量および次元数の観点から大規模問題をどのように処理するか?
  • RQ5明示的な勾配計算なしに、ロックフリーで非同期な並列環境で収束を保証する条件は何か?

主な発見

  • 提案された AsyDSZOVR アルゴリズムは $O(1/T)$ の収束速度を達成し、従来の非同期および逐次的な確率的零番目最適化手法の $O(1/\sqrt{T})$ の速度を著しく上回る。
  • 理論的解析により、期待勾配ノルムが $O(1/T)$ に減少することが証明され、$\omega = 0$ のとき、$\frac{1}{T}\sum_{s=0}^{S-1}\sum_{t=0}^{m-1}\mathbb{E}\left\|\nabla f(x^{s+1}_t)\right\|^2 \leq \frac{\widetilde{L}l^\alpha(f(x^0) - \mathbb{E}(f(x^S)))}{\sigma b T}$ のバインドが得られる。
  • 勾配情報が存在しない状況下でも、分散低減と適応的ステップサイズスケジューリングにより収束速度が向上する。
  • 共有メモリ上でロックフリーな環境において、スケーラブルかつ効率的であり、同期のオーバーヘッドなしに並列更新が可能である。
  • 下界 $\widetilde{\Gamma} \geq \frac{\sigma b}{\widetilde{L}l^\alpha}$ が確立され、適切なパrameter選択のもとで $O(1/T)$ の収束が保証される。
  • ロジスティック回帰やリッジ回帰といった一般的な機械学習問題をカバーする、滑らかでおそらく凸でない関数の有限和に適用可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。