Skip to main content
QUICK REVIEW

[論文レビュー] A Novel Stochastic Stratified Average Gradient Method: Convergence Rate and Its Complexity

Aixiang Chen, Bingchuan Chen|arXiv (Cornell University)|Oct 21, 2017
Stochastic Gradient Optimization Techniques参考文献 13被引用数 6
ひとこと要約

本稿では、層別抽出と反復平均化を組み合わせることで勾配分散を低減する、新たな確率的最適化手法SSAGを提案する。この手法は、データサイズ$N$に依存しない線形収束率$ olinebreak[4]\mathcal{O}((1 - \frac{\mu}{8CL})^k)$を達成し、低コストのストレージと反復コストを実現する。クラスレベルのデータ構造を活用することで、SAGや他のアルゴリズムを凌駕する性能を発揮する。

ABSTRACT

SGD (Stochastic Gradient Descent) is a popular algorithm for large scale optimization problems due to its low iterative cost. However, SGD can not achieve linear convergence rate as FGD (Full Gradient Descent) because of the inherent gradient variance. To attack the problem, mini-batch SGD was proposed to get a trade-off in terms of convergence rate and iteration cost. In this paper, a general CVI (Convergence-Variance Inequality) equation is presented to state formally the interaction of convergence rate and gradient variance. Then a novel algorithm named SSAG (Stochastic Stratified Average Gradient) is introduced to reduce gradient variance based on two techniques, stratified sampling and averaging over iterations that is a key idea in SAG (Stochastic Average Gradient). Furthermore, SSAG can achieve linear convergence rate of $\mathcal {O}((1-\fracμ{8CL})^k)$ at smaller storage and iterative costs, where $C\geq 2$ is the category number of training data. This convergence rate depends mainly on the variance between classes, but not on the variance within the classes. In the case of $C\ll N$ ($N$ is the training data size), SSAG's convergence rate is much better than SAG's convergence rate of $\mathcal {O}((1-\fracμ{8NL})^k)$. Our experimental results show SSAG outperforms SAG and many other algorithms.

研究の動機と目的

  • 大規模最適化における収束速度と計算コストのトレードオフを解消すること。
  • 反復コストやストレージ要件の増加なしに、確率的最適化における勾配分散を低減すること。
  • 特に$C \ll N$の状況下で、学習データサイズ$N$に依存しない線形収束を達成する手法の開発。
  • 新たな収束-分散不等式(CVI)を用いて、収束速度と勾配分散の関係を形式的に定式化すること。
  • 大規模データセット上で深層ニューラルネットワークを効率的に学習可能であり、強力な理論的保証を有するアルゴリズムの設計。

提案手法

  • 収束速度と勾配分散の関係を明確に定式化するための新たな収束-分散不等式(CVI)を導入する。
  • データクラスごとに均等にサンプリングできるように層別抽出を採用し、初期の勾配分散を低減する。
  • SAGにインspiredされた反復的平均化により、時間経過に伴う分散の増加を抑制する。
  • 層別抽出と勾配平均化を統合したハイブリッド手法として、SSAG(Stochastic Stratified Average Gradient)を提案する。
  • 強い凸性と行列解析を用いて収束レートの境界を導出し、線形収束を証明する。
  • クラス数$C$に依存する複雑度の境界を確立し、データサイズ$N$に依存しないことを示す。

実験結果

リサーチクエスチョン

  • RQ1サンプリングプロセスに層別抽出を用いることで、標準的なSGDやSAGと比較して、勾配分散をより効果的に低減できるか?
  • RQ2層別抽出と反復平均化を組み合わせることで、データサイズ$N$に依存しない線形収束率が得られるか?
  • RQ3確率的最適化において、勾配分散と収束速度の理論的関係は何か?
  • RQ4SSAGの収束速度が、データセット全体のサイズ$N$ではなくクラス数$C$にのみ依存することを理論的に証明できるか?
  • RQ5実際の性能において、SSAGはSAG、SVRG、SAGAと比較して収束速度と計算コストの面で優れているか?

主な発見

  • SSAGは、データサイズ$N$ではなくクラス数$C$に依存する線形収束率$\mathcal{O}((1 - \frac{\mu}{8CL})^k)$を達成する。
  • 特に$C \ll N$の状況では、SAGの$\mathcal{O}((1 - \frac{\mu}{8NL})^k)$と比較して、収束速度が顕著に速い。
  • 低コストのストレージと反復コストを維持しており、大規模なディープラーニングに適している。
  • 理論的解析により、収束速度が$N$に依存せず、クラス間分散にのみ依存することが証明された。
  • 実験結果から、SSAGはSAG、SVRG、SAGA、ミニバッチSGDをすべて上回る収束速度と安定性を示した。
  • 収束境界はシュール補行列条件と行列解析を用いて導出され、$E\|W^k - W^*\|^2 \leq (1 - \frac{\mu}{8CL})^k \cdot \mathcal{O}(\sigma_c^2(W^*))$が確立された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。