Skip to main content
QUICK REVIEW

[論文レビュー] Stochastic Variance-Reduced ADMM

Shuai Zheng, James T. Kwok|arXiv (Cornell University)|Apr 24, 2016
Stochastic Gradient Optimization Techniques参考文献 29被引用数 6
ひとこと要約

本稿では、凸問題に対して高速な線形収束を達成し、最小限の記憶領域を要する、サンプルサイズ n に依存しないスケーリングを実現する、スケジュール付きバリアンス削減付き ADMM アルゴリズムである SVRG-ADMM を提案する。非凸問題に対しても収束保証を提供する。SAG-ADMM や SCAS-ADMM よりも高速かつスケーラブルであり、過去の勾配や双対変数を保存せずに勾配の再利用を効率的に行うため、大規模データセット上でも顕著な性能向上を示す。

ABSTRACT

The alternating direction method of multipliers (ADMM) is a powerful optimization solver in machine learning. Recently, stochastic ADMM has been integrated with variance reduction methods for stochastic gradient, leading to SAG-ADMM and SDCA-ADMM that have fast convergence rates and low iteration complexities. However, their space requirements can still be high. In this paper, we propose an integration of ADMM with the method of stochastic variance reduced gradient (SVRG). Unlike another recent integration attempt called SCAS-ADMM, the proposed algorithm retains the fast convergence benefits of SAG-ADMM and SDCA-ADMM, but is more advantageous in that its storage requirement is very low, even independent of the sample size $n$. We also extend the proposed method for nonconvex problems, and obtain a convergence rate of $O(1/T)$. Experimental results demonstrate that it is as fast as SAG-ADMM and SDCA-ADMM, much faster than SCAS-ADMM, and can be used on much bigger data sets.

研究の動機と目的

  • SAG-ADMM や SDCA-ADMM のようなバリアンス削減付き確率的 ADMM 法がサンプルサイズ n に比例して記憶領域を要するという高コストな記憶領域の問題に対処すること。
  • SVRG 法を ADMM に統合し、収束速度を高速化するとともに、記憶領域の最小化を実現する方法を確立すること。
  • 非凸問題における提案手法の理論的収束レートを確立すること。非凸問題ではこのような保証が限られている。
  • 大規模・高次元の機械学習問題において、提案手法の実用的優位性を示すこと。

提案手法

  • SVRG を ADMM により密接に統合し、過去の勾配を保存せずに、制御変数を用いて勾配の分散を低減する。
  • 内部ループで一定ステップサイズを採用し、徐々に小さくするステップサイズを必要としないため、収束が速い。
  • 二段階更新スキームを導入:一方の段階ではスナップショット点でのフル勾配を計算し、もう一方では制御変数による分散低減付きの確率的勾配を使用する。
  • ADMM の収束が停留点に至ることを示す最近の理論的結果を活用し、非凸問題へのフレームワークの拡張を図る。
  • 1回の反復コストを低減しながら分散低減を維持するため、勾配計算にミニバッチ近似を用いる。
  • 収束を最適化するためにペナルティパラメータ ρ を調整し、最適選択の理論的根拠を提示する。

実験結果

リサーチクエスチョン

  • RQ1SVRG を ADMM に効果的に統合することで、低記憶領域で高速収束を達成できるか?
  • RQ2提案手法は、SAG-ADMM の O(nd) 記憶領域や SDCA-ADMM の O(n) 記憶領域を回避しながら、凸問題において線形収束レートを維持できるか?
  • RQ3提案手法は非凸問題に対しても収束保証を達成できるか?収束レートは何か?
  • RQ4大規模データセット上での既存の確率的 ADMM 変種(SCAS-ADMM, SAG-ADMM, SDCA-ADMM)と比較して、実用的性能はどうか?

主な発見

  • SVRG-ADMM は強い凸問題において線形収束を達成し、SAG-ADMM や SDCA-ADMM と同等の収束速度を示すが、サンプルサイズ n に依存しない O(d) の記憶領域で十分である。
  • 1,000 タスクを含む ImageNet データセットでは、SVRG-ADMM は記憶領域がたったの 62.5MB にとどまる一方、SAG-ADMM は 38.2TB、SDCA-ADMM は 9.6GB を要した。
  • minist8m や dna のような大規模データセットでは、SVRG-ADMM は SCAS-ADMM よりも高速に収束する。後者は逐次的な部分問題更新のため、性能が著しく劣化していた。
  • 非凸グラフ誘導融合ラッソ問題において、a9a, news20, covertype データセットで、非凸モデルが SVRG-ADMM を用いて凸モデルよりも低いテスト誤差を達成した。
  • 命題 3 で導出された最適なペナルティパラメータ ρ は、TV 回帰実験で最も速い収束を示し、他の ρ 値を上回った。
  • マルチタスク学習において、SVRG-ADMM は最小限の記憶領域で良好な解へ迅速に収束し、大規模問題へのスケーラビリティを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。