Skip to main content
QUICK REVIEW

[論文レビュー] Fast Variance Reduction Method with Stochastic Batch Size

Xuanqing Liu, Cho‐Jui Hsieh|arXiv (Cornell University)|Aug 7, 2018
Stochastic Gradient Optimization Techniques被引用数 6
ひとこと要約

この論文は、メモリ階層とI/Oコストを考慮して実行時間を最小化するように動的にバッチサイズを最適化する、バリアンス低減アルゴリズムSAGA++を提案する。標準のSAGAとは異なり、データアクセス数を最小化するのではなく、順方向アクセスを優先することで実際の収束速度を向上させ、SAGA、SVRG、LIBLINEARを実データセット上で上回る。バッチサイズの適応的選択と頻繁な制御変数更新がその要因である。

ABSTRACT

In this paper we study a family of variance reduction methods with randomized batch size---at each step, the algorithm first randomly chooses the batch size and then selects a batch of samples to conduct a variance-reduced stochastic update. We give the linear convergence rate for this framework for composite functions, and show that the optimal strategy to achieve the optimal convergence rate per data access is to always choose batch size of 1, which is equivalent to the SAGA algorithm. However, due to the presence of cache/disk IO effect in computer architecture, the number of data access cannot reflect the running time because of 1) random memory access is much slower than sequential access, 2) when data is too big to fit into memory, disk seeking takes even longer time. After taking these into account, choosing batch size of $1$ is no longer optimal, so we propose a new algorithm called SAGA++ and show how to calculate the optimal average batch size theoretically. Our algorithm outperforms SAGA and other existing batched and stochastic solvers on real datasets. In addition, we also conduct a precise analysis to compare different update rules for variance reduction methods, showing that SAGA++ converges faster than SVRG in theory.

研究の動機と目的

  • 有限和最適化における確率的バッチサイズの影響がバリアンス低減収束速度に与える影響を分析すること。
  • キャッシュやディスクI/Oなどの実世界の計算コストを考慮した場合の最適バッチサイズ戦略を特定すること。
  • 収束速度とハードウェアに配慮した効率性の両立を図る実用的なアルゴリズムを開発すること。
  • 現実的なメモリアクセス制約下でSAGA++、SVRG、SAGAを理論的および実験的に比較すること。
  • 頻繁な制御変数更新と順方向アクセスパターンが、最小データアクセスよりも実行時間を短くする理由を示すこと。

提案手法

  • アルゴリズムは、確率的バッチサイズを用いたバリアンス低減の統一フレームワークを採用しており、各ステップで勾配計算の前にバッチサイズを確率的に選択する。
  • 任意のバッチサイズ分布に対して、合成的で強い凸問題で線形収束を証明し、バッチサイズ1(SAGA)がデータアクセス回数を最小化することを示す。
  • 順方向アクセスとランダムアクセス、ディスクI/Oオーバーヘッドを考慮したハードウェアに配慮したコストモデリングを組み込む。
  • SAGA++は、単にデータアクセス回数ではなく、実行時間を最小化するように最適な平均バッチサイズを動的に計算する。
  • ℓ₁正則化問題に対してラージ更新を実装し、収束を加速することで、標準のSAGAやSVRGよりも効率性を向上させる。
  • SVRGの順方向アクセスの利点とSAGAの頻繁な制御変数更新の利点を組み合わせ、勾配の分散を低減する。

実験結果

リサーチクエスチョン

  • RQ1実際のハードウェアI/Oコストを考慮した場合、バッチサイズを増加させることでバリアンス低減手法の収束速度が向上するか?
  • RQ2データアクセス回数ではなく、実行時間を最小化する最適なバッチサイズ戦略は何か?
  • RQ3メモリアクセス制約下で、更新ルールの選択(例:SAGA対SVRG)が収束速度に与える影響は何か?
  • RQ4順方向アクセスと頻繁な制御変数更新を組み合わせたハイブリッド手法は、既存手法を上回るか?
  • RQ5キャッシュやディスクI/Oの影響により、理論的には優位なSAGAが実際にはなぜ優位でなくなるのか?

主な発見

  • SAGA++は、kddb、avazu、criteoを含むすべてのテストデータセットで、SAGA、SVRG、LIBLINEARを実行時間で上回る。
  • SAGAはバッチサイズ1を用いることでデータアクセス回数を最小化するが、ランダムメモリアクセスのオーバーヘッドのため実際には最適ではない。
  • SAGA++の最適な平均バッチサイズは、順方向アクセス速度とI/Oコストを考慮して理論的に導出された。
  • SAGA++は、より頻繁な制御変数更新のおかげで理論的にSVRGよりも収束が速い。これは勾配分散を低減するからである。
  • ラージ更新技術はℓ₁正則化ソルバーの収束を顕著に加速し、SAGA++がLIBLINEARのプロキシマルニュートン法でさえも上回ることを可能にした。
  • kddbデータセットでは、正則化パラメータが異なる場合でもSAGA++は常に競合他社を上回り、強靭性と効率性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。