Skip to main content
QUICK REVIEW

[論文レビュー] On the Acceleration of L-BFGS with Second-Order Information and Stochastic Batches

Jie Liu, Yu Rong|arXiv (Cornell University)|Jul 14, 2018
Sparse and Compressive Sensing Techniques参考文献 17被引用数 4
ひとこと要約

本稿では、確率的バッチと近似ヘッセ行列またはフィッシャー情報行列を用いた安定な2次精度のL-BFGSフレームワークを提案する。有限和最適化における収束を加速し、凸および非凸問題の両方で線形収束を達成する。分散環境下で大規模バッチを用いた場合、SGD、ADAM、標準L-BFGSよりも優れた性能を示す。

ABSTRACT

This paper proposes a framework of L-BFGS based on the (approximate) second-order information with stochastic batches, as a novel approach to the finite-sum minimization problems. Different from the classical L-BFGS where stochastic batches lead to instability, we use a smooth estimate for the evaluations of the gradient differences while achieving acceleration by well-scaling the initial Hessians. We provide theoretical analyses for both convex and nonconvex cases. In addition, we demonstrate that within the popular applications of least-square and cross-entropy losses, the algorithm admits a simple implementation in the distributed environment. Numerical experiments support the efficiency of our algorithms.

研究の動機と目的

  • 有限和問題におけるノイズの多い勾配差分によって引き起こされる確率的L-BFGSの不安定性を解消すること。
  • 2次情報(ヘッセ行列またはフィッシャー行列)を活用することで、収束を高速化する安定で効率的なL-BFGSの変種を開発すること。
  • 曲率の近似にフィッシャー情報行列を用いることで、分散計算を可能にするスケーラブルな分散実装を可能とすること。
  • 凸および非凸な有限和最小化問題の両方に対して、線形収束の保証を確立すること。
  • ロジスティック回帰およびニューラルネットワークの学習において、ADAM、SGD、標準L-BFGSよりも実用的に優れた性能を示すこと。

提案手法

  • 勾配差分の滑らかな推定を用いることで、確率的L-BFGSにおける曲率近似の安定化を図るLBFGS-Hを導入する。
  • ヘッセ行列の近似をフィッシャー情報行列に置き換えることで、安定性を向上させるとともに分散計算を可能にするLBFGS-Fを提案する。
  • 限界的記憶(m)を用いた二重ループ再帰を採用し、曲率ペア(s_k, y_k)を効率的に用いて探索方向を計算する。
  • 線分探索または固定ステップサイズ戦略を用いて学習率を決定し、目的関数の十分な減少を保証する。
  • 安定性を維持し収束を加速するために、適切にスケーリングされた初期ヘッセ行列 H_k^0 を適用する。
  • ヘッセ行列の更新をフィッシャー情報行列に置き換えることで、通信コストと計算コストを削減し、分散展開を可能にする。

実験結果

リサーチクエスチョン

  • RQ1ノイズの多い勾配差分の影響を受けることなく、2次情報が確率的L-BFGSに効果的に組み込まれるか。
  • RQ2勾配差分の滑らかな推定を用いることで、確率的L-BFGSにおける収束の安定性が向上するか。
  • RQ3フィッシャー情報行列を用いたLBFGS-Fは、分散環境下で標準L-BFGSと同等またはそれ以上の性能を達成できるか。
  • RQ4提案されたフレームワークは、凸および非凸な有限和問題の両方で線形収束を達成するか。
  • RQ5特に大規模バッチの場合に、分散学習におけるアルゴリズムの性能はどの程度か。

主な発見

  • 標準的な仮定の下で、LBFGS-Hは凸および非凸な有限和問題の両方において、最適解の近傍への線形収束を達成する。
  • LBFGS-Fは分散環境下でも安定的かつ高速に収束し、特に大規模バッチを用いた場合にADAM、ADAGRAD、SGDを上回る性能を示す。
  • 数値実験では、LBFGS-Hは100回のランダムシードに対して一貫した性能を維持するが、ADAMやSGDは大規模バッチで著しく性能が低下する。
  • 大規模バッチ(例:4096)を用いる場合、LBFGS-Hは目標精度に到達するためのエポック数を削減し、分散システムにおける通信コストを最小化する。
  • 単一GPU上ではバッチサイズが2^6まで計算時間はほぼ一定を保つため、より大きなバッチへのスケーラビリティが示された。
  • ベースラインの確率的L-BFGSであるLBFGS-Sは高い不安定性と遅い収束を示し、本稿で提案する滑らかさの導入およびヘッセ/フィッシャー近似の必要性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。