Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Distributed Hessian Free Algorithm for Large-scale Empirical Risk Minimization via Accumulating Sample Strategy

Majid Jahani, Xi He|arXiv (Cornell University)|Oct 26, 2018
Stochastic Gradient Optimization Techniques参考文献 31被引用数 12
ひとこと要約

本稿では、逐次的に増加するサンプルサイズを用いる蓄積的サンプル戦略を採用することで、大規模な経験的リスク最小化を効率的に解く、分散型でヘッセ行列を必要としないアルゴリズムDANCEを提案する。繰り返し、増加するサンプルサイズの部分問題を解き、ニュートンステップにプリコンディショニング共役勾配法を活用することで、統計的精度に近い収束を達成し、分散環境下でも強力なスケーリング性能を示す。

ABSTRACT

In this paper, we propose a Distributed Accumulated Newton Conjugate gradiEnt (DANCE) method in which sample size is gradually increasing to quickly obtain a solution whose empirical loss is under satisfactory statistical accuracy. Our proposed method is multistage in which the solution of a stage serves as a warm start for the next stage which contains more samples (including the samples in the previous stage). The proposed multistage algorithm reduces the number of passes over data to achieve the statistical accuracy of the full training set. Moreover, our algorithm in nature is easy to be distributed and shares the strong scaling property indicating that acceleration is always expected by using more computing nodes. Various iteration complexity results regarding descent direction computation, communication efficiency and stopping criteria are analyzed under convex setting. Our numerical results illustrate that the proposed method outperforms other comparable methods for solving learning problems including neural networks.

研究の動機と目的

  • 第二階層法の計算コストが高い問題を、ヘッセ行列の逆行列計算のオーバーヘッドを低減することで、大規模な経験的リスク最小化に適応する。
  • 分散環境下で通信ボトルネックやハイパーパrameterへの感受性のため、SGDのような一次法の非効率性を克服する。
  • 小さな部分問題から始めて、徐々にサンプルサイズを増やすことで、統計的精度に収束する高速な収束を実現する。
  • ネイティブに分散化された手法として、より多くの計算ノードを追加しても線形のスピードアップを達成する強力なスケーリング性能を有する。
  • 完全なヘッセ行列の計算を回避しつつも、高速な収束速度を維持できるスケーラブルな第二階層法を開発する。

提案手法

  • 各段階で以前のサンプルを含むより大きなデータサブセットを使用するマルチステージアルゴリズムを提案し、以前の解をウォームスタートとして活用する。
  • プリコンディショニング共役勾配法(PCG)を用いて、明示的なヘッセ行列の逆行列計算を避けて、不正確な減衰ニュートンステップを効率的に解く。
  • 蓄積的サンプル戦略を採用:小さなバッチから開始し、段階的により多くのサンプルを追加しながら、解の連続性を維持する。
  • 複数のノードにわたり勾配およびヘッセ・ベクトル積の計算を分散処理することで、分散計算を活用する。
  • 通信コストを最小限に抑え、各ノードの計算効率を最大化することで、強力なスケーリングを確保する。
  • 統計的精度に達した段階で早期に停止する適応的サンプルサイズ技術を統合し、フルデータセットでの無駄な計算を回避する。

実験結果

リサーチクエスチョン

  • RQ1明示的なヘッセ行列計算を伴わず、大規模なERM問題にスケーラブルかつ効率的な第二階層法を実現できるか?
  • RQ2蓄積的サンプル戦略は、統計的精度に収束させる一方で、データの走査回数を削減できるか?
  • RQ3分散型ニュートン型手法は、実際の環境で強力なスケーリング(ノード数の増加に伴い線形的スピードアップ)を達成できるか?
  • RQ4SGD や Adam といった一次法と比較して、提案手法の収束速度とハイパーパrameterへの感受性はどのように異なるか?
  • RQ5既存の第二階層法および一次法と比較して、提案手法の通信コストおよび計算複雑度はどの程度か?

主な発見

  • DANCEは、大規模問題においてAdaNewton や k-TAN よりも顕著に低い計算複雑度 Õ((log N)³ N¹ᐟ⁴ d²) を達成する。
  • 特に分散環境下では、時間単位あたりの損失低下の観点でSGD や Adam よりも速やかに収束する。
  • DANCEは強力なスケーリングを示す:ノード数を増やすことで、図4に示すようにほぼ線形のスピードアップが得られ、大規模バッチサイズでは理想性能に近づく。
  • ハイパーパrameterのチューニングに対して頑健である—SGD や Adam とは異なり、学習率やバッチサイズの慎重な調整を必要としない。
  • VGG11を用いたCifar10データセットの実験では、DANCEはPyTorchの組み込みSGDオプティマイザーよりも収束速度が速く、ハイパーパrameterチューニングなしで同等またはより高い精度を達成する。
  • NaiveCNetを用いたMnistの実験では、DANCEはAdamと同等のテスト精度を達成し、特にCPU上での総実行時間の観点で、より高速なトレーニング時間を実現する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。