Skip to main content
QUICK REVIEW

[論文レビュー] Second Order Optimization Made Practical.

Rohan Anil, Vineet Gupta|arXiv (Cornell University)|Feb 20, 2020
Stochastic Gradient Optimization Techniques参考文献 7被引用数 20
ひとこと要約

本稿では、フル行列Adagradの変種に基づく実用的で分散型の2次最適化手法を提示する。アルゴリズム的および数値的改善を施し、計算コストとメモリコストを低減した。この手法は、CPU-GPUアーキテクチャを効率的に活用することで、特にニューラル機械翻訳において、一階最適化手法よりも収束が速く、ウォールタイム性能に優れる。

ABSTRACT

Optimization in machine learning, both theoretical and applied, is presently dominated by first-order gradient methods such as stochastic gradient descent. Second-order optimization methods that involve second-order derivatives and/or second-order statistics of the data have become far less prevalent despite strong theoretical properties, due to their prohibitive computation, memory and communication costs. In an attempt to bridge this gap between theoretical and practical optimization, we present a proof-of-concept distributed system implementation of a second-order preconditioned method (specifically, a variant of full-matrix Adagrad), that along with a few yet critical algorithmic and numerical improvements, provides significant practical gains in convergence on state-of-the-art deep models and gives rise to actual wall-time improvements in practice compared to conventional first-order methods. Our design effectively utilizes the prevalent heterogeneous hardware architecture for training deep models which consists of a multicore CPU coupled with multiple accelerator units. We demonstrate superior performance on very large learning problems in machine translation where our distributed implementation runs considerably faster than existing gradient-based methods.

研究の動機と目的

  • 2次最適化の強力な理論的性質と、その高コストな計算・メモリ要件による実用的利用の限界の間のギャップを埋めること。
  • 現代の異種ハードウェア(CPU + 複数のアクセcelレータ)に適した、スケーラブルで分散型の2次予めんづけ法の実装を設計すること。
  • 2次最適化が、確率的勾配降下法などの一階最適化手法と比較して、より速い学習収束とウォールタイム性能を達成できることを示すこと。
  • 特にニューラル機械翻訳を含む大規模ディープラーニングワークロードにおいて、このアプローチを検証すること。

提案手法

  • 本手法は、勾配を予めんづけるためにフル・ヘッシアン近似を維持・更新するフル行列Adagradの変種を採用する。
  • 2次最適化手法の計算およびメモリオーバーヘッドを低減するための重要なアルゴリズム的および数値的改善を組み込む。
  • 複数のアクセcelレータを介した分散学習を想定し、計算をGPUに効率的にオフロードするとともに、通信コストを管理する。
  • マルチコアCPUと複数のアクセcelレータユニットを組み合わせた異種ハードウェアスタックを、計算負荷のバランスとデータ移動を最適化するようにアルゴリズムとシステムを共同設計することで活用する。
  • 損失関数の履歴的2次統計に基づいて勾配を適応的にスケーリングするための予めんづけを実装する。

実験結果

リサーチクエスチョン

  • RQ12次最適化は、高い計算・メモリコストにもかかわらず、大規模ディープラーニングモデルに実用的に行えるか?
  • RQ2分散型2次最適化手法は、一階最適化手法と比較して収束速度とウォールクロック時間においてどのように異なるか?
  • RQ3CPU + 複数のアクセcelレータというハードウェアの異種性をどれだけ活用して、2次最適化のスケーラビリティを実現できるか?
  • RQ42次最適化手法を実用的に行うために、どのようなアルゴリズム的および数値的改善が必要か?

主な発見

  • 提案された分散型2次最適化手法は、最先端のディープラーニングモデルにおいて、一階最適化手法よりも著しく速い収束を達成した。
  • 2次最適化手法の複雑さにもかかわらず、本実装は大規模学習において、従来の一階最適化手法よりも実際のウォールタイム性能を向上させた。
  • システムは異種ハードウェアを効果的に活用し、CPUと複数のアクセcelレータ間で計算をバランスさせることで、学習時間を短縮した。
  • 本手法は、収束性と実行時間の両面で、既存の勾配ベースの手法を上回る性能を示し、大規模なニューラル機械翻訳タスクにおいて優れた性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。