Skip to main content
QUICK REVIEW

[論文レビュー] Differential Dynamic Programming Neural Optimizer.

Guan-Horng Liu, Tianrong Chen|arXiv (Cornell University)|Feb 20, 2020
Reinforcement Learning in Robotics参考文献 33被引用数 5
ひとこと要約

本稿では、2次最適制御理論を用いて深層ニューラルネットワークの学習を軌道最適化問題に再定式化することにより、新たなニューラル最適化手法である微分動的プログラミングニューラル最適化法(DDP-NO)を提案する。バッチ処理と層別フィードバック方策による曲率近似を統合することで、高速な収束性とハイパーパramータへの感受性の低減を達成し、最先端の1次および2次手法を上回る性能を示す。

ABSTRACT

Interpretation of Deep Neural Networks (DNNs) training as an optimal control problem with nonlinear dynamical systems has received considerable attention recently, yet the algorithmic development remains relatively limited. In this work, we make an attempt along this line by reformulating the training procedure from the trajectory optimization perspective. We first show that most widely-used algorithms for training DNNs can be linked to the Differential Dynamic Programming (DDP), a celebrated second-order trajectory optimization algorithm rooted in the Approximate Dynamic Programming. In this vein, we propose a new variant of DDP that can accept batch optimization for training feedforward networks, while integrating naturally with the recent progress in curvature approximation. The resulting algorithm features layer-wise feedback policies which improve convergence rate and reduce sensitivity to hyper-parameter over existing methods. We show that the algorithm is competitive against state-ofthe-art first and second order methods. Our work opens up new avenues for principled algorithmic design built upon the optimal control theory.

研究の動機と目的

  • 深層学習最適化と最適制御理論を統合し、DNN学習を軌道最適化問題として解釈すること。
  • 前向き伝搬ネットワークのバッチ学習をサポートできるように、微分動的プログラミング(DDP)アルゴリズムを拡張すること。
  • 層別フィードバック方策を用いて収束速度を向上させるとともに、ハイパーパramータへの感受性を低減すること。
  • ヘッセ行列の近似に関する最近の進展を統合し、より優れた2次最適化を実現すること。
  • 最先端の手法と競合可能な、原理的かつ理論的裏付けのある最適化手法を開発すること。

提案手法

  • 最適制御理論を用いて、DNN学習を非線形力学系最適化問題に再定式化する。
  • ミニバッチ更新に対応できるように、微分動的プログラミング(DDP)アルゴリズムを前向き伝搬ネットワークに適応させる。
  • 損失関数の2次近似に基づく層別フィードバック方策を導入する。
  • 勾配逆伝搬中にヘッセ行列の情報を効率的に推定するための曲率近似技術を採用する。
  • 逐次二次計画法(SQP)の原則を用いて、最適化軌道を繰り返し改善する。
  • バックプロパゲーションによるエンドツーエンド学習を維持しつつ、2次収束性を保つ。

実験結果

リサーチクエスチョン

  • RQ1深層学習の学習は、最適制御フレームワーク内において、軌道最適化問題として効果的に定式化可能か?
  • RQ22次DDPアルゴリズムは、前向き伝搬ネットワークにおけるミニバッチ学習を効果的にサポートできるか?
  • RQ3層別フィードバック方策は、標準的な最適化手法と比較して、収束性とロバスト性をどのように向上させるか?
  • RQ4曲率近似は、深層ネットワークにおけるDDPベースの最適化の性能をどのように向上させるか?
  • RQ5DDPベースの最適化手法は、最先端の1次および2次最適化手法と同等またはそれ以上の性能を達成できるか?

主な発見

  • 提案されたDDP-NO最適化手法は、SGD や Adam といった標準的な1次最適化手法と比較して、より高速な収束速度を達成する。
  • フィードバック方策による内蔵的適応的ステップサイズのおかげで、ハイパーパramータ、特に学習率への感受性が著しく低減されている。
  • 曲率近似の統合により、計算コストが著しく増大することなく2次最適化の利点を実現できる。
  • 層別フィードバック方策は、さまざまなネットワークアーキテクチャにおいて、最適化の安定性と収束速度を顕著に向上させる。
  • 実騴結果では、標準ベンチマークデータセットにおいて、最先端の1次および2次最適化手法と同等の性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。