Skip to main content
QUICK REVIEW

[論文レビュー] Algorithms of Data Development For Deep Learning and Feedback Design

Wei Kang, Qi Gong|arXiv (Cornell University)|Dec 1, 2019
Model Reduction and Neural Networks参考文献 31被引用数 14
ひとこと要約

本稿では、最適フィードバック制御における深層ニューラルネットワークの訓練を可能にする、因果関係に依存しないアルゴリズムを提案する。この手法により、グリッドに依存せず、並列化可能な効率的な訓練が実現される。各点で価値関数の解を独立に計算することで、適応的データ生成と実証的誤差検証が可能となり、6次元剛体制御問題において4,096件のデータポイントを用い、4ラウンドの訓練でニューラルネットワークの精度が向上した。

ABSTRACT

Recent research reveals that deep learning is an effective way of solving high dimensional Hamilton-Jacobi-Bellman equations. The resulting feedback control law in the form of a neural network is computationally efficient for real-time applications of optimal control. A critical part of this design method is to generate data for training the neural network and validating its accuracy. In this paper, we provide a survey of existing algorithms that can be used to generate data. All the algorithms surveyed in this paper are causality-free, i.e., the solution at a point is computed without using the value of the function at any other points. At the end of the paper, an illustrative example of optimal feedback design using deep learning is given.

研究の動機と目的

  • 高次元システムにおける最適制御のためのハミルトニアン・ジョルダン・ベルマン(HJB)方程式を解く際の次元の呪いに対処すること。
  • 各点で価値関数の解を隣接値に依存せずに独立に計算する因果関係に依存しないアルゴリズムの開発により、グリッド依存性を回避し、並列処理を可能とすること。
  • 価値関数の急勾配領域や複雑な領域において、標的を絞った高精度なデータ収集を可能とする、適応的データ生成を支援すること。
  • 独立したデータセットによる検証を含め、信頼性があり実証的に検証されたニューラルネットワークの訓練法を提供すること。
  • 因果関係に依存しないデータ生成を用いた、深層学習ベースのフィードバック制御の実現可能性とスケーラビリティを、高次元最適制御問題において示すこと。

提案手法

  • 隣接値に依存せず、個々の点での価値関数 $ V(t, \mathbf{x}) $ の解を計算する因果関係に依存しない数値解法を用いることで、グリッドベースの手法を回避する。
  • 初期データセットを $ N_d $ 個のランダムな初期状態 $ \mathbf{x}^{(i)} $ として生成し、TPBVPソルバーを用いて $ V^{(i)} $ とその勾配 $ \bm{\lambda}^{(i)} $ を計算する。
  • 値誤差と勾配誤差の両方を組み合わせた損失関数を用いて、深層ニューラルネットワークが $ V(t, \mathbf{x}) $ を近似するように学習させる:$ \mathcal{L} = \frac{1}{N_d}\sum (V^{(i)} - V^{NN})^2 + \frac{\mu}{N_d}\sum \|\bm{\lambda}^{(i)} - V_{\mathbf{x}}^{NN}\|^2 $。
  • 訓練済みネットワークを次のTPBVP解法のウォームスタートとして用いることで、誤差が大きい領域や複雑な領域での高速かつ適応的なデータ生成を可能にする。
  • 適応的ループを適用:各訓練ラウンドの後、近似誤差が大きい領域にデータセットを拡張し、事前に定義された基準に従ってデータ配置をガイドする。
  • 最終的なニューラルネットワークを別個に生成されたモンテカルロ法による検証データセットを用いて検証し、実証的な正確性と信頼性を確認する。

実験結果

リサーチクエスチョン

  • RQ1因果関係に依存しないアルゴリズムを用いることで、高次元最適制御問題における深層学習のための訓練データをどのように生成できるか?
  • RQ2スケーラビリティと並列処理の観点から、従来のグリッドベース手法に比べて、因果関係に依存しないデータ生成がどのような利点を提供するか?
  • RQ3ニューラルネットワークの誤差推定に基づく適応的データ生成は、学習されたフィードバック制御則の精度を向上させることができるか?
  • RQ4損失関数に値と勾配の両方の監視を組み合わせることで、価値関数のニューラルネットワーク近似の訓練にどのような向上効果が得られるか?
  • RQ5因果関係に依存しないデータ生成を用いた6次元剛体アタチュード制御問題において、深層学習ベースのフィードバック制御の実証的性能はいかがなものか?

主な発見

  • 因果関係に依存しない手法により、グリッドに依存しない並列計算が可能となり、高次元問題の取り扱いが可能になった。
  • 誤差駆動型サンプリングを用いた適応的データ生成により、4回の訓練ラウンドを通じてニューラルネットワークの精度が向上し、データサイズは64から4,096ポイントに増加した。
  • 損失関数に値と勾配の両方の監視を組み合わせることで、真の価値関数およびその微分の近似能力が著しく向上した。
  • 訓練済みのニューラルネットワークは、安定的かつ正確なフィードバック制御則を達成し、別個のモンテカルロテストセットを用いた検証で実証的な信頼性を示した。
  • ニューラルネットワークのウォームスタートを用いることで、時間積分ソルバーへの依存度を低減し、後続の訓練ラウンドにおけるデータ生成を高速化した。
  • 正確で高速かつ実証的に検証された最適制御則のニューラルネットワーク近似を可能にすることで、実用的なリアルタイムフィードバック制御を実現できるようになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。