Skip to main content
QUICK REVIEW

[論文レビュー] Using Neural Networks to Compute Approximate and Guaranteed Feasible Hamilton-Jacobi-Bellman PDE Solutions

Frank J. Jiang, Glen Chou|arXiv (Cornell University)|Nov 10, 2016
Model Reduction and Neural Networks参考文献 31被引用数 19
ひとこと要約

本稿では、最適制御におけるハミルトニアン・ジャコビ・ベルマン(HJB)偏微分方程式の値関数を、グリッドフリーなニューラルネットワークベースの手法で近似する手法を提案する。状態空間の離散化を回避しつつ、保守的で実行可能(feasible)な軌道を保証する。ニューラルネットワークを用いて、システム制約を厳密に満たす近最適な制御入力を生成するように訓練することで、計算複雑性を低減し、長時間スケールの計画を可能にするとともに、実行可能性と近最適性を保証する。この手法は、ダブルンズ・カー(Dubins car)モデルを用いた実験で、従来のレベルセット法と比較して顕著な高速化を達成した。

ABSTRACT

To sidestep the curse of dimensionality when computing solutions to Hamilton-Jacobi-Bellman partial differential equations (HJB PDE), we propose an algorithm that leverages a neural network to approximate the value function. We show that our final approximation of the value function generates near optimal controls which are guaranteed to successfully drive the system to a target state. Our framework is not dependent on state space discretization, leading to a significant reduction in computation time and space complexity in comparison with dynamic programming-based approaches. Using this grid-free approach also enables us to plan over longer time horizons with relatively little additional computation overhead. Unlike many previous neural network HJB PDE approximating formulations, our approximation is strictly conservative and hence any trajectories we generate will be strictly feasible. For demonstration, we specialize our new general framework to the Dubins car model and discuss how the framework can be applied to other models with higher-dimensional state spaces.

研究の動機と目的

  • 動的計画法を用いたHJB偏微分方程式の解法における次元の呪い(curse of dimensionality)を克服すること。
  • 状態空間の離散化を回避しつつ、実行可能で近最適な軌道を保証する手法を開発すること。
  • 動的計画法(保守的特性)と機械学習(スケーラビリティと効率性)の長所を統合すること。
  • 最小限の計算オーバーヘッドで長時間スケールの計画を可能にすること。
  • 劣化した訓練データに対してもロバストで、より高次元のシステムへスケーラブルなフレームワークを提供すること。

提案手法

  • ニューラルネットワークを、実行可能な軌道の周辺領域に限定して値関数を近似する。全状態空間をカバーするのを避ける。
  • 二段階の訓練プロセスを採用する:まず探索を用いて多様な軌道を生成し、次に保守的なフィルタリング機構でそれらを精錬する。
  • 円錐型のターゲットフィルタ(R_O)は、実行不能または近最適でない状態を除外し、ターゲット集合のε近傍内に到達する軌道のみを保持する。
  • 長さフィルタは、長すぎる軌道を除去し、劣化した訓練データに対してロバスト性を向上させるとともに、訓練データの品質を向上させる。
  • 値関数の近似は厳密に保守的であり、生成されたすべての軌道が動的実行可能であることが保証される。
  • 本手法は到達可能性解析を用いて検証され、ニューラルネットワークベースの値関数がレベルセット法で計算された真値解と比較された。

実験結果

リサーチクエスチョン

  • RQ1ニューラルネットワークベースの手法が、生成されるすべての軌道の実行可能性を保証する形でHJB値関数を近似できるか?
  • RQ2グリッドフリーでデータ駆動型の手法は、従来の動的計画法やレベルセット法と比較して、計算複雑性をどの程度低減できるか?
  • RQ3本手法は、異なる初期状態や長時間スケールの計画タスクにどの程度一般化できるか?
  • RQ4値関数近似において、厳密な保守性を保ちつつ、近最適性を維持できるか?
  • RQ5フィルタリング機構(例:長さフィルタやターゲットフィルタ)の導入により、ノイズが多いまたは劣化した訓練データに対するロバスト性はどの程度向上するか?

主な発見

  • 高スペックデスクトップ上で4日間かかっていた計算を、2012年製MacBook Proで5分未満で完了した。
  • コロイド計算において、ニューラルネットワークベースの値関数近似は179 MBのストレージで実現可能だったが、低解像度のレベルセット法では7 GBを要した。
  • ダブルンズ・カーの事例では、NNが生成した軌道は近最適であり、コスト値が真の最適コストに近く、例として状態(-12,5,2)では26.51 vs. 14.84であった。
  • 長さフィルタは、劣化した制御から生成された状態を除去することで、訓練データの品質を著しく向上させた(図5(a)対5(b)を比較)。
  • 円錐型ターゲットフィルタは、ターゲットのε近傍外の状態を効果的に除外し、最終的なすべての軌道が許容可能な到達範囲内にあることを保証した。
  • 本手法は、ターゲットから遠く離れた初期状態(例:(10,-4,-3))に対しても実行可能で近最適な軌道を生成した。この場合、NNコストは16.20、真のコストは13.36であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。