Skip to main content
QUICK REVIEW

[論文レビュー] Deep adaptive dynamic programming for nonaffine nonlinear optimal control problem with state constraints

Jingliang Duan, Zhengyu Liu|arXiv (Cornell University)|Nov 26, 2019
Adaptive Dynamic Programming Control参考文献 35被引用数 12
ひとこと要約

本稿では、状態制約付きの非アフィン非線形最適制御問題を解くために、深層ニューラルネットワークを用いた制約付き深層適応的動的プログラミング(CDADP)アルゴリズムを提案する。方策改善を制約付き最適化問題に変換し、信頼領域と双対最適化を活用することで、基底関数を必要としない直接的で安定した高速収束の学習を可能にし、自律走行車両の経路追従制御において効果的に実証された。

ABSTRACT

This paper presents a constrained deep adaptive dynamic programming (CDADP) algorithm to solve general nonlinear optimal control problems with known dynamics. Unlike previous ADP algorithms, it can directly deal with problems with state constraints. Both the policy and value function are approximated by deep neural networks (NNs), which directly map the system state to action and value function respectively without needing to use hand-crafted basis function. The proposed algorithm considers the state constraints by transforming the policy improvement process to a constrained optimization problem. Meanwhile, a trust region constraint is added to prevent excessive policy update. We first linearize this constrained optimization problem locally into a quadratically-constrained quadratic programming problem, and then obtain the optimal update of policy network parameters by solving its dual problem. We also propose a series of recovery rules to update the policy in case the primal problem is infeasible. In addition, parallel learners are employed to explore different state spaces and then stabilize and accelerate the learning speed. The vehicle control problem in path-tracking task is used to demonstrate the effectiveness of this proposed method.

研究の動機と目的

  • 既存の適応的動的プログラミング(ADP)手法が直接処理できない、一般の非線形最適制御問題に状態制約を適用する課題に対処すること。
  • 方策および価値関数の近似において、手作業で設計された基底関数の必要性を排除するため、深層ニューラルネットワークを用いること。
  • 信頼領域正則化を用いた制約付き最適化定式化により、方策学習中に制約の満たしを保証すること。
  • 並列学習者を用いて状態空間の異なる領域を探索することで、学習の安定性と速度を向上させること。
  • 自律走行車両の経路追従制御という実世界の問題に、この手法を実証すること。

提案手法

  • 方策および価値関数は、システムの状態を直接行動および価値へ写像する深層ニューラルネットワークを用いて近似し、基底関数の必要性を回避する。
  • 状態制約は、状態変数に不等式制約を課した制約付き最適化問題に方策改善ステップを再定式化することで実装する。
  • 制約付き問題の局所線形化により、二次制約付き二次計画問題(QCQP)問題に変換する。
  • QCQP問題の双対を解くことで最適方策更新が導かれる。これにより、効率的かつ安定したパラメータ更新が可能になる。
  • プライマル最適化問題が不実行となった場合に対応するための回復ルールを導入し、訓練の継続性を確保する。
  • 並列学習者を用いて状態空間の多様な領域を探索することで、探索の多様性を高め、収束を加速する。

実験結果

リサーチクエスチョン

  • RQ1非アフィン非線形最適制御問題に状態制約が存在する状況において、深層ニューラルネットワークは方策および価値関数を効果的に近似できるか?
  • RQ2基底関数に依存せずに、適応的動的プログラミングの方策改善プロセスに状態制約を統合する方法は何か?
  • RQ3信頼領域制約および双対最適化は、方策更新の安定性と収束性にどのような影響を与えるか?
  • RQ4並列学習者は、制約付き非線形制御設定において、より速く安定した学習をどのように促進するか?
  • RQ5提案されたCDADPフレームワークは、車両の経路追従といった実世界の制御タスクにおいて、信頼性のある性能を達成できるか?

主な発見

  • CDADPアルゴリズムは、手作業で設計された基底関数を必要とせず、非アフィン非線形最適制御問題における状態制約を効果的に処理できた。
  • 信頼領域制約と双対最適化の活用により、複雑な制約下でも安定的かつ実行可能な方策更新が保証された。
  • 回復ルールは、プライマル最適化問題における不実行性を効果的に管理し、訓練の継続性を維持した。
  • 並列学習者は、状態空間の多様な探索を可能にすることで、学習速度と安定性を顕著に向上させた。
  • 本手法は、経路追従制御タスクにおいて優れた性能を示し、実世界の車両制御応用における有効性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。