Skip to main content
QUICK REVIEW

[論文レビュー] Robust On-Line ADP-based Solution of a Class of Hierarchical Nonlinear Differential Game

Mohammad reza Satouri, Hamed Kebriaei|arXiv (Cornell University)|Jul 26, 2019
Adaptive Dynamic Programming Control被引用数 4
ひとこと要約

本稿では、モデル不確実性および摂動が存在する状況下で、1人のリーダーと複数のフォロワーを含む階層的非線形微分ゲームを解くための、新しいオンライン適応型動的プログラミング(ADP)手法を提案する。価値関数、制御方策、摂動をニューラルネットワークを用いて推定することで、ネットワーク使用量を約30%削減し、ラプラウン型解析を用いてロバストな収束性を達成した。これにより、最悪の摂動下でもゼロサムおよびノンゼロサムゲーム要素の両方を効果的に扱えることが示された。

ABSTRACT

In this paper, a hierarchical one-leader-multi-followers game for a class of continuous-time nonlinear systems with disturbance is investigated by a novel policy iteration reinforcement learning technique in which, the game model consists both of the zero-sum and nonzero-sum games, simultaneously. An adaptive dynamic programming (ADP), method is developed to achieve optimal control strategy under the worst case of disturbance. This algorithm reduces the number of neural networks which are used for estimation for about thirty percent. The proposed algorithm uses neural networks to estimate value functions, control policies and disturbances. Convergence analysis of the estimations is investigated using Lyapunov theory and exploiting properties of the Nemytskii operator. Finally, the simulation results will show effectiveness of the developed ADP method.

研究の動機と目的

  • モデル不確実性および最悪の摂動下における、1リーダー・複数フォロワーの階層的非線形微分ゲームを解く課題に対処すること。
  • 計算複雑性を低減するためにニューラルネットワーク使用量を最小限に抑える、効率的なオンラインADPベースの解法を開発すること。
  • ラプラウン安定性理論を用いて、摂動に対してロバストであり、スタッケルベルク=ナッシュ均衡に収束するようにすること。
  • 統一フレームワーク内で、価値関数、制御方策、および摂動信号の同時推定をニューラルネットワークを統合すること。
  • シミュレーションを用いて、本手法の有効性を検証し、ゼロサムおよびノンゼロサムゲーム要素を同時に処理できることを示すこと。

提案手法

  • リアルタイムで制御方策および価値関数近似を反復的に更新する、ポリシー反復に基づくADPフレームワークを採用する。
  • ニューラルネットワークを用いて価値関数、制御方策、および摂動信号を推定し、必要なネットワーク数を約30%削減する。
  • ラプラウン理論およびネミツキー作用素の性質を用いて、推定誤差およびシステム状態の均等最終有界性(UUB)を証明する。
  • ゼロサムおよびノンゼロサムゲーム要素を統合する修正されたコスト関数を導入し、同時に最適化を可能にする。
  • 勾配降下法を用いてニューラルネットワークの重みをオンラインで更新し、リアルタイムでの適応を保証する。
  • 行列不等式を用いて誤差ダイナミクスをバインドし、行列 $M$ の正定値性を保証するための調整パラメータ $F_1^i$ および $F_2^i$ を用いて、安定性の十分条件を導出する。

実験結果

リサーチクエスチョン

  • RQ1ゼロサムおよびノンゼロサムの両方の成分を有する階層的非線形微分ゲームを解くための、オンラインADP手法をどのように設計できるか?
  • RQ2モデル不確実性および摂動下でロバスト制御を達成するために、必要な最小限のニューラルネットワーク数は何か?
  • RQ3ラプラウン安定性理論を用いて、摂動が存在する状況下でのADPベース推定器の収束性をどのように証明できるか?
  • RQ4提案フレームワークにおいて、推定誤差およびシステム状態の均等最終有界性(UUB)を保証する条件は何か?
  • RQ5本手法は、動的ゲームに適用される既存のADPベースの解法と比較して、性能および複雑性においてどのように異なるか?

主な発見

  • 提案手法は、従来の手法と比較して、推定に使用するニューラルネットワーク数を約30%削減した。
  • 推定誤差およびシステム状態が均等最終有界性(UUB)であることが証明され、最悪の摂動下でも長期的な安定性が保証された。
  • ラプラウン理論およびネミツキー作用素の性質を用いて、アルゴリズムがスタッケルベルク=ナッシュ均衡に収束することを解析的に確立した。
  • 本手法は、ゼロサムおよびノンゼロサムゲーム要素を1つの統一フレームワーク内で効果的に処理でき、不確実性下でもロバスト制御を実現した。
  • シミュレーション結果から、モデル不確実性および摂動が存在する状況下でも、最適制御戦略を達成できることを確認した。
  • 調整パラメータ $F_1^i$ および $F_2^i$ が、安定領域および収束速度を支配する行列 $M$ の正定値性を保証するために極めて重要であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。