Skip to main content
QUICK REVIEW

[論文レビュー] Inverse Dynamic Games Based on Maximum Entropy Inverse Reinforcement Learning

Jairo Inga, Esther Bischoff|arXiv (Cornell University)|Nov 18, 2019
Advanced Control Systems Optimization参考文献 38被引用数 8
ひとこと要約

この論文は、連続的状態空間および制御空間を持つN人プレーヤーの動的ゲームに、最大エントロピー逆強化学習を拡張し、パレート効率的解およびオープンループ・フィードバックナッシュ均衡の両方のためのコスト関数パラメータを特定する手法を提案する。主な貢献は、不偏なパラメータ推定の理論的証明であり、ノイズのある条件下でも非線形および線形二次のシミュレーションで高いロバストネスを示している。

ABSTRACT

We consider the inverse problem of dynamic games, where cost function parameters are sought which explain observed behavior of interacting players. Maximum entropy inverse reinforcement learning is extended to the N-player case in order to solve inverse dynamic games with continuous-valued state and control spaces. We present methods for identification of cost function parameters from observed data which correspond to (i) a Pareto efficient solution, (ii) an open-loop Nash equilibrium or (iii) a feedback Nash equilibrium. Furthermore, we give results on the unbiasedness of the estimation of cost function parameters for each arising class of inverse dynamic game. The applicability of the methods is demonstrated with simulation examples of a nonlinear and a linear-quadratic dynamic game.

研究の動機と目的

  • 動的ゲームにおける逆問題に取り組み、観測されたプレーヤー行動からコスト関数パラメータを同定すること。
  • 最大エントロピー逆強化学習を、マルチエージェント設定における連続的状態および制御空間に拡張すること。
  • 3つの解概念(パレート効率性、オープンループナッシュ、フィードバックナッシュ均衡)の識別可能な手法を開発すること。
  • 各逆動的ゲーム定式化におけるコスト関数パラメータの不偏推定を保証する理論的条件を確立すること。
  • ノイズのある測定条件下での非線形および線形二次動的ゲームのシミュレーションを通じて、手法の妥当性を検証すること。

提案手法

  • 連続的状態および制御空間を持つN人プレーヤーの動的ゲームに最大エントロピーの原則を適用し、確率的軌道分布を導出する。
  • 個々のプレーヤーの目的を線形パラメータ構造を持つ特徴ベースのコスト関数でモデル化する。
  • 均衡条件から導かれる制約のもとで、観測された軌道のエントロピーを最大化することで、最尤推定を用いて逆問題を解く。
  • 線形二次ゲームにおけるフィードバックナッシュ均衡軌道を求めるために、結合されたリカッチ方程式を用いる。
  • 非凸最適化問題のパラメータ同定に、BFGS最適化手法を用いる。
  • 各解概念(パレート、オープンループ、フィードバックナッシュ)におけるコスト関数パラメータの不偏推定のための理論的条件を導出する。

実験結果

リサーチクエスチョン

  • RQ1最大エントロピー逆強化学習は、連続的状態および制御空間を持つN人プレーヤーの動的ゲームに効果的に拡張可能か?
  • RQ2協力的動的ゲームにおいて、逆強化学習を用いてパレート効率的解のためのコスト関数パラメータを同定する方法は何か?
  • RQ3非協力的動的ゲームにおいて、オープンループおよびフィードバックナッシュ均衡仮定の下で、提案手法のパラメータ同定の性能とロバストネスはいかがなものか?
  • RQ4各解概念における推定コスト関数パラメータが不偏となる条件は何か?
  • RQ5測定ノイズは、逆動的ゲームにおけるパラメータ同定の精度にどのように影響するか?

主な発見

  • 本手法は、パレート効率性、オープンループナッシュ、フィードバックナッシュ均衡の3つの解概念すべてにおいて、観測された軌道を再現するコスト関数パラメータを成功裏に同定した。
  • 非線形パンドラム例では、理想的な条件下で、状態の正規化最大絶対誤差(NMAE)が0.010、制御のNMAEが0.016と、真値に非常に近い近似が得られた。
  • 線形二次例では、無限大のSNR条件下でもNMAEが状態で0.013、制御で0.032と低く保たれ、SNRが20 dB未満で性能が低下した。
  • フィードバックナッシュ逆ゲーム手法はノイズにやや敏感であり、15 dB SNRで制御のNMAEが0.998に上昇したが、SNRが向上するにつれて著しく改善した。
  • 理論的分析により、提案フレームワーク下で、3つの解概念すべてにおいてコスト関数パラメータの推定が不偏であることが確認された。
  • 協力的ゲーム(CG)ではノイズに強く、15 dB SNRでもNMAEが0.015未満を維持したが、非協力的手法はSNRが低下するにつれてより著しく劣化した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。