[論文レビュー] Competitive Multi-agent Inverse Reinforcement Learning with Sub-optimal Demonstrations
本稿では、最適でない専門家のデモを直接的に考慮することで、専門家方策とナッシュ均衡戦略の間のパフォーマンスギャップを直接最小化する、新しい競争的マルチエージェント逆強化学習フレームワークを提案する。深層ニューラルネットワークを用いた敵対的訓練により、エージェントを分離せずに報酬関数とナッシュ均衡戦略を同時に学習し、10×10グリッドワールドの追跡ゲームを含む大規模なゼロサム確率的ゲームで優れた性能を達成する。
This paper considers the problem of inverse reinforcement learning in zero-sum stochastic games when expert demonstrations are known to be not optimal. Compared to previous works that decouple agents in the game by assuming optimality in expert strategies, we introduce a new objective function that directly pits experts against Nash Equilibrium strategies, and we design an algorithm to solve for the reward function in the context of inverse reinforcement learning with deep neural networks as model approximations. In our setting the model and algorithm do not decouple by agent. In order to find Nash Equilibrium in large-scale games, we also propose an adversarial training algorithm for zero-sum stochastic games, and show the theoretical appeal of non-existence of local optima in its objective function. In our numerical experiments, we demonstrate that our Nash Equilibrium and inverse reinforcement learning algorithms address games that are not amenable to previous approaches using tabular representations. Moreover, with sub-optimal expert demonstrations our algorithms recover both reward functions and strategies with good quality.
研究の動機と目的
- 既存のマルチエージェントIRL手法が最適な専門家のデモを仮定しているという制限に対処すること。これは複雑なゲームではしばしば現実的ではない。
- エージェントを分離しない統合フレームワークを構築し、報酬関数とナッシュ均衡戦略の共同学習を可能にすること。
- ゼロサム確率的ゲームにおいて、専門家のデモと最適(ナッシュ均衡)戦略の間のパフォーマンスギャップを最小化すること。
- グローバル収束の理論的保証を備えたナッシュ均衡計算のための敵対的訓練アルゴリズムを設計すること。
- 表形式手法では対応できない大規模なゲームにおいて、本手法の有効性を示すこと。
提案手法
- アルゴリズムは、ナッシュ均衡を敵対的訓練で計算するポリシー段階と、専門家とナッシュ戦略の間のパフォーマンスギャップを減らすために報酬関数を更新する報酬段階を交互に実行する。
- 敵対的訓練では、エージェントが最適な相手と競い合う。ポリシーの改善にはプロキシマルポリシー最適化(PPO)を用い、深層ニューラルネットワークを用いてポリシーと価値関数をモデル化する。
- 報酬関数は深層ニューラルネットワークとしてモデル化され、確率的勾配降下法により、専門家の行動と現在のナッシュポリシーからの最適行動の間のパフォーマンスギャップを最小化するように訓練される。
- 最適でない行動を許容するのを防ぐために、固定されたラグランジュ乗数λを用いたペナルティ項が追加され、λはグリッドサーチにより調整され(最適値λ=10が得られた)。
- エージェントを分離しないように、報酬とポリシーを共同最適化ループで同時に最適化することで、ゲーム理論的相互依存性を保つ。
- 理論的分析により、敵対的訓練の目的関数に局所最適解が存在せず、最適解へのグローバル収束を支持することが示された。
実験結果
リサーチクエスチョン
- RQ1専門家のデモが最適でない状況下でも、競争的マルチエージェントシステムにおいて報酬関数とナッシュ均衡戦略を効果的に回復できるか?
- RQ2マルチエージェントIRLにおいてエージェントを分離しない共同学習フレームワークをどのように設計できるか?戦略的相互依存性を保つことができるか?
- RQ3専門家とナッシュ均衡戦略の間のパフォーマンスギャップを明示的に最小化することで、学習品質にどのような影響を与えるか?
- RQ4深層強化学習を用いた敵対的訓練は、ゼロサム確率的ゲームでグローバル収束を達成できるか?
- RQ5本手法は、表形式手法では対応できない大規模なゲームにどの程度スケーラブルに適用できるか?
主な発見
- 10×10グリッドワールドの追跡ゲームにおいて、提案手法はベンチマーク手法(分離最適化を用いた)と比較して、予言者のポリシー性能を48.6%向上させた。
- 10×10グリッドにおいて、獲物の観点からも、提案手法はベンチマーク手法より5.9%のパフォーマンス向上を達成した。
- 5×5グリッドでは、提案手法はより優れた予言者ポリシー(-44.7 対 -87.4)を生成し、獲物のパフォーマンスもベンチマークと同等であった。
- 表形式IRL手法では対応できないほど大きなゲームにおいて、報酬関数とポリシーの両方を成功裏に回復した。これはスケーラビリティを示している。
- パフォーマンスギャップ最小化の目的関数により、最適でない専門家のデモでも、より高品質なポリシー回復が可能になった。
- 敵対的訓練の目的関数に局所最適解が存在しないことが実証され、安定的かつグローバルに収束する学習を支持する結果が得られた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。