Skip to main content
QUICK REVIEW

[論文レビュー] Modelling Bounded Rationality in Multi-Agent Interactions by Generalized Recursive Reasoning

Ying Wen, Yaodong Yang|arXiv (Cornell University)|Jan 26, 2019
Reinforcement Learning in Robotics参考文献 40被引用数 5
ひとこと要約

本稿では、階層的かつ柔軟な推論レベルを備えたマルチエージェント強化学習における限界的合理性をモデル化するための新規フレームワークであるGeneralized Recursive Reasoning (GR2)を提案する。GR2は確率的グラフィカルモデルとソフトアクタクリティクスアルゴリズムを用い、定常点への収束を達成し、正規形ゲーム、協調的ナビゲーション、Keynes Beauty Contestにおいて、多様な相手タイプに効果的に対応することで、最先端のベースラインを上回る性能を発揮する。

ABSTRACT

Though limited in real-world decision making, most multi-agent reinforcement learning (MARL) models assume perfectly rational agents -- a property hardly met due to individual's cognitive limitation and/or the tractability of the decision problem. In this paper, we introduce generalized recursive reasoning (GR2) as a novel framework to model agents with different \emph{hierarchical} levels of rationality; our framework enables agents to exhibit varying levels of "thinking" ability thereby allowing higher-level agents to best respond to various less sophisticated learners. We contribute both theoretically and empirically. On the theory side, we devise the hierarchical framework of GR2 through probabilistic graphical models and prove the existence of a perfect Bayesian equilibrium. Within the GR2, we propose a practical actor-critic solver, and demonstrate its convergent property to a stationary point in two-player games through Lyapunov analysis. On the empirical side, we validate our findings on a variety of MARL benchmarks. Precisely, we first illustrate the hierarchical thinking process on the Keynes Beauty Contest, and then demonstrate significant improvements compared to state-of-the-art opponent modeling baselines on the normal-form games and the cooperative navigation benchmark.

研究の動機と目的

  • 認知的・計算的制約により現実世界ではほとんど成立しない完全合理的な仮定を採用する既存のマルチエージェント強化学習モデルの限界を是正すること。
  • 行動ゲーム理論における認知的階層理論と限界的合理性を想起させ、異なる合理性水準のエージェントをモデル化すること。
  • マルチエージェントシステムにおける完全ベイジアンナッシュ均衡の存在と収束する学習ダイナミクスを保証する理論的根拠を有するフレームワークの構築。
  • 異なる推論レベルの相手に最適に反応できる実用的なアクタクリティクスアルゴリズムの設計。
  • 正規形ゲームや協調的ナビゲーションタスクを含む多様なマルチエージェント強化学習ベンチマークにおいて、フレームワークの実証的妥当性の検証。

提案手法

  • GR2はエージェントにL0からLkまでの推論レベルを割り当て、L0は非戦略的であり、高水準のエージェントは低水準の相手を再帰的にモデル化する階層的推論構造を構築する。
  • フレームワークは、相手タイプと推論レベルに関する信念分布を表現するために確率的グラフィカルモデルを用いる。
  • GR2内では、方策の表現力の向上と共同Q関数の学習をガイドするために補助損失を組み込んだソフトアクタクリティクスアルゴリズムが導出される。
  • 理論的分析により、GR2下で完全ベイジアンナッシュ均衡が存在することを証明し、リャプノフ解析を用いて2人用正規形ゲームにおける方策勾配法の定常点への収束を確立する。
  • 「私はあなたが私のことを信じていると考える」といったネストされた推論(例:「私はあなたが私のことを信じていると考える」)を、異なる推論レベルにおける相手の心理状態に関する信念をモデル化することで実現する。
  • フレームワークは自己対戦および多様なベースライン(DDPG-ToM, PR2, 独立学習者など)に対するゼロショット評価に応用される。

実験結果

リサーチクエスチョン

  • RQ1完全合理的な仮定に代えて、限界的合理性をより効果的にモデル化できる階層的推論フレームワークは、マルチエージェントシステムにおいて有効であるか?
  • RQ2多様な推論レベルを持つマルチエージェント相互作用において、GR2フレームワークは完全ベイジアンナッシュ均衡の存在を支持するか?
  • RQ3リャプノフ安定性解析を用いて、2人用正規形ゲームにおけるGR2アクタクリティクスアルゴリズムは定常点に収束するか?
  • RQ4複数の均衡と協調の課題を有するゲームにおいて、GR2は最先端の相手モデル化ベースラインを上回る性能を示すか?
  • RQ5協調的ナビゲーションのような複雑で高次元な環境において、GR2エージェントは予期しない相手(異なる合理性水準)に一般化可能か?

主な発見

  • 正規形ゲームにおけるラウンドロビン評価において、GR2-Mエージェントはすべてのベースラインを上回り、正しい均衡に的確に収束することを示し、多様な相手タイプに対して高い頑健性を示す。
  • Keynes Beauty Contestにおいて、GR2エージェントは人間の限界的合理性と整合する階層的思考プロセスを示し、高水準エージェントはナッシュ均衡の0ではなく、実験的平均(13–25)に近い値に収束する。
  • 回転ゲーム(RG)では、L0方策は収束しないループダイナミクスに陥るが、GR2-L方策は一意の均衡点(0.5, 0.5)に収束し、高水準方策はより速やかに収束する。
  • ハスキーント(SH)では、GR2モデルに加えPR2とDDPG-ToMもパレート最適な均衡(S,S)に到達し、最大報酬4を達成するが、他のモデルは非効率な均衡(P,P)から脱出できない。
  • 協調的ナビゲーションでは、GR2エージェントは自己対戦およびゼロショット評価で優れた性能を発揮し、異なる目的(例:異なるランドマークを標的にする)を持つ相手に適応することで、衝突をより効果的に回避する。
  • アブレーションスタディにより、GR2目的関数における補助損失が方策の表現力を向上させ、特に決定的ロールアウトを用いる場合に、より良い方策最適化を導くことが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。