[論文レビュー] Modeling Theory of Mind in Multi-Agent Games Using Adaptive Feedback Control
本稿は、階層的制御層を介した上位からの予測と下位からの誤差信号を統合する、適応的フィードバック制御を用いた制御理論的枠組みを提案し、マルチエージェントシステムにおける心の理論(ToM)をモデル化する。ゲーム理論的タスクにおいて、他者の方策をモデル化するか、合理的に行動するエージェントは、純粋な強化学習エージェントよりも優れた性能を示し、収束が速く、特に協調的・競争的ゲーム(スタッグ・フット、エクス・バトルなど)で顕著である。
A major challenge in cognitive science and AI has been to understand how autonomous agents might acquire and predict behavioral and mental states of other agents in the course of complex social interactions. How does such an agent model the goals, beliefs, and actions of other agents it interacts with? What are the computational principles to model a Theory of Mind (ToM)? Deep learning approaches to address these questions fall short of a better understanding of the problem. In part, this is due to the black-box nature of deep networks, wherein computational mechanisms of ToM are not readily revealed. Here, we consider alternative hypotheses seeking to model how the brain might realize a ToM. In particular, we propose embodied and situated agent models based on distributed adaptive control theory to predict actions of other agents in five different game theoretic tasks (Harmony Game, Hawk-Dove, Stag-Hunt, Prisoner's Dilemma and Battle of the Exes). Our multi-layer control models implement top-down predictions from adaptive to reactive layers of control and bottom-up error feedback from reactive to adaptive layers. We test cooperative and competitive strategies among seven different agent models (cooperative, greedy, tit-for-tat, reinforcement-based, rational, predictive and other's-model agents). We show that, compared to pure reinforcement-based strategies, probabilistic learning agents modeled on rational, predictive and other's-model phenotypes perform better in game-theoretic metrics across tasks. Our autonomous multi-agent models capture systems-level processes underlying a ToM and highlight architectural principles of ToM from a control-theoretic perspective.
研究の動機と目的
- 自律エージェントにおける心の理論(ToM)の背後にあるアーキテクチャ的および計算的原則を理解すること。
- 生物学的に妥当で、身体的かつ状況的(エージェントが環境に埋め込まれた状態で)な認知アーキテクチャを構築し、マルチエージェント間の社会的推論を支援すること。
- 予測と適応的フィードバックを組み合わせた制御ベースのモデルが、社会的意思決定タスクにおいて標準的な強化学習を上回るかを検証すること。
- 5つの代表的なゲーム理論的シナリオにおいて、シミュレーテッド環境および実物のロボット的環境(エピック・ロボット)の両方でモデルを検証すること。
- 協調的・合理的・他者モデル型などの異なる行動プロファイルが、共有される社会的ダイナミクス下でどのように出現し、性能を発揮するかを探索すること。
提案手法
- 反応的(下位からの)制御層と適応的(上位からの)制御層をフィードバックループで接続した多層制御アーキテクチャを設計する。
- 上位層からの予測を反応的行動の指針として用い、下位層からの誤差信号で適応的方策を更新する。
- 長期報酬を最大化するために、反応層からの予測誤差を情報源として用いた強化学習を適応層に実装する。
- ハーモニー・ゲーム、スタッグ・フット、ハクドリ・ドービー、ジレンマの囚人、エクス・バトルのゲーム理論的ベンチマークを用いてエージェントのパフォーマンスを評価する。
- 部分的観測とリアルタイムのセンサフィードバックを備えたePuckロボットを用いたシミュレーテッド環境および実物のロボットプラットフォームでモデルを検証する。
- 協力的・欲張り的・タット・フォー・タット・強化学習ベース・合理的・予測的・他者モデル型エージェントの7種類のエージェントを比較する。
実験結果
リサーチクエスチョン
- RQ1生物学的に妥当な制御メカニズムを用いて、人工エージェントにおける心の理論(ToM)をどのように実装できるか。
- RQ2適応的フィードバック制御アーキテクチャは、純粋な強化学習に比べ、社会的ゲームで収束を速くし、より良いパフォーマンスを達成できるか。
- RQ3他者の方策を予測またはモデル化するエージェントは、自己最適化に依存するエージェントよりも高いパフォーマンスを発揮するか。
- RQ4身体的かつ状況的条件下では、マルチエージェントシステムにおけるToM的行動がどのように出現するか。
- RQ5予測的および他者モデル型エージェントは、人間の社会的意思決定タスクにおける行動パターンをどの程度再現できるか。
主な発見
- すべての5つのゲーム理論的タスクにおいて、予測的または他者モデル型エージェントが、純粋な強化学習エージェントに比べ、報酬と収束速度の両面で優れた性能を示した。
- 相手の行動を観測した上で最適な行動を取ると仮定する合理的エージェントは、大多数のゲームで最高のパフォーマンスを達成し、戦略的先見性の価値を示した。
- 予測的および他者モデル型エージェントは、すべてのゲームタイプにおいて相手の行動や方策を的確に予測し、機能的ToM能力を示した。
- リアルタイムのフィードバックを伴う身体的ロボット環境では、ボールィスティック(非対話的)シミュレーションで見られた収束問題が克服され、状況的相互作用の利点が顕在化した。
- エクス・バトルゲームにおける人間の驚異度プロファイルは、予測的および他者モデル型エージェントとよく一致したが、合理的または純粋な強化学習エージェントとは一致しなかった。これは、認知的妥当性を示唆している。
- 複雑な協調的・競争的ゲームでは、他者をモデル化しない純粋な強化学習エージェントは最適な均衡に収束しなかった。これは、社会的推論において他者をモデル化しないと限界があることを示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。