Skip to main content
QUICK REVIEW

[論文レビュー] Theory of Mind as Intrinsic Motivation for Multi-Agent Reinforcement Learning

Ini Oguntola, Joseph Campbell|arXiv (Cornell University)|Jul 3, 2023
Opinion Dynamics and Social Influence被引用数 7
ひとこと要約

本稿では、2次理論的思考(他エージェントの信念を予測すること)を、マルチエージェント強化学習における内発的報酬信号として用いる手法を提案する。情報理論的残差法を用いて意味的に意味のある信念を根拠づけることで、協調的・競合的混合環境における協調性とだましの性能が向上し、実験的結果では1次信念のみを用いるベースラインや信念を一切用いないベースラインと比較して顕著な性能向上が得られた。

ABSTRACT

The ability to model the mental states of others is crucial to human social intelligence, and can offer similar benefits to artificial agents with respect to the social dynamics induced in multi-agent settings. We present a method of grounding semantically meaningful, human-interpretable beliefs within policies modeled by deep networks. We then consider the task of 2nd-order belief prediction. We propose that ability of each agent to predict the beliefs of the other agents can be used as an intrinsic reward signal for multi-agent reinforcement learning. Finally, we present preliminary empirical results in a mixed cooperative-competitive environment.

研究の動機と目的

  • 深層強化学習方策内に意味的に意味のある、人間が解釈可能な信念を根拠づける手法を開発すること。
  • 他のエージェントの心的状態(理論的思考)を予測することが、マルチエージェント強化学習における内発的報酬信号として機能するかどうかを調査すること。
  • 2次信念予測に起因する内発的動機付けを用いて、協調的・競合的混合設定におけるマルチエージェントのパフォーマンスを向上させること。
  • このアプローチの有効性を、だましや協調的回避といった複雑な社会的戦略の実現に寄与するかどうかを評価すること。

提案手法

  • 概念ボトルネック学習の情報理論的残差変種を用い、入力観測と信念表現の相互情報量を最小化することで意味的根拠づけを強制する。
  • 各エージェントは、環境に関する1次信念(例:ターゲットの位置、報酬係数)と、他のエージェントの1次信念に関する2次信念を維持する。
  • 内発的報酬は、他のエージェントの信念の予測精度として計算され、エージェントが他者の心的状態をモデル化するよう促進する。
  • 集中学習と分散実行(CTDE)を特徴とするマルチエージェントプロキシマルポリシー最適化(MAPPO)を訓練に用いる。
  • 100kステップごとに、良いエージェントと悪意のあるエージェントの最適化を交互に実施し、他方の重みは固定する。
  • 信念予測タスクを残差接続によりポリシー・ネットワークに統合し、分離可能で解釈可能な表現を強制する。
Figure 1: Policy models with 1st and 2nd-order belief prediction. The belief predictor is supervised by ground truth labels, and the residual network is regularized via mutual information minimization with respect to beliefs.
Figure 1: Policy models with 1st and 2nd-order belief prediction. The belief predictor is supervised by ground truth labels, and the residual network is regularized via mutual information minimization with respect to beliefs.

実験結果

リサーチクエスチョン

  • RQ1他エージェントが何を信じているかをモデル化する2次信念予測は、マルチエージェント強化学習における効果的な内発的報酬信号として機能するか?
  • RQ2意味的に意味のある概念に信念を根拠づけることで、マルチエージェント方策の解釈可能性とパフォーマンスが向上するか?
  • RQ3状態の新規性や行動の影響に基づく内発的報酬と比較して、理論的思考に基づく内発的動機付けは、協調的・競合的混合環境でどのように機能するか?
  • RQ4このアプローチにより、だましや協調的回避といった複雑な社会的戦略が出現するか?

主な発見

  • 2次信念内発的報酬を用いて訓練された良いエージェントは、ベースラインと比較して顕著に優れた性能を示し、物理的だましタスクにおいてより高い平均エピソード報酬を達成した。
  • 悪意のあるエージェントも、2次信念内発的報酬を用いて訓練した場合、意思決定が明確になり、ターゲットへの到達が速くなった。
  • 定性的分析の結果、2次内発的報酬を持つエージェントは、ランドマークの切り替えや協調的回避といった、ベースラインや1次信念設定では見られなかったより複雑で適応的な戦略を示した。
  • 2次信念内発的報酬は、意図的な誤魔化しや協調的移動といったより戦略的な行動を促進したが、これは理論的思考の監視がないモデルでは観察されなかった。
  • この手法は、明示的なタスク設計なしに、信念予測に基づく内発的動機付けが社会知能的行動の出現を促進できることを示した。
Figure 2: ParticleWorld physical deception environment.
Figure 2: ParticleWorld physical deception environment.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。