Skip to main content
QUICK REVIEW

[論文レビュー] Emergence of Theory of Mind Collaboration in Multiagent Systems

Luyao Yuan, Zipeng Fu|arXiv (Cornell University)|Sep 30, 2021
Reinforcement Learning in Robotics参考文献 41被引用数 9
ひとこと要約

本論文は、完全な再帰的ネストを伴わずに、他者の心の状態に関する1階の信念(信念の信念)をモデル化するのみで、相互に協調的に心の理論(ToM)を学習できる適応的トレーニングアルゴリズムを提案する。集中型トレーニングと信念の監視、分散型実行を組み合わせることで、2つの不完全情報ゲームにおいて優れた性能を達成し、従来のすべての分散型アルゴリズムを上回り、柔軟なエージェントグループ割り当てにおいても強固で普遍的なプロトコルを実現する。

ABSTRACT

Currently, in the study of multiagent systems, the intentions of agents are usually ignored. Nonetheless, as pointed out by Theory of Mind (ToM), people regularly reason about other's mental states, including beliefs, goals, and intentions, to obtain performance advantage in competition, cooperation or coalition. However, due to its intrinsic recursion and intractable modeling of distribution over belief, integrating ToM in multiagent planning and decision making is still a challenge. In this paper, we incorporate ToM in multiagent partially observable Markov decision process (POMDP) and propose an adaptive training algorithm to develop effective collaboration between agents with ToM. We evaluate our algorithms with two games, where our algorithm surpasses all previous decentralized execution algorithms without modeling ToM.

研究の動機と目的

  • 直接的な通信ができない状況下で、エージェントが他者の心の状態を推論する必要がある部分的に観測可能なマルチエージェントシステムにおける効果的な協調を可能にするための課題に対処すること。
  • マルチエージェント計画や意思決定における高階の再帰的信念(例:信念の信念の信念)のモデル化の非実行可能性を克服すること。
  • 集中型トレーニングと信念の監視を活用する分散型実行アルゴリズムを開発し、効果的でスケーラブルなToMに基づく協調戦略を学習すること。
  • エージェントが新しいグループに再割り当てされても性能を維持できる、普遍的かつグループに依存しない通信プロトコルの創出を可能にすること。

提案手法

  • エージェントが自らの状態に関する信念と、他者の非公開状態に関する1階の信念を維持するマルチエージェント部分的に観測可能なマルコフ決定過程(POMDP)フレームワークを導入する。
  • 反事後的推論を用いて、相手が自らの非公開状態について持つ信念を推定し、再帰の第1段階における信念の信念モデリングを可能にする。
  • エージェントが信念推定値を共有することで、各エージェントの信念推定関数を学習するための監視情報を得る集中型トレーニングフェーズを採用する。
  • 1つのエージェントをトレーニング中に固定することで、環境の非定常性を回避し、安定した学習を実現する動的で適応的なトレーニングスケジュールを適用する。
  • 予測された信念ベクトルと真値信念ベクトル(監視のための離散化)のL2ノルム損失を用いて、信念推定関数を最適化する。
  • 無効または誤解を招く通信を防ぐためのメッセージ空間制約を導入し、メッセージごとにコストを課して、長く無意味なやり取りを抑制する。

実験結果

リサーチクエスチョン

  • RQ1完全な再帰的信念モデリングなしに、分散型マルチエージェントシステムで1階の心の理論(他者の信念の信念をモデル化)を効果的に学習できるか?
  • RQ2適応的信念推定を用いてToMを統合することで、非ToMベースラインと比較して、部分的に観測可能な環境における協調的パフォーマンスが向上するか?
  • RQ3ToMに基づくエージェントは、異なるグループ間で相手が入れ替わっても有効な、普遍的でタスクレベルの通信プロトコルを発展させられるか?
  • RQ4共有モジュール(例:共有Q関数やメタエージェント)を備えた集中型トレーニングアプローチと比較して、提案手法はパフォーマンスと一般化性能において優れているか?

主な発見

  • 提案されたToMベースのアルゴリズムは、2つの不完全情報ゲームにおいて、従来のすべての分散型実行アルゴリズムを上回り、最先端の集中型モデルに非常に近いパフォーマンスを達成した。
  • アポイントメントスケジューリングゲームでは、25%のランダムベースラインと50%の自己ベース提案ベースラインを著しく上回る成功率を達成し、定量的結果は表2および図2(b)に示されている。
  • 柔軟なグループ割り当て実験において、性能低下が最小限に抑えられ、エージェント再割り当て時に顕著な性能低下を示す集中型ベースライン(BADやCOMA)を上回った。
  • ToMで訓練されたエージェントは、未知の相手に対しても効果的な協調を可能にする普遍的でタスクレベルのプロトコルを発展させ、グループ固有の暗黙の合意を超えた堅牢性を示した。
  • 集中型トレーニングにおける信念の監視のおかげで、言語的コミュニケーションなしに高水準の協調が可能になる相手の信念を正確に推定でき、これが重要であった。
  • 1つのエージェントを固定してトレーニングする適応的トレーニング手順により、共同学習のダイナミクスに起因する非定常性の問題が効果的に緩和され、安定した収束が達成された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。