Skip to main content
QUICK REVIEW

[論文レビュー] Neural Recursive Belief States in Multi-Agent Reinforcement Learning

Pol Blasco Moreno, Edward Hughes|arXiv (Cornell University)|Feb 3, 2021
Reinforcement Learning in Robotics参考文献 48被引用数 7
ひとこと要約

本稿では、再帰的ニューラル信念ネットワークを用いて、他者の信念についての信念(高次信念)を含む、スケーラブルな深層生成モデルであるNeural Recursive Belief States(NRBS)を提案する。この手法により、部分的に観測可能なマルコフゲーム(POMG)である「Running with Scissors」のような複雑な環境でも、モデルフリーのベースラインを著しく上回る性能が達成され、高次信念モデルを用いるエージェントが、低次または信念モデルなしのエージェントよりも優れた性能を発揮することが示された。

ABSTRACT

In multi-agent reinforcement learning, the problem of learning to act is particularly difficult because the policies of co-players may be heavily conditioned on information only observed by them. On the other hand, humans readily form beliefs about the knowledge possessed by their peers and leverage beliefs to inform decision-making. Such abilities underlie individual success in a wide range of Markov games, from bluffing in Poker to conditional cooperation in the Prisoner's Dilemma, to convention-building in Bridge. Classical methods are usually not applicable to complex domains due to the intractable nature of hierarchical beliefs (i.e. beliefs of other agents' beliefs). We propose a scalable method to approximate these belief structures using recursive deep generative models, and to use the belief models to obtain representations useful to acting in complex tasks. Our agents trained with belief models outperform model-free baselines with equivalent representational capacity using common training paradigms. We also show that higher-order belief models outperform agents with lower-order models.

研究の動機と目的

  • エージェントが観測できない情報や協力者エージェントの方策を推論できるように、部分観測可能なマルコフゲームにおけるマルチエージェントの部分観測性の課題に対処すること。
  • 複雑な環境における階層的信念構造(例:他者の信念についての信念)の非効率性を、深層学習を用いて克服すること。
  • 意思決定の向上を図るため、エージェントが再帰的信念状態を形成・活用できるようにすること。
  • 高次信念モデリングが、低次またはモデルフリーのベースラインと比較して優れた性能を発揮することを実証すること。
  • 深層強化学習のスケーラビリティとドメインに依存しない性質を保ちながら、構造的かつ解釈可能な信念表現を統合すること。

提案手法

  • 階層的信念状態を近似するために再帰的深層生成モデルを用い、世界状態に加え、他者の信念(B1, B2, など)についてもモデル化する。
  • 観測履歴を処理するRNNによって生成されるニューラルコードを用いて信念状態を表現し、ベイズフィルタリングのダイナミクスを模倣する。
  • 教師なし学習により信念モデルをエンドツーエンドで訓練し、真の状態の教師信号を必要としないため、スケーラビリティを維持する。
  • 方策学習をニューラル信念表現に条件づけることで、エージェントが他者の非公開情報や方針について推論した知識に基づいて行動できるようにする。
  • 信念推定におけるサンプル数を制御する要因Kを用いたネストドサンプリングを組み込み、高次信念分布を近似する。
  • 学習ルールを変更せず、標準のポリシー勾配更新を維持することで、既存の深層強化学習フレームワークとの互換性を確保する。

実験結果

リサーチクエスチョン

  • RQ1再帰的信念モデルは、隠れた情報を持つ部分的観測可能なマルコフゲームにおけるマルチエージェント意思決定を改善できるか?
  • RQ2高次信念モデリング(例:B1, B2)は、低次またはモデルフリーのベースラインと比較して、測定可能な性能向上をもたらすか?
  • RQ3信念近似に使用するサンプル数(K)が、再帰的信念学習の安定性と性能に与える影響は何か?
  • RQ4明示的な状態の教師信号を必要とせず、複雑な環境でもニューラル信念モデルを効率的かつスケーラブルに訓練できるか?
  • RQ5再帰的信念を活用するエージェントは、生の観測履歴やモデルフリー方策に依存するエージェントと比較して、どの程度優れた性能を発揮するか?

主な発見

  • 「Running with Scissors」環境において、K=10サンプルを用いたNeural Recursive Belief States(NRBS)を採用したエージェントは、モデルフリーのベースラインおよびK=1サンプルを用いたエージェントを上回った。
  • Tigerゲームでは、K=10サンプルで訓練されたエージェントが正しく高次信念分布を学習した一方、K=1のエージェントは崩壊的に失敗した。
  • 他者の信念をモデル化するB1エージェントは、信念モデリングを行わないB0エージェントよりも平均報酬が高かったが、これはK=10の十分なサンプリングが行われた場合に限る。K=1の場合はB1エージェントは性能が劣り、分散が大きくなった。
  • K=10の条件下ではB1とB0エージェントの性能差が顕著に現れ、より豊かな信念表現がより優れた戦略的推論を可能にすることが示された。
  • 高次信念モデル(B2以上)は実証的に有効であり、Hanabiのような複雑なゲームにおけるより深い心の理論(ToM)推論の可能性を示唆している。
  • 本手法はスケーラビリティとドメインに依存しない性質を維持しており、ポリシー更新ルールを変更していないため、標準的な深層強化学習の訓練パラダイムへの統合が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。