Skip to main content
QUICK REVIEW

[論文レビュー] Joint Policy Search for Multi-agent Collaboration with Imperfect Information

Yuandong Tian, Qucheng Gong|arXiv (Cornell University)|Aug 14, 2020
Reinforcement Learning in Robotics被引用数 1
ひとこと要約

本稿では、不完全情報ゲームにおけるマルチエージェント協調のための新規アルゴリズムであるJoint Policy Search(JPS)を提案する。JPSは、新たな概念であるポリシー変化密度を用いて、グローバルな価値変化を局所的なポリシー更新に分解することで、完全なゲーム再評価を伴わずに反復的に共同ポリシーを改善する。テーブル型ゲームにおいて既存手法を上回り、1,000手のコンラクト・ブリッジにおいて1手あたり+0.63 IMPの優位を示した。これは、WBridge5といったチャンピオンシップレベルのソフトウェアでさえも上回る結果である。

ABSTRACT

To learn good joint policies for multi-agent collaboration with imperfect information remains a fundamental challenge. While for two-player zero-sum games, coordinate-ascent approaches (optimizing one agent's policy at a time, e.g., self-play) work with guarantees, in multi-agent cooperative setting they often converge to sub-optimal Nash equilibrium. On the other hand, directly modeling joint policy changes in imperfect information game is nontrivial due to complicated interplay of policies (e.g., upstream updates affect downstream state reachability). In this paper, we show global changes of game values can be decomposed to policy changes localized at each information set, with a novel term named policy-change density. Based on this, we propose Joint Policy Search(JPS) that iteratively improves joint policies of collaborative agents in imperfect information games, without re-evaluating the entire game. On multi-agent collaborative tabular games, JPS is proven to never worsen performance and can improve solutions provided by unilateral approaches (e.g, CFR), outperforming algorithms designed for collaborative policy learning (e.g. BAD). Furthermore, for real-world games, JPS has an online form that naturally links with gradient updates. We test it to Contract Bridge, a 4-player imperfect-information game where a team of $2$ collaborates to compete against the other. In its bidding phase, players bid in turn to find a good contract through a limited information channel. Based on a strong baseline agent that bids competitive bridge purely through domain-agnostic self-play, JPS improves collaboration of team players and outperforms WBridge5, a championship-winning software, by $+0.63$ IMPs (International Matching Points) per board over 1k games, substantially better than previous SoTA ($+0.41$ IMPs/b) under Double-Dummy evaluation.

研究の動機と目的

  • 不完全情報を持つマルチエージェント協調設定における効果的な共同ポリシーの学習という課題に取り組む。
  • CFR や BAD のような単一エージェント手法が協調環境で局所最適に収束する問題を克服する。
  • 完全なゲーム再評価を回避するスケーラブルで反復的なポリシー改善手法を開発する。
  • 勾配互換性を持つ更新を用いて、リアルタイムゲームにおけるオンライン学習を可能にする。
  • コンラクト・ブリッジのような複雑な現実世界の不完全情報ゲームにおいて、優れたパフォーマンスを示すことを目的とする。

提案手法

  • 各情報集合におけるグローバルなゲーム価値変化を局所的ポリシー更新に分解するための新規概念であるポリシー変化密度を導入する。
  • 完全なゲームを再評価せずに、局所的ポリシー変更に注目することで共同ポリシーを改善する反復的アルゴリズムであるJoint Policy Search(JPS)を構築する。
  • 座標昇下に類似したアプローチを採用しているが、グローバル価値分解を用いることで単調増加の改善を保証する。
  • ポリシー変更と価値変更の関係を数学的枠組みで導出し、安定的かつ効率的な更新を可能にする。
  • リアルタイムゲーム応用に適した勾配ベースの更新と互換性を持つオンライン形式にJPSを適応する。
  • コンラクト・ブリッジにおけるパフォーマンスベンチマークに、ダブルダミー評価フレームワークを採用する。

実験結果

リサーチクエスチョン

  • RQ1完全なゲーム再評価を伴わずに、不完全情報ゲームにおける共同ポリシー改善は可能か?
  • RQ2グローバル価値変化を局所的ポリシー更新に分解することで、単調なパフォーランス向上が達成できるか?
  • RQ3JPSは、CFR や BAD のような単一エージェントポリシー学習手法よりも、協調的マルチエージェント環境で優れた性能を示せるか?
  • RQ4JPSは、コンラクト・ブリッジのような複雑な情報構造を持つ現実世界のゲームに効果的に適用可能か?
  • RQ5JPSは、現実世界のベンチマークにおいて、SOTAエージェントと比較して優れたパフォーマンスを達成できるか?

主な発見

  • JPSは性能を悪化させず、テーブル型マルチエージェントゲームにおいてCFRのような単一エージェント手法が生成する解よりも一貫して改善を示す。
  • JPSは、テーブル型協調環境において、BAD などの専用協調ポリシー学習アルゴリズムを上回る性能を示す。
  • コンラクト・ブリッジにおいて、JPSはチームプレイヤー間の協調を向上させ、1,000ゲームの平均で1手あたり+0.63 IMPの優位を達成した。
  • これは、ダブルダミー評価下で以前のSOTAである+0.41 IMP/手を上回る結果である。
  • JPSは、チャンピオンシップ優勝実績を持つブリッジソフトウェアWBridge5をも凌駕し、現実世界の環境における実用的優位性を示した。
  • JPSのオンライン版は、効率的で勾配互換性のある更新を可能にし、大規模かつ動的なゲーム環境に適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。