Skip to main content
QUICK REVIEW

[論文レビュー] K-level Reasoning for Zero-Shot Coordination in Hanabi

Brandon Cui, Hengyuan Hu|arXiv (Cornell University)|Jul 14, 2022
Reinforcement Learning in Robotics被引用数 8
ひとこと要約

本稿では、同期的k段階推論(SyKLR)と、階層全体を同時に学習する新規ハイブリッド手法SyKLRBRを提案する。この手法は、全段階のk段階推論を並列に学習し、階層全体に対して最適応答を同時に学習する。このアプローチにより、ハナビにおいて、手順や外部情報に依存せずに、ゼロショット協調とアドホックチームプレイの性能が最先端水準に達し、一般化性能と人間-AI協調性が著しく向上した。

ABSTRACT

The standard problem setting in cooperative multi-agent settings is self-play (SP), where the goal is to train a team of agents that works well together. However, optimal SP policies commonly contain arbitrary conventions ("handshakes") and are not compatible with other, independently trained agents or humans. This latter desiderata was recently formalized by Hu et al. 2020 as the zero-shot coordination (ZSC) setting and partially addressed with their Other-Play (OP) algorithm, which showed improved ZSC and human-AI performance in the card game Hanabi. OP assumes access to the symmetries of the environment and prevents agents from breaking these in a mutually incompatible way during training. However, as the authors point out, discovering symmetries for a given environment is a computationally hard problem. Instead, we show that through a simple adaption of k-level reasoning (KLR) Costa Gomes et al. 2006, synchronously training all levels, we can obtain competitive ZSC and ad-hoc teamplay performance in Hanabi, including when paired with a human-like proxy bot. We also introduce a new method, synchronous-k-level reasoning with a best response (SyKLRBR), which further improves performance on our synchronous KLR by co-training a best response.

研究の動機と目的

  • 事前に通信のない独立して訓練されたエージェントや人間が、協調する必要がある協調的マルチエージェント設定におけるゼロショット協調の課題に対処すること。
  • 自己対戦学習の限界を克服し、脆く、合図依存のポリシーを生成するが、外部エージェントと互換性のないものとなること。
  • k段階推論のような認知階層手法を、ハナビのような大規模かつ部分的に観測可能な協調問題に適応させること。
  • 任意の通信合図への依存を減らすことで、アドホックチームプレイおよび人間-AI協調性の耐性を高めること。
  • 同期的訓練によって階層的推論段階が学習の安定性と性能向上に寄与するかどうかを調査すること。

提案手法

  • 全k段階推論エージェントを逐次的ではなく、同時に並列に訓練することで、ウォールクロック時間を短縮し、過学習に対する正則化として機能させる。
  • 全k段階推論階層に対して最適応答を同時に学習するハイブリッド手法SyKLRBRを導入し、特に上位2段階に高い重みを付与する。
  • 各レベル-kエージェントが他のエージェントをレベル-(k-1)としてモデル化する階層的訓練スキームを採用するが、全段階を同時に更新する。
  • カリキュラム学習を適用し、低い段階から訓練を開始し、徐々に高い段階を導入するが、全段階を同時に訓練する。
  • 信念モデルを用いて、ポリシーが任意の合図にどれほど依存しているかを評価し、ゲーム状態における信念の交差エントロピーを測定する。
  • 全階層に対する最適応答を訓練し、最終的なテスト時のポリシーとして用いることで、ゼロショット環境における即時の適応が可能になる。

実験結果

リサーチクエスチョン

  • RQ1複雑なDec-POMDPにおいて、同期的k段階推論エージェントの訓練は、逐次的訓練と比較して性能と安定性を向上させるか?
  • RQ2k段階推論は、ハナビのような大規模かつ部分的に観測可能な協調問題に効果的にスケーリング可能か?
  • RQ3k段階階層に対する最適応答を同時に学習させることで、ゼロショット協調とアドホックチームプレイの性能が向上するか?
  • RQ4同期的訓練は、低レベルポリシーへの過学習をどのように軽減し、一般化性能を向上させるか?
  • RQ5本手法は、先行SOTA手法と比較して、人間風のプロキシとの協調性をどの程度向上させるか?

主な発見

  • SyKLRBRは自己対戦スコア21.65±0.21を達成し、ハナビベンチマークで先行手法を上回った。
  • クロスプレイ評価では21.42±0.10を達成し、独立して訓練されたエージェントとの強いゼロショット協調性能を示した。
  • 人間プロキシ(クローンボット)との評価では14.59±0.25を記録し、ハナビにおける人間-AI協調の新記録を樹立した。
  • 同期的訓練により、低レベルポリシーへの過学習が軽減された。中間スナップショットにおける信念モデルの交差エントロピーは1.70±0.01であったが、最終ポリシーでは1.58±0.01に低下した。
  • 最適応答部品のおかげで、アドホック環境における耐性が向上し、推論時に即時の適応が可能になった。
  • 同期的認知階層(CH)訓練はSyKLRBRより成績が悪く、この設定ではKLRに最適応答を組み合わせた手法が、標準的な認知階層アプローチよりも効果的であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。