Skip to main content
QUICK REVIEW

[論文レビュー] Maximum Entropy Population-Based Training for Zero-Shot Human-AI Coordination

Rui Zhao, Jinming Song|arXiv (Cornell University)|Dec 22, 2021
Reinforcement Learning in Robotics被引用数 5
ひとこと要約

本論文は、個々のエージェントおよびペairワイズのポリシー多様性を促進するためのポピュレーションエントロピー報酬を用いて、多様な強化学習エージェントの集団を訓練するMaximum Entropy Population-based Training (MEP)を提案する。ベストレスポンスAIエージェントの訓練中に、困難なパートナーポリシーを動的に優先することで、未確認の人間パートナーとの優れたゼロショット協調を達成し、自己対戦、PBT、TrajeDi、FCPを凌駕する。

ABSTRACT

We study the problem of training a Reinforcement Learning (RL) agent that is collaborative with humans without using any human data. Although such agents can be obtained through self-play training, they can suffer significantly from distributional shift when paired with unencountered partners, such as humans. To mitigate this distributional shift, we propose Maximum Entropy Population-based training (MEP). In MEP, agents in the population are trained with our derived Population Entropy bonus to promote both pairwise diversity between agents and individual diversity of agents themselves, and a common best agent is trained by paring with agents in this diversified population via prioritized sampling. The prioritization is dynamically adjusted based on the training progress. We demonstrate the effectiveness of our method MEP, with comparison to Self-Play PPO (SP), Population-Based Training (PBT), Trajectory Diversity (TrajeDi), and Fictitious Co-Play (FCP) in the Overcooked game environment, with partners being human proxy models and real humans. A supplementary video showing experimental results is available at https://youtu.be/Xh-FKD0AAKE.

研究の動機と目的

  • トレーニング中に人間データが利用できないゼロショット人間-AI協調の課題に対処すること。
  • 自己対戦で訓練されたエージェントが、未遭遇した人間パートナーとペairを組んだ際に生じる分布シフトを軽減すること。
  • トレーニング集団におけるポリシー多様性の向上により、AIエージェントの多様な人間戦略への一般化を改善すること。
  • マルチエージェント集団における個々およびペアワイズの多様性を促進する計算効率的で安全な代替目的関数を開発すること。
  • 多様な集団からの優先順位付きサンプリングが、未確認の人間パートナーとのより良い協調をもたらすことを示すこと。

提案手法

  • 個々のポリシー エントロピーとペアワイズのKullback–Leibler 散布の両方を組み合わせた、新しいポピュレーション多様性(PD)目的関数を提案する。
  • PD目的関数の下界である、計算効率的で線形時間計算量の代替目的関数であるポピュレーション エントロピー(PE)を導出する。
  • 集中的なトレーニングを用いてPE報酬を追加することで、集団の多様性を最大化するエージェント集団を訓練する。
  • ベストレスポンスAIエージェントを、多様な集団からサンプリングされたエージェントとペアにすることで、学習進捗に基づく優先順位付けスキームを用いて訓練する。
  • 協調の難易度に応じて動的にサンプリング優先度を調整し、未確認のポリシーへの一般化を向上させる。
  • 評価のために、人間プロキシモデルと実際の人間参加者を用いて、Overcooked環境に本手法を適用する。

実験結果

リサーチクエスチョン

  • RQ1エントロピーに基づく多様性促進を伴う集団ベースのトレーニングアプローチは、AIエージェントと人間の間のゼロショット協調を向上させることができるか?
  • RQ2提案されたポピュレーション エントロピー報酬は、既存手法と比較して、個々およびペアワイズのポリシー多様性を促進する上で効果的か?
  • RQ3多様な集団からの優先順位付きサンプリングは、未確認の人間戦略への一般化およびパフォーマンス向上に寄与するか?
  • RQ4MEPは、Fictitious Co-Play、TrajeDi、Self-Play PPOといった最先端手法と比較して、実際の人間-AI協調において優れているか?
  • RQ5本手法は、人間の示範データを一切必要とせずに、強固な協調を達成できるか?

主な発見

  • MEPは、Overcooked環境における人間プロキシモデルおよび実際の人間の両方の評価で、Self-Play PPO、PBT、TrajeDi、FCPを上回る性能を発揮する。
  • ベースラインと比較して、多様な人間プロキシモデルおよび実際の人間と協調する際の平均報酬と成功確率がより高い。
  • FCPの半分の集団サイズで優れた性能を達成できるため、多様性誘導における高いサンプル効率性を示している。
  • 動的優先順位付けスキームは、異なる人間戦略において一貫したパフォーマンス向上を示しており、一般化の向上に顕著に寄与している。
  • ポピュレーション エントロピー報酬は、個々およびペアワイズの多様性を効果的に促進し、より強固で柔軟なAIポリシーをもたらす。
  • 実証的結果から、MEPで訓練されたエージェントは、未訓練の人間パートナーと相互作用する際に、より適応的で分布シフトの影響を受けにくいことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。