Skip to main content
QUICK REVIEW

[论文解读] Maximum Entropy Population-Based Training for Zero-Shot Human-AI Coordination

Rui Zhao, Jinming Song|arXiv (Cornell University)|Dec 22, 2021
Reinforcement Learning in Robotics被引用 5
一句话总结

本文提出最大熵群体训练(MEP),一种通过群体熵奖励鼓励个体与成对策略多样性的方法,用于训练强化学习智能体群体。通过在训练最优响应AI智能体时动态优先选择困难的伙伴策略,MEP在与未见过的人类伙伴进行零样本协作方面表现优异,优于自博弈、PBT、TrajeDi和FCP,在Overcooked环境中表现更佳。

ABSTRACT

We study the problem of training a Reinforcement Learning (RL) agent that is collaborative with humans without using any human data. Although such agents can be obtained through self-play training, they can suffer significantly from distributional shift when paired with unencountered partners, such as humans. To mitigate this distributional shift, we propose Maximum Entropy Population-based training (MEP). In MEP, agents in the population are trained with our derived Population Entropy bonus to promote both pairwise diversity between agents and individual diversity of agents themselves, and a common best agent is trained by paring with agents in this diversified population via prioritized sampling. The prioritization is dynamically adjusted based on the training progress. We demonstrate the effectiveness of our method MEP, with comparison to Self-Play PPO (SP), Population-Based Training (PBT), Trajectory Diversity (TrajeDi), and Fictitious Co-Play (FCP) in the Overcooked game environment, with partners being human proxy models and real humans. A supplementary video showing experimental results is available at https://youtu.be/Xh-FKD0AAKE.

研究动机与目标

  • 解决训练期间无任何人类数据可用时的零样本人类-AI协作挑战。
  • 缓解自博弈训练智能体在与未遭遇过的人类伙伴配对时出现的分布偏移问题。
  • 通过提升训练群体中的策略多样性,改善AI智能体对多样化人类策略的泛化能力。
  • 开发一种计算高效且安全的替代目标函数,以促进多智能体群体中的个体与成对多样性。
  • 证明从多样化群体中优先采样可带来与未见过的人类伙伴更优的合作表现。

提出的方法

  • 提出一种新颖的群体多样性(PD)目标函数,结合个体策略熵与成对Kullback–Leibler散度以实现策略多样性。
  • 推导出一种计算高效的线性复杂度替代目标函数——群体熵(PE),该函数是PD目标的下界。
  • 使用包含PE奖励的集中式训练方法训练智能体群体,以最大化整体多样性。
  • 通过基于学习进展的优先采样方案,将最优响应AI智能体与多样化群体中采样的智能体配对进行训练。
  • 根据协作难度动态调整采样优先级,以提升对未见策略的泛化能力。
  • 在Overcooked环境中应用该方法,使用人类代理模型与真实人类参与者进行评估。

实验结果

研究问题

  • RQ1基于熵的多样性促进的群体训练方法是否能提升AI智能体与人类之间的零样本协作?
  • RQ2所提出的群体熵奖励与现有方法相比,在促进个体与成对策略多样性方面表现如何?
  • RQ3从多样化群体中优先采样是否能带来对未见人类策略的更好泛化与性能表现?
  • RQ4MEP与Fictitious Co-Play、TrajeDi和Self-Play PPO等SOTA方法相比,在真实人类-AI协作中的表现如何?
  • RQ5该方法是否能在无需任何人类示范数据的情况下实现稳健协作?

主要发现

  • 在Overcooked环境中,MEP在人类代理模型与真实人类参与者的评估中,均优于Self-Play PPO、PBT、TrajeDi和FCP。
  • 与基线方法相比,MEP在与多样化人类代理模型及真实人类协作时,实现了更高的平均奖励与更好的成功率。
  • MEP仅需FCP一半的群体规模即可实现更优性能,表明其在多样性诱导方面具有更高的样本效率。
  • 动态优先采样方案显著提升了泛化能力,表现为在不同人类策略下均保持一致的性能提升。
  • 群体熵奖励能有效促进个体与成对多样性,从而生成更鲁棒、更具弹性的AI策略。
  • 实证结果表明,MEP训练的智能体在与未训练过的人类伙伴交互时更具适应性,且更不易出现分布偏移。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。