Skip to main content
QUICK REVIEW

[论文解读] Towards Open Ad Hoc Teamwork Using Graph-based Policy Learning

Arrasy Rahman, Niklas Höpner|arXiv (Cornell University)|Jun 18, 2020
Mobile Crowdsensing and Crowdsourcing参考文献 34被引用 4
一句话总结

该论文提出图神经网络策略学习(GPL),一种新颖的开放即兴协作方法,使单个智能体能够动态适应具有未知策略的团队成员变化。通过图神经网络建模可变规模的团队,并将智能体模型与联合动作价值函数相结合,GPL在多环境基准测试中优于基线方法,尤其在泛化到未见过的团队规模和组成方面表现优异。

ABSTRACT

Ad hoc teamwork is the challenging problem of designing an autonomous agent which can adapt quickly to collaborate with teammates without prior coordination mechanisms, including joint training. Prior work in this area has focused on closed teams in which the number of agents is fixed. In this work, we consider open teams by allowing agents with different fixed policies to enter and leave the environment without prior notification. Our solution builds on graph neural networks to learn agent models and joint-action value models under varying team compositions. We contribute a novel action-value computation that integrates the agent model and joint-action value model to produce action-value estimates. We empirically demonstrate that our approach successfully models the effects other agents have on the learner, leading to policies that robustly adapt to dynamic team compositions and significantly outperform several alternative methods.

研究动机与目标

  • 为解决开放即兴协作中的挑战,即具有未知策略的智能体在无事先协调的情况下动态加入或离开团队。
  • 克服固定状态向量强化学习方法在可变规模团队环境中的局限性。
  • 使单个智能体能够学习鲁棒策略,以适应多样化的队友类型和不断变化的团队构成。
  • 开发一种联合动作价值模型,以解耦个体智能体对学习者回报的影响。
  • 通过基于图的建模与集成动作价值计算,提升对未见团队规模和构成的泛化能力。

提出的方法

  • GPL使用图神经网络(GNNs)对智能体动态和联合动作价值函数进行建模,从而能够处理可变规模的团队。
  • 提出一种新颖的动作价值计算方法,将智能体模型的预测与基于GNN的价值模型的联合动作价值估计相融合。
  • 智能体模型利用观察历史预测队友行为,而联合动作价值模型则基于团队整体动作估计回报。
  • GPL与基于价值的单智能体强化学习算法兼容,测试了两种变体:一种基于Q-learning,另一种基于软策略迭代。
  • 联合动作价值模型经过训练,能够解耦每个智能体动作对学习者回报的贡献,从而实现稳健适应。
  • 该框架使用成对效用模型(MLPδ)捕捉智能体间依赖关系,提升价值估计精度。

实验结果

研究问题

  • RQ1单智能体强化学习智能体是否能有效适应开放环境中具有未知策略的动态团队构成?
  • RQ2与固定规模或拼接式方法相比,基于图的建模在开放即兴协作中如何提升性能与泛化能力?
  • RQ3GPL在团队规模和构成变化时,能在多大程度上解耦单个队友对学习者回报的影响?
  • RQ4将智能体模型与联合动作价值函数集成,是否能带来比独立模型或输入拼接更好的策略学习效果?
  • RQ5GPL在复杂多智能体环境中对未见过的团队规模和队友类型,泛化能力如何?

主要发现

  • GPL在所有三个基准环境(基于层级的觅食、狼群、FortAttack)中显著优于所有基线方法,包括Q-learning、MADDPG、DGN以及使用输入拼接的消融版本。
  • 两种GPL变体在大多数学习任务中均获得比所有基线更高的回报,其中基于GNN的版本在动态团队场景中表现更优。
  • GPL在未见过的团队规模和构成上表现出强大的泛化能力,优于未能建模动态团队动态的方法。
  • 状态值分析显示,GPL学习者能为攻击者处于射击范围内的状态分配更高效用,而基线方法则偏好无攻击者的状态。
  • 基于GNN的联合动作价值模型能够更好地区分关键游戏状态(如附近存在攻击者),这与策略性能的提升密切相关。
  • 将智能体模型与联合动作价值函数集成,使GPL能够学习到单智能体基线方法未能捕捉的复杂智能体间依赖关系。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。