Skip to main content
QUICK REVIEW

[论文解读] Learning Control Admissibility Models with Graph Neural Networks for Multi-Agent Navigation

Chenning Yu, Hongzhan Yu|arXiv (Cornell University)|Oct 17, 2022
Adversarial Robustness in Machine Learning被引用 4
一句话总结

本文提出控制可容许性模型(CAMs),利用图神经网络学习多智能体导航中安全且可行的动作集合,将碰撞避免与目标到达解耦。通过稀疏奖励和反向传播的重标注进行训练,CAMs 在不同智能体数量下具有泛化能力——即使在部署于包含数百个智能体的密集环境中,也能实现高成功率和低碰撞率,优于最先进方法,并实现了对新任务(如追逐游戏)的零样本迁移。

ABSTRACT

Deep reinforcement learning in continuous domains focuses on learning control policies that map states to distributions over actions that ideally concentrate on the optimal choices in each step. In multi-agent navigation problems, the optimal actions depend heavily on the agents' density. Their interaction patterns grow exponentially with respect to such density, making it hard for learning-based methods to generalize. We propose to switch the learning objectives from predicting the optimal actions to predicting sets of admissible actions, which we call control admissibility models (CAMs), such that they can be easily composed and used for online inference for an arbitrary number of agents. We design CAMs using graph neural networks and develop training methods that optimize the CAMs in the standard model-free setting, with the additional benefit of eliminating the need for reward engineering typically required to balance collision avoidance and goal-reaching requirements. We evaluate the proposed approach in multi-agent navigation environments. We show that the CAM models can be trained in environments with only a few agents and be easily composed for deployment in dense environments with hundreds of agents, achieving better performance than state-of-the-art methods.

研究动机与目标

  • 为解决在不同智能体密度下多智能体导航的泛化挑战,标准强化学习策略因分布偏移而失效的问题。
  • 通过将目标到达与碰撞避免解耦,消除对复杂、环境特定的奖励工程的需求。
  • 通过学习可容许动作的集合论表示而非最优动作,实现组合式、可扩展的推理。
  • 开发一种利用稀疏奖励和基于反向传播的重标注方法的训练策略,以从轨迹中提取丰富信息。
  • 通过基于图神经网络的CAMs学习可迁移的安全约束,实现在新任务(如追逐游戏)上的零样本迁移。

提出的方法

  • 该方法引入控制可容许性模型(CAMs),以图神经网络表示,将本体智能体状态图映射为可容许动作的集合。
  • CAMs 在无模型强化学习设置中进行训练,使用稀疏奖励和一种新颖的基于反向传播的重标注技术,以提高样本效率。
  • 推理过程中,状态图被分解为更小的子图,CAMs 在智能体间组合,以实现可扩展的、去中心化的动作选择。
  • 结合简单的目标到达偏好函数与CAM,选择具体动作,实现安全与任务目标的解耦。
  • 图神经网络架构处理局部智能体交互,使模型能够捕捉对碰撞避免至关重要的复杂非线性交互模式。
  • 推理过程中的图分解缓解了协变量偏移,使在少量智能体(如3个)上训练的模型可泛化至高密度部署(如512个智能体)。

实验结果

研究问题

  • RQ1基于学习的方法是否能在不重新训练的情况下,泛化至多智能体导航中截然不同的智能体密度?
  • RQ2碰撞避免是否可独立于目标到达目标进行学习,以降低奖励工程的复杂性?
  • RQ3可容许动作的集合论表示是否能实现在大规模多智能体系统中的可扩展、可组合推理?
  • RQ4基于图神经网络的CAMs,若在稀疏数据上训练并使用反向传播进行重标注,是否能在密集且未见过的环境中实现高性能?
  • RQ5训练好的CAM是否能实现对根本不同的任务(如追逐游戏)的零样本迁移?

主要发现

  • 在最多3个智能体的环境中训练的CAMs,在部署于包含512个智能体的密集环境中时,实现了99%的安全率和98.9%的成功率,显著优于基线方法。
  • 在汽车环境中,采用图分解的CAM实现了0.99 ± 0.00的安全率和3.10 ± 1.20的奖励,而未使用分解的版本则为0.90 ± 0.03和-19.98 ± 7.08。
  • 在64个智能体的无人机追逐游戏中,CAM方法实现了98.9%的安全率和6.84 ± 1.12的奖励,证明了其在新任务上的有效零样本迁移能力。
  • 在512个智能体时安全率下降的故障模式被归因于连续状态中出现负向CAM值,表明可行动作不足,凸显了在高密度簇中全局协调的必要性。
  • 图分解在高密度场景中显著提升了性能,尤其在2D汽车环境中,因与训练条件的结构差异更大。
  • 该方法在无需专家演示或奖励塑形的情况下实现了高性能,完全依赖稀疏奖励和基于反向传播的重标注实现有效学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。