[论文解读] Graph Policy Gradients for Large Scale Unlabeled Motion Planning with Constraints
本文提出图策略梯度(GPG),一种用于大规模无标签运动规划的可扩展强化学习框架,具有约束条件。通过使用图卷积网络(GCNs)参数化去中心化策略,GPG 实现了从小规模到大规模机器人集群的零样本迁移,无论集群规模和目标配置如何变化,其性能均在约12–15秒内接近集中式最优解(oracle解决方案)。
In this paper, we present a learning method to solve the unlabelled motion problem with motion constraints and space constraints in 2D space for a large number of robots. To solve the problem of arbitrary dynamics and constraints we propose formulating the problem as a multi-agent problem. In contrast to previous works that propose using learning solutions for unlabelled motion planning with constraints, we are able to demonstrate the scalability of our methods for a large number of robots. The curse of dimensionality one encounters when working with a large number of robots is mitigated by employing a graph convolutional neural (GCN) network to parametrize policies for the robots. The GCN reduces the dimensionality of the problem by learning filters that aggregate information among robots locally, similar to how a convolutional neural network is able to learn local features in an image. Additionally, by employing a GCN we are also able to overcome the computational overhead of training policies for a large number of robots by first training graph filters for a small number of robots followed by zero-shot policy transfer to a larger number of robots. We demonstrate the effectiveness of our framework through various simulations.
研究动机与目标
- 解决具有动力学和空间约束的无标签多机器人运动规划中的可扩展性挑战。
- 克服在大规模机器人数量下训练策略时面临的维度灾难和计算开销问题。
- 通过图结构的信息聚合实现机器人之间的去中心化、局部协调。
- 在保持可扩展性的前提下,实现与集中式、可证明正确的算法相近的最优性能。
- 通过学习的图滤波器,实现从小型到大型机器人集群的零样本策略迁移。
提出的方法
- 将无标签运动规划问题建模为具有图结构机器人交互拓扑的多智能体强化学习(MARL)任务。
- 使用图卷积网络(GCNs)对机器人策略进行参数化,通过可学习滤波器实现从K跳邻居处的本地信息聚合。
- 基于欧氏距离定义图结构,机器人之间通过连接性建立图关系,每个机器人观测其感知半径内的最近邻机器人及其目标。
- 在小规模机器人配置上训练策略,并将策略零样本迁移至更大规模集群,利用滤波器大小对图大小不变的特性。
- 训练期间使用集中式评论器进行策略梯度更新,而推理过程保持完全去中心化。
- 采用稀疏奖励函数,仅当所有目标均被覆盖时才给予非零奖励,从而在无需显式任务标注的情况下激励覆盖行为。
实验结果
研究问题
- RQ1图卷积网络能否实现大规模无标签运动规划中具有约束条件的可扩展、去中心化策略学习?
- RQ2在不重新训练的情况下,基于小规模机器人集群训练的策略在多大程度上可实现零样本迁移至更大规模集群?
- RQ3与集中式最优解相比,去中心化的GPG框架在到达目标时间上的性能差距有多大?
- RQ4与全连接网络相比,使用基于图的局部信息聚合是否在可扩展性和协调能力方面表现更优?
- RQ5随着集群规模和目标复杂度的增加,该框架能否保持相对于最优集中式解的一致性能差距?
主要发现
- GPG在所有测试构型中均实现接近最优的性能,其到达目标时间与集中式CAPT最优解的差距约为12–15秒。
- 即使机器人数量增加或目标距离变长,GPG与集中式最优解之间的性能差距仍基本保持恒定(约12–15秒)。
- 从小规模到大规模集群的零样本策略迁移有效,基于小图训练的策略可直接应用于更大规模图而无需重新训练。
- 该框架能成功协调机器人集群在无碰撞前提下覆盖所有目标,即使机器人之间存在局部观测重叠和有限感知范围。
- GPG通过保持邻居交互基数恒定(固定数量的K跳邻居),实现了可扩展性,从而缓解了维度灾难问题。
- GCN的使用实现了机器人图上的局部特征学习与信息传播,从而产生协调一致的无碰撞覆盖行为。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。