[论文解读] Graph Neural Networks for Decentralized Multi-Robot Submodular Action Selection
本文提出了一种基于图神经网络(GNN)的学习框架,用于去中心化的多机器人目标跟踪,其中机器人利用本地观测和邻居通信来选择动作,以最大化跟踪性能。该GNN通过模仿集中式贪心算法进行训练,实现了接近专家水平的性能,推理速度比基线快数个数量级,并且在未见过的机器人数量和环境配置下表现出强大的泛化能力。
The problem of decentralized multi-robot target tracking asks for jointly selecting actions, e.g., motion primitives, for the robots to maximize target tracking performance with local communications. One major challenge for practical implementations is to make target tracking approaches scalable for large-scale problem instances. In this work, we propose a general-purpose learning architecture toward collaborative target tracking at scale, with decentralized communications. Particularly, our learning architecture leverages a graph neural network (GNN) to capture local interactions of the robots and learns decentralized decision-making for the robots. We train the learning model by imitating an expert solution and implement the resulting model for decentralized action selection involving local observations and communications only. We demonstrate the performance of our GNN-based learning approach in a scenario of active target tracking with large networks of robots. The simulation results show our approach nearly matches the tracking performance of the expert algorithm, and yet runs several orders faster with up to 100 robots. Moreover, it slightly outperforms a decentralized greedy algorithm but runs faster (especially with more than 20 robots). The results also exhibit our approach's generalization capability in previously unseen scenarios, e.g., larger environments and larger networks of robots.
研究动机与目标
- 解决在通信受限条件下多机器人目标跟踪中的可扩展性与去中心化挑战。
- 开发一种基于学习的方法,仅使用本地观测和邻居通信,实现快速的去中心化动作选择。
- 训练GNN策略以模仿集中式贪心算法,用于子模目标最大化问题。
- 评估模型在更大机器人团队和训练分布之外的未见环境中的泛化能力。
- 与集中式和去中心化贪心基线相比,实现显著降低的推理时间,同时保持高水平的跟踪性能。
提出的方法
- 使用图神经网络(GNN)建模机器人之间的交互,其中每个机器人作为节点,边表示通信范围。
- GNN处理原始传感器测量值和本地观测,通过消息传递机制聚合来自邻近机器人的信息。
- 通过监督式模仿学习训练GNN策略,使用集中式贪心算法生成的动作作为专家示范。
- 该架构与感知模块(如CNN)集成,以处理原始图像或传感器数据,实现从原始输入端到端的训练。
- 在较小的机器人数量(如N=20)上进行训练,并在更大的数量(如N=100)上进行测试,从而实现对未见规模的泛化。
- 通信仅限于邻居之间,确保去中心化运行,同时最小化协调开销。
实验结果
研究问题
- RQ1基于GNN的模仿学习框架能否在去中心化的多机器人目标跟踪中实现接近专家水平的性能?
- RQ2随着机器人数量的增加,基于GNN的方法在推理速度和跟踪质量方面如何扩展?
- RQ3GNN策略能否在不重新训练的情况下泛化至更大的机器人团队和新环境?
- RQ4与去中心化贪心和随机基线策略相比,GNN在性能和速度方面表现如何?
- RQ5GNN能否在保持去中心化决策和可扩展性的前提下,有效处理原始传感器数据?
主要发现
- GNN方法的跟踪性能与最优解相差不超过1.5%,在目标覆盖度方面几乎与集中式贪心算法(Centrl-gre)持平。
- 在100台机器人的情况下,GNN的单次推理时间小于1毫秒,相比Centrl-gre实现了1.5至2.5个数量级的速度提升。
- GNN在跟踪质量上优于去中心化贪心(Decent-gre)算法,且推理速度显著更快,尤其当机器人数量超过20台时优势更明显。
- GNN在未见机器人数量上表现出良好的泛化能力:在20台机器人上训练后,其性能在N=20至50台机器人范围内保持了Centrl-gre性能的约88.6%至89.5%。
- GNN在更大环境和未见配置下也表现出泛化能力,1000次不同场景测试中性能保持一致。
- 即使在机器人数量较少时(如N=4至10),GNN仍能保持高性能,展现出跨尺度的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。