Skip to main content
QUICK REVIEW

[论文解读] Graph Policy Gradients for Large Scale Robot Control

Arbaaz Khan, Ekaterina Tolstaya|arXiv (Cornell University)|Jul 8, 2019
Reinforcement Learning in Robotics参考文献 32被引用 21
一句话总结

本文提出图策略梯度(GPG),一种利用图卷积网络(GCNs)学习大规模多机器人系统可扩展、对称策略的强化学习方法。通过利用机器人之间的局部图结构,GPG 实现了从仅三台机器人训练的策略零样本迁移至超过100台机器人,显著优于全连接基线方法在编队飞行任务中的表现。

ABSTRACT

In this paper, we consider the problem of learning policies to control a large number of homogeneous robots. To this end, we propose a new algorithm we call Graph Policy Gradients (GPG) that exploits the underlying graph symmetry among the robots. The curse of dimensionality one encounters when working with a large number of robots is mitigated by employing a graph convolutional neural (GCN) network to parametrize policies for the robots. The GCN reduces the dimensionality of the problem by learning filters that aggregate information among robots locally, similar to how a convolutional neural network is able to learn local features in an image. Through experiments on formation flying, we show that our proposed method is able to scale better than existing reinforcement methods that employ fully connected networks. More importantly, we show that by using our locally learned filters we are able to zero-shot transfer policies trained on just three robots to over hundred robots.

研究动机与目标

  • 为解决大规模同质机器人控制策略训练中的可扩展性挑战。
  • 通过利用机器人之间的潜在图对称性,缓解多机器人强化学习中的维度灾难问题。
  • 通过基于局部学习的图滤波器,实现从小规模到大规模机器人集群的零样本策略迁移。
  • 在复杂、高维控制环境(如模拟空中编队飞行)中提升样本效率。
  • 证明图结构策略参数化相比全连接网络可实现更快收敛与更好泛化能力。

提出的方法

  • 该方法使用图卷积网络(GCNs)对单个机器人策略进行参数化,利用在动态定义的机器人交互图上的局部邻域信息。
  • 每个机器人的策略基于通过可学习图滤波器聚合的K跳邻域特征,降低维度并强制实现排列等变性。
  • 采用集中训练、去中心化执行的策略梯度强化学习方法进行训练,使用共享奖励信号。
  • 图结构基于空间邻近性(例如,距离 < ε)定义,为所有机器人的状态信号向量提供支持。
  • 图卷积的排列等变性确保对机器人排序变化具有鲁棒性,从而在大规模机器人数量下稳定训练。
  • 该方法在仿真环境中应用于质点模型和单积分器动力学,包括用于真实空中动力学模拟的AirSim。

实验结果

研究问题

  • RQ1图结构策略参数化是否能降低多机器人强化学习中的样本复杂度并提升可扩展性?
  • RQ2基于图函数逼近的方法在多大程度上可成功将小规模机器人训练的策略迁移至大规模集群?
  • RQ3与全连接网络相比,使用局部图滤波器在收敛速度和编队控制任务性能方面表现如何?
  • RQ4GPG是否能泛化至包含有限质量与速度状态的复杂、真实动力学环境(如实时模拟器)?
  • RQ5GCN的排列等变性是否有助于在具有动态图拓扑的大型多机器人系统中稳定训练?

主要发现

  • GPG成功将仅在三台机器人上训练的策略零样本迁移至超过100台机器人,在编队飞行任务中实现稳定且协调的行为,无需重新训练。
  • 该方法在机器人数量增加时,收敛速度更快且泛化能力更强,优于全连接基线网络。
  • 在包含真实单积分器动力学与噪声观测的AirSim仿真中,GPG优于基线方法,后者在50,000个训练周期内无法学习到合理行为。
  • 图卷积的使用实现了有效的局部特征提取,降低了策略输入空间的有效维度。
  • GCN的排列等变性确保在探索过程中机器人排序或图拓扑发生变化时,训练依然稳定。
  • GPG在高维、连续控制设置中实现了样本高效的强化学习,使大规模多机器人策略学习成为可能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。