Skip to main content
QUICK REVIEW

[论文解读] Decentralized Control of Quadrotor Swarms with End-to-end Deep Reinforcement Learning

Sumeet Batra, Zhehui Huang|arXiv (Cornell University)|Sep 16, 2021
Reinforcement Learning in Robotics参考文献 25被引用 9
一句话总结

本文提出一种去中心化、端到端的深度强化学习(DRL)方法,用于控制四旋翼无人机群,实现了从仿真环境到真实硬件的零样本迁移。在物理特性丰富的仿真环境中训练的神经策略,可在最多128架无人机的群组中实现无碰撞、高速机动、编队控制及追逃行为,且成功部署于资源受限的Crazyflie 2.0无人机上,仅使用10^3个参数。

ABSTRACT

We demonstrate the possibility of learning drone swarm controllers that are zero-shot transferable to real quadrotors via large-scale multi-agent end-to-end reinforcement learning. We train policies parameterized by neural networks that are capable of controlling individual drones in a swarm in a fully decentralized manner. Our policies, trained in simulated environments with realistic quadrotor physics, demonstrate advanced flocking behaviors, perform aggressive maneuvers in tight formations while avoiding collisions with each other, break and re-establish formations to avoid collisions with moving obstacles, and efficiently coordinate in pursuit-evasion tasks. We analyze, in simulation, how different model architectures and parameters of the training regime influence the final performance of neural swarms. We demonstrate the successful deployment of the model learned in simulation to highly resource-constrained physical quadrotors performing station keeping and goal swapping behaviors. Code and video demonstrations are available on the project website at https://sites.google.com/view/swarm-rl.

研究动机与目标

  • 开发一种仅依赖局部观测的去中心化、端到端深度强化学习控制器,用于四旋翼无人机群。
  • 实现训练策略从高保真仿真环境到真实世界、资源受限的物理无人机的零样本迁移。
  • 实现高性能群组行为,如高速编队飞行、动态障碍物避让及追逃行为,无需动力学规划或集中式协调。
  • 在不同群组规模(最多128架无人机)和物理构型下,验证系统的可扩展性与鲁棒性。
  • 验证模型无关的策略可在无需微调或PID调参的情况下控制多种四旋翼平台。

提出的方法

  • 在包含真实四旋翼动力学与物理特性的仿真环境中,使用多智能体深度强化学习训练策略。
  • 每架无人机使用自注意力与邻居编码器,将本体感知与外部感知观测(如相对位置、速度)转化为潜在嵌入。
  • 策略网络将这些嵌入直接映射为推力指令,实现端到端控制,无需人工设计控制器。
  • 采用排列与尺度无关的模型架构,确保在不同群组规模与构型下的泛化能力。
  • 训练使用奖励函数,重点强调避碰、目标抵达与编队维持。
  • 在仅配备约10^3个参数的物理Crazyflie 2.0无人机上部署策略,利用机载微控制器以500 Hz频率进行计算。

实验结果

研究问题

  • RQ1端到端深度强化学习能否生成去中心化、可扩展且无碰撞的群组控制策略,并实现从仿真到真实硬件的零样本迁移?
  • RQ2不同的神经网络架构与训练超参数如何影响所学习群组控制器的性能与鲁棒性?
  • RQ3所学习的策略在高维、实时环境中,对高速机动、动态障碍物避让及追逃行为的处理能力如何?
  • RQ4同一策略架构是否可在无需重新训练的情况下,泛化至不同规模的群组与不同物理参数的四旋翼平台?
  • RQ5与经典规划方法相比,所学习的DRL控制器在轨迹效率、敏捷性及三维空间利用率方面表现如何?

主要发现

  • DRL训练的策略在仅配备约10^3个参数的物理Crazyflie 2.0无人机上,成功执行了所有任务,包括保持站位、目标交换及追逃行为。
  • 控制器实现了最大7 m/s的速度与1.7 g的加速度,显著优于经典方法。
  • DRL控制器生成的轨迹充分利用了三维空间,而经典方法的轨迹主要局限于二维平面。
  • 与经典方法相比,DRL策略能更快抵达目标,后者因保守的避碰约束而产生更长、更低效的轨迹。
  • 系统对气动干扰(如下洗气流)及非破坏性碰撞表现出鲁棒性,无人机在空中接触后能恢复并重新稳定。
  • 经过额外训练后,同一策略架构可控制最多128架无人机的群组,且单架无人机的计算开销无显著增加。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。