[论文解读] Autonomous Drone Racing with Deep Reinforcement Learning
本文提出了一种基于深度强化学习(DRL)的方法,用于在自主无人机竞速中实现近似时间最优的轨迹规划,通过使用相对栅门观测和并行化训练方案,实现实时适应动态赛道变化。该方法在真实四旋翼无人机上实现了高达60 km/h的飞行速度,展示了在仿真和真实环境中的鲁棒性与可扩展性。
In many robotic tasks, such as autonomous drone racing, the goal is to travel through a set of waypoints as fast as possible. A key challenge for this task is planning the time-optimal trajectory, which is typically solved by assuming perfect knowledge of the waypoints to pass in advance. The resulting solution is either highly specialized for a single-track layout, or suboptimal due to simplifying assumptions about the platform dynamics. In this work, a new approach to near-time-optimal trajectory generation for quadrotors is presented. Leveraging deep reinforcement learning and relative gate observations, our approach can compute near-time-optimal trajectories and adapt the trajectory to environment changes. Our method exhibits computational advantages over approaches based on trajectory optimization for non-trivial track configurations. The proposed approach is evaluated on a set of race tracks in simulation and the real world, achieving speeds of up to 60 km/h with a physical quadrotor.
研究动机与目标
- 开发一种基于学习的方法,用于自主无人机竞速中的时间最优轨迹规划,使其在适应性和计算效率方面优于传统的基于优化的方法。
- 解决在不确定或变化的赛道布局下规划激进且动力学可行轨迹的挑战。
- 实现在无需重新训练的情况下,对多样化、随机生成的赛道实现在线重规划和泛化。
- 通过学习的安全裕度和减少碰撞,提升真实部署中的安全性和鲁棒性。
- 验证DRL策略在高速飞行条件下向物理四旋翼机成功迁移的能力。
提出的方法
- 使用深度强化学习训练策略,采用自定义的密集奖励函数,将其形状设计为三维路径进度代理,以最小化圈速时间。
- 状态观测被编码为相对于无人机当前位姿的相对栅门位置(x, y, z),从而在不使用绝对坐标的情况下实现空间感知。
- 采用高度并行化的采样方案,加速在多样化赛道构型(包括随机栅门布局)下的策略训练。
- 引入安全奖励,以最小化穿越栅门时与栅门中心的距离,从而在不确定环境中提升鲁棒性并降低碰撞率。
- 通过模型预测控制器(MPC)部署策略,实现在物理四旋翼无人机上的实时轨迹跟踪。
- 该方法利用高容量神经网络策略,可在不同复杂度和栅门配置的赛道间实现有效泛化。
实验结果
研究问题
- RQ1深度强化学习能否为四旋翼机在无人机竞速中生成接近时间最优的轨迹,使其性能与最先进的轨迹优化方法相当或接近?
- RQ2在赛道不确定条件下,观测未来栅门的数量如何影响策略在圈速时间和碰撞率方面的表现?
- RQ3DRL策略在无需重新训练的情况下,能在多大程度上泛化到随机生成的赛道,并适应大规模赛道变化?
- RQ4在仿真和真实飞行中,引入安全奖励是否能提升穿越栅门时的碰撞鲁棒性和安全裕度?
- RQ5所学习的策略是否能成功迁移到物理四旋翼机上,实现在真实动态环境和跟踪误差下的高速、激进飞行?
主要发现
- 在AlphaPilot赛道上,DRL策略实现了8.14秒的标称圈速时间,非常接近轨迹优化得到的时间最优解。
- 在观测中使用两个未来栅门可实现性能与鲁棒性的最佳平衡,将1000条随机赛道上的平均圈速时间降低至8.32秒,碰撞率降低至2.5%。
- 安全奖励使成功穿越栅门的平均安全裕度从0.67 m(无奖励)提升至0.95 m(奖励为2.5 m),同时将碰撞率从2.5%降低至0.8%。
- 该策略能有效泛化到随机生成的赛道,在多样化布局下保持低碰撞率和一致的性能表现。
- 该方法实现了在物理四旋翼机上高达60 km/h的飞行速度,证明了尽管存在显著的跟踪误差,策略迁移依然成功。
- 该方法在适应动态环境方面优于基于优化的方法,为在线轨迹生成提供了一种可扩展且计算高效的替代方案。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。