[论文解读] End-to-End Motion Planning of Quadrotors Using Deep Reinforcement Learning
本文提出一种基于深度强化学习的四旋翼机端到端运动规划系统,直接将原始深度图像与相对位置映射为运动基元,在复杂环境中实现安全且目标导向的导航。该方法在无障碍物的真实飞行中实现100%成功率,在仿真中实现88%的目标到达准确率,证明了直接从感知到动作学习在自主四旋翼飞行中的可行性。
In this work, a novel, end-to-end motion planning method is proposed for quadrotor navigation in cluttered environments. The proposed method circumvents the explicit sensing-reconstructing-planning in contrast to conventional navigation algorithms. It uses raw depth images obtained from a front-facing camera and directly generates local motion plans in the form of smooth motion primitives that move a quadrotor to a goal by avoiding obstacles. Promising training and testing results are presented in both AirSim simulations and real flights with DJI F330 Quadrotor equipped with Intel RealSense D435. The proposed system in action can be found in https://youtu.be/pYvKhc8wrTM.
研究动机与目标
- 解决模块化、流水线式导航系统存在的误差传播及感知、重建与规划模块之间不兼容的问题。
- 开发一种统一的端到端运动规划系统,跳过显式的障碍物重建,直接将感官输入映射为控制动作。
- 仅使用前向摄像头的原始深度图像,在部分已知、杂乱环境中实现安全高效的导航。
- 在高保真AirSim仿真环境和搭载Intel RealSense D435的DJI F330四旋翼机的真实飞行中验证该方法。
提出的方法
- 系统使用一个参数量约为75,000的深度Q网络(DQN),将由32×32原始深度图像和3×1相对位置向量组成的状态映射为动作。
- 动作为由三次Bézier曲线定义的运动基元,共18种预设基元,旨在因前向摄像头视场有限而偏向前进运动。
- 使用深度神经网络近似动作价值函数,实现在高维状态-动作空间中的泛化能力。
- 奖励函数设计用于鼓励靠近目标路径,对偏离超过5m的行为施加惩罚,并对碰撞行为施以严重惩罚,同时基于进展(Δd)和到目标的距离(dt)提供中间奖励。
- DQN通过经验回放和目标网络进行训练,以稳定学习过程,超参数通过试错法调优。
- 系统在AirSim仿真和搭载PX4固件及RealSense D435深度传感的DJI F330四旋翼机的真实飞行中进行评估。
实验结果
研究问题
- RQ1端到端深度强化学习智能体能否仅使用原始深度图像和相对目标位置,在未知、杂乱环境中学习导航四旋翼机?
- RQ2在仿真与真实飞行中,该端到端强化学习规划器在成功率、安全性与导航效率方面的表现如何比较?
- RQ3该智能体在未经微调的情况下,对未见过的环境具有多大程度的泛化能力?
- RQ4噪声较大的真实世界深度观测与不完美的控制执行如何影响智能体实现安全且目标导向导航的能力?
- RQ5何种奖励函数设计策略能有效平衡部分已知环境中障碍物规避与高效路径跟踪的学习?
主要发现
- 在AirSim仿真中,智能体在25次安全飞行中实现了88%的目标到达率,其中86%的试验未发生碰撞。
- 在无障碍物的真实飞行中,智能体在五次试验中100%成功到达目标,平均导航时间为20秒,平均距离为3.50米。
- 在包含两个大型矩形障碍物的真实飞行中,智能体实现了80%的安全飞行率,仅在第二次试验中发生一次坠毁,第三次试验中沿初始路径最大前进距离达1.55米。
- 在障碍物密集环境中,智能体表现出保守行为,常在避开首个障碍物后在开阔区域停止或悬停,表明其决策具有谨慎性。
- 该方法在未见环境中泛化能力良好,尽管RealSense D435存在噪声深度数据且真实世界控制执行存在不完美,仍表现出鲁棒性。
- 奖励函数设计成功平衡了向目标前进的进展与障碍物规避,体现在仿真与真实世界测试中均取得高成功率与高安全性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。