[论文解读] Learning Unmanned Aerial Vehicle Control for Autonomous Target Following
该论文提出了一种分层深度强化学习方法,结合卷积神经网络策略与PID控制器,实现无人机自主目标跟踪的稳定、数据高效训练。通过学习高层参考指令而非低层电机动作,该方法在仿真到真实DJI四旋翼无人机之间实现了鲁棒的策略迁移,具备出色的泛化能力且极少发生灾难性失败。
While deep reinforcement learning (RL) methods have achieved unprecedented successes in a range of challenging problems, their applicability has been mainly limited to simulation or game domains due to the high sample complexity of the trial-and-error learning process. However, real-world robotic applications often need a data-efficient learning process with safety-critical constraints. In this paper, we consider the challenging problem of learning unmanned aerial vehicle (UAV) control for tracking a moving target. To acquire a strategy that combines perception and control, we represent the policy by a convolutional neural network. We develop a hierarchical approach that combines a model-free policy gradient method with a conventional feedback proportional-integral-derivative (PID) controller to enable stable learning without catastrophic failure. The neural network is trained by a combination of supervised learning from raw images and reinforcement learning from games of self-play. We show that the proposed approach can learn a target following policy in a simulator efficiently and the learned behavior can be successfully transferred to the DJI quadrotor platform for real-world UAV control.
研究动机与目标
- 解决模型无关深度强化学习在真实无人机控制中样本复杂度高和不稳定的挑战。
- 克服依赖人工调参控制器和专家标注数据的传统两阶段流水线的局限性。
- 实现感知与控制策略的端到端学习,使其在多样化环境中具备泛化能力。
- 通过将传统PID控制器与深度强化学习策略网络结合,实现稳定且安全的训练。
- 在物理DJI四旋翼无人机平台上成功演示所学策略从仿真到现实的迁移。
提出的方法
- 将控制策略表示为单一卷积神经网络(CNN),将原始图像观测映射为PID控制器的高层参考指令。
- 将训练分解为基于原始图像的监督预训练,随后通过自对弈强化学习游戏稳定策略优化。
- 采用分层控制架构,其中深度强化学习策略为固定PID控制器生成设定点,确保学习过程中的系统稳定性。
- 使用基于目标跟踪性能的标量奖励信号,通过策略梯度方法训练整个网络。
- 在仿真中利用领域随机化和自对弈策略提升对未见环境的鲁棒性与泛化能力。
- 通过ROS将训练好的策略部署在真实DJI Matrice 100四旋翼无人机上,使用地面GPU进行推理,并通过NUC实现实时命令映射。
实验结果
研究问题
- RQ1在仿真中,是否可以稳定训练一个深度强化学习策略用于无人机目标跟踪,而不会在探索过程中发生灾难性失败?
- RQ2在仿真中训练的策略在存在传感器噪声、控制延迟和软硬件差异的真实环境中,其泛化能力如何?
- RQ3将学习到的策略与传统PID控制器结合,在多大程度上提升了数据效率和训练稳定性?
- RQ4与独立的感知和控制模块相比,端到端训练感知-控制策略是否能实现更好的泛化能力?
- RQ5在未进行微调的情况下,直接将仿真中训练的策略迁移到真实无人机上时,其性能如何?
主要发现
- 所提出的分层方法在相同设置下实现了无灾难性失败的稳定训练,而标准模型无关强化学习则未能做到。
- 端到端训练的策略在仿真中持续将目标保持在目标状态的极小范围内超过5000个时间步,平均偏差低于归一化状态空间中的0.1。
- 该策略在具有不同背景和干扰物的未见场景中表现出良好泛化能力,显示出对视觉变化的中等鲁棒性。
- 在真实世界测试中,该策略成功跟随移动目标长达4000个时间步(约3分钟),尽管存在传感器噪声、IMU/GPS延迟和硬件差异。
- 与仿真相比,该策略在真实世界中仅出现轻微的控制精度下降,表明其具备强大的仿真到现实迁移能力。
- 即使在部分遮挡条件下,该方法也实现了有效的泛化,但当干扰物与目标视觉相似时性能略有下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。