[论文解读] Using Soft Actor-Critic for Low-Level UAV Control
本文提出在模拟四旋翼机的去目标任务中使用软 actor-critic(SAC)算法进行低层控制。SAC 实现了样本高效的、鲁棒的策略学习,无需事先了解无人机的动力学特性,在极端初始条件下实现了 100% 的成功率,并在鲁棒性方面优于 PPO 等在线策略方法和模仿学习方法。
Unmanned Aerial Vehicles (UAVs), or drones, have recently been used in several civil application domains from organ delivery to remote locations to wireless network coverage. These platforms, however, are naturally unstable systems for which many different control approaches have been proposed. Generally based on classic and modern control, these algorithms require knowledge of the robot's dynamics. However, recently, model-free reinforcement learning has been successfully used for controlling drones without any prior knowledge of the robot model. In this work, we present a framework to train the Soft Actor-Critic (SAC) algorithm to low-level control of a quadrotor in a go-to-target task. All experiments were conducted under simulation. With the experiments, we show that SAC can not only learn a robust policy, but it can also cope with unseen scenarios. Videos from the simulations are available in https://www.youtube.com/watch?v=9z8vGs0Ri5g and the code in https://github.com/larocs/SAC_uav.
研究动机与目标
- 开发一种基于软 actor-critic(SAC)的无模型强化学习框架,用于四旋翼机的低层控制。
- 评估 SAC 在无需事先了解无人机动力学特性的情况下,学习鲁棒策略以应对未见场景的能力。
- 将 SAC 的性能和样本效率与使用在线策略方法(如 PPO)和模仿学习(GAIL)的先前工作进行比较。
- 在模拟中评估所学策略在极端初始位姿条件下的鲁棒性。
- 证明 SAC 能够在不同目标速度的动态目标跟踪任务中有效控制无人机。
提出的方法
- 作者在自定义的强化学习框架中实现 SAC,使用 CoppeliaSim(前身为 V-REP)进行四旋翼机动态的高保真模拟。
- 状态空间包括位置、速度和姿态;动作空间通过控制旋翼转速来产生推力和扭矩。
- 设计了密集奖励、稀疏奖励和塑形奖励函数,以鼓励快速到达目标,同时最小化偏离和能量消耗。
- SAC 算法采用离策略、最大熵强化学习方法,结合随机策略,提升了探索能力和鲁棒性。
- 策略通过 100 万时间步进行训练,与以往工作相比,显著降低了样本复杂度(以往工作需数十亿或数百万时间步)。
- 通过 216 次实验评估鲁棒性,初始位姿分布极端,包括高滚转和俯仰角度。
实验结果
研究问题
- RQ1SAC 是否能在不了解系统动力学特性的情况下,学习到四旋翼机在去目标任务中的鲁棒低层控制策略?
- RQ2与 PPO 和 DDPG 等先前的无模型深度强化学习方法相比,SAC 的样本效率如何?
- RQ3SAC 训练的策略在未见初始条件和动态目标轨迹下的泛化能力有多强?
- RQ4与 PPO 和模仿学习(GAIL)等在线策略方法相比,SAC 的最大熵探索策略在提升鲁棒性方面有何优势?
- RQ5SAC 是否能有效控制无人机在不同目标速度的动态目标跟踪任务中?
主要发现
- SAC 在 216 次极端初始条件测试中实现了 100% 的成功率,中位数奖励为 886.13,平均奖励为 886.81。
- 策略成功跟踪了不同速度的移动目标,包括正弦和方波轨迹,稳态误差极小。
- 在相同极端初始条件下,SAC 的鲁棒性优于 PPO(93.98% 成功率)和 GAIL(54.1% 成功率)。
- 该方法仅需约 100 万时间步即可收敛,与以往工作相比,显著降低了样本复杂度(以往工作需数十亿或 800 万时间步)。
- 在快速移动目标场景中,由于其最短路径驱动策略,策略表现出阻尼响应,但保持了稳定飞行且未发生坠毁。
- 结果证实,SAC 的最大熵探索策略能够更有效地实现不稳定、高维控制任务中的鲁棒策略学习。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。