Skip to main content
QUICK REVIEW

[论文解读] Deep Reinforcement Learning-based UAV Navigation and Control: A Soft Actor-Critic with Hindsight Experience Replay Approach

Myoung‐Hoon Lee, Jun Moon|arXiv (Cornell University)|Jun 2, 2021
Reinforcement Learning in Robotics参考文献 27被引用 5
一句话总结

该论文提出SACHER,一种新颖的深度强化学习算法,通过结合软演员评论家(SAC)与事后经验回放(HER),提升了无人机(UAV)导航中的样本效率与学习最优性。通过让智能体利用事后目标从失败轨迹中学习,SACHER在复杂障碍物环境中实现了比SAC和DDPG更快的收敛速度与显著更高的成功率达到目标的比率,2000个episode中成功路径达568条。

ABSTRACT

In this paper, we propose SACHER (soft actor-critic (SAC) with hindsight experience replay (HER)), which constitutes a class of deep reinforcement learning (DRL) algorithms. SAC is known as an off-policy model-free DRL algorithm based on the maximum entropy framework, which outperforms earlier DRL algorithms in terms of exploration, robustness and learning performance. However, in SAC, maximizing the entropy-augmented objective may degrade the optimality of learning outcomes. HER is known as a sample-efficient replay method that enhances the performance of off-policy DRL algorithms by allowing the agent to learn from both failures and successes. We apply HER to SAC and propose SACHER to improve the learning performance of SAC. More precisely, SACHER achieves the desired optimal outcomes faster and more accurately than SAC, since HER improves the sample efficiency of SAC. We apply SACHER to the navigation and control problem of unmanned aerial vehicles (UAVs), where SACHER generates the optimal navigation path of the UAV under various obstacles in operation. Specifically, we show the effectiveness of SACHER in terms of the tracking error and cumulative reward in UAV operation by comparing them with those of state-of-the-art DRL algorithms, SAC and DDPG. Note that SACHER in UAV navigation and control problems can be applied to arbitrary models of UAVs.

研究动机与目标

  • 解决尽管探索充分且鲁棒性高,SAC在到达目标位置时仍存在次优学习性能的问题。
  • 通过利用事后经验回放(HER)提升深度强化学习在无人机控制中的样本效率。
  • 在无需精确无人机模型或环境知识的前提下,实现在复杂障碍物环境中的可靠、最优的无人机路径规划。
  • 通过与SAC稳定且最大化熵的框架集成,克服DDPG在连续控制任务中出现的不稳定性和收敛性差的问题。
  • 验证SACHER在不同环境条件下生成精确、稳定导航路径的有效性。

提出的方法

  • SACHER将软演员评论家(SAC)与事后经验回放(HER)相结合,修改经验回放缓冲区以同时存储初始目标与状态-动作-奖励转移数据。
  • 训练过程中,SACHER从每个episode中访问的状态中采样额外目标,将失败轨迹重新评估为新目标下的成功轨迹。
  • 该算法使用稀疏二元奖励函数,但通过为失败转移分配有意义的事后奖励,提升策略优化效果。
  • SACHER保持SAC的最大熵目标以确保探索性,同时利用HER提升最终策略的最优性与收敛速度。
  • 该方法采用SAC的离策略学习与经验回放缓冲区,但将其扩展为包含目标条件的经验回放,以提升数据复用效率。
  • 目标条件的经验回放机制使智能体能够从成功与失败的episode中同时学习,显著提升数据效率。

实验结果

研究问题

  • RQ1HER是否能改善SAC在连续控制任务中的最优性,即使熵最大化可能导致最终性能下降?
  • RQ2在障碍物环境下的无人机导航中,SACHER相较于SAC与DDPG在样本效率与成功率方面表现如何?
  • RQ3SACHER是否能在无需针对特定无人机模型或环境配置进行调优的情况下,泛化至不同无人机模型与环境配置?
  • RQ4将HER集成到SAC中是否能缓解基于DDPG的HER方法中观察到的不稳定性问题?
  • RQ5事后学习在复杂无人机导航任务中能在多大程度上加速收敛并提升最终路径精度?

主要发现

  • 在16个障碍物的环境中,SACHER在2000个episode中实现了568条成功导航路径,而SAC仅实现33条,DDPG仅13条。
  • SACHER的累积奖励稳定在约-31,表明学习后性能可靠且一致。
  • 由SACHER控制的六旋翼无人机成功抵达着陆区域并避开了障碍物,而由SAC或DDPG控制的无人机未能实现。
  • SACHER生成的最优路径与实际无人机轨迹之间的跟踪误差可忽略不计,表明路径跟踪精度极高。
  • 即使在学习初期累积奖励较低,SACHER仍保持了平滑且稳定的无人机轨迹。
  • 该算法在环境设置变化下表现出良好泛化能力,包括更高速度(v₁=8)与更多障碍物(N=16),并维持了高成功率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。