Skip to main content
QUICK REVIEW

[论文解读] Obstacle Avoidance and Navigation Utilizing Reinforcement Learning with Reward Shaping

Daniel Zhang, Colleen P. Bailey|arXiv (Cornell University)|Mar 28, 2020
Reinforcement Learning in Robotics参考文献 13被引用 4
一句话总结

本论文提出了一种改进的深度确定性策略梯度(DDPG)和近端策略优化(PPO)算法,采用基于李雅普诺夫的奖励塑造技术,用于无人地面车辆(UGVs)的避障与导航。该方法通过引入基于稳定性的奖励项,加速了收敛并提升了性能,在Gazebo仿真环境中的Turtlebot 3 Burger®平台上,实现了更高的平均奖励和更快的收敛速度。

ABSTRACT

In this paper, we investigate the obstacle avoidance and navigation problem in the robotic control area. For solving such a problem, we propose revised Deep Deterministic Policy Gradient (DDPG) and Proximal Policy Optimization algorithms with an improved reward shaping technique. We compare the performances between the original DDPG and PPO with the revised version of both on simulations with a real mobile robot and demonstrate that the proposed algorithms achieve better results.

研究动机与目标

  • 解决无人地面车辆(UGVs)在复杂真实环境中的避障与导航挑战。
  • 克服传统SLAM方法在多样化环境中泛化能力差的局限性。
  • 提升强化学习(RL)在移动机器人连续控制任务中的样本效率与收敛速度。
  • 评估基于李雅普诺夫稳定性启发的奖励塑造技术在真实机器人平台上提升DDPG与PPO性能的有效性。

提出的方法

  • 基于李雅普诺夫稳定性理论设计奖励塑造技术,定义为 $ R^{lyap}(s_{t+1},a_{t+1}) = R(s_t,a_t) + \eta(\gamma R(s_{t+1},a_{t+1}) - R(s_t,a_t)) $,以引导策略学习。
  • 在DDPG中通过在评论家更新中使用塑造后的奖励,修改时序差分(TD)误差。
  • 将塑造后的奖励应用于PPO中的优势函数估计器,调整 $ \hat{A}_t $ 以整合基于李雅普诺夫的奖励信号。
  • 使用Gazebo-ROS-Turtlebot 3 Burger®仿真平台,对DDPG与PPO在有无奖励塑造的情况下进行训练与评估。
  • 两种算法均采用基于深度神经网络的演员-评论家框架,使用Adam优化器,学习率设为0.0003,批量大小为32。
  • 将状态表示为26维向量,包含24个激光雷达读数,动作空间为连续控制,用于调节线速度与角速度。

实验结果

研究问题

  • RQ1所提出的基于李雅普诺夫的奖励塑造技术是否提升了DDPG与PPO在UGV导航任务中的收敛速度与最终性能?
  • RQ2在有无奖励塑造的情况下,DDPG与PPO在避障任务中的稳定性、收敛速率与平均累积奖励表现如何比较?
  • RQ3奖励塑造的集成是否能在复杂、类真实机器人环境中实现更鲁棒且高效的策略?
  • RQ4奖励塑造技术在移动机器人连续控制强化学习中,能在多大程度上减少训练不稳定性并提升样本效率?

主要发现

  • PPO在收敛速度与最终性能上均优于DDPG,采用奖励塑造后,其平均累积奖励达到-323.59,显著高于DDPG的-477.06。
  • 奖励塑造显著提升了性能:DDPG的平均奖励从无塑造时的-710.56提升至-477.06,PPO则从-679.43提升至-323.59。
  • PPO在塑造后的最小奖励达到-155.06,表明严重惩罚的episode更少,反映出更一致的策略学习过程。
  • DDPG在塑造后达到的最大奖励为-177.65,显著优于基线最大值-360.87,表明策略鲁棒性更强。
  • 奖励塑造技术显著加快了收敛速度,表现为DDPG与PPO的平均奖励曲线更早实现稳定。
  • 由于基于李雅普诺夫稳定性的理论基础,所提方法保持了最优性与收敛性保证,确保了无偏的最优策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。