Skip to main content
QUICK REVIEW

[论文解读] Sim-to-Real Strategy for Spatially Aware Robot Navigation in Uneven Outdoor Environments

Kasun Weerakoon, Adarsh Jagan Sathyamoorthy|arXiv (Cornell University)|May 18, 2022
Reinforcement Learning in Robotics被引用 4
一句话总结

该论文提出了一种基于预训练深度强化学习策略中间注意力特征的仿真到真实(sim-to-real)策略,用于在不平坦的户外地形中实现稳定的机器人导航。该方法利用IMU和高程梯度信息,结合动态窗口法(DWA)与自适应速度约束,使振动减少13.09%,平均速度降低19.33%,同时在真实户外环境中相比端到端DRL方法,成功率提升5%。

ABSTRACT

Deep Reinforcement Learning (DRL) is hugely successful due to the availability of realistic simulated environments. However, performance degradation during simulation to real-world transfer still remains a challenging problem for the policies trained in simulated environments. To close this sim-to-real gap, we present a novel hybrid architecture that utilizes an intermediate output from a fully trained attention DRL policy as a navigation cost map for outdoor navigation. Our attention DRL network incorporates a robot-centric elevation map, IMU data, the robot's pose, previous actions, and goal information as inputs to compute a navigation cost-map that highlights non-traversable regions. We compute least-cost waypoints on the cost map and utilize the Dynamic Window Approach (DWA) with velocity constraints on high cost regions to follow the waypoints in highly uneven outdoor environments. Our formulation generates dynamically feasible velocities along stable, traversable regions to reach the robot's goals. We observe an increase of 5% in terms of success rate, 13.09% of the decrease in average robot vibration, and a 19.33% reduction in average velocity compared to end-to-end DRL method and state-of-the-art methods in complex outdoor environments. We evaluate the benefits of our method using a Clearpath Husky robot in both simulated and real-world uneven environments.

研究动机与目标

  • 解决在复杂、不平坦的户外环境中,深度强化学习用于机器人导航时存在的仿真到真实差距问题。
  • 提升机器人在崎岖斜坡地形(如山地和岩石地)上导航时的稳定性,减少振动。
  • 通过将感知与控制解耦,实现在仿真和真实户外环境中的一致性能表现。
  • 开发一种混合架构,利用中间DRL特征生成地形感知的成本图,并进行速度约束的轨迹规划。
  • 通过从原始传感器输入(点云、IMU、位姿、目标点)中学习,最小化对启发式或人工标注地形特征的依赖。

提出的方法

  • 一种新颖的基于注意力的DRL网络,处理以机器人为中心的高程图、IMU数据、机器人位姿、先前动作和目标信息,生成突出不可通行区域的导航成本图。
  • 成本图用于计算最低成本的路径点,引导机器人沿稳定、可通行的路径行进,且高程梯度最小。
  • 动态窗口法(DWA)通过基于实时振动和姿态反馈的、惩罚高海拔或崎岖地形高速度的速度空间约束得到增强。
  • 在DRL训练过程中使用IMU和高程梯度奖励,以识别不稳定区域并鼓励安全导航行为。
  • 系统将感知(通过DRL实现)与控制(通过DWA实现)解耦,从而实现从仿真到真实部署的可迁移性。
  • 该方法使用将3D点云处理为2D以机器人为中心的高程图作为输入,实现在非结构化户外环境中的空间感知能力。

实验结果

研究问题

  • RQ1预训练DRL策略的中间特征是否能提升户外机器人导航中的仿真到真实迁移性能?
  • RQ2如何动态调整速度约束以减少在不平坦地形上的机器人振动并防止翻倒?
  • RQ3结合DRL感知与DWA控制的混合架构是否在真实户外导航中优于端到端DRL?
  • RQ4基于地形感知的速度控制在复杂户外环境中在多大程度上提升了稳定性和成功率?
  • RQ5该方法是否能在仿真和真实场景中保持相当的性能表现,尤其是在陡坡或崎岖表面上?

主要发现

  • 与端到端DRL相比,该方法在真实户外场景中成功率提高了5%,在场景2中达到89%的成功率,在场景3中达到78%的成功率。
  • 与端到端DRL相比,平均机器人振动降低了13.09%,在真实场景3中所有方法中振动最低(平均值为0.079)。
  • 与端到端DRL相比,平均导航速度降低了19.33%,在真实场景3中达到0.357 m/s,表明运动更加安全、可控。
  • 该方法在仿真和真实环境中的表现均保持高水平,而端到端DRL在真实环境中的迁移性能显著下降。
  • 由于采用了自适应速度约束,该方法生成的轨迹更加稳定,不易发生振荡或失稳,尤其在陡坡上表现更优。
  • 该方法生成的轨迹虽然更长,但更安全,相比DWA和TERP更优先考虑稳定性与低振动。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。