Skip to main content
QUICK REVIEW

[论文解读] Resilient Legged Local Navigation: Learning to Traverse with Compromised Perception End-to-End

Jin Jin, Chong Zhang|arXiv (Cornell University)|Oct 5, 2023
Robotic Locomotion and Control被引用 1
一句话总结

本文提出一种用于足式机器人的端到端强化学习(RL)策略,可在感知能力受损(如障碍物或深坑不可见)的情况下实现稳健的局部导航。通过将运动系统中的本体感觉和外部感觉反馈整合到导航策略中,该方法能够学习检测并响应感知故障(如碰撞或踏空),而无需依赖启发式异常检测,其在感知故障场景下的成功率比经典规划器高出30%。

ABSTRACT

Autonomous robots must navigate reliably in unknown environments even under compromised exteroceptive perception, or perception failures. Such failures often occur when harsh environments lead to degraded sensing, or when the perception algorithm misinterprets the scene due to limited generalization. In this paper, we model perception failures as invisible obstacles and pits, and train a reinforcement learning (RL) based local navigation policy to guide our legged robot. Unlike previous works relying on heuristics and anomaly detection to update navigational information, we train our navigation policy to reconstruct the environment information in the latent space from corrupted perception and react to perception failures end-to-end. To this end, we incorporate both proprioception and exteroception into our policy inputs, thereby enabling the policy to sense collisions on different body parts and pits, prompting corresponding reactions. We validate our approach in simulation and on the real quadruped robot ANYmal running in real-time (<10 ms CPU inference). In a quantitative comparison with existing heuristic-based locally reactive planners, our policy increases the success rate over 30% when facing perception failures. Project Page: https://bit.ly/45NBTuh.

研究动机与目标

  • 开发一种在外部感知失效(如存在不可见障碍物或深坑)时仍保持鲁棒性的导航策略。
  • 消除对基于启发式的异常检测与重规划来恢复感知故障的依赖。
  • 实现实时、端到端的导航策略学习,能够根据机器人运动过程中获得的物理反馈进行响应。
  • 在仿真环境和ANYmal四足机器人的真实部署中验证该方法。
  • 证明即使完全无法感知障碍物,足式机器人也能仅依靠身体反馈成功导航。

提出的方法

  • 训练一种非对称的演员-评论家深度强化学习策略,以受损的外部感知和本体感觉反馈为输入,生成速度指令。
  • 将运动层级的外部感知(如足部接触力)和本体感觉(如关节角度、底盘IMU)作为关键观测,用于检测碰撞和踏空。
  • 采用带记忆的演员网络,从部分或受损的传感器输入中推断环境状态,提升对感知故障的鲁棒性。
  • 使用具备访问特权信息(如完美地图、外部受力)的评论家网络指导训练并稳定学习过程。
  • 设计一种可调节感知故障率(如0%、50%、100%障碍物/深坑可见性)的定制仿真环境,用于策略的训练与评估。
  • 引入正则化技术,以在潜在空间中隐式推断真实环境状态,防止策略收敛至次优解。

实验结果

研究问题

  • RQ1端到端强化学习策略是否能在感知失效(如障碍物或深坑不可见)时仍有效导航?
  • RQ2来自运动系统的本体感觉与外部感觉如何共同促进感知故障的检测与恢复?
  • RQ3与基线方法相比,引入记忆机制与潜在状态推断是否能提升对感知退化情况的鲁棒性?
  • RQ4该策略是否能在真实世界导航中实现全感知失效(如完全失明)下的泛化能力?
  • RQ5在不同感知退化程度下,该策略与基于启发式的规划器相比在定量指标上表现如何?

主要发现

  • 所提出的RL策略在感知故障场景下的成功率比经典启发式规划器高出30%以上,0%可见性深坑场景下的成功率达到93.0%。
  • 在50%可见性的障碍物场景中,该策略成功率达92.0%,而基线规划器仅为54.0%,p值 < 0.001。
  • 仅依赖本体感觉即可提升鲁棒性,将0%可见性障碍物场景下的底盘碰撞次数从48.3次降至4.6次。
  • 运动层级的外部感知显著改善了深坑检测,将0%可见性深坑场景下的平均耗时从22.5秒降至12.3秒。
  • 隐式状态推断的正则化至关重要——若无此正则化,性能显著下降,尤其在高感知退化条件下。
  • 该策略在真实环境中成功实现完全失明下的导航,能响应底盘、大腿和腿部的碰撞,并通过侧向速度指令从不可见深坑中恢复。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。