Skip to main content
QUICK REVIEW

[论文解读] DreamWaQ: Learning Robust Quadrupedal Locomotion With Implicit Terrain Imagination via Deep Reinforcement Learning

I Made Aswin Nahrendra, Byeongho Yu|arXiv (Cornell University)|Jan 25, 2023
Robotic Locomotion and Control被引用 7
一句话总结

DreamWaQ 提出了一种深度强化学习框架,使四足机器人仅通过本体感觉传感器即可学习到鲁棒的运动能力,方法通过隐式想象地形特性(如高度、摩擦力和障碍物)实现。该方法实现了零样本的仿真到现实的泛化,并在具有挑战性的自然和人工地形(包括山坡、台阶和泥泞斜坡)上实现了长达465米的持续户外导航,展现出在真实环境下的高耐久性和适应性。

ABSTRACT

Quadrupedal robots resemble the physical ability of legged animals to walk through unstructured terrains. However, designing a controller for quadrupedal robots poses a significant challenge due to their functional complexity and requires adaptation to various terrains. Recently, deep reinforcement learning, inspired by how legged animals learn to walk from their experiences, has been utilized to synthesize natural quadrupedal locomotion. However, state-of-the-art methods strongly depend on a complex and reliable sensing framework. Furthermore, prior works that rely only on proprioception have shown a limited demonstration for overcoming challenging terrains, especially for a long distance. This work proposes a novel quadrupedal locomotion learning framework that allows quadrupedal robots to walk through challenging terrains, even with limited sensing modalities. The proposed framework was validated in real-world outdoor environments with varying conditions within a single run for a long distance.

研究动机与目标

  • 解决四足机器人在传感模态有限的情况下,于非结构化和动态地形中导航的挑战。
  • 通过联合学习策略与环境上下文,克服仅依赖本体感觉进行地形估计时的表征学习瓶颈。
  • 开发一种鲁棒且可泛化的运动策略,使其在真实世界户外环境中有效运行,且不依赖外部传感器。
  • 在仅使用本体感觉的前提下,证明在多样化且具有挑战性的地形(如斜坡、台阶和可变形地面)上实现持续、长距离运动的能力。
  • 在紧凑的 Unitree A1 机器人上验证该框架,实现了前所未有的耐久性和适应性,适用于真实世界户外部署。

提出的方法

  • 提出一种非对称的演员-critic 架构,使策略仅通过本体感觉反馈即可隐式推断地形特性(如高度图、摩擦力、恢复系数)。
  • 引入一种上下文辅助估计网络(CENet),仅使用 IMU 和关节编码器数据,联合估计身体状态与环境上下文。
  • 在模拟环境中使用部分可观察的马尔可夫决策过程(POMDP)公式进行策略训练,其中智能体必须通过交互推断地形特性。
  • 实施一种自适应重采样方法(AdaBoot),通过根据不确定性动态调整探索策略,提升训练期间的鲁棒性。
  • 使用潜在空间表征隐式建模地形特性,避免显式进行地形分割或分类。
  • 通过在多样化模拟环境中训练策略,以模拟真实世界地形变化和扰动,实现零样本的仿真到现实迁移。

实验结果

研究问题

  • RQ1四足机器人能否仅依赖本体感觉传感器,而不使用摄像头或激光雷达等外部传感器,学习到鲁棒的运动能力?
  • RQ2深度强化学习策略如何仅通过本体感觉反馈,隐式推断复杂地形特性(如摩擦力、高度和障碍物存在性)?
  • RQ3在未进行微调或领域随机化的情况下,模拟环境中训练的策略在真实世界非结构化地形上的泛化能力有多强?
  • RQ4联合估计身体状态与环境上下文在提升策略鲁棒性和适应性方面起到何种作用?
  • RQ5像 Unitree A1 这样轻便紧凑的机器人,能否仅依赖本体感觉在多样化且具有挑战性的户外地形上实现长距离运动?

主要发现

  • DreamWaQ 使 Unitree A1 机器人成功完成了一条465米长的户外路径,穿越一座海拔上升22米的山坡,用时不足10分钟即抵达山顶。
  • 该机器人成功穿越了非结构化的自然地形,包括泥泞斜坡、台阶和茂密植被,并实时调整步态与关节功率。
  • 在潮湿条件下,尽管台阶湿滑且脚印深陷泥中,机器人仍保持稳定并持续行走,展现出对环境扰动的强适应能力。
  • 采用 CENet 的策略实现了精确的身体速度估计,并能快速响应脚部绊倒和打滑,实现即时步态恢复。
  • DreamWaQ 在鲁棒性方面优于基线方法,能承受更强的推力干扰,并在恶劣条件下实现更高的生存率。
  • AdaBoot 方法在不降低基础性能的前提下增强了策略鲁棒性,证实了其在不确定性感知训练中的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。