[论文解读] Combining Learning-based Locomotion Policy with Model-based Manipulation for Legged Mobile Manipulators
本文提出了一种混合控制框架,将基于学习的运动策略与基于模型的抓取控制相结合,用于腿式移动操作机器人。通过训练基底策略以利用MPC生成的预测来预判未来的外部合力,系统在崎岖地形上实现了鲁棒的运动,同时实现了无需微调即可适应新操作臂配置的零样本迁移。
Deep reinforcement learning produces robust locomotion policies for legged robots over challenging terrains. To date, few studies have leveraged model-based methods to combine these locomotion skills with the precise control of manipulators. Here, we incorporate external dynamics plans into learning-based locomotion policies for mobile manipulation. We train the base policy by applying a random wrench sequence on the robot base in simulation and adding the noisified wrench sequence prediction to the policy observations. The policy then learns to counteract the partially-known future disturbance. The random wrench sequences are replaced with the wrench prediction generated with the dynamics plans from model predictive control to enable deployment. We show zero-shot adaptation for manipulators unseen during training. On the hardware, we demonstrate stable locomotion of legged robots with the prediction of the external wrench.
研究动机与目标
- 解决在具有高维动力学特性的非结构化、接触密集型环境中对腿式移动操作机器人进行控制的挑战。
- 克服纯基于模型方法(在复杂地形中计算成本高)和纯基于学习方法(在不同机器人构型间泛化能力差)的局限性。
- 通过将未来合力预测纳入策略观测空间,实现对外部干扰的鲁棒运动控制。
- 通过解耦控制设计,实现无需微调即可将运动策略零样本适应于新的操作臂配置。
提出的方法
- 使用深度强化学习(PPO)策略,通过观测由模型预测控制(MPC)生成的未来0.0–0.8秒的合力预测序列,来抵消外部合力。
- 在仿真训练期间使用随机合力序列,使策略暴露于多样化干扰,提升鲁棒性。
- 通过仅将合力预测作为条件,而非机械臂状态或任务特定动作,实现基底运动策略与机械臂构型的解耦。
- 在硬件上部署系统时,使用MPC实现精确的机械臂控制,同时生成供运动策略使用的合力预测。
- 在部署过程中,将实时合力观测替换为MPC预测的合力序列,以实现主动干扰抑制。
- 使用本体感知历史和归一化器,稳定观测输入,提升策略泛化能力。
实验结果
研究问题
- RQ1基于学习的运动策略是否能从基于模型的操作控制器生成的未来合力预测中获益?
- RQ2将预测的合力序列引入是否能提升在崎岖地形上运动时的干扰抑制能力和稳定性?
- RQ3单一运动策略是否能在不重新训练的情况下泛化到多种机械臂构型?
- RQ4使用预测合力与通过本体感知解码的合力相比,策略性能如何?
- RQ5合力观测的预测时域对在动态干扰下维持策略性能有多关键?
主要发现
- 将MPC生成的合力预测作为观测输入,显著提升了基底策略的干扰抑制能力,与使用5 rad/s频率下解码合力相比,平均角速度误差降低了38%。
- 在动态操作(5 rad/s)下,策略实现了平均4.1秒的稳定运动,而使用解码合力时仅能维持1.9秒。
- 在硬件上成功演示了对新机械臂构型(如3 kg末端执行器)的零样本适应,无需重新训练,验证了策略的泛化能力。
- 遮挡实验表明,策略最依赖于近期的合力预测(0.0–0.2 s ahead),而0.8 s的预测在平均意义上最具信息量。
- 在训练中未观测到的干扰(如1 kg载荷)下,策略表现出显著更低的基底角速度误差(稳定性提升),在动力学不匹配下表现更优。
- 该系统首次实现了在崎岖地形上基于硬件的腿式移动操作机器人实时预测控制部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。