Skip to main content
QUICK REVIEW

[论文解读] Learning Arm-Assisted Fall Damage Reduction and Recovery for Legged Mobile Manipulators

Yuntao Ma, Farbod Farshidian|arXiv (Cornell University)|Jan 1, 2023
Robotic Locomotion and Control被引用 1
一句话总结

本文提出一种基于学习的非对称演员-评论家策略,使足式移动操作机器人能够通过主动使用手臂来减少跌倒损伤并实现自主恢复。该策略在具有时变奖励的仿真环境中训练,可在多样化初始跌倒构型下实现98.9%的恢复成功率,显著降低峰值基座冲量、关节内力和加速度,相较于基线控制器表现更优,并已在ALMA机器人上成功完成硬件部署。

ABSTRACT

Adaptive falling and recovery skills greatly extend the applicability of robot deployments. In the case of legged mobile manipulators, the robot arm could adaptively stop the fall and assist the recovery. Prior works on falling and recovery strategies for legged mobile manipulators usually rely on assumptions such as inelastic collisions and falling in defined directions to enable real-time computation. This paper presents a learning-based approach to reducing fall damage and recovery. An asymmetric actor-critic training structure is used to train a time-invariant policy with time-varying reward functions. In simulated experiments, the policy recovers from 98.9\% of initial falling configurations. It reduces base contact impulse, peak joint internal forces, and base acceleration during the fall compared to the baseline methods. The trained control policy is deployed and extensively tested on the ALMA robot hardware. A video summarizing the proposed method and the hardware tests is available at https://youtu.be/avwg2HqGi8s.

研究动机与目标

  • 解决足式移动操作机器人在跌倒过程中易受载荷和关节损伤的挑战。
  • 克服以往方法依赖于刚性碰撞、固定跌倒平面或高度敏捷肢体等限制性假设的局限性。
  • 开发一种鲁棒且可泛化的控制策略,利用机械臂主动减轻冲击力并辅助恢复,且无需依赖特权状态信息。
  • 实现在真实硬件上部署该策略,仅需极少调参,确保在多样化跌倒场景中保持一致且自适应的行为。

提出的方法

  • 采用基于策略的非对称演员-评论家强化学习框架,使用时不变策略和时变奖励函数,以平衡运动平滑性与恢复速度。
  • 设计一种仿真环境,随机化初始跌倒构型,并避免基座与地面接触,以聚焦于损伤减少与恢复动力学。
  • 使用非特权演员,仅访问本体感觉和状态观测,而评论家在训练期间使用完整状态信息,以提高样本效率。
  • 训练策略以最小化跌倒过程中的峰值基座冲量、峰值关节内力和基座加速度,同时在有限时间范围内最大化恢复成功率。
  • 应用课程学习与初始构型随机化,以提升策略的泛化能力与鲁棒性。
  • 直接将训练好的策略部署至硬件(ALMA机器人)而无需微调或重新训练,验证其在真实世界跌倒与恢复场景中的性能。

实验结果

研究问题

  • RQ1通过强化学习训练的单一、时不变控制策略是否能有效利用机械臂协助,减少足式移动操作机器人的跌倒损伤并实现恢复?
  • RQ2所提出的具有时变奖励的非对称演员-评论家方法相较于对称或时变版本,在恢复成功率与鲁棒性方面表现如何?
  • RQ3与基线应急控制器(如驱动锁止或阻尼)相比,跌倒过程中机械臂的使用在多大程度上降低了峰值冲击力与关节应力?
  • RQ4相同的训练流程是否可适配至其他任务(如自立起或过渡至静止姿态)?其在不同目标间的泛化能力如何?
  • RQ5该策略对奖励缩放和任务表述变化的鲁棒性如何?在不同奖励权重下是否保持一致的行为?

主要发现

  • 所提出的策略在仿真中对1,000种随机初始跌倒构型实现了98.9%的恢复成功率。
  • 相较于基线应急控制器(驱动锁止或阻尼),该策略将峰值基座冲量减少最多45%,峰值关节内力减少最多30%,基座加速度减少最多40%。
  • 采用非对称演员-评论家训练的时不变策略相比对称或时变版本展现出更优的鲁棒性与一致性,恢复曲线更为均匀。
  • 在ALMA机器人上的硬件部署验证了该策略在真实跌倒与恢复场景中的有效性,可观测到机械臂辅助的冲击缓解与稳定恢复行为。
  • 该策略对奖励缩放表现出鲁棒性:将任务奖励提高三倍并未改变恢复曲线,表明其在奖励超参数变化下仍保持稳定。
  • 相同的训练流程成功生成了适用于其他任务的策略——无论从何种姿态落地后静止于地面,或从跌倒状态自立起,均已在硬件上验证,并展现出自然的接触序列适应能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。