Skip to main content
QUICK REVIEW

[论文解读] REvolveR: Continuous Evolutionary Models for Robot-to-robot Policy Transfer

Xingyu Liu, Deepak Pathak|arXiv (Cornell University)|Feb 10, 2022
Reinforcement Learning in Robotics被引用 4
一句话总结

REvolveR 通过在物理模拟器中逐步演化源机器人到目标机器人的机器人形态和运动学特性,提出了一种用于机器人间策略迁移的连续演化模型。通过在中间、平滑变换的机器人上训练策略,该方法实现了更高的样本效率,并在模仿学习失败的稀疏奖励设置中取得成功。

ABSTRACT

A popular paradigm in robotic learning is to train a policy from scratch for every new robot. This is not only inefficient but also often impractical for complex robots. In this work, we consider the problem of transferring a policy across two different robots with significantly different parameters such as kinematics and morphology. Existing approaches that train a new policy by matching the action or state transition distribution, including imitation learning methods, fail due to optimal action and/or state distribution being mismatched in different robots. In this paper, we propose a novel method named $REvolveR$ of using continuous evolutionary models for robotic policy transfer implemented in a physics simulator. We interpolate between the source robot and the target robot by finding a continuous evolutionary change of robot parameters. An expert policy on the source robot is transferred through training on a sequence of intermediate robots that gradually evolve into the target robot. Experiments on a physics simulator show that the proposed continuous evolutionary model can effectively transfer the policy across robots and achieve superior sample efficiency on new robots. The proposed method is especially advantageous in sparse reward settings where exploration can be significantly reduced. Code is released at https://github.com/xingyul/revolver.

研究动机与目标

  • 解决在形态和动力学特性显著不同的机器人之间迁移策略的挑战,传统模仿学习因最优动作/状态分布不匹配而失效。
  • 克服为每个新机器人从头重新训练策略的低效性和不切实际性,尤其是在复杂或高维环境中。
  • 在探索困难且成功信号稀少的稀疏奖励环境中实现有效的策略迁移。
  • 开发一个可扩展的框架,将困难的跨机器人迁移问题分解为一系列更简单、渐进的策略微调任务。
  • 通过引入新型组件(如局部随机演化和演化奖励设计)提升训练稳定性和样本效率。

提出的方法

  • 定义一种连续演化模型,通过在物理模拟器中平滑地改变腿长、质量、手指配置等参数,在源机器人和目标机器人之间进行插值。
  • 在一系列逐渐向目标机器人演化的中间机器人上训练策略,实现对动态变化的渐进适应。
  • 实施一种局部随机演化策略,即在每个训练周期内从演化参数的小范围内随机采样一组机器人,以提升鲁棒性和泛化能力。
  • 引入演化奖励设计,为在更进化机器人上的过渡分配更高奖励,以促进更快收敛至目标机器人。
  • 采用可微分插值方案,将机器人参数表示在连续空间中,实现平滑过渡并支持基于梯度的优化。
  • 与标准强化学习算法(如 NPG、SAC)集成,并应用自适应训练调度以增强样本效率。

实验结果

研究问题

  • RQ1能否通过连续演化框架,有效将源机器人上训练的策略迁移到形态和动力学特性显著不同的目标机器人上?
  • RQ2局部随机演化在策略迁移过程中对演化机器人训练的稳定性和鲁棒性有何提升作用?
  • RQ3演化奖励设计在多大程度上提升了策略迁移中的样本效率和收敛速度?
  • RQ4所提方法是否能在标准模仿学习和直接迁移失败的稀疏奖励环境中实现成功的策略迁移?
  • RQ5在样本效率和最终性能方面,连续演化模型相较于直接迁移和模仿学习基线方法表现如何?

主要发现

  • 在密集奖励和稀疏奖励设置下,REvolveR 均优于直接迁移和模仿学习基线方法,展现出更高的样本效率和更快的收敛速度。
  • 在稀疏奖励设置中,采用演化奖励设计(h=1.0)的 REvolveR 在 6,279.35 ± 290.33 次优化步骤内达到 90% 的成功率,显著优于未能学习的基线方法。
  • 采用局部随机演化降低了奖励的标准差,表明相比确定性演化,其训练鲁棒性有所提升。
  • 即使在稀疏奖励环境下,REvolveR 所需的优化步骤数也少于在密集奖励下训练的基线方法,证明其具有更优的样本效率。
  • 消融实验表明,局部随机演化和演化奖励设计均能独立提升性能,两者结合效果最佳。
  • 该方法成功实现了从五指机器人到双指夹爪在复杂操作任务(锤子、重定位、开门)中的策略迁移,而基于人类示范的方法则完全失败。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。