[论文解读] Riemannian Motion Policy Fusion through Learnable Lyapunov Function Reshaping
本文提出RMPfusion,作为RMPflow的可学习扩展,通过引入分层的、可学习的权重函数来重塑子任务李雅普诺夫函数,从而增强策略融合。通过实现自适应、与配置相关的策略混合,RMPfusion提高了对不完善子任务策略的鲁棒性,并保证了全局李雅普诺夫稳定性,使得在模仿学习设置中可通过反向传播实现安全且稳定的策略学习。
RMPflow is a recently proposed policy-fusion framework based on differential geometry. While RMPflow has demonstrated promising performance, it requires the user to provide sensible subtask policies as Riemannian motion policies (RMPs: a motion policy and an importance matrix function), which can be a difficult design problem in its own right. We propose RMPfusion, a variation of RMPflow, to address this issue. RMPfusion supplements RMPflow with weight functions that can hierarchically reshape the Lyapunov functions of the subtask RMPs according to the current configuration of the robot and environment. This extra flexibility can remedy imperfect subtask RMPs provided by the user, improving the combined policy's performance. These weight functions can be learned by back-propagation. Moreover, we prove that, under mild restrictions on the weight functions, RMPfusion always yields a globally Lyapunov-stable motion policy. This implies that we can treat RMPfusion as a structured policy class in policy optimization that is guaranteed to generate stable policies, even during the immature phase of learning. We demonstrate these properties of RMPfusion in imitation learning experiments both in simulation and on a real-world robot.
研究动机与目标
- 为了解决RMPflow中需要高质量、手动设计的子任务黎曼运动策略(RMPs)所带来的挑战,这限制了其实际可用性。
- 通过引入可学习的权重函数,实现子任务策略重要性的动态、与配置相关的自适应调整,从而提高策略融合的鲁棒性。
- 在权重函数满足温和约束的前提下,确保融合策略的全局李雅普诺夫稳定性,即使在学习初期阶段也成立。
- 通过将RMPfusion视为一种稳定策略类别,实现结构化策略学习并提供安全保证,适用于模仿学习与强化学习。
- 在仿真和真实机器人环境中验证该方法,证明其能够实现稳定且高性能的策略模仿。
提出的方法
- RMPfusion引入了乘法权重函数,根据机器人构型和环境状态,分层地重塑各个子任务RMP的李雅普诺夫函数。
- 这些权重函数被建模为可学习函数(例如神经网络),并在策略学习过程中通过反向传播进行优化。
- 融合策略通过加权贡献的方式组合子任务RMP,其中权重调节每个子任务李雅普诺夫函数的有效重要性。
- 该方法证明,只要权重函数非负且非退化,RMPfusion即可保持全局李雅普诺夫稳定性,从而保留RMPflow的稳定性保证。
- 该框架支持通过行为克隆的端到端训练,利用专家示范来监督权重函数的学习。
- 采用RMP-tree*结构来组织子任务和权重函数,实现模块化且可解释的策略设计。
实验结果
研究问题
- RQ1可学习的权重函数是否能提升RMPflow在子任务策略不完美或次优情况下的鲁棒性?
- RQ2在权重函数满足温和约束的前提下,RMPfusion是否在学习初期阶段仍能保持全局李雅普诺夫稳定性?
- RQ3RMPfusion是否能通过模仿学习有效训练,以匹配专家表现,同时确保安全与稳定性?
- RQ4与线性组合方法相比,通过权重函数对李雅普诺夫函数进行分层重塑,在策略性能与稳定性方面表现如何?
- RQ5鉴于其基于配置的加权机制,RMPfusion是否能在无需重新训练的情况下泛化到新环境和新任务?
主要发现
- RMPfusion在仿真环境和真实Franka机器人上均成功学习模仿专家行为,在所有指标上均达到接近专家的性能。
- 学习者的目标距离误差在1200次迭代后显著降低,性能在10秒内收敛至专家水平,且执行过程中未发生任何碰撞。
- 即使在初始化阶段(learner-0),策略仍保持稳定,李雅普诺夫函数单调递减,证实了在学习初期阶段的稳定性。
- 该方法在测试轨迹上表现出稳定性能,未出现超时或安全违规,证明了对环境变化的鲁棒性。
- 基于神经网络的权重函数使策略能够动态适应机器人构型和障碍物位置,提升了泛化能力。
- 理论上的稳定性保证在实践中成立,经验证李雅普诺夫函数在整个训练和执行过程中均保持单调递减。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。