Skip to main content
QUICK REVIEW

[论文解读] DEP-RL: Embodied Exploration for Reinforcement Learning in Overactuated and Musculoskeletal Systems

Pierre Schumacher, Daniel Häufle|arXiv (Cornell University)|May 30, 2022
Muscle activation and electromyography studies被引用 6
一句话总结

DEP-RL 通过整合微分外部可塑性(DEP)来生成相关联的、具身体验感知的运动噪声,提出了一种新型强化学习探索策略,适用于过度驱动的肌肉骨骼系统。该方法在高维肌肉控制空间中实现了复杂抓握与运动任务的快速、样本高效学习,在包含最多120块肌肉的任务中,其样本效率和鲁棒性优于以往方法。

ABSTRACT

Muscle-actuated organisms are capable of learning an unparalleled diversity of dexterous movements despite their vast amount of muscles. Reinforcement learning (RL) on large musculoskeletal models, however, has not been able to show similar performance. We conjecture that ineffective exploration in large overactuated action spaces is a key problem. This is supported by the finding that common exploration noise strategies are inadequate in synthetic examples of overactuated systems. We identify differential extrinsic plasticity (DEP), a method from the domain of self-organization, as being able to induce state-space covering exploration within seconds of interaction. By integrating DEP into RL, we achieve fast learning of reaching and locomotion in musculoskeletal systems, outperforming current approaches in all considered tasks in sample efficiency and robustness.

研究动机与目标

  • 解决在高维、过度驱动的肌肉骨骼系统中,标准噪声策略失效时的无效探索挑战。
  • 探究相关联的探索噪声(尤其是 DEP)是否能在冗余运动系统中有效覆盖状态空间。
  • 开发一种方法,实现在肌肉刺激水平上的样本高效、鲁棒的强化学习控制,而无需简化动作空间或使用专家示范。
  • 展示该方法在具有不同自由度和肌肉数量的多样化运动与抓握任务中的泛化能力。
  • 在运动任务中验证该方法在分布外扰动下的鲁棒性。

提出的方法

  • 将微分外部可塑性(DEP)——一种自组织控制规则——集成到强化学习训练循环中,以生成时间相关、与状态相关的运动噪声。
  • 采用一种 DEP 规则,基于过去与当前传感器速度之间的相关性计算动作调制:$ C_{t} = \tanh(\kappa \dot{s}_{t} \dot{s}_{t-\Delta t}) $,其中 $ \Delta t $ 为时间延迟,$ \kappa $ 为增益。
  • 在每个回合内交替使用强化学习策略与 DEP 控制器,通过切换概率 $ p_{\text{switch}} $ 平衡探索与利用。
  • 仅使用极少先验知识——仅使用将控制信号映射到肌肉长度的身份矩阵——避免手工设计的相关性矩阵或结构先验。
  • 直接在模拟肌肉骨骼模型的肌肉刺激水平上应用该方法,包括一个50块肌肉的人类手臂和一个120块肌肉的鸵鸟模型。
  • 使用标准强化学习算法(如 MPO),并将 DEP 作为探索机制集成其中,无需奖励塑形或课程学习。

实验结果

研究问题

  • RQ1在标准噪声失效的过度驱动肌肉骨骼系统中,相关联的探索噪声(如 DEP)是否能有效覆盖状态空间?
  • RQ2与常见探索策略(如 $\epsilon$-greedy、不相关高斯噪声)相比,DEP 在样本效率和鲁棒性方面表现如何?
  • RQ3将 DEP 集成到强化学习中是否能提升在高维肌肉空间中复杂任务(如抓握与运动)的学习性能?
  • RQ4DEP-RL 方法对超参数(如切换概率 $ p_{\text{switch}} $)的敏感度如何,特别是在跑步等不稳定任务中?
  • RQ5DEP-RL 是否能在无需奖励塑形、专家示范或动作空间简化的前提下实现最先进性能?

主要发现

  • 在120块肌肉的模拟鸵鸟运动任务中,DEP-RL 达到了迄今为止测量到的最高速度,且无需奖励塑形或课程学习。
  • 该方法成功在肌肉刺激水平上实现了对具有50块独立可调节肌肉的7自由度人类手臂模型的鲁棒控制——此前在强化学习中尚未解决。
  • 在所有评估任务(包括抓握与运动)中,DEP-RL 在样本效率和鲁棒性方面均优于基线强化学习方法。
  • 在三种运动任务中,该方法在分布外扰动下表现出更优的鲁棒性,即使在代理受到扰动时性能依然稳定。
  • 实证结果表明,DEP 在 $ \Delta t $ 值范围(5–28)内均有效,表明其对多样化系统动态具有泛化能力。
  • 消融研究证实,在稳定任务(如 humanreacher)中,性能对 $ p_{\text{switch}} $ 的敏感度较低;但在不稳定任务(如 ostrich-run)中,性能对 $ p_{\text{switch}} $ 更为敏感,高频 DEP 会导致频繁跌倒。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。