[论文解读] Learning Fast Adaptation with Meta Strategy Optimization
本文提出元策略优化(MSO),一种元学习算法,通过使用潜在变量输入训练策略,实现在仅15次真实环境试运行的情况下,快速适应新型环境(如斜坡或电机性能下降)的场景。通过在训练和推理过程中均暴露相同的适应过程(策略优化),MSO 学习到一个鲁棒的潜在空间,从而实现样本高效、高性能的适应,其在仿真和真实四足机器人实验中均优于领域随机化和基线元强化学习方法。
The ability to walk in new scenarios is a key milestone on the path toward real-world applications of legged robots. In this work, we introduce Meta Strategy Optimization, a meta-learning algorithm for training policies with latent variable inputs that can quickly adapt to new scenarios with a handful of trials in the target environment. The key idea behind MSO is to expose the same adaptation process, Strategy Optimization (SO), to both the training and testing phases. This allows MSO to effectively learn locomotion skills as well as a latent space that is suitable for fast adaptation. We evaluate our method on a real quadruped robot and demonstrate successful adaptation in various scenarios, including sim-to-real transfer, walking with a weakened motor, or climbing up a slope. Furthermore, we quantitatively analyze the generalization capability of the trained policy in simulated environments. Both real and simulated experiments show that our method outperforms previous methods in adaptation to novel tasks.
研究动机与目标
- 解决在动力学或奖励函数与训练阶段不同的新环境中部署腿部机器人策略的挑战。
- 提升真实环境中适应的样本效率,最小化成功策略迁移所需的真实环境试运行次数。
- 开发一种元学习框架,学习一个适合在推理阶段实现快速、在线策略适应的潜在策略空间。
- 实现对复杂控制任务(如爬坡或电机受损状态下的行走)的稳健仿真到现实迁移和适应。
- 证明在训练和测试阶段均暴露相同的适应机制,可带来更优的泛化能力和适应性能。
提出的方法
- MSO 训练一个由低维潜在代码调制的策略,其中潜在代码在元训练和真实环境适应过程中均通过策略优化(SO)进行优化。
- 在元训练阶段,算法使策略暴露于一系列环境分布中,并通过每个任务多轮试运行的 SO 优化潜在空间,以支持快速适应。
- 在推理阶段,潜在代码通过仅15轮试运行的基于采样的优化(SO)直接在真实机器人上进行适应,实现快速收敛至新行为。
- 该方法使用一个显式训练为适合快速适应的潜在空间,从而在不同动力学和奖励函数下提升泛化能力。
- 该算法对超参数选择具有鲁棒性,消融研究显示在不同试运行次数、潜在维度和 SO 频率设置下性能均保持稳定。
- MSO 在仿真和真实四足机器人上均进行了评估,使用真实机器人(Minitaur)和仿真 Hopper 环境来验证性能。
实验结果
研究问题
- RQ1元强化学习方法是否能在真实腿部机器人控制中,仅用极少的真实环境试运行,实现对新型动力学和奖励函数的快速适应?
- RQ2在训练和测试阶段均暴露相同的适应过程(SO)如何提升策略适应的泛化能力和样本效率?
- RQ3MSO 在仿真到现实迁移和新型任务适应方面,相较于领域随机化和基于梯度的元强化学习方法(如 MAML)的性能优势有多大?
- RQ4MSO 对超参数(如适应试运行次数、潜在维度和 SO 频率)的敏感程度如何?
- RQ5MSO 是否能在仿真和真实硬件上成功适应复杂任务,如爬坡、电机性能减弱和负重携带?
主要发现
- MSO 仅使用15次试运行(75秒数据),即在真实四足机器人上成功实现了对新型任务(如爬坡和电机性能减弱)的适应。
- 在仿真环境中,MSO 在泛化到未见动力学和奖励方面优于领域随机化和投影通用策略基线。
- 在 Hopper 任务中,MSO 在训练和泛化性能方面显著优于 MAML 和 NoRML,尤其在动力学范围扩展时表现更优。
- 即使在训练阶段仅允许一次 SO 试运行,MSO 仍优于领域随机化,表明潜在空间学习对适应具有显著价值。
- 消融研究显示,MSO 对超参数变化具有鲁棒性,在不同试运行次数、潜在维度和 SO 频率设置下性能下降极小。
- MSO 有效稳定了机器人负重携带行为,防止跌倒,而基线方法在类似条件下无法维持稳定性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。