[论文解读] Rapidly Adaptable Legged Robots via Evolutionary Meta-Learning
本文提出了一种抗噪声的进化元学习框架,结合批量爬山法(BHC)与基于进化策略的元学习(ES-MAML),使足式机器人能够快速适应现实环境中动态变化的条件。该方法仅使用不到3分钟的真实世界数据即可实现稳健适应,在电池电量变化和地面湿滑等高噪声环境下的表现显著优于基于梯度的MAML方法。
Learning adaptable policies is crucial for robots to operate autonomously in our complex and quickly changing world. In this work, we present a new meta-learning method that allows robots to quickly adapt to changes in dynamics. In contrast to gradient-based meta-learning algorithms that rely on second-order gradient estimation, we introduce a more noise-tolerant Batch Hill-Climbing adaptation operator and combine it with meta-learning based on evolutionary strategies. Our method significantly improves adaptation to changes in dynamics in high noise settings, which are common in robotics applications. We validate our approach on a quadruped robot that learns to walk while subject to changes in dynamics. We observe that our method significantly outperforms prior gradient-based approaches, enabling the robot to adapt its policy to changes based on less than 3 minutes of real data.
研究动机与目标
- 解决在奖励信号不可靠的高噪声现实机器人环境中,基于梯度的方法因失败而难以实现快速策略适应的问题。
- 提升在硬件差异、传感器噪声和环境扰动导致的高随机性下元学习策略的鲁棒性。
- 开发一种非可微、数据高效的适应算子,其性能在现实世界噪声条件下优于标准平均法和基于梯度的方法。
- 在真实四足机器人(Minitaur)上验证该方法在电池电量骤降和附加负载等剧烈动力学变化下的表现。
- 证明结合BHC的进化元学习在分布外设置下,相比最先进PG-MAML方法,能够实现更快、更可靠的适应。
提出的方法
- 提出批量爬山法(BHC)作为非可微、抗噪声的适应算子,可并行评估多个扰动后的策略参数。
- 将BHC与基于进化策略的元学习(ES-MAML)结合,实现策略参数的元优化,以实现快速适应。
- 采用紧凑的线性策略,其在高噪声环境下更稳定,更适合实现确定性适应。
- 在适应过程中采用并行评估(P),以提高样本效率并降低奖励估计的方差。
- 在元训练期间对策略参数施加高斯扰动,并通过在扰动批次上最大化奖励来引导适应。
- 在模拟环境中引入更高噪声(观测噪声、随机力)以模拟现实世界的随机性。
实验结果
研究问题
- RQ1非可微、抗噪声的适应算子(如BHC)是否能在高噪声现实机器人适应中优于基于梯度的方法?
- RQ2将BHC集成到ES-MAML中,是否能在现实环境中实现比PG-MAML更快、更可靠的动态变化适应?
- RQ3在噪声环境中,BHC的性能与在多次滚动中对奖励进行平均的方法相比如何?
- RQ4仅在仿真中训练的策略是否能有效适应现实世界中的动力学变化,如低电量和附加负载?
- RQ5BHC算子中并行评估数(P)的增加是否能带来适应性能的提升?
主要发现
- 所提方法在少于3分钟的真实世界数据下即实现了显著的适应性能提升,在所有测试的真实世界场景中均优于PG-MAML。
- 在Minitaur机器人上,该方法成功适应了10V电压下降和500g负载,将行走性能从差劣状态提升至稳定状态。
- 批量爬山法(BHC)优于基于平均的爬山法,尤其当P > 5时,表现出更强的抗噪声能力和更高的适应增益。
- 在高度噪声的模拟环境(Minitaur-Noisy)中,BHC在保持高性能的同时显著降低了方差,即使最终性能与平均法相当。
- 在极端测试环境中,该方法有效实现了适应,性能达到与均匀测试(Uniform Test)相当的水平,而PG-MAML未能提升性能。
- 该方法在分布外动力学(如湿滑表面和大扰动)中表现出强大的泛化能力,而PG-MAML因噪声梯度估计失败而失效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。