[论文解读] Emergent Real-World Robotic Skills via Unsupervised Off-Policy Reinforcement Learning
本文提出 off-DADS,一种用于现实世界机器人无奖励技能发现的离策略、样本高效强化学习算法。通过利用互信息最大化来鼓励多样且与任务相关的行为,而无需奖励或示范,该方法使一台12自由度的四足机器人在20小时的真实世界训练中学习到多样的行走步态和朝向,所学技能可通过模型预测控制进行组合,以完成下游导航任务。
Reinforcement learning provides a general framework for learning robotic skills while minimizing engineering effort. However, most reinforcement learning algorithms assume that a well-designed reward function is provided, and learn a single behavior for that single reward function. Such reward functions can be difficult to design in practice. Can we instead develop efficient reinforcement learning methods that acquire diverse skills without any reward function, and then repurpose these skills for downstream tasks? In this paper, we demonstrate that a recently proposed unsupervised skill discovery algorithm can be extended into an efficient off-policy method, making it suitable for performing unsupervised reinforcement learning in the real world. Firstly, we show that our proposed algorithm provides substantial improvement in learning efficiency, making reward-free real-world training feasible. Secondly, we move beyond the simulation environments and evaluate the algorithm on real physical hardware. On quadrupeds, we observe that locomotion skills with diverse gaits and different orientations emerge without any rewards or demonstrations. We also demonstrate that the learned skills can be composed using model predictive control for goal-oriented navigation, without any additional training.
研究动机与目标
- 解决真实世界机器人无奖励强化学习中的样本效率低下问题。
- 在真实机器人上实现无奖励、自监督的技能发现,无需人工设计的奖励或示范。
- 开发一种离策略算法,以提高真实世界环境中无奖励技能学习的数据效率。
- 证明多样且有用的行走技能可从无奖励的交互中自然涌现,并可被重新用于下游任务。
- 通过克服空间有限和硬件磨损等实际约束,实现无奖励技能发现的真实世界部署。
提出的方法
- 将DADS算法扩展为一种离策略变体off-DADS,采用基于动力学和互信息的目标,以促进技能多样性。
- 使用潜在变量 $ z $ 来调节策略行为,并优化状态转移与潜在编码之间的互信息。
- 在多个机器人上实现异步、离策略的数据收集,以提升样本效率。
- 利用所学的技能动力学 $ q_{\phi}(s'\mid s,z) $ 实现基于模型的规划以应对下游任务。
- 在所学的技能空间上应用模型预测控制(MPC),以组合行为实现目标导向导航。
- 使用潜在编码的先验 $ p(z) $ 来采样多样技能,而无需奖励塑形。
实验结果
研究问题
- RQ1离策略学习是否能显著提升真实世界机器人无奖励技能发现的样本效率?
- RQ2在真实世界中,是否可以在没有任何奖励函数或人工示范的情况下涌现出多样化的行走技能?
- RQ3以无奖励、无监督方式学习到的技能是否能有效组合用于下游导航任务?
- RQ4在物理机器人上部署无奖励强化学习时会遇到哪些实际挑战,如何缓解?
- RQ5互信息最大化在多大程度上能驱动真实机器人系统中产生有意义、多样且有用的行為?
主要发现
- off-DADS算法在仿真环境中相比其在线策略前身,样本效率最高提升4倍。
- 在真实硬件(D’Kitty四足机器人)上,经过20小时训练,无需任何奖励或示范,成功涌现出多样化的行走技能——包括不同的步态和朝向。
- 通过off-DADS学习到的技能具有鲁棒性:95%的随机采样技能执行能完成100步不摔倒,平均行走距离为2.17±0.59米。
- 利用所学技能动力学进行模型预测控制,成功实现仅依赖无监督技能库的机器人导航至目标位置。
- 尽管存在空间有限和硬件磨损等物理约束,该方法仍证明了无奖励、持续学习在真实世界中的可行性。
- 训练曲线未显示收敛,表明在更长训练时间下可能涌现出更多技能多样性,提示长期无监督学习具有潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。