[论文解读] High Acceleration Reinforcement Learning for Real-World Juggling with Binary Rewards
本文提出了一种样本高效、安全感知的强化学习系统,使 Barrett WAM 机械臂仅通过二元奖励即可在真实世界中学习高速双球杂耍。通过整合任务特定的策略初始化、基于工程经验的策略表示以及 KL 约束的策略优化,该系统在仅 56 分钟真实世界经验后,即可实现长达 33 分钟(超过 4,500 次接球)的连续杂耍,性能优于人工调校的策略。
Robots that can learn in the physical world will be important to en-able robots to escape their stiff and pre-programmed movements. For dynamic high-acceleration tasks, such as juggling, learning in the real-world is particularly challenging as one must push the limits of the robot and its actuation without harming the system, amplifying the necessity of sample efficiency and safety for robot learning algorithms. In contrast to prior work which mainly focuses on the learning algorithm, we propose a learning system, that directly incorporates these requirements in the design of the policy representation, initialization, and optimization. We demonstrate that this system enables the high-speed Barrett WAM manipulator to learn juggling two balls from 56 minutes of experience with a binary reward signal. The final policy juggles continuously for up to 33 minutes or about 4500 repeated catches. The videos documenting the learning process and the evaluation can be found at https://sites.google.com/view/jugglingbot
研究动机与目标
- 开发一种安全、样本高效的强化学习系统,用于高加速度物理任务(如杂耍),由于非线性动力学和执行器限制,仿真方法不适用。
- 解决在真实机器人上使用稀疏二元奖励进行学习的挑战,其中失败可能导致损坏,样本效率至关重要。
- 证明将领域知识融入策略表示、初始化和优化过程,可实现纯强化学习无法达成的真实世界学习。
- 验证系统能否在不依赖仿真或密集奖励的情况下,成功在物理机器人上学习复杂动态操作任务(双球杂耍)。
提出的方法
- 系统采用基于专家知识的任务特定初始化的参数化策略,使机器人能够实现初始的、基础的接球动作,为学习奠定基础。
- 使用二元奖励信号——若杂耍持续 10 秒则奖励为 1,否则为 0——将学习聚焦于成功/失败,避免密集奖励 shaping。
- 采用具有 KL 散度约束(2)的 eREPS 进行稳定策略优化,确保渐进式改进并防止灾难性更新。
- 策略在 20 个回合中进行训练,每个回合包含 25 个随机采样的参数,若因环境错误导致轨迹损坏则重复执行。
- 末端执行器设计具备被动稳定性,可在受到轻微扰动时实现恢复,提升执行过程中的鲁棒性。
- 最终策略通过 30 次确定性轨迹进行评估,以衡量可重复性与性能,长期杂耍测试持续时间最长达 33 分钟。
实验结果
研究问题
- RQ1强化学习系统能否仅通过二元奖励在真实机器人上学习高加速度动态操作任务(如双球杂耍)?
- RQ2如何将工程知识和任务特定知识整合到策略表示与优化中,以提升真实世界强化学习中的样本效率与安全性?
- RQ3当前深度强化学习算法在应用于具有高加速度和严格安全约束的物理系统时存在哪些局限性?
- RQ4在真实世界执行中,学习得到的策略是否能在杂耍的一致性和持续时间上优于人工调校的策略?
主要发现
- 机器人在仅 56 分钟真实世界经验后,即可实现长达 33 分钟(超过 4,500 次接球)的连续双球杂耍,展现出极高的样本效率。
- 在 30 次确定性轨迹中,最终学习到的策略平均杂耍时长达到 106.82 秒,显著优于人工调校策略的平均 66.51 秒。
- 系统从第 10 回合起即可实现稳定的 10 秒杂耍,第 20 回合中所有 25 个参数均实现完美成功。
- 策略表现出强鲁棒性,得益于末端执行器设计中的被动稳定性,能够从轻微环境变化中恢复。
- 学习到的策略比人工调校策略更具可重复性,凸显数据驱动优化相比人工调校的优势。
- 本研究证实,对于该任务,基于仿真的方法失败,原因在于高加速度下未建模的电缆动力学和非线性执行器行为。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。