[论文解读] On-Robot Learning With Equivariant Models
本文提出了一种基于对称SAC的机器人上学习方法(On-Robot Learning with Equivariant SAC),这是一种样本高效的强化学习方法,通过利用离散对称群(如D₄、C₈)和数据增强技术,在不到两小时内直接在真实机器人上训练机器人抓取策略。实验表明,预训练于仿真环境通常是不必要的,甚至可能造成负迁移,使得直接在机器人上进行学习在简单抓取任务中既可行又高效。
Recently, equivariant neural network models have been shown to improve sample efficiency for tasks in computer vision and reinforcement learning. This paper explores this idea in the context of on-robot policy learning in which a policy must be learned entirely on a physical robotic system without reference to a model, a simulator, or an offline dataset. We focus on applications of Equivariant SAC to robotic manipulation and explore a number of variations of the algorithm. Ultimately, we demonstrate the ability to learn several non-trivial manipulation tasks completely through on-robot experiences in less than an hour or two of wall clock time.
研究动机与目标
- 实现无需依赖仿真器或离线数据集的高效机器人上策略学习。
- 探究离散对称群的等变模型是否在机器人抓取任务中优于连续对称群。
- 评估数据增强对直接在真实机器人上训练的等变模型的影响。
- 评估仿真到现实的预训练是否对机器人上学习有益或必要。
- 理解仿真到现实迁移失败的时机与原因,特别是接触动力学的领域差异。
提出的方法
- 使用具有离散对称群(如D₄、C₈)的等变软演员评论家(SAC)算法,将旋转与反射不变性编码进策略网络。
- 通过群的不可约表示强制神经网络架构中的等变性,从而提升样本效率。
- 在经验回放缓冲区中应用数据增强技术(尤其是缓冲区增强),以进一步提升离散对称群上的性能。
- 完全基于真实机器人收集的真实世界经验进行策略训练,无需仿真或预训练。
- 通过使用PyBullet仿真环境进行仿真到现实的微调,对比机器人上训练与仿真到现实微调的效果,以评估迁移的有效性。
- 在四个抓取任务上评估性能:积木抓取、杂乱抓取、积木推动和碗中积木。
实验结果
研究问题
- RQ1在机器人上强化学习中,离散对称群(如D₄、C₈)是否比连续对称群(如SO(2)、O(2))表现更优?
- RQ2尽管模型已编码对称性,数据增强是否仍能提升在真实机器人上训练的等变模型的性能?
- RQ3对于机器人抓取策略的机器人上学习,仿真到现实的预训练是否必要或有益?
- RQ4在何种条件下,仿真到现实的预训练会导致真实机器人策略学习中的负迁移?
- RQ5在真实机器人上训练的等变模型是否能在两小时以内的实际运行时间内,实现复杂抓取任务的高性能?
主要发现
- 在所有评估任务中,使用离散对称群(D₄、C₈)的等变SAC优于连续对称群(SO(2)、O(2))的等变性,表明即使存在近似,其泛化能力更强。
- 数据增强,尤其是缓冲区增强,显著提升了离散对称群上的性能,表明即使模型已编码对称性,数据增强仍具显著益处。
- 采用等变模型的机器人上学习在积木推动任务中达到92%的成功率,在碗中积木任务中也达到92%,杂乱抓取任务中为70%,所有训练均在1至2小时内完成。
- 成功实现机器人上学习并不需要仿真到现实的预训练;在积木推动任务中,预训练反而导致负迁移,因仿真中的接触动力学与真实世界不同,使预训练策略表现劣于从零开始训练。
- 仿真到现实的代理学习到了向下按压积木的行为(因PyBullet中接触柔顺性更软),而机器人上代理则学习到了侧向推动,凸显了因领域差异导致迁移失败的根源。
- 在积木抓取和碗中积木任务中,机器人上学习与仿真到现实微调均达到100%成功率,但在某些情况下,机器人上学习收敛更快,表明直接学习具有竞争力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。