[论文解读] Simultaneously Learning Vision and Feature-based Control Policies for Real-world Ball-in-a-Cup
本文提出了一种多任务强化学习方法,通过在真实机器人上同时训练基于视觉的控制策略和基于特征的控制策略,利用任务特定状态空间的辅助任务来加速学习。通过在策略之间共享特征并利用低成本的训练时特征,该方法实现了从零开始在真实硬件上端到端学习Ball-in-a-Cup任务,耗时约28小时,达到100%捕获率,且无需模仿学习或仿真到真实世界的迁移。
We present a method for fast training of vision based control policies on real robots. The key idea behind our method is to perform multi-task Reinforcement Learning with auxiliary tasks that differ not only in the reward to be optimized but also in the state-space in which they operate. In particular, we allow auxiliary task policies to utilize task features that are available only at training-time. This allows for fast learning of auxiliary policies, which subsequently generate good data for training the main, vision-based control policies. This method can be seen as an extension of the Scheduled Auxiliary Control (SAC-X) framework. We demonstrate the efficacy of our method by using both a simulated and real-world Ball-in-a-Cup game controlled by a robot arm. In simulation, our approach leads to significant learning speed-ups when compared to standard SAC-X. On the real robot we show that the task can be learned from-scratch, i.e., with no transfer from simulation and no imitation learning. Videos of our learned policies running on the real robot can be found at https://sites.google.com/view/rss-2019-sawyer-bic/.
研究动机与目标
- 实现真实机器人上基于视觉的控制策略的快速、样本高效的训练。
- 通过使用具有任务特定状态空间的辅助任务,克服真实世界数据有限的挑战。
- 在无需模仿学习或仿真到真实世界迁移的前提下,从零开始学习基于视觉的策略。
- 展示基于特征的策略可通过共享表征引导基于视觉的策略学习。
- 实现仅使用原始摄像头图像和本体感知信息的最终策略部署,无需实时跟踪。
提出的方法
- 将Scheduled Auxiliary Control (SAC-X)框架扩展,以支持主任务与辅助任务使用不同的状态空间。
- 采用共享神经网络架构,使视觉策略与基于特征的策略共享隐藏层,以实现知识迁移。
- 引入在训练时可用的高维状态空间(如物体位置)上运行的辅助任务。
- 为辅助任务使用奖励塑形,以加速学习并提高数据效率。
- 采用非对称演员-评论家训练,以稳定具有不同状态表示的多个任务的学习过程。
- 通过结合视觉与特征模态的稀疏奖励与塑形奖励的多任务损失函数,联合训练策略。
实验结果
研究问题
- RQ1具有任务特定状态空间的辅助任务是否能显著加速真实机器人上基于视觉的控制策略的学习?
- RQ2使用基于特征的策略训练是否能提高真实世界强化学习中基于视觉策略的样本效率与最终性能?
- RQ3是否可以在无需模仿学习或仿真到真实世界迁移的前提下,从零开始在真实硬件上训练基于视觉的策略?
- RQ4包含一个故意无用的辅助任务在多大程度上影响学习的稳定性和收敛性?
- RQ5视觉与基于特征的策略之间的共享表征在多大程度上能提高数据效率与策略泛化能力?
主要发现
- 该方法在真实机器人上300次评估中实现了100%的捕获率,平均捕获时间为2.39秒。
- 最终的基于视觉的策略在约28小时的真实世界训练中从零开始训练完成,未使用任何模仿或仿真数据。
- 即使引入了故意无用的辅助任务,学习性能依然保持强劲,表明对辅助任务选择具有鲁棒性。
- 为辅助任务引入塑形奖励显著提升了真实硬件上的训练速度与数据效率。
- 尽管传感器存在噪声且视觉数据不完美,基于特征与基于视觉的策略的学习曲线在真实硬件上约5,000个训练周期后均实现收敛。
- 最终策略仅使用原始摄像头图像与本体感知反馈即成功运行,证明了仅依赖最少传感器需求的部署可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。