[论文解读] Learning Visual Robotic Control Efficiently with Contrastive Pre-training and Data Augmentation
CoDER 通过结合对比预训练、在线数据增强和少量示范,实现了数据高效的视觉机器人强化学习。在仅使用 10 次示范的真实机器人数据上进行训练,它仅用 30 分钟的真实世界训练时间,即可完成稀疏奖励的操控任务,例如抓取、拨动开关和打开抽屉。
Recent advances in unsupervised representation learning significantly improved the sample efficiency of training Reinforcement Learning policies in simulated environments. However, similar gains have not yet been seen for real-robot reinforcement learning. In this work, we focus on enabling data-efficient real-robot learning from pixels. We present Contrastive Pre-training and Data Augmentation for Efficient Robotic Learning (CoDER), a method that utilizes data augmentation and unsupervised learning to achieve sample-efficient training of real-robot arm policies from sparse rewards. While contrastive pre-training, data augmentation, demonstrations, and reinforcement learning are alone insufficient for efficient learning, our main contribution is showing that the combination of these disparate techniques results in a simple yet data-efficient method. We show that, given only 10 demonstrations, a single robotic arm can learn sparse-reward manipulation policies from pixels, such as reaching, picking, moving, pulling a large object, flipping a switch, and opening a drawer in just 30 minutes of mean real-world training time. We include videos and code on the project website: https://sites.google.com/view/efficient-robotic-manipulation/home
研究动机与目标
- 解决从像素观测中进行真实机器人强化学习时面临的数据效率低下这一关键挑战。
- 通过结合无监督表征学习与高效探索,克服标准强化学习与模仿学习的局限性。
- 实现在真实机器人硬件上的样本高效策略学习,无需依赖仿真环境、动作捕捉系统或密集奖励信号。
- 证明对比预训练、数据增强与少量示范的协同作用,可在真实世界环境中实现快速且可靠的策略训练。
提出的方法
- 收集 10 次专家示范,并将其存储在经验回放缓冲区中,以初始化学习过程。
- 利用示范数据上的实例级对比学习对卷积编码器进行预训练,以学习视角不变的视觉表征。
- 使用来自在线交互和初始示范的增强观测,通过离策略深度强化学习(SAC)对策略进行微调。
- 在强化学习训练过程中,对观测应用随机数据增强(例如裁剪、颜色抖动),以提升鲁棒性与表征学习能力。
- 使用稀疏奖励信号在真实世界中端到端训练策略,最大限度减少对人工设计奖励或先验状态信息的依赖。
- 利用预训练编码器通过初始化策略网络为语义上有意义的视觉特征,提升样本效率。

实验结果
研究问题
- RQ1对比预训练与数据增强是否能显著提升真实机器人视觉强化学习中的样本效率?
- RQ2当与无监督表征学习结合时,少量示范(例如 10 次)在多大程度上能实现高效的策略学习?
- RQ3预训练、数据增强与离策略强化学习的组合是否在真实世界机器人操控任务中优于各独立组件?
- RQ4该框架在多样化的稀疏奖励操控任务中,实现最小人工干预的效率如何?
- RQ5该方法是否能在无需仿真或密集监督的情况下,泛化到真实世界的视觉变化与复杂操控任务中?
主要发现
- CoDER 仅使用 10 次示范,即可成功训练出在 6 种多样化操控任务(包括抓取、推动、拉动大型物体、拨动开关和打开抽屉)上的策略。
- 该方法在每项任务上仅需 15 至 50 分钟的总真实世界训练时间,相比标准强化学习显著降低了样本复杂度。
- 对比预训练、数据增强与示范的组合,实现了高效学习,而单独使用任一组件在真实机器人任务中均会失败。
- CoDER 实现了与依赖密集奖励、Sim2Real 迁移或动作捕捉的方法相当的数据效率,但无需依赖这些组件。
- 该方法对物体形状或位置的小幅扰动具有泛化能力,但在光照或背景发生较大视觉域偏移时性能会下降。
- 该方法轻量化且可部署于标准机器人硬件上,仅需两台 RGB 相机、一块 GPU 及极少设置——无需深度传感器或复杂基础设施。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。