[论文解读] RoboNet: Large-Scale Multi-Robot Learning
RoboNet 引入了一个大规模、多机器人的数据集,包含来自七个机器人平台的1500万帧视频,以实现可泛化的基于视觉的机器人操作。通过在该多样化数据上预训练视觉预测模型和逆模型,该方法在新机器人、新物体、新视角和新夹爪上均实现了卓越的零样本和微调性能,且所需数据量仅为传统机器人专用训练的4倍至20倍。
Robot learning has emerged as a promising tool for taming the complexity and diversity of the real world. Methods based on high-capacity models, such as deep networks, hold the promise of providing effective generalization to a wide range of open-world environments. However, these same methods typically require large amounts of diverse training data to generalize effectively. In contrast, most robotic learning experiments are small-scale, single-domain, and single-robot. This leads to a frequent tension in robotic learning: how can we learn generalizable robotic controllers without having to collect impractically large amounts of data for each separate experiment? In this paper, we propose RoboNet, an open database for sharing robotic experience, which provides an initial pool of 15 million video frames, from 7 different robot platforms, and study how it can be used to learn generalizable models for vision-based robotic manipulation. We combine the dataset with two different learning algorithms: visual foresight, which uses forward video prediction models, and supervised inverse models. Our experiments test the learned algorithms' ability to work across new objects, new tasks, new scenes, new camera viewpoints, new grippers, or even entirely new robots. In our final experiment, we find that by pre-training on RoboNet and fine-tuning on data from a held-out Franka or Kuka robot, we can exceed the performance of a robot-specific training approach that uses 4x-20x more data. For videos and data, see the project webpage: https://www.robonet.wiki/
研究动机与目标
- 通过在机器人和环境之间实现大规模数据共享,解决机器人学习中的数据效率和泛化能力限制。
- 开发一种可扩展的、自我监督的数据采集流程,用于真实世界中的机器人经验收集,且可轻松扩展至新硬件和传感器。
- 评估在多样化、多机器人数据上预训练的模型,是否能在极少微调的情况下泛化到未见过的机器人、物体、视角和夹爪。
- 证明从共享的大规模数据集中进行迁移学习,可优于传统机器人专用训练,且所需数据量显著更少。
提出的方法
- 使用七个机器人平台(Sawyer、Franka、Kuka、Baxter、WidowX、Fetch 和 Google 的机器人)收集了162,000条自主轨迹,覆盖不同物体、视角和环境。
- 采用一种自我监督、极少人工干预的数据采集协议,收集视频和动作序列,无需显式奖励或标签。
- 通过动作条件化的视频预测训练视觉预测模型,以学习世界动态并规划至目标。
- 训练深度逆模型,以预测从一张图像过渡到另一张图像所需的动作,从而实现目标图像的到达。
- 在完整 RoboNet 数据集上预训练模型,并在保留机器人(Franka 或 Kuka)的400条轨迹上进行微调,以评估零样本和少样本泛化性能。
- 在零样本和微调设置下,评估模型在新物体、新视角、新桌面表面、新夹爪和新机器人平台上的泛化能力。
实验结果
研究问题
- RQ1在大规模多机器人数据集上预训练的模型,是否能在无需额外训练的情况下泛化到新机器人、新物体和新环境?
- RQ2与机器人专用训练相比,在多样化真实世界机器人数据上进行预训练是否能提升样本效率?
- RQ3视觉预测模型和逆模型在不同机器人硬件、摄像头视角和夹爪类型之间泛化能力如何?
- RQ4预训练模型适应新机器人平台所需的最少微调数据量是多少?
- RQ5从大规模真实世界数据中进行自我监督学习,是否能优于使用大量数据的领域特定学习?
主要发现
- 在 RoboNet 上进行预训练,并在仅400条轨迹上进行微调,即可使模型泛化到未见过的机器人(Franka 或 Kuka),其性能超越了使用4倍至20倍更多数据的机器人专用训练。
- 在 RoboNet 上微调的模型实现了零样本泛化,适用于新物体、新视角和新桌面表面,展现出广泛的领域泛化能力。
- 即使参数量达5亿的视频预测模型在 RoboNet 上仍表现出欠拟合,表明当前架构在缺乏架构改进或数据选择优化的情况下,难以充分利用数据集的全部多样性。
- 结果表明,大规模数据带来的性能提升受限于模型容量和数据分布不匹配,凸显了对更灵活模型架构或更智能数据选择策略的需求。
- 本研究证明,跨机构和机器人平台的数据共享是可行且有效的,仅需数百条轨迹的微调即可实现对新硬件的适应。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。