Skip to main content
QUICK REVIEW

[论文解读] Robot Learning with Sensorimotor Pre-training

Ilija Radosavovic, Baifeng Shi|arXiv (Cornell University)|Jun 16, 2023
Robot Manipulation and Learning被引用 4
一句话总结

本文提出RPT,一种基于Transformer模型的自监督传感器运动预训练方法,通过从真实世界轨迹中预测被遮蔽的视觉、本体感觉和动作标记序列,实现机器人学习。该方法在从零开始训练的基础上实现了稳定的性能提升——在积木堆叠任务中最高提升2倍——并能仅使用无标签传感器运动数据,在不同任务、环境和机器人之间实现有效迁移。

ABSTRACT

We present a self-supervised sensorimotor pre-training approach for robotics. Our model, called RPT, is a Transformer that operates on sequences of sensorimotor tokens. Given a sequence of camera images, proprioceptive robot states, and actions, we encode the sequence into tokens, mask out a subset, and train a model to predict the missing content from the rest. We hypothesize that if a robot can predict the masked-out content it will have acquired a good model of the physical world that can enable it to act. RPT is designed to operate on latent visual representations which makes prediction tractable, enables scaling to larger models, and allows fast inference on a real robot. To evaluate our approach, we collected a dataset of 20,000 real-world trajectories over 9 months using a combination of motion planning and grasping algorithms. We find that sensorimotor pre-training consistently outperforms training from scratch, has favorable scaling properties, and enables transfer across different tasks, environments, and robots.

研究动机与目标

  • 开发一种自监督预训练方法,从无标签的真实世界机器人轨迹中学习丰富的传感器运动表征。
  • 探究对传感器运动序列进行遮蔽预测是否能生成对下游机器人控制有用的的世界模型。
  • 仅使用单一预训练表征,实现跨多样化任务、环境和机器人平台的迁移学习。
  • 在保持物理机器人实时推理能力的前提下,将预训练扩展至大模型和长上下文长度。

提出的方法

  • 模型RPT是一个Transformer,用于处理来自机器人轨迹的视觉、本体感觉和动作标记的交错序列。
  • 采用高比例、多模态的遮蔽策略,跨时间和模态进行遮蔽,模型从剩余上下文预测缺失标记。
  • 视觉特征通过在ImageNet上预训练的视觉编码器提取,使用潜在表征使预测任务更可行且可扩展。
  • 使用均方误差(MSE)损失进行预训练,以鼓励学习时空依赖性和跨模态依赖性。
  • 预训练完成后,将学习到的表征在下游任务(如抓取放置、积木堆叠和料箱抓取)上进行微调。
  • 该方法将视觉计算与序列建模解耦,实现在真实机器人上使用大模型(3亿参数以上)实现10 Hz控制。

实验结果

研究问题

  • RQ1在原始传感器运动序列上进行自监督遮蔽预测,能否学习到对机器人策略学习有用的的世界模型?
  • RQ2与从零开始训练相比,基于真实世界轨迹的预训练是否能提升样本效率和跨任务、跨机器人的泛化能力?
  • RQ3模型规模、上下文长度和数据集规模等缩放因素如何影响预训练机器人策略的性能?
  • RQ4跨视觉、本体感觉和动作的多模态遮蔽是否比单模态或稀疏遮蔽更有效?
  • RQ5预训练表征能否在不同机器人平台和环境中实现有效迁移?

主要发现

  • RPT在所有评估任务中均持续优于从零开始训练,且在更复杂任务中性能提升更显著。
  • 与随机初始化相比,使用预训练表征后,积木堆叠任务的性能最高提升2倍。
  • 预训练实现了策略的零样本迁移成功,例如从抓取放置任务迁移到堆叠和料箱抓取任务。
  • 该方法表现出有利的缩放特性:性能随视觉编码器增大、上下文长度变长和预训练数据集增大而提升。
  • 高比例、跨时间与模态的多模态遮蔽对性能至关重要,显著优于稀疏或单模态遮蔽策略。
  • 使用潜在视觉表征使大模型(超过3亿参数)在真实机器人上实现10 Hz实时推理,使该方法具备实际部署可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。