Skip to main content
QUICK REVIEW

[论文解读] RVT: Robotic View Transformer for 3D Object Manipulation

Ankit Goyal, Jie Xu|arXiv (Cornell University)|Jun 26, 2023
Advanced Vision and Imaging被引用 6
一句话总结

RVT 提出了一种可扩展的、基于视角的 3D 操控框架,采用多视角 Transformer 并结合重渲染的虚拟视角,以在性能上超越基于体素的方法。在 18 个 RLBench 任务中,其成功率比 PerAct 高出 26%,训练速度提升 36 倍,推理速度提升 2.3 倍,同时仅需每项任务约 10 次示范即可泛化至真实世界任务。

ABSTRACT

For 3D object manipulation, methods that build an explicit 3D representation perform better than those relying only on camera images. But using explicit 3D representations like voxels comes at large computing cost, adversely affecting scalability. In this work, we propose RVT, a multi-view transformer for 3D manipulation that is both scalable and accurate. Some key features of RVT are an attention mechanism to aggregate information across views and re-rendering of the camera input from virtual views around the robot workspace. In simulations, we find that a single RVT model works well across 18 RLBench tasks with 249 task variations, achieving 26% higher relative success than the existing state-of-the-art method (PerAct). It also trains 36X faster than PerAct for achieving the same performance and achieves 2.3X the inference speed of PerAct. Further, RVT can perform a variety of manipulation tasks in the real world with just a few ($\sim$10) demonstrations per task. Visual results, code, and trained model are provided at https://robotic-view-transformer.github.io/.

研究动机与目标

  • 开发一种可扩展且精确的 3D 物体操控方法,在性能和训练效率上均超越基于体素的方法。
  • 通过引入能有效聚合跨视角信息的多视角 Transformer,解决基于视角方法在 3D 推理中的局限性。
  • 通过利用重渲染的虚拟视角和鲁棒的视觉特征学习,实现在极少示范下的真实世界部署。
  • 通过重渲染将传感器相机输入与 Transformer 输入解耦,实现不受物理相机限制的灵活、任务特定视角选择。

提出的方法

  • RVT 使用多视角 Transformer 架构,同时关注场景的多个重渲染视角,以聚合跨视角的空间与语义信息。
  • 该模型处理 RGB-D 输入,并从虚拟视角(如俯视或前视)重渲染场景,这些视角经优化以支持任务相关的 3D 推理。
  • 采用两阶段注意力机制:首先在每张图像的 patch 内部进行注意力计算,随后在所有视角之间执行跨视角注意力,以增强特征表示。
  • 网络输出各视角的热力图和特征,用于预测机器人的末端执行器位姿,从而实现在 3D 空间中的精确控制。
  • 重渲染通过可微分渲染器实现,支持端到端训练,并支持正交投影和数据增强的使用。
  • 该方法支持单摄像头真实世界部署,即使仅有一个物理摄像头,也能通过虚拟视角重渲染实现。

实验结果

研究问题

  • RQ1基于视角的方法能否在保持图像方法可扩展性的前提下,实现 SOTA 的 3D 操控性能?
  • RQ2与使用原始传感器相机输入相比,从虚拟视角重渲染如何提升性能?
  • RQ3在多视角 Transformer 架构中,诸如注意力顺序和视角选择等设计选择如何最大化操控精度?
  • RQ4一个单一的 RVT 模型能否在极少真实世界示范下泛化至多样化的 3D 操控任务?

主要发现

  • 在 18 个 RLBench 任务(共 249 种任务变体)中,RVT 的成功率比 PerAct 高出 26%,展现出更优的泛化能力和准确性。
  • RVT 的训练速度比 PerAct 快 36 倍——在相同硬件上,训练时间从 14 天缩短至 10 小时,同时达到峰值性能。
  • RVT 的推理速度比 PerAct 快 2.3 倍(11.6 fps vs. 4.9 fps),支持实时部署。
  • 在真实世界实验中,RVT 在堆叠积木任务上实现 100% 成功率,在按压洗手液任务上实现 80% 成功率,且每项任务仅需约 10 次示范。
  • 在非标记物任务中,RVT 达到 82.5% 的成功率,而在标记物相关任务中性能较低,原因在于点云稀疏且噪声大。
  • 使用重渲染的虚拟视角显著提升了性能,尤其在结合正交投影和数据增强时效果更明显。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。