Skip to main content
QUICK REVIEW

[论文解读] Open-TeleVision: Teleoperation with Immersive Active Visual Feedback

Xuxin Cheng, Jialong Li|arXiv (Cornell University)|Jul 1, 2024
Multimedia Communication and Technology被引用 4
一句话总结

Open-TeleVision 引入了一种基于 VR 的手部与头部追踪技术的沉浸式远程操作(teleoperation)系统,结合主动立体视觉,实现了对人形机器人的直观、远程控制,适用于精确的长时程操作。该系统通过实时传输第一人称、立体的3D视觉反馈,实现了高保真度的模仿学习,相较于静态或单目视觉,显著提升了任务成功率和推理速度。

ABSTRACT

Teleoperation serves as a powerful method for collecting on-robot data essential for robot learning from demonstrations. The intuitiveness and ease of use of the teleoperation system are crucial for ensuring high-quality, diverse, and scalable data. To achieve this, we propose an immersive teleoperation system Open-TeleVision that allows operators to actively perceive the robot's surroundings in a stereoscopic manner. Additionally, the system mirrors the operator's arm and hand movements on the robot, creating an immersive experience as if the operator's mind is transmitted to a robot embodiment. We validate the effectiveness of our system by collecting data and training imitation learning policies on four long-horizon, precise tasks (Can Sorting, Can Insertion, Folding, and Unloading) for 2 different humanoid robots and deploy them in the real world. The system is open-sourced at: https://robot-tv.github.io/

研究动机与目标

  • 开发一种可扩展的远程操作框架,支持对配备多指手部的人形机器人进行精确、直观的控制。
  • 通过集成与操作者头部动作同步的主动式头戴立体摄像头,解决传统远程操作中因遮挡和空间感知差导致的问题。
  • 通过在远程操作过程中提供沉浸式、第一人称、立体视觉反馈,实现高质量数据采集,以支持模仿学习。
  • 在两台不同的人形机器人上,验证该系统在多样化、长时程操作任务中的有效性。
  • 实现跨大陆的远程操作,具备低延迟、实时的视觉与运动反馈能力。

提出的方法

  • 系统利用 VR 跟踪技术捕获操作者的手部、头部和手腕在 SE(3) 空间中的位姿,并通过运动重定向将其映射至机器人关节位置。
  • 机器人颈部配备可驱动装置,其上安装立体 RGB 摄像头,与操作者头部运动同步,提供实时、第一人称的3D视觉反馈。
  • 以 480×640 分辨率、60 Hz 的频率将立体视频流传输至 VR 头显,增强深度感知与空间意识。
  • 系统支持跨网络的远程操作,已在加州大学圣地亚哥分校与麻省理工学院之间成功实现跨大陆远程操作。
  • 模仿学习策略采用一种处理图像与本体感觉标记的分段动作 Transformer 架构进行训练。
  • 该系统已开源,兼容多种 VR 设备与人形机器人,包括 Unitree H1 和 Fourier GR1。

实验结果

研究问题

  • RQ1主动式、立体的、第一人称视觉反馈是否能提升远程操作中的操作者表现与任务成功率?
  • RQ2沉浸式、头部镜像的视觉反馈是否能增强空间理解能力,减少精细操作过程中的遮挡问题?
  • RQ3使用 Open-TeleVision 收集的远程操作数据,是否能支持在多样化任务上训练出鲁棒的长时程模仿学习策略?
  • RQ4与单目或静态摄像头视角相比,立体视觉在任务表现与控制平滑度方面有何优势?
  • RQ5在实时视觉与运动反馈支持下,远程低延迟操作的实现程度如何?

主要发现

  • 在用户实验中,使用立体视频相比单目或静态视角,系统实现了更高的任务成功率与更短的任务完成时间。
  • 操作者报告称,在使用主动式、头部镜像的立体视觉时,空间感知能力与任务专注度显著提升。
  • 基于 Open-TeleVision 数据训练的模仿学习策略,成功执行了如顺序插入易拉罐、折叠等长时程任务。
  • 使用立体图像输入显著提升了策略性能,使复杂环境下的操作更加精确与稳定。
  • 该系统实现了跨美国大陆的实时、低延迟远程操作,验证了其可扩展性与网络鲁棒性。
  • 在灵活性、远程操作能力以及多指操作支持方面,该系统优于以往的远程操作框架。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。