[论文解读] Robotic Telekinesis: Learning a Robotic Hand Imitator by Watching Humans on Youtube
本论文提出 Robotic Telekinesis,一种低成本、无需手套、无需标记的遥操作技术,仅通过单个未校准的RGB摄像头即可实现实时控制16自由度的机械手与手臂。通过利用预先存在的YouTube视频对3D人体姿态估计器进行预训练,并引入一种新颖的运动重定向网络及对抗性自碰撞损失,系统实现了平滑、无碰撞且语义准确的人类手部动作模仿,使未经训练的用户无需专用硬件或校准即可执行灵巧操作任务。
We build a system that enables any human to control a robot hand and arm, simply by demonstrating motions with their own hand. The robot observes the human operator via a single RGB camera and imitates their actions in real-time. Human hands and robot hands differ in shape, size, and joint structure, and performing this translation from a single uncalibrated camera is a highly underconstrained problem. Moreover, the retargeted trajectories must effectively execute tasks on a physical robot, which requires them to be temporally smooth and free of self-collisions. Our key insight is that while paired human-robot correspondence data is expensive to collect, the internet contains a massive corpus of rich and diverse human hand videos. We leverage this data to train a system that understands human hands and retargets a human video stream into a robot hand-arm trajectory that is smooth, swift, safe, and semantically similar to the guiding demonstration. We demonstrate that it enables previously untrained people to teleoperate a robot on various dexterous manipulation tasks. Our low-cost, glove-free, marker-free remote teleoperation system makes robot teaching more accessible and we hope that it can aid robots in learning to act autonomously in the real world. Videos at https://robotic-telekinesis.github.io/
研究动机与目标
- 实现无需手套、标记或专用硬件的低成本、实时、可访问的灵巧机械手遥操作。
- 通过利用海量、未标注的互联网视频数据进行预训练,解决人类-机器人姿态对应关系中的数据稀缺问题。
- 开发一种运动重定向系统,能够实时将多样的人类手部姿态转换为物理上合理、无碰撞的机器人轨迹。
- 使未经训练的用户仅通过单个摄像头观察自然手部动作,即可成功完成复杂的灵巧操作任务。
- 通过提供直观、易用的人类示范平台,推动机器人学习的民主化,从而启动自主策略学习。
提出的方法
- 系统使用预训练的3D人体姿态估计器,从单个未校准摄像头捕获的2D RGB视频帧中推断3D手部与身体姿态。
- 一种新颖的运动重定向网络利用基于能量的优化框架,将推断出的人体姿态映射到对应的16自由度Allegro机械手与手臂关节配置。
- 能量函数包含关键点匹配损失、运动学一致性损失以及对抗性自碰撞损失,以确保物理合理性并避免自碰撞。
- 自碰撞损失通过判别器学习,该判别器用于判断预测的机器人姿态是否导致自碰撞,从而实现端到端训练并隐式实现碰撞规避。
- 整个系统在数千小时未经筛选的YouTube视频上进行预训练,消除了在实验室中对机器人进行主动数据采集的需求。
- 通过每帧40ms的推理预算实现实时推理,使系统在真实环境中具备响应迅速的遥操作能力。
实验结果
研究问题
- RQ1是否可以仅通过单个RGB摄像头和无专用硬件实现实时遥操作机械手?
- RQ2在未经筛选的互联网视频上进行训练的系统,能否在未经训练的用户中泛化至真实世界的遥操作?
- RQ3在从人类手部到机器人手部的运动重定向过程中,如何有效避免自碰撞,而无需显式碰撞检测?
- RQ4在多样化YouTube视频上进行预训练,在多大程度上提升了遥操作策略的鲁棒性与泛化能力?
- RQ5即使缺乏真实机器人数据的监督,所学习的重定向网络是否仍能超越强基线方法DexPilot-Monocular ∗,在匹配最优机器人姿态方面表现更优?
主要发现
- 所提出的神经网络重定向器在匹配伪真实标签(pseudo-ground-truth oracle)时,每关节的RMSE为0.17弧度(≈10°),优于DexPilot-Monocular ∗的0.25弧度(≈14°)。
- 引入对抗性自碰撞损失显著减少了机器人手部姿态中的自碰撞现象,同时保持了与人类示范的语义相似性。
- 消融实验表明,在最小化自碰撞与最小化姿态差异之间存在权衡,当自碰撞损失权重为0.8时,达到了理想的平衡。
- 该系统使十名此前未经训练的人类操作员仅通过自然手部动作和单个摄像头,成功完成了十个具有挑战性的灵巧操作任务。
- 系统在每帧40ms的推理预算下展现出实时性能,实现在非受控环境中的响应迅速、流畅的遥操作。
- 通过针对非专家的系统性用户研究验证,该方法在不同用户和任务间均表现出良好的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。