Skip to main content
QUICK REVIEW

[论文解读] Vision-based Teleoperation of Shadow Dexterous Hand using End-to-End Deep Neural Network

Shuang Li, Xiaojian Ma|arXiv (Cornell University)|Sep 17, 2018
Robot Manipulation and Learning参考文献 27被引用 7
一句话总结

本文提出 TeachNet,一种端到端的深度神经网络,可直接将人类手部的深度图像映射到 Shadow 多指机器人手的关节角度,实现直观、无标记的遥操作。该方法在新手用户中实现更快、更准确的抓握任务,优于当前最先进方法,其核心是利用包含 400,000 个样本的人机深度图像与关节角度数据集,并引入一致性损失,以应对解剖结构和外观上的差异。

ABSTRACT

In this paper, we present TeachNet, a novel neural network architecture for intuitive and markerless vision-based teleoperation of dexterous robotic hands. Robot joint angles are directly generated from depth images of the human hand that produce visually similar robot hand poses in an end-to-end fashion. The special structure of TeachNet, combined with a consistency loss function, handles the differences in appearance and anatomy between human and robotic hands. A synchronized human-robot training set is generated from an existing dataset of labeled depth images of the human hand and simulated depth images of a robotic hand. The final training set includes 400K pairwise depth images and joint angles of a Shadow C6 robotic hand. The network evaluation results verify the superiority of TeachNet, especially regarding the high-precision condition. Imitation experiments and grasp tasks teleoperated by novice users demonstrate that TeachNet is more reliable and faster than the state-of-the-art vision-based teleoperation method.

研究动机与目标

  • 仅使用人类手部的深度图像,实现对灵巧机器人手的直观、无标记遥操作。
  • 以端到端方式解决人类手与机器人手在解剖结构和视觉外观上的差异所带来的映射挑战。
  • 通过直接从输入深度图像回归机器人关节角度,减少对手部姿态估计或后处理的依赖。
  • 构建大规模、同步的人机数据集,用于训练鲁棒的视觉遥操作系统。
  • 通过减少抓握任务中的时间和错误,提升新手操作员的易用性。

提出的方法

  • 设计 TeachNet,一种教师-学生神经网络架构,学习从人类手部深度图像到机器人关节角度的直接运动学映射。
  • 构建一个包含真实人类手部深度图像与对应姿态下 Shadow 机器手模拟深度图像的 400,000 个样本数据集。
  • 使用一致性损失函数,对齐机器人手的笛卡尔位置与连杆方向与人类手的姿态,提升在解剖差异下的泛化能力。
  • 实现一种优化的映射方法,基于人类手的关键点位置与连杆方向估计机器人关节角度,同时考虑自碰撞约束。
  • 采用端到端方式训练网络,使用配对的深度图像与真实机器人关节角度,无需中间姿态估计步骤。
  • 在实时遥操作中部署训练好的模型,将人类操作员的实时深度输入直接映射为机器人关节指令。

实验结果

研究问题

  • RQ1端到端的深度神经网络是否能够无需显式姿态估计,准确且鲁棒地学习从人类手部深度图像到机器人手关节角度的映射?
  • RQ2所提出的 一致性损失 在处理人类手与机器人手之间解剖与外观差异方面的有效性如何?
  • RQ3与当前最先进的数据驱动方法相比,该方法在提升新手用户遥操作速度与准确性方面达到何种程度的改进?
  • RQ4在遮挡或非理想光照条件下,系统性能如何退化?
  • RQ5该方法是否能泛化到涉及多种形状与尺寸物体的复杂抓握任务?

主要发现

  • TeachNet 在网络评估中表现出更高的准确率与更低的误差,尤其在高精度条件下优于其他端到端基线方法。
  • 新手用户使用 TeachNet 完成手部抓握与释放任务的平均时间比 HandIK 基线快 44%(20.73 秒 vs. 36.39 秒)。
  • 在处理大直径物体(如瓶子、马克杯)的任务中,该方法显著优于 HandIK,后者因拇指精度较低导致延迟。
  • 香蕉任务耗时最长(25.80 秒),归因于其细长形状需要精确的指尖控制。
  • 可见误差主要出现在手指的第二、三关节以及拇指的基底关节,可能由于 Shadow 手的复杂运动学结构与遮挡所致。
  • 即使机器人手腕关节固定,系统仍能可靠地实时模仿人类手势,且无需明确定义关节对应关系。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。