Skip to main content
QUICK REVIEW

[论文解读] DexVIP: Learning Dexterous Grasping with Human Hand Pose Priors from Video

Priyanka Mandikal, Kristen Grauman|arXiv (Cornell University)|Jan 31, 2022
Robot Manipulation and Learning被引用 12
一句话总结

DexVIP 通过利用从真实世界 YouTube 视频中提取的人类手部姿态先验,结合一种奖励人类相似手部姿态和功能感知抓取的深度强化学习智能体,学习灵巧机器人抓取。该方法在 ContactDB 上实现了 68% 的成功率,训练速度比以往方法快 20%,并且在无需实验室级示范的情况下,能够高效扩展至新物体。

ABSTRACT

Dexterous multi-fingered robotic hands have a formidable action space, yet their morphological similarity to the human hand holds immense potential to accelerate robot learning. We propose DexVIP, an approach to learn dexterous robotic grasping from human-object interactions present in in-the-wild YouTube videos. We do this by curating grasp images from human-object interaction videos and imposing a prior over the agent's hand pose when learning to grasp with deep reinforcement learning. A key advantage of our method is that the learned policy is able to leverage free-form in-the-wild visual data. As a result, it can easily scale to new objects, and it sidesteps the standard practice of collecting human demonstrations in a lab -- a much more expensive and indirect way to capture human expertise. Through experiments on 27 objects with a 30-DoF simulated robot hand, we demonstrate that DexVIP compares favorably to existing approaches that lack a hand pose prior or rely on specialized tele-operation equipment to obtain human demonstrations, while also being faster to train. Project page: https://vision.cs.utexas.edu/projects/dexvip-dexterous-grasp-pose-prior

研究动机与目标

  • 在不依赖昂贵且专用的实验室级人类示范的情况下,实现灵巧机器人抓取。
  • 通过从非结构化视频数据中学习,提高机器人操作的样本效率和泛化能力。
  • 利用来自非结构化互联网视频的人类手部姿态先验,指导仿真环境中的策略学习。
  • 减少将抓取策略扩展至新物体所需的时间和开销。
  • 开发一种在噪声传感和执行条件下具有良好泛化能力的方法,支持实际部署。

提出的方法

  • 使用最先进的计算机视觉模型,从 YouTube 教程视频的精选帧中提取 3D 人类手部姿态。
  • 在仿真环境中训练深度强化学习智能体,其奖励函数结合了抓取成功、功能区域预测以及与人类姿态的相似性。
  • 采用多分量奖励:R = R_grasp + λ1·R_touch + λ2·R_pose,其中 R_pose 用于惩罚与观察到的人类手部姿态的偏差。
  • 引入基于图像的功能区域预测,引导智能体朝向功能上有用的抓取区域。
  • 应用噪声增强(本体感觉、物体追踪、执行和像素扰动的高斯噪声),以提高鲁棒性。
  • 整理了一个包含 27 种物体的数据集,其抓取图像来自 YouTube,避免使用 VR、动作捕捉或动力学遥操作。

实验结果

研究问题

  • RQ1仅使用来自非结构化 YouTube 视频的视觉数据,能否有效训练灵巧抓取策略?
  • RQ2与标准强化学习基线相比,从真实世界交互中提取的人类手部姿态先验是否能提高样本效率和性能?
  • RQ3所提出的方法在无需新专家示范的情况下,如何扩展至新物体?
  • RQ4在存在噪声传感和执行条件时,策略是否具备泛化能力,表明其具备实际部署潜力?
  • RQ5与传统遥操作相比,基于视频的监督在训练速度和成功率方面表现如何?

主要发现

  • DexVIP 在 ContactDB 基准上实现了 68% 的抓取成功率,优于未使用手部姿态先验的方法。
  • 由于姿态先验带来的样本效率提升,该方法比性能最佳的基线 GRAFF 快 20% 训练。
  • 在 11 种非 ContactDB 物体上(无动作捕捉示范),DexVIP 维持了 65% 的成功率(仅比 68% 下降 4%),而 DAPG 下降了 15%(从 59% 降至 50%)。
  • 在奖励函数中加入手部姿态先验,使成功率从仅使用功能区域奖励的 60% 提升至完整模型的 68%,证明了该先验的有效性。
  • 在重度噪声(传感和执行)条件下,DexVIP 达到 64% 的成功率,优于无噪声基线,表明其具备鲁棒性。
  • 基于视频的数据整理每种物体仅需数秒,而遥操作每条示范约需 5 分钟,显著提升了新物体的快速扩展能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。