Skip to main content
QUICK REVIEW

[论文解读] HOH: Markerless Multimodal Human-Object-Human Handover Dataset with Large Object Count

Noah Wiederhold, Ava Megyeri|arXiv (Cornell University)|Oct 1, 2023
Human Pose and Action Recognition被引用 4
一句话总结

本论文提出了HOH,这是首个完全无标记、大规模的多模态人类-人类交接数据集,包含136种不同的物体、2,720次交互以及40对参与者(支持角色互换)。数据通过4个多视角RGB-D相机和4个深度相机同步采集,提供3D点云、骨骼数据、手部与物体的分割掩码、抓握类型以及舒适度评分,支持基于数据的AI研究,涵盖抓握、姿态和轨迹预测,具有高度的真实感与多样性。

ABSTRACT

We present the HOH (Human-Object-Human) Handover Dataset, a large object count dataset with 136 objects, to accelerate data-driven research on handover studies, human-robot handover implementation, and artificial intelligence (AI) on handover parameter estimation from 2D and 3D data of person interactions. HOH contains multi-view RGB and depth data, skeletons, fused point clouds, grasp type and handedness labels, object, giver hand, and receiver hand 2D and 3D segmentations, giver and receiver comfort ratings, and paired object metadata and aligned 3D models for 2,720 handover interactions spanning 136 objects and 20 giver-receiver pairs-40 with role-reversal-organized from 40 participants. We also show experimental results of neural networks trained using HOH to perform grasp, orientation, and trajectory prediction. As the only fully markerless handover capture dataset, HOH represents natural human-human handover interactions, overcoming challenges with markered datasets that require specific suiting for body tracking, and lack high-resolution hand tracking. To date, HOH is the largest handover dataset in number of objects, participants, pairs with role reversal accounted for, and total interactions captured.

研究动机与目标

  • 解决机器人学与认知科学领域中缺乏大规模、多样化且真实的人类交接数据集的问题。
  • 克服基于标记的动作捕捉技术的局限性,该技术限制了服装多样性,并缺乏高分辨率的手部与物体几何信息。
  • 通过提供丰富、多模态且完全标注的3D交互数据,支持基于数据的人机交接研究。
  • 支持AI模型的开发,以从2D和3D数据中预测抓握类型、物体朝向与交接轨迹。
  • 通过捕捉人类交互中的自然非语言协调与舒适度,提升社交机器人设计。

提出的方法

  • 使用4台同步的30 FPS Kinect RGB-D相机与4台60 FPS FLIR Point Grey深度相机,实现360°共视角捕捉,采集2,720次人类-人类交接交互。
  • 利用Segment Anything Model (SAM) 协助人工标注关键事件中的物体、给予者手部与接收者手部的掩码。
  • 从首次抓握到最后一次接触,生成完整的360°融合3D点云、OpenPose骨骼数据,并追踪手部与物体的掩码。
  • 采用Cini等人提出的分类法标注抓握类型,并为给予者与接收者在交接后标注手部使用习惯与舒适度评分。
  • 为全部136种物体提供对齐的3D模型与元数据,包括116种市售物品与20种3D打印物品,涵盖17种子形态/功能类别。
  • 在数据集上训练神经网络,以预测抓握、朝向与轨迹,结果表明其性能优于基线模型。

实验结果

研究问题

  • RQ1在自然、无标记的环境中,物体的几何形状与物理属性在多大程度上影响人类交接行为?
  • RQ2在本数据集上训练的神经网络在多大程度上能高精度预测抓握类型、物体朝向与交接轨迹?
  • RQ3舒适度评分与抓握类型、物体类别及参与者配对动态之间存在何种相关性?
  • RQ4该数据集能否支持开发能够主动适应人类运动与功能偏好的人机交接控制器?
  • RQ5角色互换与参与者多样性对交接协调与轨迹模式有何影响?

主要发现

  • 该数据集包含2,720次交接交互,涉及136种不同物体,是目前在物体数量、参与者数量与角色互换对数方面规模最大的交接数据集。
  • 在HOH上训练的神经网络在抓握类型预测中达到92.3%的准确率,在朝向预测中达到87.6%,优于基线模型。
  • g2rt模型在轨迹预测准确率上相比基线模型提升15.4%,表明其在多样化物体类型上具有出色的泛化能力。
  • 给予者与接收者的舒适度评分与抓握类型及物体类别显著相关,表明舒适度是自然交接质量的可靠指标。
  • 360°多视角采集与3D点云融合技术实现了对手部-物体交互的高保真重建,即使在部分遮挡条件下亦表现良好。
  • g2rg模型在从给予者动作预测接收者抓握类型方面达到91.2%的准确率,且预测抓握区域重叠极小,可有效用于机器人系统的抓握偏好引导。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。