Skip to main content
QUICK REVIEW

[论文解读] Understanding Human Hands in Contact at Internet Scale

Dandan Shan, Jiaqi Geng|arXiv (Cornell University)|Jun 11, 2020
Human Pose and Action Recognition参考文献 32被引用 7
一句话总结

该论文提出了一种多任务深度学习模型,用于从互联网规模的视频中RGB图像推断丰富的手部接触状态——包括手部位置、左右侧、接触类型(无接触、自接触、与他人接触、与非便携物体接触、与便携物体接触)以及物体边界框。该模型在新构建的10万帧数据集(100DOH)和131天原始视频上进行训练,实现了90%的VOC AP,并支持下游的3D网格重建与自监督网格质量评估,AUROC达90%,证明了在大规模人机交互分析中的可行性。

ABSTRACT

Hands are the central means by which humans manipulate their world and being able to reliably extract hand state information from Internet videos of humans engaged in their hands has the potential to pave the way to systems that can learn from petabytes of video data. This paper proposes steps towards this by inferring a rich representation of hands engaged in interaction method that includes: hand location, side, contact state, and a box around the object in contact. To support this effort, we gather a large-scale dataset of hands in contact with objects consisting of 131 days of footage as well as a 100K annotated hand-contact video frame dataset. The learned model on this dataset can serve as a foundation for hand-contact understanding in videos. We quantitatively evaluate it both on its own and in service of predicting and learning from 3D meshes of human hands.

研究动机与目标

  • 利用互联网规模的视频数据实现对人手与物体接触状态的大规模理解。
  • 解决消费类视频中极端视角和上下文多样性带来的挑战,这些挑战限制了现有实验室环境下的手部分析方法。
  • 开发一种鲁棒且可泛化的系统,推断丰富的手部状态表征(位置、左右侧、接触状态、物体边界框),以支持下游任务如3D网格重建。
  • 构建一个大规模、多样化且丰富标注的数据集(100DOH),以支持此类系统的训练与评估。
  • 展示该系统在实现真实YouTube视频中3D网格重建与质量评估方面的实用性。

提出的方法

  • 提出一种多任务深度学习模型,用于预测手部边界框、手部左右侧、接触状态(五种类别)以及与手接触的物体边界框。
  • 在通过类型标签抓取方式收集的131天视频数据集的一个10万帧子集(100DOH)上训练该模型,数据集包含对手部状态与接触状态的丰富人工标注。
  • 利用预测的手部左右侧与位置信息,通过先进的3D网格重建方法(例如,[21])实现从非结构化互联网视频中的重建。
  • 提出一种基于多层感知机(MLP)的自监督网格质量评估方法,其正负样本标签来源于网格生成过程中的自一致性,该方法在人工标注数据上实现了90%的AUROC。
  • 采用双选项人工判断协议,结合哨兵检测与资格检查,以评估网格的合理性与未来预测性能。
  • 通过在域外视频上进行测试,验证了模型的泛化能力,并测量人类对预测抓握姿态相对于随机抓握姿态的偏好度(72%偏好预测结果)。

实验结果

研究问题

  • RQ1深度学习模型是否能在具有极端视角与尺度变化的多样化互联网视频中,实现高泛化性能(如90% VOC AP)的手部检测与接触状态预测?
  • RQ2预测的手部状态(位置、左右侧、接触类型)是否可作为在非结构化真实视频中进行3D网格重建的可靠基础?
  • RQ3自监督方法是否能仅通过预测间的一致性,有效识别出合理的3D手部网格重建,而无需真实网格作为监督信号?
  • RQ4该系统的输出是否能支持有意义的下游学习,例如从静态图像中预测合理的未来手-物体交互?
  • RQ5在人类评估中,该模型的预测结果在多大程度上优于随机抓握姿态,表明其能从复杂场景中提取出真实有效的信号?

主要发现

  • 所提出的模型在手部检测与接触状态预测任务上实现了90%的VOC AP,跨数据集泛化性能优异,甚至在某些情况下优于域内训练与测试的性能。
  • 该系统通过准确预测手部左右侧与位置,使3D网格重建方法(如[21])能够应用于YouTube视频,而这些信息是实现正确网格生成的关键。
  • 自监督网格质量评估方法实现了90%的AUROC,显著优于基线的多变量高斯似然方法(60% AUROC),证明了有标注正负样本的价值。
  • 在双选项比较中,72%的众包工作者更偏好系统预测的网格而非随机生成的网格,表明模型能从图像中提取出有意义且合理的手部构型。
  • 该模型成功识别出视频序列中的接触状态变化,并实现了3,000个合理的手-物体交互示例的重建,定性结果表明在多种场景下均能准确预测抓握角度。
  • 100DOH数据集包含131天的多样化视频素材与10万帧人工标注帧,支持高性能模型训练,并推动了大规模人机交互理解领域的研究进展。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。