Skip to main content
QUICK REVIEW

[论文解读] Simultaneous Hand Pose and Skeleton Bone-Lengths Estimation from a Single Depth Image

Jameel Malik, Ahmed Elhayek|arXiv (Cornell University)|Dec 8, 2017
Hand Gesture Recognition Systems参考文献 31被引用 7
一句话总结

本文提出了一种新颖的混合深度学习方法,通过带有可学习缩放参数的卷积神经网络(CNN)和可微分前向运动学层,从单张深度图像中端到端地同时估计3D手部姿态和手部骨骼骨长。该方法在ICVL和合并数据集上实现了最先进(SOTA)的精度,其在统一的、具有大变化范围的数据集(HandSet)上进行端到端训练,优于以往假设手部几何结构固定的模型。

ABSTRACT

Articulated hand pose estimation is a challenging task for human-computer interaction. The state-of-the-art hand pose estimation algorithms work only with one or a few subjects for which they have been calibrated or trained. Particularly, the hybrid methods based on learning followed by model fitting or model based deep learning do not explicitly consider varying hand shapes and sizes. In this work, we introduce a novel hybrid algorithm for estimating the 3D hand pose as well as bone-lengths of the hand skeleton at the same time, from a single depth image. The proposed CNN architecture learns hand pose parameters and scale parameters associated with the bone-lengths simultaneously. Subsequently, a new hybrid forward kinematics layer employs both parameters to estimate 3D joint positions of the hand. For end-to-end training, we combine three public datasets NYU, ICVL and MSRA-2015 in one unified format to achieve large variation in hand shapes and sizes. Among hybrid methods, our method shows improved accuracy over the state-of-the-art on the combined dataset and the ICVL dataset that contain multiple subjects. Also, our algorithm is demonstrated to work well with unseen images.

研究动机与目标

  • 解决现有混合手部姿态估计方法因假设固定手部几何结构而导致在不同手部形状和尺寸间泛化能力不足的问题。
  • 开发一种统一的深度学习框架,从单张深度图像中联合估计3D手部姿态和骨长。
  • 通过将NYU、ICVL和MSRA-2015数据集以统一格式整合,构建大规模、多样化的手部姿态数据集(HandSet),以提升模型泛化能力。
  • 通过可学习参数显式建模手部缩放变化,实现端到端训练,提升对未见受试者的鲁棒性。

提出的方法

  • 设计一种CNN架构,用于预测3D手部姿态参数以及与手部骨骼每根骨相关的缩放参数。
  • 提出一种新型可微分前向运动学层,将估计的姿态和缩放参数整合,计算3D关节位置,支持通过运动链进行反向传播。
  • 实现三种变体:GlobalScale(一个全局缩放参数)、MultiScale(每根骨独立缩放)和5Scales(五个用于主要手部节段的可学习缩放参数)。
  • 在统一数据集(HandSet)上进行端到端训练,该数据集通过整合NYU、ICVL和MSRA-2015并保持一致的预处理和标注方式构建而成。
  • 前向运动学层通过在推理过程中施加骨骼约束,确保姿态的物理合理性。
  • 使用关节位置的L2损失与一种可微分运动学函数联合训练模型,以尊重手部几何结构。

实验结果

研究问题

  • RQ1深度学习模型能否从单张深度图像中同时估计3D手部姿态和骨长,并在不同手部形状和尺寸间实现更优的泛化能力?
  • RQ2在端到端训练中显式学习手部缩放参数,与固定几何结构模型相比,性能提升程度如何?
  • RQ3将多个真实世界数据集整合为统一格式(HandSet)在多大程度上提升了模型的鲁棒性和泛化能力?
  • RQ4所提方法能否泛化到训练过程中未见的受试者和复杂手部姿态?

主要发现

  • 5Scales架构在HandSet测试集上实现了最低的3D关节位置误差(12.7mm),优于Zhou等人[34](18.7mm)和其他基线方法。
  • 在ICVL数据集上,所提方法实现了10.0mm的3D关节位置误差,优于最先进方法LRF[25](12.6mm)和Zhou等人[34](11.5mm)。
  • 与仅包含一个受试者的NYU数据集相比,该方法在ICVL数据集上表现出更优的泛化能力,后者包含更大的手部形状和尺寸变化。
  • GlobalScale和MultiScale变体存在局限性:GlobalScale因缩放约束过强而表现受限,而MultiScale则因独立学习每根骨的长度而出现不稳定性。
  • 模型收敛稳定,且在未见图像上泛化良好,如HandSet数据集上的定性比较所示。
  • 所提出的HandSet数据集整合了NYU、ICVL和MSRA-2015,显著提升了手部形状、尺寸和复杂姿态的多样性,增强了训练的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。