Skip to main content
QUICK REVIEW

[论文解读] Silhouette-Net: 3D Hand Pose Estimation from Silhouettes

Kuo‐Wei Lee, Shih‐Hung Liu|arXiv (Cornell University)|Dec 28, 2019
Human Pose and Action Recognition参考文献 30被引用 4
一句话总结

Silhouette-Net 提出了一种端到端的深度学习框架,仅通过二值化手部轮廓图即可估计3D手部姿态,无需依赖深度图。通过在深度感知网络(DPN)和残差预测网络(RPN)中学习隐式的深度感知能力,该模型在 HIM2017 基准测试中取得了最先进性能,平均误差为 5.60 mm,每关节最大误差为 7.63 mm。

ABSTRACT

3D hand pose estimation has received a lot of attention for its wide range of applications and has made great progress owing to the development of deep learning. Existing approaches mainly consider different input modalities and settings, such as monocular RGB, multi-view RGB, depth, or point cloud, to provide sufficient cues for resolving variations caused by self occlusion and viewpoint change. In contrast, this work aims to address the less-explored idea of using minimal information to estimate 3D hand poses. We present a new architecture that automatically learns a guidance from implicit depth perception and solves the ambiguity of hand pose through end-to-end training. The experimental results show that 3D hand poses can be accurately estimated from solely {\em hand silhouettes} without using depth maps. Extensive evaluations on the {\em 2017 Hands In the Million Challenge} (HIM2017) benchmark dataset further demonstrate that our method achieves comparable or even better performance than recent depth-based approaches and serves as the state-of-the-art of its own kind on estimating 3D hand poses from silhouettes.

研究动机与目标

  • 解决仅使用最少输入(即二值化手部轮廓图)进行3D手部姿态估计的挑战,而非依赖深度图或RGB图像。
  • 探究隐式深度感知是否足以替代显式的深度图监督,以实现准确的3D手部姿态估计。
  • 开发一种低成本、鲁棒的系统,在仅使用轮廓图输入的前提下,仍能保持高精度,即使面对自遮挡和视角变化。
  • 证明学习“深度概念”比拥有精确的深度值对准确的3D姿态预测更为关键。

提出的方法

  • 该模型采用多视角输入策略,通过处理正面和侧面视角的轮廓图以提升空间理解能力。
  • 设计了一种深度感知网络(DPN),其架构类似U-Net与特征金字塔网络(FPN),用于从轮廓图中学习分层的、多尺度的空间表征。
  • DPN 生成隐式的深度感知引导信号,用于约束并增强残差预测网络(RPN)中3D关节点位置的预测。
  • 整个网络通过轮廓图作为输入进行端到端训练,训练期间可选择性地使用真实深度图作为监督信号。
  • 从多个视角学习深度感知的潜在表征,使模型能够在无显式深度数据的情况下推断3D结构。
  • 最终通过回归头输出21个手部关节点的3D坐标,融合来自DPN和RPN的特征。

实验结果

研究问题

  • RQ1是否可以仅使用二值化手部轮廓图,而无需任何深度图或RGB输入,实现准确的3D手部姿态估计?
  • RQ2隐式深度感知是否足以实现与基于深度图的方法相当的3D手部姿态估计性能?
  • RQ3与单视角输入相比,多视角轮廓图输入在准确性和鲁棒性方面表现如何?
  • RQ4当测试输入仅为轮廓图时,训练阶段使用真实深度图监督在多大程度上能提升性能?
  • RQ5在无显式深度线索的情况下,仅使用轮廓图训练的模型是否能良好泛化至遮挡和复杂手部姿态?

主要发现

  • Silhouette-Net 在 HIM2017 基准测试中实现了 5.60 mm 的平均误差和 7.63 mm 的每关节最大误差,优于多个最先进的基于深度图的方法。
  • 采用正面和侧面视角的多视角版本 Silhouette-Net 显著优于单视角基线模型(单视角平均误差为 7.07 mm),显著提升了准确性。
  • 即使在训练阶段未使用真实深度图监督,模型仍实现了优异性能(平均误差 6.75 mm),表明深度感知学习具有鲁棒性和有效性。
  • 在训练中引入真实深度图监督后,性能进一步提升至 5.60 mm 的平均误差,表明监督可增强性能,但并非最终结果所必需。
  • 该方法表明,学习深度感知比拥有精确的深度图更为关键,因为模型仅从轮廓图中即可实现良好泛化。
  • 该方法的性能超越了多个基于RGBD的最先进方法,证明在结合有效的隐式深度学习时,极简输入亦可实现高精度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。