Skip to main content
QUICK REVIEW

[论文解读] Hand Pose Estimation through Semi-Supervised and Weakly-Supervised Learning

Natalia Neverova, Christian Wolf|arXiv (Cornell University)|Nov 20, 2015
Human Pose and Action Recognition参考文献 49被引用 6
一句话总结

本文提出了一种半监督和弱监督的深度学习方法,用于手部姿态估计,通过融合原始深度数据与部件分割中间表示,提升关节点回归的准确性。该方法利用密集标注的合成数据和仅含关节点标注的真实图像,通过将预测块与合成字典对齐,学习高保真度的分割结果,相较于直接回归,在NYU数据集上将2D关节点误差降低了15.7%。

ABSTRACT

We propose a method for hand pose estimation based on a deep regressor trained on two different kinds of input. Raw depth data is fused with an intermediate representation in the form of a segmentation of the hand into parts. This intermediate representation contains important topological information and provides useful cues for reasoning about joint locations. The mapping from raw depth to segmentation maps is learned in a semi/weakly-supervised way from two different datasets: (i) a synthetic dataset created through a rendering pipeline including densely labeled ground truth (pixelwise segmentations); and (ii) a dataset with real images for which ground truth joint positions are available, but not dense segmentations. Loss for training on real images is generated from a patch-wise restoration process, which aligns tentative segmentation maps with a large dictionary of synthetic poses. The underlying premise is that the domain shift between synthetic and real data is smaller in the intermediate representation, where labels carry geometric and topological meaning, than in the raw input domain. Experiments on the NYU dataset show that the proposed training method decreases error on joints over direct regression of joints from depth data by 15.7%.

研究动机与目标

  • 通过将结构化的中间表示(部件分割)与原始深度输入相结合,提升手部姿态估计的准确性。
  • 通过利用关节点位置的弱监督信号,实现在无需密集分割标注的真实深度数据上的训练。
  • 通过在共享潜在空间中学习中间表示,减轻合成数据与真实数据之间的域偏移。
  • 证明结构化的中间表示相较于直接关节点回归,能提供更强的几何与拓扑线索。
  • 开发一种基于块的重建过程,将真实图像预测的分割结果与大规模合成部件图字典对齐。

提出的方法

  • 通过融合原始深度输入与部件分割图为中间表示,训练一个深度回归器以预测关节点位置。
  • 分割网络采用半监督方式训练:使用密集标注的合成数据,并通过将真实图像的预测块与合成块字典对齐,实现弱监督。
  • 基于块的重建过程利用几何与拓扑一致性作为监督信号,将真实图像的初步分割图与最相似的合成块对齐。
  • 该方法利用部件分割的结构化标签空间——其标签具有邻接性、拓扑结构与几何特性——以指导弱监督学习。
  • 训练使用两个数据集:带有密集像素级部件分割的合成深度图像,以及仅含关节点位置标注的真实深度图像。
  • 最终模型可实现实时推理(每只手31–58 ms),且不依赖逆向运动学等后处理步骤。

实验结果

研究问题

  • RQ1结构化的中间表示(如部件分割)是否能提升深度回归在手部姿态估计中的准确性?
  • RQ2如何在仅使用关节点位置标注的情况下,对真实深度图像中的分割网络进行训练,而无需密集标注?
  • RQ3当操作于中间表示空间而非原始输入空间时,合成数据与真实数据之间的域偏移是否更容易处理?
  • RQ4将真实数据的分割图与合成字典进行基于块的对齐,能否作为学习高保真部件分割的有效弱监督信号?
  • RQ5与直接回归相比,融合深度与分割信息在2D和3D关节点定位误差方面改善程度如何?

主要发现

  • 与直接从深度数据回归相比,该方法在NYU手部姿态数据集上将2D平均关节点误差降低了15.7%。
  • 在不使用逆向运动学或后处理的情况下,该模型在深度学习方法中达到了最先进性能。
  • 弱监督训练流程仅依赖关节点位置标注,即可在真实数据上实现高保真度的分割预测。
  • 基于块的重建过程通过将真实图像块与大规模合成部件图字典对齐,有效缓解了域偏移问题。
  • 该方法可实现实时推理,24×24分辨率的分割推理耗时31 ms,48×48分辨率耗时58 ms。
  • 在2D和3D定位精度方面,该模型优于纯监督基线方法以及非深度学习方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。