[论文解读] Model-based Hand Pose Estimation for Generalized Hand Shape with Appearance Normalization
本文提出了一种基于模型的手部姿态估计方法,通过神经回归使手部形状参数(掌心形状和骨骼长度)可学习,从而实现对任意手部形状的泛化,同时使用级联的外观归一化网络通过平移、旋转和缩放减少输入方差。该方法在NYU数据集上实现了最先进精度,并优于先前将手部形状固定为单一用户的混合模型。
Since the emergence of large annotated datasets, state-of-the-art hand pose estimation methods have been mostly based on discriminative learning. Recently, a hybrid approach has embedded a kinematic layer into the deep learning structure in such a way that the pose estimates obey the physical constraints of human hand kinematics. However, the existing approach relies on a single person's hand shape parameters, which are fixed constants. Therefore, the existing hybrid method has problems to generalize to new, unseen hands. In this work, we extend the kinematic layer to make the hand shape parameters learnable. In this way, the learnt network can generalize towards arbitrary hand shapes. Furthermore, inspired by the idea of Spatial Transformer Networks, we apply a cascade of appearance normalization networks to decrease the variance in the input data. The input images are shifted, rotated, and globally scaled to a similar appearance. The effectiveness and limitations of our proposed approach are extensively evaluated on the Hands 2017 challenge dataset and the NYU dataset.
研究动机与目标
- 解决现有混合手部姿态估计方法将手部形状参数固定为单一用户所带来的局限性,防止其泛化到未见过的手部。
- 提高对输入图像中因平移、旋转和缩放引起的手部外观变化的鲁棒性。
- 实现实时、准确的3D手部姿态估计,同时尊重不同手部形状下的物理运动学约束。
- 在基准数据集上独立评估外观归一化和可学习手部形状参数的有效性,以及二者结合的效果。
提出的方法
- 引入一种新型可微分运动学层,其中手部形状参数(掌心形状和骨骼长度)由神经网络从输入图像中回归得出,从而实现对任意手部形状的泛化。
- 设计一个由神经网络组成的级联结构——BoxNet、Box+RotNet 和 Box+Rot+ScaleNet,用于估计并应用平移、旋转和缩放变换,以归一化输入的手部图像。
- 通过重新居中、旋转和重缩放输入图像,实现外观归一化,使其呈现为标准外观,从而降低输入数据的方差。
- 将外观归一化流程集成到手部姿态估计网络之前,随后通过一个将学习到的参数映射到3D关节点位置的运动学层。
- 使用残差网络(ResNet)和浅层CNN作为主干网络,以评估不同模型容量下的性能表现。
- 通过联合使用关节点回归损失和物理约束损失来训练完整流程,以确保姿态的运动学合理性。
实验结果
研究问题
- RQ1可学习的手部形状参数是否能提升混合手部姿态估计模型对未见手部形状的泛化能力?
- RQ2通过神经网络实现的外观归一化在多大程度上减少了输入图像的方差,并提升了姿态估计的准确性?
- RQ3当与深度残差网络相比,外观归一化流程在浅层架构上的性能表现如何?
- RQ4可学习的手部形状参数与外观归一化相结合是否能在标准基准上实现最先进性能?
主要发现
- 所提方法在Hands 2017挑战赛数据集上,采用可学习手部形状参数时,平均关节点定位误差为11.0 mm,优于先前的混合模型如DeepModel(16.9 mm)和DeepPrior++(12.3 mm)。
- 在NYU数据集上,该方法使用Variable Hand CNN时平均关节点定位误差为11.4 mm,使用Variable Hand ResNet时为11.0 mm,表现出最先进性能。
- 在NYU数据集上,外观归一化流程与Variable Hand CNN结合时,将关节点定位误差降低了3.3 mm,表明其在提升准确性方面的有效性。
- 外观归一化流程在ResNets上的表现存在混合结果:在NYU数据集上提升了性能,但在Hands 2017挑战赛数据集上略有下降,可能由于对领域偏移的过拟合或过度正则化所致。
- 变换参数估计流程在测试集上的平均误差为:平移10.98 mm,旋转18.54°,缩放0.0498,表明其在估计归一化参数方面具有合理准确性。
- 在已见手部形状的未见训练图像上评估时,外观归一化流程将误差降低了1.06 mm,表明其有助于泛化到未见视角;但在实际测试集上未见优势,表明Hands 2017挑战赛测试集中存在领域偏移问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。