[论文解读] Rotation-invariant Mixed Graphical Model Network for 2D Hand Pose Estimation
本文提出了一种新型的深度学习架构——旋转不变混合图模型网络(R-MGMN),用于从单目RGB图像中进行2D手部姿态估计。通过将旋转不变网络与可学习的图模型池结合,并利用分类器实现软选择,R-MGMN提升了关键点的一致性,并在CMU Panoptic数据集上相比CPM提升了4.76%的mPCK,在Large-scale 3D数据集上提升了3.35%。
In this paper, we propose a new architecture named Rotation-invariant Mixed Graphical Model Network (R-MGMN) to solve the problem of 2D hand pose estimation from a monocular RGB image. By integrating a rotation net, the R-MGMN is invariant to rotations of the hand in the image. It also has a pool of graphical models, from which a combination of graphical models could be selected, conditioning on the input image. Belief propagation is performed on each graphical model separately, generating a set of marginal distributions, which are taken as the confidence maps of hand keypoint positions. Final confidence maps are obtained by aggregating these confidence maps together. We evaluate the R-MGMN on two public hand pose datasets. Experiment results show our model outperforms the state-of-the-art algorithm which is widely used in 2D hand pose estimation by a noticeable margin.
研究动机与目标
- 为解决在严重自遮挡和手部姿态变化下2D手部姿态估计中的几何不一致性问题。
- 通过显式建模手部关节之间的空间关系,利用能适应输入图像内容的图模型,提升关键点定位精度。
- 通过学习将输入图像旋转至标准方向,实现在姿态估计中的旋转不变性。
- 通过软分类器实现灵活的、依赖输入的选择图模型,增强模型容量与适应性。
- 实现统一架构的端到端训练,结合旋转、一元回归与多个图模型。
提出的方法
- 一种旋转网络,受空间变换网络启发,用于估计并应用旋转,将手部在图像中对齐至标准方向。
- 一个软分类器输出预定义图模型池的概率分布,实现基于输入图像内容的软选择。
- 通过深度卷积网络回归一元热图,并将其作为每个图模型中的一元势能。
- 在每个图模型上独立执行信念传播,计算边缘分布,再通过软分类器的权重进行聚合。
- 通过将聚合后的边缘分布旋转回原始图像坐标系,获得最终的置信度图。
- 整个网络采用多阶段优化调度进行端到端训练,包括旋转、一元和图模型组件的独立训练阶段。
实验结果
研究问题
- RQ1通过在关键点预测前将手部对齐至标准方向,旋转不变网络是否能提升2D手部姿态估计性能?
- RQ2基于输入图像选择的多个图模型的可学习池,是否相比单一固定图模型能提升关键点的一致性?
- RQ3通过学习的分类器实现图模型的软选择,是否相比硬选择或固定模型能提升性能?
- RQ4将旋转不变性与图模型混合结合,是否能在标准基准上带来显著的性能提升?
- RQ5所提出的架构在严重遮挡情况下是否能保持高精度,而传统方法在此类情况下会失效?
主要发现
- 在CMU Panoptic数据集上,R-MGMN相比CPM基线模型,mPCK提升了4.76%,达到69.93%的mPCK。
- 在σ=0.03的阈值下,R-MGMN相比CPM的PCK提升了6.22个百分点,显著提高了关键点定位精度。
- 在Large-scale 3D Multiview Hand Pose Dataset上,R-MGMN相比CPM的mPCK提升了3.35%,在σ=0.02时PCK提升了4.19%。
- 消融实验表明,引入图模型混合相比单一图模型可使mPCK提升1.28%,而仅使用旋转网络即可使性能提升3.35%。
- 定性结果表明,R-MGMN显著减少了关键点之间的几何不一致性,并成功恢复了CPM失效的遮挡手指(如食指和拇指)。
- 该模型对噪声和遮挡表现出强鲁棒性,尤其在超过一半手部被自遮挡的困难情况下表现优异。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。