Skip to main content
QUICK REVIEW

[论文解读] RGB-based 3D Hand Pose Estimation via Privileged Learning with Depth Images

Shanxin Yuan, Björn Stenger|arXiv (Cornell University)|Nov 18, 2018
Human Pose and Action Recognition参考文献 47被引用 15
一句话总结

本文提出了一种新颖的基于RGB的3D手部姿态估计方法,通过在训练过程中利用深度图像作为特权信息,提升仅使用RGB输入进行测试时的性能。通过在大规模深度数据集上预训练基于深度的网络,并利用成对的RGB-D数据将其中级特征迁移至RGB网络,同时使用深度图像生成的手部掩码来抑制背景响应,该方法在仅使用RGB输入进行推理的情况下,在3D和2D手部姿态估计基准上实现了最先进性能。

ABSTRACT

This paper proposes a method for hand pose estimation from RGB images that uses both external large-scale depth image datasets and paired depth and RGB images as privileged information at training time. We show that providing depth information during training significantly improves performance of pose estimation from RGB images during testing. We explore different ways of using this privileged information: (1) using depth data to initially train a depth-based network, (2) using the features from the depth-based network of the paired depth images to constrain mid-level RGB network weights, and (3) using the foreground mask, obtained from the depth data, to suppress the responses from the background area. By using paired RGB and depth images, we are able to supervise the RGB-based network to learn middle layer features that mimic that of the corresponding depth-based network, which is trained on large-scale, accurately annotated depth data. During testing, when only an RGB image is available, our method produces accurate 3D hand pose predictions. Our method is also tested on 2D hand pose estimation. Experiments on three public datasets show that the method outperforms the state-of-the-art methods for hand pose estimation using RGB image input.

研究动机与目标

  • 通过利用大量且完全标注的深度数据集,弥合基于RGB和深度图像的3D手部姿态估计之间的性能差距。
  • 克服小规模、真实世界中带有精确标注的RGB数据集在3D手部姿态估计方面的局限性。
  • 引入一种新的训练范式,在模型训练期间使用深度数据作为特权信息,以提升在仅RGB测试数据上的泛化能力。
  • 证明从基于深度的网络向基于RGB的网络迁移中级特征,可显著提升姿态估计的准确性。
  • 探究基于深度图像生成的前景手部掩码在抑制特征学习过程中背景干扰方面的影响。

提出的方法

  • 在大规模、完全标注的深度数据集(如BigHand2.2M)上预训练基于深度的3D手部姿态网络,以学习鲁棒的中级特征。
  • 在第二阶段训练中使用成对的RGB和深度图像,通过特征回归损失将RGB网络的中级激活与预训练深度网络的激活对齐。
  • 引入前景手部掩码损失,通过利用基于深度的手部分割来抑制RGB网络中的背景响应。
  • 在预训练后冻结基于深度的网络,并通过结合3D姿态损失和中间特征损失的联合损失,对RGB网络进行微调。
  • 将特权学习策略嵌入到现有CNN架构(如CPM)中,用于2D和3D手部姿态估计,而无需对网络结构进行大规模修改。
  • 将该方法应用于2D和3D手部姿态估计任务,证明其在不同网络设计和数据集之间的可迁移性。

实验结果

研究问题

  • RQ1在训练过程中使用深度图像作为特权信息,是否能显著提升仅使用单张RGB图像进行测试时的3D手部姿态估计精度?
  • RQ2将基于深度的网络中的中级特征迁移至基于RGB的网络,是否能带来比从零开始训练RGB网络更好的泛化性能?
  • RQ3在训练过程中使用基于深度图像生成的手部掩码来抑制背景激活,在多大程度上能改善基于RGB的姿态估计中的特征学习?
  • RQ4与当前最先进方法相比,该提出的特权学习策略在公开基准上的性能表现如何?
  • RQ5该训练策略是否能有效迁移至不同的CNN架构和2D手部姿态估计任务?

主要发现

  • 所提方法在Stereo、RHD和Dexter-Object数据集上均优于当前最先进基于RGB的3D手部姿态估计方法,在仅使用RHD训练数据的情况下,于Dexter-Object数据集上实现了11.809的中位2D PCK。
  • 在RHD数据集上,该方法将中位2D端点误差(EPE)降低至2.642,相较于基线RGB-only模型的3.708,显示出特权学习带来的显著改进。
  • 结合中级特征正则化的联合损失在约30,000次迭代后收敛,表明在特权信息微调阶段优化过程稳定。
  • 在训练中使用基于深度图像生成的手部掩码可减少背景干扰,提升特征质量,从而在定性结果中实现更精确的关键点定位。
  • 在仅使用基于深度的监督时,该方法在RHD数据集上实现了2.087的中位EPE;而采用特权学习的RGB模型达到2.642的EPE,表明当受到深度数据引导时,RGB网络可接近基于深度的性能表现。
  • 即使训练数据较少(仅使用RHD),该方法仍优于在RHD和Stereo数据集上联合训练的SOTA模型(Z&B_Joint),凸显了该特权学习方法的数据效率优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。