Skip to main content
QUICK REVIEW

[论文解读] Monocular Real-time Hand Shape and Motion Capture using Multi-modal Data

Yuxiao Zhou, Marc Habermann|arXiv (Cornell University)|Mar 21, 2020
Human Pose and Action Recognition参考文献 53被引用 8
一句话总结

本文提出了一种实时、单目手部形状与运动捕捉方法,通过一种新颖的深度学习架构联合估计3D关节位置和旋转。通过整合2D/3D标注图像与独立的3D动作捕捉数据,该方法在两阶段网络架构下实现了100fps的推理速度,并达到最先进水平的精度:第一阶段使用DetNet进行3D关节检测,第二阶段采用端到端的逆运动学网络(IKNet),在一次前向传播中回归关节旋转,显著提升了姿态精度与解剖学合理性。

ABSTRACT

We present a novel method for monocular hand shape and pose estimation at unprecedented runtime performance of 100fps and at state-of-the-art accuracy. This is enabled by a new learning based architecture designed such that it can make use of all the sources of available hand training data: image data with either 2D or 3D annotations, as well as stand-alone 3D animations without corresponding image data. It features a 3D hand joint detection module and an inverse kinematics module which regresses not only 3D joint positions but also maps them to joint rotations in a single feed-forward pass. This output makes the method more directly usable for applications in computer vision and graphics compared to only regressing 3D joint positions. We demonstrate that our architectural design leads to a significant quantitative and qualitative improvement over the state of the art on several challenging benchmarks. Our model is publicly available for future research.

研究动机与目标

  • 通过仅使用单个RGB摄像头,实现实时、高精度的单目手部运动捕捉。
  • 克服先前方法未能充分利用所有可用训练数据模态的局限,包括2D/3D标注图像与独立的3D动作捕捉(MoCap)数据。
  • 直接回归关节旋转而非仅回归3D关节位置,从而更直接地应用于计算机图形学及VR/AR应用。
  • 通过联合利用动作捕捉数据的监督与3D关节位置的弱监督,学习姿态先验,提升鲁棒性与解剖学正确性。
  • 设计统一架构,有效利用图像与动作捕捉数据,即使在成对数据稀缺的情况下亦能保持性能。

提出的方法

  • 该方法采用两模块架构:DetNet用于3D手部关节检测,通过多任务学习联合优化2D与3D关节预测。
  • DetNet在真实图像(含2D/3D标注)与合成图像的组合数据上进行训练,实现从单目RGB输入中鲁棒地估计3D关节。
  • 端到端的逆运动学网络(IKNet)以DetNet输出的3D关节预测为输入,在一次前向传播中回归关节旋转。
  • IKNet通过动作捕捉数据的直接旋转监督与3D关节位置数据的弱监督联合训练,学习准确的姿态先验。
  • 网络采用结合L2损失与四元数余弦损失的联合损失函数,以提升旋转估计精度。
  • 模型在多样化数据源(RHD、STB、3DPosData与动作捕捉数据)上进行联合训练,最大化泛化能力与鲁棒性。

实验结果

研究问题

  • RQ1单一深度学习模型能否有效利用多种数据模态——包括2D/3D标注图像与独立的3D动作捕捉数据——实现单目手部姿态估计?
  • RQ2与仅回归3D位置相比,直接从3D关节预测回归关节旋转是否能提升精度与解剖学合理性?
  • RQ3通过动作捕捉数据的旋转监督进行端到端训练的逆运动学网络,是否能超越依赖后处理拟合或弱监督的方法?
  • RQ4将3D关节位置的弱监督与直接旋转监督相结合,对模型鲁棒性与泛化能力有何影响?
  • RQ5将检测与旋转回归分离的架构设计,在多大程度上提升了训练稳定性与性能?

主要发现

  • 所提方法实现100fps的推理速度,可在单个RGB摄像头下实现实时性能。
  • 在DO基准测试中,该方法AUC达到0.948,优于先前最先进方法(0.923),且使用相同训练数据。
  • 引入IKNet使AUC相比仅使用DetNet提升2.5个百分点,证明了学习姿态先验的价值。
  • 若去除来自动作捕捉数据的旋转监督,即使3D关节位置准确,仍会产生解剖学上不正确的姿态,证明其必要性。
  • L2损失与四元数余弦损失的结合实现了最高精度,其中余弦损失在处理旋转差异时更为有效。
  • 消融实验表明,IKNet在DetNet生成的噪声3D预测(通过3DPosData获得)上进行训练对性能至关重要,因其显著提升了对真实世界数据的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。