Skip to main content
QUICK REVIEW

[论文解读] GANerated Hands for Real-time 3D Hand Tracking from Monocular RGB

Franziska Mueller, Florian Bernard|arXiv (Cornell University)|Dec 4, 2017
Human Pose and Action Recognition参考文献 57被引用 8
一句话总结

本文提出了一种基于单目RGB视频的实时3D手部追踪系统,利用一种新型几何一致生成对抗网络(GAN)从合成数据中生成逼真的手部图像,同时保留姿态标注。该方法通过在GAN处理后的合成数据上训练卷积神经网络(CNN),在仅使用RGB的基准测试中实现了最先进性能,实现了在遮挡和视角变化下鲁棒、时序平滑且解剖学上合理的3D手部追踪。

ABSTRACT

We address the highly challenging problem of real-time 3D hand tracking based on a monocular RGB-only sequence. Our tracking method combines a convolutional neural network with a kinematic 3D hand model, such that it generalizes well to unseen data, is robust to occlusions and varying camera viewpoints, and leads to anatomically plausible as well as temporally smooth hand motions. For training our CNN we propose a novel approach for the synthetic generation of training data that is based on a geometrically consistent image-to-image translation network. To be more specific, we use a neural network that translates synthetic images to "real" images, such that the so-generated images follow the same statistical distribution as real-world hand images. For training this translation network we combine an adversarial loss and a cycle-consistency loss with a geometric consistency loss in order to preserve geometric properties (such as hand pose) during translation. We demonstrate that our hand tracking system outperforms the current state-of-the-art on challenging RGB-only footage.

研究动机与目标

  • 实现从非约束单目RGB视频中实时进行3D手部追踪,该任务因深度模糊、遮挡和视角变化而具有挑战性。
  • 解决用于训练深度学习模型的大规模、高保真、3D标注RGB数据集的缺乏问题。
  • 通过使在合成数据上训练的CNN分布与真实图像对齐,提升其泛化能力,而无需配对的真实-合成数据。
  • 开发一种在图像到图像转换过程中保留手部姿态的方法,确保合成的3D标注在转换为真实图像后依然有效。

提出的方法

  • 使用对抗损失、循环一致性损失和一种新型几何一致性损失训练几何一致GAN(GeoConGAN),将合成手部图像转换为外观逼真的图像,同时保留手部姿态。
  • 几何一致性损失确保源合成图像中的3D手部关键点在转换后的图像中得以保留,最大限度减少纹理渗出并保持轮廓清晰。
  • 利用3D手部模型生成具有完美3D真实值的合成手部图像,并通过变化的光照、视角和背景生成多样化训练集。
  • 将转换后的图像(称为“GANerated”图像)用于训练CNN(RegNet),该网络从RGB输入中联合回归2D关键点热力图和相对于根关节的3D关键点位置。
  • 通过运动学拟合步骤,将2D预测结果与相对3D关键点位置结合,恢复全局3D手部姿态,解决深度模糊问题并确保时序平滑性。
  • 最终追踪流水线可在实时运行,单次前向传播耗时13 ms(在GTX 1080 Ti上),支持在标准RGB网络摄像头上的部署。

实验结果

研究问题

  • RQ1基于GAN的图像到图像转换方法是否能在无需配对真实-合成数据的情况下,保留从合成图像到真实风格图像转换过程中的3D手部姿态?
  • RQ2在GANerated图像(即转换为接近真实分布的合成图像)上训练CNN,是否能相比在原始合成数据上训练,提升在真实RGB视频上的3D手部追踪性能?
  • RQ3单目RGB输入系统在遮挡和非约束相机视角下,能在多大程度上实现实时、鲁棒的3D手部追踪?
  • RQ4与最先进RGB-D和RGB-only手部追踪方法相比,该方法在估计全局手部根位置方面的准确性如何?

主要发现

  • 所提出的GeoConGAN通过保留手部姿态、减少纹理渗出并增强轮廓清晰度,显著提升了图像转换质量,相比标准CycleGAN有明显改进。
  • 在仅使用RGB的Dexter和EgoDexter数据集上,基于GANerated数据训练的RegNet模型实现了最先进性能,3D PCK(关键点正确率)优于以往方法。
  • 在Dexter+Object基准测试中,该方法在20mm阈值下达到78.4%的3D PCK,表明即使仅使用RGB输入,性能依然出色。
  • 消融研究证实,几何一致性损失对转换过程中姿态的保留至关重要,其移除会导致显著的姿态失真和性能下降。
  • 系统在消费级GPU上实现13ms/次推理的实时运行,支持在标准RGB网络摄像头中部署于非约束环境。
  • 与RGB-D方法的定量比较表明,主要性能差距源于根位置估计不准确,提示根姿态仍是单目RGB-only追踪中的关键挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。