[论文解读] DeepCap: Monocular Human Performance Capture Using Weak Supervision
DeepCap 提出了一种弱监督的深度学习方法,用于单目密集人体动作捕捉,仅使用多视角视频和个性化模板网格,联合回归三维骨骼姿态与非刚性表面形变。通过可微渲染和分析-合成训练,该方法在三维几何重建和鲁棒性方面优于以往方法,尤其在复杂姿态下表现更优,实现了最先进(SOTA)的精度与时间一致性。
Human performance capture is a highly important computer vision problem with many applications in movie production and virtual/augmented reality. Many previous performance capture approaches either required expensive multi-view setups or did not recover dense space-time coherent geometry with frame-to-frame correspondences. We propose a novel deep learning approach for monocular dense human performance capture. Our method is trained in a weakly supervised manner based on multi-view supervision completely removing the need for training data with 3D ground truth annotations. The network architecture is based on two separate networks that disentangle the task into a pose estimation and a non-rigid surface deformation step. Extensive qualitative and quantitative evaluations show that our approach outperforms the state of the art in terms of quality and robustness.
研究动机与目标
- 实现仅从单目视频中进行密集、时空一致的三维人体动作捕捉,且无需依赖三维真实标注。
- 克服现有单目方法在捕捉全身非刚性形变或缺乏时间一致性方面的局限。
- 开发一种仅使用多视角图像和模板网格的弱监督训练范式,消除对昂贵三维标注的依赖。
- 生成一种可微的基于网格的表示,可在时间上追踪表面顶点,实现图形兼容且肢体保持的重建。
- 在遮挡和非平面运动条件下,实现复杂衣物与身体形变的高保真重建。
提出的方法
- 该方法采用双流卷积神经网络架构:一个分支用于预测骨骼姿态(PoseNet),另一分支用于预测基于网格的形变图的形变参数(DefNet)。
- 模型采用完全可微的渲染层,将预测的三维网格投影回二维图像空间,通过多视角一致性实现监督。
- 训练采用分析-合成方式,将预测的二维观测与真实多视角图像进行比较,无需三维监督。
- 形变图嵌入网格中,并通过每个节点的旋转和平移参数化,实现局部非刚性表面形变。
- 该方法使用个性化模板网格,并在一次前向传播中联合回归姿态与形变,确保时间一致性。
- 损失函数仅通过多视角视频的二维监督进行端到端优化,实现弱监督学习。
实验结果
研究问题
- RQ1单目深度学习模型是否能在无三维真实标注的情况下,实现对全身人体运动与非刚性表面形变的准确、时空一致的三维重建?
- RQ2与完全监督方法相比,多视角视频提供的弱监督在三维几何精度与鲁棒性方面表现如何?
- RQ3可微的网格表示是否能实现在遮挡与复杂姿态下的稳定、肢体保持的重建?
- RQ4与仅姿态或基于蒙皮的方法相比,形变图的集成在多大程度上提升了重建保真度?
- RQ5训练中使用的视角数量与帧数如何影响所学习三维重建的质量?
主要发现
- 在 S1 序列上,DeepCap 达到 87.2% 的 AMVIoU 和 89.26% 的 SVIoU,优于所有先前的单目方法,并接近多视角基线(91.74% AMVIoU)。
- 在 S4 序列上,DeepCap 达到 82.53% 的 AMVIoU 和 86.66% 的 SVIoU,显著优于 LiveCap(59.96% AMVIoU)和 HMR(65.1% AMVIoU)。
- 训练时增加相机视角数量,可使 AMVIoU 从 1 视角的 65.11% 提升至 7 视角的 81.73%,证明了多视角监督的优势。
- 将训练数据从 1/4 增加到完整帧数,可使 AMVIoU 从 73.41% 提升至 82.53%,表明具有数据效率与泛化能力。
- 与仅使用 PoseNet 相比,DefNet 将 AMVIoU 提升约 4%,尤其在修正松垮衣物与蒙皮伪影等局部形变方面表现更优。
- 在 S4 序列上,该方法达到 96.74% 的 3DPCK,与最佳基线性能相当,表明姿态估计精度极高。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。