Skip to main content
QUICK REVIEW

[论文解读] Procedural Humans for Computer Vision

Charlie Hewitt, Tadas Baltrušaitis|arXiv (Cornell University)|Jan 3, 2023
Face recognition and analysis被引用 4
一句话总结

本文提出了一种参数化、程序化生成的3D人体模型,结合[20]中的高保真面部细节与SMPL-H以实现全身形状和姿态控制,从而能够生成带有密集3D真实标注的逼真合成数据。该方法通过可微分渲染管道与学习先验的优化,实现了从多视角2D关键点准确重建3D人体,即使在自遮挡和高运动复杂度情况下也具有鲁棒性。

ABSTRACT

Recent work has shown the benefits of synthetic data for use in computer vision, with applications ranging from autonomous driving to face landmark detection and reconstruction. There are a number of benefits of using synthetic data from privacy preservation and bias elimination to quality and feasibility of annotation. Generating human-centered synthetic data is a particular challenge in terms of realism and domain-gap, though recent work has shown that effective machine learning models can be trained using synthetic face data alone. We show that this can be extended to include the full body by building on the pipeline of Wood et al. to generate synthetic images of humans in their entirety, with ground-truth annotations for computer vision applications. In this report we describe how we construct a parametric model of the face and body, including articulated hands; our rendering pipeline to generate realistic images of humans based on this body model; an approach for training DNNs to regress a dense set of landmarks covering the entire body; and a method for fitting our body model to dense landmarks predicted from multiple views.

研究动机与目标

  • 为解决计算机视觉中生成逼真、全标注合成人体数据的挑战,减少域差距和标注成本。
  • 将先前关于合成面部数据的工作扩展至包含密集3D标注(如关节活动的手部和面部表情)的全身人体模型。
  • 通过可微分渲染管道与学习先验的优化,实现从多视角2D关键点准确重建3D人体。
  • 克服人体姿态估计相比面部重建更高的模糊性和自遮挡问题,需依赖多视角输入与鲁棒初始化。

提出的方法

  • 将[20]中的高保真面部模型与SMPL-H结合,创建一个包含12,943个顶点和54个关节点的统一参数化人体模型,支持身份、表情和姿态控制。
  • 使用线性骨骼蒙皮(LBS)函数与手工编写蒙皮权重,根据关节点旋转对网格进行形变,同时结合SMPL-H的姿势相关混合形状。
  • 通过将[20]头部模型对齐至SMPL,合并网格并手工设计拓扑以实现平滑过渡,并调整UV空间以保证纹理兼容性。
  • 通过映射函数将源模型的基底(身份、表情、姿态、蒙皮权重)转移至新拓扑,确保与现有资产的兼容性。
  • 采用可微分渲染管道从参数化模型生成逼真图像,支持端到端训练深度神经网络(DNN)以实现密集2D关键点回归。
  • 利用包含数据项与正则化项的多视角优化框架,将完整人体模型拟合至预测的2D关键点,其中包含用于姿态和身份的高斯混合模型(GMM)先验。

实验结果

研究问题

  • RQ1能否使用程序化生成的、具有全身与面部高保真细节的3D人体模型,合成用于计算机视觉训练的逼真数据?
  • RQ2如何利用此类模型高效地大规模生成密集3D真实标注(如关键点、形状、姿态)?
  • RQ3在自遮挡和姿态模糊性较高的情况下,何种优化策略可实现从多视角2D关键点鲁棒地重建3D人体?
  • RQ4与L2正则化相比,学习先验(如姿态与身份的GMM)如何提升重建精度与合理性?
  • RQ5多视角输入与高质量初始化在解决单目3D人体重建病态性问题中起到何种作用?

主要发现

  • 所提出的模型在面部保真度上显著优于SMPL-H,同时保持与现有SMPL-H资产和流程的兼容性。
  • 使用该模型生成的合成数据可有效用于训练DNN以实现高精度的密集2D关键点回归。
  • 多视角输入(C ≥ 3台相机)对鲁棒3D重建至关重要,且随着视角数量增加,性能显著提升。
  • 使用GMM先验(尤其是针对每只手)进行姿态与身份建模,相比L2正则化,能生成更合理、更逼真的3D重建结果。
  • 基于机器学习的单视角姿态初始化显著提升收敛速度与精度,尤其在复杂手部姿态下表现更优。
  • 采用多视角关键点的模型拟合实现了高精度的3D一致性与精确的世界空间配准,优于未显式强制跨视角一致性的方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。