Skip to main content
QUICK REVIEW

[论文解读] A high fidelity synthetic face framework for computer vision

Tadas Baltrušaitis, Erroll Wood|arXiv (Cornell University)|Jul 16, 2020
Face recognition and analysis参考文献 11被引用 4
一句话总结

本文提出了一种用于计算机视觉的高保真合成人脸框架,通过参数化3D人脸模型、学习得到的身份与表情混合形状、手工制作的发型资源以及基于图像的光照,生成多样化、逼真且带有精确真实标注的人脸图像。该框架可实现可扩展、一致且准确的数据合成,对形状、纹理、表情、姿态、光照和发型具有前所未有的控制能力。

ABSTRACT

Analysis of faces is one of the core applications of computer vision, with tasks ranging from landmark alignment, head pose estimation, expression recognition, and face recognition among others. However, building reliable methods requires time-consuming data collection and often even more time-consuming manual annotation, which can be unreliable. In our work we propose synthesizing such facial data, including ground truth annotations that would be almost impossible to acquire through manual annotation at the consistency and scale possible through use of synthetic data. We use a parametric face model together with hand crafted assets which enable us to generate training data with unprecedented quality and diversity (varying shape, texture, expression, pose, lighting, and hair).

研究动机与目标

  • 解决为计算机视觉任务收集大规模、准确标注的真实人脸数据的挑战。
  • 生成具有真实标注的合成人脸数据,这些标注在大规模下难以或无法手动获取。
  • 实现高保真、多样化且可控的数据合成,涵盖身份、表情、姿态、光照、纹理和发型。
  • 通过真实、一致且完全监督的合成人脸数据支持机器学习训练。
  • 提供可扩展的流水线,用于生成具有对几何和外观因素精确控制的多样化人脸图像。

提出的方法

  • 该框架使用包含7127个顶点和6908个四边形面的参数化3D人脸模型,通过混合形状和线性混合蒙皮对身份、表情和姿态进行参数化。
  • 利用101个高质量3D扫描数据,通过联合优化模型参数和混合形状,最小化几何损失和正则化损失,学习身份和表情混合形状。
  • 纹理通过具有50维潜在空间的VAE表示,使用裁剪的人脸区域进行训练,结合感知损失和MSE损失,实现解耦且紧凑的表示。
  • 发型通过基于物理的着色器建模为3D发丝,包含136种头皮发丝、50种眉毛、71种胡须和3种睫毛样式,每种发型通过黑色素和灰色比例参数分配颜色。
  • 发型通过UV图表示长度和密度,通过体积图表示流向方向,结合主成分分析(PCA)实现降维,以适配机器学习使用。
  • 光照通过324张HDR环境贴图模拟,经log(1+I)预处理后,通过PCA降维至50维,以捕捉80%的方差,每张图像额外进行5次随机旋转以实现数据增强。

实验结果

研究问题

  • RQ1合成人脸生成流水线能否生成逼真图像,并为计算机视觉任务提供准确、一致且完全监督的标注?
  • RQ2如何优化3D人脸模型,以联合学习身份和表情混合形状,同时保持几何保真度并避免伪影?
  • RQ3基于VAE的纹理表示在实现紧凑、解耦的潜在编码以用于机器学习的同时,能在多大程度上保留面部细节?
  • RQ4如何对3D发丝进行建模与参数化,以在不同光照和人脸几何条件下支持多样化、逼真且可训练的发型?
  • RQ5经过PCA降维的HDR图像光照能否有效模拟多样化、逼真的光照条件,同时实现高效的数据增强?

主要发现

  • 该框架通过单一渲染流水线生成1024×1024的逼真人脸图像,涵盖身份、表情、姿态、光照、纹理和发型的高多样性。
  • 模型参数与身份混合形状的联合优化实现了高几何精度,最小化了顶点和法线位置的误差,同时确保了解剖学上的合理性与网格质量。
  • 基于VAE的纹理表示实现了50维的紧凑潜在空间,保留了感知质量,并能有效生成多样化的面部纹理。
  • 通过UV图和体积图表示发型,实现了复杂发型的精确重建,结合PCA降维,支持高效的机器学习应用。
  • 经过PCA降维的HDR光照模型仅用50维就捕捉了80%的方差,实现了高效且逼真的光照变化,覆盖1620种增强后的光照条件。
  • 整个流水线生成的合成数据包含形状、姿态、表情和外观的真实标注,可实现无需人工标注的可靠计算机视觉模型训练。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。