Skip to main content
QUICK REVIEW

[论文解读] Landmark Detection and 3D Face Reconstruction for Caricature using a Nonlinear Parametric Model

Hongrui Cai, Yudong Guo|arXiv (Cornell University)|Apr 20, 2020
Face recognition and analysis参考文献 57被引用 6
一句话总结

本文提出了一种首个端到端的方法,通过一种新颖的非线性参数化3D漫画模型,从单张2D漫画图像中自动检测2D关键点并重建3D人脸。通过在包含6,000张标注漫画的大规模数据集上训练深度神经网络,回归3D形状和姿态,该方法实现了最先进水平的精度和实时推理(每张图像10ms),在速度和关键点精度方面均优于现有方法,且无需人工输入关键点。

ABSTRACT

Caricature is an artistic abstraction of the human face by distorting or exaggerating certain facial features, while still retains a likeness with the given face. Due to the large diversity of geometric and texture variations, automatic landmark detection and 3D face reconstruction for caricature is a challenging problem and has rarely been studied before. In this paper, we propose the first automatic method for this task by a novel 3D approach. To this end, we first build a dataset with various styles of 2D caricatures and their corresponding 3D shapes, and then build a parametric model on vertex based deformation space for 3D caricature face. Based on the constructed dataset and the nonlinear parametric model, we propose a neural network based method to regress the 3D face shape and orientation from the input 2D caricature image. Ablation studies and comparison with state-of-the-art methods demonstrate the effectiveness of our algorithm design. Extensive experimental results demonstrate that our method works well for various caricatures. Our constructed dataset, source code and trained model are available at https://github.com/Juyong/CaricatureFace.

研究动机与目标

  • 解决由于极端几何夸张和艺术风格差异导致的漫画中2D关键点检测与3D人脸重建缺乏自动方法的问题。
  • 克服标准3D可变形模型在夸张漫画人脸形状上泛化能力不足的局限。
  • 开发一种数据驱动的非线性参数化模型,以捕捉3D漫画人脸的独特形变模式。
  • 设计一个端到端的深度学习框架,直接从2D漫画图像回归3D形状和姿态,通过3D投影实现自动关键点预测。
  • 建立一个大规模、多样化的2D漫画数据集,包含对应的3D形状和68个关键点,用于训练与基准测试。

提出的方法

  • 作者构建了一个包含约6,000张2D漫画的数据集,其中人工标注了68个关键点,并通过风格迁移方法生成了约2,000张带有对应3D形状的漫画。
  • 在3D漫画数据集上,于顶点形变空间中学习了一个非线性参数化模型,以表示超出标准3DMM或FaceWarehouse模型范围的夸张面部形状。
  • 采用ResNet-34主干作为编码器,从输入的2D漫画图像中提取特征,随后通过解码头回归非线性形变参数和人脸姿态。
  • 网络被训练为以相对于均值形状的形变系数形式预测3D人脸形状,而非直接预测顶点坐标,从而提升对极端夸张的泛化能力。
  • 通过估计的相机姿态,将预测的68个3D关键点投影到图像平面,恢复2D关键点。
  • 该方法完全端到端,推理过程中无需真实2D关键点,与以往基于优化的方法不同。

实验结果

研究问题

  • RQ1能否训练一个深度神经网络,直接从单张2D漫画图像预测3D漫画形状和姿态,从而实现自动关键点检测?
  • RQ2如何构建一个非线性参数化模型,以表示典型漫画人脸所特有的极端几何失真,超越标准3D人脸模型的外推极限?
  • RQ3与直接回归2D关键点相比,回归3D形状和姿态是否能带来在高度风格化和夸张的漫画中更鲁棒、更精确的关键点检测?
  • RQ4所提出的方法是否能在无需艺术家特定微调或成对的正常-漫画图像数据的情况下,泛化到不同艺术风格?
  • RQ5与现有最先进方法相比,该方法在精度和速度方面表现如何,而这些方法需要以人工标注的关键点作为输入?

主要发现

  • 所提方法在投影后的2D关键点与真实值之间实现了4.98的均方误差(MSE),优于3DMM(6.32)和FaceWarehouse(7.61),尽管推理过程中未使用真实2D关键点。
  • 该方法每轮推理耗时约10ms,实现了实时性能,而最先进方法[12]需要人工关键点输入,耗时12.5秒。
  • 定性结果表明,重建的3D网格在不同艺术风格和夸张程度下均自然、生动且与输入漫画高度对齐。
  • 消融实验确认,非线性参数化模型和3D形状+姿态回归流程对性能至关重要,移除任一组件均导致精度显著下降。
  • 该方法在不同艺术家和风格间表现出良好泛化能力,因其在无成对正常-漫画图像的多样化数据集上进行训练。
  • 作者已在GitHub上发布了数据集、代码和预训练模型,支持可复现性与未来基准测试。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。