[论文解读] Learning Detailed Face Reconstruction from a Single Image
本文提出了一种端到端的深度学习框架,用于从单张图像实现高保真度的3D人脸重建,采用两阶段CNN流水线:CoarseNet通过3D形态可变形模型(3DMM)预测粗略的3D人脸形状,随后FineNet利用可微分渲染层和无监督的形状从阴影损失对细节进行精细化处理。该方法在FRGC V2数据集上实现了最先进的精度,平均深度误差为3.22毫米,优于以往的单图像方法。
Reconstructing the detailed geometric structure of a face from a given image is a key to many computer vision and graphics applications, such as motion capture and reenactment. The reconstruction task is challenging as human faces vary extensively when considering expressions, poses, textures, and intrinsic geometries. While many approaches tackle this complexity by using additional data to reconstruct the face of a single subject, extracting facial surface from a single image remains a difficult problem. As a result, single-image based methods can usually provide only a rough estimate of the facial geometry. In contrast, we propose to leverage the power of convolutional neural networks to produce a highly detailed face reconstruction from a single image. For this purpose, we introduce an end-to-end CNN framework which derives the shape in a coarse-to-fine fashion. The proposed architecture is composed of two main blocks, a network that recovers the coarse facial geometry (CoarseNet), followed by a CNN that refines the facial features of that geometry (FineNet). The proposed networks are connected by a novel layer which renders a depth image given a mesh in 3D. Unlike object recognition and detection problems, there are no suitable datasets for training CNNs to perform face geometry reconstruction. Therefore, our training regime begins with a supervised phase, based on synthetic images, followed by an unsupervised phase that uses only unconstrained facial images. The accuracy and robustness of the proposed model is demonstrated by both qualitative and quantitative evaluation tests.
研究动机与目标
- 为解决从单张2D图像重建详细3D人脸几何结构这一病态问题,该问题因表情、姿态、光照和纹理的差异而具有挑战性。
- 克服现有单图像方法仅能生成粗略重建的局限,通过引入两阶段深度学习流水线以恢复精细细节。
- 通过在合成数据上训练并随后在真实图像上进行无监督微调,消除对人工标注或外部初始化的依赖。
- 通过一种新型可微分渲染层实现端到端训练,该层将3DMM几何结构转换为深度图,从而实现反向传播优化。
- 在无需多张图像、视频或深度先验的前提下,实现高保真度的3D人脸重建。
提出的方法
- 该框架使用CoarseNet(一种在合成数据上训练的CNN),通过3D形态可变形模型(3DMM)预测3D人脸形状并估计人脸姿态。
- FineNet是一种全卷积网络,通过基于形状从阴影的损失函数,在无监督设置下学习真实人脸图像中的精细面部细节,从而对粗略深度图进行细化。
- 一种新型可微分渲染层将基于3DMM的粗略几何结构和姿态转换为2D深度图,从而在端到端训练过程中实现向CoarseNet的梯度反传。
- 训练策略采用两阶段方法:首先在具有真实3DMM几何结构的合成图像上进行监督预训练,随后在无约束的真实图像上进行无监督微调。
- FineNet的损失函数基于形状从阴影的公理化原则设计,以保留高频面部细节。
- 该架构支持可变输入分辨率,允许网络在不重新训练的情况下从200×200到400×400图像平滑扩展。
实验结果
研究问题
- RQ1能否通过深度学习框架在无需多视角或深度先验的前提下,从单张图像中重建出详细的3D人脸几何结构?
- RQ2可微分渲染层如何实现基于3DMM的粗略几何预测器与细节细化网络之间的端到端训练?
- RQ3在无监督设置下,基于形状从阴影的损失在仅使用真实图像的情况下,能在多大程度上恢复精细面部细节?
- RQ4两阶段CNN流水线是否能在准确性和对姿态与表情变化的鲁棒性方面超越现有单图像重建方法?
- RQ5结合合成数据用于粗略形状学习与真实数据用于细节细化,在实现高保真重建方面有多高效?
主要发现
- 该方法在FRGC V2数据集上实现了3.22毫米的平均深度误差,优于所有对比方法,包括[48]、[34]和[20]。
- 如在具有多样化姿态和表情的野外图像上的定性对比所示,该方法生成的面部几何结构显著优于[34]和[48]。
- FineNet在输入分辨率上表现出鲁棒性,在400×400图像上即使训练时使用200×200输入,也能生成更高质量的细节。
- 即使在极端头部姿态下(包括接近90°的角度),该方法仍能保持高精度和细节恢复能力,如图8所示。
- 无监督训练阶段对CoarseNet的调整较小,尽管主要细化工作由FineNet完成,这表明3DMM表示限制了CoarseNet对精细细节的适应能力。
- 可微分渲染层成功实现了从深度图到3DMM参数的梯度流动,从而支持两个网络的联合优化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。