[论文解读] Towards High-Fidelity 3D Face Reconstruction from In-the-Wild Images Using Graph Convolutional Networks
本文提出了一种新颖的从粗到精的3D人脸重建框架,利用图卷积网络(GCNs)通过单张野外图像对3D可变形模型(3DMM)生成的低保真度纹理进行细化,实现了无需大规模高分辨率UV纹理数据库的高保真度人脸纹理。该方法利用GCNs将详细RGB颜色直接传播至网格顶点,在定性和定量评估中均优于当前最先进方法。
3D Morphable Model (3DMM) based methods have achieved great success in recovering 3D face shapes from single-view images. However, the facial textures recovered by such methods lack the fidelity as exhibited in the input images. Recent work demonstrates high-quality facial texture recovering with generative networks trained from a large-scale database of high-resolution UV maps of face textures, which is hard to prepare and not publicly available. In this paper, we introduce a method to reconstruct 3D facial shapes with high-fidelity textures from single-view images in-the-wild, without the need to capture a large-scale face texture database. The main idea is to refine the initial texture generated by a 3DMM based method with facial details from the input image. To this end, we propose to use graph convolutional networks to reconstruct the detailed colors for the mesh vertices instead of reconstructing the UV map. Experiments show that our method can generate high-quality results and outperforms state-of-the-art methods in both qualitative and quantitative comparisons.
研究动机与目标
- 为解决基于3DMM的方法在从野外图像中捕捉精细人脸细节方面的局限性,从而导致纹理保真度较低的问题。
- 消除对难以收集且成本高昂的大规模高分辨率UV纹理数据库的依赖。
- 通过可学习的、基于网格的细化过程,利用图像细节对3DMM生成的粗略纹理进行优化,以提升纹理保真度。
- 探索使用图卷积网络(GCNs)对顶点级别颜色进行直接细化,而非基于UV图的生成方式。
- 通过自监督训练与可微分渲染结合的对抗性训练,实现在3D人脸重建任务中的最先进性能。
提出的方法
- 设计了一种从粗到精的框架,其中CNN回归器从单张2D图像中估计3DMM系数(身份、表情、纹理)和渲染参数(姿态、光照)。
- 3DMM模型利用基于主成分分析(PCA)的重建方法,从均值形状和基向量中生成初始人脸形状和粗略反照率纹理。
- 预训练的FaceNet提取图像级特征,输入至GCN细化器,以预测3D网格上顶点的详细颜色。
- GCN解码器处理相同的图像特征,生成细化的纹理嵌入,与GCN细化器的输出进行拼接。
- 合并后的特征通过一个Combine Net生成具有细粒度、高保真度的纹理图,用于网格渲染。
- 该框架使用可微分渲染层进行自监督训练,并引入GAN损失以增强真实感并减少模糊。
实验结果
研究问题
- RQ1图卷积网络能否仅通过单张野外图像,在不依赖大规模UV纹理数据库的前提下,有效实现对3D人脸纹理的顶点级别细化?
- RQ2与传统的基于UV空间的纹理生成方法相比,通过GCNs实现的顶点级别纹理细化在保真度和细节保留方面表现如何?
- RQ3通过可学习的GCN细化模块整合图像衍生细节后,基于3DMM的粗略重建在多大程度上可得到改善?
- RQ4结合可微分渲染层与对抗性训练是否能显著提升重建3D人脸的真实感与感知质量?
- RQ5在建模3D面部结构时,GCNs是否能优于全连接层或UV空间上的卷积层,同时减少参数量并更好地保留空间关系?
主要发现
- 所提方法在CelebA-HQ数据集上实现了29.69的PSNR和0.894的SSIM,显著优于先前方法在像素级重建保真度方面的表现。
- 该方法在LightCNN特征相似度上达到0.900,表明重建的3D人脸更可能被分类为与输入图像相同的个体,优于基线方法。
- 消融实验表明,结合$L_{pix}$、$L_{id}$、$L_{adv}$和$L_{vert}$损失可获得最佳性能,PSNR从26.58提升至29.69。
- 将GCNs替换为UV空间上的全连接层或卷积层后,性能下降(PSNR分别为25.88和27.54),证明GCNs在保留3D结构方面的优越性。
- 在更高分辨率图像(512×512)上训练时,该方法减少了类似棋盘的伪影,生成了更清晰、更逼真的纹理,定性对比结果表明其优势。
- 在MICC数据集上,该方法在VGG-Face特征相似度方面优于当前最先进方法,EMD得分更低(同一名身份为0.08),且在身份保持方面更具一致性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。