[论文解读] CNN-based Real-time Dense Face Reconstruction with Inverse-rendered Photo-realistic Face Images
本文提出了一种基于CNN的实时密集3D人脸重建框架,利用通过逆向渲染和多尺度细节迁移生成的新型照片级真实感数据集。通过在大规模、多样化的训练数据上训练自粗到精的网络架构,该方法在减少计算量的同时实现了高保真度重建,在几何精度和细节保留方面优于最先进方法,同时对姿态、表情和光照变化保持鲁棒性。
With the powerfulness of convolution neural networks (CNN), CNN based face reconstruction has recently shown promising performance in reconstructing detailed face shape from 2D face images. The success of CNN-based methods relies on a large number of labeled data. The state-of-the-art synthesizes such data using a coarse morphable face model, which however has difficulty to generate detailed photo-realistic images of faces (with wrinkles). This paper presents a novel face data generation method. Specifically, we render a large number of photo-realistic face images with different attributes based on inverse rendering. Furthermore, we construct a fine-detailed face image dataset by transferring different scales of details from one image to another. We also construct a large number of video-type adjacent frame pairs by simulating the distribution of real video data. With these nicely constructed datasets, we propose a coarse-to-fine learning framework consisting of three convolutional networks. The networks are trained for real-time detailed 3D face reconstruction from monocular video as well as from a single image. Extensive experimental results demonstrate that our framework can produce high-quality reconstruction but with much less computation time compared to the state-of-the-art. Moreover, our method is robust to pose, expression and lighting due to the diversity of data.
研究动机与目标
- 为解决缺乏大规模、照片级真实感3D人脸数据集(包含详细几何信息)以供深度学习模型训练的问题。
- 实现从单目视频和单张图像中通过深度学习实现实时、高质量的密集3D人脸重建。
- 克服现有基于CNN的方法依赖合成的、非照片级真实感数据或监督损失函数精度有限的局限性。
- 开发一种训练数据流水线,通过逆向渲染和细节迁移生成具有不同姿态、表情和光照条件的多样化、逼真人脸图像。
- 构建一种自粗到精的网络架构,实现实时联合估计几何、反照率、光照和姿态。
提出的方法
- 该方法使用基于优化的逆向渲染过程,从真实照片出发,通过调整姿态、表情和光照参数,生成大规模照片级真实感人脸图像。
- 提出一种新颖的细节迁移技术,将高分辨率源图像中的多尺度面部细节(如皱纹)传递到目标图像,从而实现精细的3D人脸模型构建。
- 训练数据集包含粗尺度和细尺度的照片级真实感人脸图像,以及模拟真实视频动态的视频帧对。
- 提出一种三阶段CNN框架——单图像粗网络(Single-image CoarseNet)、跟踪粗网络(Tracking CoarseNet)和精细网络(FineNet),用于从单张图像或单目视频端到端、实时重建。
- 损失函数结合了姿态和几何重建误差(定义为ℒ_pose和ℒ_geo),以提升训练稳定性和准确性,优于标准的MSE和顶点距离度量。
- 该框架使用大规模数据集进行训练,包括2D图像、3D粗略模型、3D精细模型和多视角人脸数据,所有数据均通过GitHub公开提供。
实验结果
研究问题
- RQ1对真实照片进行逆向渲染能否生成照片级真实感训练数据,从而实现比基于参数化模型合成的数据更精确的3D人脸重建?
- RQ2如何有效在图像之间传递多尺度面部细节(如皱纹),以增强3D重建中的细粒度几何结构?
- RQ3在多样化、逼真的数据上训练的自粗到精CNN架构,能否实现实时性能,同时保持几何和外观重建的高精度?
- RQ4所提出的损失函数(ℒ_pose和ℒ_geo)与标准度量(如MSE和顶点距离)相比,在提升重建质量方面表现如何?
- RQ5训练数据的多样性(姿态、表情、光照)在多大程度上提升了对真实视频和单张图像输入中实际变化的鲁棒性?
主要发现
- 与[42]相比,所提方法的测试误差显著降低,ℒ_pose从26.35降至7.69,ℒ_geo从5.53降至4.23,表明训练收敛性和准确性得到提升。
- 在FRGC V2数据集的Spring2004range子集上,该方法的RMSE为4.915 mm,MAE为3.846 mm,两项指标均优于[61]和[60]。
- 图16的视觉对比显示,与[42]、[3]、[24]、[46]和[14]相比,所提方法在全局几何精度和面部细节(如皱纹)方面表现更优。
- 该方法可实时运行,支持从单目视频和单张图像进行在线重建,与基于优化的最先进方法相比,计算时间显著减少。
- 由于训练数据的多样性,包括多样的参数和模拟视频序列,该框架对姿态、表情和光照变化具有鲁棒性。
- 公开发布的数据集(包含2D图像、3D粗略和精细模型以及多视角数据)有望推动未来在人脸分析、识别和归一化方面的研究。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。