[论文解读] FaceScape: 3D Facial Dataset and Benchmark for Single-View 3D Face Reconstruction
本文提出了 FaceScape,一个大规模的3D面部数据集,包含来自847名受试者的16,940个高保真度纹理3D面部模型,每位受试者在20种表情下被捕获,具有毛孔级几何细节。该研究提出了一种两阶段深度学习方法,能够从单张图像预测可驱动的、与表情相关的3D面部模型,实现精确的动态细节合成,并在野外和实验室环境下的评估中建立了单视角3D面部重建的新基准。
In this paper, we present a large-scale detailed 3D face dataset, FaceScape, and the corresponding benchmark to evaluate single-view facial 3D reconstruction. By training on FaceScape data, a novel algorithm is proposed to predict elaborate riggable 3D face models from a single image input. FaceScape dataset releases $16,940$ textured 3D faces, captured from $847$ subjects and each with $20$ specific expressions. The 3D models contain the pore-level facial geometry that is also processed to be topologically uniform. These fine 3D facial models can be represented as a 3D morphable model for coarse shapes and displacement maps for detailed geometry. Taking advantage of the large-scale and high-accuracy dataset, a novel algorithm is further proposed to learn the expression-specific dynamic details using a deep neural network. The learned relationship serves as the foundation of our 3D face prediction system from a single image input. Different from most previous methods, our predicted 3D models are riggable with highly detailed geometry under different expressions. We also use FaceScape data to generate the in-the-wild and in-the-lab benchmark to evaluate recent methods of single-view face reconstruction. The accuracy is reported and analyzed on the dimensions of camera pose and focal length, which provides a faithful and comprehensive evaluation and reveals new challenges. The unprecedented dataset, benchmark, and code have been released at https://github.com/zhuhao-nju/facescape.
研究动机与目标
- 为解决当前缺乏大规模、高质量的3D面部数据集(包含详细几何结构与表情变化)以用于训练和评估单视角3D面部重建方法的问题。
- 开发一种方法,能够从单张图像预测出具有详细特征、可驱动的3D面部模型,捕捉如皱纹等随表情变化的动态几何特征。
- 建立一个全面的基准,用于评估单视角3D面部重建方法,包括具有精确真实几何的野外和实验室数据。
- 通过基于位移图的表示方法,实现对表情特异性动态细节的学习,从而提升预测3D面部的真实感与可驱动性。
- 公开发布数据集与基准,以加速3D面部重建与建模领域的研究。
提出的方法
- 使用密集的68台相机阵列捕获高分辨率3D面部扫描,实现毛孔级几何细节,确保亚毫米级精度(<0.2mm)。
- 将原始扫描处理为拓扑一致(TU)模型以表示粗略形状,以及位移图以捕捉精细细节,从而在不同受试者间保持一致的拓扑结构。
- 基于TU模型,在身份和表情维度上构建双线性3D形态可变形模型,相比先前方法具有更强的表示能力。
- 提出一种两阶段深度学习流程:首先利用2D面部关键点拟合粗略网格;其次通过神经网络预测与表情相关的位移图。
- 动态细节被建模为学习到的位移图的线性组合,使得预测的3D面部可被驱动至任意表情,包括未见过的皱纹。
- 基准包含实验室和野外数据,真实形状对齐精度在0.2mm以内,支持对相机姿态、焦距和表情准确度的评估。
实验结果
研究问题
- RQ1一个包含毛孔级几何细节、每位受试者20种表情的大规模高保真3D面部数据集,是否能实现更精确、更真实的单视角3D面部重建?
- RQ2如何通过深度学习有效建模并从单张图像预测出如皱纹等动态面部细节?
- RQ3学习到的位移图表示在多大程度上能支持在多种面部表情下实现可驱动的3D面部模型?
- RQ4该提出的基准(具备精确真实几何与多样化条件)如何揭示单视角3D面部重建中的新挑战?
- RQ5当前方法在处理侧视图和中等尺度几何结构方面存在哪些局限性?如何加以改进?
主要发现
- FaceScape 包含来自 847 名受试者的 16,940 个高保真度 3D 面部模型,每名受试者具有 20 种表情,使用密集的 68 台相机阵列捕获,精度达到亚毫米级(<0.2mm)。
- 所提出的两阶段方法成功预测出具有精确动态细节(包括未见过的皱纹)的可驱动 3D 面部模型,通过学习与表情相关的位移图实现。
- 基于 FaceScape 构建的双线性 3D 形态可变形模型在表示能力上优于先前方法,能够更优地建模身份与表情之间的形状变化。
- 基准对 14 种近期方法在实验室和野外数据上进行了评估,揭示了在相机姿态、焦距和表情准确度方面的挑战,尤其在非约束条件下更为明显。
- 该方法在侧视面部上性能下降,且在中等尺度几何结构的处理上存在困难,表明在泛化能力和几何精度方面仍有改进空间。
- 数据集与基准已公开发布,供非商业研究使用,代码与数据可于 https://github.com/zhuhao-nju/facescape.git 获取。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。