[论文解读] Learning Formation of Physically-Based Face Attributes
本文提出了一种基于非线性深度学习的3D可变形人脸模型,该模型在4,000份高分辨率人脸扫描数据上进行训练,能够在4K分辨率下实现毛孔级几何细节和基于物理的材质属性(反照率、高光、位移)建模。该模型采用级联生成对抗网络(GAN),结合联合与独立判别器,生成逼真且解剖结构一致的人脸,实现优越的表情拟合性能(1.2mm MSE,优于线性模型的2.4mm MSE),并支持新型身份生成、网格拟合以及低分辨率至高分辨率的数据转换。
Based on a combined data set of 4000 high resolution facial scans, we introduce a non-linear morphable face model, capable of producing multifarious face geometry of pore-level resolution, coupled with material attributes for use in physically-based rendering. We aim to maximize the variety of face identities, while increasing the robustness of correspondence between unique components, including middle-frequency geometry, albedo maps, specular intensity maps and high-frequency displacement details. Our deep learning based generative model learns to correlate albedo and geometry, which ensures the anatomical correctness of the generated assets. We demonstrate potential use of our generative model for novel identity generation, model fitting, interpolation, animation, high fidelity data visualization, and low-to-high resolution data domain transferring. We hope the release of this generative model will encourage further cooperation between all graphics, vision, and data focused professionals while demonstrating the cumulative value of every individual's complete biometric profile.
研究动机与目标
- 解决公共数据集中缺乏高保真、基于物理的人脸数据的问题,以支持图形学与视觉研究。
- 克服线性3DMM在捕捉亚毫米级几何细节与材质一致性方面的局限性。
- 利用深度生成建模技术,实现对多样化、解剖结构正确的人脸身份与表情的可控生成。
- 通过从大规模高分辨率扫描数据库构建紧凑的生成模型,实现高质量人脸资源的普惠化。
- 支持诸如网格拟合、低分辨率数据增强以及视效与生物识别领域中的高保真可视化等应用。
提出的方法
- 采用混合建模方法,将非线性3DMM用于头部几何建模,同时使用线性PCA对眼睛、牙齿和头部进行建模。
- 训练级联生成对抗网络(GAN),联合生成几何与反照率,通过独立与联合判别器确保解剖结构正确性与纹理质量。
- 通过从低维潜在代码推理与上采样,恢复高分辨率4K纹理图(反照率、高光、位移)。
- 采用自动化流水线对每位受试者26种表情进行密集对应与UV参数化,实现一致对齐与模型训练。
- 通过独立的低维潜在向量分离身份与表情,实现独立控制。
- 采用可微分渲染与拟合流水线,通过反演GAN从目标网格中推断潜在代码,实现3D扫描配准。
实验结果
研究问题
- RQ1深度生成模型能否从大规模、高保真扫描数据库中学习生成高分辨率、基于物理的人脸属性(几何、反照率、高光)?
- RQ2非线性3DMM在重建人脸表情与拟合扫描数据方面,相较于线性模型表现如何?
- RQ3该模型在训练过程中未见过的新身份与新表情上,泛化能力达到何种程度?
- RQ4该模型能否通过将低分辨率人脸扫描转换到高分辨率、基于物理的域中,实现有效增强?
- RQ5该模型在3D网格拟合与动画重定向等下游任务中的表现如何?
主要发现
- 所提模型在表情拟合方面达到1.2mm的均方误差(MSE),优于线性FaceWarehouse模型的2.4mm MSE,证明其具有更高的重建精度。
- 模型成功生成了5,000个新型人脸身份,其性别与年龄分布与原始训练数据高度一致,表明潜在空间覆盖良好。
- 低分辨率人脸扫描通过模型有效增强至4K分辨率,实现了逼真的材质与几何细节,经定性与定量对比验证。
- 通过非线性反演过程实现精确的3D扫描拟合,其在Hausdorff距离误差指标上优于线性模型(如Basel与FLAME)。
- 采用独立与联合判别器的联合GAN训练策略,确保了高质量、解剖结构一致的几何与反照率联合生成。
- 该模型支持身份插值、动画生成与数据域转换等新应用,展现出在图形学与视觉流程中的广泛实用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。