[论文解读] Self-supervised Multi-level Face Model Learning for Monocular Reconstruction at over 250 Hz
本文提出了一种自监督、端到端可训练的单目3D人脸重建方法,联合学习多层级人脸模型与深度回归器,在超过250 Hz的帧率下实现了高保真度的几何、反射率(包括 facial hair)和光照重建。通过将3D形态模型(3DMM)与学习到的校正空间结合,并采用可微渲染器,该方法在传统3DMM的有限子空间之外实现了泛化能力,同时在无需密集标注的情况下进行训练,利用多层级自监督损失实现优化。
The reconstruction of dense 3D models of face geometry and appearance from a single image is highly challenging and ill-posed. To constrain the problem, many approaches rely on strong priors, such as parametric face models learned from limited 3D scan data. However, prior models restrict generalization of the true diversity in facial geometry, skin reflectance and illumination. To alleviate this problem, we present the first approach that jointly learns 1) a regressor for face shape, expression, reflectance and illumination on the basis of 2) a concurrently learned parametric face model. Our multi-level face model combines the advantage of 3D Morphable Models for regularization with the out-of-space generalization of a learned corrective space. We train end-to-end on in-the-wild images without dense annotations by fusing a convolutional encoder with a differentiable expert-designed renderer and a self-supervised training loss, both defined at multiple detail levels. Our approach compares favorably to the state-of-the-art in terms of reconstruction quality, better generalizes to real world faces, and runs at over 250 Hz.
研究动机与目标
- 通过学习超越传统3DMM低维子空间的更具泛化能力的人脸模型,解决单目3D人脸重建的病态性问题。
- 实现实时、高速的重建(超过250 Hz),从单张RGB图像中重建出详细的面部几何、反射率和光照。
- 通过利用自监督学习,在野外图像上端到端训练,无需密集的真实标注。
- 通过将3DMM正则化与学习到的校正空间结合,提升对多样化真实人脸(包括胡须、化妆和复杂反射率)的泛化能力。
提出的方法
- 该方法采用混合卷积自编码器结构,包含CNN编码器和可微的、专家设计的渲染器,以在多个细节层级上建模图像形成过程。
- 学习一种多层级人脸模型,结合3DMM的正则化与学习到的校正空间,以超越原始3DMM子空间的泛化能力。
- 网络通过在多个细节层级上运行的自监督损失进行训练,包括光度、轮廓和形状/反射率正则化项。
- 关键组件包括用于提升人脸对齐的轮廓约束、形状稳定性项,以及反射率稀疏性先验(局部与全局),以防止将阴影错误归因于反射率。
- 采用线性(仿射)映射作为回归器,以保持训练稳定性并减少光度重渲染误差。
- 训练过程采用两阶段调度:首先预训练3DMM,然后联合微调3DMM与校正空间,以及CNN编码器和渲染器。
实验结果
研究问题
- RQ1自监督、端到端可训练的框架是否能够联合学习更具泛化能力的人脸模型与深度回归器,用于单目3D人脸重建?
- RQ2结合3DMM正则化与学习到的校正空间的多层级人脸模型,在泛化到真实世界人脸多样性(包括胡须与复杂反射率)方面表现如何?
- RQ3可微渲染器与多层级自监督损失在无需密集标注的情况下,能在多大程度上实现高保真度重建?
- RQ4形状与反射率正则化项(如稀疏性、平滑性)对重建质量与稳定性有何影响?
主要发现
- 该方法实现了超过250 Hz的推理速度,支持实时单目3D人脸重建。
- 当形状与反射率的校正参数数量为500时,网络达到最低的光度重渲染误差,优于仅使用3DMM的基线模型(C = 0)。
- 移除反射率稀疏性先验会导致将阴影错误归因于反射率,证明了这些先验对准确表面外观估计的必要性。
- 形状正则化项(稳定性与平滑性)至关重要——若移除,会导致校正位移严重欠约束,引发训练失败。
- 在合成测试数据上,反射率预测的像素级RGB误差为0.072,表明反射率估计具有高精度。
- 该方法在具有挑战性的现实场景中表现出稳健的泛化能力,包括胡须与化妆情况,其重建质量与鲁棒性优于最先进的基于优化与学习的方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。