[论文解读] Dense 3D Face Decoding over 2500FPS: Joint Texture & Shape Convolutional Mesh Decoders
本文提出首个基于联合网格卷积自编码器的非线性3D形态模型(3DMM),直接在网格域上解码3D形状与纹理。通过在三角形网格上应用几何深度学习,该方法实现了超过2500 FPS的实时彩色网格解码,模型仅需17 MB,显著优于以往方法在速度与参数效率方面的表现,同时保持了最先进的重建质量。
3D Morphable Models (3DMMs) are statistical models that represent facial texture and shape variations using a set of linear bases and more particular Principal Component Analysis (PCA). 3DMMs were used as statistical priors for reconstructing 3D faces from images by solving non-linear least square optimization problems. Recently, 3DMMs were used as generative models for training non-linear mappings (\ie, regressors) from image to the parameters of the models via Deep Convolutional Neural Networks (DCNNs). Nevertheless, all of the above methods use either fully connected layers or 2D convolutions on parametric unwrapped UV spaces leading to large networks with many parameters. In this paper, we present the first, to the best of our knowledge, non-linear 3DMMs by learning joint texture and shape auto-encoders using direct mesh convolutions. We demonstrate how these auto-encoders can be used to train very light-weight models that perform Coloured Mesh Decoding (CMD) in-the-wild at a speed of over 2500 FPS.
研究动机与目标
- 为克服现有3D人脸重建方法依赖全连接层或UV图上的2D卷积所带来的高参数量与计算成本。
- 开发一种基于3D网格上几何深度学习的非线性3DMM,联合建模形状与纹理,实现对人脸几何与外观更高效、更直观的建模。
- 在保持高重建精度的前提下,实现超过2500 FPS的实时推理速度与仅17 MB的极小模型尺寸,适用于野外图像。
- 证明网格卷积网络能够有效学习从图像特征到密集3D人脸网格的复杂非线性映射,其表达能力与效率均超越基于线性PCA的模型。
提出的方法
- 提出一种新型编码器-解码器架构:2D图像编码器提取特征,彩色网格解码器通过三角形网格上的3D卷积层,直接在网格上重建3D形状与纹理。
- 采用基于图卷积网络(GCNs)并适配网格拓扑的网格卷积,处理网格表面的顶点特征,实现局部、空间感知的特征学习。
- 训练一个联合自编码器,从共享潜在表示中重建形状与纹理,结合可微分网格渲染器与感知损失,以保持高保真度的外观。
- 采用仅含17 MB参数的紧凑网格解码器,在CPU上实现每帧0.367 ms(即2500 FPS)的推理速度,显著快于使用2D卷积或全连接层的先前方法。
- 利用密集对应估计(如Densereg或关键点检测)监督基于网格的特征学习,实现弱监督下的端到端训练。
- 引入一种新型损失函数,结合顶点位置与纹理的L2损失,以及来自预训练VGG网络的感知损失,以提升视觉真实感与几何精度。
实验结果
研究问题
- RQ1网格卷积网络能否有效用于学习一种联合的、非线性的3DMM,实现在网格域上同时建模形状与纹理?
- RQ2此类基于网格的解码器能否在极小模型尺寸下实现实时性能(如>2500 FPS),同时保持高重建精度?
- RQ3与基于UV图上2D卷积或全连接层的方法相比,基于网格的非线性3DMM在速度、精度与参数效率方面表现如何?
- RQ4所提方法能否在无需预对齐或受控采集数据的情况下泛化至野外图像?其对姿态与表情变化的鲁棒性如何?
主要发现
- 所提出的彩色网格解码器(CMD)在CPU上实现每帧0.367 ms(即2500+ FPS)的解码速度,显著优于所有基线方法的推理速度。
- CMD模型仅需17 MB大小,尽管表达能力更强,但仅为MoFA中线性形状基底(120 MB)的约七分之一。
- 在Florence数据集上,该方法的重建精度与PRNet和VRN相当,且在不同偏航角下表现稳定,在侧视图中优于3DDFA与VRN。
- 在Florence数据集上的定量结果表明,该方法在姿态变化下仍保持较低的归一化均方误差(NME),在侧视条件下性能与PRNet相当,优于3DDFA与VRN。
- 视觉对比显示,重建的3D人脸能保持逼真的面部表情与纹理细节,彩色顶点清晰呈现面部动态变化。
- 该方法在重建质量上超越所有基于回归的基线方法(如[36]、[28]、[35]),且在速度与模型尺寸上显著优于N-3DMM与MoFA。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。