[论文解读] Deep Representation of Facial Geometric and Photometric Attributes for Automatic 3D Facial Expression Recognition
本文提出了一种用于3D面部表情识别的深度表征框架,通过从3D面部扫描中提取几何和光度属性图(几何、法线、曲率、纹理)并输入预训练的CNN以生成判别性深度特征。该方法在BU-3DFE数据集上使用线性SVM融合实现了84.87%的准确率,达到最先进水平,优于手工设计的描述符和先前的SOTA方法,且在相同协议下表现更优。
In this paper, we present a novel approach to automatic 3D Facial Expression Recognition (FER) based on deep representation of facial 3D geometric and 2D photometric attributes. A 3D face is firstly represented by its geometric and photometric attributes, including the geometry map, normal maps, normalized curvature map and texture map. These maps are then fed into a pre-trained deep convolutional neural network to generate the deep representation. Then the facial expression prediction is simplyachieved by training linear SVMs over the deep representation for different maps and fusing these SVM scores. The visualizations show that the deep representation provides a complete and highly discriminative coding scheme for 3D faces. Comprehensive experiments on the BU-3DFE database demonstrate that the proposed deep representation can outperform the widely used hand-crafted descriptors (i.e., LBP, SIFT, HOG, Gabor) and the state-of-art approaches under the same experimental protocols.
研究动机与目标
- 通过利用3D面部几何与光度数据,解决2D FER在光照与姿态变化下的局限性。
- 克服依赖密集对应与配准的模型驱动型3D FER方法所存在的主体偏差与高计算成本问题。
- 利用现成的深度特征,开发一种完全自动、鲁棒且具有判别能力的3D面部表情表征方法。
- 证明在标准协议下,3D属性图的深度表征优于手工设计的描述符与最先进方法。
提出的方法
- 使用四种2D属性图表示3D面部扫描:几何图、法线图(x、y、z分量)、曲率图与纹理图。
- 利用预训练的VGG-verydeep-19 CNN,进行微调或直接使用,从每张属性图中提取深度卷积特征。
- 从CNN的最后一个全连接层提取深度特征,为面部属性生成高层次、非线性的编码。
- 在每张图的深度特征上分别训练一个线性SVM,以预测面部表情。
- 在决策层融合SVM得分,生成最终的表情预测结果。
- 可视化学习到的滤波器与特征图,以验证深度表征的完整性和判别能力。
实验结果
研究问题
- RQ13D面部几何与光度属性的深度表征是否能在3D FER中优于传统手工设计的描述符(如LBP、SIFT、HOG、Gabor)?
- RQ2在属性图上使用预训练CNN是否能为3D面部表情提供更具判别性与完整性的特征表征?
- RQ3在标准协议下,所提出方法与最先进3D FER方法相比,在准确率与鲁棒性方面表现如何?
- RQ4深度表征在不同面部表情中,尤其是恐惧或悲伤等困难类别中,是否保持了良好的判别能力?
- RQ5仅使用线性SVM与现成的深度特征,是否能超越使用非线性核函数或多核学习的复杂模型?
主要发现
- 所提出的深度表征在BU-3DFE数据集的Protocol I上平均识别准确率达到83.48%,在Protocol II上达到84.87%,优于表VII中列出的所有最先进方法。
- 该方法在判别能力上超越了Gabor描述符,尤其在区分恐惧表情方面表现更优,正确分类率达到68.19%,高于Gabor的62.84%。
- 深度表征展现出强大的泛化能力与鲁棒性,表现为在所有六种基本表情上均保持一致的高性能,尤其在Protocol I下,快乐(95.27%)与惊讶(96.34%)的准确率极高。
- 学习到的滤波器可视化结果表明,深度特征同时捕捉了面部结构的局部与全局信息,表明其表征具有完整性和高判别能力。
- 该方法仅使用线性SVM与每张图单一类型的深度特征,即实现了SOTA结果,无需复杂的模型微调或多核学习。
- Protocol I与Protocol II之间的性能差距表明,Protocol II存在主体偏差,而所提方法在更具真实性的Protocol I下依然保持鲁棒与可靠。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。