[论文解读] Accurate Facial Parts Localization and Deep Learning for 3D Facial Expression Recognition
该论文提出了一种新颖的3D面部表情识别系统,通过从2D纹理图和深度图中精确提取面部部件定位,随后利用自定义CNN子网络进行深度特征融合,以学习部件特定的重要性权重。该方法在BU-3DFE数据集上使用融合面部部件的VGG-M-DF特征,实现了88.54%的最先进平均识别率。
Meaningful facial parts can convey key cues for both facial action unit detection and expression prediction. Textured 3D face scan can provide both detailed 3D geometric shape and 2D texture appearance cues of the face which are beneficial for Facial Expression Recognition (FER). However, accurate facial parts extraction as well as their fusion are challenging tasks. In this paper, a novel system for 3D FER is designed based on accurate facial parts extraction and deep feature fusion of facial parts. In particular, each textured 3D face scan is firstly represented as a 2D texture map and a depth map with one-to-one dense correspondence. Then, the facial parts of both texture map and depth map are extracted using a novel 4-stage process consists of facial landmark localization, facial rotation correction, facial resizing, facial parts bounding box extraction and post-processing procedures. Finally, deep fusion Convolutional Neural Networks (CNNs) features of all facial parts are learned from both texture maps and depth maps, respectively and nonlinear SVMs are used for expression prediction. Experiments are conducted on the BU-3DFE database, demonstrating the effectiveness of combing different facial parts, texture and depth cues and reporting the state-of-the-art results in comparison with all existing methods under the same setting.
研究动机与目标
- 通过将有意义的面部部件作为判别性单元,提升3D面部表情识别(FER)性能。
- 解决从带有纹理的3D人脸扫描中精确提取面部部件的挑战,利用纹理图与深度图之间的密集对应关系。
- 通过深度融合CNN子网络学习不同面部部件特征的重要性及其组合方式。
- 通过在单个面部部件层面融合2D纹理与3D几何线索,实现最先进性能。
- 验证基于部件的表征相较于整体人脸表征在3D FER中的优越性。
提出的方法
- 每个3D人脸扫描被分解为具有单对单密集对应关系的2D纹理图和深度图。
- 应用四阶段面部部件定位流程:面部关键点定位、旋转校正、图像缩放以及带后处理的边界框提取。
- 预训练的VGG-M-DF网络分别从纹理图和深度图中提取每个面部部件的深度特征。
- 提出一种新型深度融合子网络,学习部件特定的重要性权重,并非线性地融合特征以进行表情预测。
- 使用非线性SVM将最终融合的特征分类为六种基本面部表情。
- 系统在BU-3DFE数据集上采用标准的10折交叉验证协议进行训练与评估。
实验结果
研究问题
- RQ1能否通过从3D人脸扫描中精确定位面部部件来提升面部表情识别性能?
- RQ2来自单个面部部件的纹理与深度线索如何贡献于表情识别?它们能否被有效融合?
- RQ3通过深度融合子网络学习部件特定的重要性权重,是否能相比整体人脸或手工设计的特征融合方式提升识别准确率?
- RQ4各个面部部件(如嘴、眼睛、眉毛)在3D数据中的表情识别中相对贡献如何?
- RQ5在与先前工作相同的评估协议下,所提方法是否在BU-3DFE基准上实现了最先进性能?
主要发现
- 所提方法在BU-3DFE数据集上使用面部部件的VGG-M-DF特征,实现了88.54%的最先进平均识别率。
- 融合面部部件的纹理与深度特征相比整体人脸特征融合,性能提升了3.04%(85.58% vs. 88.54%)。
- 嘴部是表达最丰富的面部部件,当同时使用纹理与深度线索时,其识别准确率达到81.94%。
- 与手工设计特征相比,深度融合子网络显著提升了性能,相比最佳手工方法(ULBP:86.89% vs. 88.54%)提升了2.95%。
- 无论特征类型如何,使用面部部件而非整体人脸均提升了识别准确率,证明了基于部件表征的有效性。
- 2D与3D线索的融合始终能提升性能,其中纹理特征单独表现优于深度特征,但两者结合可获得最大性能增益。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。