Skip to main content
QUICK REVIEW

[论文解读] Deep and Shallow Covariance Feature Quantization for 3D Facial Expression Recognition

Walid Hariri, Nadir Farah|arXiv (Cornell University)|May 12, 2021
Face and Expression Recognition参考文献 54被引用 4
一句话总结

本文提出了一种新颖的3D面部表情识别方法,通过从3D人脸扫描及其2D投影中提取的深层和浅层特征,采用协方差特征量化。利用卷积神经网络(CNNs)提取深层特征,几何描述子提取浅层特征,并结合协方差矩阵学习与Bag-of-Features(BoF)量化,该方法在BU-3DFE和Bosphorus数据集上实现了最先进(SOTA)的准确率,在Bosphorus数据集上使用联合码书达到了93.30%的识别率。

ABSTRACT

Facial expressions recognition (FER) of 3D face scans has received a significant amount of attention in recent years. Most of the facial expression recognition methods have been proposed using mainly 2D images. These methods suffer from several issues like illumination changes and pose variations. Moreover, 2D mapping from 3D images may lack some geometric and topological characteristics of the face. Hence, to overcome this problem, a multi-modal 2D + 3D feature-based method is proposed. We extract shallow features from the 3D images, and deep features using Convolutional Neural Networks (CNN) from the transformed 2D images. Combining these features into a compact representation uses covariance matrices as descriptors for both features instead of single-handedly descriptors. A covariance matrix learning is used as a manifold layer to reduce the deep covariance matrices size and enhance their discrimination power while preserving their manifold structure. We then use the Bag-of-Features (BoF) paradigm to quantize the covariance matrices after flattening. Accordingly, we obtained two codebooks using shallow and deep features. The global codebook is then used to feed an SVM classifier. High classification performances have been achieved on the BU-3DFE and Bosphorus datasets compared to the state-of-the-art methods.

研究动机与目标

  • 通过利用3D几何数据,解决基于2D的面部表情识别方法在光照和姿态变化下的敏感性问题。
  • 通过结合卷积神经网络(CNNs)提取的深层特征与3D扫描中提取的浅层几何特征,改进3D FER中的特征表示。
  • 通过协方差矩阵学习增强特征描述子的判别能力并保留流形结构。
  • 通过Bag-of-Features(BoF)范式对深层与浅层协方差矩阵进行量化,实现鲁棒分类。
  • 通过多模态2D+3D特征融合策略,在基准3D面部表情识别数据集上超越现有最先进方法。

提出的方法

  • 使用曲率和法向分量等几何描述子,直接从3D人脸扫描中提取浅层特征。
  • 通过将预训练的CNN(VGG-16和AlexNet)应用于从3D扫描生成的2D投影(如深度图和法向图)来生成深层特征。
  • 将浅层和深层特征表示为协方差矩阵,以捕捉统计关系并保留其黎曼结构。
  • 应用深层协方差矩阵学习,以降低维度、增强判别能力,并保留协方差描述子的流形特性。
  • 将学习到的深层与浅层协方差矩阵展平,并应用Bag-of-Features(BoF)范式,为每种模态分别创建码书。
  • 将深层与浅层码书合并为全局特征向量,并使用多类支持向量机(SVM)进行表情分类。

实验结果

研究问题

  • RQ1将2D与3D模态的深层与浅层特征相结合,是否能提升3D面部表情识别的性能?
  • RQ2对特征采用协方差矩阵表示,是否能在保留3D FER中几何结构的同时增强判别能力?
  • RQ3深层协方差矩阵学习是否能有效降低维度并提高特征紧凑性,同时不损失判别能力?
  • RQ4基于BoF的协方差矩阵量化是否优于单模态或非量化方法?
  • RQ5在标准基准测试中,该方法与现有最先进3D FER方法相比,在准确率和鲁棒性方面表现如何?

主要发现

  • 所提方法在Bosphorus数据集上实现了93.30%的分类准确率,优于Ramya等人(87.69%)的最先进方法。
  • 仅使用深层码书的准确率高于浅层码书,表明深层特征具有更强的判别能力。
  • 深层与浅层码书的结合性能优于单独使用深层码书,证明了多模态特征融合的互补优势。
  • 协方差矩阵学习有效减小了深层协方差矩阵的尺寸,同时增强了其判别能力并保留了其黎曼结构。
  • BoF范式在量化协方差描述子方面表现有效,使得传统分类器(如SVM)在3D FER中得以高效应用。
  • 该方法在BU-3DFE和Bosphorus数据集上均表现出良好的泛化能力和鲁棒性,证实了其在3D面部表情识别中的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。