Skip to main content
QUICK REVIEW

[论文解读] Improving Facial Emotion Recognition Systems Using Gradient and Laplacian Images

Ram Krishna Pandey, Souvik Karmakar|arXiv (Cornell University)|Feb 12, 2019
Emotion and Mood Recognition参考文献 28被引用 9
一句话总结

本文提出通过在卷积神经网络(CNN)中同时输入原始图像、梯度图和拉普拉斯图,以增强面部表情识别(FER)系统,显著提升准确率。该方法在不增加网络架构复杂度的前提下,使KDEF和FERPlus数据集上的最先进性能提升了3–5%,利用了标准CNN无法从原始图像中提取的边缘和强度变化信息。

ABSTRACT

In this work, we have proposed several enhancements to improve the performance of any facial emotion recognition (FER) system. We believe that the changes in the positions of the fiducial points and the intensities capture the crucial information regarding the emotion of a face image. We propose the use of the gradient and the Laplacian of the input image together with the original input into a convolutional neural network (CNN). These modifications help the network learn additional information from the gradient and Laplacian of the images. However, the plain CNN is not able to extract this information from the raw images. We have performed a number of experiments on two well known datasets KDEF and FERplus. Our approach enhances the already high performance of state-of-the-art FER systems by 3 to 5%.

研究动机与目标

  • 通过简单有效的图像预处理方法,提升现有面部表情识别(FER)系统的性能。
  • 探究预计算的梯度图和拉普拉斯图是否能增强深度CNN在FER任务中的特征学习能力。
  • 通过边缘感知的图像变换捕捉与情绪相关的强度和结构变化,减少对手工关键点检测的依赖。
  • 开发一种轻量级、高效的CNN架构,在仅使用标准模型1/10参数量的情况下保持高准确率。
  • 验证梯度和拉普拉斯特征无法被标准CNN从原始图像中有效学习,从而证明显式输入的必要性。

提出的方法

  • 将原始图像的梯度图(通过Sobel算子计算)和拉普拉斯图(二阶导数)作为附加通道输入,形成多通道输入(例如:3通道输入:原始图像 + 梯度x/y + 拉普拉斯图)。
  • 将经过修改的多通道图像输入CNN,使网络能够同时从原始图像和衍生图像表示中学习特征。
  • 采用空间变换层(STL)和倒残差瓶颈模块以提升特征学习能力并降低模型复杂度。
  • 在KDEF和FERPlus数据集上训练多个模型,包括仅使用原始图像、梯度图、拉普拉斯图及组合输入的变体,以对比性能提升效果。
  • 使用Adam优化器重新实现VGG13和RTNN模型,并评估输入层面改进带来的准确率提升。
  • 提出一种轻量级模型,参数量仅为VGG13的1/13,采用深度可分离卷积和全局平均池化(GAP),在使用梯度和拉普拉斯图输入时达到与完整VGG13模型相当的准确率。

实验结果

研究问题

  • RQ1在CNN输入中加入梯度图和拉普拉斯图是否能显著提升面部表情识别的准确率?
  • RQ2性能提升是否源于输入多样性增加和更丰富的边缘/纹理信息,而非单纯的图像增强?
  • RQ3当使用梯度和拉普拉斯图输入时,轻量级CNN架构能否实现与大型模型相当的性能?
  • RQ4梯度和拉普拉斯特征能否仅从原始图像中被标准CNN有效学习,还是必须显式输入?
  • RQ5使用预计算的边缘特征是否能减少FER系统中对显式关键点检测的依赖?

主要发现

  • 所提方法在KDEF和FERPlus数据集上均将最先进FER性能提升3–5%,且在多种架构上均表现出一致的性能增益。
  • 使用Sobel或拉普拉斯变换并将结果作为附加通道输入,可使输入多样性增加,并使准确率相比基线VGG13提升近3%。
  • RTNN模型采用原始图像、梯度图和拉普拉斯图的并行输入流,其准确率高于原始RTNN模型,证明了多流特征输入的优势。
  • 所提出的自定义轻量级CNN模型参数量仅为VGG13的1/13,在使用梯度和拉普拉斯图输入时,其准确率与完整VGG13模型相当。
  • 结果表明,普通CNN无法从原始图像中有效提取梯度和拉普拉斯特征,从而证明显式输入的合理性。
  • 通过衍生图像通道,该方法使有效数据集规模扩大2–3倍,增强了泛化能力,且无需额外数据采集。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。