Skip to main content
QUICK REVIEW

[论文解读] Enriched Long-term Recurrent Convolutional Network for Facial Micro-Expression Recognition

Huai-Qian Khor, John See|arXiv (Cornell University)|May 22, 2018
Emotion and Mood RecognitionPsychology参考文献 15被引用 17
一句话总结

本文提出了一种增强型长短期记忆卷积神经网络(ELRCN)用于面部微表情识别,结合基于CNN的空间特征提取与基于LSTM的时序建模。该框架采用两种变体——通过通道堆叠实现空间增强,以及通过特征堆叠实现时序增强——在无需数据增强的情况下实现优异性能,且Grad-CAM可视化结果证实模型注意力集中在与动作单元(AU)相关的面部区域。

ABSTRACT

Facial micro-expression (ME) recognition has posed a huge challenge to researchers for its subtlety in motion and limited databases. Recently, handcrafted techniques have achieved superior performance in micro-expression recognition but at the cost of domain specificity and cumbersome parametric tunings. In this paper, we propose an Enriched Long-term Recurrent Convolutional Network (ELRCN) that first encodes each micro-expression frame into a feature vector through CNN module(s), then predicts the micro-expression by passing the feature vector through a Long Short-term Memory (LSTM) module. The framework contains two different network variants: (1) Channel-wise stacking of input data for spatial enrichment, (2) Feature-wise stacking of features for temporal enrichment. We demonstrate that the proposed approach is able to achieve reasonably good performance, without data augmentation. In addition, we also present ablation studies conducted on the framework and visualizations of what CNN "sees" when predicting the micro-expression classes.

研究动机与目标

  • 解决由于微表情可见度低且训练数据有限,导致难以识别的挑战。
  • 克服手工设计特征的局限性,后者需要领域特定调参且不具备泛化能力。
  • 开发一种深度学习框架,通过端到端学习有效捕捉微表情中的时空动态。
  • 研究不同特征表示(原始像素与光流)及网络架构对识别性能的影响。
  • 利用Grad-CAM提供模型预测的可视化解释,验证模型对与动作单元(AU)相关的面部区域的关注。

提出的方法

  • 使用预训练的VGG-16 CNN从每个微表情帧中提取深层空间特征,测试来自最后一个和倒数第二个全连接层的特征图。
  • 将提取的空间特征输入长短期记忆(LSTM)网络,以建模帧间的时间依赖关系。
  • 实现两种网络变体:(1) 通过通道堆叠输入数据(RGB、光流)实现空间增强;(2) 通过CNN嵌入特征的特征堆叠实现时序增强。
  • 采用光流作为输入以增强运动敏感性,替代原始像素强度,从而更有效地区分微表情中的细微面部动态。
  • 在最后一个卷积层上应用梯度加权类激活映射(Grad-CAM),可视化对分类决策贡献最大的面部区域。
  • 通过消融实验比较不同LSTM架构(单层与双层)、特征提取层及输入模态(像素与光流)的性能。

实验结果

研究问题

  • RQ1基于深度学习的方法是否能在无需大量超参数调优的情况下,优于手工设计特征在微表情识别中的表现?
  • RQ2输入模态的选择(原始像素与光流)如何影响微表情任务中的识别性能?
  • RQ3通过输入通道堆叠实现的空间增强,或通过特征堆叠实现的时序增强,在单数据库与跨数据库评估中哪种表现更优?
  • RQ4模型预测在多大程度上与专家标注的动作单元(AUs)一致,可通过Grad-CAM可视化验证?
  • RQ5使用深度特征进行微表情识别时,LSTM组件(如层数、单元数)的最优配置是什么?

主要发现

  • 在单数据库评估中,采用时序增强(TE)的ELRCN优于空间增强(SE)变体,达到更高的识别准确率。
  • 空间增强(SE)变体在跨数据库设置中泛化能力更强,表明其具备更好的领域迁移能力。
  • 光流特征作为输入始终优于原始像素强度,表明其对微表情中细微面部运动具有更高的敏感性。
  • 当使用深度CNN特征时,单层LSTM的表现优于双层LSTM,表明更深的循环结构未必提升性能,且会增加计算成本。
  • VGG-16最后一个全连接层(4096维)的特征能产生最具判别力的表示,适用于微表情分类。
  • Grad-CAM可视化结果证实,模型关注的是与动作单元相关的面部区域,如嘴角上提(AU12)和眉毛上抬(AU1),与专家标注一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。