[论文解读] Evaluation of the Spatio-Temporal features and GAN for Micro-expression Recognition System
本文提出了一种改进的三流卷积神经网络架构,结合时空光流特征与基于生成对抗网络(GAN)的数据增强方法,用于微表情识别。评估了五种光流方法(RLOF、TVL1、Farneback、Lucas-Kanade、Horn-Schunck)和两种 GAN 变体(AC-GAN、SAGAN),以增强特征表示并缓解数据稀缺问题,在 SMIC 数据集上采用 p&q&ε 输入配置,最高准确率达到 71.20%,F1 分数达到 68.31%。
Owing to the development and advancement of artificial intelligence, numerous works were established in the human facial expression recognition system. Meanwhile, the detection and classification of micro-expressions are attracting attentions from various research communities in the recent few years. In this paper, we first review the processes of a conventional optical-flow-based recognition system, which comprised of facial landmarks annotations, optical flow guided images computation, features extraction and emotion class categorization. Secondly, a few approaches have been proposed to improve the feature extraction part, such as exploiting GAN to generate more image samples. Particularly, several variations of optical flow are computed in order to generate optimal images to lead to high recognition accuracy. Next, GAN, a combination of Generator and Discriminator, is utilized to generate new "fake" images to increase the sample size. Thirdly, a modified state-of-the-art Convolutional neural networks is proposed. To verify the effectiveness of the the proposed method, the results are evaluated on spontaneous micro-expression databases, namely SMIC, CASME II and SAMM. Both the F1-score and accuracy performance metrics are reported in this paper.
研究动机与目标
- 通过使用多种光流方法增强时空特征提取,以提高微表情识别的准确率。
- 通过使用 AC-GAN 和 SAGAN 的基于 GAN 的数据增强,缓解微表情数据集中数据稀缺与类别不平衡问题。
- 开发一种改进的三流卷积神经网络架构(OFF-ApexNet),融合光流分量以提升特征学习与分类性能。
- 在基准微表情数据库(SMIC、CASME II、SAMM)上评估不同光流输入与 GAN 生成数据的有效性。
- 通过主成分分析(PCA)可视化学习到的特征嵌入,分析模型在训练过程中的动态变化。
提出的方法
- 计算五种光流方法(RLOF、TVL1、Farneback、Lucas-Kanade、Horn-Schunck)以从面部视频序列中提取时空特征。
- 提出一种改进的三流卷积神经网络架构,其三个输入为光流分量(p、q、ρ、θ、ε、εux、εuy)的组合,特征图通过逐元素相乘而非拼接方式进行融合。
- 采用 AC-GAN 和 SAGAN 生成合成微表情图像,增加训练数据规模并改善类别分布的平衡性。
- 在 SMIC、CASME II 和 SAMM 数据集上,使用交叉熵损失和 Adam 优化器端到端训练改进的 OFF-ApexNet 模型。
- 在不同训练轮次应用主成分分析(PCA),以可视化特征聚类情况与训练进展。
- 通过准确率与 F1 分数,在不同输入配置与 GAN 增强条件下,对识别性能进行评估。
实验结果
研究问题
- RQ1在 RLOF、TVL1、Farneback、Lucas-Kanade 和 Horn-Schunck 五种光流方法中,哪一种在微表情分类任务中达到最高识别准确率?
- RQ2额外引入光流分量(如 ρ、θ、εux、εuy)如何影响三流卷积神经网络架构的性能?
- RQ3AC-GAN 和 SAGAN 在小样本且类别不平衡的微表情数据集中,能在多大程度上提升识别性能?
- RQ4通过在学习到的嵌入特征上应用 PCA 可视化,模型在训练过程中特征空间如何演变?
- RQ5与标准的拼接融合方法相比,采用特征乘法的改进型三流卷积神经网络在微表情识别中是否表现更优?
主要发现
- p&q&ε 配置在 SMIC 数据集上实现了最高的 71.20% 准确率与 68.31% F1 分数,优于其他输入组合。
- 在五种光流方法中,TVL1 和 RLOF 表现最为稳定,其中 TVL1 在多数配置下表现最佳。
- AC-GAN 和 SAGAN 有效增加了训练样本数量,有助于缓解数据不平衡问题并提升泛化能力。
- 在第 600 个训练轮次的 PCA 可视化结果中,不同情绪类别的特征呈现清晰聚类,表明模型实现了有效的特征学习与分离。
- 采用特征乘法的改进型 OFF-ApexNet 在使用幅值与方向分量时,性能优于标准的拼接融合方法。
- 在所有数据集中,最高准确率为 SMIC 上的 71.20%;CASME II 与 SAMM 数据集在最优配置下分别达到 68.71% 与 68.48%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。