[论文解读] A Multi-stream Convolutional Neural Network for Micro-expression Recognition Using Optical Flow and EVM
本文提出了一种多流卷积神经网络(MSCNN),通过融合光流、欧拉视频放大(EVM)增强的面部运动以及掩码灰度图像,实现微表情识别。通过结合EVM进行运动放大、光流捕捉动态运动模式,并采用基于掩码的局部特征提取,该模型在CASME-II(43.04%准确率,0.3569 F1分数)和SAMM(40.71%准确率,0.3173 F1分数)数据集上实现了最先进性能,且通过随机过采样方法有效缓解了类别不平衡问题。
Micro-expression (ME) recognition plays a crucial role in a wide range of applications, particularly in public security and psychotherapy. Recently, traditional methods rely excessively on machine learning design and the recognition rate is not high enough for its practical application because of its short duration and low intensity. On the other hand, some methods based on deep learning also cannot get high accuracy due to problems such as the imbalance of databases. To address these problems, we design a multi-stream convolutional neural network (MSCNN) for ME recognition in this paper. Specifically, we employ EVM and optical flow to magnify and visualize subtle movement changes in MEs and extract the masks from the optical flow images. And then, we add the masks, optical flow images, and grayscale images into the MSCNN. After that, in order to overcome the imbalance of databases, we added a random over-sampler after the Dense Layer of the neural network. Finally, extensive experiments are conducted on two public ME databases: CASME II and SAMM. Compared with many recent state-of-the-art approaches, our method achieves more promising recognition results.
研究动机与目标
- 为解决微表情因持续时间短、强度低及面部运动细微而导致的识别准确率低的问题。
- 克服深度学习模型在微表情识别中特征表征能力差与数据集类别不平衡的局限性。
- 通过结合EVM实现运动放大与光流捕捉动态运动模式,提升特征提取能力。
- 通过多流CNN架构融合静态、动态与局部化面部特征,提升模型泛化能力。
- 在神经网络的最后全连接层后插入随机过采样器,以缓解数据集类别不平衡问题。
提出的方法
- 采用最优放大因子α = 8的欧拉视频放大(EVM)方法,以增强微表情中细微的面部运动。
- 使用Liu等人[9]提出的方法计算光流,以捕捉面部肌肉变化的运动模式。
- 通过设定50的阈值,从光流图像中生成二值掩码,以隔离显著运动区域。
- 将三种输入流送入MSCNN:原始灰度图像(静态)、光流图像(动态)以及掩码灰度图像(局部运动区域)。
- 在神经网络的最后全连接层后插入随机过采样器,以缓解CASME-II与SAMM数据库中的类别不平衡问题。
- 多流CNN架构实现了静态、动态与局部化运动表征之间的特征融合,从而提升分类性能。
实验结果
研究问题
- RQ1结合EVM与光流是否能提升对细微微表情运动的可检测性?
- RQ2与使用全帧输入相比,集成掩码局部运动特征是否能提升识别性能?
- RQ3在深度神经网络架构中插入随机过采样器,在缓解微表情数据库类别不平衡问题方面是否有效?
- RQ4所提出的多流CNN是否在CASME-II与SAMM数据集上优于单流与双流基线模型?
- RQ5在微表情数据集中,使识别准确率最大化的最优EVM放大因子α是多少?
主要发现
- 所提出的MSCNN在SAMM数据库上实现了43.04%的准确率与0.3569的F1分数,优于现有方法如HOOF(42.17%准确率)与HOG3D(34.16%准确率)。
- 在CASME-II上,该方法实现了40.71%的准确率与0.3173的F1分数,相较于LBP-TOP(35.56%准确率)及其他最先进方法表现出更优性能。
- 最优EVM放大因子被确定为α = 8,该因子在CASME-II与SAMM两个数据集上均实现了最佳识别性能。
- 在CASME-II上,加入随机过采样器后性能有所提升,但在SAMM上效果较不理想,可能由于该数据集规模更小且噪声更高。
- 结合静态、动态与局部化运动特征的多流架构,在两个数据集上均优于单流或双流基线模型。
- 混淆矩阵分析表明,该模型能有效区分CASME-II与SAMM中的五类主要情绪(厌恶、快乐、压抑、惊讶及其他)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。