[论文解读] Video-based Facial Expression Recognition using Graph Convolutional Networks
该论文提出 FER-GCN,一种新颖的图卷积网络(GCN)增强的 CNN-RNN 框架,用于基于视频的人脸表情识别。通过利用 GCN 在视频帧之间传播峰值表情帧的特征,并使用学习得到的邻接矩阵对特征进行加权,该模型聚焦于动态的、高强度的表情区域,在 CK+、Oulu-CASIA、MMI 和具有挑战性的 AFEW8.0 数据集上实现了最先进性能。
Facial expression recognition (FER), aiming to classify the expression present in the facial image or video, has attracted a lot of research interests in the field of artificial intelligence and multimedia. In terms of video based FER task, it is sensible to capture the dynamic expression variation among the frames to recognize facial expression. However, existing methods directly utilize CNN-RNN or 3D CNN to extract the spatial-temporal features from different facial units, instead of concentrating on a certain region during expression variation capturing, which leads to limited performance in FER. In our paper, we introduce a Graph Convolutional Network (GCN) layer into a common CNN-RNN based model for video-based FER. First, the GCN layer is utilized to learn more significant facial expression features which concentrate on certain regions after sharing information between extracted CNN features of nodes. Then, a LSTM layer is applied to learn long-term dependencies among the GCN learned features to model the variation. In addition, a weight assignment mechanism is also designed to weight the output of different nodes for final classification by characterizing the expression intensities in each frame. To the best of our knowledge, it is the first time to use GCN in FER task. We evaluate our method on three widely-used datasets, CK+, Oulu-CASIA and MMI, and also one challenging wild dataset AFEW8.0, and the experimental results demonstrate that our method has superior performance to existing methods.
研究动机与目标
- 解决现有基于视频的 FER 方法在动态表情变化过程中无法持续聚焦于关键面部区域的局限性。
- 通过在帧之间整合基于 GCN 的特征传播,改进面部表情中长期时间依赖关系的建模。
- 通过 GCN 的邻接矩阵自动识别并强调峰值表情帧,以提升分类性能。
- 开发一种稳健的端到端框架,通过集中关注视频序列中最具表现力的面部区域来增强特征表示。
提出的方法
- 在 CNN 和 LSTM 之间集成 GCN 层,通过消息传递机制学习具有更强动态表情区域关注的帧级特征。
- 在 GCN 中使用可学习的邻接矩阵来建模帧间依赖关系,突出峰值表情帧的特征。
- 基于学习得到的邻接矩阵应用加权特征融合函数,优先选择高强度帧中的信息性特征。
- 采用 VGG16 作为主干网络进行空间特征提取,随后通过基于 GCN 的时空特征优化。
- 在 GCN 之后使用 LSTM,以建模经过优化、区域聚焦的特征中的长期时间动态。
- 通过 Sigmoid 函数对邻接矩阵权重进行归一化,以表示表情强度,并引导注意力聚焦于峰值帧。
实验结果
研究问题
- RQ1基于 GCN 的特征传播能否改善视频序列中动态面部表情变化的建模?
- RQ2通过 GCN 学习得到的数据驱动邻接矩阵是否有助于识别并强调峰值表情帧,从而提升识别性能?
- RQ3基于表情强度对 GCN 学习的特征进行加权融合,能否在分类准确率上超越标准的特征平均方法?
- RQ4所提出的 FER-GCN 框架在受控环境和真实场景的人脸表情数据集上,与最先进方法相比表现如何?
主要发现
- 在 CK+ 数据集上,FER-GCN 达到 99.54% 的准确率,显著优于 VGG16 基线的 97.78%。
- 在 Oulu-CASIA 数据集上,模型准确率达到 91.04%,较基线提升 5.21%,较 VGG-Face-LSTM 提升 2.71%。
- 在具有挑战性的 AFEW8.0 真实场景数据集上,FER-GCN 达到 55.67% 的准确率,较 Emotiw2018 中最佳单模型(53.91%)高出 1.76%。
- 消融实验表明,两层 GCN 层次达到最佳性能,更深的堆叠会导致过平滑并引起性能下降。
- 加权特征融合机制在 CK+、Oulu-CASIA 和 MMI 数据集上分别带来额外 0.45%、1.25% 和 1.25% 的准确率提升。
- 邻接矩阵的可视化显示其与表情强度保持一致,所有数据集中的权重均在最具表现力的帧处达到峰值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。