[论文解读] Frame attention networks for facial expression recognition in videos
本文提出帧注意力网络(FAN),一种深度学习框架,通过使用双重注意力机制——自注意力与关联注意力——自动识别并加权视频序列中具有区分性的面部帧,以提升面部表情识别性能。该方法在CK+数据集上实现了最先进性能,相较于以往基于CNN的方法,通过端到端学习帧重要性,无需人工帧聚合。
The video-based facial expression recognition aims to classify a given video into several basic emotions. How to integrate facial features of individual frames is crucial for this task. In this paper, we propose the Frame Attention Networks (FAN), to automatically highlight some discriminative frames in an end-to-end framework. The network takes a video with a variable number of face images as its input and produces a fixed-dimension representation. The whole network is composed of two modules. The feature embedding module is a deep Convolutional Neural Network (CNN) which embeds face images into feature vectors. The frame attention module learns multiple attention weights which are used to adaptively aggregate the feature vectors to form a single discriminative video representation. We conduct extensive experiments on CK+ and AFEW8.0 datasets. Our proposed FAN shows superior performance compared to other CNN based methods and achieves state-of-the-art performance on CK+.
研究动机与目标
- 解决基于视频的面部表情识别中均匀帧聚合的局限性,即所有帧被视为同等重要,尽管其区分性价值各不相同。
- 通过自适应建模帧重要性,而非依赖固定平均或统计池化,改进视频级表征学习。
- 设计一个端到端可训练的框架,联合学习特征嵌入与帧注意力权重,以实现更优的视频级分类。
- 证明注意力机制在捕捉视频中时序动态与关键面部表情方面的有效性。
- 仅使用视觉特征,不依赖音频或复杂后处理,在基准数据集上实现最先进性能。
提出的方法
- 使用深度卷积神经网络(CNN)作为特征嵌入模块,从视频中的每个面部帧提取固定维数的特征向量。
- 引入自注意力机制,直接从帧特征计算注意力权重,以评估单个帧的重要性。
- 实现关联注意力机制,基于每帧与全局视频级锚点特征之间的相似性计算注意力权重。
- 将自注意力与关联注意力权重结合,生成最终的帧权重,用于执行自适应、加权的帧特征聚合。
- 通过应用学习到的注意力权重对帧特征向量进行加权,形成单一、具有区分性的视频级表征。
- 使用交叉熵损失进行端到端训练以实现分类,支持特征学习与注意力加权的联合优化。
实验结果
研究问题
- RQ1注意力机制是否能有效识别面部表情视频中最具区分性的帧,而无需依赖手工设计的聚合规则?
- RQ2自注意力与关联注意力的结合相较于仅使用一种注意力类型,如何提升视频级表征?
- RQ3所提出的FAN框架是否在标准面部表情识别基准上超越现有基于CNN且采用固定帧聚合策略的方法?
- RQ4FAN的性能在骨干网络架构与超参数设置(如注意力头数量)变化下,其鲁棒性如何?
- RQ5FAN学习到的注意力权重是否可被有意义地可视化,以反映人类标注的情感强度?
主要发现
- 所提出的FAN在CK+数据集上达到99.69%的测试准确率,超越基线与最先进方法,且仅使用视觉特征。
- 在自注意力模块中加入关联注意力,使性能相比基线提升2.36%,证明了建模帧与视频关系的价值。
- 仅使用自注意力的FAN模型在CK+上达到99.39%准确率,显著优于标准帧平均或统计池化方法。
- 可视化结果表明,最终注意力权重(自注意力 × 关联注意力)为具有清晰、明显面部特征的帧分配更高权重,与人类感知一致。
- 该方法对超参数变化具有鲁棒性:在不同K值(注意力头数量)下性能保持稳定,最优性能出现在K=3。
- 在AFEW8.0数据集上,FAN达到51.18%准确率,与最先进方法中最佳单模型性能持平,尽管未使用音频或复杂融合策略。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。