[论文解读] E2-Capsule Neural Networks for Facial Expression Recognition Using AU-Aware Attention
本文提出E2-Capsnet,一种用于面部表情识别(FER)的端到端胶囊网络,结合了AU感知注意力机制。通过双模块设计增强特征学习:(1) 在早期卷积层中引入AU感知注意力,聚焦于动作单元区域;(2) 采用动态路由的深层胶囊层,以建模空间关系。在RAF-DB和EmotioNet数据集上,E2-Capsnet分别取得85.24%和55.91%的准确率,优于当前最先进方法。
Capsule neural network is a new and popular technique in deep learning. However, the traditional capsule neural network does not extract features sufficiently before the dynamic routing between the capsules. In this paper, the one Double Enhanced Capsule Neural Network (E2-Capsnet) that uses AU-aware attention for facial expression recognition (FER) is proposed. The E2-Capsnet takes advantage of dynamic routing between the capsules, and has two enhancement modules which are beneficial for FER. The first enhancement module is the convolutional neural network with AU-aware attention, which can help focus on the active areas of the expression. The second enhancement module is the capsule neural network with multiple convolutional layers, which enhances the ability of the feature representation. Finally, squashing function is used to classify the facial expression. We demonstrate the effectiveness of E2-Capsnet on the two public benchmark datasets, RAF-DB and EmotioNet. The experimental results show that our E2-Capsnet is superior to the state-of-the-art methods. Our implementation will be publicly available online.
研究动机与目标
- 通过集成聚焦于动作单元(AU)区域的注意力机制,提升面部表情识别(FER)的性能。
- 通过结合使用动态路由的卷积神经网络与胶囊网络,增强FER中的特征表示能力。
- 比传统CNN更有效地建模面部组件之间的空间关系。
- 在基准FER数据集RAF-DB和EmotioNet上实现最先进性能。
提出的方法
- 网络采用VGG16作为主干网络,将最后的全连接层替换为胶囊层以实现特征编码。
- 利用面部关键点地标生成AU感知注意力图,通过计算到AU中心的曼哈顿距离确定权重,以识别活跃的AU区域。
- 通过逐元素相乘将注意力图应用于阶段2池化后的特征图,随后与阶段3卷积输出相加。
- 在PrimaryCaps与FaceCaps层之间应用动态路由,以学习局部特征之间的层次关系。
- 挤压函数对胶囊输出进行归一化,以表示各类表情的概率。
- 使用边缘损失和重建损失进行端到端训练,训练在GPU上完成。
实验结果
研究问题
- RQ1AU感知注意力是否能通过聚焦于活跃面部区域来改善面部表情识别中的特征学习?
- RQ2将多层卷积网络与胶囊网络结合,是否能增强FER中的特征表示能力?
- RQ3胶囊之间的动态路由是否能比标准CNN更有效地建模面部表情中的空间关系?
- RQ4注意力与胶囊网络的结合是否能在基准FER数据集上实现更优性能?
主要发现
- 在RAF-DB数据集上,E2-Capsnet达到85.24%的准确率,优于次佳方法RCCnet的0.46%。
- 在EmotioNet上,E2-Capsnet达到55.91%的准确率,超越所有对比的最先进方法。
- 消融实验表明,同时引入注意力与动态路由后,性能相比仅使用注意力的AVGGnet提升了5.95%。
- 采用动态路由与丰富卷积层的模型(RCCnet)达到84.78%的准确率,表明层次化特征学习具有显著优势。
- 使用T-SNE的可视化结果证实,E2-Capsnet生成的特征表示比Capsnet、VGG16和FERAtt更具判别性。
- 注意力机制有效突出了AU活跃区域,如眉毛和嘴角,与面部动作单元模式高度一致。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。