Skip to main content
QUICK REVIEW

[论文解读] Intensity-Aware Loss for Dynamic Facial Expression Recognition in the Wild

Hanting Li, Hongjing Niu|arXiv (Cornell University)|Aug 19, 2022
Emotion and Mood Recognition被引用 5
一句话总结

本文提出了一种新颖的强度感知损失(IAL)和全局卷积-注意力模块(GCA),以提升真实场景下动态面部表情识别(DFER)的性能,其中低强度表情常因类间差异小、类内差异大而被误分类。GCA通过增强低强度样本的特征并抑制无关通道来提升模型表现,IAL则在训练过程中聚焦于难以分类的低强度序列,最终在DFEW和FERV39k数据集上实现了最先进性能。

ABSTRACT

Compared with the image-based static facial expression recognition (SFER) task, the dynamic facial expression recognition (DFER) task based on video sequences is closer to the natural expression recognition scene. However, DFER is often more challenging. One of the main reasons is that video sequences often contain frames with different expression intensities, especially for the facial expressions in the real-world scenarios, while the images in SFER frequently present uniform and high expression intensities. However, if the expressions with different intensities are treated equally, the features learned by the networks will have large intra-class and small inter-class differences, which is harmful to DFER. To tackle this problem, we propose the global convolution-attention block (GCA) to rescale the channels of the feature maps. In addition, we introduce the intensity-aware loss (IAL) in the training process to help the network distinguish the samples with relatively low expression intensities. Experiments on two in-the-wild dynamic facial expression datasets (i.e., DFEW and FERV39k) indicate that our method outperforms the state-of-the-art DFER approaches. The source code will be made publicly available.

研究动机与目标

  • 为解决因表情强度变化,特别是在低强度样本下导致的真实场景动态面部表情识别(DFER)中误分类的问题。
  • 通过增强低强度表情的特征表示,降低类内方差并提升类间分离度。
  • 开发一种即插即用模块(GCA),通过重标定特征图通道来优先关注低强度序列的相关特征。
  • 提出一种新型损失函数(IAL),在训练过程中明确聚焦于难以分类的低强度样本。
  • 在无需强度标注的前提下,验证该方法在真实世界、真实场景下的DFER数据集上的有效性。

提出的方法

  • 全局卷积-注意力(GCA)模块利用全局卷积聚合通道信息并重标定特征图,增强低强度表情的目标相关通道,同时抑制不重要通道。
  • GCA被设计为即插即用模块,可轻松集成至现有DFER模型中,无需对网络架构进行大规模修改。
  • 强度感知损失(IAL)通过增加低置信度预测样本的损失权重来优化训练,尤其聚焦于低表情强度的样本。
  • IAL通过分析预测置信度识别出难以分类的样本,并强制网络关注每个低强度序列最可能混淆的类别。
  • 该方法采用端到端训练,结合交叉熵损失与IAL进行优化,GCA被插入主干网络以细化特征表示。
  • 在两个真实场景下的DFER基准数据集(DFEW与FERV39k)上进行评估,采用动态采样与标准评估协议。

实验结果

研究问题

  • RQ1真实视频序列中表情强度的变化如何影响离散标签DFER模型的性能?
  • RQ2可学习的注意力机制是否能在无需强度标注的情况下提升低强度面部表情的特征表示?
  • RQ3一种强调难以分类的低强度样本的损失函数,能在多大程度上提升DFER中的类间判别能力?
  • RQ4所提出的GCA模块是否能有效增强低强度表情的特征表示,同时抑制无关通道?
  • RQ5IAL与GCA的结合是否能在真实场景下的DFER基准上实现最先进性能?

主要发现

  • 在DFEW数据集上,所提出的GCA+IAL方法实现了69.24%的加权平均召回率(WAR),较之前最先进方法(NR-DFERNet)提升1.05个百分点。
  • 在FERV39k数据集上,该方法实现了48.54%的WAR,超过此前最佳结果(Former-DFER)1.34个百分点。
  • 可视化结果表明,低强度与中性表情的特征不再聚集于非中性类别的中心区域,表明类间分离度得到改善。
  • t-SNE可视化结果证实,所提方法学习到更具判别性的特征,尤其在“中性”与“惊讶”类别上表现更优,这两类在低强度场景下常被混淆。
  • 消融实验表明,GCA与IAL均对性能提升有显著贡献,其中IAL在提升难以分类样本识别率方面尤为有效。
  • 该方法在DFEW与FERV39k数据集的多个指标上均达到最先进水平,验证了其在真实场景下的鲁棒性与泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。