Skip to main content
QUICK REVIEW

[论文解读] NR-DFERNet: Noise-Robust Network for Dynamic Facial Expression Recognition

Hanting Li, Mingzhe Sui|arXiv (Cornell University)|Jun 10, 2022
Emotion and Mood Recognition被引用 20
一句话总结

NR-DFERNet 通过融合动态与静态时空特征、使用用于时间框架的动态类标记,以及在决策时进行基于片段的筛选来缓解野外视频数据中的嘈杂帧,提出了对 DFER 的抗噪声架构。它在 DFEW 上取得了最先进的结果,在 AFEW 上也具备竞争力的表现。

ABSTRACT

Dynamic facial expression recognition (DFER) in the wild is an extremely challenging task, due to a large number of noisy frames in the video sequences. Previous works focus on extracting more discriminative features, but ignore distinguishing the key frames from the noisy frames. To tackle this problem, we propose a noise-robust dynamic facial expression recognition network (NR-DFERNet), which can effectively reduce the interference of noisy frames on the DFER task. Specifically, at the spatial stage, we devise a dynamic-static fusion module (DSF) that introduces dynamic features to static features for learning more discriminative spatial features. To suppress the impact of target irrelevant frames, we introduce a novel dynamic class token (DCT) for the transformer at the temporal stage. Moreover, we design a snippet-based filter (SF) at the decision stage to reduce the effect of too many neutral frames on non-neutral sequence classification. Extensive experimental results demonstrate that our NR-DFERNet outperforms the state-of-the-art methods on both the DFEW and AFEW benchmarks.

研究动机与目标

  • 通过将关键帧与嘈杂帧区分,在真实世界噪声下推动鲁棒的 DFER。
  • 开发在空间、时间和决策阶段抑制噪声同时保留表情信号的组件。
  • 证明动态-静态融合提升空间辨别力和鲁棒性。
  • 表明动态类标记有助于 transformer 聚焦于与目标相关的帧。
  • 证明在决策阶段采用基于片段的筛选对于处理过多的中性帧的有效性。

提出的方法

  • 动态-静态融合模块,将动态图像差分与下采样的静态特征结合。
  • 基于 transformer 的时间阶段,使用动态类标记来衰减与目标无关的帧。
  • 在决策阶段的基于片段的筛选,降低中性占主导的片段权重,并倾向于非中性判定。
  • 在训练/测试过程中对视频片段进行动态采样以生成长度为 16 的序列。
  • 消融研究验证 DSF、DCT 和 SF 对 UAR 与 WAR 的贡献。
  • 在 DFEW 和 AFEW 基准上进行带交叉验证和预训练策略的实验。

实验结果

研究问题

  • RQ1NR-DFERNet 能否抑制野外 DFER 序列中嘈杂帧(N1 与 N2)的影响?
  • RQ2整合动态与静态空间特征是否提升对动态表情的判别能力?
  • RQ3动态类标记是否在基于注意力的融合中改善时序帧的选择?
  • RQ4决策阶段的基于片段的筛选在减少因过多中性帧造成的错误分类方面是否有效?
  • RQ5NR-DFERNet 在 DFEW 与 AFEW 数据集上的表现如何,与最先进方法相比?

主要发现

  • 在 DFEW 上,结合 DSF、DCT 和 SF 的 NR-DFERNet 达到最先进的 UAR/WAR(例如,标准设置下为 88.47/53.54)。
  • 动态-静态融合在 WAR 与 UAR 上都持续优于基线。
  • 动态类标记通过减少目标无关帧的干扰带来额外提升;例如在消融中 UAR/WAR 提升约 1.15/1.95 个百分点。
  • 基于片段的筛选在模型整体准确度提升时带来更大收益,验证其在处理中性帧主导中的作用。
  • 在 AFEW 上,NR-DFERNet 表现优于若干基线,在在 DFEW 预训练并在 AFEW 上微调时甚至接近 Former-DFER。
  • 在 DFEW 的过采样设置下,NR-DFERNet 在类别不平衡缓解下比 Former-DFER 提升 2.08% UAR 和 2.31% WAR。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。