Skip to main content
QUICK REVIEW

[论文解读] MMA-MRNNet: Harnessing Multiple Models of Affect and Dynamic Masked RNN for Precise Facial Expression Intensity Estimation

Dimitrios Kollias, Andreas Psaroudakis|arXiv (Cornell University)|Mar 1, 2023
Emotion and Mood Recognition被引用 9
一句话总结

FaceRNET 是一个动态多输出的人脸表情强度估计网络,使用逐帧情感表示(VA、AUs、基本表情)和一个掩码启用的 RNN 来处理可变视频长度和视频级注释,在 Hume-Reaction 数据集上取得了最先进的结果。

ABSTRACT

This paper presents MMA-MRNNet, a novel deep learning architecture for dynamic multi-output Facial Expression Intensity Estimation (FEIE) from video data. Traditional approaches to this task often rely on complex 3-D CNNs, which require extensive pre-training and assume that facial expressions are uniformly distributed across all frames of a video. These methods struggle to handle videos of varying lengths, often resorting to ad-hoc strategies that either discard valuable information or introduce bias. MMA-MRNNet addresses these challenges through a two-stage process. First, the Multiple Models of Affect (MMA) extractor component is a Multi-Task Learning CNN that concurrently estimates valence-arousal, recognizes basic facial expressions, and detects action units in each frame. These representations are then processed by a Masked RNN component, which captures temporal dependencies and dynamically updates weights according to the true length of the input video, ensuring that only the most relevant features are used for the final prediction. The proposed unimodal non-ensemble learning MMA-MRNNet was evaluated on the Hume-Reaction dataset and demonstrated significantly superior performance, surpassing state-of-the-art methods by a wide margin, regardless of whether they were unimodal, multimodal, or ensemble approaches. Finally, we demonstrated the effectiveness of the MMA component of our proposed method across multiple in-the-wild datasets, where it consistently outperformed all state-of-the-art methods across various metrics.

研究动机与目标

  • 引入一个可处理视频级注释的动态多输出 FEIE 架构。
  • 利用逐帧的情感表示(VA、AUs、基本表情)进行稳健的时序建模。
  • 通过具有动态路由的 Mask 层处理可变输入视频长度。
  • 通过编码情感表示之间关系的损失来改进训练。
  • 在 Hume-Reaction 数据集上相较基线和多模态方法,展示最先进的性能。

提出的方法

  • Affect Representation Extractor Component (REC) 是一个多任务 CNN,从每帧预测 VA、7 个基本表情和 17 个 AUs。
  • REC 使用一种新颖的损失(L_REC)进行训练,该损失包含基于 CCC 的项、交叉熵损失、二元交叉熵,以及一个远端损失项 L_DM,该项将 AU–表情关系的先验知识引入其中。
  • 一个 RNN 在逐帧的 REC 特征上操作,以建模整段视频的时序动态。
  • 一个 Mask 层根据真实视频长度动态路由 RNN 输出,从而实现对不同帧数的灵活处理。
  • 拼接的路由 RNN 输出输入到一个密集层,然后进入输出层,预测七个表达强度。
  • 训练使用跨七个表达的基于 Pearson 相关性的损失(1 - 平均 ρ)以与评估指标保持一致。

实验结果

研究问题

  • RQ1由多任务 REC 提取的逐帧情感表示(VA、AUs、基本表情)是否可以在视频级注释上提高 FEIE 的准确性?
  • RQ2基于 Mask 的动态路由机制是否能在统一的 FEIE 流水线中有效处理可变长度的视频?
  • RQ3通过 L_DM 将 AU–表情关系的先验知识引入是否能提高 REC 的梯度质量和收敛性?
  • RQ4FaceRNET 与 Hume-Reaction 数据集上的单模态和多模态最先进方法相比如何?
  • RQ5架构选择(GRU 与 LSTM、层数/单元数)和损失变体对 FEIE 性能的影响是什么?

主要发现

  • FaceRNET 在测试集上优于最先进的基线和若干多模态方法,达到 Pearson ρ=0.499。
  • 消融研究表明,使用所有三种任务表示(VA、基本表情、AUs)可获得最佳性能,ρ 高于仅使用任意单一任务。
  • Mask 路由和提出的 L_REC/L_DM 损失对相对于没有动态路由或使用 MSE 损失的变体有显著的性能提升贡献。
  • 最佳的 REC 配置使用一个单层 GRU,128 个单元,后接一个 32 单元的密集层,结合 Mask 层实现对可变长度的处理。
  • 仅使用 AU 和表达表示的 REC 就能提供具竞争力的结果,而组合表示则可将性能最大化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。