Skip to main content
QUICK REVIEW

[论文解读] A Multi-modal and Multi-task Learning Method for Action Unit and Expression Recognition

Yue Jin, Tianqing Zheng|arXiv (Cornell University)|Jul 9, 2021
Emotion and Mood Recognition参考文献 22被引用 21
一句话总结

本文提出了一种多模态、多任务学习框架,通过视觉和音频输入联合识别面部动作单元(AUs)和表情。通过使用AU和表情分支共享视觉主干网络进行训练,冻结主干后,利用Transformer编码器融合视觉与音频特征,该方法在Aff-Wild2验证集上实现了0.712的AU识别得分和0.477的表情识别得分,显著优于基线模型。

ABSTRACT

Analyzing human affect is vital for human-computer interaction systems. Most methods are developed in restricted scenarios which are not practical for in-the-wild settings. The Affective Behavior Analysis in-the-wild (ABAW) 2021 Contest provides a benchmark for this in-the-wild problem. In this paper, we introduce a multi-modal and multi-task learning method by using both visual and audio information. We use both AU and expression annotations to train the model and apply a sequence model to further extract associations between video frames. We achieve an AU score of 0.712 and an expression score of 0.477 on the validation set. These results demonstrate the effectiveness of our approach in improving model performance.

研究动机与目标

  • 解决在真实世界、非受控视频场景中情感识别的挑战,此类场景数据通常存在噪声且分布不均。
  • 通过结合视觉与音频模态,提升动作单元(AU)与面部表情识别的性能。
  • 通过特定任务的损失函数与多任务训练,缓解AU与表情数据集中类别不平衡的问题。
  • 利用基于Transformer的编码器增强面部序列的时间建模能力,捕捉长距离帧间依赖关系。
  • 通过防止AU与表情验证集之间的数据泄露,确保评估的公平性。

提出的方法

  • 在Glint360K数据集上使用Cosface损失训练一个用于AU与表情识别的多任务视觉主干网络,共享权重用于AU与表情分支。
  • AU识别采用带类别权重的BCE损失以处理正样本不平衡问题,表情识别则使用焦点损失以强调难分类样本。
  • 主干网络预训练完成后被冻结,音频流通过基于TDNN的模型在梅尔频谱图上提取音频特征。
  • 将视觉与音频特征拼接后输入单层Transformer编码器,以建模视频帧之间的时序动态。
  • 通过在AU与表情分支之间交替进行训练(按训练轮次或批次),以应对Aff-Wild2数据集中不完整的标注问题。
  • 最终预测头为全连接层,输出每帧的AU与表情概率。

实验结果

研究问题

  • RQ1联合进行AU与表情的多任务学习是否能提升在非受控场景下情感识别的性能?
  • RQ2引入音频模态是否能提升AU与表情识别性能,使其超越仅依赖视觉线索的表现?
  • RQ3基于Transformer的序列模型在捕捉面部序列中时序依赖关系方面有多高效,尤其在情感识别任务中?
  • RQ4分别使用BCE损失与焦点损失,能在多大程度上缓解AU与表情数据集中的类别不平衡问题?
  • RQ5多模态、多任务框架是否能减少过拟合并提升真实世界视频场景下的泛化能力?

主要发现

  • 所提方法在Aff-Wild2验证集上实现了0.712的AU识别得分,显著优于基线的0.31。
  • 在表情识别方面,该方法得分达到0.477,相较基线的0.366有显著提升。
  • 结合视觉与音频模态的性能优于仅使用视觉数据,尤其在具有挑战性的非受控环境下表现更优。
  • 采用交替反向传播的多任务训练策略,有效应对AU与表情数据集中不完整标注的问题。
  • Transformer编码器能有效建模长距离时序依赖,提升序列级别识别准确率。
  • 通过移除重叠的验证样本以消除数据泄露,确保了模型性能评估的公平性与可靠性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。