Skip to main content
QUICK REVIEW

[论文解读] Continuous Multimodal Emotion Recognition Approach for AVEC 2017

Narotam Singh, Nittin D. Singh|arXiv (Cornell University)|Sep 18, 2017
Music and Audio Processing参考文献 22被引用 4
一句话总结

该论文提出了一种用于 AVEC 2017 的连续多模态情感识别系统,结合了音频和视觉特征——HOG、SIFT-GMM Fisher 向量、VGG-Face 和 ResNet-50 特征,通过神经网络回归进行融合。最佳多模态融合在开发集上对唤醒度的组内一致性相关系数(CCC)达到 0.525,对愉悦度的 CCC 为 0.507,优于单模态模型,但在测试集上的表现较低,表明可能存在过拟合或领域偏移问题。

ABSTRACT

This paper reports the analysis of audio and visual features in predicting the continuous emotion dimensions under the seventh Audio/Visual Emotion Challenge (AVEC 2017), which was done as part of a B.Tech. 2nd year internship project. For visual features we used the HOG (Histogram of Gradients) features, Fisher encodings of SIFT (Scale-Invariant Feature Transform) features based on Gaussian mixture model (GMM) and some pretrained Convolutional Neural Network layers as features; all these extracted for each video clip. For audio features we used the Bag-of-audio-words (BoAW) representation of the LLDs (low-level descriptors) generated by openXBOW provided by the organisers of the event. Then we trained fully connected neural network regression model on the dataset for all these different modalities. We applied multimodal fusion on the output models to get the Concordance correlation coefficient on Development set as well as Test set.

研究动机与目标

  • 为 AVEC 2017 挑战赛开发一种使用多模态音频和视觉特征的连续情感识别系统。
  • 评估手工设计的视觉特征(HOG、SIFT-GMM)与深度学习特征(VGG-Face、ResNet-50)在预测连续情感维度方面的有效性。
  • 研究音频与视觉特征的多模态融合对唤醒度、愉悦度和喜好度回归性能的影响。
  • 在开发集和测试集上,通过组内一致性相关系数(CCC)比较单模态与多模态模型的性能。

提出的方法

  • 使用梯度直方图从视频帧的面部区域提取 HOG 特征。
  • 计算 SIFT 特征,随后通过 GMM 基 Fisher 向量编码实现时序建模,再应用 PCA 进行降维至 4508 维。
  • 使用预训练的 VGG-Face 和 ResNet-50-dag 模型,分别从第 35 层和第 174 层提取激活值作为深度视觉特征。
  • 从 23 个低层次描述符(LLDs)生成音频 Bag-of-audio-words(BoAW)表示,使用 openXBOW 工具,训练时采用 6 秒的块大小。
  • 训练使用 ReLU 激活函数的全连接前馈神经网络(输出层除外)进行唤醒度、愉悦度和喜好度的回归。
  • 通过早期或晚期融合策略融合单模态预测结果,并在开发集和测试集上通过 CCC 评估性能。

实验结果

研究问题

  • RQ1手工设计的视觉特征(HOG、SIFT-GMM)与基于深度学习的视觉特征(VGG-Face、ResNet-50)在预测连续情感维度方面表现如何?
  • RQ2仅使用音频特征(LLDs 的 BoAW)在预测唤醒度、愉悦度和喜好度方面的表现,与视觉模型和多模态模型相比如何?
  • RQ3与单模态基线相比,音频与视觉特征的多模态融合是否能提升 AVEC 2017 数据集上的回归性能?
  • RQ4模型复杂度(如更深的网络)对连续情感回归性能和计算成本有何影响?
  • RQ5融合过程中特征特定权重对不同情感维度预测的影响程度如何?

主要发现

  • 多模态融合模型在开发集上表现最佳:唤醒度 CCC 为 0.525,愉悦度 CCC 为 0.507,优于单模态模型。
  • 在视觉特征中,HOG 特征表现最佳,其在开发集上的唤醒度 CCC 为 0.289,愉悦度 CCC 为 0.310。
  • VGG-Face 特征在唤醒度上取得 CCC 0.277,愉悦度上为 0.336,优于 ResNet-50 特征(分别为 0.165 和 0.274)。
  • SIFT-GMM Fisher 向量表现较差,唤醒度 CCC 仅为 0.075,愉悦度 CCC 为 0.123,表明在此设置下判别能力有限。
  • 在测试集上,多模态模型的唤醒度 CCC 为 0.306,愉悦度 CCC 为 0.466,与开发集相比性能显著下降。
  • 测试集上多模态模型的皮尔逊积矩相关系数为唤醒度 0.361,愉悦度 0.437,证实其具有中等预测能力,尽管 CCC 较低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。