Skip to main content
QUICK REVIEW

[论文解读] The MuSe 2021 Multimodal Sentiment Analysis Challenge: Sentiment, Emotion, Physiological-Emotion, and Stress

Lukas Stappen, Alice Baird|arXiv (Cornell University)|Apr 14, 2021
Emotion and Mood Recognition被引用 9
一句话总结

本论文介绍了MuSe 2021多模态情感分析挑战赛,设立了四个子挑战,分别聚焦于连续与分类情感/情绪预测、生理情绪识别以及使用音视频、文本和生物信号的应激检测。基于MuSe-CaR和Ulm-TSST数据集,基线模型——基于LSTM的多模态融合模型——在生理情绪预测任务上取得了0.4908的测试CCC值,凸显了将低层次生理信号与情感状态相融合的挑战。

ABSTRACT

Multimodal Sentiment Analysis (MuSe) 2021 is a challenge focusing on the tasks of sentiment and emotion, as well as physiological-emotion and emotion-based stress recognition through more comprehensively integrating the audio-visual, language, and biological signal modalities. The purpose of MuSe 2021 is to bring together communities from different disciplines; mainly, the audio-visual emotion recognition community (signal-based), the sentiment analysis community (symbol-based), and the health informatics community. We present four distinct sub-challenges: MuSe-Wilder and MuSe-Stress which focus on continuous emotion (valence and arousal) prediction; MuSe-Sent, in which participants recognise five classes each for valence and arousal; and MuSe-Physio, in which the novel aspect of `physiological-emotion' is to be predicted. For this years' challenge, we utilise the MuSe-CaR dataset focusing on user-generated reviews and introduce the Ulm-TSST dataset, which displays people in stressful depositions. This paper also provides detail on the state-of-the-art feature sets extracted from these datasets for utilisation by our baseline model, a Long Short-Term Memory-Recurrent Neural Network. For each sub-challenge, a competitive baseline for participants is set; namely, on test, we report a Concordance Correlation Coefficient (CCC) of .4616 CCC for MuSe-Wilder; .4717 CCC for MuSe-Stress, and .4606 CCC for MuSe-Physio. For MuSe-Sent an F1 score of 32.82 % is obtained.

研究动机与目标

  • 通过在真实场景和应激环境下整合音视频、文本和生物信号模态,推动多模态情感与情绪分析的发展。
  • 通过引入结合皮肤电活动(EDA)与唤醒度标注的新子挑战,填补生理情绪识别的空白。
  • 利用MuSe-CaR和Ulm-TSST数据集,提供标准化基准,配套透明、开源的特征提取方法与基线模型。
  • 通过统一且明确的挑战框架,促进情感计算、情感分析与健康信息学领域之间的协作。

提出的方法

  • 挑战赛采用两个数据集:MuSe-CaR用于真实用户生成的车载评论,Ulm-TSST用于诱发应激的特里社会压力测试场景。
  • 采用评分者对齐标注加权(RAAW)方法融合连续情绪标注,以考虑评分者间的一致性及反应时间对齐。
  • 所有子挑战均采用基于长短期记忆(LSTM)的循环神经网络作为基线模型,采用音视频与文本特征的后期融合策略。
  • 从各模态中提取最先进特征集:音频使用DeepSpectrum,视频使用VGGface,文本使用BERT,生物信号(EDA、ECG、RESP、BPM)以1 kHz采样率获取原始信号。
  • 在生理情绪预测任务中,通过RAAW融合EDA与唤醒度,模型预测连续的生理-唤醒水平。
  • 基线性能通过组内相关系数(CCC)评估回归任务,通过F1-score评估分类任务,采用严格划分的训练/开发/测试集。

实验结果

研究问题

  • RQ1多模态模型在真实、非脚本化的视频评论中,利用音频、视觉和文本信号,能否有效预测连续的愉悦度与唤醒度?
  • RQ2在高应激场景下,与传统模态相比,生理信号(如EDA)是否能提升情绪与应激识别的准确性?
  • RQ3在多模态设置中,音频、视频、文本与生物信号对连续与分类情感状态预测的相对贡献如何?
  • RQ4评分者对齐标注加权(RAAW)在多样化数据集中,如何提升连续情绪标注的质量与可靠性?
  • RQ5当使用开源、透明的特征提取管道时,简单的基于LSTM的融合模型在多模态情感识别任务中能否实现优异性能?

主要发现

  • 基线模型在MuSe-Wilder子挑战中,连续情绪预测任务的测试组内相关系数(CCC)达到0.4616。
  • 在MuSe-Sent分类任务中,基线模型在测试集上取得32.82%的F1分数,其中视觉与文本特征的后期融合表现最佳。
  • 在MuSe-Stress子挑战中,表现最佳的模型在测试集上取得0.5088的CCC值,音视频特征的后期融合优于单一模态。
  • 在新颖的MuSe-Physio子挑战中,最佳基线模型通过融合表现最佳的音频(DeepSpectrum)与视觉(VGGface)特征,在测试集上取得0.4908的CCC值。
  • 文本特征(BERT)表现显著低于音视频特征,在MuSe-Physio任务中,开发集CCC仅为0.2583,测试集仅为0.1604。
  • 仅使用生物信号并配合四层LSTM时,生理情绪预测任务在测试集上取得0.3328的CCC值,表明未来仍有较大提升空间。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。