[论文解读] MuSe 2020 -- The First International Multimodal Sentiment Analysis in Real-life Media Challenge and Workshop
MuSe 2020 引入了首个针对真实媒体中多模态情感分析的国际挑战赛,采用 MuSe-CaR 数据集对车载评论进行评估,涵盖三个子挑战:连续情绪预测(MuSe-Wild)、情感-目标参与度检测(MuSe-Topic)以及可信度预测(MuSe-Trust)。该研究通过融合音频、视觉和文本特征,建立了最先进基线模型,关键结果表明:原始音频特征在情感预测中表现最佳,且引入愉悦度与唤醒度信号可提升可信度预测性能。
Multimodal Sentiment Analysis in Real-life Media (MuSe) 2020 is a Challenge-based Workshop focusing on the tasks of sentiment recognition, as well as emotion-target engagement and trustworthiness detection by means of more comprehensively integrating the audio-visual and language modalities. The purpose of MuSe 2020 is to bring together communities from different disciplines; mainly, the audio-visual emotion recognition community (signal-based), and the sentiment analysis community (symbol-based). We present three distinct sub-challenges: MuSe-Wild, which focuses on continuous emotion (arousal and valence) prediction; MuSe-Topic, in which participants recognise domain-specific topics as the target of 3-class (low, medium, high) emotions; and MuSe-Trust, in which the novel aspect of trustworthiness is to be predicted. In this paper, we provide detailed information on MuSe-CaR, the first of its kind in-the-wild database, which is utilised for the challenge, as well as the state-of-the-art features and modelling approaches applied. For each sub-challenge, a competitive baseline for participants is set; namely, on test we report for MuSe-Wild a combined (valence and arousal) CCC of .2568, for MuSe-Topic a score (computed as 0.34$\cdot$ UAR + 0.66$\cdot$F1) of 76.78 % on the 10-class topic and 40.64 % on the 3-class emotion prediction, and for MuSe-Trust a CCC of .4359.
研究动机与目标
- 通过在真实场景中推动多模态融合,弥合基于信号的音视频情感识别领域与基于符号的情感分析领域之间的差距。
- 评估并比较多模态方法在用户生成的、真实场景媒体中对连续情绪(愉悦度与唤醒度)预测、情感-目标参与度检测以及可信度检测的表现。
- 利用 MuSe-CaR 数据集建立基准,该数据集是一个大规模、真实场景下的多模态汽车评论语料库,以实现跨模态的透明化与可复现性评估。
- 推动统一的多模态模型发展,整合语言、音频与视觉信号,用于自然环境下的情感计算。
- 通过提供开源特征、代码与数据,促进多模态融合技术的创新,并确保可复现性与公平比较。
提出的方法
- 该挑战赛使用 MuSe-CaR 数据集,该数据集包含 35 小时的真实场景车载评论视频,涵盖愉悦度、唤醒度、主题与可信度的多模态标注。
- 对于 MuSe-Wild,模型通过原始音频、面部关键点(dlib)和文本嵌入(FastText、BERT)的特征,预测连续的愉悦度与唤醒度。
- 对于 MuSe-Topic,模型通过融合文本(BERT)、音频(eGeMAPS)与视觉(Xception、VGGface)特征,对 10 个特定领域主题与 3 级情感强度(低/中/高)进行分类。
- 对于 MuSe-Trust,模型通过多模态特征预测连续可信度,消融实验测试了引入愉悦度与唤醒度预测作为辅助信号的影响。
- 基线系统采用端到端训练,结合晚期或早期融合策略,表现最佳的模型结合了 FastText、VGGface 与原始音频特征以实现最优性能。
- 所有基线模型均使用开源工具实现,训练集、开发集与测试集已公开发布,以确保可复现性与透明性。
实验结果
研究问题
- RQ1多模态模型在真实场景的用户生成视频内容中,对连续愉悦度与唤醒度的预测能力如何?
- RQ2多模态融合在自然对话中对特定主题的情感-目标参与度检测的提升程度如何?
- RQ3在多模态系统中,引入愉悦度与唤醒度预测是否能提升可信度估计的性能?
- RQ4在非受控、真实场景环境中,哪种模态(文本、音频或视觉)对情感预测的贡献最为显著?
- RQ5当与手工提取的音频特征(eGeMAPS)结合时,最先进的深度学习架构(如 BERT、Xception、VGGface)在多模态情感分析中的有效性如何?
主要发现
- MuSe-Wild 的端到端基线在测试集上对愉悦度与唤醒度预测的联合组内一致性相关系数(CCC)达到 0.2568。
- 对于 MuSe-Topic,最佳基线在 10 类主题预测上取得 76.78% 的综合得分(计算方式为 0.34×UAR + 0.66×F1),在 3 类情感强度预测上得分为 40.64%。
- MuSe-Trust 的基线在测试集上取得 CCC 为 0.4359,当引入愉悦度与唤醒度信号作为辅助输入后,性能进一步提升至 0.4119。
- 原始音频特征在连续情绪预测中表现最强,优于单独使用视觉或文本特征。
- 在主题检测方面,NLP 专用模型(如微调后的 BERT/Albert)显著优于其他架构,表明语言建模在主题识别中占主导地位。
- 将愉悦度与唤醒度预测作为辅助信号可提升可信度估计性能,证明了在多模态情感计算中跨任务知识迁移的价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。