[论文解读] Deep Net Features for Complex Emotion Recognition
该论文提出利用预训练模型——AudioSet Net、VoxCeleb Net 和 Deep Speech Net 的深度神经网络特征,用于复杂情绪识别,特别是好奇心的识别。通过从这些网络的深层提取并编码高层次表征为特征向量,该方法在 EmoReact 数据集上实现了 0.85 的 F1 分数,显著优于先前基线的 0.69。
This paper investigates the influence of different acoustic features, audio-events based features and automatic speech translation based lexical features in complex emotion recognition such as curiosity. Pretrained networks, namely, AudioSet Net, VoxCeleb Net and Deep Speech Net trained extensively for different speech based applications are studied for this objective. Information from deep layers of these networks are considered as descriptors and encoded into feature vectors. Experimental results on the EmoReact dataset consisting of 8 complex emotions show the effectiveness, yielding highest F1 score of 0.85 as against the baseline of 0.69 in the literature.
研究动机与目标
- 探究声学特征、音频事件特征和词汇特征在识别复杂情绪(如好奇心)方面的有效性。
- 评估预训练深度神经网络(AudioSet Net、VoxCeleb Net 和 Deep Speech Net)在情绪识别中用于特征提取的实用性。
- 探究这些模型深层的高层表征是否可作为复杂情绪分类的稳健描述符。
- 在现有基线基础上进一步提升复杂情绪识别性能,特别是在包含 8 种情绪类别的 EmoReact 数据集上。
提出的方法
- 利用在大规模语音和音频数据上训练的预训练 AudioSet Net、VoxCeleb Net 和 Deep Speech Net 模型,这些模型分别针对不同任务进行训练。
- 从这些网络的更深层(更具抽象性)提取特征表征,以捕捉高层次的语义模式。
- 将提取的深层特征编码为紧凑且具有判别力的特征向量,用于下游分类任务。
- 在 EmoReact 数据集上,通过联合使用深度特征训练分类器,以识别包括好奇心在内的 8 种复杂情绪。
- 使用标准指标(特别是 F1 分数)评估性能,并与现有最先进结果进行比较。
实验结果
研究问题
- RQ1从预训练模型中提取的声学特征、音频事件特征和词汇特征在复杂情绪识别中起到何种作用?
- RQ2AudioSet Net、VoxCeleb Net 和 Deep Speech Net 的深层表征在多大程度上能够提升情绪识别性能?
- RQ3来自预训练网络的高层特征是否能有效泛化到好奇心等复杂情绪?
- RQ4使用这些深度网络特征,相较于现有基线,可实现多大的性能提升?
主要发现
- 所提方法在 EmoReact 数据集上实现了 0.85 的 F1 分数,显著优于先前基线的 0.69。
- 从预训练网络高层提取的深度特征在捕捉细微情绪状态方面表现出高度有效性。
- 声学特征、音频事件特征以及基于自动语音翻译的词汇特征的结合,增强了对复杂情绪的判别能力。
- 即使针对不同语音应用进行微调的预训练模型,其表征仍具有较强的可迁移性,适用于情绪识别任务。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。