[论文解读] Deep Multilayer Perceptrons for Dimensional Speech Emotion Recognition
本文提出一种通过使用高级统计函数(HSF)降低输入维度的深度多层感知机(MLP),在 IEMOCAP 和 MSP-IMPROV 数据集上,在说话人相关和说话人无关设置下,实现了维度化语音情感识别的最先进性能,优于更深层的 LSTM 和 CNN 架构,且计算资源需求显著更低。
Modern deep learning architectures are ordinarily performed on high-performance computing facilities due to the large size of the input features and complexity of its model. This paper proposes traditional multilayer perceptrons (MLP) with deep layers and small input size to tackle that computation requirement limitation. The result shows that our proposed deep MLP outperformed modern deep learning architectures, i.e., LSTM and CNN, on the same number of layers and value of parameters. The deep MLP exhibited the highest performance on both speaker-dependent and speaker-independent scenarios on IEMOCAP and MSP-IMPROV corpus.
研究动机与目标
- 为解决现代深度学习在语音情感识别中计算需求过高的问题,提出一种轻量级深度 MLP 架构。
- 评估在使用紧凑的高级统计特征时,传统深度 MLP 是否能超越 LSTM 和 CNN 等现代架构。
- 研究深度 MLP 在说话人相关和说话人无关语音情感识别场景中的有效性。
- 证明在维度化情感识别中实现高性能并不需要昂贵的 GPU 硬件或复杂模型。
- 在多个数据集上进行泛化,包括同语料库和混合语料库评估。
提出的方法
- 输入特征源自 GeMAPS 低层次描述符(LLD),对每个语音段应用高级统计函数(HSF),将维度从 3409×23 降低至 1×23。
- 采用包含五个隐藏层的深度多层感知机(MLP),不包括输入层和输出层,使用均方误差(MSE)损失进行训练。
- 模型预测三个连续的情感维度:愉悦度、唤醒度和支配度,训练时归一化至 [-1, 1]。
- 评估两种训练场景:说话人相关(80/20 划分)和说话人无关(留一话务会话,LOSO),使用 IEMOCAP 和 MSP-IMPROV 数据集。
- 所有设置下均以组内相关系数(CCC)为主要评估指标。
- 通过合并 IEMOCAP 和 MSP-IMPROV 的训练集、开发集和测试集,构建混合语料库数据集,以评估跨语料库泛化能力。
实验结果
研究问题
- RQ1在维度化语音情感识别中,具有小输入尺寸的深度 MLP 是否能超越 LSTM 和 CNN 等现代深度学习架构?
- RQ2在多个数据集上,所提出的深度 MLP 在说话人相关和说话人无关设置下的性能表现如何?
- RQ3使用高级统计特征(HSF)在多大程度上降低了计算复杂度,同时保持了识别准确率?
- RQ4在混合语料库评估中,模型在不同数据集间的泛化能力如何?
- RQ5若使用与评估指标(CCC)匹配的损失函数进行训练,而非 MSE 损失,模型性能是否会提升?
主要发现
- 所提出的深度 MLP 在 IEMOCAP 和 MSP-IMPROV 数据集的所有情感维度及平均得分上,均在说话人相关和说话人无关设置下达到最高组内相关系数(CCC)。
- 在 IEMOCAP 上,深度 MLP 的平均 CCC 分别为 0.469(说话人相关)和 0.453(说话人无关),优于 LSTM(0.387 和 0.359)和 CNN(0.307 和 0.328)。
- 在 MSP-IMPROV 上,深度 MLP 的平均 CCC 分别为 0.536(说话人相关)和 0.407(说话人无关),优于 LSTM(0.515 和 0.335)和 CNN(0.497 和 0.375)。
- 在混合语料库评估中,深度 MLP 的平均 CCC 分别为 0.499(说话人相关)和 0.294(说话人无关),在所有维度上再次优于 LSTM 和 CNN。
- 在 IEMOCAP 中,说话人相关与说话人无关场景之间的性能差距小于 MSP-IMPROV,可能由于文件命名和话务会话排序的差异所致。
- 尽管使用 MSE 损失而非 CCC 损失,模型仍表现出优越性能,表明若采用基于 CCC 的训练,性能还可进一步提升,显示出巨大的优化潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。