[论文解读] Multistage linguistic conditioning of convolutional layers for speech emotion recognition
本文提出一种多阶段语言条件化方法,将源自 BERT 的语言嵌入与卷积神经网络处理对数梅尔倒谱图的多个中间层相结合,用于语音情感识别(SER)。该方法在 MSP-Podcast 和 IEMOCAP 数据集上的分类与维度化 SER 任务中均优于单阶段融合与晚期融合基线模型,尤其在愉悦度与支配感预测方面表现更优。
In this contribution, we investigate the effectiveness of deep fusion of text and audio features for categorical and dimensional speech emotion recognition (SER). We propose a novel, multistage fusion method where the two information streams are integrated in several layers of a deep neural network (DNN), and contrast it with a single-stage one where the streams are merged in a single point. Both methods depend on extracting summary linguistic embeddings from a pre-trained BERT model, and conditioning one or more intermediate representations of a convolutional model operating on log-Mel spectrograms. Experiments on the MSP-Podcast and IEMOCAP datasets demonstrate that the two fusion methods clearly outperform a shallow (late) fusion baseline and their unimodal constituents, both in terms of quantitative performance and qualitative behaviour. Overall, our multistage fusion shows better quantitative performance, surpassing alternatives on most of our evaluations. This illustrates the potential of multistage fusion in better assimilating text and audio information.
研究动机与目标
- 通过深度融合语言与声学信息,实现更紧密的语言与声学信息整合,以提升语音情感识别(SER)性能。
- 探究多阶段融合——即在多个卷积神经网络层上使用语言嵌入进行条件化——是否优于单阶段或晚期融合。
- 在真实世界数据集上评估该方法在分类与维度化 SER 任务中的有效性。
- 分析模型偏差与错误模式,尤其关注自然主义情感数据集中情感尺度极端值与数据不平衡问题。
提出的方法
- 从预训练的 BERT 模型中为每个语音片段提取摘要语言嵌入。
- 将这些嵌入用于条件化训练于对数梅尔倒谱图的卷积神经网络中的多个中间卷积层。
- 采用多阶段融合架构(MFCNN14),在卷积神经网络的多个阶段应用语言条件化。
- 与单阶段融合模型(SFCNN14)进行对比,后者仅在网络中某一点进行融合。
- 以晚期融合(LF)作为基线,通过平均独立的单模态 BERT 与 CNN 模型的预测结果实现融合。
- 使用 CCC 与 MSE 作为评估指标,在多个情感维度(唤醒度、愉悦度、支配感)上联合训练模型。
实验结果
研究问题
- RQ1与单阶段或晚期融合相比,对卷积神经网络层进行多阶段语言条件化是否能提升语音情感识别性能?
- RQ2语言与声学特征的融合在不同情感维度(唤醒度、愉悦度、支配感)上的表现如何?
- RQ3所提出的融合方法在多大程度上减少了偏差,特别是对情感尺度极端值的偏差?
- RQ4模型的误差残差行为如何?是否存在异方差性或向均值回归现象?
- RQ5多阶段融合是否能比单模态或浅层融合基线更好地整合语言与声学信息?
主要发现
- 多阶段融合模型(MFCNN14)在所有指标上均表现最佳,在 MSP-Podcast 数据集上,唤醒度的 CCC 为 .670,愉悦度为 .515,支配感为 .603。
- MFCNN14 在愉悦度(CCC: .515 vs. .462)与支配感(CCC: .603 vs. .209)上显著优于 BERT 单模态基线,证明了深度融合的优势。
- 单阶段融合模型(SFCNN14)在性能上优于晚期融合与单模态模型,但在支配感与愉悦度预测方面仍逊于 MFCNN14。
- 误差残差分析显示,包括 BERT 与 CNN14 在内的多数模型在尺度极端值处误差更高,表明存在向均值回归现象,尽管 SFCNN14 的残差分布更为均衡。
- MFCNN14 与 SFCNN14 均较 BERT 与 CNN14 减少了偏差,其中 MFCNN14 在所有维度上均表现出最一致的性能。
- 多阶段方法在整合语言与声学线索方面表现更优,这从更优的定量结果与更稳定的误差模式中得到验证。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。