[论文解读] Speech Emotion Recognition with Multiscale Area Attention and Data Augmentation
本文提出一种结合多尺度区域注意力机制与声道长度扰动(VTLP)的语音情感识别(SER)方法,通过在不同空间粒度上增强特征表示,并利用数据增强提升模型鲁棒性。在 IEMOCAP 数据集上,该方法实现了 79.34% 的加权准确率和 77.54% 的未加权准确率,创下新的 SOTA 记录。
In Speech Emotion Recognition (SER), emotional characteristics often appear in diverse forms of energy patterns in spectrograms. Typical attention neural network classifiers of SER are usually optimized on a fixed attention granularity. In this paper, we apply multiscale area attention in a deep convolutional neural network to attend emotional characteristics with varied granularities and therefore the classifier can benefit from an ensemble of attentions with different scales. To deal with data sparsity, we conduct data augmentation with vocal tract length perturbation (VTLP) to improve the generalization capability of the classifier. Experiments are carried out on the Interactive Emotional Dyadic Motion Capture (IEMOCAP) dataset. We achieved 79.34% weighted accuracy (WA) and 77.54% unweighted accuracy (UA), which, to the best of our knowledge, is the state of the art on this dataset.
研究动机与目标
- 为解决 SER 模型中固定粒度注意力机制的局限性,该机制可能无法捕捉频谱图在不同尺度下的多样化情感能量模式。
- 通过在 IEMOCAP 数据集上应用基于 VTLP 的数据增强,提升模型在低资源场景下的泛化能力。
- 提出一种新型多尺度区域注意力机制,可动态关注多空间粒度下的情感特征。
- 在 IEMOCAP 基准上实现语音情感识别的 SOTA 性能。
提出的方法
- 提出一种多尺度区域注意力机制,可在频谱图表示中对可变大小区域(如 1×1、2×2、3×3、4×4)计算注意力,使模型能够同时关注局部与整体的情感线索。
- 通过从特征图中提取查询(query)、键(key)和值(value)矩阵,对自注意力机制进行改进,注意力分数通过缩放点积注意力的 softmax 计算得出。
- 应用 VTLP 对训练数据进行增强,通过扰动声道长度,在保留情感标签的同时提升数据多样性与模型鲁棒性。
- 采用五层卷积神经网络(CNN),包含批量归一化,随后接注意力层与全连接层进行分类,输入为 logMel 频谱图。
- 使用最大值(Max)、均值(Mean)和采样值(Sample,即扰动后的均值)作为键的特征,使用最大值(Max)、均值(Mean)和求和(Sum)作为值的特征,以探索最优注意力表示。
- 通过消融实验评估注意力类型、VTLP、区域大小及特征选择对模型准确率的影响。
实验结果
研究问题
- RQ1多尺度区域注意力是否能通过捕捉频谱图中不同空间粒度的情感模式,提升 SER 性能?
- RQ2基于 VTLP 的数据增强是否能提升低资源 SER 场景下的模型泛化能力与准确率?
- RQ3在 SER 任务中,多尺度区域注意力的最优最大区域尺寸与特征组合(如 Max、Mean、Sample)为何种配置?
- RQ4多尺度注意力与数据增强的结合方式与 IEMOCAP 数据集上的先前 SOTA 模型相比表现如何?
主要发现
- 所提出的多尺度区域注意力机制在 IEMOCAP 数据集上实现了 79.34% 的加权准确率与 77.54% 的未加权准确率,优于文献中报告的所有先前方法。
- 当与多尺度区域注意力结合时,VTLP 数据增强使准确率提升了约 0.5% 的绝对值,证明其在数据稀缺场景下的有效性。
- 在 VTLP 增强数据上训练时,最优最大区域尺寸为 3×3;而在原始数据上训练时,4×4 表现最佳,表明模型性能对数据分布具有敏感性。
- 键与值特征采用 'Sample-Max' 组合时准确率最高(78.44%),表明在键计算中引入随机扰动能增强模型鲁棒性。
- 消融实验确认,多尺度区域注意力与 VTLP 均对性能提升有显著贡献,最强模型达到 79.34% WA 与 77.54% UA。
- 特征图可视化显示,区域注意力能捕捉比标准 CNN 更广泛的时序上下文,有利于识别长期情感模式。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。