[论文解读] Contrastive Unsupervised Learning for Speech Emotion Recognition
本文提出通过对比预测编码(CPC)进行对比无监督表示学习,以在不依赖大规模标注数据集的情况下提升语音情感识别(SER)性能。通过在无标注语音数据上进行预训练,模型学习到鲁棒且与情感相关的特征,在IEMOCAP和MSP-Podcast数据集上显著提升性能,所有情感基本维度(激活度、效价、支配感)均达到当前最优的CCC分数。
Speech emotion recognition (SER) is a key technology to enable more natural human-machine communication. However, SER has long suffered from a lack of public large-scale labeled datasets. To circumvent this problem, we investigate how unsupervised representation learning on unlabeled datasets can benefit SER. We show that the contrastive predictive coding (CPC) method can learn salient representations from unlabeled datasets, which improves emotion recognition performance. In our experiments, this method achieved state-of-the-art concordance correlation coefficient (CCC) performance for all emotion primitives (activation, valence, and dominance) on IEMOCAP. Additionally, on the MSP- Podcast dataset, our method obtained considerable performance improvements compared to baselines.
研究动机与目标
- 解决语音情感识别(SER)中大规模标注数据集缺乏的问题,这是深度学习方法的主要瓶颈。
- 探究在大量无标注语音数据上进行无监督预训练是否能提升SER性能。
- 评估对比预测编码(CPC)作为学习语音中与情感相关表征的预训练方法的有效性。
- 证明无监督表征即使在无显式情感监督的情况下也能捕捉到具有判别性的感情模式。
- 比较不同的预训练策略——CPC在LibriSpeech上的预训练、联合训练以及小规模预训练——以评估其泛化能力和鲁棒性。
提出的方法
- 应用对比预测编码(CPC)从大规模无标注语音数据集中学习声学表征,使用非线性编码器将原始波形映射为潜在表征。
- 使用单向GRU作为自回归模型,从过去的潜在状态生成上下文表征,用于预测未来的表征。
- 将学习目标表述为使用infoNCE损失的对比N分类问题,其中正样本为真实的未来表征,负样本则从其他序列中随机采样。
- 在LibriSpeech的10秒语音片段上训练CPC模型,每个上下文使用50个负样本,并预测12个时间步之后的表征。
- 使用两层前馈网络和8头自注意力层对预训练的CPC编码器进行微调以用于SER,采用dropout和权重衰减正则化。
- 在IEMOCAP和MSP-Podcast数据集上,通过5折交叉验证评估下游SER任务中学习到的表征性能。

实验结果
研究问题
- RQ1通过CPC进行对比无监督表示学习是否能在不使用标注情感数据的情况下提升标准基准上的语音情感识别性能?
- RQ2与手工设计特征和联合训练相比,基于CPC的预训练在情感基本维度上的泛化能力和性能表现如何?
- RQ3在无显式情感监督的情况下,预训练CPC模型的嵌入空间中情感聚类的出现程度如何?
- RQ4在多样化且大规模的语音数据(如LibriSpeech)上进行预训练,是否比在较小或任务特定的数据上进行预训练能带来更好的SER性能?
- RQ5预训练策略的选择(如preCPC vs. miniCPC vs. jointCPC)如何影响模型在不同情感维度上的泛化能力?
主要发现
- preCPC方法在IEMOCAP数据集上达到了当前最优的组内相关系数(CCC),平均CCC为0.731 ± 0.003,优于所有基线方法,包括手工特征(Sup)和联合训练(jointCPC)。
- 在IEMOCAP数据集上,preCPC在激活度维度上取得0.752 ± 0.014的CCC,在效价维度上为0.752 ± 0.009,在支配感维度上为0.691 ± 0.009,表明即使在具有挑战性的效价维度上也表现出色。
- 在MSP-Podcast数据集上,preCPC的平均CCC为0.571 ± 0.004,优于最佳基线方法(miniCPC)0.022,尤其在效价(0.377 ± 0.008)和支配感(0.639 ± 0.012)维度上提升显著。
- 尽管在较小数据集上预训练,miniCPC变体仍优于jointCPC,表明无监督预训练在情感识别任务中比联合优化具有更好的泛化能力。
- 对学习到的表征进行可视化显示,情感类别(如悲伤与愤怒)在嵌入空间中呈现出清晰的聚类,证实了在无显式监督下,与情感相关的结构能够自然涌现。
- preCPC模型显著优于jointCPC方法,表明将表示学习与情感预测分离可获得更高质量的特征和更强的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。