[论文解读] Learning Representations of Emotional Speech with Deep Convolutional Generative Adversarial Networks
该论文提出了一种结合半监督表示学习的深度卷积生成对抗网络(DCGAN),以提升语音情绪效价分类性能。通过利用100小时未标注的会议数据与12小时标注的IEMOCAP数据集,该模型在3分类效价任务上达到49.80%的准确率,性能与当前最先进方法相当,而采用激活度作为多任务目标的训练未带来收益。
Automatically assessing emotional valence in human speech has historically been a difficult task for machine learning algorithms. The subtle changes in the voice of the speaker that are indicative of positive or negative emotional states are often "overshadowed" by voice characteristics relating to emotional intensity or emotional activation. In this work we explore a representation learning approach that automatically derives discriminative representations of emotional speech. In particular, we investigate two machine learning strategies to improve classifier performance: (1) utilization of unlabeled data using a deep convolutional generative adversarial network (DCGAN), and (2) multitask learning. Within our extensive experiments we leverage a multitask annotated emotional corpus as well as a large unlabeled meeting corpus (around 100 hours). Our speaker-independent classification experiments show that in particular the use of unlabeled data in our investigations improves performance of the classifiers and both fully supervised baseline approaches are outperformed considerably. We improve the classification of emotional valence on a discrete 5-point scale to 43.88% and on a 3-point scale to 49.80%, which is competitive to state-of-the-art performance.
研究动机与目标
- 通过利用有限标注数据中的表示学习,提升语音情绪效价分类性能。
- 探究在大规模未标注语音数据上进行无监督预训练是否能提升分类器性能。
- 评估将效价与激活度作为相关目标进行多任务学习的有效性。
- 确定从原始语谱图端到端学习是否优于传统特征工程在情感计算中的表现。
- 评估模型在跨说话人评估中的泛化能力与鲁棒性。
提出的方法
- 微调一个深度卷积神经网络(CNN)架构作为DCGAN框架中的判别器,以学习判别性语音表征。
- 在100小时未标注的会议语料数据上预训练DCGAN,以学习通用语音模式,随后在标注的IEMOCAP数据上进行微调。
- 集成一个多任务头,联合预测情绪效价与激活度,共享底层特征。
- 使用生成器与判别器之间的最小最大损失进行训练,分类头使用交叉熵损失。
- 采用说话人独立的划分方式,设置独立的训练集、验证集与测试集,以确保评估的稳健性。
- 在原始语谱图上进行端到端训练,未使用MFCC或基频等手工设计的声学特征。
实验结果
研究问题
- RQ1在大规模未标注语音数据上进行无监督预训练是否能提升情绪效价分类性能?
- RQ2将效价与激活度作为目标进行多任务学习,是否能增强主效价分类器的泛化能力与准确率?
- RQ3从原始语谱图中进行表示学习与传统基于特征的方法相比,在情感计算中表现如何?
- RQ4使用无关但大规模的语音数据(如会议数据)在多大程度上能提升情绪语音的表征能力?
- RQ5无监督预训练带来的性能提升在不同分类尺度(3分类 vs. 5分类)下是否具有鲁棒性?
主要发现
- BasicDCGAN模型在5分类情绪效价分类任务中达到43.88%的准确率,显著优于完全监督的CNN基线模型。
- 在3分类尺度上,模型准确率达到49.80%,与当前最先进结果相当,包括使用测试说话人会话伙伴数据的模型。
- 预测值与连续效价标签之间的皮尔逊相关系数为ρ = 0.2618(p < .001),表明回归性能具有实际意义。
- 来自AMI会议语料的未标注数据显著提升了特征学习效果,其性能优于完全监督模型。
- 多任务学习未带来性能提升;事实上,其性能略有下降,MultitaskCNN在所有指标上均劣于BasicCNN。
- 混淆矩阵显示,'负面'类别具有高召回率但低精确率,而'非常积极'类别F1值最高(0.5284)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。