[论文解读] Learning Representations of Affect from Speech
该论文提出使用去噪自编码器和循环自编码器,从原始语音谱图中无监督地学习具有区分性的副语言情感属性表征——如激活强度和情绪效价。表现最佳的模型(128个FFT频点、5帧上下文的权重共享堆叠自编码器)在IEMOCAP数据集上四分类情绪识别任务中取得了48.10%的加权准确率,优于标准特征提取器,且与当前最先进方法相当。
There has been a lot of prior work on representation learning for speech recognition applications, but not much emphasis has been given to an investigation of effective representations of affect from speech, where the paralinguistic elements of speech are separated out from the verbal content. In this paper, we explore denoising autoencoders for learning paralinguistic attributes i.e. categorical and dimensional affective traits from speech. We show that the representations learnt by the bottleneck layer of the autoencoder are highly discriminative of activation intensity and at separating out negative valence (sadness and anger) from positive valence (happiness). We experiment with different input speech features (such as FFT and log-mel spectrograms with temporal context windows), and different autoencoder architectures (such as stacked and deep autoencoders). We also learn utterance specific representations by a combination of denoising autoencoders and BLSTM based recurrent autoencoders. Emotion classification is performed with the learnt temporal/dynamic representations to evaluate the quality of the representations. Experiments on a well-established real-life speech dataset (IEMOCAP) show that the learnt representations are comparable to state of the art feature extractors (such as voice quality features and MFCCs) and are competitive with state-of-the-art approaches at emotion and dimensional affect recognition.
研究动机与目标
- 研究语音中情感与副语言属性的无监督表征学习,超越标准特征提取器(如MFCCs)的局限。
- 评估自编码器是否能够学习到对类别化情绪(如愤怒、快乐、悲伤、中性)和维度化情感(激活度、效价)的区分性表征。
- 比较不同谱图类型(FFT、对数梅尔)、时间上下文窗口以及自编码器架构(堆叠式、深层、权重共享/非共享)在情感表征学习中的表现。
- 探索将去噪自编码器与BLSTM-RNN结构的循环自编码器结合,以学习话语级情感表征的有效性。
- 通过在IEMOCAP数据集上采用说话人独立的交叉验证协议,评估下游情绪分类任务中所学表征的质量。
提出的方法
- 在添加了噪声的语音谱图(FFT和对数梅尔)上训练去噪自编码器,通过使用tanh激活函数的前馈网络学习低维瓶颈表征。
- 自编码器采用权重共享(W = W′^T)以减少参数量并起到正则化作用,并通过反向传播最小化重构误差进行训练。
- 通过使用5帧的滑动窗口,将时间上下文信息整合到输入谱图中,以编码序列信息。
- 评估堆叠式和深层自编码器架构,并在保留的验证集上选择最佳配置(TIED-128-5)。
- 在最佳谱图-自编码器配置的激活输出上训练BLSTM-RNN作为循环自编码器,以学习序列级表征。
- 从BLSTM编码器中提取话语级表征,并用于初始化多层感知机(MLP)以进行情绪分类。
实验结果
研究问题
- RQ1去噪自编码器能否有效从原始语音谱图中学习到对类别化和维度化情感特质的区分性表征?
- RQ2不同谱图类型(FFT与对数梅尔)以及时间上下文窗口如何影响所学情感表征的质量?
- RQ3在堆叠自编码器中使用权重共享是否相比非共享权重能提升表征质量?
- RQ4循环自编码器(特别是BLSTM-RNN)是否能比前馈自编码器更好地捕捉动态的话语级情感模式?
- RQ5在下游情绪分类任务中,所学表征与标准特征提取器(如MFCCs、语音特征)相比表现如何?
主要发现
- TIED-128-5配置(128个FFT频点、5帧上下文、权重共享)在验证集上表现最佳,被选为最优模型。
- 瓶颈层表征对激活强度具有高度区分性,能有效将高激活情绪(愤怒、兴奋)与低激活情绪(悲伤)分离。
- 表征还能有效区分负向效价(愤怒、悲伤)与正向效价(快乐),表明对情感情感倾向具有敏感性。
- 使用预训练自编码器权重初始化的最终MLP分类器,在IEMOCAP数据集上采用五折留一话者交叉验证方案,取得了48.10%的加权准确率。
- 该方法优于未预训练的MLP(46.75%加权准确率)和基于COVAREP的Softmax分类器(44.67%加权准确率),证明了无监督预训练的价值。
- BLSTM-自编码器成功捕捉了话语级表征,可视化结果表明情感状态呈现有意义的聚类。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。