Skip to main content
QUICK REVIEW

[论文解读] Variational Autoencoders for Learning Latent Representations of Speech Emotion: A Preliminary Study

Siddique Latif, Rajib Rana|arXiv (Cornell University)|Dec 22, 2017
Speech Recognition and Synthesis被引用 4
一句话总结

本文提出使用变分自编码器(VAEs)和条件变分自编码器(CVAEs)来学习语音信号的解耦、低维潜在表征,用于情感分类,在IEMOCAP数据集上实现了最先进性能。通过将VAE学习到的特征与LSTM分类器结合,该方法在维度情感预测方面优于基于自编码器和先前的深度学习方法。

ABSTRACT

Learning the latent representation of data in unsupervised fashion is a very interesting process that provides relevant features for enhancing the performance of a classifier. For speech emotion recognition tasks, generating effective features is crucial. Currently, handcrafted features are mostly used for speech emotion recognition, however, features learned automatically using deep learning have shown strong success in many problems, especially in image processing. In particular, deep generative models such as Variational Autoencoders (VAEs) have gained enormous success for generating features for natural images. Inspired by this, we propose VAEs for deriving the latent representation of speech signals and use this representation to classify emotions. To the best of our knowledge, we are the first to propose VAEs for speech emotion classification. Evaluations on the IEMOCAP dataset demonstrate that features learned by VAEs can produce state-of-the-art results for speech emotion classification.

研究动机与目标

  • 探究诸如VAEs之类的深度生成模型是否能够学习到有效的、解耦的潜在表征,用于语音情感识别。
  • 比较VAEs及其条件变体(CVAE)与传统自编码器(AEs)在学习情感敏感特征方面的性能。
  • 评估将VAE学习到的特征与LSTM分类器结合用于分类情感和维度情感分类的有效性。
  • 确定实现最高分类准确率的最优潜在维度数量。

提出的方法

  • 在原始语音语谱图上端到端训练变分自编码器(VAE),以学习概率潜在表征,将潜在码的后验分布建模为高斯分布。
  • VAE使用深度神经网络编码器来预测潜在分布的均值和方差,并使用解码器从采样得到的潜在码中重建输入语音信号。
  • 采用条件变分自编码器(CVAE)变体,其中在训练过程中将潜在表征条件化于情感标签,以提升解耦性和表征质量。
  • 将学习到的潜在特征(均值和方差向量)用作LSTM分类器的输入,以实现分类情感和维度情感识别。
  • 使用变分下界(ELBO)目标函数进行模型训练,该函数平衡重建损失与后验分布和先验分布之间的KL散度。
  • 通过不同潜在维度大小(32、128、512)的消融研究,分析其对分类性能的影响。

实验结果

研究问题

  • RQ1VAEs能否有效学习到用于情感分类的有意义且解耦的语音信号潜在表征?
  • RQ2当与LSTM分类器结合时,基于VAE的特征学习性能与传统自编码器(AEs)相比如何?
  • RQ3与标准VAEs相比,使用条件变分自编码器(CVAE)是否能进一步提升表征质量和分类准确率?
  • RQ4在语音情感分类中,实现最佳性能的最优潜在维度数量是多少?

主要发现

  • CVAE-LSTM模型在维度情感分类(Arousal, Power, Valence)上实现了56.42%的平均准确率,优于先前最佳结果55.3%(来自分层特征融合方法)。
  • 在分类情感分类中,CVAE-LSTM模型达到了64.93%的准确率,与使用手工设计或混合特征的最先进方法相比具有竞争力。
  • VAE-LSTM和CVAE-LSTM显著优于AE-LSTM基线模型,证明了VAEs在学习情感敏感表征方面的优越性。
  • 最优潜在特征数量被确定为128;较小(32)和较大(512)的维度均导致性能下降,表明需要进行经验调优。
  • 结果表明,VAEs能够有效学习到解耦的、低维的表征,捕捉到与情感相关的信息,从而在最小归纳偏差下实现高性能分类。
  • 本研究证实了使用深度生成模型(如VAEs)进行语音情感特征自动、端到端学习的可行性与潜力,为未来自监督情感表征学习研究铺平了道路。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。