Skip to main content
QUICK REVIEW

[论文解读] Multi-Channel Auto-Encoder for Speech Emotion Recognition

Zefang Zong, Hao Li|arXiv (Cornell University)|Oct 25, 2018
Emotion and Mood Recognition参考文献 18被引用 5
一句话总结

该论文提出了一种用于语音情感识别的多通道自编码器(MTC-AE),通过在不同低层级声学描述符上训练多个局部深度神经网络(DNN),每个网络均以堆叠去噪自编码器(SDAE)进行初始化,再将瓶颈特征拼接用于全局分类。该方法在IEMOCAP数据集上实现了64.8%的留一说话人测试未加权准确率,优于先前的最先进方法2.4个百分点。

ABSTRACT

Inferring emotion status from users' queries plays an important role to enhance the capacity in voice dialogues applications. Even though several related works obtained satisfactory results, the performance can still be further improved. In this paper, we proposed a novel framework named multi-channel auto-encoder (MTC-AE) on emotion recognition from acoustic information. MTC-AE contains multiple local DNNs based on different low-level descriptors with different statistics functions that are partly concatenated together, by which the structure is enabled to consider both local and global features simultaneously. Experiment based on a benchmark dataset IEMOCAP shows that our method significantly outperforms the existing state-of-the-art results, achieving $64.8\%$ leave-one-speaker-out unweighted accuracy, which is $2.4\%$ higher than the best result on this dataset.

研究动机与目标

  • 为解决直接拼接低层级描述符(LLDs)导致的过拟合与高维输入问题。
  • 在保留各LLD独立判别能力的同时,通过共享全局分类器实现特征融合。
  • 通过使用堆叠去噪自编码器(SDAE)对局部DNN进行无监督预训练,提升泛化能力与表征质量。
  • 通过在统一目标函数下联合训练局部与全局分类器,实现在基准数据集上的优越性能。
  • 证明通过多通道自编码实现的结构化特征融合,相较于传统拼接或高层统计方法,能生成更鲁棒、更具判别性的表征。

提出的方法

  • 该框架采用38个局部DNN,每个DNN分别在不同的低层级声学描述符(LLD)上进行训练,以保持特征独立性。
  • 每个局部DNN通过堆叠去噪自编码器(SDAE)进行预训练,通过重建被遮蔽20%噪声的输入,提升模型鲁棒性与泛化能力。
  • 从每个局部DNN中提取瓶颈特征,并将其拼接形成高层、紧凑的表征,供全局分类器使用。
  • 全局分类器与局部分类器通过单一目标函数联合训练,确保局部与全局学习的一致性。
  • 最终预测通过融合所有局部与全局分类器的输出获得,从而增强整体判别能力。
  • 优化使用Adam优化器,学习率为0.0003,批量大小为64,并基于验证集性能采用早停策略。

实验结果

研究问题

  • RQ1能否通过保留特征独立性并支持联合学习的多通道自编码器架构,提升语音情感识别性能?
  • RQ2使用堆叠去噪自编码器(SDAE)对局部DNN进行预训练,是否能在小样本场景下提升泛化能力并减少过拟合?
  • RQ3与直接拼接原始LLDs相比,拼接多个专用局部网络的瓶颈特征在分类准确率方面表现如何?
  • RQ4与顺序或独立训练相比,联合训练局部与全局分类器在性能提升方面具有多大程度的优势?
  • RQ5所提出的MTC-AE框架能否在IEMOCAP基准数据集上,于留一说话人测试设置下达到最先进性能?

主要发现

  • MTC-AE在IEMOCAP数据集上实现了64.8%的留一说话人测试未加权准确率,较先前最先进方法提升2.4个百分点。
  • 无SDAE预训练的变体(MTC-DNN)仍优于先前方法,达到62.7%准确率,证明了结构化特征融合的有效性。
  • 使用SDAE进行预训练显著提升了性能,表明噪声鲁棒的初始化有助于模型收敛与泛化。
  • 利用多个局部DNN的瓶颈特征实现了比直接拼接LLDs更优的表征学习,减少了过拟合并提升了判别能力。
  • 在统一目标函数下联合训练局部与全局分类器,相比独立训练,能实现更一致且高效的特征学习。
  • 该方法有效缓解了高维输入与有限训练数据导致的过拟合问题,尤其在说话人相关设置下表现显著。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。