Skip to main content
QUICK REVIEW

[论文解读] Transfer Learning From Sound Representations For Anger Detection in Speech

Mohamed Ezzeldin A. Elshaer, Scott Wisdom|arXiv (Cornell University)|Feb 6, 2019
Emotion and Mood Recognition参考文献 19被引用 14
一句话总结

本文提出了一种基于 SoundNet 的迁移学习方法,用于低延迟语音愤怒情绪检测。SoundNet 是一种在通用声音上预训练的自监督音频表征模型。通过在小规模语音情绪数据集(IEMOCAP)上微调 SoundNet 的特征,该方法在自然语音和跨语言语音上均取得了显著的性能提升,表明尽管在预训练阶段没有直接的情绪监督,通用声音表征仍能很好地泛化到情绪语音任务中。

ABSTRACT

In this work, we train fully convolutional networks to detect anger in speech. Since training these deep architectures requires large amounts of data and the size of emotion datasets is relatively small, we use transfer learning. However, unlike previous approaches that use speech or emotion-based tasks for the source model, we instead use SoundNet, a fully convolutional neural network trained multimodally on a massive video dataset to classify audio, with ground-truth labels provided by vision-based classifiers. As a result of transfer learning from SoundNet, our trained anger detection model improves performance and generalizes well on a variety of acted, elicited, and natural emotional speech datasets. We also test the cross-lingual effectiveness of our model by evaluating our English-trained model on Mandarin Chinese speech emotion data. Furthermore, our proposed system has low latency suitable for real-time applications, only requiring 1.2 seconds of audio to make a reliable classification.

研究动机与目标

  • 通过利用大规模通用音频表征的迁移学习,解决语音情绪标注数据有限的挑战。
  • 使用仅 1.2 秒延迟的全卷积神经网络(FCN)提升语音中愤怒情绪检测的性能。
  • 探究在通用声音事件上预训练(通过 SoundNet)是否比基于语音或情绪特定的预训练在愤怒情绪检测中具有更好的泛化能力。
  • 通过在中文普通话情绪语音数据上测试英语模型,评估其跨语言迁移能力。
  • 开发一种适用于社交机器人和交互式语音应答(IVR)系统等实时应用场景的低延迟系统。

提出的方法

  • 使用从预训练 SoundNet 模型初始化的权重,微调一个全卷积神经网络(FCN)用于愤怒情绪检测。
  • 采用 SoundNet 作为源模型——一个在 200 万个视频片段上训练的 5 层全卷积网络,利用视觉标签对通用音频事件进行分类。
  • 在微调过程中冻结 SoundNet 的前两层,以保留低层次的声学表征,同时调整高层网络以适应情绪分类任务。
  • 在 IEMOCAP 数据集上端到端训练 FCN,采用平衡采样策略以缓解愤怒与非愤怒语音片段之间的类别不平衡问题。
  • 采用滑动窗口推理策略,使用 1.2 秒的音频片段和 600ms 的步长,对较短的片段进行零填充,以实现低延迟的实时预测。
  • 使用交叉熵损失进行模型优化,并以 AU-ROC 作为主要评估指标,以应对类别不平衡问题并支持训练后灵活调整阈值。

实验结果

研究问题

  • RQ1与从随机初始化训练相比,从通用声音表征模型(SoundNet)进行迁移学习是否能提升语音中愤怒情绪检测的性能?
  • RQ2在通用音频事件上预训练是否能带来比传统语音基预训练更好的泛化能力,特别是在不同语音条件(如表演式、诱发式、自然语音)下的表现?
  • RQ3当在英语数据上微调后,该模型在中文普通话情绪语音上的跨语言设置下效果如何?
  • RQ4该模型在保持高性能的同时,是否能将延迟控制在 1.2 秒以内,从而适用于实时应用场景?
  • RQ5尽管 SoundNet 未在语音或情绪标签上进行训练,其学习到的低层次声学特征是否可迁移用于语音情绪识别?

主要发现

  • 与从零初始化训练相比,从 SoundNet 进行迁移学习将 IEMOCAP 诱发英语数据集上的 AU-ROC 从 0.719 提升至 0.736,且差异具有统计显著性(p < 3e-4)。
  • 在自然英语数据集 AngerSES 上,迁移学习模型的 AU-ROC 达到 0.669,显著优于随机初始化模型的 0.581。
  • 在表演式普通话中文数据集 MASC 上,迁移学习模型的 AU-ROC 达到 0.626,显著优于从零初始化训练的基线模型的 0.481。
  • 由于 SoundNet 学习到的声学表征具有鲁棒性,该模型在未见条件(如含环境噪声的自然语音、不同录音环境)下也表现出良好的泛化能力。
  • 除 EmoProsody 外,所有性能提升在 99% 置信水平下均具有统计显著性(p < 3e-4),证实了迁移学习方法的有效性。
  • 系统仅需 1.2 秒音频延迟,与人类感知愤怒的时间(约 700ms)相近,因此适用于对话式人工智能和社交机器人等实时应用场景。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。