Skip to main content
QUICK REVIEW

[论文解读] The Role of Phonetic Units in Speech Emotion Recognition

Jiahong Yuan, Xingyu Cai|arXiv (Cornell University)|Aug 2, 2021
Emotion and Mood Recognition参考文献 24被引用 9
一句话总结

本文提出了一种新颖的语音情感识别方法,通过微调 Wav2vec 2.0 实现基于情感依赖的语音识别,以对音素、宽泛音素类别和音节等语音单位进行分类,结果表明引入语音单位可显著提升准确率。在 IEMOCAP 数据集上,使用宽泛音素类别取得了最佳性能,其表现优于音素和话语级模型,并在跨语言设置中展现出良好潜力。

ABSTRACT

We propose a method for emotion recognition through emotiondependent speech recognition using Wav2vec 2.0. Our method achieved a significant improvement over most previously reported results on IEMOCAP, a benchmark emotion dataset. Different types of phonetic units are employed and compared in terms of accuracy and robustness of emotion recognition within and across datasets and languages. Models of phonemes, broad phonetic classes, and syllables all significantly outperform the utterance model, demonstrating that phonetic units are helpful and should be incorporated in speech emotion recognition. The best performance is from using broad phonetic classes. Further research is needed to investigate the optimal set of broad phonetic classes for the task of emotion recognition. Finally, we found that Wav2vec 2.0 can be fine-tuned to recognize coarser-grained or larger phonetic units than phonemes, such as broad phonetic classes and syllables.

研究动机与目标

  • 探究将音素、宽泛音素类别和音节等语音单位纳入模型是否能提升语音情感识别性能。
  • 评估情感识别模型在不同语言和数据集上的鲁棒性与泛化能力。
  • 确定较粗粒度或更大的语音单位(如宽泛音素类别、音节)是否在情感识别中优于传统的音素级模型。
  • 探索 Wav2vec 2.0 是否可有效微调以识别音素以外的更大或更粗粒度的语音单位。
  • 评估宽泛音素类别和音节在跨语言情感识别中的潜力,因其具有语言通用性。

提出的方法

  • 通过训练 Wav2vec 2.0 模型预测情感依赖的语音单位(如音素、宽泛音素类别和音节),在语音情感识别任务上进行微调。
  • 所有语音单位均使用相同的 Wav2vec 2.0 架构,并在其上下文表示基础上添加特定任务的分类头。
  • 在 IEMOCAP 数据集上进行训练,使用带有情感标签的音频数据,每个语音片段均被转录为语音单位并关联其情感标签。
  • 在 IEMOCAP 及另外三个跨语言数据集(EmoDB(德语)、KSU(阿拉伯语)和普通话情感语音数据集(普通话))上评估模型性能。
  • 在测试普通话数据集时,将音频采样率从 8 kHz 上采样至 16 kHz,以缓解采样率不匹配问题。
  • 在所有数据集和语音单位类型上,均以加权准确率为首要评估指标。

实验结果

研究问题

  • RQ1Wav2vec 2.0 是否可被微调以识别比标准音素更粗粒度或更大的语音单位,如宽泛音素类别和音节?
  • RQ2在音素、宽泛音素类别和音节中,哪种语音单位能带来最高的情感识别准确率?
  • RQ3在一种语言上训练的情感识别模型在其他语言上的泛化能力如何,特别是在使用语言通用的语音单位(如宽泛音素类别)时?
  • RQ4与语言特定的音素相比,使用宽泛音素类别或音节是否能提升跨语言情感识别的鲁棒性?
  • RQ5数据不匹配(如采样率差异)对情感识别模型在不同数据集间迁移能力有何影响?

主要发现

  • 在 IEMOCAP 数据集上,基于宽泛音素类别训练的模型取得了最高的情感识别准确率,显著优于音素和话语级模型。
  • 在 IEMOCAP 上表现最佳的模型使用宽泛音素类别,加权准确率达到 73.2%,显著优于以往报道的结果。
  • 在跨语言数据集上,宽泛音素类别模型在 EmoDB(德语)上达到 66.7% 的准确率,在 KSU(阿拉伯语)上达到 60.6%,在普通话情感语音数据集上达到 39.9%,其泛化能力优于音素模型。
  • 音节级模型在德语和阿拉伯语数据集上的表现优于音素级模型,准确率分别为 68.4% 和 55.0%,表明其具有更好的鲁棒性。
  • 普通话数据集上表现较差(音素模型准确率为 40.7%)主要归因于 8 kHz 与 16 kHz 采样率不匹配,经在原始 8 kHz 数据上进行 7 折交叉验证后,初始辅音和元音的准确率提升至 75.2%,证实了该推断。
  • 对 Wav2vec 2.0 进行更大或更粗粒度语音单位(如宽泛音素类别和音节)的微调是可行且有效的,无需依赖语言模型,表明该模型在学习分层语音表征方面具有高度灵活性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。