Skip to main content
QUICK REVIEW

[论文解读] Exploring Wav2vec 2.0 fine-tuning for improved speech emotion recognition

Liwei Chen, Alexander I. Rudnicky|arXiv (Cornell University)|Oct 12, 2021
Speech Recognition and Synthesis参考文献 28被引用 14
一句话总结

本文提出了一种新颖的微调方法 P-TAPT,用于 wav2vec 2.0 以提升语音情感识别(SER)性能,通过引入情感感知的预训练目标。通过将任务自适应预训练用于预测上下文化的感情状态,P-TAPT 在 IEMOCAP 数据集上相较于最先进模型实现了 7.4% 的绝对准确率提升,尤其在低资源条件下表现显著。

ABSTRACT

While Wav2Vec 2.0 has been proposed for speech recognition (ASR), it can also be used for speech emotion recognition (SER); its performance can be significantly improved using different fine-tuning strategies. Two baseline methods, vanilla fine-tuning (V-FT) and task adaptive pretraining (TAPT) are first presented. We show that V-FT is able to outperform state-of-the-art models on the IEMOCAP dataset. TAPT, an existing NLP fine-tuning strategy, further improves the performance on SER. We also introduce a novel fine-tuning method termed P-TAPT, which modifies the TAPT objective to learn contextualized emotion representations. Experiments show that P-TAPT performs better than TAPT, especially under low-resource settings. Compared to prior works in this literature, our top-line system achieved a 7.4\% absolute improvement in unweighted accuracy (UA) over the state-of-the-art performance on IEMOCAP. Our code is publicly available.

研究动机与目标

  • 为解决预训练数据(ASR)与 SER 数据之间的领域偏移问题,该问题限制了预训练模型的性能。
  • 通过在 wav2vec 2.0 上进行超越简单微调或特征提取的微调,提升语音情感识别(SER)性能。
  • 开发一种数据高效、情感感知的预训练目标,以增强模型泛化能力,尤其在低资源设置下。
  • 探究任务自适应预训练(TAPT)及其变体 P-TAPT 是否能在 SER 任务上超越原始微调和现有最先进方法。
  • 评估 P-TAPT 在捕捉语言和情感内容方面的能力,尤其是在 IEMOCAP 中自然诱发的情感语音中。

提出的方法

  • 提出原始微调(V-FT),在 wav2vec 2.0 的最后一层之上添加全局平均池化层和分类头,用于语音片段级别的 SER。
  • 采用任务自适应预训练(TAPT),在目标 SER 数据集上继续预训练,以减少预训练与微调数据之间的领域偏移。
  • 提出 P-TAPT,一种新方法,通过修改 TAPT 的目标函数,从聚类后的 wav2vec 2.0 表示中预测伪标签情感状态,实现情感感知的自监督学习。
  • 使用一个步长为 2 的独立卷积神经网络(CNN),以对齐 wav2vec 2.0 与 P-TAPT 中情感状态估计模块之间的时序分辨率。
  • 采用基于聚类的方法,从 wav2vec 2.0 的上下文表示中生成情感状态的伪标签,随后通过对比损失函数进行模型训练。
  • 在目标 SER 数据集上预训练期间应用 P-TAPT 目标函数,使模型学习到既具备语音感知又具备情感感知的表示。
Fig. 1 : System overview of our methods. (a) Emotion state estimation phase of P-TAPT. An additional CNN with stride 2 is used to align the time steps between wav2vec and wav2vec 2.0. The output of cluster assignments will be used as pseudo-labels for the P-TAPT objective. (b) Model architecture and
Fig. 1 : System overview of our methods. (a) Emotion state estimation phase of P-TAPT. An additional CNN with stride 2 is used to align the time steps between wav2vec and wav2vec 2.0. The output of cluster assignments will be used as pseudo-labels for the P-TAPT objective. (b) Model architecture and

实验结果

研究问题

  • RQ1wav2vec 2.0 的原始微调能否在 IEMOCAP 数据集上超越现有最先进模型在语音情感识别任务上的表现?
  • RQ2当预训练与微调数据之间存在领域偏移时,任务自适应预训练(TAPT)是否能显著提升 wav2vec 2.0 在 SER 上的性能?
  • RQ3P-TAPT 中修改后的预训练目标(预测情感状态而非掩码音频帧)是否能在低资源 SER 设置下带来更好的性能和更高的数据效率?
  • RQ4在不同数据量下,P-TAPT 的性能与 TAPT 和 V-FT 相比如何,尤其是在低资源场景下?
  • RQ5数据中的语言内容(如句子特定的情感)在多大程度上影响模型性能?P-TAPT 是否能比 TAPT 更好地捕捉此类模式?

主要发现

  • wav2vec 2.0 的原始微调(V-FT)在 IEMOCAP 上实现了 69.9% 的未加权准确率(UA),优于先前使用 wav2vec 2.0 作为特征提取器的最先进方法。
  • 任务自适应预训练(TAPT)将 IEMOCAP 上的性能提升至 73.5% UA,证明了领域适应在缓解领域偏移方面的有效性。
  • 所提出的 P-TAPT 方法在 IEMOCAP 上实现了 74.3% UA,相较于之前最先进性能实现了 7.4% 的绝对提升。
  • P-TAPT 展现出更优的数据效率:在 0.5 小时训练数据下,P-TAPT 相较 V-FT 的提升与 TAPT 相较 V-FT 的提升之比为 65.0%,表明其在低资源设置下获益更大。
  • 在 SAVEE 数据集上,TAPT 相较 V-FT 提升了 8.8% 的 UA,P-TAPT 进一步将性能提升至 70.9% UA,但由于语言与情感之间强相关性,其相对于 TAPT 的提升较小。
  • LibriSpeech 上的预训练损失为 32.04,显著低于 IEMOCAP 上的 55.42,证实了领域偏移的存在,从而支持采用 TAPT 和 P-TAPT。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。