Skip to main content
QUICK REVIEW

[论文解读] On the Impact of Word Error Rate on Acoustic-Linguistic Speech Emotion Recognition: An Update for the Deep Learning Era

Shahin Amiriparian, Artem Sokolov|arXiv (Cornell University)|Apr 20, 2021
Speech Recognition and Synthesis参考文献 31被引用 9
一句话总结

本文研究了在深度学习时代,自动语音识别(ASR)词错误率(WER)对声学-语言学语音情感识别(SER)的影响。采用现代ASR系统(RNN-T、CTC、wav2vec)和预训练文本编码器(BERT、DeepMoji、ELECTRA),将声学特征(openSMILE、DeepSpectrum、auDeep、BoAW)与ASR生成的转录文本及标准转录文本进行融合,在IEMOCAP数据集上通过晚期融合实现了73.6%(开发集)和73.8%(测试集)的最新技术水平未加权平均召回率(UAR)。

ABSTRACT

Text encodings from automatic speech recognition (ASR) transcripts and audio representations have shown promise in speech emotion recognition (SER) ever since. Yet, it is challenging to explain the effect of each information stream on the SER systems. Further, more clarification is required for analysing the impact of ASR's word error rate (WER) on linguistic emotion recognition per se and in the context of fusion with acoustic information exploitation in the age of deep ASR systems. In order to tackle the above issues, we create transcripts from the original speech by applying three modern ASR systems, including an end-to-end model trained with recurrent neural network-transducer loss, a model with connectionist temporal classification loss, and a wav2vec framework for self-supervised learning. Afterwards, we use pre-trained textual models to extract text representations from the ASR outputs and the gold standard. For extraction and learning of acoustic speech features, we utilise openSMILE, openXBoW, DeepSpectrum, and auDeep. Finally, we conduct decision-level fusion on both information streams -- acoustics and linguistics. Using the best development configuration, we achieve state-of-the-art unweighted average recall values of $73.6\,\%$ and $73.8\,\%$ on the speaker-independent development and test partitions of IEMOCAP, respectively.

研究动机与目标

  • 研究现代深度学习系统中ASR词错误率(WER)对语言学语音情感识别(SER)的影响。
  • 评估端到端SER系统中标准转录文本(GS)与ASR生成转录文本之间的性能差距。
  • 识别实现最先进SER性能的声学与语言学特征集的最佳组合。
  • 评估结合声学、标准转录文本和ASR转录文本表示的晚期融合策略的有效性。
  • 为未来SER研究提供一个生态上有效的基准,使用真实的ASR输出而非理想化的人工转录文本。

提出的方法

  • 将三种现代ASR系统(RNN-T、CTC、wav2vec)应用于原始音频,生成ASR转录文本,并与标准转录文本对比测量WER。
  • 使用预训练的NLP模型(BERT、DeepMoji、ELECTRA)从ASR输出和标准转录文本中提取上下文文本嵌入。
  • 采用四种声学特征提取方法:openSMILE(ComParE 2016)、BoAW(来自openXBOW)、DeepSpectrum(使用预训练DenseNet121)以及auDeep(基于自编码器的表征学习)。
  • 通过多数投票法实施晚期融合,以整合多个声学与语言学特征集的预测结果。
  • 对IEMOCAP数据集的开发集与测试集进行了全面的消融研究,评估了单个与组合特征集的表现。
  • 采用未加权平均召回率(UAR)进行性能评估,并在多种配置下评估统计显著性。

实验结果

研究问题

  • RQ1随着ASR词错误率(WER)的增加,语言学语音情感识别的性能如何变化?
  • RQ2当与声学特征融合时,ASR生成的转录文本与标准转录文本在SER性能上的表现有何差异?
  • RQ3在晚期融合设置下,哪些声学与语言学特征集的组合能实现最高的SER性能?
  • RQ4ASR生成的文本嵌入与标准转录文本嵌入之间的相似性是否限制了早期或晚期融合中的性能提升?
  • RQ5是否可以在不针对目标数据集进行微调的情况下,仅使用真实的ASR输出实现最先进水平的SER性能?

主要发现

  • 在仅使用语言学特征的SER中,标准转录文本始终优于ASR生成的转录文本,且WER越低,未加权平均召回率(UAR)越高,二者存在明显相关性。
  • 尽管在单独使用时表现较差,但ASR生成的语言学特征在与声学特征融合后仍能带来正向贡献,在IEMOCAP测试集上实现了73.8%的UAR。
  • 表现最佳的配置在开发集上达到73.6%的UAR,在测试集上达到73.8%的UAR,代表了针对说话人无关的IEMOCAP评估的新SOTA水平。
  • 所有特征集(音频、GS文本、ASR文本)的组合实现了最高的平均UAR(66.2%)和最大UAR(73.6%),表明多样化表征具有优势。
  • 仅融合ASR生成文本与标准文本特征并未提升性能,反而可能因特征高度相似和冗余而表现不如仅使用标准文本特征。
  • 性能最高的融合策略结合了BERT、DeepMoji和auDeep特征与音频表征,证明了多模态与多架构融合的价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。