[论文解读] Emotion Recognition From Speech With Recurrent Neural Networks
本论文提出一种基于递归神经网络的方法,采用 Connectionist Temporal Classification (CTC) 损失进行语音情感识别,在 IEMOCAP 上进行评估,并与基线和人工表现进行比较。
In this paper the task of emotion recognition from speech is considered. Proposed approach uses deep recurrent neural network trained on a sequence of acoustic features calculated over small speech intervals. At the same time special probabilistic-nature CTC loss function allows to consider long utterances containing both emotional and neutral parts. The effectiveness of such an approach is shown in two ways. Firstly, the comparison with recent advances in this field is carried out. Secondly, human performance on the same task is measured. Both criteria show the high quality of the proposed method.
研究动机与目标
- 解决在较长说话片段中识别情感的挑战,其中情感可能局部出现在语音中。
- 利用带有 CTC 损失的深度循环神经网络,将帧级特征对齐到说话单元级情感标签。
- 在说话者独立的 cross-validation 下,将基于 CTC 的序列到序列学习与帧级和单标签基线进行比较。
- 评估所提出方法相对于在同一任务上的人类表现的质量。
提出的方法
- 将音频预处理为每帧 200 ms、重叠 100 ms 的帧,并对每帧提取 34 个声学特征(MFCCs、chroma、能量等)。
- 使用基于双向 LSTM 的神经网络,对扩展标签集(包括 NULL)输出概率。
- 使用 Connectionist Temporal Classification (CTC) 损失进行训练,以处理未对齐的长输入序列并产生情感标签序列。
- 在分组交叉验证下将 CTC 与帧级和单标签基线进行比较,以确保说话人独立性。
- 使用整体准确率和均值类准确率进行评估,以应对类别不平衡。
实验结果
研究问题
- RQ1基于 CTC 的 RNN 模型是否能够在较长的语音序列中,从帧级声学特征准确识别出说话单元级情感?
- RQ2在说话人独立评估下,CTC 方法与 IEMOCAP 数据集上的帧级和单标签基线相比如何?
- RQ3人工评估者之间的主观性和标签一致性对模型性能的影响是什么?
- RQ4机器在情感识别任务中的表现与人类表现有多接近?
主要发现
- CTC 达到 54% 的整体准确率和 54% 的均值类准确率,优于帧级基线(45%/41%)和单标签基线(51%/49%),并接近人类表现(69%/70%)。
- 帧级基线在较长的说话片段中表现不稳定,而 CTC 维持鲁棒性能。
- 人工评估者的准确性高于模型,突出情感标注的主观性及改进空间。
- 模型的错误模式与人类标注的不一致部分一致,表明模型捕捉到与人类相似的感知线索。
- 该方法展示了在语音情感识别中使用 CTC 进行端到端序列建模的可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。