[论文解读] Bimodal Speech Emotion Recognition Using Pre-Trained Language Models
本文提出 IEmoNET,一种模块化的双模态框架,通过将预训练语言模型(BERT/XLNet)与语音情感识别(SER)相结合,以提升情感分类性能。通过在文本上微调语言模型,并将其与独立的 SER 系统集成,该方法在 IEMOCAP 数据集上使用所提供转录文本时达到 73.5% 的准确率,在使用自动转录输入时达到 71.4%,证明了预训练模型在多模态情感识别中的有效性。
Speech emotion recognition is a challenging task and an important step towards more natural human-machine interaction. We show that pre-trained language models can be fine-tuned for text emotion recognition, achieving an accuracy of 69.5% on Task 4A of SemEval 2017, improving upon the previous state of the art by over 3% absolute. We combine these language models with speech emotion recognition, achieving results of 73.5% accuracy when using provided transcriptions and speech data on a subset of four classes of the IEMOCAP dataset. The use of noise-induced transcriptions and speech data results in an accuracy of 71.4%. For our experiments, we created IEmoNet, a modular and adaptable bimodal framework for speech emotion recognition based on pre-trained language models. Lastly, we discuss the idea of using an emotional classifier as a reward for reinforcement learning as a step towards more successful and convenient human-machine interaction.
研究动机与目标
- 通过将预训练语言模型与语音特征相结合,提升语音情感识别性能。
- 开发一种模块化、可适应的双模态情感识别框架,支持文本与语音组件的独立训练。
- 探索将情感分类作为强化学习中的奖励信号,以实现更自然的人机交互。
- 评估预训练语言模型在文本情感识别上的表现及其与基于语音的情感识别的融合效果。
- 评估在多模态情感识别中使用自动语音识别(ASR)转录文本与真实转录文本的影响。
提出的方法
- 在 SemEval 2017 Task 4A 数据集上微调 BERT 和 XLNet 以进行文本情感识别,准确率达到 69.5%。
- 设计 IEmoNET 为模块化框架,包含独立可训练的 ASR、SER 和 TER 子模块。
- 通过共享分类头将微调后的预训练语言模型与语音情感识别模型相结合。
- 在 IEMOCAP 数据集上使用 10 折交叉验证进行评估,使用提供的转录文本和受噪声影响的转录文本。
- 仅训练分类头和语言模型的少数几层,以避免过拟合并保持效率。
- 使用四类情感的加权准确率(WA)和未加权准确率(UA)评估性能。
实验结果
研究问题
- RQ1像 BERT 和 XLNet 这样的预训练语言模型能否在文本情感识别上有效微调,并在标准基准上提升性能?
- RQ2在双模态设置下,将预训练语言模型与语音情感识别模型结合,对整体分类准确率有何影响?
- RQ3在多模态情感识别系统中,使用真实转录文本与自动生成(带噪声)转录文本之间的性能差异是什么?
- RQ4像 IEmoNET 这样的模块化框架是否能实现无需重新训练整个模型的高效、灵活且高性能的双模态情感识别?
- RQ5是否可行将自动情感识别作为强化学习中的奖励信号,以改善对话系统?
主要发现
- 在 SemEval 2017 Task 4A 上微调 BERT 和 XLNet 达到 69.5% 的准确率,比之前的最先进方法高出超过 3 个百分点。
- 使用提供的转录文本和语音数据,IEmoNET 在 IEMOCAP 数据集上实现了 73.5% 的加权准确率,采用基于 BERT 的文本建模。
- 在使用自动转录输入(通过添加噪声模拟)时,模型达到 71.4% 的加权准确率,表明对转录错误具有鲁棒性。
- 性能最佳的 SER 模型是双向 LSTM 与自注意力机制的混合模型,采用 128 维注意力,其在 IEMOCAP 上的未加权准确率为 63.8%。
- 仅微调分类头和语言模型的少数几层,其结果优于端到端微调,可能是因为大型预训练模型的主导作用。
- IEmoNET 的模块化设计允许在不重新训练整个系统的情况下,对文本和语音组件进行即插即用的替换。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。