[论文解读] Multi-level Fusion of Wav2vec 2.0 and BERT for Multimodal Emotion Recognition
本文提出了一种多层级融合框架,结合 wav2vec 2.0 与 BERT 嵌入表示,用于多模态情感识别,结合了基于协同注意力的早期融合与晚期融合,并提出了一种新颖的多粒度语音嵌入提取方法(帧级、音素级、音节级、词级)。该方法在 IEMOCAP 数据集上实现了 76.31% 的未加权准确率,比当前最先进方法高出 1.3%。
The research and applications of multimodal emotion recognition have become increasingly popular recently. However, multimodal emotion recognition faces the challenge of lack of data. To solve this problem, we propose to use transfer learning which leverages state-of-the-art pre-trained models including wav2vec 2.0 and BERT for this task. Multi-level fusion approaches including coattention-based early fusion and late fusion with the models trained on both embeddings are explored. Also, a multi-granularity framework which extracts not only frame-level speech embeddings but also segment-level embeddings including phone, syllable and word-level speech embeddings is proposed to further boost the performance. By combining our coattention-based early fusion model and late fusion model with the multi-granularity feature extraction framework, we obtain result that outperforms best baseline approaches by 1.3% unweighted accuracy (UA) on the IEMOCAP dataset.
研究动机与目标
- 通过利用预训练模型的迁移学习,解决多模态情感识别中的数据稀疏问题。
- 探索文本(BERT)与语音(wav2vec 2.0)模态之间有效的融合策略——早期融合与晚期融合。
- 通过引入在帧、音素、音节和词级别提取语音嵌入的多粒度框架,提升性能。
- 证明结合多个融合层级(早期与晚期)的策略优于单一融合方法。
- 在 IEMOCAP 基准上,使用统一的 5 折交叉验证设置,超越现有最先进方法。
提出的方法
- 分别将预训练的 BERT 和 wav2vec 2.0 作为文本与语音模态的固定特征提取器。
- 实现一种多粒度语音嵌入框架,利用 wav2vec 2.0 在帧、音素、音节和词级别提取嵌入表示。
- 采用基于协同注意力的早期融合方法,通过注意力机制动态对齐并融合文本与语音嵌入。
- 通过拼接来自独立 BERT 与 wav2vec 2.0 模型的预测 logits 实现晚期融合,用于最终分类。
- 将表现最佳的早期融合(F+P 嵌入)与晚期融合(F+S 嵌入)配置相结合,实现多层级融合。
- 在 IEMOCAP 数据集上采用 5 折交叉验证,以确保公平评估并与先前工作进行比较。
实验结果
研究问题
- RQ1基于协同注意力的 BERT 与 wav2vec 2.0 嵌入早期融合是否能优于简单的拼接方法,从而提升多模态情感识别性能?
- RQ2在帧级嵌入之外引入分段级语音嵌入(音素、音节、词)是否能进一步提升性能?
- RQ3模态特定模型的晚期融合是否能优于早期融合?
- RQ4结合早期与晚期融合策略是否能带来相较于单一融合层级的进一步性能增益?
- RQ5所提出的多粒度融合框架在 IEMOCAP 基准上与最先进方法相比表现如何?
主要发现
- 基于协同注意力的早期融合模型在使用帧级与音素级语音嵌入时,实现了 74.57% 的未加权准确率(UA),相比拼接式早期融合高出约 3%。
- 晚期融合模型始终优于早期融合模型,其中最佳晚期融合模型在使用帧级与音节级嵌入时达到 75.80% 的 UA。
- 将最佳早期融合配置(F+P)与最佳晚期融合配置(F+S)结合的多层级融合模型,实现了 76.31% 的 UA,比最佳基线高出 1.3%。
- 分段级嵌入带来的性能增益并非源于集成效应,而是源于捕捉到与情感相关的语调信息。
- 即使仅使用帧级语音与文本嵌入,所提出方法的性能也已超越大多数先前的最先进方法。
- 多粒度框架在早期与晚期融合设置中均显著提升了性能,证实了多尺度语音表征的价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。