Skip to main content
QUICK REVIEW

[论文解读] MEmoBERT: Pre-training Model with Prompt-based Learning for Multimodal Emotion Recognition

Jinming Zhao, Ruichen Li|arXiv (Cornell University)|Oct 27, 2021
Emotion and Mood Recognition被引用 6
一句话总结

该论文提出 MEmoBERT,一种多模态预训练模型,通过在大规模未标注视频上进行自监督学习,学习用于情感识别的联合文本、视觉和音频表征。该方法引入了一种基于提示的微调方法,将情感分类任务重新表述为掩码预测任务,显著提升了传统微调方法的性能,尤其在低资源条件下表现更优,在 IEMOCAP 和 MSP-IMPROV 数据集上取得了最先进结果。

ABSTRACT

Multimodal emotion recognition study is hindered by the lack of labelled corpora in terms of scale and diversity, due to the high annotation cost and label ambiguity. In this paper, we propose a pre-training model extbf{MEmoBERT} for multimodal emotion recognition, which learns multimodal joint representations through self-supervised learning from large-scale unlabeled video data that come in sheer volume. Furthermore, unlike the conventional "pre-train, finetune" paradigm, we propose a prompt-based method that reformulates the downstream emotion classification task as a masked text prediction one, bringing the downstream task closer to the pre-training. Extensive experiments on two benchmark datasets, IEMOCAP and MSP-IMPROV, show that our proposed MEmoBERT significantly enhances emotion recognition performance.

研究动机与目标

  • 为应对由于标注成本高和标签模糊性导致的大规模、多样化且高质量的多模态情感数据集稀缺问题。
  • 开发一种多模态预训练框架,从大规模未标注视频数据中学习跨文本、视觉和音频模态的联合表征。
  • 通过基于提示的学习方法适应预训练表征,改进下游多模态情感识别性能,从而更好地对齐预训练与微调目标。
  • 展示基于提示的学习在低资源设置下对多模态情感识别的有效性。

提出的方法

  • MEmoBERT 使用三种模态专用编码器(文本使用 BERT,视觉使用预训练面部模型,音频使用预训练语音模型)从各模态提取原始特征。
  • 各模态的特征通过模态专用嵌入器进行嵌入,该嵌入器结合了标记/帧特征、位置嵌入和模态类型嵌入,随后进行层归一化。
  • 该模型使用多层跨模态 Transformer 来跨模态进行注意力计算,学习联合表征。
  • 采用四种自监督预训练任务:完整词掩码语言建模(WWMLM)、片段掩码视觉帧建模(SpanMVFM)、基于 KL 散度的片段掩码视觉帧分类(SpanMVFC-KL),以及片段掩码音频帧建模(SpanMAFM)。
  • 基于提示的学习方法将情感分类任务重新表述为掩码文本预测任务,使模型在微调过程中能更有效地利用预训练知识。
  • 在微调阶段,不引入额外参数;而是将可学习提示插入输入文本之前,以引导分类任务。

实验结果

研究问题

  • RQ1在大规模未标注视频数据上进行自监督预训练是否能显著提升多模态情感识别性能?
  • RQ2在将预训练多模态模型适配至情感识别任务时,基于提示的学习是否优于传统微调方法?
  • RQ3在标注数据有限的低资源条件下,所提出的 MEmoBERT 模型泛化能力如何?
  • RQ4各项独立预训练任务对 MEmoBERT 整体性能的贡献是什么?
  • RQ5通过交叉注意力机制进行联合多模态表征学习是否能超越单一模态表征,提升情感识别性能?

主要发现

  • 在 IEMOCAP 数据集上,MEmoBERT 实现了 80.01% 的加权准确率(WA)和 81.09% 的未加权平均召回率(UAR),优于先前最先进模型。
  • 在 MSP-IMPROV 数据集上,MEmoBERT 实现了 72.36% 的 WA 和 72.22% 的 UAR,显示出对先前方法的一致性改进。
  • 与 'BERT+Direct' 基线相比,基于提示的方法('Pretrain+Prompt')在 IEMOCAP 上 UAR 提升了 +2.1%,在 MSP-IMPROV 上提升了 +2.5%。
  • 消融研究证实,四项预训练任务均产生积极贡献,任一任务的移除均导致性能下降。
  • 在低资源条件下,基于提示的方法始终优于标准微调方法,且随着训练数据减少,性能增益更为显著。
  • 通过在大规模未标注视频上进行预训练,模型性能得到显著提升,'Pretrain+Finetune' 和 'Pretrain+Prompt' 在所有设置下均优于 'BERT+Direct'。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。