Skip to main content
QUICK REVIEW

[论文解读] M-BERT: Injecting Multimodal Information in the BERT Structure

Wasifur Rahman, K. M. Azharul Hasan|arXiv (Cornell University)|Aug 15, 2019
Multimodal Machine Learning Applications参考文献 11被引用 31
一句话总结

该论文提出 M-BERT,一种将多模态信息(文本、视觉和音频)直接注入 BERT 输入空间的多模态情感分析方法。通过在 BERT 编码器之前融合模态特定特征,该方法在 CMU-MOSI 数据集上实现了 84.38% 的二元准确率,创下新 SOTA 记录,相较于原始 BERT 和先前的多模态模型分别提升了 1.02% 和 5.98%。

ABSTRACT

Multimodal language analysis is an emerging research area in natural language processing that models language in a multimodal manner. It aims to understand language from the modalities of text, visual, and acoustic by modeling both intra-modal and cross-modal interactions. BERT (Bidirectional Encoder Representations from Transformers) provides strong contextual language representations after training on large-scale unlabeled corpora. Fine-tuning the vanilla BERT model has shown promising results in building state-of-the-art models for diverse NLP tasks like question answering and language inference. However, fine-tuning BERT in the presence of information from other modalities remains an open research problem. In this paper, we inject multimodal information within the input space of BERT network for modeling multimodal language. The proposed injection method allows BERT to reach a new state of the art of $84.38\%$ binary accuracy on CMU-MOSI dataset (multimodal sentiment analysis) with a gap of 5.98 percent to the previous state of the art and 1.02 percent to the text-only BERT.

研究动机与目标

  • 为解决微调 BERT 以实现多模态语言理解的挑战,其中视觉和音频等额外模态未能被有效整合。
  • 通过增强 BERT 对跨模态交互的建模能力,提升多模态情感分析任务的性能。
  • 通过直接将多模态信号注入 BERT 的输入表示,实现在 CMU-MOSI 基准测试上的最先进结果。
  • 证明在多模态 BERT 模型中,将多模态特征注入输入空间是一种简单但有效的替代架构修改的方法。

提出的方法

  • 所提出的方法在 BERT 编码器之前,将模态特定特征(文本、视觉、语音)注入 BERT 的输入嵌入层。
  • 多模态特征与原始 BERT 输入嵌入拼接,保留模型预训练的注意力机制。
  • 模型采用早期融合策略,即在 BERT 编码器处理前,于输入层面将不同模态的特征组合。
  • 通过将 BERT 池化后的 token 嵌入与来自视觉和音频的模态特定特征拼接,构建输入表示。
  • 使用标准 BERT 优化方法和损失函数,在 CMU-MOSI 数据集上端到端微调模型。
  • 该方法保持原始 BERT 架构不变,无需修改注意力机制或 Transformer 层。

实验结果

研究问题

  • RQ1是否可以在不修改架构的前提下,有效将多模态信息注入 BERT 的输入空间?
  • RQ2在输入层面融合文本、视觉和音频是否能提升多模态情感分类的性能?
  • RQ3与基准数据集上的原始 BERT 和先前的多模态 BERT 模型相比,该方法在多大程度上实现性能超越?
  • RQ4与后期融合或模态特定微调相比,多模态特征的早期融合是否能带来更好的跨模态交互学习?
  • RQ5简单的输入注入策略是否足以在多模态情感分析中实现最先进结果?

主要发现

  • M-BERT 在 CMU-MOSI 数据集上实现了 84.38% 的二元准确率,创下多模态情感分析新 SOTA 记录。
  • 与原始 BERT 基线相比,准确率提升 1.02 个百分点,证明了多模态注入的有效性。
  • 相比先前 SOTA 结果,准确率提升 5.98 个百分点,表明性能有显著提升。
  • 结果表明,仅通过输入空间注入多模态特征,即可实现优异性能,而无需修改 BERT 架构。
  • 该方法在保持 BERT 的高效性和可扩展性的同时,实现了稳健的多模态理解能力。
  • 该方法的成功表明,输入空间的早期融合是多模态 NLP 任务中一种可行且有效的策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。