Skip to main content
QUICK REVIEW

[论文解读] MMFT-BERT: Multimodal Fusion Transformer with BERT Encodings for Visual Question Answering

Aisha Urooj Khan, Amir Mazaheri|arXiv (Cornell University)|Oct 27, 2020
Multimodal Machine Learning Applications参考文献 50被引用 10
一句话总结

该论文提出MMFT-BERT,一种多模态融合Transformer模型,采用独立的BERT编码器分别处理问题、视频帧和字幕,随后通过一种新颖的基于Transformer的融合机制,联合关注模态特异性表征。该方法在TVQA数据集上达到最先进性能,相较于先前方法在Q+V设置下提升2.41%,在Q+V+S设置下提升1.1%,同时引入TVQA-Visual诊断子集以评估视觉模态的依赖性。

ABSTRACT

We present MMFT-BERT(MultiModal Fusion Transformer with BERT encodings), to solve Visual Question Answering (VQA) ensuring individual and combined processing of multiple input modalities. Our approach benefits from processing multimodal data (video and text) adopting the BERT encodings individually and using a novel transformer-based fusion method to fuse them together. Our method decomposes the different sources of modalities, into different BERT instances with similar architectures, but variable weights. This achieves SOTA results on the TVQA dataset. Additionally, we provide TVQA-Visual, an isolated diagnostic subset of TVQA, which strictly requires the knowledge of visual (V) modality based on a human annotator's judgment. This set of questions helps us to study the model's behavior and the challenges TVQA poses to prevent the achievement of super human performance. Extensive experiments show the effectiveness and superiority of our method.

研究动机与目标

  • 通过分别处理和联合建模文本、视频和字幕等多种模态,提升视觉问答性能。
  • 解决在真实视频问答中多模态理解的挑战,实现视觉与语言线索的有效整合。
  • 开发一种更具可解释性的融合机制,基于问题上下文动态学习模态间的重要性权重。
  • 提出TVQA-Visual诊断子集,用于隔离视觉模态依赖性,以评估模型的鲁棒性与偏差。
  • 证明多流BERT编码结合结构化融合优于简单的拼接或单流方法。

提出的方法

  • 该方法采用三个独立的BERT编码器:Q-BERT用于问题-答案对,V-BERT用于视觉概念,S-BERT用于字幕,各自独立处理其对应模态。
  • 每个BERT编码器在配对输入(如问题+候选答案)上进行微调,以通过多头自注意力实现模态特异性注意力。
  • 一种新颖的多模态融合Transformer(MMFT)模块接收来自各模态的拼接特征以及一个可学习的[FUSE]标记,对所有输入源执行跨注意力机制。
  • MMFT模块使用多头注意力,根据问题动态分配各模态的重要性权重,实现上下文感知的融合。
  • MMFT的最终输出送入线性分类器,预测候选答案的概率。
  • 模型通过多个损失项端到端训练,包括各模态流的独立损失与联合损失,以提升优化效果与性能。

实验结果

研究问题

  • RQ1与共享编码器相比,为每种模态使用独立BERT编码器是否能提升视觉问答性能?
  • RQ2专用的基于Transformer的融合机制相比简单拼接或早期融合,如何增强多模态推理能力?
  • RQ3该模型在多大程度上依赖视觉信息?能否通过诊断子集隔离这种依赖性?
  • RQ4与单一联合损失相比,在训练中使用多个损失项是否能提升模型收敛性与性能?
  • RQ5融合模块中注意力头数量和编码器层数等架构选择如何影响最终性能?

主要发现

  • MMFT-BERT在TVQA验证集上达到新的最先进结果,在仅使用问题与视频输入(Q+V)时,相比先前方法提升2.41%。
  • 在使用全部三种模态(Q+V+S)时,模型相比之前最先进方法提升1.1%的绝对准确率,达到73.10%的准确率。
  • 在训练中使用多个损失项(独立损失与联合损失)相比仅使用单一联合损失(71.82%),性能更优(73.10%)。
  • MMFT融合模块中的多头注意力机制(H=12)优于单头注意力(73.55% vs. 72.66%),表明局部注意力模式对特征整合至关重要。
  • MMFT中单层融合模块(L=1)表现最佳(73.55%),而堆叠层(L=2或使用跳跃连接)导致性能下降,表明深层融合存在过拟合或冗余问题。
  • 使用ResNet-101特征而非目标检测标签作为视觉输入会降低性能(71.82%),表明该任务中目标级概念比原始视觉特征更具价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。