Skip to main content
QUICK REVIEW

[论文解读] What BERT Sees: Cross-Modal Transfer for Visual Question Generation

Thomas Scialom, Patrick Bordes|arXiv (Cornell University)|Feb 25, 2020
Multimodal Machine Learning Applications被引用 5
一句话总结

本文提出 BERT-gen,一种新颖的文本生成框架,通过利用预训练 BERT 实现视觉问题生成,且无需额外预训练。通过应用简单的线性投影将视觉物体特征与 BERT 的输入嵌入对齐,该模型在 VQG 基准测试中达到最先进性能,表明 BERT 的表征即使在极少微调且无显式多模态预训练的情况下,也能天然地跨模态泛化。

ABSTRACT

Pre-trained language models have recently contributed to significant advances in NLP tasks. Recently, multi-modal versions of BERT have been developed, using heavy pre-training relying on vast corpora of aligned textual and image data, primarily applied to classification tasks such as VQA. In this paper, we are interested in evaluating the visual capabilities of BERT out-of-the-box, by avoiding pre-training made on supplementary data. We choose to study Visual Question Generation, a task of great interest for grounded dialog, that enables to study the impact of each modality (as input can be visual and/or textual). Moreover, the generation aspect of the task requires an adaptation since BERT is primarily designed as an encoder. We introduce BERT-gen, a BERT-based architecture for text generation, able to leverage on either mono- or multi- modal representations. The results reported under different configurations indicate an innate capacity for BERT-gen to adapt to multi-modal data and text generation, even with few data available, avoiding expensive pre-training. The proposed model obtains substantial improvements over the state-of-the-art on two established VQG datasets.

研究动机与目标

  • 探究预训练 BERT 模型是否在未进行显式多模态预训练的情况下,天然编码跨模态视觉抽象。
  • 开发一种基于 BERT 的文本生成框架,支持单模态与多模态输入。
  • 评估一种最小化适应方法——具体而言,是线性投影层——将 BERT 与视觉数据对齐的有效性。
  • 证明 BERT 仅通过在 VQG 数据上微调,即可生成与图像上下文相关的、基于视觉的问题。
  • 分析 BERT-gen 中的注意力机制与跨模态对齐情况,以解释模型在不同模态下的行为。

提出的方法

  • BERT-gen 通过修改其输入表征方式,将 BERT 作为自回归解码器使用,使其输入序列中包含视觉物体特征作为序列标记。
  • 视觉特征通过 Faster R-CNN 提取,并使用可学习的线性层投影到 BERT 的嵌入空间,不引入额外非线性变换。
  • 该模型将图像视为物体区域序列(含边界框),并将其标记化方式与单词类似处理,从而实现在文本与视觉物体上的联合注意力。
  • 通过在最终 BERT 层中对所有头的注意力权重取平均,分析跨注意力机制,以可视化模型在生成问题时关注的词语与图像区域。
  • 通过计算图像与对应标题在 BERT 各层中 [CLS] 嵌入表示之间的余弦相似度,衡量跨模态相似性,以度量对齐程度。
  • 通过广泛的消融实验,比较三种设置下的性能表现:仅标题、仅图像、图像+标题输入,同时控制视觉投影矩阵的使用。

实验结果

研究问题

  • RQ1预训练 BERT 是否能在未进行多模态预训练或视觉数据微调的情况下,生成与视觉内容相关的问答?
  • RQ2一个简单的线性投影层是否足以将视觉物体特征与 BERT 的文本表征对齐,以实现有效的跨模态推理?
  • RQ3在问题生成过程中,BERT-gen 中的注意力机制如何在文本词语与视觉物体区域之间分配?
  • RQ4在 VQG 上微调过程中,图像与标题的 [CLS] 标记表征在语义上对齐的程度如何?
  • RQ5在训练中加入文本标题是否相比仅使用图像输入,能提升跨模态对齐与生成质量?

主要发现

  • BERT-gen 在两个公认的 VQG 基准测试中达到最先进性能,优于现有方法,且无需额外预训练。
  • 该模型展现出强大的零样本跨模态泛化能力:即使在预训练阶段未显式进行图像-文本对齐,仍能学习生成与视觉内容相关的问题。
  • 跨模态相似度(X_sim)在最终 BERT 层显著提升,其顺序为:图像+标题 > 仅图像 > 仅标题,表明通过微调实现了有效对齐。
  • 注意力可视化显示,即使某些物体(如时钟、雨伞)未在标题中提及,模型仍能正确关注到相关视觉对象,证实了视觉定位的有效性。
  • 仅图像设置能正确纠正视觉误判(例如,识别出撑伞的女性而非男性),表明具备稳健的视觉推理能力。
  • 随机 Transformer 基线模型的 X_sim 接近零,确认 BERT-gen 中观察到的对齐现象源于学习到的表征,而非随机相关性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。