Skip to main content
QUICK REVIEW

[论文解读] MAF: Multimodal Alignment Framework for Weakly-Supervised Phrase Grounding

Qinxin Wang, Hao Tan|arXiv (Cornell University)|Oct 12, 2020
Multimodal Machine Learning Applications参考文献 23被引用 5
一句话总结

MAF 提出了一种用于弱监督短语定位的多模态对齐框架,通过引入超越物体标签的细粒度视觉特征来增强视觉表征,并利用视觉感知的语言表征以改善对齐效果。在弱监督设置下,其在 Flickr30k Entities 数据集上达到 61.43% 的准确率,相比之前的方法提升 22.72%,并在无监督设置下将性能提升 5.56% 至 56.05%。

ABSTRACT

Phrase localization is a task that studies the mapping from textual phrases to regions of an image. Given difficulties in annotating phrase-to-object datasets at scale, we develop a Multimodal Alignment Framework (MAF) to leverage more widely-available caption-image datasets, which can then be used as a form of weak supervision. We first present algorithms to model phrase-object relevance by leveraging fine-grained visual representations and visually-aware language representations. By adopting a contrastive objective, our method uses information in caption-image pairs to boost the performance in weakly-supervised scenarios. Experiments conducted on the widely-adopted Flickr30k dataset show a significant improvement over existing weakly-supervised methods. With the help of the visually-aware language representations, we can also improve the previous best unsupervised result by 5.56%. We conduct ablation studies to show that both our novel model and our weakly-supervised strategies significantly contribute to our strong results.

研究动机与目标

  • 通过利用广泛可用的图像字幕配对作为弱监督,缓解大规模短语-物体标注数据集的稀缺问题。
  • 通过将来自 Faster R-CNN 的细粒度视觉特征与物体标签相结合,克服基于物体标签定位的歧义性。
  • 通过增强多模态对齐,提升在弱监督和无监督设置下的短语定位性能。
  • 设计一种对比学习目标,利用图像-字幕相关性对齐视觉与文本表征。
  • 展示视觉感知语言表征以及各组件消融实验在提升定位准确率方面的有效性。

提出的方法

  • 通过结合预训练 Faster R-CNN 检测器输出的物体标签、视觉特征和属性,增强视觉表征。
  • 利用短语嵌入与增强视觉特征之间的交叉注意力机制,构建视觉感知的语言表征。
  • 设计一种多模态相似度函数,基于联合视觉-文本表征计算短语-物体匹配得分。
  • 使用对比学习目标进行模型训练,促使相关图像-字幕对的得分高于无关对。
  • 采用两阶段训练策略:首先预训练视觉和文本编码器,然后使用对比损失微调对齐头。
  • 应用特定的权重初始化策略(视觉投影层初始化为零,文本投影层初始化为恒等矩阵+噪声),以稳定训练并提升性能。

实验结果

研究问题

  • RQ1当仅有图像字幕配对可用时,细粒度视觉表征是否能提升短语定位性能?
  • RQ2在弱监督短语定位中,引入视觉感知语言表征对对齐准确率有何影响?
  • RQ3不同视觉特征(标签、特征、属性)对最终定位性能的贡献如何?
  • RQ4对齐头的不同初始化策略如何影响模型收敛性和准确率?
  • RQ5所提出的框架在无任何标注短语-物体对的情况下,能在多大程度上提升无监督短语定位性能?

主要发现

  • 在弱监督训练下,MAF 在 Flickr30k Entities 上达到 61.43% 的准确率,相比之前最先进方法提升 22.72%。
  • 在无监督设置下,MAF 通过使用视觉感知语言表征,将之前最佳结果从 50.49% 提升至 56.05%。
  • 将视觉注意力替换为平均池化操作后,准确率从 61.43% 降至 60% 以下,表明注意力机制的重要性。
  • 仅使用物体标签或视觉特征时,准确率分别下降 4.20% 和 2.94%,表明联合表征的必要性。
  • 最佳初始化策略为:视觉投影矩阵初始化为零,文本投影矩阵初始化为恒等矩阵+随机噪声,该策略实现 61.28% 的准确率且方差较低。
  • 完整模型(包含所有视觉特征:标签、特征、属性)的性能反而低于仅使用标签和特征的模型,表明该数据集中属性提供的判别能力有限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。