Skip to main content
QUICK REVIEW

[论文解读] Reasoning over Vision and Language: Exploring the Benefits of Supplemental Knowledge

Violetta Shevchenko, Damien Teney|arXiv (Cornell University)|Jan 15, 2021
Multimodal Machine Learning Applications被引用 13
一句话总结

本文提出了一种知识注入技术,通过在训练过程中将视觉-语言Transformer模型的表征与外部知识库(KB)嵌入对齐,从而增强其性能。通过使用辅助对比损失函数与ConceptNet和Wikidata对齐,该方法在知识密集型VQA任务上显著提升性能(例如,在OK-VQA上提升1.78%),并出人意料地提升了视觉推理基准的表现(例如,在NLVR2上提升1.28%),表明KB正则化有助于提升语义和关系表征学习能力。

ABSTRACT

The limits of applicability of vision-and-language models are defined by the coverage of their training data. Tasks like vision question answering (VQA) often require commonsense and factual information beyond what can be learned from task-specific datasets. This paper investigates the injection of knowledge from general-purpose knowledge bases (KBs) into vision-and-language transformers. We use an auxiliary training objective that encourages the learned representations to align with graph embeddings of matching entities in a KB. We empirically study the relevance of various KBs to multiple tasks and benchmarks. The technique brings clear benefits to knowledge-demanding question answering tasks (OK-VQA, FVQA) by capturing semantic and relational knowledge absent from existing models. More surprisingly, the technique also benefits visual reasoning tasks (NLVR2, SNLI-VE). We perform probing experiments and show that the injection of additional knowledge regularizes the space of embeddings, which improves the representation of lexical and semantic similarities. The technique is model-agnostic and can expand the applicability of any vision-and-language transformer with minimal computational overhead.

研究动机与目标

  • 解决仅在配对图像-文本数据集上训练的视觉-语言模型中事实性和常识性知识有限的问题。
  • 探究从通用知识库(KBs)注入外部知识是否能提升多模态Transformer的推理能力。
  • 评估不同知识库(如ConceptNet、Wikidata)对多样化视觉-语言基准的影响。
  • 分析知识注入是否不仅提升知识需求型任务,也提升不明确依赖外部事实的视觉推理任务。
  • 证明知识注入方法具有模型无关性且计算开销低,具备广泛适用性。

提出的方法

  • 该方法通过辅助对比训练目标,将外部知识库(ConceptNet、Wikidata)中的知识注入视觉-语言Transformer模型中。
  • 使用预训练的图嵌入模型(如TransE、DistMult)将知识库实体嵌入向量空间。
  • 在训练过程中,通过对比损失函数对模型的注意力和表征层进行正则化,使其与相应的KB嵌入对齐。
  • 该技术应用于LXMERT架构,并在VQA、NLVR2、SNLI-VE和OK-VQA数据集上进行微调。
  • 该方法具有模型无关性,可应用于任何视觉-语言Transformer,且计算开销极低。
  • 通过探针实验分析知识注入对词汇、语义和关系表征学习的影响。

实验结果

研究问题

  • RQ1从外部KB注入知识是否能提升视觉-语言推理任务的性能?
  • RQ2知识注入是否不仅对知识需求型任务有益,也对不明确依赖外部事实的视觉推理任务有益?
  • RQ3在增强多模态表征方面,不同知识库(如ConceptNet与Wikidata)的有效性如何比较?
  • RQ4知识注入在多大程度上正则化了嵌入空间并提升了语义和关系相似性学习能力?
  • RQ5该方法是否可在多种视觉-语言基准上有效应用,且仅需极少的架构修改?

主要发现

  • 与基线LXMERT-GitHub模型相比,该知识注入方法在OK-VQA上的性能提升了1.78个百分点(从37.26%提升至39.04%)。
  • 在NLVR2上实现了1.28个百分点的提升(从71.31%提升至72.59%),表明其在视觉推理任务中同样有效。
  • 消融实验表明,若从KB中移除与营养相关的实体,针对营养相关问题的准确率将从91.11%降至68.89%,证明性能提升源于知识注入。
  • 探针实验显示,知识注入提升了模型捕捉词汇和语义相似性能力,表明其优化了表征学习。
  • 该方法在多个基准上均有效,且具有模型无关性,可轻松集成到任意视觉-语言Transformer中,训练成本极低。
  • 尽管具有优势,Wikidata的性能受限于噪声和模糊性,表明利用大型、结构较松散的知识库仍存在挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。