Skip to main content
QUICK REVIEW

[论文解读] Visual Entailment Task for Visually-Grounded Language Learning

Ning Xie, Farley Lai|arXiv (Cornell University)|Nov 26, 2018
Multimodal Machine Learning Applications参考文献 22被引用 13
一句话总结

本文提出了视觉蕴涵(VE)这一新型多模态任务,旨在判断文本假设是否由图像前提所蕴含,将文本蕴涵任务扩展至视觉-语言理解领域。作者构建了SNLI-VE数据集,并提出一种新型可微分模型EVE,该模型利用自注意力与交叉注意力机制,提升对图像-文本对的推理能力,在测试集上达到71.4%的准确率,超越了现有的基于VQA的基线模型。

ABSTRACT

We introduce a new inference task - Visual Entailment (VE) - which differs from traditional Textual Entailment (TE) tasks whereby a premise is defined by an image, rather than a natural language sentence as in TE tasks. A novel dataset SNLI-VE (publicly available at https://github.com/necla-ml/SNLI-VE) is proposed for VE tasks based on the Stanford Natural Language Inference corpus and Flickr30k. We introduce a differentiable architecture called the Explainable Visual Entailment model (EVE) to tackle the VE problem. EVE and several other state-of-the-art visual question answering (VQA) based models are evaluated on the SNLI-VE dataset, facilitating grounded language understanding and providing insights on how modern VQA based models perform.

研究动机与目标

  • 为解决视觉蕴涵任务中缺乏高质量标注、真实世界数据集的问题,即在自然语言蕴涵中使用图像前提而非文本前提。
  • 提出一种新的多模态推理任务——视觉蕴涵(VE),要求模型能够推理假设与图像之间的蕴涵、中性或矛盾关系。
  • 评估最先进VQA模型在VE任务上的泛化能力,并识别其局限性,如语言偏见以及对中性样本推理不足的问题。
  • 提出并验证一种新型可微分架构——可解释视觉蕴涵(EVE)模型,通过建模模态内与模态间关系,提升VE任务的性能。

提出的方法

  • SNLI-VE数据集通过将SNLI语料库中的文本前提替换为Flickr30k中对应的图像,同时保留原始的假设-文本对构建而成。
  • EVE模型采用双分支架构:文本分支通过词嵌入的自注意力机制与门控循环单元(GRU)编码假设;图像分支则使用卷积神经网络(CNN)特征图(EVE-Image)或Mask R-CNN检测到的区域提议(EVE-ROI)。
  • EVE利用文本-图像注意力机制,将相关图像区域与假设中的词元对齐,实现基于视觉的推理。
  • 在文本与图像特征空间中分别应用自注意力机制,以捕捉超越简单注意力机制的内部关系与依赖性。
  • 通过点积操作融合注意力对齐后的图像与文本特征,并利用最终分类器将关系分类为蕴涵、中性或矛盾。
  • 评估了两种变体:EVE-Image(使用特征图)与EVE-ROI(使用检测到的物体区域),并通过消融实验评估性能。

实验结果

研究问题

  • RQ1在更精细的视觉蕴涵任务中,特别是区分中性类别时,基于VQA训练的视觉-语言模型能否有效泛化?
  • RQ2依赖图像字幕作为前提的模型与直接基于图像进行推理的模型在VE任务中的性能表现有何差异?
  • RQ3与VQA中使用的标准注意力机制相比,自注意力与交叉注意力机制在视觉蕴涵任务中能多大程度上提升性能?
  • RQ4使用目标级区域(ROIs)与密集CNN特征相比,哪种方式在视觉蕴涵任务中能实现更好的泛化能力?
  • RQ5SNLI数据集中固有的语言偏见如何影响VE任务上的性能表现?模型是否仍能超越这一基线?

主要发现

  • 所提出的SNLI-VE数据集已公开,为使用真实世界图像与自然语言假设的视觉蕴涵任务提供了真实可靠的基准。
  • 仅使用假设的基线模型达到67%的准确率,确立了较强的下界,表明模型必须显著超越此水平才具有实际意义。
  • 图像字幕基线模型在测试集上仅达到67.47%的准确率,表明生成的字幕在有效蕴涵分类方面可能不足或不准确。
  • 注意力自顶向下VQA模型在测试集上达到70.59%的准确率,证明注意力机制在视觉推理中的有效性。
  • EVE-Image在测试集上取得最高性能,准确率达71.4%,优于所有其他基线模型,包括注意力自顶向下与注意力自底向上模型。
  • EVE相较于现有模型的微小性能提升,归因于自注意力机制,其能够捕捉图像与文本表征中复杂的内部关系。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。