Skip to main content
QUICK REVIEW

[论文解读] Task-driven Visual Saliency and Attention-based Visual Question Answering

Yuetan Lin, Zhangyang Pang|arXiv (Cornell University)|Feb 22, 2017
Multimodal Machine Learning Applications参考文献 32被引用 22
一句话总结

本文提出了一种任务驱动的视觉显著性机制和一种基于逐元素相乘的新型注意力方法,用于视觉问答(VQA)。通过利用双向LSTM基于图像区域间的相互关系计算区域显著性权重,并使用逐元素相乘实现视觉与文本特征的融合,该模型在COCO-VQA上取得了当前最优的性能,多项选择任务准确率达到63.69%,开放式任务准确率达到56.02%,优于多个基于注意力的基线模型。

ABSTRACT

Visual question answering (VQA) has witnessed great progress since May, 2015 as a classic problem unifying visual and textual data into a system. Many enlightening VQA works explore deep into the image and question encodings and fusing methods, of which attention is the most effective and infusive mechanism. Current attention based methods focus on adequate fusion of visual and textual features, but lack the attention to where people focus to ask questions about the image. Traditional attention based methods attach a single value to the feature at each spatial location, which losses many useful information. To remedy these problems, we propose a general method to perform saliency-like pre-selection on overlapped region features by the interrelation of bidirectional LSTM (BiLSTM), and use a novel element-wise multiplication based attention method to capture more competent correlation information between visual and textual features. We conduct experiments on the large-scale COCO-VQA dataset and analyze the effectiveness of our model demonstrated by strong empirical results.

研究动机与目标

  • 为了解决现有VQA模型在图像提问时缺乏对人类关注区域的注意力问题。
  • 通过基于任务特定兴趣模式的显著图像区域预选择,提升VQA性能。
  • 通过一种新颖的逐元素相乘注意力机制,增强视觉与语言模态之间的特征融合。
  • 证明区域预选择与精细化注意力机制可显著提升VQA准确率,且无需复杂架构。

提出的方法

  • 提出一种任务驱动的视觉显著性机制,利用双向LSTM(BiLSTM)建模区域特征之间的相互关系,计算区域重要性。
  • 应用BiLSTM编码图像区域间的空间关系,生成突出可能成为问题关注焦点的区域的显著性权重。
  • 引入一种基于逐元素相乘的注意力机制,相比拼接或标准注意力,能更有效地融合视觉与文本特征。
  • 对视觉与文本特征的逐元素乘积结果进行最大池化,生成紧凑且富含信息的融合向量,用于答案预测。
  • 采用一种简单但有效的VQA基线模型,结合所提出的预选择与注意力机制,无需复杂多步注意力层。
  • 为提升计算效率,使用3×3区域网格,尽管承认其在捕捉小物体方面存在局限。

实验结果

研究问题

  • RQ1VQA模型如何通过识别可能成为问题关注焦点的区域,更好地模拟人类视觉注意力?
  • RQ2基于BiLSTM的机制能否有效建模图像区域间的依赖关系,以生成特定任务的显著性图?
  • RQ3在VQA中,视觉与文本特征的逐元素相乘是否优于拼接或标准注意力机制,实现更优的特征融合?
  • RQ4预选择显著区域在多大程度上能提升VQA性能,尤其是在开放式与多项选择问题上?

主要发现

  • 所提模型在COCO-VQA测试-开发集的多项选择任务中达到63.69%的准确率,在开放式任务中达到56.02%,优于多个当前最优模型。
  • 在测试标准集上,多项选择任务准确率达到63.99%,开放式任务达到56.42%,表现出强大的泛化能力。
  • 模型在'其他'答案类型上表现尤为出色,该类型包括物体与场景识别,表明其对感兴趣区域的检测有效。
  • 可视化结果表明,预选择机制能突出语义相关的区域(如人物、关注对象),且注意力图与问题语义一致(如针对天气相关问题聚焦于衣物)。
  • 该方法具有良好的通用性,可集成到其他基于注意力的VQA模型中以提升其性能。
  • 尽管仅使用3×3区域特征(少于其他模型的100个或14×14),模型仍取得具有竞争力的结果,表明其高效且有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。