[论文解读] Hierarchical Co-Attention for Visual Question Answering
本文提出了一种用于视觉问答(VQA)的分层协同注意力模型,通过基于1D-CNN的分层结构,联合学习视觉与问题的注意力机制。通过同时建模图像中应关注的位置以及问题中应关注的词汇,该方法在VQA和COCO-QA数据集上均取得了当前最优性能,准确率分别达到62.1%和65.4%。
A number of recent works have proposed attention models for Visual Question Answering (VQA) that generate spatial maps highlighting image regions relevant answering the question. In this paper, we argue that in addition modeling where look or visual attention, it is equally important model what words listen to or question attention. We present a novel co-attention model for VQA that jointly reasons about image and question attention. In addition, our model reasons about the question and consequently the image via the co-attention mechanism in a hierarchical fashion via a novel 1-dimensional convolution neural networks (CNN) model. Our final model outperforms all reported methods, improving the state-of-the-art on the VQA dataset from 60.4% 62.1%, and from 61.6% 65.4% on the COCO-QA dataset.
研究动机与目标
- 解决现有VQA模型仅关注视觉注意力而忽略问题特异性注意力的局限性。
- 通过联合建模图像区域与问题词汇的注意力机制,提升VQA性能。
- 引入基于1D-CNN的分层推理机制,以建模图像与问题特征之间的协同注意力。
- 通过改进的跨模态注意力机制,在基准VQA和COCO-QA数据集上实现最先进结果。
提出的方法
- 提出一种协同注意力机制,联合计算图像特征与问题词汇的注意力权重。
- 采用一维卷积神经网络(1D-CNN)分层建模图像与问题表征之间的交互。
- 使用双注意力机制,使模型能够基于问题内容推理相关图像区域,反之亦然。
- 以分层方式应用协同注意力机制,实现在图像与问题特征之间的多级推理。
- 将学习到的注意力图整合到最终分类层,以生成答案。
实验结果
研究问题
- RQ1与仅关注视觉注意力的模型相比,联合建模视觉与问题注意力是否能提升VQA性能?
- RQ2通过1D-CNN实现的分层推理如何增强VQA中的跨模态注意力?
- RQ3引入问题级别的注意力是否能提升VQA基准上的泛化能力与准确率?
- RQ4所提出的协同注意力机制在多大程度上优于现有的基于注意力的VQA模型?
主要发现
- 所提模型在VQA数据集上达到62.1%的测试准确率,较之前最先进方法提升1.7%。
- 在COCO-QA数据集上,模型准确率达到65.4%,较先前最先进方法的61.6%提升3.8%。
- 分层协同注意力机制在跨模态特征对齐方面优于标准注意力机制。
- 通过同时关注相关图像区域与语义重要的问题词汇,模型展现出更强的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。