Skip to main content
QUICK REVIEW

[论文解读] Attention on Attention: Architectures for Visual Question Answering (VQA)

Jasdeep Singh, Vincent Ying|arXiv (Cornell University)|Mar 21, 2018
Multimodal Machine Learning Applications参考文献 5被引用 21
一句话总结

本文提出了一种新颖的注意力机制 A3x2,通过堆叠两个并行的 A3 注意力模块来提升视觉问答(VQA)性能。通过使用问题引导的、多方面聚焦的方式对图像特征进行注意力优化,该模型在经过 300 小时 GPU 超参数与架构搜索后,在 VQA v2.0 数据集上取得了 64.78% 的验证分数,超越了 2017 年之前最优单模型的 63.15% 分数。

ABSTRACT

Visual Question Answering (VQA) is an increasingly popular topic in deep learning research, requiring coordination of natural language processing and computer vision modules into a single architecture. We build upon the model which placed first in the VQA Challenge by developing thirteen new attention mechanisms and introducing a simplified classifier. We performed 300 GPU hours of extensive hyperparameter and architecture searches and were able to achieve an evaluation score of 64.78%, outperforming the existing state-of-the-art single model's validation score of 63.15%.

研究动机与目标

  • 通过在标准单次注意力之外增强注意力机制,提升视觉问答(VQA)性能。
  • 探究多个并行注意力模块对图像-问题联合表征学习的影响。
  • 通过大规模搜索优化模型架构与超参数,重点关注注意力设计与分类器简化。
  • 在验证集上超越 2017 年 VQA 挑战赛冠军模型的单模型性能(63.15%)

提出的方法

  • 模型使用预训练的 GloVe 嵌入和 GRU 将输入问题编码为 1280 维嵌入。
  • 通过固定的 Faster R-CNN 提取图像特征,每张图像生成 36 个以对象为中心的特征。
  • 双路单向自顶向下注意力模块(A3x2)使用学习到的注意力权重,计算问题嵌入与每个图像区域的相关性得分。
  • A3x2 机制将两个 A3 注意力模块并行堆叠,使模型能够同时关注多个图像区域。
  • 在图像-问题联合嵌入上应用简化分类器,以预测最终答案。
  • 通过贪婪的顺序搜索,在权重归一化、激活函数(如 Leaky ReLU)及其他架构组件上进行广泛的超参数调优。

实验结果

研究问题

  • RQ1通过堆叠多个注意力机制,能否通过实现对图像区域的多方面聚焦来提升 VQA 性能?
  • RQ2注意力机制的设计如何影响模型将问题与相关视觉特征对齐的能力?
  • RQ3权重归一化和激活函数等架构组件对 VQA 准确率有何影响?
  • RQ4在 VQA 设置中,简化分类器能否优于更复杂的输出头?

主要发现

  • A3x2 注意力机制在 13 种评估的注意力模块中表现最佳,优于单注意力和其他堆叠变体。
  • 最终模型在验证集上达到 64.78% 的分数,超越了 Teney 等人于 2017 年报告的先前最优单模型分数 63.15%。
  • 双注意力机制在需要关注多个图像区域的复杂问题上表现出更优的特征定位能力,如热力图可视化所示。
  • 尽管在训练集上经过多轮训练后出现过拟合,但模型仍保持了较强的泛化能力,表明超参数调优有效缓解了对验证集的过拟合。
  • 权重归一化和 Leaky ReLU 激活函数被证明是最优选择,其性能优于标准 ReLU 和无归一化设置。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。