Skip to main content
QUICK REVIEW

[论文解读] Dual Attention Networks for Visual Reference Resolution in Visual Dialog

Gi-Cheon Kang, Jaeseo Lim|arXiv (Cornell University)|Feb 25, 2019
Multimodal Machine Learning Applications参考文献 28被引用 13
一句话总结

本文提出双注意力网络(DAN)用于视觉对话中的视觉指代消解,采用两种专用注意力模块:REFER模块通过多头自注意力建模对话历史依赖关系,以解决模糊代词问题;FIND模块则利用图像特征的自下而上注意力实现视觉定位。DAN在VisDial v1.0和v0.9数据集上取得当前最优性能,显著优于先前方法。

ABSTRACT

Visual dialog (VisDial) is a task which requires an AI agent to answer a series of questions grounded in an image. Unlike in visual question answering (VQA), the series of questions should be able to capture a temporal context from a dialog history and exploit visually-grounded information. A problem called visual reference resolution involves these challenges, requiring the agent to resolve ambiguous references in a given question and find the references in a given image. In this paper, we propose Dual Attention Networks (DAN) for visual reference resolution. DAN consists of two kinds of attention networks, REFER and FIND. Specifically, REFER module learns latent relationships between a given question and a dialog history by employing a self-attention mechanism. FIND module takes image features and reference-aware representations (i.e., the output of REFER module) as input, and performs visual grounding via bottom-up attention mechanism. We qualitatively and quantitatively evaluate our model on VisDial v1.0 and v0.9 datasets, showing that DAN outperforms the previous state-of-the-art model by a significant margin.

研究动机与目标

  • 解决视觉对话中的视觉指代消解问题,即利用对话历史和视觉上下文来解析如'it'或'they'等模糊代词。
  • 模拟人类分步推理过程:首先利用对话历史消除语言歧义,然后在图像中定位对应实体。
  • 通过显式分离并优化语言消歧与视觉定位两个阶段,提升VisDial任务的性能。
  • 通过消融实验和真实对话数据的定性分析,验证双注意力架构的有效性。

提出的方法

  • REFER模块在所有先前对话轮次上使用多头自注意力计算参考感知表征,捕捉当前问题与对话历史之间的潜在关联。
  • FIND模块通过条件化于REFER模块生成的参考感知表征,利用自下而上的注意力机制对图像特征进行视觉定位。
  • 模型以流水线方式集成两个模块:REFER首先解析模糊指代,随后FIND在图像中定位对应视觉区域。
  • REFER模块采用残差连接以稳定训练并在深层架构中提升性能。
  • FIND模块使用区域建议网络(RPN)提取的特征作为图像特征,实验证明其性能优于VGG-16特征。
  • 对REFER模块的层数和注意力头数进行超参数消融,以优化模型容量与性能。

实验结果

研究问题

  • RQ1两阶段注意力机制——先利用对话历史消除语言歧义,再进行视觉定位——是否能提升视觉对话中的视觉指代消解性能?
  • RQ2REFER模块对对话历史的注意力机制与依赖先前视觉注意力图的模型相比,表现如何?
  • RQ3不同图像特征表示(如RPN与VGG-16)对视觉定位性能有何影响?
  • RQ4残差连接与多头注意力等架构选择如何影响模型性能与稳定性?
  • RQ5通过定性注意力可视化,模型的注意力机制在多大程度上与人类推理对齐?

主要发现

  • DAN在VisDial v1.0数据集上取得64.17%的新SOTA MRR分数,显著优于先前方法。
  • 消融实验表明,仅使用FIND模块或仅使用REFER模块时性能显著下降,证实了两个模块的互补性。
  • 使用自下而上的注意力特征(RPN)的MRR优于VGG-16特征,表明目标级特征在视觉定位中更有效。
  • REFER模块中的残差连接提升了性能,验证了深度残差学习在该架构中的有效性。
  • 最优配置为两层REFER模块搭配四个注意力头,在消融实验中达到最高MRR。
  • 定性分析表明,DAN能正确关注相关对话轮次和显著图像区域,展现出与人类推理一致的推理过程。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。