Skip to main content
QUICK REVIEW

[论文解读] DualNet: Domain-Invariant Network for Visual Question Answering

Kuniaki Saito, Andrew Shin|arXiv (Cornell University)|Jun 20, 2016
Multimodal Machine Learning Applications参考文献 19被引用 16
一句话总结

DualNet 提出了一种领域不变的视觉问答模型,通过分别使用加法和乘法操作融合图像和文本特征,实现了优于以往方法的性能,且无需使用注意力机制。该模型在真实图像和抽象场景两种场景下均取得了最先进(SOTA)的结果,尤其在抽象场景中超越了其自身先前的 SOTA 模型。

ABSTRACT

Visual question answering (VQA) task not only bridges the gap between images and language, but also requires that specific contents within the image are understood as indicated by linguistic context of the question, in order to generate the accurate answers. Thus, it is critical to build an efficient embedding of images and texts. We implement DualNet, which fully takes advantage of discriminative power of both image and textual features by separately performing two operations. Building an ensemble of DualNet further boosts the performance. Contrary to common belief, our method proved effective in both real images and abstract scenes, in spite of significantly different properties of respective domain. Our method was able to outperform previous state-of-the-art methods in real images category even without explicitly employing attention mechanism, and also outperformed our own state-of-the-art method in abstract scenes category, which recently won the first place in VQA Challenge 2016.

研究动机与目标

  • 开发一种在真实图像和抽象场景等多样化领域中均能有效泛化的视觉问答模型。
  • 在不依赖注意力机制的前提下,提升图像与文本模态之间的特征融合效果。
  • 设计一种简单但强大的架构,以充分挖掘两种模态中的判别性特征。
  • 在真实图像和抽象场景的 VQA 基准测试中均实现最先进性能。
  • 证明通过极少的架构复杂度,即可实现领域不变的表征学习。

提出的方法

  • DualNet 对图像特征和文本特征分别执行加法和乘法两种独立操作,以生成互补的表征。
  • 将加法分支和乘法分支的输出进行拼接,并输入最终分类器以预测答案。
  • 构建了隐藏维度不同的多个 DualNet 模型的集成,以提升鲁棒性与性能。
  • 图像使用 VGG 或 ResNet 特征,问题使用 LSTM 嵌入的特征,不使用空间注意力或区域级监督。
  • 特征融合在共享嵌入空间中进行,以实现视觉与语言输入的联合理解。
  • 模型在标准 VQA 数据集上端到端训练,使用交叉熵损失函数。

实验结果

研究问题

  • RQ1是否能够通过一种简单且非注意力机制的模型,在真实图像和抽象场景的 VQA 任务中均达到最先进性能?
  • RQ2在图像-文本特征上同时使用加法和乘法操作,是否能比仅使用单一操作带来更优的表征学习效果?
  • RQ3单一架构是否能有效泛化到具有根本不同视觉特征的多个领域?
  • RQ4是否可能在不使用复杂注意力机制的前提下,超越现有 SOTA 方法?
  • RQ5在抽象场景等低数据场景下,使用不同隐藏维度的模型集成对性能有何影响?

主要发现

  • 在真实图像类别中,DualNet 在测试-标准(test-std)划分上取得了 69.73 的准确率,即使未使用注意力机制,也优于此前的 SOTA 方法。
  • 在抽象场景类别中,DualNet 在测试-标准(test-std)划分上达到了 74.02 的准确率,超越了此前的 SOTA(73.29)以及其自身在 2016 年 VQA 挑战赛中取得的 SOTA(73.29)。
  • 与单个模型相比,DualNet 模型的集成在抽象场景的测试-标准划分上提升了 0.76 个百分点。
  • 仅使用乘法分支的准确率为 59.15,而仅使用加法分支的准确率为 56.81,表明乘法操作能捕捉到更多判别性信息。
  • 同时结合加法和乘法路径显著提升了性能,证明了两种路径在信息提取上的互补性。
  • 尽管两种场景的视觉属性截然不同,该模型在两者上均取得了优异结果,证明了通过简单特征融合可实现领域不变性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。