Skip to main content
QUICK REVIEW

[论文解读] Joint Image Captioning and Question Answering

Jialin Wu, Zeyuan Hu|arXiv (Cornell University)|May 22, 2018
Multimodal Machine Learning Applications参考文献 30被引用 13
一句话总结

本文提出一种联合学习框架,通过相互监督机制同时提升图像字幕生成与视觉问答(VQA)性能:由VQA生成的与问题相关的字幕为VQA提供语义知识以提升其性能,同时问题特征引导字幕生成模型产出更具信息量和多样性的字幕。通过集成模型,该系统在VQA v2测试标准划分上达到69.7%的准确率,使用生成字幕作为辅助输入时,在自动评估指标和VQA性能方面均取得显著提升。

ABSTRACT

Answering visual questions need acquire daily common knowledge and model the semantic connection among different parts in images, which is too difficult for VQA systems to learn from images with the only supervision from answers. Meanwhile, image captioning systems with beam search strategy tend to generate similar captions and fail to diversely describe images. To address the aforementioned issues, we present a system to have these two tasks compensate with each other, which is capable of jointly producing image captions and answering visual questions. In particular, we utilize question and image features to generate question-related captions and use the generated captions as additional features to provide new knowledge to the VQA system. For image captioning, our system attains more informative results in term of the relative improvements on VQA tasks as well as competitive results using automated metrics. Applying our system to the VQA tasks, our results on VQA v2 dataset achieve 65.8% using generated captions and 69.1% using annotated captions in validation set and 68.4% in the test-standard set. Further, an ensemble of 10 models results in 69.7% in the test-standard split.

研究动机与目标

  • 为解决独立的VQA与图像字幕系统在捕捉复杂视觉关系和常识知识方面的局限性。
  • 通过引入来自图像字幕的外部常识知识,减少VQA模型对图像特征的过度依赖。
  • 通过在字幕生成过程中使用视觉问题作为启发式引导,提升字幕的多样性和信息量。
  • 通过联合训练与推理,展示图像字幕与VQA之间的互补性。

提出的方法

  • 系统联合生成与问题相关的字幕,利用图像与问题特征的联合表征,随后将这些字幕作为额外输入提供给VQA模型。
  • 采用基于梯度的在线选择算法,在训练过程中识别最相关的标注字幕,以最大化与答案梯度的一致性。
  • VQA模型通过逐元素操作(加法与乘法)融合图像、问题与字幕特征,以优化注意力机制与预测结果。
  • 字幕生成模型将问题特征作为条件先验,引导生成更具多样性与上下文相关性的字幕。
  • 采用双流架构,实现共享视觉特征的端到端训练,并对问题与字幕分别进行模态特异性处理。
  • 使用10个模型的集成方法,以提升在VQA v2测试标准划分上的泛化能力与性能表现。

实验结果

研究问题

  • RQ1在联合训练过程中生成的与问题相关的字幕,是否能超越仅依赖图像与问题特征的VQA性能?
  • RQ2问题感知字幕在多大程度上提升了图像描述的信息量与多样性?
  • RQ3将生成的字幕作为辅助特征输入,对VQA系统的鲁棒性与准确性有何影响?
  • RQ4字幕生成与VQA之间的相互监督能否减少对图像特征的依赖,并缓解仅基于问题预测的偏差?

主要发现

  • 通过10个模型的集成,联合系统在VQA v2测试标准划分上达到69.7%的准确率,优于BUTD基线模型。
  • 当使用生成字幕作为输入时,VQA模型在验证集上达到65.8%的准确率,显著优于63.2%的基线水平。
  • 在使用COCO数据集中标注字幕的情况下,VQA模型在验证集上达到69.1%的准确率,证明了基于字幕知识的价值。
  • 与基线模型相比,生成字幕使VQA准确率相对提升4.11%,而基线仅提升2.22%,表明生成字幕更具信息量。
  • 该系统在保持竞争性自动字幕评估指标的同时,显著提升了下游VQA性能,体现了双任务协同增益。
  • 基于梯度的字幕选择方法能有效识别高质量的监督信号,提升字幕相关性与答案预测之间的一致性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。