Skip to main content
QUICK REVIEW

[论文解读] Answer-Me: Multi-Task Open-Vocabulary Visual Question Answering

AJ Piergiovanni, Wei Li|arXiv (Cornell University)|May 2, 2022
Multimodal Machine Learning Applications被引用 16
一句话总结

Answer-Me 提出了一种用于开放词汇视觉问答的多任务、任务感知框架,该框架仅使用噪声图像字幕数据端到端预训练视觉语言模型。通过联合优化 VQA、视觉蕴涵和推理任务中多样的问题意图,该方法在零样本泛化和灾难性遗忘鲁棒性方面达到当前最先进水平,在开放词汇设置下优于先前的多任务和微调模型。

ABSTRACT

We present Answer-Me, a task-aware multi-task framework which unifies a variety of question answering tasks, such as, visual question answering, visual entailment, visual reasoning. In contrast to previous works using contrastive or generative captioning training, we propose a novel and simple recipe to pre-train a vision-language joint model, which is multi-task as well. The pre-training uses only noisy image captioning data, and is formulated to use the entire architecture end-to-end with both a strong language encoder and decoder. Our results show state-of-the-art performance, zero-shot generalization, robustness to forgetting, and competitive single-task results across a variety of question answering tasks. Our multi-task mixture training learns from tasks of various question intents and thus generalizes better, including on zero-shot vision-language tasks. We conduct experiments in the challenging multi-task and open-vocabulary settings and across a variety of datasets and tasks, such as VQA2.0, SNLI-VE, NLVR2, GQA. We observe that the proposed approach is able to generalize to unseen tasks and that more diverse mixtures lead to higher accuracy in both known and novel tasks.

研究动机与目标

  • 开发一种统一的多任务框架,无需任务特定微调即可在多样化视觉问答任务间实现泛化。
  • 解决任务无关预训练的局限性,后者无法捕捉问题意图,导致零样本性能较差。
  • 在跨多个任务的持续学习过程中,提升对灾难性遗忘的鲁棒性。
  • 仅使用图像字幕数据,实现视觉语言模型的端到端训练,且编码器-解码器对齐性强。
  • 在更真实的开放词汇设置下评估性能,该设置要求精确的文本生成,而非多项选择分类。

提出的方法

  • 该模型采用统一架构,包含共享视觉编码器、语言编码器和文本解码器,基于多任务预训练目标的混合数据进行端到端训练。
  • 预训练采用仅使用图像字幕数据的简单方案,包含四项不同任务:字幕生成、字幕补全、图文匹配(ITM)和掩码语言建模(MLM)。
  • 每项任务使用相同的损失函数,仅需极少的预处理差异,从而实现视觉和语言编码器以及解码器的联合优化。
  • 融合机制通过拼接图像和文本特征,再经 Transformer 编码器处理,以最小化参数量同时保持性能。
  • 模型被训练为生成自由形式答案,从而在无需额外提示或微调的情况下实现对未见任务的零样本推理。
  • 该方法避免了复杂的物体检测流水线,转而依赖轻量级、可扩展的架构,可泛化至分布外对象。

实验结果

研究问题

  • RQ1仅使用图像字幕数据的多任务预训练方案,能否在多样化视觉问答任务中实现强大的零样本泛化?
  • RQ2预训练中任务多样性如何影响对新型未见问答任务的泛化能力?
  • RQ3与仅对比学习或自回归预训练相比,端到端训练编码器和解码器组件是否能提升性能?
  • RQ4在开放词汇设置下,当要求精确答案匹配时,模型性能如何,相较于多项选择基准表现如何?
  • RQ5在增量学习新任务时,多任务学习在多大程度上能减少灾难性遗忘?

主要发现

  • 使用全部四项任务(字幕生成、字幕补全、ITM、MLM)的完整多任务预训练方案表现最佳,在 VQA2.0 上达到 65.2% F1,在 SNLI-VE 上达到 77.7%,优于任何单任务预训练方案。
  • 随着任务混合多样性的提升,对未见任务的零样本泛化性能显著提高:四任务(B)混合方案在零样本 VQA 上达到 16% F1,而标准预训练模型仅达 2%。
  • 仅使用 MS-COCO 数据进行预训练,模型在零样本检测任务上达到 53% F1,四任务(B)混合方案进一步将其提升至 53% F1,表明对新物体检测任务具有强大泛化能力。
  • 使用编码器/解码器融合层而非拼接操作对性能影响极小,但参数量增加 4%,因此为效率起见仍优先选择拼接。
  • 模型表现出对灾难性遗忘的强鲁棒性,在持续学习多个任务后仍能保持高性能,而微调各任务的模型则表现不佳。
  • 由于更强的泛化能力和意图理解,该方法在开放词汇设置下优于当前最先进模型,包括部分更大规模的微调模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。