Skip to main content
QUICK REVIEW

[论文解读] Declaration-based Prompt Tuning for Visual Question Answering

Yuhang Liu, Wei Wei|arXiv (Cornell University)|May 5, 2022
Multimodal Machine Learning Applications被引用 5
一句话总结

本文提出声明式提示微调(DPT),一种用于视觉问答(VQA)的新颖微调范式,通过将问题转换为带有[MASK]标记的陈述句,将任务重新表述以与预训练目标——掩码语言建模(MLM)和图文匹配(ITM)——对齐。DPT在完全监督设置下实现2.68%的准确率提升,在GQA数据集的零样本/少样本设置下实现超过31%的绝对性能提升,展现出在预训练视觉语言模型上的强大泛化能力。

ABSTRACT

In recent years, the pre-training-then-fine-tuning paradigm has yielded immense success on a wide spectrum of cross-modal tasks, such as visual question answering (VQA), in which a visual-language (VL) model is first optimized via self-supervised task objectives, e.g., masked language modeling (MLM) and image-text matching (ITM), and then fine-tuned to adapt to downstream task (e.g., VQA) via a brand-new objective function, e.g., answer prediction. The inconsistency of the objective forms not only severely limits the generalization of pre-trained VL models to downstream tasks, but also requires a large amount of labeled data for fine-tuning. To alleviate the problem, we propose an innovative VL fine-tuning paradigm (named Declaration-based Prompt Tuning, abbreviated as DPT), which jointly optimizes the objectives of pre-training and fine-tuning of VQA model, boosting the effective adaptation of pre-trained VL models to the downstream task. Specifically, DPT reformulates the objective form of VQA task via (1) textual adaptation, which converts the given questions into declarative sentence-form for prompt-tuning, and (2) task adaptation, which optimizes the objective function of VQA problem in the manner of pre-training phase. Experimental results on GQA dataset show that DPT outperforms the fine-tuned counterpart by a large margin regarding accuracy in both fully-supervised (2.68%) and zero-shot/few-shot (over 31%) settings. All the data and codes will be available to facilitate future research.

研究动机与目标

  • 解决视觉语言模型在预训练与微调阶段目标形式不一致导致的性能差距问题。
  • 通过将下游任务目标与预训练目标对齐,降低VQA对大规模标注数据集的依赖。
  • 通过统一的目标格式,提升VQA在零样本和少样本设置下的泛化能力。
  • 在不引入任务特定分类头的前提下,实现预训练视觉语言模型的有效适配。

提出的方法

  • 文本适配:通过将疑问词替换为[MASK]标记或候选答案,将输入问题转换为陈述句。
  • 任务适配:将VQA重构为掩码语言建模(MLM)任务(预测[MASK]标记)和图文匹配(ITM)任务(选择最佳匹配答案)。
  • 仅使用预训练目标(MLM和ITM)对视觉语言模型进行微调,避免引入新分类头。
  • 在预训练和微调阶段均使用相同的损失函数(MLM和ITM),以最小化分布差距。
  • 将该方法应用于UNIVERSITY和ViLT等多种预训练模型,验证其泛化能力。
  • 使用标准交叉熵损失端到端优化MLM和ITM任务,除提示模板外不引入额外参数。

实验结果

研究问题

  • RQ1将VQA微调的目标形式与预训练目标对齐,是否能提升模型泛化能力?
  • RQ2与标准微调相比,DPT在零样本和少样本VQA设置下的表现如何?
  • RQ3将问题重构为带[MASK]标记的陈述句,是否能增强模型对属性和全局语义的理解?
  • RQ4DPT在不同预训练视觉语言模型上的泛化程度如何?
  • RQ5DPT能否在不牺牲性能的前提下,减少VQA对大规模标注数据集的依赖?

主要发现

  • 在完全监督设置下,DPT在GQA数据集上的准确率相比标准微调提升2.68个百分点。
  • 在零样本和少样本设置下,DPT相比基线模型准确率提升31.8%至37.4%,其中零样本设置下无任何训练数据。
  • 在基于属性的问题上,DPT准确率提升5.59个百分点(70.46% vs. 64.87%),表明其对属性理解能力更强。
  • 在全局范围问题上,DPT准确率提升2.55个百分点(59.24% vs. 56.69%),表明其具备更强的全局推理能力。
  • DPT具备良好的跨模型泛化能力:在GQA数据集上,UNITER+DPT相比其微调基线提升1.01%,ViLT+DPT提升0.46%。
  • 案例研究显示,DPT通过利用ITM实现语义一致性,能正确解析歧义问题,优于依赖答案频率的基线模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。