Skip to main content
QUICK REVIEW

[论文解读] CapWAP: Captioning with a Purpose

Adam Fisch, Kenton Lee|arXiv (Cornell University)|Nov 9, 2020
Multimodal Machine Learning Applications参考文献 54被引用 5
一句话总结

本文提出CapWAP,一种新颖的图像字幕生成框架,通过使用基于问答(QA)模型的奖励信号,利用强化学习优化字幕以满足特定用户的信息需求。通过在图像-问题-答案三元组上进行训练,并奖励能够支持准确问答的字幕,CapWAP生成的字幕比通用字幕模型更具目的性与信息量,在多个数据集上显著提升了下游问答性能。

ABSTRACT

The traditional image captioning task uses generic reference captions to provide textual information about images. Different user populations, however, will care about different visual aspects of images. In this paper, we propose a new task, Captioning with a Purpose (CapWAP). Our goal is to develop systems that can be tailored to be useful for the information needs of an intended population, rather than merely provide generic information about an image. In this task, we use question-answer (QA) pairs---a natural expression of information need---from users, instead of reference captions, for both training and post-inference evaluation. We show that it is possible to use reinforcement learning to directly optimize for the intended information need, by rewarding outputs that allow a question answering model to provide correct answers to sampled user questions. We convert several visual question answering datasets into CapWAP datasets, and demonstrate that under a variety of scenarios our purposeful captioning system learns to anticipate and fulfill specific information needs better than its generic counterparts, as measured by QA performance on user questions from unseen images, when using the caption alone as context.

研究动机与目标

  • 解决通用图像字幕的局限性,即无法预判用户特定的信息需求。
  • 提出一项新任务——有目的的字幕生成(CapWAP),将字幕生成问题重新定义为对预期用户问题的直接优化。
  • 证明使用问答性能作为奖励信号可使模型生成更有利于回答用户问题的字幕。
  • 展示合成预训练可提升强化学习字幕生成中的策略收敛速度与流畅性。

提出的方法

  • 该模型采用强化学习框架,其奖励基于使用生成字幕作为上下文时,QA模型回答问题的准确性。
  • 使用一个固定且强大的QA模型,评估生成的字幕是否能支持从用户查询分布中采样的问题的正确回答。
  • 训练目标是最大化QA模型从与训练QA对相同分布中采样问题时正确回答的概率。
  • 提出一种新颖的合成预训练方法(SYN),用于将策略初始化在字幕空间的高奖励区域,从而提升样本效率并缓解稀疏奖励问题。
  • 该方法被应用于四个VQA数据集(CapGQA、CapVisual7W、CapVizWiz、CapVQA),通过使用图像-问题-答案三元组作为监督信号,将它们转换为CapWAP数据集。
  • 模型采用端到端的策略梯度训练,初始预训练使用交叉熵损失,后续微调基于基于QA的奖励进行强化学习。

实验结果

研究问题

  • RQ1我们能否训练图像字幕模型以预判并满足特定用户的信息需求,而非仅生成通用描述?
  • RQ2使用问答性能作为奖励信号是否能生成比标准字幕更有利于回答真实用户问题的字幕?
  • RQ3合成预训练在多大程度上提升了强化学习在字幕生成中的样本效率与质量?
  • RQ4CapWAP方法在多大程度上能泛化到多样化的用户群体和问题类型,包括真实用户提出的长句问题?
  • RQ5与基于关键词的监督相比,基于QA的奖励信号是否能减少虚假或不连贯的字幕生成?

主要发现

  • 采用合成预训练的CapWAP模型(RL + SYN)在CapVisual7W数据集上达到31.3的F1分数,显著优于基线MLE模型(14.1 F1)。
  • 在包含视障用户真实问题的CapVizWiz数据集中,RL + SYN模型达到22.0的EM和31.3的F1,展现出在复杂、长句查询上的强大性能。
  • 与仅使用关键词奖励的基线相比,使用QA模型作为奖励信号在所有数据集上均取得了更高的F1和EM分数,后者生成了更多虚假和不连贯的字幕。
  • RL + SYN模型保持了更自然的形容词使用率(adj%)和更丰富的二元语法使用(|V²|),表明其流畅性与语言质量得到提升。
  • 消融实验表明,若移除QA模型或仅使用关键词存在性信号,性能会下降,证实了奖励信号中语义准确性的关键作用。
  • 与通用字幕基线相比,该模型生成的字幕更长、更具描述性,形容词使用更多,词汇多样性更高,表明其对相关视觉属性的覆盖更全面。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。