[论文解读] Learning to Disambiguate by Asking Discriminative Questions
本文提出了视觉区分性问题生成(VDQG)这一新任务,旨在生成能够区分两幅视觉上相似图像的问题。该方法提出了一种基于LSTM的模型,通过评分函数识别出区分性特征,并在弱监督设置下利用VQA数据集进行训练,最终在包含超过10,000对图像和100,000个问题的新大规模VDQG数据集上取得了优异性能。
The ability to ask questions is a powerful tool to gather information in order to learn about the world and resolve ambiguities. In this paper, we explore a novel problem of generating discriminative questions to help disambiguate visual instances. Our work can be seen as a complement and new extension to the rich research studies on image captioning and question answering. We introduce the first large-scale dataset with over 10,000 carefully annotated images-question tuples to facilitate benchmarking. In particular, each tuple consists of a pair of images and 4.6 discriminative questions (as positive samples) and 5.9 non-discriminative questions (as negative samples) on average. In addition, we present an effective method for visual discriminative question generation. The method can be trained in a weakly supervised manner without discriminative images-question tuples but just existing visual question answering datasets. Promising results are shown against representative baselines through quantitative evaluations and user studies.
研究动机与目标
- 为解决缺乏正式化任务以生成能够消除两幅图像实例之间视觉歧义的问题这一问题。
- 通过利用现有VQA数据集中的弱监督信号,克服在训练区分性问题生成时的数据稀缺问题。
- 开发一种方法,通过识别图像对之间最具区分性的视觉特征,生成自然、以对象为中心且具有区分性的提问。
- 通过构建一个大规模、人工标注的10,000余对图像-问题样本数据集(包含正样本与负样本问题),为VDQG建立基准。
提出的方法
- 使用基于LSTM的序列生成器,以深度卷积神经网络提取的视觉特征为条件,生成自然语言问题。
- 应用区分性评分函数,从噪声属性预测中识别出两幅图像实例之间最具区分性的特征。
- 通过从Visual Genome数据集中提取问题-答案对,以弱监督方式训练模型,无需显式配对图像-问题标注。
- 将LSTM模型基于得分最高的区分性特征进行条件控制,以约束生成空间,提升相关性与区分能力。
- 通过结合检索式监督与人工标注的问题数据,对模型进行端到端微调,以提升性能。
- 引入一种新的评估协议,结合自动指标(BLEU、METEOR)与人工评估,以衡量问题质量与区分效果。
实验结果
研究问题
- RQ1模型能否生成自然且具有区分性的提问,有效区分两幅视觉上模糊的图像?
- RQ2如何在无需大规模配对图像数据集及显式问题标注的情况下,训练区分性问题生成模型?
- RQ3哪些视觉特征最能有效帮助模型生成能够解决对象间歧义的问题?
- RQ4在人类区分任务中,区分性问题生成与指代表达生成的性能相比如何?
- RQ5来自VQA数据的弱监督预训练信号在多大程度上提升了生成的区分性问题的质量?
主要发现
- 所提出的ACQG完整模型在VDQG困难子集上达到BLEU 40.6与METEOR 39.7,优于强基线模型(包括CNN-LSTM与检索基线方法)。
- 人工标注的问题(Human top)始终优于随机人工标注(Human random),验证了VDQG数据集的质量与区分意图。
- 在用户研究中,ACQG完整模型在区分图像对方面显著优于CNN-LSTM与检索基线,尤其在困难样本上优势更为明显。
- 通过VQA数据中的弱监督进行训练的模型取得了具有竞争力的性能,证明了无需完整配对图像监督即可学习VDQG的可行性。
- 带有条件特征的区分性问题在人类区分任务中达到69.51%的平均检索准确率,优于指代表达(65.14%),表明二者具有互补优势。
- 结果表明,区分性问题与指代表达在不同情况下失效,提示二者可结合使用以进一步提升视觉歧义消除效果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。