QUICK REVIEW
[论文解读] VQD: Visual Query Detection in Natural Scenes
Manoj Acharya, Karan Jariwala|arXiv (Cornell University)|Apr 4, 2019
Multimodal Machine Learning Applications参考文献 19被引用 9
一句话总结
本文提出了视觉查询检测(Visual Query Detection, VQD)这一新的视觉定位任务,要求根据自然语言查询在图像中定位零个至多个对象,与指代表达识别(Referring Expression Recognition, RER)不同之处在于其输出数量可变。作者构建了首个VQD数据集(VQDv1),采用合成查询,并对基线模型进行了评估,结果表明,模型必须理解上下文和多个对象才能取得成功,其中Vision+Query模型在VQD和RER基准上均优于简单基线模型。
ABSTRACT
We propose Visual Query Detection (VQD), a new visual grounding task. In VQD, a system is guided by natural language to localize a variable number of objects in an image. VQD is related to visual referring expression recognition, where the task is to localize only one object. We describe the first dataset for VQD and we propose baseline algorithms that demonstrate the difficulty of the task compared to referring expression recognition.
研究动机与目标
- 将视觉查询检测(Visual Query Detection, VQD)定义并形式化为一种新的视觉定位任务,要求基于自然语言查询定位可变数量的对象。
- 解决现有任务(如指代表达识别,RER)和视觉问答(Visual Question Answering, VQA)的局限性,这些任务存在数据集偏差和单输出约束问题。
- 开发并发布首个公开可用的VQD数据集(VQDv1),采用合成的、上下文相关的查询,以减少语言偏差。
- 在VQD上评估基线模型,并证明该任务相较于RER的难度更高,特别是在处理包含多个或零个有效输出的复杂查询时。
- 表明VQD比VQA和RER更不易受偏差影响,因为其要求生成边界框,而非依赖纯语言模式。
提出的方法
- VQD任务定义为:使用自然语言查询在图像中定位0至N个对象,输出为与查询匹配的边界框。
- VQDv1数据集通过模板生成的合成查询构建,包含属性、关系和空间推理,确保提示多样化且上下文相关。
- 基线模型包括DETECT(使用Faster R-CNN检测与查询首个名词匹配的COCO类别)、RANDOM(随机选择提议框)、Query-Blind(仅使用CNN特征和三全连接层的视觉模型),以及Vision+Query(将GRU编码的查询特征与CNN特征拼接后进行分类)。
- 所有模型均使用ResNet-101主干网络的Faster R-CNN和非极大值抑制(IoU阈值为0.7)生成区域提议。
- Vision+Query模型使用GRU将查询编码为固定大小向量,该向量与CNN特征拼接后,通过包含ReLU激活的三全连接层MLP进行处理。
- 评估采用AP@IoU=0.50(用于VQDv1的0-N个对象)和Precision@1(用于单对象VQDv1与RER),训练使用二元交叉熵损失和学习率衰减。
实验结果
研究问题
- RQ1VQD的复杂性与指代表达识别(RER)相比如何,特别是在输出可变性和模型泛化能力方面?
- RQ2在RER上训练的模型能否泛化到VQD?考虑到VQD允许每个查询存在零个或多个有效边界框。
- RQ3现有模型在RER和VQA中在多大程度上利用了数据集偏差?VQD如何因要求生成边界框而减少此类偏差?
- RQ4视觉模型与视觉-语言模型在基于复杂、属性丰富的或关系型查询检测自然场景中的对象时,其有效性如何?
- RQ5简单基线模型(如DETECT和RANDOM)在VQD中的性能极限是什么?与端到端学习模型相比表现如何?
主要发现
- Vision+Query模型在RER和VQD任务上均表现优异,优于DETECT和RANDOM等简单基线,表明视觉与语言联合理解的重要性。
- DETECT基线在单对象VQD上表现良好,但在0–N对象设置中表现显著下降,凸显了模型必须能够推理多个或无有效对象的能力。
- RANDOM基线在VQD和RER上均表现较差,证实随机框选择不足以实现准确的定位。
- 仅使用视觉特征的Query-Blind模型在RefCOCOg上达到71.2%的top-2精度,表明现有RER数据集容易受到纯视觉偏差的影响。
- 与现有RER和VQA数据集相比,VQDv1数据集减少了语言偏差,因为其合成查询被设计为最小化偶然的语言相关性,从而更难利用数据集偏差。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。