Skip to main content
QUICK REVIEW

[论文解读] Cops-Ref: A new Dataset and Task on Compositional Referring Expression Comprehension

Zhenfang Chen, Peng Wang|arXiv (Cornell University)|Mar 1, 2020
Multimodal Machine Learning Applications参考文献 40被引用 6
一句话总结

本文提出了 Cops-Ref,一个全新的基准数据集与任务,用于组合性指代表达理解,通过结合六种推理逻辑(如链式、顺序、非等)与丰富的视觉属性,强调复杂的视觉推理。该任务要求模型在一组具有相似视觉特性的干扰图像中定位目标对象,从而减少因简单跨域对齐而获得的成功。尽管评估了最先进模型并提出了模块化难例挖掘策略,性能仍较低,凸显视觉定位系统在推理能力方面仍需显著提升。

ABSTRACT

Referring expression comprehension (REF) aims at identifying a particular object in a scene by a natural language expression. It requires joint reasoning over the textual and visual domains to solve the problem. Some popular referring expression datasets, however, fail to provide an ideal test bed for evaluating the reasoning ability of the models, mainly because 1) their expressions typically describe only some simple distinctive properties of the object and 2) their images contain limited distracting information. To bridge the gap, we propose a new dataset for visual reasoning in context of referring expression comprehension with two main features. First, we design a novel expression engine rendering various reasoning logics that can be flexibly combined with rich visual properties to generate expressions with varying compositionality. Second, to better exploit the full reasoning chain embodied in an expression, we propose a new test setting by adding additional distracting images containing objects sharing similar properties with the referent, thus minimising the success rate of reasoning-free cross-domain alignment. We evaluate several state-of-the-art REF models, but find none of them can achieve promising performance. A proposed modular hard mining strategy performs the best but still leaves substantial room for improvement. We hope this new dataset and task can serve as a benchmark for deeper visual reasoning analysis and foster the research on referring expression comprehension.

研究动机与目标

  • 为解决现有指代表达数据集的局限性,这些数据集通常依赖简单、简短的表达式,且缺乏足够的干扰项,导致对视觉推理能力的评估不足。
  • 提出一个新的数据集与任务 Cops-Ref,通过在丰富视觉属性上灵活组合六种推理逻辑(如链式、顺序、非等),强调组合性推理。
  • 通过引入包含多个与目标对象具有相似视觉属性的干扰图像的新测试设置,减少数据集偏差,从而最小化无需推理的对齐带来的性能提升。
  • 评估现有最先进模型在该新基准上的鲁棒性,并识别当前推理能力的差距。
  • 提出并验证一种模块化难例挖掘策略,尽管仍存在显著提升空间,但该策略能有效提升 Cops-Ref 任务上的性能。

提出的方法

  • 设计一种新颖的表达引擎,将六种推理逻辑——'与'、'或'、'顺序'、'相同'、'非' 和 '链式'——与视觉属性(如物体类别、位置、属性、交互)结合,生成高度组合性的指代表达。
  • 使用来自 GQA 的真实世界图像构建 Cops-Ref 数据集,确保视觉真实感与语义丰富性,同时在数据集中融入多样化的干扰图像,其物体类别与属性与目标对象相似。
  • 实施一种新的测试设置,要求模型从包含目标图像与多个干扰图像的图像集合中选择正确图像,每个干扰图像与目标在视觉相似度上存在不同程度的相似性。
  • 采用两阶段流程:首先使用检索模型(SCAN-t2i)检索候选图像,然后使用 MattNet 在检索到的图像中进行定位。
  • 提出一种模块化难例挖掘策略,基于模块化表达特征的相似性识别并优先处理难负样本,从而提升模型在复杂干扰项上的泛化能力。
  • 通过消融研究比较不同难负样本挖掘策略,包括随机、类别感知、基于句子相似度以及模块特定的方法,以评估其有效性。

实验结果

研究问题

  • RQ1现有最先进指代表达理解模型能否泛化到强调组合性推理与复杂干扰结构的新基准?
  • RQ2与更复杂的逻辑形式(如'链式'或'与')相比,'顺序'与'非'等推理逻辑在多大程度上提升了模型性能?
  • RQ3表达长度如何影响模型性能?是否存在一个在信息丰富度与推理复杂度之间达到平衡的最优长度?
  • RQ4模块化难例挖掘策略是否能有效提升在 Cops-Ref 这类干扰丰富、推理密集型基准上的模型性能?
  • RQ5包含相似干扰图像如何影响基于推理与无需推理模型之间的性能差距?

主要发现

  • 采用所提模块化难例挖掘策略的最佳模型在 Full 情况下仅达到 33.8% 的准确率,表明视觉推理能力仍有巨大提升空间。
  • 使用 '顺序' 与 '非' 推理形式的表达分别达到最高准确率(84.5% 与 82.3%),可能因其推理树结构更简单,且具备精确的空间或排除逻辑。
  • 中等长度表达(10–20 个词)表现最佳,表明其在提供足够信息与避免过度复杂性导致模型过载之间达到了良好平衡。
  • 模块特定的难例挖掘策略优于所有其他策略,尤其在 Cat&attr 与 Cat&cat 干扰设置下表现突出,证明其在识别语义相似负样本方面的有效性。
  • 随机与句子相似度挖掘策略仅带来微弱的性能提升,表明基于朴素或全局特征的采样方法不足以应对复杂干扰结构。
  • 即使最佳模型在 Full 情况下也未突破 35% 的准确率,揭示当前模型对 Cops-Ref 中引入的组合性推理与干扰复杂性仍缺乏鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。