[论文解读] SpatialSense: An Adversarially Crowdsourced Benchmark for Spatial Relation Recognition
SpatialSense 引入了一种新颖的对抗性众包基准,用于空间关系识别,通过聚焦于具有挑战性的长尾关系,减少了对简单视觉和语言先验的偏差。该数据集包含 17,498 个空间关系,分布在 11,569 幅图像中,正负样本均衡,揭示了当前最先进模型表现不佳,表明其依赖于表面线索而非真正的空间推理。
Understanding the spatial relations between objects in images is a surprisingly challenging task. A chair may be "behind" a person even if it appears to the left of the person in the image (depending on which way the person is facing). Two students that appear close to each other in the image may not in fact be "next to" each other if there is a third student between them. We introduce SpatialSense, a dataset specializing in spatial relation recognition which captures a broad spectrum of such challenges, allowing for proper benchmarking of computer vision techniques. SpatialSense is constructed through adversarial crowdsourcing, in which human annotators are tasked with finding spatial relations that are difficult to predict using simple cues such as 2D spatial configuration or language priors. Adversarial crowdsourcing significantly reduces dataset bias and samples more interesting relations in the long tail compared to existing datasets. On SpatialSense, state-of-the-art recognition models perform comparably to simple baselines, suggesting that they rely on straightforward cues instead of fully reasoning about this complex task. The SpatialSense benchmark provides a path forward to advancing the spatial reasoning capabilities of computer vision systems. The dataset and code are available at https://github.com/princeton-vl/SpatialSense.
研究动机与目标
- 解决缺乏严格基准以避免语言和视觉先验的空间关系识别问题。
- 通过使用对抗性众包减少数据集偏差,其中标注者被要求找出模糊或具有误导性的样本。
- 创建一个正负样本均衡、长尾分布的数据集,以更好地评估模型的推理能力。
- 通过提供物体名称和边界框作为输入,将目标检测与空间关系识别解耦。
- 提供一个基准,以暴露当前模型在理解复杂空间构型方面的能力局限,超越二维布局和语言模式。
提出的方法
- 对抗性众包:人类标注者被明确要求识别那些仅凭二维布局或语言先验难以预测的空间关系。
- 每个关系被标注为正例或负例,确保正负类别的分布为 50/50,以防止模型对多数类别的偏差。
- 该任务被表述为二分类问题:给定两个带有名称和边界框的物体,预测特定空间关系是否成立。
- 使用一组预定义的 9 个空间谓词(例如 'on'、'under'、'in front of')以标准化标注并减少歧义。
- 提供目标定位和名称作为输入,将空间关系识别与目标检测解耦。
- 模型在罕见目标类别上的泛化能力得到评估,其中 3,679 个目标类别中有 2,139 个仅出现一次。
实验结果
研究问题
- RQ1对抗性众包能否有效减少空间关系识别数据集中偏差?
- RQ2当前最先进模型在多大程度上依赖于简单的视觉或语言线索,而非真正的空间推理?
- RQ3目标类别的长尾分布在多大程度上影响模型在空间关系识别中的泛化能力?
- RQ4数据集中正负样本的均衡划分是否能带来更可靠的模型性能评估?
- RQ5一个经过精心策划的对抗性样本基准是否能更好地暴露当前视觉模型在空间理解方面的局限性?
主要发现
- 最先进模型在 SpatialSense 上的表现与简单基线模型相当,表明其依赖于表面线索而非深层空间推理。
- 该数据集包含 17,498 个关系,分布在 11,569 幅图像中,包含 3,679 个唯一物体类别,其中 2,139 个仅出现一次,呈现出强烈的长尾分布特征。
- 对抗性众包成功减少了语言偏差——与 Visual Genome 等数据集不同,后者中‘on’关系占主导地位(表相关关系达 89.37%)。
- 该基准揭示了模型在细微空间推理任务上的失败,例如在三维构型下,尽管物体在视觉上位于右侧,却仍难以判断其是否位于另一物体前方。
- 采用正负样本均衡的二分类设定,相比以往工作中使用的 Recall@K 指标,能带来更可靠的评估结果。
- 在 SpatialSense 上训练的模型相较于以往基准,性能出现显著下降,凸显了该数据集的挑战性与有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。