[论文解读] Rel3D: A Minimally Contrastive Benchmark for Grounding Spatial Relations in 3D
本文提出了 Rel3D,这是首个大规模、人工标注的 3D 基准数据集,用于定位空间关系,采用最小对比的场景对以减少数据集偏差。实验表明,3D 几何与语义监督可实现高精度的空间关系预测,且最小对比数据能提升模型的鲁棒性与样本效率。
Understanding spatial relations (e.g., "laptop on table") in visual input is important for both humans and robots. Existing datasets are insufficient as they lack large-scale, high-quality 3D ground truth information, which is critical for learning spatial relations. In this paper, we fill this gap by constructing Rel3D: the first large-scale, human-annotated dataset for grounding spatial relations in 3D. Rel3D enables quantifying the effectiveness of 3D information in predicting spatial relations on large-scale human data. Moreover, we propose minimally contrastive data collection -- a novel crowdsourcing method for reducing dataset bias. The 3D scenes in our dataset come in minimally contrastive pairs: two scenes in a pair are almost identical, but a spatial relation holds in one and fails in the other. We empirically validate that minimally contrastive examples can diagnose issues with current relation detection models as well as lead to sample-efficient training. Code and data are available at https://github.com/princeton-vl/Rel3D.
研究动机与目标
- 解决机器人学与视觉领域中缺乏大规模、高质量 3D 数据集用于空间关系定位的问题。
- 通过引入一种新颖的最小对比数据采集方法,减少空间关系识别中的数据集偏差。
- 实现对 3D 几何与语义因素(例如位置、尺度、姿态)如何影响空间关系理解的系统性研究。
- 提供一个基准,用于评估和改进利用丰富 3D 监督的神经网络模型在 3D 空间推理方面的能力。
- 探索从 Rel3D 学习到的 3D 空间理解在 2D 图像空间关系识别中的可迁移性。
提出的方法
- 使用亚马逊 Mechanical Turk 在大规模合成 3D 数据集上进行人工标注空间关系。
- 采用最小对比的场景对——除一个空间关系在其中一个场景中成立而另一个不成立外,其余完全相同——以减少虚假相关性。
- 通过众包方式收集数据:工作人员根据指令在 3D 场景中放置物体,并验证空间关系。
- 提取丰富的 3D 监督信息:每个场景的物体位置、姿态、尺度、深度以及分割掩码。
- 使用 3D 特征在 Rel3D 基准上训练并评估基线模型(例如 VtranE、VipCNN、DRNet、PPFRCN、MLP)。
- 在不同模型和消融实验之间进行性能比较,以分离 3D 监督与对比设计的影响。
实验结果
研究问题
- RQ1与 2D 基线相比,3D 几何与语义监督在多大程度上提升了空间关系定位的性能?
- RQ2最小对比数据采集方法是否能有效减少空间关系识别中的数据集偏差?
- RQ3特定 3D 因素(如物体姿态、尺度、正面对齐)如何影响模型在空间关系上的表现?
- RQ4在最小对比样本上进行训练是否能带来样本效率更高且更鲁棒的模型?
- RQ5从 Rel3D 学习到的 3D 空间理解能否提升在 2D 图像空间关系识别任务上的性能?
主要发现
- 人工标注的 Rel3D 基准在 30 种空间关系上实现了高人类性能(平均准确率 0.946),验证了其质量与复杂性。
- 最小对比数据采集显著减少了模型对虚假线索的依赖,采用此类数据训练的模型表现出更强的泛化能力与更低的偏差。
- 3D 监督带来了显著的性能提升:最佳模型(使用对齐绝对特征的 MLP)在 Rel3D 上达到 0.965 的平均 F1,相较于 2D 基线在某些关系上最高提升达 15%。
- 在最小对比对上训练的模型表现出更高的样本效率,且更不容易利用语言偏差(例如,'on' 比 'under' 更常见)。
- 使用对齐绝对 3D 特征的 MLP 达到了当前最优性能(0.965 平均 F1),表明物体位置的几何对齐对准确的空间推理至关重要。
- 各关系上的人类性能在 0.946 至 0.988 之间,表明该数据集捕捉到了细微的空间语义,包括参照框架依赖性与常识推理。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。