[论文解读] <b>D</b>ataset for <b>O</b>pen <b>V</b>ocabulary <b>E</b>ntity <b>G</b>rounding (DOVE-G)
本文提出开放词汇3D场景图(OVSG),一种新颖的框架,用于在3D环境中使用自由形式文本查询进行上下文感知的实体定位。通过结合开放词汇检测与编码空间关系和属性的3D场景图,OVSG在处理未见类别和复杂查询方面优于先前方法,尤其在ScanNet、ICL-NUIM以及包含4,000个查询的新型DOVE-G数据集上得到验证,涵盖八个场景。
<b>DOVE-G</b>To accommodate the richness of open-vocabulary queries, we introduced a custom dataset—DOVE-G (Dataset for Open-Vocabulary Entity Grounding). This dataset has 8 scenes namely kitchen, kitchenette, room1, room2, room3, bathroom, computer lab, and hallway. This dataset is created to facilitate users to query for objects within a scene using natural language. For each scene within DOVE-G, we manually labeled the ground truth and created 50 natural language queries (<i>L</i><sub><em>q</em></sub> ). To augment this query set, we harnessed LLMs to generate four additional sets of natural language queries. This approach yielded a total of 250 queries for each scene, and cumulatively, we have 4000 queries to evaluate OVSG’s performance. With this setup, we set out to assess how our OVSG framework performs with open-vocabulary queries, one of our key research questions, providing a critical testbed for its effectiveness in handling diverse natural language expressions.
研究动机与目标
- 解决在语义类别、属性或关系未见或未预定义时,对3D场景中实体进行定位的挑战。
- 通过自由形式的自然语言查询(如“拿起厨房桌上的杯子”或“前往有人坐着的沙发”)实现上下文感知的实体定位。
- 通过支持超越固定词汇表的开放词汇查询,开发一种可扩展且实用的系统,用于真实世界中的机器人导航与操作。
- 创建一个新的基准数据集DOVE-G,包含4,000个多样化、富含上下文的查询,覆盖八个真实世界室内场景,以支持开放词汇定位的评估。
- 通过在复杂动态环境中进行机器人导航与操作实验,证明该框架在真实世界中的适用性。
提出的方法
- 构建开放词汇3D场景图(OVSG),将实体(物体、智能体、区域)表示为节点,空间/语义关系表示为边,并包含颜色、材质和可操作性等属性。
- 集成开放词汇视觉-语言模型(如基于CLIP的Detic和OVIR-3D),实现对3D物体实例的检测与嵌入,具备对未见类别的零样本泛化能力。
- 使用3D全局数据关联将2D检测结果(来自OVIR-3D)融合到3D场景中,为每个实例分配唯一特征和空间上下文。
- 将查询表示为自然语言输入,并使用视觉-语言编码器对查询进行编码,使其与场景图的节点和边对齐。
- 通过计算查询嵌入与场景图之间的交叉注意力,基于相似度得分选择最相关的实体,完成定位。
- 采用多尺度推理策略(OVSG-J、OVSG-S、OVSG-L)在速度与精度之间取得平衡,其中OVSG-L使用完整的特征融合与上下文推理。

实验结果
研究问题
- RQ13D场景图表示能否支持对包含未见类别和复杂空间关系的自由形式、开放词汇查询的上下文感知实体定位?
- RQ2将开放词汇检测与3D场景图结合,相较于最先进基于语义的定位方法,能否显著提升定位准确率?
- RQ3所提出的框架在未见物体类别和训练数据中未出现的新关系方面,其泛化能力达到何种程度?
- RQ4该系统在需要对模糊或依赖上下文的查询进行精确定位的真实世界机器人导航与操作任务中,效果如何?
- RQ5在多样化的3D环境和不同IoU阈值下,OVSG相较于基线方法(如ConceptFusion和OVIR-3D)的性能提升有多大?
主要发现
- 在office_room_traj0_frei_png场景(29个查询)中,OVSG-L在IoU > 0.15时实现了100%的3D定位成功率,显著优于ConceptFusion(0%)和OVIR-3D(65.52%)。
- 在living_room_traj3_frei_png场景(17个查询)中,OVSG-L在IoU > 0.15时达到82.36%的成功率,在IoU > 0.25时达到64.71%,而ConceptFusion完全失败(0%成功率)。
- OVSG-L在office_room_traj0_frei_png和office_room_traj1_frei_png的所有场景中,IoU > 0.15时均实现100%的成功率,证明其在复杂室内环境中的鲁棒性。
- DOVE-G数据集包含4,000个查询,覆盖八个独特室内场景,每个场景包含50个多样化、富含上下文的查询,涵盖复杂的空间与关系描述。
- 在ICL-NUIM数据集的“仅物体”和“完整查询”类别中,OVSG-L在所有IoU阈值(0.15、0.25、0.5、0.75)下均优于OVIR-3D和ConceptFusion,尤其在处理完整句子查询方面表现更优。
- 定性结果表明,OVSG-L能正确对复杂模糊查询(如“一个在靠近人的桌子上的杯子”)中的实体进行定位,而ConceptFusion常因缺乏上下文建模而失败。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。