[论文解读] Toward Explainable and Fine-Grained 3D Grounding through Referring Textual Phrases
本文提出3D短语感知定位(3DPAG),一种细粒度的3D视觉定位任务,可定位自然语言描述中提及的目标与非目标物体。通过提出短语-物体对齐优化与短语特定预训练方法,并发布一个包含约22.7万条短语级标注的新数据集,该方法在标准基准上将最先进3D视觉定位性能提升了3.9%至4.6%。
Recent progress in 3D scene understanding has explored visual grounding (3DVG) to localize a target object through a language description. However, existing methods only consider the dependency between the entire sentence and the target object, ignoring fine-grained relationships between contexts and non-target ones. In this paper, we extend 3DVG to a more fine-grained and interpretable task, called 3D Phrase Aware Grounding (3DPAG). The 3DPAG task aims to localize the target objects in a 3D scene by explicitly identifying all phrase-related objects and then conducting the reasoning according to contextual phrases. To tackle this problem, we manually labeled about 227K phrase-level annotations using a self-developed platform, from 88K sentences of widely used 3DVG datasets, i.e., Nr3D, Sr3D and ScanRefer. By tapping on our datasets, we can extend previous 3DVG methods to the fine-grained phrase-aware scenario. It is achieved through the proposed novel phrase-object alignment optimization and phrase-specific pre-training, boosting conventional 3DVG performance as well. Extensive results confirm significant improvements, i.e., previous state-of-the-art method achieves 3.9%, 3.5% and 4.6% overall accuracy gains on Nr3D, Sr3D and ScanRefer respectively.
研究动机与目标
- 解决现有3D视觉定位(3DVG)方法仅关注目标物体而忽略与非目标物体之间细粒度关系的局限性。
- 通过显式定位3D场景中所有被短语引用的物体,实现更可解释、可解释的3D定位。
- 构建一个新基准,涵盖来自Nr3D、Sr3D和ScanRefer的8.8万条句子中约22.7万条人工标注的短语级引用。
- 提出即插即用的技术——短语-物体对齐优化与短语特定预训练,以增强现有3DVG模型在3DPAG任务上的表现。
- 证明3DPAG在多个标准数据集上显著提升3DVG性能。
提出的方法
- 对现有3DVG数据集(Nr3D、Sr3D、ScanRefer)中的8.8万条句子进行约22.7万条短语级引用的标注,创建三个新数据集:Sr3D++、Nr3D++和ScanRefer++。
- 提出一种新颖的短语-物体对齐(POA)图优化技术,通过优化交叉注意力特征,使语言短语与对应3D物体更好地对齐。
- 设计一种短语特定的预训练策略,通过使用合成掩码在训练过程中交替将目标物体与其他短语引用物体进行替换。
- 通过集成POA优化与短语特定预训练,将现有3DVG模型(如SAT、MVT)适配为可执行3DPAG的模型。
- 通过使用基于规则的短语检测与仅目标物体标注进行弱监督3DPAG训练,同时在完整短语标注上进行评估。
- 使用标准指标(如$Acc_{ ext{VG}}$与$Acc_{ ext{PG}}$)在3DVG与3DPAG任务上评估性能。
实验结果
研究问题
- RQ1细粒度3D视觉定位(即定位所有被短语引用的物体,而不仅目标物体)是否能带来更准确、更具可解释性的3D场景理解?
- RQ2短语特定预训练在提升模型对3D定位中非目标物体泛化能力方面有多有效?
- RQ3优化短语-物体对齐图在复杂3D场景中的定位准确率提升程度如何?
- RQ4仅使用现有3DVG标注中的弱监督信号,能否有效将现有3DVG模型适配至3DPAG任务?
- RQ5显式建模短语-物体关系是否能在标准3DVG基准上带来可测量的性能提升?
主要发现
- 所提出的3DPAG任务显著提升了3DVG性能,最先进方法MVT在Nr3D上达到59.0%的准确率,较基线提升3.9%。
- 在Sr3D上,同一方法达到68.0%的准确率,较之前最先进方法提升3.5%;在ScanRefer上达到59.9%的准确率,提升4.6%。
- 消融研究证实,短语特定预训练与POA优化均对性能提升有贡献,完整模型在Nr3D上相较基线分别提升5.2%(SAT)与3.9%(MVT)。
- 弱监督3DPAG设置(训练时仅使用目标物体标注)仍取得有意义的性能表现(如在ScanRefer++上达到43.6%),表明所提组件具有强鲁棒性。
- 增强所提组件后的BUTD-DETR模型在ScanRefer++上的$Acc_{PG}@0.5$从22.6%提升至32.3%,证实显式短语-物体监督的必要性。
- 可视化结果表明,3DPAG可为每个短语生成细粒度、颜色对齐的预测,为模型决策提供内在可解释性与可解释性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。