[论文解读] EDA: Explicit Text-Decoupling and Dense Alignment for 3D Visual Grounding
本文提出 EDA,一种新颖的 3D 视觉定位框架,通过显式地将文本解耦为语义成分(如属性、关系和代词),并利用位置和语义对齐损失,在这些成分与 3D 点云对象之间实现密集对齐。该方法在 ScanRefer 和 SR3D/NR3D 上取得最先进性能,在一项新提出的具有挑战性的任务——无对象名称定位中实现绝对领先,展现出超越依赖对象类别之外的鲁棒、细粒度视觉-语言理解能力。
3D visual grounding aims to find the object within point clouds mentioned by free-form natural language descriptions with rich semantic cues. However, existing methods either extract the sentence-level features coupling all words or focus more on object names, which would lose the word-level information or neglect other attributes. To alleviate these issues, we present EDA that Explicitly Decouples the textual attributes in a sentence and conducts Dense Alignment between such fine-grained language and point cloud objects. Specifically, we first propose a text decoupling module to produce textual features for every semantic component. Then, we design two losses to supervise the dense matching between two modalities: position alignment loss and semantic alignment loss. On top of that, we further introduce a new visual grounding task, locating objects without object names, which can thoroughly evaluate the model's dense alignment capacity. Through experiments, we achieve state-of-the-art performance on two widely-adopted 3D visual grounding datasets, ScanRefer and SR3D/NR3D, and obtain absolute leadership on our newly-proposed task. The source code is available at https://github.com/yanmin-wu/EDA.
研究动机与目标
- 为解决现有 3D 视觉定位方法中隐式将所有词语耦合为单一句级特征所导致的不平衡与模糊性问题。
- 通过解耦属性、关系和代词等语言成分,减少对对象名称的归纳偏置。
- 通过显式监督,实现在组件级别上文本与 3D 点云对象之间的细粒度对齐。
- 提出一项新基准任务——无对象名称定位,以严格评估模型的鲁棒性与泛化能力。
- 证明模型仅依赖属性与空间关系即可准确定位对象,而无需依赖类别级别线索。
提出的方法
- 一个文本解耦模块将输入句子解析为不同的语义成分:主对象、属性、关系、代词和辅助对象。
- 引入两种监督损失:位置对齐损失用于将预测的边界框与真实框对齐,语义对齐损失用于在组件级别匹配文本与视觉特征。
- 模型在每个解耦的文本成分与候选 3D 对象之间执行密集匹配,选择总体相似度最高的对象。
- 通过交叉注意力机制与对比学习端到端训练模型,以增强特征对齐。
- 引入一种新的评估协议,将对象名称替换为“object”,以创建类似零样本的挑战性设置。
- 在不重新训练的情况下,对模型在标准 3D VG 基准和新提出的 VG-w/o-ON 任务上进行评估。
实验结果
研究问题
- RQ1显式解耦语言成分是否能通过减少对对象名称的归纳偏置,提升 3D 视觉定位性能?
- RQ2与句级特征融合相比,文本与 3D 对象之间的密集组件级对齐是否能带来更高的定位准确率?
- RQ3当对象名称缺失时,模型是否仍能实现鲁棒定位,仅依赖属性与空间关系?
- RQ4在无对象名称的情况下,不同文本成分(如属性、关系)对定位性能的贡献如何?
- RQ5所提方法在标准基准之外,能否泛化到更具挑战性、更真实的语言描述?
主要发现
- EDA 在 ScanRefer 和 SR3D/NR3D 上均取得最先进性能,IoU 为 0.25 和 0.5 时的准确率分别达到 54.6% 和 42.3%。
- 在新提出的 VG-w/o-ON 任务中,EDA 在 IoU 为 0.25 和 0.5 时的准确率分别达到 26.5% 和 21.2%,较所有基线模型高出超过 10 个百分点。
- 在 VG-w/o-ON 设置下,添加文本成分带来的性能提升更为显著,尤其是空间关系,其提供了强有力的定位线索。
- 消融实验表明,所有解耦组件均对性能有贡献,其中关系组件在无名称设置下影响最大。
- 定性结果表明,EDA 可在不知晓对象名称的情况下正确实现定位,而基线模型如 BUTD-DETR 在此设置下会完全失败。
- 模型在涉及属性与关系的复杂描述上泛化良好,优于基线模型,后者在类似情况下因歧义而表现不佳。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。