Skip to main content
QUICK REVIEW

[论文解读] LanguageRefer: Spatial-Language Model for 3D Visual Grounding

Junha Roh, Karthik Desingh|arXiv (Cornell University)|Jul 7, 2021
Multimodal Machine Learning Applications参考文献 43被引用 22
一句话总结

LanguageRefer 提出了一种基于 Transformer 的空间-语言模型,用于 3D 视觉定位,通过融合来自 3D 边界框的空间嵌入与微调后的 DistilBERT 嵌入,识别嘈杂 3D 场景中的被指代对象。该模型通过将空间推理与感知噪声解耦,在 ReferIt3D 上实现了最先进性能,Nr3D 上达到 48.2% 的准确率,且在使用校正后的视角标注时,视图相关语句的准确率提升了 12.7%。

ABSTRACT

For robots to understand human instructions and perform meaningful tasks in the near future, it is important to develop learned models that comprehend referential language to identify common objects in real-world 3D scenes. In this paper, we introduce a spatial-language model for a 3D visual grounding problem. Specifically, given a reconstructed 3D scene in the form of point clouds with 3D bounding boxes of potential object candidates, and a language utterance referring to a target object in the scene, our model successfully identifies the target object from a set of potential candidates. Specifically, LanguageRefer uses a transformer-based architecture that combines spatial embedding from bounding boxes with fine-tuned language embeddings from DistilBert to predict the target object. We show that it performs competitively on visio-linguistic datasets proposed by ReferIt3D. Further, we analyze its spatial reasoning task performance decoupled from perception noise, the accuracy of view-dependent utterances, and viewpoint annotations for potential robotics applications.

研究动机与目标

  • 开发一种模块化、端到端的空间-语言模型,通过将空间推理与感知噪声解耦,提升 3D 视觉定位性能。
  • 研究视角模糊性在视图相关语句中对 3D 视觉定位模型性能的影响。
  • 通过引入校正后的视角标注,提升模型的鲁棒性与可解释性,以应对视图相关语句。
  • 评估模型在不同数据集上的泛化能力及其在涉及指代语言的机器人应用中的潜力。
  • 分析各个损失组件的贡献以及类别标签质量对模型准确率的影响。

提出的方法

  • 该模型采用基于 Transformer 的架构,联合编码语言语句与来自物体边界框的 3D 空间信息。
  • 空间嵌入通过位置编码从 3D 边界框坐标中提取,以表示空间关系。
  • 语言嵌入来自微调后的 DistilBERT,用于处理目标物体的自然语言描述。
  • 空间-语言模型通过关注基于多模态嵌入的最相关候选物体,预测目标物体。
  • 采用模块化流程,将感知(物体类别标签)、空间嵌入、语言嵌入与空间-语言推理模块分离,以提升灵活性与可解释性。
  • 作者通过收集人工验证的朝向信息,引入了校正后的视角标注,实现场景对齐在训练与推理阶段的一致性。

实验结果

研究问题

  • RQ1将空间推理与感知噪声解耦对 3D 视觉定位性能有何影响?
  • RQ2视图相关语句中的视角模糊性在多大程度上降低了模型准确率?是否可以缓解?
  • RQ3在真实 3D 场景中,使用真实类别标签与噪声预测标签时,模型的有效性如何?
  • RQ4不同损失组件(分类、掩码、文本)对模型性能与泛化能力有何影响?
  • RQ5模型是否能泛化到不同数据集,并支持涉及指代语言指令的机器人应用?

主要发现

  • LanguageRefer 在 Nr3D 基准上达到 48.2% 的准确率,优于无需额外训练数据的最先进模型。
  • 使用校正后的视角标注时,模型在视图相关语句上的准确率提升了 12.7%,表明一致的空间对齐带来了显著性能增益。
  • 在 Sr3D 数据集上,使用预测类别标签时,模型达到 40.6% 的准确率,表明其对基于模板的合成语言具有鲁棒性。
  • 消融实验表明,分类损失提升了性能,而文本损失降低了准确率,因此最终模型中去除了文本损失项。
  • 使用校正朝向训练的模型泛化能力良好,在整体测试集上达到 50.7% 的准确率,较无校正的基线模型提升 5.1%。
  • 模型在视图无关语句上保持了高性能(准确率为 46.4%),表明其对视角无关指代具有强大的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。