[论文解读] Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers
本文提出 Chat-3D v2,一种两阶段对齐方法,通过使用对象标识符使大型语言模型(LLMs)能够精确引用和推理三维场景中的多个对象。通过为每个对象学习属性感知和关系感知的标记,该模型建立了稳健的三维-LLM 对齐,在指代和描述任务中实现了最先进性能,且对象引用准确率得到提升。
Recent advancements in 3D Large Language Models (LLMs) have demonstrated promising capabilities for 3D scene understanding. However, previous methods exhibit deficiencies in general referencing and grounding capabilities for intricate scene comprehension. In this paper, we introduce the use of object identifiers and object-centric representations to interact with scenes at the object level. Specifically, we decompose the input 3D scene into a set of object proposals, each assigned a unique identifier token, which enables efficient object referencing and grounding during user-assistant interactions. Given the scarcity of scene-language data, we model the scene embeddings as a sequence of explicit object-level embeddings, derived from semantic-rich 2D or 3D representations. By employing object identifiers, we transform diverse 3D scene-language tasks into a unified question-answering format, facilitating joint training without the need for additional task-specific heads. With minimal fine-tuning on all downstream tasks, our model significantly outperforms existing methods on benchmarks including ScanRefer, Multi3DRefer, Scan2Cap, ScanQA, and SQA3D.
研究动机与目标
- 通过引入对象标识符以实现无歧义的引用,使大型语言模型(LLMs)能够处理三维场景中的多对象查询。
- 解决在 LLM 的嵌入空间中建立三维对象与其标识符之间可靠一一对应关系的挑战。
- 通过学习的关系感知标记,将数十个三维对象之间的复杂空间关系融入 LLM 的推理过程。
- 通过标识符增强的指令微调,提升下游三维场景理解任务(如指代、描述和视觉问答)的性能。
- 使用 GPT-4 创建一个新标注的三维场景描述数据集,其中包含丰富的对象标识符,以支持更优的评估。
提出的方法
- 提出一种两阶段对齐框架:首先为每个对象的视觉和语义特征学习属性感知标记,然后学习关系感知标记以编码与邻近对象的空间关系。
- 为每个三维实例引入唯一的对象标识符(例如 obj13、obj23),通过可靠的三维实例分割模型提取,以实现精确引用。
- 使用关系模块聚合周围对象的空间信息,并将其注入关系感知标记中,增强 LLM 中的空间推理能力。
- 采用两阶段训练策略:首先进行对象级对齐,将三维特征映射到 LLM 嵌入空间,随后进行场景级对齐以优化标记表示。
- 在指令微调数据集上微调模型,将对象标识符作为输入上下文,实现三维环境中灵活且准确的对话。
- 通过使用监督基线模型的预测概率分布来筛选候选对象,再提示标识符感知模型选择最终答案,实现模型集成。

实验结果
研究问题
- RQ1对象标识符是否能显著提升 LLM 在三维场景对话中对象引用的精确度和清晰度?
- RQ2如何在 LLM 的嵌入空间中建立三维对象与其标识符之间可靠的单对单映射?
- RQ3与仅依赖属性感知标记相比,学习到的关系感知标记在多大程度上能增强三维场景中的空间推理能力?
- RQ4所提出的对齐方法是否能在多对象指代和场景描述任务中超越现有三维-LLM 方法?
- RQ5将标识符感知 LLM 与高性能监督基线模型结合,在提升指代准确率方面有多有效?
主要发现
- 所提方法在 Nr3D/Sr3D 指代基准上达到最先进性能,优于缺乏对象标识符支持的先前三维-LLM。
- 在 ScanRefer 和 Nr3D/Sr3D 上,模型表现与监督基线相当,尽管关系模块设计简单,仍展现出强大的场景理解与推理能力。
- 消融实验表明,仅使用对象标识符即可显著提升性能,而属性感知与关系感知标记的结合效果最佳。
- 用平均池化表示替换学习到的关系感知标记后性能明显下降,证明关系模块在捕捉空间结构中的关键作用。
- 与 ViL3DRel 模型集成后,指代准确率提升约 1.0%,表明标识符感知模型能有效优化高置信度候选预测。
- 在三维场景描述任务中,模型生成的描述比 Chat-3D 更全面且更具场景意识,后者往往过度聚焦于孤立的视觉元素。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。