[论文解读] M3DBench: Let's Instruct Large Models with Multi-modal 3D Prompts
M3DBench 引入了一个大规模、多模态的 3D 指令跟随数据集,包含超过 320,000 对指令-响应数据,整合了文本、图像、3D 物体、坐标和视觉提示,以支持面向 3D 核心任务的多模态语言模型(MLMs)的指令微调。该基准测试表明,基于 M3DBench 微调的模型在多种 3D 任务(如视觉感知、推理、导航和规划)中表现出色,基于 Vicuna-7B-v1.5 的模型在详细场景描述和多任务评估中表现尤为突出。
Recently, 3D understanding has become popular to facilitate autonomous agents to perform further decisionmaking. However, existing 3D datasets and methods are often limited to specific tasks. On the other hand, recent progress in Large Language Models (LLMs) and Multimodal Language Models (MLMs) have demonstrated exceptional general language and imagery tasking performance. Therefore, it is interesting to unlock MLM's potential to be 3D generalist for wider tasks. However, current MLMs' research has been less focused on 3D tasks due to a lack of large-scale 3D instruction-following datasets. In this work, we introduce a comprehensive 3D instructionfollowing dataset called M3DBench, which possesses the following characteristics: 1) It supports general multimodal instructions interleaved with text, images, 3D objects, and other visual prompts. 2) It unifies diverse 3D tasks at both region and scene levels, covering a variety of fundamental abilities in real-world 3D environments. 3) It is a large-scale 3D instruction-following dataset with over 320k instruction-response pairs. Furthermore, we establish a new benchmark for assessing the performance of large models in understanding multi-modal 3D prompts. Extensive experiments demonstrate the effectiveness of our dataset and baseline, supporting general 3D-centric tasks, which can inspire future research.
研究动机与目标
- 为解决当前缺乏大规模、多样化的 3D 指令跟随数据集,以支持多模态输入用于训练通用型 3D 敏感多模态语言模型(MLMs)的问题。
- 在单一基准测试中统一并标准化涵盖感知、推理、导航和规划等广泛 3D 核心任务的评估。
- 通过提供一个全面且交错的多模态提示方案(结合文本、3D 物体、图像和空间坐标),实现大模型在 3D 理解任务中的指令微调。
- 建立一个基线模型和评估协议,以实现跨多个任务的公平且可复现的 3D MLM 性能基准测试。
提出的方法
- 设计一个多模态指令跟随数据集,将文本、2D 图像、3D 点云、边界框和基于坐标的提示交错结合,以表示多样化的 3D 视觉任务。
- 在 10 个不同的 3D 任务中收集并标注超过 320,000 对指令-响应数据,包括密集描述、视觉问答、具身问答、多区域推理和具身规划。
- 提出一种新颖的提示方案,将语言指令与多种视觉模态(文本、2D 图像、3D 物体和空间坐标)结合,实现丰富且上下文感知的模型交互。
- 使用统一的训练流程(Adam 优化器和余弦退火学习率衰减)训练并评估多个基线模型,基于 M3DBench 数据集在不同 3D 编码器(如 PointNet++、Transformer)上微调大语言模型。
- 使用标准 NLP 指标(BLEU、ROUGE、METEOR、CiDEr)和基于 GPT-4 的对比评分来评估模型性能,尤其针对详细场景描述任务。
- 建立一个全面的评估基准,包含五个核心任务:密集描述、视觉问答、具身问答、多区域推理和具身规划。
实验结果
研究问题
- RQ1大规模、多模态的 3D 指令跟随数据集能否提升多模态语言模型在多样化 3D 视觉任务中的泛化能力?
- RQ2所提出的交错多模态提示方案(文本、图像、3D 物体、坐标)在 3D 环境中实现精确且上下文感知的指令遵循方面有多高效?
- RQ3在 M3DBench 上微调的最先进 LLM 与它们在标准 3D 基准测试或零样本能力下的表现之间,性能差距有多大?
- RQ4在空间推理和具身规划等不同 3D 核心任务中,哪些模型架构组件(如 3D 编码器、语言解码器)能带来最佳性能?
- RQ5基于 GPT-4 的评估在多大程度上能可靠地评分复杂 3D 场景中模型生成描述的质量?
主要发现
- 基于 Vicuna-7B-v1.5 的模型在详细描述任务中获得了最高的 GPT-4 评分 32.37,优于其他 LLM,展现出强大的 3D 理解能力。
- 使用基于 Transformer 的 3D 编码器的模型在密集描述和具身规划任务中优于基于 PointNet++ 的模型,表明模型架构对性能有显著影响。
- 在 M3DBench 上微调的基线模型在多个任务中达到了最先进水平,包括在视觉问答任务中取得 BLEU-4 得分 27.89,以及在多区域推理任务中取得 CiDEr 得分 29.08。
- 所有基于 OPT-6.7B 解码器的模型在所有任务中表现相对较低,表明模型架构和预训练数据对 3D 指令跟随能力有显著影响。
- M3DBench 基准测试揭示,当前模型在复杂 3D 任务(如详细场景描述和多轮对话)中仍存在困难,表明在 3D 敏感指令微调方面仍有改进空间。
- 所提出的多模态提示方案能有效支持多样化的 3D 任务,模型能成功理解并响应涉及空间坐标、3D 物体实例和图像引用的指令。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。