[论文解读] SQA3D: Situated Question Answering in 3D Scenes
SQA3D 引入了一项新的基准,用于评估具身智能体从第一人称视角理解其三维空间情境并回答复杂、需要推理的问题的能力。该基准在 650 个 ScanNet 场景中进行评估,涵盖 6.8k 个独特情境和 33.4k 个问题,最佳模型仅达到 47.20% 的准确率,远低于人类表现(90.06%),凸显了在三维环境中进行情境推理的挑战。
We propose a new task to benchmark scene understanding of embodied agents: Situated Question Answering in 3D Scenes (SQA3D). Given a scene context (e.g., 3D scan), SQA3D requires the tested agent to first understand its situation (position, orientation, etc.) in the 3D scene as described by text, then reason about its surrounding environment and answer a question under that situation. Based upon 650 scenes from ScanNet, we provide a dataset centered around 6.8k unique situations, along with 20.4k descriptions and 33.4k diverse reasoning questions for these situations. These questions examine a wide spectrum of reasoning capabilities for an intelligent agent, ranging from spatial relation comprehension to commonsense understanding, navigation, and multi-hop reasoning. SQA3D imposes a significant challenge to current multi-modal especially 3D reasoning models. We evaluate various state-of-the-art approaches and find that the best one only achieves an overall score of 47.20%, while amateur human participants can reach 90.06%. We believe SQA3D could facilitate future embodied AI research with stronger situation understanding and reasoning capability.
研究动机与目标
- 为解决缺乏评估具身智能体从第一人称视角理解其空间情境并推理其三维环境能力的基准这一问题。
- 探究当前多模态模型在情境推理方面的局限性,特别是三维场景理解与空间定位方面。
- 提供一个大规模、多样化的数据集,以测试广泛的推理能力,包括空间关系、导航、常识推理和多跳推理。
- 识别现有模型在情境理解方面的关键失败模式,并为未来研究提供方向,推动更鲁棒的三维推理架构发展。
提出的方法
- 该任务要求智能体首先根据对情境的自然语言描述,定位其在三维场景中的位置和朝向。
- 该基准使用 ScanNet 的三维扫描作为场景上下文,输入模态包括第一人称视角图像、视频或鸟瞰图(BEV)。
- 情境描述通过 Amazon Mechanical Turk 进行众包,以确保在 650 个场景中位置和朝向的多样性。
- 问题经过精心筛选,以测试超越简单视觉定位的推理能力,包括导航、常识推理和多跳推理,共包含 33.4k 个问题和 6.8k 个独特情境。
- 该数据集支持使用三维扫描、第一人称视频或鸟瞰图(BEV)表示进行评估,兼容各类多模态模型。
- 评估采用零样本设置,模型必须基于描述的情境回答问题,而无需针对特定视角的直接监督。
实验结果
研究问题
- RQ1当前多模态模型在仅凭自然语言描述对三维场景中的智能体位置和朝向进行准确定位方面的能力如何?
- RQ2最先进模型在需要理解空间关系、导航和三维环境中常识推理的任务中的表现如何?
- RQ3在三维场景的情境推理任务中,最佳机器学习模型与人类参与者之间的性能差距有多大?
- RQ4推理流程中的哪些组件——尤其是情境理解与视觉-语言推理——是当前模型的主要瓶颈?
主要发现
- SQA3D 上表现最佳的模型整体准确率仅为 47.20%,表明当前三维推理模型存在显著局限性。
- 普通人类参与者的表现高达 90.06%,揭示了人类与机器在情境推理方面存在巨大差距。
- 在简化设置下,情境理解难度降低后,模型性能有所提升,证实情境定位是主要瓶颈。
- 现有模型的失败模式主要源于情境理解不准确,表明当前的三维表征与定位机制不足以支持鲁棒的第一人称推理。
- 该数据集暴露了多模态模型在泛化到新位置和新场景方面的能力缺陷,尤其是在涉及多步推理或外部知识时。
- 结果表明,改进三维场景表征并增强第一人称视角建模,对推动具身智能的发展至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。