[论文解读] Comprehensive Visual Question Answering on Point Clouds through Compositional Scene Manipulation
本论文提出了 CLEVR3D,一个大规模的 VQA-3D 数据集,包含 171,000 个问题,覆盖 8,771 个真实与增强的 3D 场景,通过基于 3D 场景图的问题生成引擎和组合式场景操作实现,以支持脱离常识的推理。所提出的 TransVQA3D 框架联合学习 VQA-3D 与场景图生成,通过引入跨模态注意力和场景图感知监督,实现了最先进性能。
Visual Question Answering on 3D Point Cloud (VQA-3D) is an emerging yet challenging field that aims at answering various types of textual questions given an entire point cloud scene. To tackle this problem, we propose the CLEVR3D, a large-scale VQA-3D dataset consisting of 171K questions from 8,771 3D scenes. Specifically, we develop a question engine leveraging 3D scene graph structures to generate diverse reasoning questions, covering the questions of objects' attributes (i.e., size, color, and material) and their spatial relationships. Through such a manner, we initially generated 44K questions from 1,333 real-world scenes. Moreover, a more challenging setup is proposed to remove the confounding bias and adjust the context from a common-sense layout. Such a setup requires the network to achieve comprehensive visual understanding when the 3D scene is different from the general co-occurrence context (e.g., chairs always exist with tables). To this end, we further introduce the compositional scene manipulation strategy and generate 127K questions from 7,438 augmented 3D scenes, which can improve VQA-3D models for real-world comprehension. Built upon the proposed dataset, we baseline several VQA-3D models, where experimental results verify that the CLEVR3D can significantly boost other 3D scene understanding tasks. Our code and dataset will be made publicly available at https://github.com/yanx27/CLEVR3D.
研究动机与目标
- 为解决缺乏大规模、多样化且无偏见的 3D VQA 数据集的问题,这些数据集可支持超越物体识别的复杂推理。
- 通过组合式场景操作引入脱离常识的设置,减轻 VQA-3D 模型对虚假相关性的依赖。
- 通过生成关于物体属性、空间关系以及计数和比较等推理类型的提问,实现全面的视觉理解。
- 开发一个统一框架,联合优化 VQA-3D 与 3D 场景图生成,以提升推理能力与鲁棒性。
- 提供一个基准,以增强在多个下游任务中对 3D 场景的理解。
提出的方法
- 基于 3D 语义场景图设计问题生成引擎,从 1,333 个真实 3D 场景中生成 44,000 个多样化推理问题,涵盖属性(颜色、大小、材质)和空间关系。
- 引入组合式场景操作(CSM),通过重新分配物体关系与属性来改变场景图,从 7,438 个增强场景中生成 127,000 个问题,以消除常识先验。
- TransVQA3D 框架采用跨模态 Transformer(CMT)将点云特征与文本问题对齐,并利用场景图注意力适配器(SGAA)注入显式关系监督。
- 模型联合优化 VQA-3D 与 3D 场景图生成,采用独立的头分支进行物体分类与谓词预测,使用 top-k 召回率与准确率作为评估指标。
- SGAA 模块结合双注意力(TA)实现节点级注意力与跨模态注意力(CMA),以增强视觉与语言模态之间的特征交互。
- 在 CMT 中应用位置编码以保留空间与序列结构,消融实验表明其显著提升性能。
实验结果
研究问题
- RQ1基于 3D 场景图的问题生成引擎能否在真实 3D 场景中生成多样化、强调推理的问题,涵盖属性与空间关系?
- RQ2组合式场景操作在减少 VQA-3D 模型对虚假常识偏见依赖方面的有效性如何?
- RQ3联合学习 VQA-3D 与 3D 场景图生成在多大程度上提升了推理性能与鲁棒性?
- RQ4通过 SGAA 模块实现的显式关系监督对提升 VQA-3D 与场景图预测准确率的贡献是什么?
- RQ5如位置编码与跨模态注意力等架构组件如何影响 CMT 在 3D VQA 中的性能?
主要发现
- CLEVR3D 数据集包含来自 8,771 个场景的 171,000 个问题,其中 44,000 个来自真实场景,127,000 个来自通过组合式操作生成的、脱离常识的增强场景。
- 当仅在 VQA 任务上训练时,TransVQA3D 在 VQA-3D 上达到 39.7% 的总体准确率,加入物体分类监督后提升至 42.7%,通过 SGAA 模块实现完整场景图监督后进一步提升至 44.7%。
- 消融实验表明,移除语言分支会使场景图预测性能下降约 5%,证明 VQA-3D 与场景图推理之间存在相互增强关系。
- 与无位置编码的模型相比,CMT 中使用位置编码可将总体准确率下降减少 3%,类别平均准确率下降减少 6%,证明其在建模跨模态交互中的关键作用。
- SGAA 模块中的双注意力(TA)组件显著提升了 VQA-3D 与场景图预测性能,而跨模态注意力(CMA)主要对 VQA-3D 有 2% 的增益。
- 该模型在场景图分析任务上达到最先进性能,尤其在谓词(关系)预测方面表现突出,top-k 召回率指标有显著提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。