Skip to main content
QUICK REVIEW

[论文解读] Symphonize 3D Semantic Scene Completion with Contextual Instance Queries

Haoyi Jiang, Tianheng Cheng|arXiv (Cornell University)|Jun 27, 2023
Advanced Vision and Imaging被引用 5
一句话总结

该论文提出Symphonies,一种新颖的3D语义场景补全(SSC)框架,通过利用上下文实例查询来增强2D到3D的重建与场景建模。通过引入序列实例传播注意力机制以及深度校正体素提议层,Symphonies有效融合了实例语义与全局上下文,在SemanticKITTI上实现了15.04的mIoU最优成绩,在SSCBench-KITTI-360上达到了18.58的mIoU最优成绩。

ABSTRACT

`3D Semantic Scene Completion (SSC) has emerged as a nascent and pivotal undertaking in autonomous driving, aiming to predict voxel occupancy within volumetric scenes. However, prevailing methodologies primarily focus on voxel-wise feature aggregation, while neglecting instance semantics and scene context. In this paper, we present a novel paradigm termed Symphonies (Scene-from-Insts), that delves into the integration of instance queries to orchestrate 2D-to-3D reconstruction and 3D scene modeling. Leveraging our proposed Serial Instance-Propagated Attentions, Symphonies dynamically encodes instance-centric semantics, facilitating intricate interactions between image-based and volumetric domains. Simultaneously, Symphonies enables holistic scene comprehension by capturing context through the efficient fusion of instance queries, alleviating geometric ambiguity such as occlusion and perspective errors through contextual scene reasoning. Experimental results demonstrate that Symphonies achieves state-of-the-art performance on challenging benchmarks SemanticKITTI and SSCBench-KITTI-360, yielding remarkable mIoU scores of 15.04 and 18.58, respectively. These results showcase the paradigm's promising advancements. The code is available at https://github.com/hustvl/Symphonies.

研究动机与目标

  • 解决体素级建模在3D语义场景补全(SSC)中的局限性,这些局限性通常忽略高层实例语义,并因遮挡和透视误差导致几何模糊。
  • 通过将实例中心语义作为动态中介,弥合2D图像特征与3D体素表示之间的差距。
  • 通过融合多个实例查询,增强整体场景理解,实现缓解几何模糊的上下文推理。
  • 开发一种新型架构,促进图像、实例与3D场景表示之间高效、交互式的特征学习。
  • 在具有挑战性的SSC基准上实现最先进性能,同时通过注意力图分析提供可解释性。

提出的方法

  • 提出Symphonies,一种新的3D SSC范式,利用从图像特征中提取的稀疏可学习实例查询来引导3D场景建模。
  • 提出序列实例传播注意力机制,实现在多个阶段中图像特征、实例查询与3D体素特征之间的动态跨注意力交互。
  • 实现深度校正体素提议层,通过将图像特征投影到隐式场景表面来优化初始2D到3D几何结构,提升几何精度。
  • 融合多个实例查询以丰富全局场景上下文,实现对遮挡和透视失真的鲁棒推理。
  • 采用基于Transformer的解码器,通过多模态注意力进行迭代优化,逐步提升体素级别的语义预测。
  • 使用上采样模块将特征升采样至全分辨率,并通过交叉熵损失进行训练,预测每个体素的类别logits。

实验结果

研究问题

  • RQ1实例中心语义是否能通过减少由遮挡和透视误差引起的几何模糊,来改善3D场景补全?
  • RQ2稀疏实例查询在连接2D图像特征与3D体素表示方面是否具有高效性?
  • RQ3融合多个实例查询在增强全局场景上下文和提升整体场景理解方面有多大程度的改善?
  • RQ4基于查询的注意力机制是否能优于传统体素级特征聚合方法在3D SSC任务中的表现?
  • RQ5与标准逆透视映射相比,所提出的深度校正体素提议层在初始几何估计方面有何改进?

主要发现

  • Symphonies在SemanticKITTI验证集上实现了15.04的SOTA mIoU,显著优于以往基于视觉的方法。
  • 在更具挑战性的SSCBench-KITTI-360基准上,Symphonies实现了18.58的mIoU,展现出强大的泛化能力和鲁棒性。
  • 消融实验确认,序列实例传播注意力机制与深度校正体素提议层对性能提升至关重要。
  • 注意力图可视化显示,实例查询能选择性地关注图像与3D场景中语义相关的区域,验证了模型的可解释性与实例感知推理能力。
  • 与MonoScene等基线方法相比,Symphonies生成的预测更加清晰、准确,后者常产生径向形状且模糊的输出。
  • 该方法在稀有和复杂类别(如植被(25.72 mIoU)和围栏(3.90 mIoU))上表现更优,表明其语义泛化能力得到提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。