[论文解读] Bridging Stereo Geometry and BEV Representation with Reliable Mutual Interaction for Semantic Scene Completion
本文提出 BRGScene,一种新颖的基于摄像头的 3D 语义场景补全框架,通过统一的占用率基础架构,将立体几何与鸟瞰图(BEV)表征相连接。它引入了互惠交互集成(MIE)模块,包含双向可靠交互与双体积集成模块,以实现细粒度、置信度感知的特征融合,在 SemanticKITTI 上实现了 SOTA 性能,mIoU 达到 15.43%,显著优于以往仅使用摄像头的方法。
3D semantic scene completion (SSC) is an ill-posed perception task that requires inferring a dense 3D scene from limited observations. Previous camera-based methods struggle to predict accurate semantic scenes due to inherent geometric ambiguity and incomplete observations. In this paper, we resort to stereo matching technique and bird's-eye-view (BEV) representation learning to address such issues in SSC. Complementary to each other, stereo matching mitigates geometric ambiguity with epipolar constraint while BEV representation enhances the hallucination ability for invisible regions with global semantic context. However, due to the inherent representation gap between stereo geometry and BEV features, it is non-trivial to bridge them for dense prediction task of SSC. Therefore, we further develop a unified occupancy-based framework dubbed BRGScene, which effectively bridges these two representations with dense 3D volumes for reliable semantic scene completion. Specifically, we design a novel Mutual Interactive Ensemble (MIE) block for pixel-level reliable aggregation of stereo geometry and BEV features. Within the MIE block, a Bi-directional Reliable Interaction (BRI) module, enhanced with confidence re-weighting, is employed to encourage fine-grained interaction through mutual guidance. Besides, a Dual Volume Ensemble (DVE) module is introduced to facilitate complementary aggregation through channel-wise recalibration and multi-group voting. Our method outperforms all published camera-based methods on SemanticKITTI for semantic scene completion. Our code is available on https://github.com/Arlo0o/StereoScene.
研究动机与目标
- 通过利用立体匹配与 BEV 表征,解决基于摄像头的 3D 语义场景补全(SSC)中固有的几何模糊性与观测不完整问题。
- 弥合立体几何与 BEV 特征之间的表征差距,实现在密集 3D 场景补全中的像素级可靠预测。
- 通过立体与 BEV 特征的互补融合,提升几何精度与不可见区域的语义幻觉能力。
- 开发一个统一框架,将立体体积与 BEV 体积集成,实现可靠、相互作用的特征交互,以提升 3D 感知性能。
提出的方法
- 提出 BRGScene,一种统一的占用率基础框架,融合密集 3D 立体体积与 BEV 特征,用于语义场景补全。
- 引入互惠交互集成(MIE)模块,通过双向引导实现在立体与 BEV 表征之间的像素级特征交互。
- 采用双向可靠交互(BRI)模块,并引入置信度重加权,以提升特征对齐效果并减少特征聚合中的噪声。
- 引入双体积集成(DVE)模块,结合通道重校准与多组投票机制,促进立体与 BEV 特征的互补聚合。
- 使用 GwcNet 进行立体匹配,生成密集 3D 体积,并利用 BEV 表征学习增强全局语义上下文。
- 在 SemanticKITTI 数据集上端到端训练模型,采用交叉熵损失进行语义分割,以及基于 IoU 的监督进行 3D 几何建模。

实验结果
研究问题
- RQ1如何在统一框架中有效连接立体几何与 BEV 表征,以实现 3D 语义场景补全?
- RQ2立体与 BEV 特征之间的互惠、置信度感知特征交互对场景补全精度有何影响?
- RQ3与单模态输入相比,双体积融合(立体 + BEV)在几何与语义性能方面提升了多少?
- RQ4所提出的 MIE 与 DVE 模块是否能在复杂真实场景中超越简单的拼接或单向融合?
- RQ5该框架是否可泛化至 SSC 之外的其他 3D 感知任务,如 3D 目标检测?
主要发现
- BRGScene 在 SemanticKITTI 验证集上实现了 15.43% 的 mIoU,相较于之前 SOTA 的仅摄像头方法 VoxFormer-T,相对提升了 14.5%。
- 双体积集成(DVE)模块贡献显著,相比简单拼接,mIoU 提升 2.06%,IoU 提升 3.24%。
- 仅使用双向可靠交互(BRI)模块,mIoU 提升 2.11%,IoU 提升 3.36%,证明了相互引导的价值。
- 添加立体体积使 IoU 提升 3.51,mIoU 提升 1.57;而 BEV 体积使 IoU 提升 2.47,mIoU 提升 1.14,证实两种模态具有互补作用。
- 定性结果表明,BRGScene 在遮挡区域或远距离区域(如十字路口、阴影区域)生成了更精确的几何结构与更优的幻觉效果。
- 在 nuScenes 上的初步 BEV 检测结果表明,BRGScene 可适配至 3D 目标检测任务,表明其在 SSC 之外具有更广泛的应用潜力。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。