[论文解读] Fully Sparse 3D Occupancy Prediction
该论文提出 SparseOcc,一种完全稀疏的全景 3D 占位预测模型,通过稀疏体素解码器和稀疏实例查询,利用几何与实例稀疏性,在 25.4 FPS 下实现 26.0 mIoU 的性能(Occ3D-nus 数据集),通过 8 帧时序建模进一步提升至 30.9 mIoU,以无额外技巧的配置创下速度与精度的新 SOTA。
Occupancy prediction plays a pivotal role in autonomous driving. Previous methods typically construct dense 3D volumes, neglecting the inherent sparsity of the scene and suffering from high computational costs. To bridge the gap, we introduce a novel fully sparse occupancy network, termed SparseOcc. SparseOcc initially reconstructs a sparse 3D representation from camera-only inputs and subsequently predicts semantic/instance occupancy from the 3D sparse representation by sparse queries. A mask-guided sparse sampling is designed to enable sparse queries to interact with 2D features in a fully sparse manner, thereby circumventing costly dense features or global attention. Additionally, we design a thoughtful ray-based evaluation metric, namely RayIoU, to solve the inconsistency penalty along the depth axis raised in traditional voxel-level mIoU criteria. SparseOcc demonstrates its effectiveness by achieving a RayIoU of 34.0, while maintaining a real-time inference speed of 17.3 FPS, with 7 history frames inputs. By incorporating more preceding frames to 15, SparseOcc continuously improves its performance to 35.1 RayIoU without bells and whistles.
研究动机与目标
- 通过利用场景稀疏性,解决自动驾驶中密集 3D 占位预测的高计算成本问题。
- 将语义级与实例级占位预测统一于单一全景框架中,实现实例感知的 3D 占位预测。
- 消除密集 3D 特征与全局注意力机制,实现完全稀疏的架构设计。
- 建立首个以视觉为中心的全景占位基准,采用 PQ 指标以实现公平评估。
- 在 Occ3D-nus 数据集上,同时实现准确率与推理速度的 SOTA 表现。
提出的方法
- 提出一种稀疏体素解码器,仅重建 3D 场景中的非空(占用)区域,通过避免构建密集 3D 特征,显著降低计算成本。
- 引入稀疏实例查询,通过掩码引导的稀疏采样与 2D 特征交互,避免在掩码 Transformer 中使用昂贵的密集交叉注意力。
- 采用带有稀疏查询的掩码 Transformer,联合预测实例掩码与类别标签,实现端到端的全景占位预测。
- 使用掩码引导的稀疏采样,仅高效关注相关 2D 特征,保持稀疏性的同时实现 3D 查询与 2D 特征之间的有效交互。
- 通过在稀疏体素解码器与掩码 Transformer 中融合过去 8 帧的特征,引入时序建模,提升场景补全与预测精度。
- 基于 Occ3D-nus 建立新的以视觉为中心的全景占位基准,采用全景质量(PQ)与 mIoU 作为评估指标。
实验结果
研究问题
- RQ1完全稀疏的架构是否能在保持实时推理的同时实现高精度的 3D 全景占位预测?
- RQ2在无密集 3D 特征的情况下,基于稀疏实例查询的预测方法在建模物体级稀疏性方面有多有效?
- RQ3时序建模在稀疏 3D 占位预测中的性能提升程度如何?
- RQ4以视觉为中心的基准结合 PQ 指标,是否能比现有仅语义的基准更有效地评估全景占位任务?
- RQ5与密集方法或稀疏到密集方法相比,稀疏体素解码与掩码引导采样在准确率与效率方面的设计表现如何?
主要发现
- SparseOcc 在 Occ3D-nus 数据集上实现 26.0 mIoU 的性能,推理速度达 25.4 FPS,展现出高效率与高精度。
- 通过 8 帧的时序建模,SparseOcc 进一步提升至 30.9 mIoU,实现无数据增强或架构花哨技巧的 SOTA 性能。
- 消融实验表明,稀疏体素解码器与掩码 Transformer 均从时序融合中受益,其中解码器贡献更显著(禁用后 mIoU 下降 3.5)。
- 当实例查询数量超过 100 后,性能不再提升,表明 100 个查询已足够满足任务需求。
- 在损失函数中平衡类别权重后,mRecall 从 24.2 提升至 74.9,表明有限的体素标记可有效覆盖场景。
- 模型对累积 LiDAR 点云中不可靠的真值保持鲁棒,但此问题仍为局限,因可能存在场景补全错误。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。