Skip to main content
QUICK REVIEW

[论文解读] Efficient Semantic Scene Completion Network with Spatial Group Convolution

Jiahui Zhang, Hao Zhao|arXiv (Cornell University)|Jul 11, 2019
3D Shape Modeling and Analysis参考文献 50被引用 6
一句话总结

本文提出空间组卷积(SGC),一种新颖的方法,通过将3D特征图划分为空间组,实现高效的稀疏卷积,显著降低计算量且仅造成轻微的精度损失。该方法在语义场景补全任务上达到最先进性能,推理速度提升3倍,SUNCG数据集上IoU损失仅为0.7%,采用多尺度、自粗到精的稀疏CNN架构,并实现端到端学习,完成完整的3D场景重建。

ABSTRACT

We introduce Spatial Group Convolution (SGC) for accelerating the computation of 3D dense prediction tasks. SGC is orthogonal to group convolution, which works on spatial dimensions rather than feature channel dimension. It divides input voxels into different groups, then conducts 3D sparse convolution on these separated groups. As only valid voxels are considered when performing convolution, computation can be significantly reduced with a slight loss of accuracy. The proposed operations are validated on semantic scene completion task, which aims to predict a complete 3D volume with semantic labels from a single depth image. With SGC, we further present an efficient 3D sparse convolutional network, which harnesses a multiscale architecture and a coarse-to-fine prediction strategy. Evaluations are conducted on the SUNCG dataset, achieving state-of-the-art performance and fast speed. Code is available at https://github.com/zjhthu/SGC-Release.git

研究动机与目标

  • 为解决3D密集预测网络的高计算成本,特别是针对具有立方体内存和FLOP增长的稀疏3D数据。
  • 利用3D体素数据中的固有稀疏性和冗余性,设计更高效的神经网络架构。
  • 开发一种方法,在不牺牲语义精度的前提下加速3D稀疏卷积,尤其适用于场景补全任务。
  • 实现从单张深度图像端到端学习完整3D场景的几何与语义信息。

提出的方法

  • 提出空间组卷积(SGC),将输入体素划分为空间组,并对每组独立应用稀疏3D卷积,以减少计算量。
  • 采用基于哈希表的稀疏卷积神经网络(SCN)框架,高效处理稀疏3D数据,避免处理空体素。
  • 引入多尺度编码器-解码器架构,结合自粗到精的预测策略,以提升重建质量并处理缺失结构。
  • 设计密集转卷积层和抽象模块,分别用于生成缺失体素和去除冗余体素。
  • 在SGC中采用固定模式划分策略,以学习不规则、模式无关的卷积滤波器,使其适应一致的稀疏性模式。
  • 在SGC后引入特征聚合操作,以恢复组间的信息流动,实现空间分离特征组之间的通信。

实验结果

研究问题

  • RQ1将3D特征在空间上划分为组,是否能在保持语义精度的同时降低3D CNN中的计算量?
  • RQ2在3D密集预测任务中,SGC与标准组卷积相比,在效率和性能方面表现如何?
  • RQ3SGC能否与稀疏卷积神经网络有效结合,以加速语义场景补全?
  • RQ4在SGC中使用固定模式而非随机划分,是否能带来更好的模型泛化能力和性能?
  • RQ5SGC在不完整3D场景中,对结构和语义信息的保留程度如何?

主要发现

  • 与基线稀疏网络相比,SGC将计算量减少了约75%(即3/4),在SUNCG数据集上语义场景补全的IoU仅下降0.7%。
  • 所提出的网络在语义场景补全任务上达到26.7%的SOTA IoU,在NYU数据集上场景补全任务达到56.2%的IoU,分别优于SSCNet 2.0%和1.1%。
  • 固定模式SGC划分方法在SUNCG和NYU基准上均取得更好或相当的结果,且表现一致提升。
  • 可视化结果表明,SGC滤波器的直方图比标准SCN滤波器更尖锐,表明其在组间对稀疏性模式具有学习到的不变性。
  • 在固定模式SGC下,模型学习到不规则的X形卷积核,与特征处理过程中一致的稀疏性模式相匹配。
  • 尽管NYU数据存在标注噪声和配准偏差,SGC仍保持强劲性能,表明其对真实世界数据缺陷具有鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。