[论文解读] Attention-based Multi-modal Fusion Network for Semantic Scene Completion
该论文提出AMFNet,一种端到端的3D卷积网络,通过多模态注意力机制将2D语义分割特征与深度线索融合,从而提升语义场景补全性能。通过利用2D分割引导和残差注意力模块,AMFNet在SUNCG-RGBD和NYUv2数据集上分别相较之前的方法提升了2.5%和2.6%的mIoU,达到当前最先进水平。
This paper presents an end-to-end 3D convolutional network named attention-based multi-modal fusion network (AMFNet) for the semantic scene completion (SSC) task of inferring the occupancy and semantic labels of a volumetric 3D scene from single-view RGB-D images. Compared with previous methods which use only the semantic features extracted from RGB-D images, the proposed AMFNet learns to perform effective 3D scene completion and semantic segmentation simultaneously via leveraging the experience of inferring 2D semantic segmentation from RGB-D images as well as the reliable depth cues in spatial dimension. It is achieved by employing a multi-modal fusion architecture boosted from 2D semantic segmentation and a 3D semantic completion network empowered by residual attention blocks. We validate our method on both the synthetic SUNCG-RGBD dataset and the real NYUv2 dataset and the results show that our method respectively achieves the gains of 2.5% and 2.6% on the synthetic SUNCG-RGBD dataset and the real NYUv2 dataset against the state-of-the-art method.
研究动机与目标
- 通过将2D语义分割作为监督信号,提升3D语义场景补全(SSC)性能。
- 通过注意力机制聚焦可靠的深度线索,缓解3D场景的稀疏性问题。
- 构建一种多模态融合框架,联合优化3D场景补全与语义标注。
- 证明2D分割经验可有效引导3D补全,尤其在物体边界与小物体上表现更优。
提出的方法
- 设计了一个双分支3D体素网络,其中一支路利用2D语义分割预测结果来引导3D特征学习。
- 应用2D-3D投影,将2D语义标签转换为初始的3D语义特征体素。
- 引入残差注意力模块(RAB),动态强调有意义的体素,抑制空区域的噪声。
- 网络采用多模态融合架构,结合RGB、深度与HHA特征,以提升3D表征能力。
- 3D引导分支将2D分割结果作为空间约束注入,以提升物体边界预测精度。
- 模型采用端到端训练,联合优化交叉熵损失与平均交并比(mIoU)损失。
实验结果
研究问题
- RQ12D语义分割结果能否提升3D语义场景补全的性能?
- RQ2基于注意力的特征精炼在处理稀疏3D体素数据方面有多有效?
- RQ3利用2D分割经验是否能比仅使用RGB-D输入获得更好的3D补全与标注效果?
- RQ4残差注意力模块是否能增强3D补全网络中的特征学习,特别是在小物体或遮挡物体上?
- RQ53D引导分支在提升物体边界精度方面有何贡献?
主要发现
- AMFNet在合成的SUNCG-RGBD数据集上相较最先进方法提升了2.5%的mIoU。
- 在真实的NYUv2数据集上,AMFNet相较当前最先进方法提升了2.6%的mIoU。
- 当在3D引导分支中使用真实2D分割标签时,SUNCG-RGBD上的性能提升达3.8%,NYUv2上达4.3%。
- 与无注意力机制的基线相比,残差注意力模块(RAB)在SUNCG-RGBD上提升mIoU 3.0%,在NYUv2上提升2.9%。
- 消融实验表明,3D引导分支显著提升了边界精度,尤其在床、墙等复杂物体上表现突出。
- 加入RAB的模型能更好地重建小物体(如橱柜上的纸堆),这些物体在无注意力机制时常被忽略。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。