Skip to main content
QUICK REVIEW

[论文解读] Attention-based Multi-modal Fusion Network for Semantic Scene Completion

Siqi Li, Changqing Zou|arXiv (Cornell University)|Mar 31, 2020
Advanced Vision and Imaging参考文献 27被引用 4
一句话总结

该论文提出AMFNet,一种端到端的3D卷积网络,通过多模态注意力机制将2D语义分割特征与深度线索融合,从而提升语义场景补全性能。通过利用2D分割引导和残差注意力模块,AMFNet在SUNCG-RGBD和NYUv2数据集上分别相较之前的方法提升了2.5%和2.6%的mIoU,达到当前最先进水平。

ABSTRACT

This paper presents an end-to-end 3D convolutional network named attention-based multi-modal fusion network (AMFNet) for the semantic scene completion (SSC) task of inferring the occupancy and semantic labels of a volumetric 3D scene from single-view RGB-D images. Compared with previous methods which use only the semantic features extracted from RGB-D images, the proposed AMFNet learns to perform effective 3D scene completion and semantic segmentation simultaneously via leveraging the experience of inferring 2D semantic segmentation from RGB-D images as well as the reliable depth cues in spatial dimension. It is achieved by employing a multi-modal fusion architecture boosted from 2D semantic segmentation and a 3D semantic completion network empowered by residual attention blocks. We validate our method on both the synthetic SUNCG-RGBD dataset and the real NYUv2 dataset and the results show that our method respectively achieves the gains of 2.5% and 2.6% on the synthetic SUNCG-RGBD dataset and the real NYUv2 dataset against the state-of-the-art method.

研究动机与目标

  • 通过将2D语义分割作为监督信号,提升3D语义场景补全(SSC)性能。
  • 通过注意力机制聚焦可靠的深度线索,缓解3D场景的稀疏性问题。
  • 构建一种多模态融合框架,联合优化3D场景补全与语义标注。
  • 证明2D分割经验可有效引导3D补全,尤其在物体边界与小物体上表现更优。

提出的方法

  • 设计了一个双分支3D体素网络,其中一支路利用2D语义分割预测结果来引导3D特征学习。
  • 应用2D-3D投影,将2D语义标签转换为初始的3D语义特征体素。
  • 引入残差注意力模块(RAB),动态强调有意义的体素,抑制空区域的噪声。
  • 网络采用多模态融合架构,结合RGB、深度与HHA特征,以提升3D表征能力。
  • 3D引导分支将2D分割结果作为空间约束注入,以提升物体边界预测精度。
  • 模型采用端到端训练,联合优化交叉熵损失与平均交并比(mIoU)损失。

实验结果

研究问题

  • RQ12D语义分割结果能否提升3D语义场景补全的性能?
  • RQ2基于注意力的特征精炼在处理稀疏3D体素数据方面有多有效?
  • RQ3利用2D分割经验是否能比仅使用RGB-D输入获得更好的3D补全与标注效果?
  • RQ4残差注意力模块是否能增强3D补全网络中的特征学习,特别是在小物体或遮挡物体上?
  • RQ53D引导分支在提升物体边界精度方面有何贡献?

主要发现

  • AMFNet在合成的SUNCG-RGBD数据集上相较最先进方法提升了2.5%的mIoU。
  • 在真实的NYUv2数据集上,AMFNet相较当前最先进方法提升了2.6%的mIoU。
  • 当在3D引导分支中使用真实2D分割标签时,SUNCG-RGBD上的性能提升达3.8%,NYUv2上达4.3%。
  • 与无注意力机制的基线相比,残差注意力模块(RAB)在SUNCG-RGBD上提升mIoU 3.0%,在NYUv2上提升2.9%。
  • 消融实验表明,3D引导分支显著提升了边界精度,尤其在床、墙等复杂物体上表现突出。
  • 加入RAB的模型能更好地重建小物体(如橱柜上的纸堆),这些物体在无注意力机制时常被忽略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。