Skip to main content
QUICK REVIEW

[论文解读] Bidirectional Projection Network for Cross Dimension Scene Understanding

Wenbo Hu, Hengshuang Zhao|arXiv (Cornell University)|Mar 26, 2021
3D Shape Modeling and Analysis参考文献 70被引用 4
一句话总结

该论文提出了一种新型端到端框架——双向投影网络(BPNet),通过在多层级特征金字塔上引入双向投影模块(BPM),实现了2D图像与3D点云之间的双向特征交互。通过联合优化2D和3D语义分割,BPNet在ScanNetV2基准上取得了最先进性能,其2D和3D mIoU得分均优于单模态基线方法。

ABSTRACT

2D image representations are in regular grids and can be processed efficiently, whereas 3D point clouds are unordered and scattered in 3D space. The information inside these two visual domains is well complementary, e.g., 2D images have fine-grained texture while 3D point clouds contain plentiful geometry information. However, most current visual recognition systems process them individually. In this paper, we present a \emph{bidirectional projection network (BPNet)} for joint 2D and 3D reasoning in an end-to-end manner. It contains 2D and 3D sub-networks with symmetric architectures, that are connected by our proposed \emph{bidirectional projection module (BPM)}. Via the \emph{BPM}, complementary 2D and 3D information can interact with each other in multiple architectural levels, such that advantages in these two visual domains can be combined for better scene recognition. Extensive quantitative and qualitative experimental evaluations show that joint reasoning over 2D and 3D visual domains can benefit both 2D and 3D scene understanding simultaneously. Our \emph{BPNet} achieves top performance on the ScanNetV2 benchmark for both 2D and 3D semantic segmentation. Code is available at \url{https://github.com/wbhu/BPNet}.

研究动机与目标

  • 通过实现2D与3D表示之间的双向特征交互,解决2D-3D场景理解中单向融合的局限性。
  • 利用2D图像(纹理)与3D点云(几何)之间的互补信息,提升联合场景识别能力。
  • 设计一种可扩展的端到端框架,在多个架构层级上整合2D与3D推理。
  • 验证双向特征流动在提升2D与3D语义分割性能方面的有效性。
  • 验证BPNet在2.5D RGB-D数据上的泛化能力,表明其适用范围不仅限于纯3D场景。

提出的方法

  • 为2D和3D分支设计对称的U-Net架构,以确保特征学习的平衡性。
  • 引入双向投影模块(BPM),在多层级特征金字塔上建立2D与3D特征图之间的可学习投影连接。
  • 执行双向特征迁移:利用BPM学习到的连接矩阵,将2D特征投影到3D空间,反之亦然。
  • 在解码器的多个层级应用BPM,以实现从粗到细的互补2D与3D特征融合。
  • 以多视角2D图像和3D点云作为输入,将深度图转换为3D点云以供3D处理。
  • 使用交叉熵损失对2D和3D语义分割任务进行端到端联合训练。

实验结果

研究问题

  • RQ12D与3D表示之间的双向特征交互是否能超越单向融合,在联合场景理解中带来性能提升?
  • RQ2通过BPM实现的多层级、从粗到细的特征融合,如何影响2D与3D语义分割性能?
  • RQ3在联合学习框架中,3D几何信息在多大程度上能提升2D分割性能,反之亦然?
  • RQ4所提出的BPNet是否能泛化到2.5D RGB-D数据(如NYUv2)上,而不仅限于完整3D场景?
  • RQ5为最大化联合2D-3D性能,最优的2D视角数量和体素大小分别是多少?

主要发现

  • 在使用2cm体素大小的ScanNetV2数据集上,BPNet实现了71.9%的2D mIoU和73.9%的3D mIoU,优于所有单模态及基线联合方法。
  • 仅使用一个2D视角时,BPNet仍达到最高的2D mIoU(66.5%),表明即使输入2D图像极少,也能从3D引导中获益。
  • 随着2D视角数量从1增加到3,3D mIoU持续上升,峰值达70.6%(三视角),表明在冗余出现前已达到最优信息增益。
  • 将体素大小从5cm减小到2cm,3D单模态基线的3D mIoU提升5.9个百分点(从68.0%增至72.1%),而结合BPNet后,2D mIoU进一步提升10.4个百分点。
  • 在NYUv2数据集上,BPNet实现了73.5%的密集像素分类准确率,超过3DMV(71.2%)及其他RGB-D基线方法,证明其在2.5D数据上的强大泛化能力。
  • 定性结果表明,由于双向特征优化,2D分割的边界更加清晰,3D分割中对形状相似物体(如墙面与画作)的区分能力也得到显著改善。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。