Skip to main content
QUICK REVIEW

[论文解读] Learning Multi-View Aggregation In the Wild for Large-Scale 3D Semantic Segmentation

Damien Robert, Bruno Vallet|arXiv (Cornell University)|Apr 15, 2022
3D Surveying and Cultural Heritage被引用 5
一句话总结

该论文提出了一种端到端可训练的多视角聚合模型,利用3D点的视角条件来融合来自多张图像和3D点云的特征,而无需进行色彩化、网格化或深度图处理。仅使用原始扫描数据、图像和相机位姿,该方法在S3DIS(74.7 mIoU)和KITTI-360(58.3 mIoU)上实现了最先进性能。

ABSTRACT

Recent works on 3D semantic segmentation propose to exploit the synergy between images and point clouds by processing each modality with a dedicated network and projecting learned 2D features onto 3D points. Merging large-scale point clouds and images raises several challenges, such as constructing a mapping between points and pixels, and aggregating features between multiple views. Current methods require mesh reconstruction or specialized sensors to recover occlusions, and use heuristics to select and aggregate available images. In contrast, we propose an end-to-end trainable multi-view aggregation model leveraging the viewing conditions of 3D points to merge features from images taken at arbitrary positions. Our method can combine standard 2D and 3D networks and outperforms both 3D models operating on colorized point clouds and hybrid 2D/3D networks without requiring colorization, meshing, or true depth maps. We set a new state-of-the-art for large-scale indoor/outdoor semantic segmentation on S3DIS (74.7 mIoU 6-Fold) and on KITTI-360 (58.3 mIoU). Our full pipeline is accessible at https://github.com/drprojects/DeepViewAgg, and only requires raw 3D scans and a set of images and poses.

研究动机与目标

  • 解决在大规模场景中融合多视角图像与3D点云的挑战,而无需依赖专用传感器或预处理步骤。
  • 克服现有混合2D/3D方法在图像选择中使用启发式策略以及在特征聚合中采用均匀池化所带来的局限性。
  • 仅使用原始3D点云和已知位姿的配准图像,实现对大规模室内外场景的有效语义分割。
  • 开发一种可扩展的、基于GPU加速的流水线,能够处理每个点的任意数量视角,并直接处理真实世界数据。
  • 证明仅凭视角条件即可实现有效的基于注意力的特征聚合,其性能优于在注意力评分中引入几何或辐射特征的方法。

提出的方法

  • 仅使用3D点云和相机位姿构建点-像素映射,避免对深度图、网格化或色彩化的需求。
  • 采用可学习的注意力机制,根据每个3D点在多张图像中的视角条件(如距离、角度)选择并聚合2D特征。
  • 将基于注意力的聚合模块作为插件集成在标准2D和3D主干网络之间,支持端到端训练。
  • 实施一种动态批处理策略,将3D点分组为球形或圆柱形邻域,并根据可见性分配相关图像。
  • 应用门控机制控制来自每个视角的特征流,使模型能够抑制无关或噪声输入。
  • 以特征最大池化作为基线进行比较,但表明基于视角条件的可学习注意力机制能取得更优性能。

实验结果

研究问题

  • RQ1仅凭视角条件是否足以在3D语义分割中引导有效的多视角特征聚合,而无需在注意力评分中引入几何或辐射特征?
  • RQ2可学习的注意力机制在多大程度上能优于基于启发式策略、从固定数量视角均匀池化特征的方法?
  • RQ3当避免色彩化处理且仅使用原始RGB图像和3D扫描数据时,混合2D/3D模型与纯3D模型的性能相比如何?
  • RQ4图像分辨率、3D点云分辨率以及在2D数据集上进行预训练对大规模3D分割的影响是什么?
  • RQ5所提方法是否能在真实世界数据集(如S3DIS和KITTI-360)上实现最先进性能,而无需网格重建或真实深度图?

主要发现

  • 所提方法在6折S3DIS基准上实现了74.7 mIoU的新最先进性能,优于所有纯3D模型和混合2D/3D模型。
  • 在KITTI-360上,该方法在测试集上达到58.3 mIoU,未使用色彩化点云或深度图,创下新最先进性能。
  • 仅使用图像特征和聚合模块的纯2D模型在S3DIS上表现优于XYZRGB基线,证明了图像在3D分割中的价值。
  • 将图像下采样2倍会导致性能显著下降,表明高分辨率图像特征对最优结果至关重要。
  • 在公开2D数据集上预训练2D编码器可带来高达7个百分点的mIoU增益,凸显利用大规模2D标注的优势。
  • 移除门控机制或仅使用一个特征组分别导致性能下降3点和4.8点,表明自适应特征选择和多尺度处理的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。