[论文解读] Large-Scale 3D Scene Classification With Multi-View Volumetric CNN
本文提出一种多视角体素卷积神经网络,用于利用多个深度平面的图像投影进行大规模三维场景分类,无需边界标注即可实现对水体和树木等复杂材质的精确像素级分类。该方法通过利用多视角像素相关性,实现了最先进的性能,在使用3D体素训练的情况下,其在航拍图像上的测试准确率达到96.3%,优于Inception-V3模型。
We introduce a method to classify imagery using a convo- lutional neural network (CNN) on multi-view image pro- jections. The power of our method comes from using pro- jections of multiple images at multiple depth planes near the reconstructed surface. This enables classification of categories whose salient aspect is appearance change un- der different viewpoints, such as water, trees, and other materials with complex reflection/light response proper- ties. Our method does not require boundary labelling in images and works on pixel-level classification with a small (few pixels) context, which simplifies the cre- ation of a training set. We demonstrate this application on large-scale aerial imagery collections, and extend the per-pixel classification to robustly create a consistent 2D classification which can be used to fill the gaps in non- reconstructible water regions. We also apply our method to classify tree regions. In both cases, the training data can quickly be generated using a small number of manually- created polygons on a map. We show that even with a very simple and standard network our CNN outperforms the state-of-the-art image classification, the Inception-V3 model retrained from a large collection of aerial images.
研究动机与目标
- 解决在大规模三维重建中对水体和树木等复杂材质进行分类的挑战,因为立体重建常因镜面反射和运动而失败。
- 通过仅使用地图上的稀疏多边形标注来生成弱监督训练数据,减少对大规模全标注训练集的依赖。
- 通过检测并使用一致的2D分类掩码填充三维模型中噪声或缺失的水体区域,从而提高重建质量。
- 证明该方法在水体之外对其他材质(如树木)的泛化能力,使用相同的多视角体素卷积神经网络框架。
提出的方法
- 将多幅输入图像投影到多个深度平面的3D照片一致性体素中,以生成多视角体素特征。
- 在这些体素表示上训练3D卷积神经网络(CNN),基于多视角像素相关性对每个3D点进行分类。
- 使用地图上的稀疏多边形标注生成弱监督训练数据,避免逐像素的边界标注。
- 通过在3D点上进行概率融合,将所有视角的逐像素分类得分聚合为一致的2D掩码。
- 在水体分类中,从掩码边界鲁棒地估计水位,并利用掩码将噪声重建几何替换为平滑表面。
- 通过学习多视角特征交互而非单幅图像外观,利用3D CNN建模复杂反射函数的能力。
实验结果
研究问题
- RQ1与单图像方法相比,多视角体素CNN是否能显著提升具有复杂反射特性的材质(如水体和树木)的三维场景分类准确率?
- RQ2仅使用地图上的稀疏多边形标注进行弱监督学习,在多大程度上减少了标注工作量,同时保持高分类准确率?
- RQ3该方法在检测和填充大规模航拍图像中水体区域的重建伪影方面有多有效?
- RQ4使用多视角对应关系的3D体素特征是否显著优于基于2D图像或基于图像块的训练策略?
- RQ5该框架是否能有效扩展至分类如树木等多样化材质,证明其在水体之外的泛化能力?
主要发现
- 3D体素CNN在水体分类任务上达到了96.3%的测试准确率,显著优于在航拍图像上微调后的基线Inception-V3模型。
- 采用完整像素对应关系(3D CNN)的模型达到96.3%的测试准确率,而基于图像块对应关系的模型为90.2%,无对应关系的模型仅为79.2%,表明3D空间建模的必要性。
- 该系统成功检测并填充了大规模3D重建中的水体空缺,即使在旧金山湾等具有异常水色的复杂区域,也能生成平滑且带纹理的水体表面。
- 从聚合的3D预测生成的2D分类掩码能够实现鲁棒的空缺填充,并保留如电线杆支柱和狭窄水道等精细细节。
- 该方法在树木分类中也表现出良好的泛化能力,仅需在地图上手动绘制八个多边形即可实现准确分割,无需逐图像的像素级标注。
- 该方法对立体重建流程的变化具有鲁棒性,在底层照片一致性计算发生变化时仍能保持高性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。