Skip to main content
QUICK REVIEW

[论文解读] View-volume Network for Semantic Scene Completion from a Single Depth Image

Yuxiao Guo, Xin Tong|arXiv (Cornell University)|Jun 14, 2018
Advanced Vision and Imaging参考文献 12被引用 8
一句话总结

本文提出View-Volume Network (VVNet),一种混合2D-3D卷积神经网络框架,通过可微分投影层将高分辨率2D几何特征与3D上下文融合,从而提升单张深度图像的语义场景补全性能。VVNet在保持3倍更快训练速度和7倍以上更快推理速度的同时,相比先前的3D-CNN方法实现了SOTA精度,且降低内存占用,支持多尺度特征融合。

ABSTRACT

We introduce a View-Volume convolutional neural network (VVNet) for inferring the occupancy and semantic labels of a volumetric 3D scene from a single depth image. The VVNet concatenates a 2D view CNN and a 3D volume CNN with a differentiable projection layer. Given a single RGBD image, our method extracts the detailed geometric features from the input depth image with a 2D view CNN and then projects the features into a 3D volume according to the input depth map via a projection layer. After that, we learn the 3D context information of the scene with a 3D volume CNN for computing the result volumetric occupancy and semantic labels. With combined 2D and 3D representations, the VVNet efficiently reduces the computational cost, enables feature extraction from multi-channel high resolution inputs, and thus significantly improves the result accuracy. We validate our method and demonstrate its efficiency and effectiveness on both synthetic SUNCG and real NYU dataset.

研究动机与目标

  • 为解决从单张深度图像中推断可见与遮挡3D场景结构的挑战。
  • 克服2D CNN(缺乏3D上下文)和3D CNN(计算成本高、分辨率低)在语义场景补全中的局限性。
  • 设计一种端到端可训练、高效的框架,结合高分辨率2D特征与3D上下文推理,以提升精度与速度。
  • 提供灵活的架构设计,支持模型复杂度、推理速度与性能之间的权衡。

提出的方法

  • 该方法使用2D视图CNN从输入深度图像中提取高分辨率几何特征。
  • 通过可微分投影层,基于深度图的空间布局将2D特征图映射到3D特征体素中。
  • 3D体素CNN处理投影后的3D特征体素,学习全局3D上下文,并预测体素级别的占据率与语义标签。
  • 级联的VVNet通过端到端训练,实现2D与3D特征学习的联合优化。
  • 该框架支持多种2D与3D CNN主干网络,支持灵活的架构设计与超参数调优。
  • 评估了多种VVNet变体(如VVNetR-120、VVNetR-60),通过不同分辨率与深度配置,在精度与效率之间实现平衡。

实验结果

研究问题

  • RQ1混合2D-3D CNN架构是否能在语义场景补全任务中超越纯3D-CNN方法,同时降低计算成本?
  • RQ2将高分辨率2D特征与3D上下文融合,如何提升对遮挡物体形状与语义标签预测的准确性?
  • RQ32D主干网络的感受野大小对3D场景补全性能有何影响?
  • RQ4可微分投影层是否能有效将2D特征传递至3D空间,同时保持几何保真度?
  • RQ5在VVNet框架中,模型深度、分辨率与推理速度之间存在何种权衡?

主要发现

  • VVNetR-120在NYUCAD数据集上达到80.3%的IoU,相比SSCNet∗提升2.1%的IoU。
  • 在SUNCG数据集上,VVNetR-120相比SSCNet∗在场景补全(SC)任务中IoU提升1.4%,在语义场景补全(SSC)任务中IoU提升5.9%。
  • 与SSCNet相比,VVNetR-120将训练时间减少3倍,推理时间减少7倍以上,内存占用降低40%。
  • VVNetR-60变体相比SSCNet实现4.7倍更快训练与10倍以上更快推理,仅带来轻微精度下降。
  • 与VVNet-120相比,VVNetR-120更大的感受野使SC与SSC任务的IoU分别提升1.9%与5.4%。
  • 即使3D体素分辨率降低,VVNetR-60仍保持优于SSCNet的精度,证明了2D-3D融合策略的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。