Skip to main content
QUICK REVIEW

[论文解读] 3D-to-2D Distillation for Indoor Scene Parsing

Zhengzhe Liu, Xiaojuan Qi|arXiv (Cornell University)|Apr 6, 2021
Advanced Vision and Imaging参考文献 73被引用 5
一句话总结

本文提出了一种3D到2D蒸馏框架,将大规模3D数据集(如ScanNet-v2)中的3D特征迁移至2D卷积神经网络(CNN),以增强室内场景解析能力,且在推理阶段无需3D数据。通过采用两阶段维度归一化和语义感知对抗损失,该方法使2D网络能够学习到对遮挡和视角变化具有鲁棒性的特征,实现了最先进性能并提升了泛化能力,在未见领域上mIoU提升了19.08%至27.22%。

ABSTRACT

Indoor scene semantic parsing from RGB images is very challenging due to occlusions, object distortion, and viewpoint variations. Going beyond prior works that leverage geometry information, typically paired depth maps, we present a new approach, a 3D-to-2D distillation framework, that enables us to leverage 3D features extracted from large-scale 3D data repository (e.g., ScanNet-v2) to enhance 2D features extracted from RGB images. Our work has three novel contributions. First, we distill 3D knowledge from a pretrained 3D network to supervise a 2D network to learn simulated 3D features from 2D features during the training, so the 2D network can infer without requiring 3D data. Second, we design a two-stage dimension normalization scheme to calibrate the 2D and 3D features for better integration. Third, we design a semantic-aware adversarial training model to extend our framework for training with unpaired 3D data. Extensive experiments on various datasets, ScanNet-V2, S3DIS, and NYU-v2, demonstrate the superiority of our approach. Also, experimental results show that our 3D-to-2D distillation improves the model generalization.

研究动机与目标

  • 解决依赖深度信息的2D语义解析方法所面临的局限,后者需要RGB-深度图像对,且对深度预测误差敏感。
  • 通过从大规模3D点云中蒸馏知识,使2D CNN能够从2D图像中学习类似3D的特征。
  • 设计一种可同时处理配对与非配对2D-3D数据的框架,提升灵活性与适用性。
  • 通过将鲁棒的3D表征嵌入2D特征中,提升模型在未见数据集上的泛化能力。

提出的方法

  • 采用两阶段维度归一化(DN)模块,对齐2D与3D特征的统计分布,以减小模态差异。
  • 在训练过程中,通过L2损失将预训练3D网络中的3D特征蒸馏至2D CNN,使2D网络能够模拟3D特征。
  • 引入语义感知对抗损失(SAAL),通过在类别级别区分2D与3D特征表示,实现在非配对2D-3D数据上的框架训练。
  • 3D到2D蒸馏框架在推理阶段仅使用2D图像,无需3D输入,从而消除了部署阶段对3D数据的需求。
  • 该方法在ScanNet-v2、S3DIS和NYU-v2上进行评估,基线网络架构为PSPNet-50。
  • SAAL中的判别器按类别训练,包含6层全连接层,每类参数量为0.009M。

实验结果

研究问题

  • RQ1能否在推理阶段无需3D数据的前提下,有效将大规模3D数据集中的3D特征迁移至2D CNN,用于室内场景解析?
  • RQ2如何最小化2D与3D特征之间的分布差异,以实现有效的特征蒸馏?
  • RQ3当在3D数据上进行训练并在无配对数据的2D图像上测试时,该框架是否能在未见领域上实现良好泛化?
  • RQ4使用非配对3D数据对2D语义分割的性能与鲁棒性有何影响?
  • RQ5蒸馏后的3D表征是否能提升深度重建质量,从而表明3D特征学习的有效性?

主要发现

  • 所提出的3D到2D蒸馏方法在未见领域上的NYU-v2数据集上实现了19.08%至27.22%的mIoU提升,证明了其强大的泛化能力。
  • 在ScanNet-v2验证集上,使用非配对3D数据时,mIoU从基线的49.50提升至51.70,相对提升4.4%。
  • 可视化对比显示,门、冰箱、书柜和椅子等挑战性物体的预测性能显著提升。
  • 经蒸馏的2D网络在深度重建质量上显著优于基线模型,表明其成功学习了有效的3D特征。
  • 该框架在ScanNet-v2、S3DIS和NYU-v2上均实现了最先进性能,且计算开销可忽略不计。
  • 语义感知对抗损失使非配对2D-3D数据下的有效训练成为可能,验证了该框架的灵活性与可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。