[论文解读] SceneNet: Understanding Real World Indoor Scenes With Synthetic Data
本文提出 SceneNet,一个合成的 3D 场景数据集,可为基于深度的语义像素级分割生成无限的训练数据。通过使用带有噪声模型的逼真深度图渲染,该方法仅使用深度输入就在 NYUv2 和 SUN RGB-D 上实现了接近最先进水平的性能,证明了合成数据在无需人工标注的情况下可显著提升真实世界场景理解能力。
Scene understanding is a prerequisite to many high level tasks for any automated intelligent machine operating in real world environments. Recent attempts with supervised learning have shown promise in this direction but also highlighted the need for enormous quantity of supervised data --- performance increases in proportion to the amount of data used. However, this quickly becomes prohibitive when considering the manual labour needed to collect such data. In this work, we focus our attention on depth based semantic per-pixel labelling as a scene understanding problem and show the potential of computer graphics to generate virtually unlimited labelled data from synthetic 3D scenes. By carefully synthesizing training data with appropriate noise models we show comparable performance to state-of-the-art RGBD systems on NYUv2 dataset despite using only depth data as input and set a benchmark on depth-based segmentation on SUN RGB-D dataset. Additionally, we offer a route to generating synthesized frame or video data, and understanding of different factors influencing performance gains.
研究动机与目标
- 解决室内场景理解中受限于人工标注训练数据的瓶颈问题。
- 克服像 NYUv2 和 SUN RGB-D 这类人工标注数据集所面临的高成本与可扩展性问题。
- 探究从 3D 渲染场景生成的合成数据是否能在基于深度的语义分割任务中达到甚至超越真实世界数据集的性能。
- 建立一个可扩展的流水线,用于生成用于训练深度网络的帧级与视频级合成数据。
- 研究数据量、噪声建模以及网络架构组件(例如 dropout)对分割性能的影响。
提出的方法
- 使用标注的 CAD 模型和程序化场景生成技术,构建大规模合成 3D 场景数据集。
- 使用具有逼真噪声模型(例如传感器噪声、数据缺失)的物理合理渲染引擎,从多个视角渲染深度图。
- 仅使用深度作为输入(不使用 RGB 或法向量),在合成深度数据上训练基于 Dense-Net 的深度神经网络。
- 使用领域自适应技术在真实世界数据集(NYUv2、SUN RGB-D)上微调模型,以弥合模拟到现实的差距。
- 在训练过程中应用数据增强策略(如 dropout),以评估模型的鲁棒性与泛化能力。
- 使用融合的深度图(DHA)作为输入,以改善特征表示,模拟传感器融合带来的时序平滑效果。
实验结果
研究问题
- RQ1仅使用合成深度数据是否能在语义像素级分割任务中实现与真实世界数据集相当的性能?
- RQ2合成数据的规模对 NYUv2 和 SUN RGB-D 等真实世界基准性能有何影响?
- RQ3合成数据中逼真的噪声模型在提升对真实传感器数据泛化能力方面起到什么作用?
- RQ4在合成数据上预训练后,对真实数据进行微调能在多大程度上提升性能?
- RQ5在合成数据与真实数据上训练时,如 dropout 等架构组件对性能有何影响?
主要发现
- SceneNet-FT-NYU-DHA 在 NYUv2 上实现了 66.5% 的全局准确率和 51.7% 的类别准确率,接近使用 RGB+深度的 SOTA 方法(如 Eigen et al. 的 68.0% 全局准确率)。
- 在 SUN RGB-D 上,SceneNet-FT-SUNRGBD-DO-DHA 实现了 75.0% 的全局准确率和 53.1% 的类别准确率,分别优于 SUNRGBD-DO-DHA(74.2% 全局准确率,52.2% 类别准确率)0.8% 和 0.9%。
- 合成数据带来的性能提升在功能类物体(如地板、墙壁、桌子)上最为显著,地板和墙壁分割的准确率最高提升了 20%。
- 在深度区分度较低的物体(如书籍、电视、窗户)上,性能提升微乎其微,证实了仅靠深度信息不足以有效识别这些类别。
- 在真实数据上微调显著提升了性能:从 NYU-DO-DHA 到 SceneNet-FT-NYU-DO-DHA,全局准确率提升了 2.2%,类别准确率提升了 3.9%。
- 在训练中加入 dropout 仅带来微小收益,表明在此设置下,合成生成带来的数据多样性比正则化策略更具影响力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。