Skip to main content
QUICK REVIEW

[论文解读] Predicting Depth, Surface Normals and Semantic Labels with a Common Multi-Scale Convolutional Architecture

David Eigen, Rob Fergus|arXiv (Cornell University)|Nov 18, 2014
Advanced Vision and Imaging参考文献 37被引用 127
一句话总结

本文提出了一种统一的多尺度卷积神经网络,通过共享架构从单张RGB图像中预测深度、表面法线和语义标签。通过在粗、中、细三个尺度上逐步优化预测,该模型在所有三项任务上均实现了最先进性能,且无需依赖超像素或低级分割,实现了约30Hz的实时推理。

ABSTRACT

In this paper we address three different computer vision tasks using a single basic architecture: depth prediction, surface normal estimation, and semantic labeling. We use a multiscale convolutional network that is able to adapt easily to each task using only small modifications, regressing from the input image to the output map directly. Our method progressively refines predictions using a sequence of scales, and captures many image details without any superpixels or low-level segmentation. We achieve state-of-the-art performance on benchmarks for all three tasks.

研究动机与目标

  • 开发一种单一的共享深度学习架构,能够同时预测多种场景理解输出:深度、表面法线和语义标签。
  • 通过利用分层多尺度特征学习,消除对手工设计组件(如超像素或低级分割)的依赖。
  • 通过统一网络在不同分辨率下逐步优化预测,提升多样化任务的性能。
  • 实现实时推理(≈30Hz)以支持机器人和增强现实中的部署。
  • 证明单一架构在深度、法线和语义分割基准上可超越专用任务模型的表现。

提出的方法

  • 该模型采用具有三个堆叠尺度的多尺度卷积网络:粗尺度(低分辨率全局视图)、中尺度和细尺度(高分辨率细化)。
  • 在每个尺度上,通过转置卷积层上采样并优化输出图,实现特征提取与预测优化。
  • 粗尺度提供对深度和法线预测至关重要的全局上下文,而更细的尺度则捕捉局部细节。
  • 网络采用端到端训练,使用任务特定的损失函数:深度预测使用L1损失,法线估计使用角度损失,语义分割使用交叉熵损失。
  • 将早期尺度的特征图与后续尺度的特征图进行拼接,使局部优化能受益于全局上下文信息。
  • 粗尺度的架构使用ImageNet预训练权重进行初始化,以提升收敛速度与性能。

实验结果

研究问题

  • RQ1单一多尺度卷积网络架构是否能在三个不同的计算机视觉任务(深度预测、表面法线估计和语义标注)上均实现最先进性能?
  • RQ2与仅依赖局部细化相比,包含粗尺度全局感受野(第1层)对深度和法线预测性能有何影响?
  • RQ3当将同一网络预测的深度和法线作为辅助输入时,对语义分割性能的提升程度如何?
  • RQ4所提出的架构是否优于依赖超像素、CRF或复杂后处理的专用任务模型?
  • RQ5该模型能否在不损失精度的前提下实现实时推理(≈30Hz)以生成全部三项输出?

主要发现

  • 多尺度架构在所有三项任务上均达到最先进性能:深度预测在NYU Depth v2数据集上平均相对误差为0.198,表面法线估计的平均角度准确率为75.3%,13类语义分割的像素准确率为64.0%。
  • 最粗尺度(第1层)对深度和法线预测贡献最大,凸显了全局上下文的重要性,而中尺度(第2层)在语义分割中影响最显著。
  • 当仅使用第2层时,将预测的深度和法线作为语义分割头的输入可提升性能,但当两层均使用时增益极小——表明网络能独立学习这些线索。
  • 该模型在仅使用RGB输入的情况下,13类语义分割的像素准确率达到64.0%,超越了使用超像素或CRF的先前方法。
  • 该网络在推理时运行速度约为30Hz,支持所有三项任务的实时部署。
  • 即使随机初始化,仅使用粗尺度时在13类分割任务上仍达到54.5%的准确率,证实其在全局场景理解中的关键作用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。