Skip to main content
QUICK REVIEW

[论文解读] Visualization of Convolutional Neural Networks for Monocular Depth Estimation

Junjie Hu, Yan Zhang|arXiv (Cornell University)|Apr 6, 2019
Advanced Vision and Imaging参考文献 42被引用 9
一句话总结

本文提出一种新颖方法,通过识别通过学习的掩码网络所确定的相关像素最小集合,可视化卷积神经网络(CNN)如何从单幅图像推断深度。该方法使用一个独立的CNN来预测稀疏、可解释的掩码,同时保持深度估计的准确性,揭示出CNN依赖于边缘和消失点等几何线索,而非原始强度或边缘强度。

ABSTRACT

Recently, convolutional neural networks (CNNs) have shown great success on the task of monocular depth estimation. A fundamental yet unanswered question is: how CNNs can infer depth from a single image. Toward answering this question, we consider visualization of inference of a CNN by identifying relevant pixels of an input image to depth estimation. We formulate it as an optimization problem of identifying the smallest number of image pixels from which the CNN can estimate a depth map with the minimum difference from the estimate from the entire image. To cope with a difficulty with optimization through a deep CNN, we propose to use another network to predict those relevant image pixels in a forward computation. In our experiments, we first show the effectiveness of this approach, and then apply it to different depth estimation networks on indoor and outdoor scene datasets. The results provide several findings that help exploration of the above question.

研究动机与目标

  • 通过可视化CNN所使用的相关图像区域,理解其如何执行单目深度估计。
  • 解决CNN在自动驾驶等安全关键应用中作为“黑箱”的可解释性挑战。
  • 确定CNN是否使用人类类似的单目深度线索,如透视、纹理梯度和边缘。
  • 开发一种稳定、基于前向计算的方法,避免反向传播可视化中常见的优化伪影。
  • 评估不同训练损失对网络在深度估计中注意力模式的影响。

提出的方法

  • 将相关像素的识别表述为稀疏优化问题:寻找从其中可生成与全图输入几乎相同的深度图的最小像素集合。
  • 使用一个独立的、可训练的CNN(称为G)在前向传播中预测相关像素掩码,避免对深度网络N进行反向传播。
  • 训练G以最小化从掩码输入估计的深度图与原始全图深度图之间的差异,同时对掩码施加稀疏性约束。
  • 通过输入图像I与掩码M的逐元素相乘,将掩码M应用于输入图像,生成掩码输入I ⊙ M,并将其输入到固定的深度网络N中。
  • 使用组合损失函数优化G,该损失函数结合了深度图相似性(如L1或L2损失)和稀疏性正则化(如M的L1范数)。
  • 将该方法应用于NYU-v2(室内)和KITTI(室外)数据集上的最先进深度估计网络,以分析注意力模式。

实验结果

研究问题

  • RQ1对于CNN而言,哪些图像区域(像素)在从单幅图像准确估计深度时最为关键?
  • RQ2用于单目深度估计的CNN是否依赖于人类视觉所使用的相同单目线索,如线性透视、纹理梯度和消失点?
  • RQ3训练损失的选择(如深度、梯度、法线)如何影响网络对特定图像区域的注意力?
  • RQ4深度神经网络能否在不反向传播通过目标网络的情况下,可靠且稳定地预测出稀疏且有意义的相关像素掩码?
  • RQ5在仅使用图像中一小部分像素的情况下,深度估计能在多大程度上被保留?这些像素共享哪些结构特征?

主要发现

  • CNN可仅使用图像中稀疏的像素子集(通常少于图像的10%)实现高精度深度估计,表明全局图像上下文并非始终必要。
  • 网络频繁关注边缘,但并非基于边缘强度;相反,传达几何结构(如物体边界)的边缘更受优先关注。
  • 在室内场景中,CNN不仅关注物体边缘,还关注物体内部区域,表明其通过识别物体形状和大小来推断深度。
  • 在室外场景中,靠近消失点的区域始终被突出显示,表明其强烈依赖透视线索,可能由于其几何重要性或深度损失函数中对误差最小化的偏好。
  • 在训练中引入梯度和法线一致性损失,可使注意力掩码更具结构性和几何一致性,边缘更清晰,目标层面的关注更集中。
  • 所提出的掩码预测网络G在不同深度估计架构和数据集上均表现出良好泛化能力,生成稳定、可解释的可视化结果,且无优化伪影。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。