Skip to main content
QUICK REVIEW

[论文解读] Size-to-depth: A New Perspective for Single Image Depth Estimation

Yiran Wu, Sihao Ying|arXiv (Cornell University)|Jan 13, 2018
Advanced Vision and Imaging参考文献 10被引用 15
一句话总结

本文提出了一种新颖的基于尺寸到深度的单张图像单目深度估计方法,利用人工标注的物体尺寸通过几何关系推断相对深度,随后通过CRF进行优化以生成精确的深度图。该方法优于传统深度标注技术,在NYU Depth数据集上实现了21%的相对误差降低和更优的指标表现。

ABSTRACT

In this paper we consider the problem of single monocular image depth estimation. It is a challenging problem due to its ill-posedness nature and has found wide application in industry. Previous efforts belongs roughly to two families: learning-based method and interactive method. Learning-based method, in which deep convolutional neural network (CNN) is widely used, can achieve good result. But they suffer low generalization ability and typically perform poorly for unfamiliar scenes. Besides, data-hungry nature for such method makes data aquisition expensive and time-consuming. Interactive method requires human annotation of depth which, however, is errorneous and of large variance. To overcome these problems, we propose a new perspective for single monocular image depth estimation problem: size to depth. Our method require sparse label for real-world size of object rather than raw depth. A Coarse depth map is then inferred following geometric relationships according to size labels. Then we refine the depth map by doing energy function optimization on conditional random field(CRF). We experimentally demonstrate that our method outperforms traditional depth-labeling methods and can produce satisfactory depth maps.

研究动机与目标

  • 通过引入基于物体尺寸而非原始深度的新视角,解决单张图像深度估计的病态性问题。
  • 克服基于学习的方法存在的泛化能力差和数据饥渴问题,以及交互式方法因人类难以估计绝对深度而导致的易错性和低效性。
  • 通过将直接深度标注转换为尺寸标注,发挥人类在尺寸估计方面的优势,从而提高标注的准确性和效率。
  • 开发一种鲁棒的深度传播框架,在保持局部连续性的同时,保留物体边界处的深度不连续性。
  • 证明基于尺寸的标注相比传统深度标注方法能生成更高质量的深度图。

提出的方法

  • 该方法以物体的稀疏人工标注真实世界尺寸作为输入,利用几何关系:深度 ∝ (焦距 × 真实世界尺寸) / (图像中的尺寸) 推断相对深度。
  • 通过基于推断比例关系的物体尺寸标注,生成粗略的深度图。
  • 采用定制的条件随机场(CRF)模型对粗略深度图进行优化,其一元项基于尺寸标注,二元项基于图像强度相似性以实现平滑性约束。
  • CRF能量函数定义为 E(x,y) = Σ_p E_unary(y_p,x) + λ Σ_(b,c)∈A (1/2) E_binary(y_b,y_c,x),其中 E_binary 通过相似性权重 sim(b,c) = exp(−β|I_b − I_c|) 实现对相似区域中深度一致性的偏好。
  • 通过基于局部图像相似性的惩罚权重,实现在物体边界处保留深度不连续性的同时优化深度传播。
  • 超参数 λ 和 β 控制标签保真度与平滑性之间的权衡,其中 β 调节基于RGB强度差异的深度差异惩罚。

实验结果

研究问题

  • RQ1物体尺寸标注能否作为单张图像深度估计中直接深度标注的更准确、更高效替代方案?
  • RQ2物体尺寸、图像尺寸与深度之间的几何关系是否能在真实场景中实现可靠的深度推断?
  • RQ3基于CRF的优化模型能否有效从稀疏尺寸标注中传播深度,同时保持物体边界处的不连续性?
  • RQ4在定量指标方面,尺寸到深度标注方法与传统深度标注方法相比表现如何?
  • RQ5超参数 λ 和 β 在多大程度上影响最终深度图的质量与平滑性?

主要发现

  • 尺寸标注的相对误差为8%,显著低于直接深度标注的21%,证明其具有更高的准确性和效率。
  • 所提出的尺寸到深度方法在NYU Depth数据集上达到0.016的均方误差,优于传统手工设计的深度方法(0.048)。
  • 该方法的余弦相似度为0.976,高于基线方法的0.935,表明与真实深度向量的对齐性更优。
  • 成对排名准确率达到0.858,超过基线的0.818,表明相对深度排序性能更优。
  • 该方法生成的深度图在视觉上合理,能有效保留物体边界处的深度不连续性,同时在同质区域保持平滑性。
  • 敏感性分析表明,λ 和 β 显著影响平滑性与标签保真度,最优值可在准确性和连续性之间实现良好平衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。