Skip to main content
QUICK REVIEW

[论文解读] MonSter: Awakening the Mono in Stereo

Yotam Gil, Shay Elmalem|arXiv (Cornell University)|Oct 30, 2019
Advanced Vision and Imaging参考文献 38被引用 6
一句话总结

MonSter 提出了一种混合立体-单目深度估计系统,通过融合相位编码孔径生成的立体差异图与基于深度学习的单目网络生成的单目深度图,实现深度估计。通过强制两种深度估计之间的一致性,该方法实现了在线自校准,并在深度估计中将相对 L1 损失降低了 10%,从而在更广的深度范围内提升了精度。

ABSTRACT

Passive depth estimation is among the most long-studied fields in computer vision. The most common methods for passive depth estimation are either a stereo or a monocular system. Using the former requires an accurate calibration process, and has a limited effective range. The latter, which does not require extrinsic calibration but generally achieves inferior depth accuracy, can be tuned to achieve better results in part of the depth range. In this work, we suggest combining the two frameworks. We propose a two-camera system, in which the cameras are used jointly to extract a stereo depth and individually to provide a monocular depth from each camera. The combination of these depth maps leads to more accurate depth estimation. Moreover, enforcing consistency between the extracted maps leads to a novel online self-calibration strategy. We present a prototype camera that demonstrates the benefits of the proposed combination, for both self-calibration and depth reconstruction in real-world scenes.

研究动机与目标

  • 解决立体视觉的局限性,例如对校准敏感以及在近距离深度估计中表现不佳的问题。
  • 通过与立体数据结合,克服单目深度估计中固有的深度模糊性和噪声问题。
  • 利用单目深度作为一致参考,实现立体相机的在线自校准。
  • 通过融合立体与单目方法的互补优势,扩展深度估计的有效深度范围。
  • 在无需微调的情况下,证明在模拟数据上训练的模型在真实世界场景中具有良好的泛化能力。

提出的方法

  • 部署一个双相机立体系统,其中一个相机使用相位编码孔径,以在光学图像中嵌入深度线索。
  • 训练一个卷积神经网络(CNN),从相位编码图像中提取深度,实现具有真实世界单位的绝对深度估计。
  • 在未经修改的立体图像上使用独立的单目深度网络(例如 DPT)生成相对深度图。
  • 应用可微的投影变换,将左图像校正以与右图像对齐,从而实现立体匹配。
  • 使用一个四层卷积网络融合立体与单目深度图,学习最优的像素级加权以提升精度。
  • 在训练过程中强制立体与单目深度图之间的一致性,从而实现在无需外部校准图案的情况下的在线自校准。

实验结果

研究问题

  • RQ1是否可以利用单目深度估计实现无需外部校准图案的立体相机在线自校准?
  • RQ2融合立体与单目深度图在不同深度范围内如何提升深度估计的精度?
  • RQ3相位编码孔径方法在近距离场景中对提升单目深度估计精度的增强程度如何?
  • RQ4在模拟数据上训练的模型是否能在无需微调的情况下有效泛化到真实世界深度估计?
  • RQ5融合立体与单目深度图是否能缓解各自方法的固有缺陷(例如立体方法在近距离的误差和单目方法在远距离的噪声)?

主要发现

  • 在具有真实值的模拟数据上,融合后的深度图相比仅使用立体的方法,相对 L1 损失降低了 10%。
  • 在近距离(深度 < 1m)范围内,单目方法优于立体方法,其相对 L1 损失为 0.551,而立体方法为 0.071,表明立体方法在近距离深度估计中的局限性。
  • 在近距离区域(掩码区域),单目方法表现更优(损失为 0.119),而立体方法在中远距离表现更佳。
  • 通过强制立体与单目深度图之间的一致性,系统实现了在线自校准,消除了对外部校准图案的需求。
  • 原型在真实世界场景中表现出定性改进,能够准确捕捉立体方法因遮挡或大视差而遗漏的近距离物体(如喷雾瓶)的深度细节。
  • 该方法在真实世界数据上表现出良好的泛化能力,即在合成数据上训练的模型在未微调的真实图像上也表现出强劲性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。