Skip to main content
QUICK REVIEW

[论文解读] P$^{2}$Net: Patch-match and Plane-regularization for Unsupervised Indoor Depth Estimation

Zehao Yu, Lei Jin|arXiv (Cornell University)|Jul 15, 2020
Advanced Vision and Imaging参考文献 59被引用 10
一句话总结

P$^{2}$Net 提出了一种新颖的无监督室内深度估计方法,通过使用以高梯度关键点为中心的局部块表示,并利用超像素先验强制实现平面一致性,显著提升了在无纹理区域的鲁棒性。该方法在 NYUv2 和 ScanNet 数据集上实现了最先进性能,通过增强匹配判别能力与几何正则化,显著优于以往的无监督方法。

ABSTRACT

This paper tackles the unsupervised depth estimation task in indoor environments. The task is extremely challenging because of the vast areas of non-texture regions in these scenes. These areas could overwhelm the optimization process in the commonly used unsupervised depth estimation framework proposed for outdoor environments. However, even when those regions are masked out, the performance is still unsatisfactory. In this paper, we argue that the poor performance suffers from the non-discriminative point-based matching. To this end, we propose P$^2$Net. We first extract points with large local gradients and adopt patches centered at each point as its representation. Multiview consistency loss is then defined over patches. This operation significantly improves the robustness of the network training. Furthermore, because those textureless regions in indoor scenes (e.g., wall, floor, roof, \etc) usually correspond to planar regions, we propose to leverage superpixels as a plane prior. We enforce the predicted depth to be well fitted by a plane within each superpixel. Extensive experiments on NYUv2 and ScanNet show that our P$^2$Net outperforms existing approaches by a large margin. Code is available at \url{https://github.com/svip-lab/Indoor-SfMLearner}.

研究动机与目标

  • 为解决在具有大范围无纹理区域的室内场景中无监督深度估计的挑战,因光度一致性损失在模糊点匹配下失效。
  • 克服基于点的表示在匹配中的局限性,避免在无纹理区域产生错误对应。
  • 通过引入几何先验(特别是墙壁和地板等均质区域的平面结构),提升深度估计的鲁棒性。
  • 消除对预匹配或稀疏对应估计的需求,实现直接的端到端训练流程。

提出的方法

  • 该方法选取具有大局部梯度的关键点作为判别性特征,以提升在无纹理区域的匹配可靠性。
  • 使用以关键点为中心的局部块表示每个关键点,以基于块的表示替代基于点的表示,从而增强判别能力。
  • 引入一种块形变机制,假设每个块内深度均匀,并在这些块上强制执行多视角光度一致性。
  • 利用超像素识别场景中的平面区域,并应用分段平面一致性损失,确保每个超像素内的预测深度与低误差平面拟合。
  • 通过组合基于块的光度损失和平面拟合损失,实现端到端训练,无需显式对应初始化。
  • 通过评估阶段的重缩放策略,避免单目深度估计中的尺度模糊性,遵循标准协议。

实验结果

研究问题

  • RQ1基于块的表示能否提升在纹理有限的室内场景中无监督深度估计的匹配鲁棒性?
  • RQ2在超像素区域内强制执行平面一致性,对大范围无纹理区域的深度估计精度有何影响?
  • RQ3将基于块的光度一致性与基于超像素的平面正则化相结合,是否能在室内基准上实现优于基于点的方法的泛化性能?
  • RQ4直接的端到端训练框架能否在无监督室内深度估计中超越需要预计算稀疏对应关系的方法?

主要发现

  • 在 NYUv2 数据集上,P$^{2}$Net 的测试误差为 0.599(rms)、0.159(rel)和 0.772(δ<1.25),优于基线方法和以往的无监督方法。
  • 消融实验表明,结合基于块的匹配与平面正则化可获得最佳性能,仅使用块模块即可将 rms 从 0.786 降低至 0.612。
  • 在 ScanNet 上,P$^{2}$Net 的相机位姿估计误差为 1.86°(旋转)和 35.11°(平移),优于 MovingIndoor,展现出强大的泛化能力。
  • 尽管未专门针对运动物体设计,P$^{2}$Net 在 KITTI 上的 δ<1.25 指标相比 Monov2 提升了 1.5%。
  • 关于块模式大小的消融实验表明,N=3 时性能最优,更大的模式(N=4)会引入噪声并降低性能。
  • 可视化结果表明,P$^{2}$Net 生成的表面法向量和三维点云在墙壁和地板区域更准确地保留了平面边界,优于 MovingIndoor。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。