[论文解读] The Edge of Depth: Explicit Constraints between Segmentation and Depth
本文提出了一种显式的语义分割与深度估计之间的边界一致性约束,以提升自监督单目深度预测性能。通过使用可微分的形变操作将深度边缘与分割边界对齐,并引入立体遮挡掩码以减少漏光伪影,该方法在 KITTI 数据集上实现了最先进性能,首次在自监督学习中达到监督方法的绝对相对误差水平(0.101)。
In this work we study the mutual benefits of two common computer vision tasks, self-supervised depth estimation and semantic segmentation from images. For example, to help unsupervised monocular depth estimation, constraints from semantic segmentation has been explored implicitly such as sharing and transforming features. In contrast, we propose to explicitly measure the border consistency between segmentation and depth and minimize it in a greedy manner by iteratively supervising the network towards a locally optimal solution. Partially this is motivated by our observation that semantic segmentation even trained with limited ground truth (200 images of KITTI) can offer more accurate border than that of any (monocular or stereo) image-based depth estimation. Through extensive experiments, our proposed approach advances the state of the art on unsupervised monocular depth estimation in the KITTI.
研究动机与目标
- 为解决自监督单目深度估计在低纹理和遮挡区域的局限性,通过语义分割作为边界精度的强先验。
- 显式建模分割与深度边界之间的关系,超越以往方法中隐式的特征共享或变换。
- 通过引入新型立体遮挡掩码,减轻基于立体视觉的自监督方法在物体边界附近的漏光伪影。
- 通过基于图像方差和光度损失质量的微调策略,提升训练稳定性和性能。
- 证明即使弱监督的分割也能在边界精度上优于深度估计本身,从而验证将分割作为深度监督信号的合理性。
提出的方法
- 该方法引入一种非可微的边界一致性损失,通过分割边界与深度边界之间的 L2 距离进行度量,并通过贪婪形变过程进行优化。
- 采用改进的 Beier–Neely 形变算法,利用从边缘对应关系中提取的蒸馏点对,生成与分割边界对齐的局部最优深度图。
- 将立体遮挡掩码集成到光度损失中,以抑制物体边界附近的错误监督信号,减少基于立体视觉训练中的漏光伪影。
- 在形变过程中应用权重函数 w(x),对低方差图像区域进行降权,避免噪声从有噪声的分割预测中被放大。
- 该方法使用预测的分割标签(来自 [46])作为输入,并应用一种微调策略,根据图像内容和光度可靠性选择性地更新网络组件。
- 形变过程在训练中迭代应用,逐步优化深度图,使其在保持光度一致性的同时更精确地对齐分割边界。
实验结果
研究问题
- RQ1显式对齐分割与深度边界是否能超越以往方法中隐式的特征级交互,进一步提升自监督单目深度估计性能?
- RQ2即使在低纹理或反光区域,使用分割边缘作为监督信号是否能带来比仅依赖深度估计更精确的深度边界?
- RQ3通过显式建模遮挡是否能减轻基于立体视觉的自监督深度估计中的漏光伪影,并提升监督信号质量?
- RQ4在形变策略的选择上——具体而言,形变与三角化方法相比——对监督信号质量和最终深度预测质量有何影响?
- RQ5一种基于方差和光度损失质量加权区域的简单微调策略,是否能提升自监督深度估计的泛化能力与性能?
主要发现
- 所提方法在 KITTI 测试集上实现了新的最先进绝对相对误差水平(0.101),首次在自监督深度估计中达到与监督方法相当的性能。
- 立体遮挡掩码有效减少了漏光伪影并提升了性能,将绝对相对误差从 0.102 降低至 0.101,同时将 δ<1.25 从 0.884 提升至 0.887。
- 基于形变的监督显著提升了深度边界质量,定性结果表明边缘更清晰、更一致,并与分割轮廓对齐。
- 形变策略显著优于基于三角化的点对蒸馏方法,将 RMSE 降低了 0.011(从 4.379 降至 4.368),且 δ<1.25 分数保持不变。
- 微调策略在多个模型上均提升了性能,绝对相对误差从 0.104 降至 0.103(Godard 等人)和从 0.096 降至 0.094(Watson 等人),证明其具有良好的泛化能力。
- 即使仅使用 200 张 KITTI 图像进行分割预训练,模型仍表明分割边界比深度估计边界更准确,验证了该方法的核心直觉。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。