[论文解读] Self-supervised Learning for Single View Depth and Surface Normal Estimation
该论文提出了一种自监督框架,联合训练卷积神经网络以实现单幅图像的深度和表面法线估计,利用深度-法线一致性作为软约束来提升几何推理能力。该方法在KITTI基准上实现了最先进(SOTA)的表面法线预测性能,并通过专用法线网络和时间一致性,显著优于基于深度平滑度的自监督方法。
In this work we present a self-supervised learning framework to simultaneously train two Convolutional Neural Networks (CNNs) to predict depth and surface normals from a single image. In contrast to most existing frameworks which represent outdoor scenes as fronto-parallel planes at piece-wise smooth depth, we propose to predict depth with surface orientation while assuming that natural scenes have piece-wise smooth normals. We show that a simple depth-normal consistency as a soft-constraint on the predictions is sufficient and effective for training both these networks simultaneously. The trained normal network provides state-of-the-art predictions while the depth network, relying on much realistic smooth normal assumption, outperforms the traditional self-supervised depth prediction network by a large margin on the KITTI benchmark. Demo video: https://youtu.be/ZD-ZRsw7hdM
研究动机与目标
- 为解决自监督深度估计中分段平滑深度假设的局限性,该假设会导致前向平行平面伪影。
- 通过训练专用的卷积神经网络而非从预测的深度图中推导法线,来提升表面法线估计性能。
- 通过使用立体图像序列估计度量视觉里程计,消除单目自监督学习中的深度平移尺度模糊性。
- 通过逆深度与预测法线之间的软一致性约束,提升深度与法线预测的准确性。
- 证明联合学习结合时间几何一致性,相比基于深度平滑度先验的方法具有更优性能。
提出的方法
- 一种自监督训练框架,联合优化三个网络:基于立体图像序列的深度预测、表面法线预测以及两帧视觉里程计。
- 通过软一致性损失对深度和法线预测进行正则化,以强制实现逆深度与表面法线之间的几何一致性。
- 表面法线网络与深度预测独立训练,从而相比从深度图推导的法线,能获得更准确、更少噪声的法线估计。
- 通过利用预测的自运动,对连续视频帧之间的不一致深度和法线预测施加惩罚,以实现时间一致性。
- 该框架利用立体数据恢复度量尺度,避免了单目自监督方法中常见的尺度模糊性。
- 采用基于预测自运动和深度的可微变形操作,利用光度一致性来监督网络。
实验结果
研究问题
- RQ1联合学习深度与表面法线预测是否能提升自监督单图像三维重建中的几何推理能力?
- RQ2使用专用法线预测网络是否优于从预测深度图中推导法线的方法?
- RQ3将深度-法线一致性作为软约束,是否能超越传统深度平滑度正则化,同时提升深度与法线估计性能?
- RQ4在视频序列中引入时间几何一致性是否能进一步提升预测准确性?
- RQ5基于立体的视觉里程计训练是否能消除自监督深度估计中的尺度模糊性?
主要发现
- 所提方法在KITTI数据集上的平均表面法线误差为30.23°,优于先前工作如Yang等人[11](35.69°)和Yang等人[12](37.44°)。
- 该方法将中位数表面法线误差降低至19.11°,表明相比基线方法,法线估计质量显著提升。
- 深度预测网络相比传统自监督深度网络有显著性能提升,得益于更真实的平滑法线假设。
- 视觉与定量对比表明,使用专用法线CNN可获得比从预测深度图计算法线更高质量的法线。
- 引入时间一致性进一步提升性能,平均误差从30.37°降至30.23°,中位数误差从19.13°降至19.11°。
- 视觉结果证实,预测的法线在平面区域更平滑,边缘保持更优,而基于深度图的法线则更嘈杂且存在伪影。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。