[论文解读] Pseudo Supervised Monocular Depth Estimation with Teacher-Student Network
本文提出一种基于教师-学生蒸馏框架的伪监督单目深度估计方法,其中双目训练的教师网络生成高质量视差图作为伪真实标签,以监督学生网络进行单目深度估计。通过整合遮挡图和语义监督,该方法在KITTI基准上实现了最先进性能,提升了泛化能力并有效处理了具有挑战性的区域。
Despite recent improvement of supervised monocular depth estimation, the lack of high quality pixel-wise ground truth annotations has become a major hurdle for further progress. In this work, we propose a new unsupervised depth estimation method based on pseudo supervision mechanism by training a teacher-student network with knowledge distillation. It strategically integrates the advantages of supervised and unsupervised monocular depth estimation, as well as unsupervised binocular depth estimation. Specifically, the teacher network takes advantage of the effectiveness of binocular depth estimation to produce accurate disparity maps, which are then used as the pseudo ground truth to train the student network for monocular depth estimation. This effectively converts the problem of unsupervised learning to supervised learning. Our extensive experimental results demonstrate that the proposed method outperforms the state-of-the-art on the KITTI benchmark.
研究动机与目标
- 通过利用伪监督来解决单目深度估计中缺乏高质量像素级深度标注的问题。
- 结合无监督双目深度估计与有监督单目学习的优势,以提升性能。
- 缓解纯无监督单目方法的局限性,如通过光度损失实现的间接监督以及弱立体一致性约束。
- 通过引入遮挡图和语义监督,提升模型在遮挡区域的鲁棒性。
- 证明通过蒸馏实现的伪监督可使模型在无直接深度监督的情况下达到具有竞争力的性能。
提出的方法
- 教师网络在立体图像对上以无监督方式训练,生成准确的视差图,作为伪真实标签。
- 学生网络使用教师网络生成的视差图作为监督信号,以有监督方式训练,从而将无监督学习转化为有监督问题。
- 在学生网络训练过程中生成并使用遮挡图,以标识教师预测可能不可靠的区域。
- 利用语义表征提升教师网络在遮挡边界附近的表现,从而提高伪真实标签的质量。
- 应用知识蒸馏,采用包含光度、平滑性和一致性项的多组件损失函数,使学生预测与伪标签对齐。
- 学生网络通过联合使用伪真实标签、遮挡掩码和语义嵌入端到端训练,以提升泛化能力。
实验结果
研究问题
- RQ1能否通过双目教师网络生成的伪监督信号提升单目深度估计性能?
- RQ2在学生网络训练过程中引入遮挡图,对模糊或遮挡区域的性能有何影响?
- RQ3语义监督在多大程度上增强了教师网络生成可靠伪真实标签的能力?
- RQ4所提出的蒸馏框架是否优于现有的无监督和半无监督单目深度估计方法?
- RQ5在无任何真实深度监督的情况下,学生网络是否能实现最先进性能?
主要发现
- 该方法在KITTI 2015 eigen分割上达到δ<1.25的分数为0.912,优于使用真实深度监督的Guo et al. [27]。
- 在KITTI 2012上,伪真实标签、遮挡图和语义监督的完整组合将绝对相对误差(Abs Rel)降低至0.115,而无这些组件时为0.127。
- 加入语义监督的教师网络将Abs Rel误差从0.089降低至0.077,证明了语义增强的有效性。
- 使用伪监督训练的学生网络优于原始Monodepth ResNet-50基线模型,在KITTI 2012上将RMSE从5.533降低至5.236。
- 定性结果表明,物体边界更清晰,对交通标志和车辆的视差预测失败率更低。
- 消融实验确认,每个组件——伪真实标签、遮挡图和语义监督——均对性能有正向贡献,完整模型达到最佳结果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。