Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Monocular Depth and Ego-motion Learning with Structure and Semantics

Vincent Casser, Sören Pirk|arXiv (Cornell University)|Jun 12, 2019
Advanced Vision and Imaging被引用 22
一句话总结

该论文提出了一种无监督单目方法,通过使用SE3变换建模单个物体的3D运动,并结合语义实例分割掩码,实现深度与自运动的联合估计。通过将结构与语义信息整合到可微分的图像扭曲框架中,并应用在线微调,该方法在KITTI和Cityscapes数据集上实现了最先进性能,尤其在具有显著运动的动态场景中,深度与自运动指标大幅优于先前方法。

ABSTRACT

We present an approach which takes advantage of both structure and semantics for unsupervised monocular learning of depth and ego-motion. More specifically, we model the motion of individual objects and learn their 3D motion vector jointly with depth and ego-motion. We obtain more accurate results, especially for challenging dynamic scenes not addressed by previous approaches. This is an extended version of Casser et al. [AAAI'19]. Code and models have been open sourced at https://sites.google.com/corp/view/struct2depth.

研究动机与目标

  • 解决在动态场景中无监督单目深度与自运动估计的挑战,因为先前方法因未建模物体运动而失效。
  • 通过使用SE3变换显式建模单个物体的3D运动,提升深度与自运动预测的准确性。
  • 通过一种在线微调技术实现在新环境中的领域泛化与迁移学习,实现实时适应而无需微调。
  • 将结构几何信息(3D场景重建)与语义信息(物体实例分割掩码)整合到学习过程中,以提升场景理解能力。

提出的方法

  • 该方法使用全卷积编码器-解码器网络,从单张RGB图像预测稠密深度图。
  • 其采用独立的自运动网络,预测连续帧之间的6D SE3变换(平移与旋转)。
  • 通过将SE3变换应用于预测的深度图,结合实例分割掩码,实现每个物体的3D运动估计。
  • 使用可微分的图像扭曲算子,通过自运动和深度信息将源图像扭曲以重建目标帧,其中使用物体掩码隔离运动区域。
  • 在推理过程中应用在线微调技术,通过使用目标域的少量帧来优化预测,实现实时模型适应。
  • 损失通过扭曲图像与原始目标帧之间的光度一致性计算,同时使用掩码排除运动物体与无效区域。

实验结果

研究问题

  • RQ1在动态场景中显式建模单个物体的3D运动是否能提升无监督单目深度与自运动估计性能?
  • RQ2结合语义实例分割掩码与3D运动约束,对高运动内容挑战性数据集的性能有何影响?
  • RQ3在测试新数据集时,无需微调的在线微调能在多大程度上提升领域迁移性能?
  • RQ4将物体运动建模与在线微调相结合,是否能产生协同增益,优于单独使用任一组件?
  • RQ5与最先进无监督方法相比,该方法在KITTI和Cityscapes等基准测试中,特别是在对动态场景的鲁棒性方面表现如何?

主要发现

  • 所提方法在KITTI数据集上达到新的最先进水平,当同时使用运动建模与在线微调时,绝对相对误差(Abs Rel)降低至0.1052,相较基线的0.1563有显著提升。
  • 在具有高度动态场景的Cityscapes数据集中,该方法显著优于先前的无监督方法,证明其在复杂真实环境中的有效性。
  • 运动建模(M)与在线微调(R)的结合将RMSE分别降低至3.5591(50m限制)与4.7619(80m限制),在关键指标上相较基线提升超过10%。
  • 仅使用在线微调即可在各数据集上提升性能,尤其在KITTI上,Abs Rel从0.1388降至0.1175,表明其具备强大的领域适应能力。
  • 仅使用运动建模即可在两个数据集上提升性能,尤其在Cityscapes上,Abs Rel从0.1388降至0.1377,显示出其在处理动态场景中的价值。
  • 在使用修订版KITTI评估代码进行评估时,该方法仍优于所有先前方法,包括使用相同评估设置的方法,证实了其鲁棒性与泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。