Skip to main content
QUICK REVIEW

[论文解读] Robustness Meets Deep Learning: An End-to-End Hybrid Pipeline for Unsupervised Learning of Egomotion

Alex Zihao Zhu, Wenxin Liu|arXiv (Cornell University)|Dec 20, 2018
Advanced Vision and Imaging参考文献 33被引用 14
一句话总结

该论文提出了一种端到端、无监督的混合流水线,结合深度学习与几何优化,以鲁棒地估计单目自运动。通过在神经网络预测的光流和视差上应用RANSAC,提取内点对应关系,该方法估计相机位姿并应用细化的光度损失,实现了在KITTI数据集上的最先进性能,且对独立运动物体和无纹理区域具有更强的鲁棒性。

ABSTRACT

In this work, we propose a method that combines unsupervised deep learning predictions for optical flow and monocular disparity with a model based optimization procedure for instantaneous camera pose. Given the flow and disparity predictions from the network, we apply a RANSAC outlier rejection scheme to find an inlier set of flows and disparities, which we use to solve for the relative camera pose in a least squares fashion. We show that this pipeline is fully differentiable, allowing us to combine the pose with the network outputs as an additional unsupervised training loss to further refine the predicted flows and disparities. This method not only allows us to directly regress relative pose from the network outputs, but also automatically segments away pixels that do not fit the rigid scene assumptions that many unsupervised structure from motion methods apply, such as on independently moving objects. We evaluate our method on the KITTI dataset, and demonstrate state of the art results, even in the presence of challenging independently moving objects.

研究动机与目标

  • 为解决端到端深度学习方法在自运动估计中缺乏鲁棒性与安全性的问题,尤其是在存在独立运动物体等挑战性条件下的表现。
  • 克服卷积神经网络直接回归位姿的局限性,后者缺乏几何保证且对异常值敏感。
  • 将几何优化(RANSAC)整合到无监督学习框架中,以在无需标注位姿数据的情况下提升精度与鲁棒性。
  • 通过几何一致性自动分割非刚性场景成分(如移动车辆、阴影),而非显式学习掩码。

提出的方法

  • 该流水线使用两个全卷积网络,分别从时间序列图像对中预测光流,从立体图像对中预测单目视差。
  • 在预测的光流和视差图上应用RANSAC,以识别最符合刚性运动模型的内点对应关系,从而获得相机速度和角速度的鲁棒估计。
  • 利用估计的位姿通过刚性运动模型生成合成的扭曲图像,实现预测光流/视差与扭曲光流/视差之间的光度一致性损失。
  • 通过从视差和位姿估计光流、反之亦然,引入一种新颖的细化损失,仅在RANSAC选出的内点像素上应用光度损失。
  • 整个流水线完全可微,允许位姿估计通过反向传播反向更新光流和视差网络,以在训练过程中进行优化。
  • 利用RANSAC得到的内点掩码对光度损失进行掩码处理,确保仅对几何上一致的预测进行监督。

实验结果

研究问题

  • RQ1与仅使用端到端学习相比,结合深度学习与几何优化的混合流水线是否能显著提升无监督自运动估计的鲁棒性?
  • RQ2RANSAC-based 异常值剔除在无需显式分割的情况下,能否有效识别并排除独立运动物体与无纹理区域?
  • RQ3基于位姿与跨模态一致性的细化光度损失,在多大程度上能提升光流与视差预测的精度?
  • RQ4即使网络预测存在噪声,RANSAC内点选择是否仍能带来与更优模型相当的性能?
  • RQ5所提出方法是否能在更小的网络架构下,于KITTI数据集上实现最先进性能?

主要发现

  • 该方法在KITTI Flow 2015基准上实现了最先进性能,端到端光流误差(EPE)为10.66,内点准确率为45.84%,优于先前的无监督方法。
  • 细化损失显著提升了性能:若移除该损失,EPE从10.66上升至11.80,证明其有效性。
  • RANSAC选出的内点具有显著更低的误差——内点上的EPE为3.21(相较整体EPE 10.66),表明该方法能有效分离出高质量预测。
  • RANSAC生成的内点掩码成功去除了独立运动物体、阴影、天空与植被,即使网络在这些区域表现不佳。
  • 在KITTI Stereo 2015上,该方法在所有像素上的深度RMSE为12.63,而在RANSAC内点上降低至8.00,表明内点质量极高。
  • 消融实验确认,RANSAC内点选择与细化损失均至关重要,移除任一均导致性能显著下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。