Skip to main content
QUICK REVIEW

[论文解读] Deep Rigid Instance Scene Flow

Wei-Chiu Ma, Shenlong Wang|arXiv (Cornell University)|Apr 18, 2019
Advanced Vision and Imaging参考文献 45被引用 7
一句话总结

本文提出深度刚性实例场景光流(DRISF),一种结合深度神经网络(用于光流、视差和实例分割)与基于几何的能量函数的深度结构化模型,通过GPU加速的高斯-牛顿求解器进行优化,实现了在KITTI数据集上的最先进精度,同时比之前的方法快800倍。

ABSTRACT

In this paper we tackle the problem of scene flow estimation in the context of self-driving. We leverage deep learning techniques as well as strong priors as in our application domain the motion of the scene can be composed by the motion of the robot and the 3D motion of the actors in the scene. We formulate the problem as energy minimization in a deep structured model, which can be solved efficiently in the GPU by unrolling a Gaussian-Newton solver. Our experiments in the challenging KITTI scene flow dataset show that we outperform the state-of-the-art by a very large margin, while being 800 times faster.

研究动机与目标

  • 解决自动驾驶场景中实时、高精度3D场景光流估计的挑战。
  • 在深度学习框架中利用强几何先验——特别是动态物体和自车的刚性运动——。
  • 克服纯深度学习方法的局限性,这些方法缺乏结构一致性,且无法在物体实例间强制实现一致的运动。
  • 通过将高斯-牛顿求解器展开为可微分的端到端可训练神经网络,实现高精度与实时性能。

提出的方法

  • 该方法首先使用深度神经网络从连续的立体图像对中估计光流、视差和实例分割。
  • 通过使用多种基于几何的能源函数(包括光度、光流和刚性运动项)将场景光流估计建模为能量最小化问题。
  • 通过高斯-牛顿求解器最小化能量函数,该求解器被展开为循环神经网络层,以实现端到端反向传播和GPU加速。
  • 求解器强制要求属于同一实例的像素共享相同的3D刚性运动,从而在物体边界处确保结构一致性。
  • 整个流程(包括视觉线索提取和优化)均在GPU上实现,以支持实时推理。
  • 模型采用端到端训练,优化步骤具有可微性,从而实现视觉线索与场景光流的联合学习。

实验结果

研究问题

  • RQ1结合学习到的视觉线索与几何先验的深度结构化模型,能否在3D场景光流估计中实现更优的精度与速度?
  • RQ2在自动驾驶场景中,刚性运动先验在提升动态物体和背景的场景光流估计方面有多有效?
  • RQ3通过可微分优化层整合光流、视差和分割线索,在多大程度上能提升运动一致性并减少遮挡误差?
  • RQ4展开的高斯-牛顿求解器能否在GPU上高效实现,以支持实时推理同时保持高精度?

主要发现

  • 与之前最先进方法相比,DRISF在KITTI场景光流数据集上将D1异常值比例降低43%,D2降低32%,光流异常值降低24%。
  • 该方法的场景光流误差比之前最佳模型降低22%,同时运行时间快800倍。
  • 将光流预测替换为真实值可使场景光流误差降低21%,表明光流模块仍有显著改进空间。
  • 将立体视差替换为真实值可使误差降低8%,表明当前流程中立体估计是主要瓶颈。
  • 消融研究显示,加入光流和刚性运动项可提升前景物体的性能,而仅使用光度项对有纹理背景最为理想。
  • 与基线深度学习方法相比,该模型生成了更清晰的物体边界,并显著减少了遮挡误差,证明了结构先验的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。