Skip to main content
QUICK REVIEW

[论文解读] Cascaded Scene Flow Prediction using Semantic Segmentation

Zhile Ren, Deqing Sun|arXiv (Cornell University)|Jul 26, 2017
Advanced Vision and Imaging参考文献 19被引用 6
一句话总结

本文提出了一种级联条件随机场框架,将语义分割与立体匹配及光流估计相结合,以提升3D场景光流预测性能。通过利用实例级语义线索,迭代优化分割、深度、运动与光流,该方法在KITTI基准上实现了最先进性能,尤其在运动车辆上表现显著,将前景视差误差降低至8.40,光流误差降低至8.20(D1-fg与Fl-fg)。

ABSTRACT

Given two consecutive frames from a pair of stereo cameras, 3D scene flow methods simultaneously estimate the 3D geometry and motion of the observed scene. Many existing approaches use superpixels for regularization, but may predict inconsistent shapes and motions inside rigidly moving objects. We instead assume that scenes consist of foreground objects rigidly moving in front of a static background, and use semantic cues to produce pixel-accurate scene flow estimates. Our cascaded classification framework accurately models 3D scenes by iteratively refining semantic segmentation masks, stereo correspondences, 3D rigid motion estimates, and optical flow fields. We evaluate our method on the challenging KITTI autonomous driving benchmark, and show that accounting for the motion of segmented vehicles leads to state-of-the-art performance.

研究动机与目标

  • 解决在低纹理和反光表面条件下,运动前景物体(尤其是车辆)3D场景光流估计不准确的问题。
  • 克服基于超像素的方法对刚性物体过度分割且无法共享全局运动信息的局限性。
  • 利用语义实例分割引导分段刚性运动建模,提升几何与运动的一致性。
  • 设计一种高效、迭代的框架,通过结构化预测同时优化多个场景光流组件。
  • 通过在级联推理流程中整合语义线索,在KITTI场景光流基准上实现最先进性能。

提出的方法

  • 使用实例级语义分割作为先验,识别刚性运动的前景物体,特别是车辆。
  • 设计一种多阶段条件随机场(CRF)的级联分类框架,联合建模分割、立体视差、光流与3D刚性运动。
  • 通过结构化SVM学习迭代优化各阶段,利用结构化预测对所有场景光流组件进行迭代精炼。
  • 解耦高维输出空间,并应用高效的置信传播算法,实现在单核CPU上的实时推理。
  • 以非语义场景光流方法(PRSF)的噪声预测初始化级联流程,逐步利用语义与几何约束提升估计精度。
  • 通过建模连续帧间的运动一致性,引入时间一致性,提升后期级联阶段的准确性。

实验结果

研究问题

  • RQ1语义分割能否提升复杂真实场景中刚性运动物体的3D场景光流估计精度?
  • RQ2通过级联CRF框架进行迭代精炼,如何增强视差、光流与运动估计的一致性与精确度?
  • RQ3语义线索在挡风玻璃和低纹理车辆表面等困难区域中,能在多大程度上减少误差?
  • RQ4与基于超像素的基线方法相比,实例级语义分割的引入是否在KITTI场景光流基准上带来可测量的性能提升?
  • RQ5级联结构如何在高维场景光流估计中平衡计算效率与精度?

主要发现

  • 所提方法在KITTI验证集上实现前景视差误差(D1-fg)为8.40,前景光流误差(Fl-fg)为8.20,优于先前最先进方法。
  • 性能在级联阶段显著提升:D1-fg从PRSF的10.10降至三轮迭代后的8.40,表明迭代精炼有效。
  • 当提供真实语义分割掩码时,方法实现D1-fg误差为7.61,Fl-fg为3.56,证明准确语义线索具有显著影响。
  • 级联的第一阶段通过独立建模分割与几何信息降低误差,第二阶段则通过时间一致性进一步优化。
  • 尽管输出空间维度高,但通过解耦推理与消息传递算法,方法在单核CPU上仍保持高效。
  • 当语义分割未能正确检测车辆边界时,出现失败案例,证实性能高度依赖于准确的实例分割。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。