Skip to main content
QUICK REVIEW

[论文解读] ClusterVO: Clustering Moving Instances and Estimating Visual Odometry for Self and Surroundings

Jiahui Huang, Sheng Yang|arXiv (Cornell University)|Mar 29, 2020
Video Surveillance and Tracking Methods参考文献 47被引用 4
一句话总结

ClusterVO 提出了一种实时立体视觉里程计系统,能够在不依赖几何或特定对象先验的情况下,联合估计自身运动并聚类动态场景中的运动刚性物体。它采用多层级概率关联和异质条件随机场(CRF),融合语义、空间和运动线索,实现在线聚类与滑动窗口优化,在 KITTI 和 Oxford Multimotion 数据集上实现了最先进性能,达到 8 FPS 的处理速度与具有竞争力的精度。

ABSTRACT

We present ClusterVO, a stereo Visual Odometry which simultaneously clusters and estimates the motion of both ego and surrounding rigid clusters/objects. Unlike previous solutions relying on batch input or imposing priors on scene structure or dynamic object models, ClusterVO is online, general and thus can be used in various scenarios including indoor scene understanding and autonomous driving. At the core of our system lies a multi-level probabilistic association mechanism and a heterogeneous Conditional Random Field (CRF) clustering approach combining semantic, spatial and motion information to jointly infer cluster segmentations online for every frame. The poses of camera and dynamic objects are instantly solved through a sliding-window optimization. Our system is evaluated on Oxford Multimotion and KITTI dataset both quantitatively and qualitatively, reaching comparable results to state-of-the-art solutions on both odometry and dynamic trajectory recovery.

研究动机与目标

  • 开发一种通用的、实时的视觉里程计系统,能够同时估计自身运动并跟踪动态场景中多个运动的刚性物体。
  • 克服先前方法依赖批处理、场景先验或对物体形状与结构的特殊假设的局限性。
  • 在室内与室外环境中(包括自动驾驶与增强现实应用)实现对动态物体与相机运动的准确且一致的聚类。
  • 设计一种在线系统,保持高效率与鲁棒性,无需密集的 RGB-D 输入或预定义的对象模板。

提出的方法

  • 一种多层级概率关联机制通过运动一致性与空间邻近性,在帧间跟踪稀疏的 2D 检测结果与 3D 三维特征点。
  • 一种异质条件随机场(CRF)融合语义边界框、空间亲和力与运动一致性,实现实时联合推断聚类分割。
  • 系统采用滑动窗口优化框架,同时求解相机位姿与动态物体轨迹。
  • CRF 建模结合了单变量与成对势函数,包含语义置信度、空间聚类与运动一致性项(公式 5)。
  • 该方法避免依赖物体尺寸先验或场景结构假设,从而在多样化环境中具备良好的泛化能力。
  • 系统在 KITTI 与 Oxford Multimotion 数据集的立体序列上进行训练与评估,仅使用稀疏特征与 2D 检测结果。

实验结果

研究问题

  • RQ1通用视觉里程计系统是否能在不依赖场景特定先验的情况下,实现对自身运动与动态物体跟踪的高精度?
  • RQ2仅使用稀疏 2D 检测与 3D 特征点,如何实现对运动刚性物体的鲁棒在线聚类?
  • RQ3在异质 CRF 中融合语义、空间与运动线索,对动态场景理解有何影响?
  • RQ4实时系统是否能在里程计与动态轨迹恢复性能上,达到与批处理优化或专用方法相当的水平?

主要发现

  • 在 KITTI 数据集上,ClusterVO 达到 8 FPS,显著优于 Chen 等人(每帧 1.2 秒)的方法,且与实时系统 DynSLAM 的效率相当。
  • 在 KITTI 数据集上,ClusterVO 的自身运动估计误差为 0.52 m(ATE)与 0.19 rad(RPE),与最先进方法性能相当。
  • 在动态物体跟踪方面,ClusterVO 在 KITTI 的 'Moderate' 类别中达到 49.65% AP(平均精度),优于 DynSLAM 的 47.16%,且对检测遗漏具有更强鲁棒性。
  • 消融实验表明,将 3D 几何与语义线索加入 CRF 后,与仅使用 2D 的 CRF 相比,聚类运动 ATE 降低 45.8%,证明了多模态融合的有效性。
  • 在 Oxford Multimotion 数据集上,系统取得竞争性结果,自身运动 ATE 为 0.61 m,聚类运动 ATE 为 0.13 m,尽管为在线系统,其性能已接近批处理优化的 ClusterSLAM。
  • 可视化结果表明,异质 CRF 能有效过滤误分类的特征点,提升聚类一致性与轨迹估计精度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。