Skip to main content
QUICK REVIEW

[论文解读] Motion Segmentation by Exploiting Complementary Geometric Models

Xun Xu, Loong‐Fah Cheong|arXiv (Cornell University)|Apr 6, 2018
Advanced Vision and Imaging参考文献 29被引用 6
一句话总结

本文提出了一种多视角谱聚类框架,通过协同结合基础矩阵与单应矩阵模型,提升在具有强烈透视效应和近退化运动的现实场景中的运动分割性能。通过协同正则化融合互补的几何模型,该方法在基准数据集上实现了最先进性能,并提出了一个新的真实世界数据集 KT3DMoSeg,以评估在复杂条件下的鲁棒性。

ABSTRACT

Many real-world sequences cannot be conveniently categorized as general or degenerate; in such cases, imposing a false dichotomy in using the fundamental matrix or homography model for motion segmentation would lead to difficulty. Even when we are confronted with a general scene-motion, the fundamental matrix approach as a model for motion segmentation still suffers from several defects, which we discuss in this paper. The full potential of the fundamental matrix approach could only be realized if we judiciously harness information from the simpler homography model. From these considerations, we propose a multi-view spectral clustering framework that synergistically combines multiple models together. We show that the performance can be substantially improved in this way. We perform extensive testing on existing motion segmentation datasets, achieving state-of-the-art performance on all of them; we also put forth a more realistic and challenging dataset adapted from the KITTI benchmark, containing real-world effects such as strong perspectives and strong forward translations not seen in the traditional datasets.

研究动机与目标

  • 解决仅使用基础矩阵或单应矩阵模型在具有强烈透视效应和近退化运动的现实场景中进行运动分割时的局限性。
  • 探究尽管在广角视场场景中缺乏几何精确性,为何基于单应矩阵的方法仍能优于基础矩阵方法。
  • 开发一种融合框架,协同结合多种几何模型,以提升子空间聚类性能。
  • 创建一个新的、真实的基准数据集(KT3DMoSeg),以反映运动分割中的现实世界挑战。
  • 证明只有当与互补模型(如单应矩阵)结合时,基础矩阵模型的全部潜力才能被充分实现。

提出的方法

  • 该方法采用多视角谱聚类框架,从多个几何模型(基础矩阵 F、单应矩阵 H 和仿射 A)生成亲和矩阵。
  • 通过协同正则化融合这些视角的谱嵌入,利用互补信息提升聚类质量。
  • 通过单应矩阵假设引入虚拟平面切片,增强非物理但刚性运动表面之间的连通性,减少过分割。
  • 融合过程通过正则化参数 λ 和 γ 对单个视角(F-视图、H-视图、A-视图)进行修正,从而纠正单一模型方法的固有缺陷。
  • 最终聚类通过在协同正则化嵌入上运行 k-means 完成,性能在标准基准和新提出的 KT3DMoSeg 数据集上进行评估。
  • 该方法在 Hopkins155、Hopkins12、MTPV62 和新提出的 KT3DMoSeg 数据集上进行评估,并对序列进行了定量误差分析。

实验结果

研究问题

  • RQ1为何基于单应矩阵的方法在 Hopkins155 上实现最先进性能,尽管在具有透视效应的场景中缺乏几何精确性?
  • RQ2除退化之外,还有哪些因素会阻碍基础矩阵模型在运动分割中的性能?
  • RQ3在具有强烈透视效应和非平面运动的现实场景中,基础矩阵模型的潜力能否被实现?
  • RQ4如何有效融合互补的几何模型(单应矩阵与基础矩阵)以提升运动分割中的子空间聚类性能?
  • RQ5协同正则化在复杂现实世界运动分割场景中,能在多大程度上提升单个几何模型的性能?

主要发现

  • 所提出的多视角融合框架在所有评估数据集(包括 Hopkins155、Hopkins12 和 MTPV62)上均实现了最先进性能。
  • 协同正则化方案使基础矩阵视图的性能超越其单独表现,当正则化参数适当调优时,实现了最佳总体结果。
  • 单应矩阵模型在 Hopkins155 上的成功归因于虚拟平面切片,其增强了刚性运动表面之间的连通性,减少了过分割。
  • 新提出的 KT3DMoSeg 数据集揭示了真实世界运动分割中的显著挑战,包括背景分裂、前景检测失败以及运动物体的对极模糊性。
  • 在具有强烈透视效应和非紧凑背景结构的场景中,单应矩阵模型由于连通性较低而倾向于过分割,而基础矩阵模型则因子空间重叠和错误分组而表现不佳。
  • 该方法成功纠正了单个模型的错误,如背景分裂或前景与静态物体的错误合并,证明了模型融合的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。