Skip to main content
QUICK REVIEW

[论文解读] Monocular Dense 3D Reconstruction of a Complex Dynamic Scene from Two Perspective Frames

Suryansh Kumar, Yuchao Dai|arXiv (Cornell University)|Aug 15, 2017
Advanced Vision and Imaging参考文献 21被引用 11
一句话总结

该论文提出 SuperpixelSoup 算法,仅通过两幅透视图像即可实现复杂动态场景的单目密集3D重建,利用超像素过分割和尽可能刚性(ARAP)约束来解决尺度模糊问题。该方法在无需物体分割、模板先验或每物体刚性假设的前提下,实现了最先进(SOTA)的重建精度,能够稳健重建非刚性、分段平面的场景,且输入需求极少。

ABSTRACT

This paper proposes a new approach for monocular dense 3D reconstruction of a complex dynamic scene from two perspective frames. By applying superpixel over-segmentation to the image, we model a generically dynamic (hence non-rigid) scene with a piecewise planar and rigid approximation. In this way, we reduce the dynamic reconstruction problem to a "3D jigsaw puzzle" problem which takes pieces from an unorganized "soup of superpixels". We show that our method provides an effective solution to the inherent relative scale ambiguity in structure-from-motion. Since our method does not assume a template prior, or per-object segmentation, or knowledge about the rigidity of the dynamic scene, it is applicable to a wide range of scenarios. Extensive experiments on both synthetic and real monocular sequences demonstrate the superiority of our method compared with the state-of-the-art methods.

研究动机与目标

  • 解决在传统刚性结构光流法失效的复杂动态场景中,由于非刚性和缺乏先验知识而导致的密集3D重建挑战。
  • 消除在一般动态场景中难以且易出错的物体级运动分割需求。
  • 利用几何约束解决单目3D重建中固有的相对尺度模糊问题。
  • 开发一个统一框架,在局部刚性、全局尽可能刚性变形和分段平面场景结构等弱假设下运行。
  • 实现仅用两幅图像即可完成高保真3D重建,适用于移动设备和实时应用。

提出的方法

  • 该方法使用超像素过分割将每幅图像划分为感知上一致的、类似平面的区域,形成‘超像素汤’。
  • 通过在尽可能刚性(ARAP)约束下优化超像素的3D位置,将3D重建建模为‘3D超像素拼图’问题。
  • ARAP能量项通过最小化K近邻邻域内对刚性变换的偏离,来强制实现局部刚性。
  • 采用全局优化框架,通过结合光度一致性与ARAP正则化的代价函数,对齐两视图中的超像素。
  • 通过求解一个非凸优化问题,联合估计深度与3D结构,同时考虑透视投影和尺度模糊问题。
  • 利用分段平面假设简化重建问题,并提升对非刚性运动的鲁棒性。

实验结果

研究问题

  • RQ1能否仅通过两幅透视图像,在无需物体级分割的前提下,实现复杂动态场景的密集3D重建?
  • RQ2能否通过几何先验而非多视角约束来解决单目3D重建中的相对尺度模糊问题?
  • RQ3尽可能刚性(ARAP)约束是否足以实现对非刚性、分段平面场景的精确重建?
  • RQ4在不同场景复杂度下,K-NN图中K值的选择如何影响重建质量?
  • RQ5在仅使用两幅视图的情况下,统一框架能否优于多帧方法?

主要发现

  • 所提出的 SuperpixelSoup 方法在 MPI Sintel、Virtual KITTI 和 KITTI 等基准数据集上实现了最先进(SOTA)的重建精度,即使对比方法使用多帧图像。
  • 在 Kinect_Paper 和 Kinect_Tshirt 数据集上,尽管仅使用两帧图像,该方法在平均深度误差上仍优于多帧非刚性 SfM 方法(如 GLRT、BMM、PTA)。
  • 通过利用 ARAP 约束,该方法有效解决了单目重建中的相对尺度模糊问题,该约束在无需外部标定的情况下稳定了尺度。
  • 实验表明,K=15–20 时重建质量最优;K值过低导致过拟合,K值过高则引起过度平滑和错误区域合并。
  • 在 YouTube-Objects 数据集上的视觉结果表明,该方法在无真实标签的真实视频序列中仍具鲁棒性,证实了其实际适用性。
  • 即使在大运动导致邻近超像素关系被破坏的情况下,该方法仍保持有效性,尽管在极端情况下性能有所下降,如附录材料所示。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。