Skip to main content
QUICK REVIEW

[论文解读] MVS^2: Deep Unsupervised Multi-view Stereo with Multi-View Symmetry

Yuchao Dai, Zhidong Zhu|arXiv (Cornell University)|Aug 30, 2019
Advanced Vision and Imaging参考文献 36被引用 18
一句话总结

该论文提出 MVS^2,这是首个用于多视角立体视觉的无监督深度学习框架,通过多视角对称性联合预测所有视角的深度图,并在无真实深度监督的情况下强制实现跨视角一致性。该方法在多个基准测试中实现了最先进性能,通过利用光度一致性与通过对称端到端训练学习到的遮挡图,实现了无需微调的强泛化能力。

ABSTRACT

The success of existing deep-learning based multi-view stereo (MVS) approaches greatly depends on the availability of large-scale supervision in the form of dense depth maps. Such supervision, while not always possible, tends to hinder the generalization ability of the learned models in never-seen-before scenarios. In this paper, we propose the first unsupervised learning based MVS network, which learns the multi-view depth maps from the input multi-view images and does not need ground-truth 3D training data. Our network is symmetric in predicting depth maps for all views simultaneously, where we enforce cross-view consistency of multi-view depth maps during both training and testing stages. Thus, the learned multi-view depth maps naturally comply with the underlying 3D scene geometry. Besides, our network also learns the multi-view occlusion maps, which further improves the robustness of our network in handling real-world occlusions. Experimental results on multiple benchmarking datasets demonstrate the effectiveness of our network and the excellent generalization ability.

研究动机与目标

  • 为了解决监督式 MVS 方法严重依赖大规模真实深度数据的问题,而此类数据往往不可用,且会阻碍在未见场景中的泛化能力。
  • 开发一种无监督深度学习框架用于多视角立体视觉,消除对 3D 监督的需求,同时保持各视角之间的几何一致性。
  • 通过联合学习深度图与遮挡图,提升在真实世界遮挡情况下的鲁棒性。
  • 证明仅通过图像扭曲误差——当受到跨视角深度一致性约束时——可有效驱动深度 MVS 网络的端到端训练。

提出的方法

  • 该网络采用对称架构,同时为所有输入视角预测深度图,将每个视角视为等同,而非依赖单一参考图像。
  • 利用可微分的单应变换生成基于预测深度图的视角间光度一致性损失。
  • 引入跨视角一致性损失,以强制不同视角的深度图之间在几何上达成一致,从而在训练和推理过程中促进三维一致性。
  • 通过利用深度一致性来检测并抑制训练过程中的遮挡区域,实现多视角遮挡推理的整合。
  • 仅使用图像扭曲误差作为监督信号,无需真实深度图,实现端到端训练。
  • 通过交替优化方案更新遮挡图与深度图,以提升鲁棒性与一致性。

实验结果

研究问题

  • RQ1基于深度学习的 MVS 系统是否能在无任何真实 3D 监督的情况下实现高质量的深度估计?
  • RQ2如何利用多视角对称性来强制实现多视角深度图之间的几何一致性?
  • RQ3跨视角深度一致性能否作为训练 MVS 网络的有效自监督信号?
  • RQ4学习到的遮挡图集成如何提升在真实世界遮挡场景下的鲁棒性?
  • RQ5无监督 MVS 模型在未见数据集上无需微调的泛化能力能达到何种程度?

主要发现

  • MVS^2 在所有基准数据集上均优于传统的基于几何的 COLMAP 方法,证明了即使在无 3D 监督的情况下,深度特征学习仍具有优势。
  • 在 SUN3D 数据集上,MVS^2 的绝对相对误差(Abs Rel)为 0.3488,优于 COLMAP(0.6232)和 DeMoN(0.2137),并在关键指标上达到或超过监督方法如 DeepMVS 的表现。
  • 在 RGB-D 数据集上,MVS^2 的 Abs Rel 为 0.4414,RMSE 为 1.2853,优于 COLMAP(0.5389 和 1.5051),且在无微调情况下展现出强大的泛化能力。
  • 在 DTU 数据集上,MVS^2 的 Abs Rel 为 0.3729,RMSE 为 1.3938,优于 COLMAP(0.3841 和 1.4795),并接近监督方法如 DeepMVS 的性能。
  • 在 Scenes11 数据集上,MVS^2 的 Abs Rel 为 0.5981,RMSE 为 2.9477,显著优于 COLMAP(0.6249 和 3.6575),且在多样化场景中表现出良好的泛化能力。
  • 在 Tanks and Temples 上的定性结果表明,MVS^2 无需任何微调即可重建出细节丰富的三维点云,证实了其强大的零样本泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。