Skip to main content
QUICK REVIEW

[论文解读] Learning Unsupervised Multi-View Stereopsis via Robust Photometric Consistency

Tejas Khot, Shubham Agrawal|arXiv (Cornell University)|May 7, 2019
Advanced Vision and Imaging参考文献 36被引用 64
一句话总结

本文提出一种用于多视图立体(MVS)的无监督学习方法,使用鲁棒光度一致性损失在没有真实三维数据的情况下训练深度预测,从而在隐式遮挡处理下实现具有竞争力的密集重建。

ABSTRACT

We present a learning based approach for multi-view stereopsis (MVS). While current deep MVS methods achieve impressive results, they crucially rely on ground-truth 3D training data, and acquisition of such precise 3D geometry for supervision is a major hurdle. Our framework instead leverages photometric consistency between multiple views as supervisory signal for learning depth prediction in a wide baseline MVS setup. However, naively applying photo consistency constraints is undesirable due to occlusion and lighting changes across views. To overcome this, we propose a robust loss formulation that: a) enforces first order consistency and b) for each point, selectively enforces consistency with some views, thus implicitly handling occlusions. We demonstrate our ability to learn MVS without 3D supervision using a real dataset, and show that each component of our proposed robust loss results in a significant improvement. We qualitatively observe that our reconstructions are often more complete than the acquired ground truth, further showing the merits of this approach. Lastly, our learned model generalizes to novel settings, and our approach allows adaptation of existing CNNs to datasets without ground-truth 3D by unsupervised finetuning. Project webpage: https://tejaskhot.github.io/unsup_mvs

研究动机与目标

  • 推动在不需要地面真相三维监督的情况下学习MVS。
  • 利用多视图之间的光度一致性作为深度预测的监督。
  • 开发一种鲁棒损失,在MVS场景下处理遮挡和光照变化。

提出的方法

  • 在给定多视图的情况下,使用CNN预测每个图像的深度图。
  • 使用可微分的像素级扭曲来合成视图并计算光度再投影损失。
  • 引入逐像素的Top-K视图损失聚合,以处理遮挡的鲁棒性。
  • 结合一阶梯度一致性以降低光照变化的影响。
  • 在加权目标中将光度损失与SSIM和边缘感知深度平滑性结合。
  • 在多视图图像集上使用Adam端到端训练;推断阶段将深度图融合成3D点云。

实验结果

研究问题

  • RQ1是否可以通过利用跨视图的光度一致性,在没有3D地面真相的情况下学习MVS深度预测?
  • RQ2在多视图光度再投影损失框架中,如何对遮挡和光照变化进行鲁棒处理?
  • RQ3对视图一致性损失进行Top-K选择是否能改善MVS中深度预测的训练信号?
  • RQ4学习得到的模型是否在无3D监督的情况下对未见数据集和设置具广泛泛化能力?
  • RQ5无监督微调是否能提升在缺少3D注释的数据集上的性能?

主要发现

  • 使用Top-K视图聚合的鲁棒光度损失在重建质量上优于简单的光度一致性。
  • 鲁棒模型在DTU上以若干指标超越基线和若干经典方法,接近有监督方法。
  • 使用鲁棒损失训练在低纹理区域产生更少的空洞、重建更完整。
  • 在新数据集上对预训练模型进行微调,使用鲁棒损失,在无需3D注释的情况下提升性能。
  • 该模型在不微调的情况下对Tanks and Temples表现出泛化能力,但由于深度范围挑战而存在局限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。