Skip to main content
QUICK REVIEW

[论文解读] Fast-MVSNet: Sparse-to-Dense Multi-View Stereo With Learned Propagation and Gauss-Newton Refinement

Zehao Yu, Shenghua Gao|arXiv (Cornell University)|Mar 29, 2020
Advanced Vision and Imaging参考文献 44被引用 14
一句话总结

Fast-MVSNet 提出了一种轻量化、高效的稀疏到稠密多视角立体视觉框架,首先使用3D CNN预测稀疏的高分辨率深度图,然后通过受联合双边上采样启发的可学习局部传播网络进行稠密化,最后利用可微分高斯-牛顿层对结果进行精炼。该方法在DTU和Tanks and Temples数据集上实现了最先进水平的精度,同时相比Point-MVSNet和R-MVSNet分别实现了5倍和14倍的加速,这得益于其内存高效且端到端可训练的设计。

ABSTRACT

Almost all previous deep learning-based multi-view stereo (MVS) approaches focus on improving reconstruction quality. Besides quality, efficiency is also a desirable feature for MVS in real scenarios. Towards this end, this paper presents a Fast-MVSNet, a novel sparse-to-dense coarse-to-fine framework, for fast and accurate depth estimation in MVS. Specifically, in our Fast-MVSNet, we first construct a sparse cost volume for learning a sparse and high-resolution depth map. Then we leverage a small-scale convolutional neural network to encode the depth dependencies for pixels within a local region to densify the sparse high-resolution depth map. At last, a simple but efficient Gauss-Newton layer is proposed to further optimize the depth map. On one hand, the high-resolution depth map, the data-adaptive propagation method and the Gauss-Newton layer jointly guarantee the effectiveness of our method. On the other hand, all modules in our Fast-MVSNet are lightweight and thus guarantee the efficiency of our approach. Besides, our approach is also memory-friendly because of the sparse depth representation. Extensive experimental results show that our method is 5$ imes$ and 14$ imes$ faster than Point-MVSNet and R-MVSNet, respectively, while achieving comparable or even better results on the challenging Tanks and Temples dataset as well as the DTU dataset. Code is available at https://github.com/svip-lab/FastMVSNet.

研究动机与目标

  • 为解决现有基于深度学习的MVS方法效率低下问题,这些方法由于大型3D代价体积而计算成本高且内存占用大。
  • 通过采用稀疏到稠密、粗到精的框架,在不牺牲精度的前提下提升重建效率。
  • 设计轻量化、可微分的模块,以支持端到端训练,同时保持高分辨率深度细节。
  • 实现在机器人和增强现实等实际应用中对高分辨率MVS的实时性能。

提出的方法

  • 从多视角图像的2D CNN特征构建稀疏代价体积,利用3D CNN预测稀疏的高分辨率深度图。
  • 通过小型卷积网络学习局部图像区域内深度的依赖关系,传播稀疏深度值并实现深度图的稠密化,其灵感来源于联合双边上采样。
  • 引入可微分高斯-牛顿层,利用多视角特征和粗略深度预测对稠密深度图进行精炼。
  • 传播模块具有数据自适应性,并通过建模局部深度一致性来解释深度稠密化过程。
  • 所有组件均为轻量化设计且支持端到端可训练,通过稀疏表示实现高效推理与内存效率。
  • 通过光度滤波、几何一致性检查和多视角平均实现深度融合,以提升最终重建质量。

实验结果

研究问题

  • RQ1与现有基于3D CNN的方法相比,稀疏到稠密、粗到精的MVS框架是否能在显著提升推理速度和内存效率的同时实现高精度?
  • RQ2可学习的局部传播网络在不依赖大型3D卷积的情况下,对稀疏高分辨率深度图的稠密化效果如何?
  • RQ3在轻量化、端到端的MVS流水线中,可微分高斯-牛顿精炼层在多大程度上提升了深度图的精度?
  • RQ4几何一致性阈值和可见视角数量等超参数如何影响重建中精度与完整度之间的权衡?

主要发现

  • Fast-MVSNet在DTU数据集上相比Point-MVSNet和R-MVSNet分别实现了5倍和14倍的加速,同时保持了相当或更优的精度。
  • 该方法通过使用稀疏表示并避免大型3D代价体积,显著降低了内存消耗,使其适用于高分辨率场景。
  • 高斯-牛顿精炼层使重建精度相对基线提升了10%,且单次迭代后增益基本不再提升。
  • 融合超参数(η 和 V)显著影响精度与完整度之间的权衡,其中 η=0.12 且 V=3 时整体性能最佳。
  • 消融实验表明,高斯-牛顿层极为有效,性能在一次迭代后即趋于稳定,从而证明其在单步精炼中的合理性。
  • 在DTU数据集上的重建结果表明,所有场景均生成了稠密、精确且抗噪声的3D输出。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。