Skip to main content
QUICK REVIEW

[论文解读] MVSTER: Epipolar Transformer for Efficient Multi-View Stereo

Xiaofeng Wang, Zheng Zhu|arXiv (Cornell University)|Apr 15, 2022
Advanced Vision and Imaging被引用 9
一句话总结

MVSTER 提出了一种高效的多视角立体方法,利用对极线上的对极 Transformer 联合建模 2D 语义与 3D 空间相关性,无需额外网络。其在 DTU 和 Tanks&Temples 上分别实现了 34% 和 14% 的相对精度提升,同时相比 MVSNet 和 CasMVSNet,推理时间分别减少了 80% 和 51%。

ABSTRACT

Learning-based Multi-View Stereo (MVS) methods warp source images into the reference camera frustum to form 3D volumes, which are fused as a cost volume to be regularized by subsequent networks. The fusing step plays a vital role in bridging 2D semantics and 3D spatial associations. However, previous methods utilize extra networks to learn 2D information as fusing cues, underusing 3D spatial correlations and bringing additional computation costs. Therefore, we present MVSTER, which leverages the proposed epipolar Transformer to learn both 2D semantics and 3D spatial associations efficiently. Specifically, the epipolar Transformer utilizes a detachable monocular depth estimator to enhance 2D semantics and uses cross-attention to construct data-dependent 3D associations along epipolar line. Additionally, MVSTER is built in a cascade structure, where entropy-regularized optimal transport is leveraged to propagate finer depth estimations in each stage. Extensive experiments show MVSTER achieves state-of-the-art reconstruction performance with significantly higher efficiency: Compared with MVSNet and CasMVSNet, our MVSTER achieves 34% and 14% relative improvements on the DTU benchmark, with 80% and 51% relative reductions in running time. MVSTER also ranks first on Tanks&Temples-Advanced among all published works. Code is released at https://github.com/JeffWang987.

研究动机与目标

  • 为解决现有基于学习的 MVS 方法因依赖额外网络进行特征融合而导致的效率低下与 3D 泛化能力有限的问题。
  • 在不引入额外可学习参数的前提下,利用对极线上的 3D 空间相关性。
  • 通过级联框架联合优化单目深度监督与多视角立体,提升深度估计精度。
  • 通过高效的注意力机制与熵正则化最优传输,降低计算成本,同时保持或提升重建质量。

提出的方法

  • 对极 Transformer 使用交叉注意力在对极线上建模数据相关的 3D 关联,利用从多个视角投影到参考相机视锥内的特征。
  • 辅助单目深度估计器在训练期间增强 2D 特征语义,训练完成后移除以避免运行时开销。
  • 将深度估计建模为一种深度感知分类问题,通过熵正则化最优传输求解,实现在级联阶段间更精细的深度图传播。
  • 采用熵正则化最优传输的级联结构,实现深度预测的渐进式优化,以极低计算成本提升精度。
  • 网络采用轻量级 3D CNN,使用 $3\times3\times1$ 卷积以减少 FLOPs,同时保持特征表示能力。
  • 多视角特征融合通过对极 Transformer 实现,替代传统的基于方差或加权融合,采用注意力驱动、几何感知的聚合方式。

实验结果

研究问题

  • RQ1能否在 MVS 中使用参数高效的注意力机制,有效建模对极线上的 3D 空间相关性?
  • RQ2辅助单目深度监督能否在不增加运行时成本的前提下改善 2D 特征语义?
  • RQ3熵正则化最优传输是否能在级联 MVS 流程中实现更准确、更精细的深度估计?
  • RQ4所提方法能否在显著降低推理时间的同时,实现相比现有 MVS 网络的 SOTA 性能?

主要发现

  • 与 MVSNet 相比,MVSTER 在 DTU 基准上实现了 34% 的相对精度提升,同时运行时间减少 80%。
  • 在同一基准上,MVSTER 相较于 CasMVSNet 提升 14% 相对精度,同时推理时间减少 51%。
  • MVSTER 在 Tanks&Temples-Advanced 基准上位列所有已发表方法之首,展现出卓越的泛化能力与鲁棒性。
  • 与 MVSNet 和 CasMVSNet 相比,MVSTER 分别将深度假设数量减少了 88% 和 73%,显著提升效率。
  • 消融实验确认,在 DTU 上,温度参数 $t_e = 2$ 和损失权重 $\lambda = 3 \times 10^{-4}$ 可获得最优性能。
  • 在 DTU、ETH3D 和 Tanks&Temples 上的点云可视化显示,MVSTER 在多样场景与深度范围内均能生成高质量、细节丰富的重建结果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。