[论文解读] MVS2D: Efficient Multi-view Stereo via Attention-Driven 2D Convolutions
MVS2D 提出了一种高效的多视角立体匹配方法,通过注意力机制将多视角约束整合到单视角2D卷积网络中,在保持最先进深度估计精度的同时,推理速度比之前的方法快达48倍。该方法采用对极线注意力机制,在计算开销最小的情况下融合多视角特征。
Deep learning has made significant impacts on multi-view stereo systems. State-of-the-art approaches typically involve building a cost volume, followed by multiple 3D convolution operations to recover the input image's pixel-wise depth. While such end-to-end learning of plane-sweeping stereo advances public benchmarks' accuracy, they are typically very slow to compute. We present \ouralg, a highly efficient multi-view stereo algorithm that seamlessly integrates multi-view constraints into single-view networks via an attention mechanism. Since \ouralg only builds on 2D convolutions, it is at least $2 imes$ faster than all the notable counterparts. Moreover, our algorithm produces precise depth estimations and 3D reconstructions, achieving state-of-the-art results on challenging benchmarks ScanNet, SUN3D, RGBD, and the classical DTU dataset. our algorithm also out-performs all other algorithms in the setting of inexact camera poses. Our code is released at \url{https://github.com/zhenpeiyang/MVS2D}
研究动机与目标
- 解决基于3D卷积的最先进多视角立体匹配(MVS)方法计算成本过高的问题,同时保持或提升精度。
- 在不依赖3D代价体或全局场景表示的前提下,无缝将多视角几何约束整合到单视角2D卷积神经网络架构中。
- 通过在注意力机制中引入多尺度特征聚合,提升对相机位姿不准确情况的鲁棒性。
- 在保持深度估计质量的前提下,实现极高的推理速度,适用于具有挑战性的基准测试。
提出的方法
- 提出一种对极线注意力模块,将来自多张参考图像的特征沿对极线聚合到参考图像中的查询像素上。
- 在整个网络中仅使用2D卷积,避免昂贵的3D卷积,从而实现更快的推理速度。
- 采用可学习的深度编码来表示深度假设,与网络联合优化以提升特征表示能力。
- 在编码器-解码器架构中应用多尺度注意力模块,以在相机位姿不准确时提升鲁棒性。
- 将注意力模块集成到标准的2D U-Net主干网络中,便于在现有单视角深度估计框架中轻松部署。
- 通过早期融合单视角与多视角特征,利用3D几何线索增强中间特征表示。
实验结果
研究问题
- RQ1是否仅使用2D卷积即可实现多视角立体匹配,同时保持最先进精度并显著提升推理速度?
- RQ2一种沿对极线操作的注意力机制,在无需显式构建3D代价体的情况下,融合多视角特征的效率如何?
- RQ3多尺度注意力在相机位姿存在噪声或不准确时,能在多大程度上提升模型鲁棒性?
- RQ4端到端学习的深度编码是否能在MVS任务中超越固定编码(如余弦或线性编码)?
主要发现
- MVS2D在ScanNet、SUN3D、RGBD和DTU基准上均达到最先进性能,在噪声位姿设置下,ScanNet上的AbsRel为0.059,DTU上的AbsRel也为0.059。
- 在DTU数据集上,MVS2D在640×480分辨率下达到36.4 FPS,比PatchmatchNet快2.2倍,比MVSNet快4.7倍。
- 在DTU验证集上,MVS2D的RMSE为14.769 mm,超过71.8%的误差低于1.0 mm阈值,优于PatchmatchNet(RMSE为32.348 mm)。
- 消融实验表明,学习的深度编码将AbsRel从0.139(均匀编码)降低至0.059,证明其在性能中的关键作用。
- 在噪声位姿设置下,采用多尺度注意力的MVS2D(Ours-robust)达到0.059的AbsRel,优于MVSNet(0.094)和DPSNet(0.094),展现出强鲁棒性。
- 该方法比NAS快48倍,比DPSNet快39倍,比MVSNet快10倍,同时保持最先进精度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。