[论文解读] Recurrent MVSNet for High-resolution Multi-view Stereo Depth Inference
该论文提出R-MVSNet,一种基于循环神经网络的框架,用深度可分离门控循环单元(GRU)替代多视角立体(MVS)重建中的3D CNN,以正则化3D代价体积。通过沿深度方向顺序处理代价图,R-MVSNet将内存消耗从立方级降低至二次方级,从而实现此前基于标准学习方法难以企及的高分辨率、大规模MVS重建。
Deep learning has recently demonstrated its excellent performance for multi-view stereo (MVS). However, one major limitation of current learned MVS approaches is the scalability: the memory-consuming cost volume regularization makes the learned MVS hard to be applied to high-resolution scenes. In this paper, we introduce a scalable multi-view stereo framework based on the recurrent neural network. Instead of regularizing the entire 3D cost volume in one go, the proposed Recurrent Multi-view Stereo Network (R-MVSNet) sequentially regularizes the 2D cost maps along the depth direction via the gated recurrent unit (GRU). This reduces dramatically the memory consumption and makes high-resolution reconstruction feasible. We first show the state-of-the-art performance achieved by the proposed R-MVSNet on the recent MVS benchmarks. Then, we further demonstrate the scalability of the proposed method on several large-scale scenarios, where previous learned approaches often fail due to the memory constraint. Code is available at https://github.com/YoYo000/MVSNet.
研究动机与目标
- 解决基于3D CNN的代价体积正则化在基于深度学习的MVS方法中内存消耗过高的问题。
- 通过将内存复杂度从模型分辨率的立方级降低至二次方级,实现可扩展的高分辨率MVS重建。
- 在与现有基于学习的MVS方法(如MVSNet)相比时,保持或提升重建质量。
- 证明在具有宽深度范围的大规模场景中,端到端学习型MVS的可行性。
- 提供一种内存高效替代3D CNN的方案,且在标准基准测试中不损失性能。
提出的方法
- 用沿深度维顺序处理代价图的卷积门控循环单元(GRU)替代MVSNet中基于3D CNN的代价体积正则化模块。
- 利用GRU以递归、内存高效的方式聚合3D代价体积中的空间与深度上下文信息。
- 沿深度方向逐切片处理代价体积,将在线内存使用从O(H×W×D³)降低至O(H×W×D²)。
- 利用MVSNet中的可微分单应性变换构建来自多视角图像的初始代价体积。
- 应用后处理步骤,包括变分优化、光度滤波、几何滤波和深度图融合,以提升最终点云质量。
- 在标准MVS基准(DTU、Tanks and Temples、ETH3D)上以固定输入尺寸端到端训练网络,并在任意输入尺寸上部署而无需微调。
实验结果
研究问题
- RQ1循环结构是否能在保持或提升重建质量的同时,降低3D代价体积正则化中的内存消耗?
- RQ2与3D CNN相比,通过GRU实现的顺序处理在高分辨率MVS中的内存效率和可扩展性方面优势有多大?
- RQ3所提方法是否能够处理因内存限制而使先前基于学习的方法无法处理的大规模MVS场景(具有宽深度范围)?
- RQ4在DTU、Tanks and Temples和ETH3D等标准基准上,R-MVSNet的性能与MVSNet及其他基线方法相比如何?
- RQ5后处理组件(如变分优化、滤波)对所提框架最终重建质量的影响如何?
主要发现
- R-MVSNet在DTU、Tanks and Temples和ETH3D基准上达到最先进性能,其结果与原始MVSNet相比相当或更优。
- 在分辨率640×512×256的DTU数据集上,R-MVSNet的f_score达到0.465,在消融研究中优于基线3D CNN-based MVSNet。
- 该方法将运行时内存使用从与模型分辨率的立方级关系降低为二次方级关系,使此前基于学习的MVS方法无法实现的高分辨率重建成为可能。
- R-MVSNet成功重建了如Tanks and Temples中的大型场景,而此前基于学习的方法因内存限制无法处理此类场景。
- 后处理组件(如变分优化和光度滤波)显著提升了重建质量,f_score从无融合时的0.431提升至完整流程下的0.465。
- 尽管仅在DTU上进行训练,该模型在未微调的情况下对不同数据集泛化能力良好,在Tanks and Temples和ETH3D上也取得了优异表现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。