Skip to main content
QUICK REVIEW

[论文解读] Dense Hybrid Recurrent Multi-view Stereo Net with Dynamic Consistency Checking

Jianfeng Yan, Zizhuang Wei|arXiv (Cornell University)|Jul 21, 2020
Advanced Vision and Imaging参考文献 31被引用 10
一句话总结

该论文提出D² HC-RMVSNet,一种轻量级密集混合循环多视角立体网络,结合动态一致性检查,实现高精度、内存高效的密集3D重建。该方法引入DRENet特征提取器与HU-LSTM进行多尺度特征聚合,同时动态一致性检查提升了深度图融合的鲁棒性,在Tanks and Temples数据集上达到最先进性能,内存消耗较R-MVSNet降低19.4%。

ABSTRACT

In this paper, we propose an efficient and effective dense hybrid recurrent multi-view stereo net with dynamic consistency checking, namely $D^{2}$HC-RMVSNet, for accurate dense point cloud reconstruction. Our novel hybrid recurrent multi-view stereo net consists of two core modules: 1) a light DRENet (Dense Reception Expanded) module to extract dense feature maps of original size with multi-scale context information, 2) a HU-LSTM (Hybrid U-LSTM) to regularize 3D matching volume into predicted depth map, which efficiently aggregates different scale information by coupling LSTM and U-Net architecture. To further improve the accuracy and completeness of reconstructed point clouds, we leverage a dynamic consistency checking strategy instead of prefixed parameters and strategies widely adopted in existing methods for dense point cloud reconstruction. In doing so, we dynamically aggregate geometric consistency matching error among all the views. Our method ranks extbf{$1^{st}$} on the complex outdoor extsl{Tanks and Temples} benchmark over all the methods. Extensive experiments on the in-door DTU dataset show our method exhibits competitive performance to the state-of-the-art method while dramatically reduces memory consumption, which costs only $19.4\%$ of R-MVSNet memory consumption. The codebase is available at \hyperlink{https://github.com/yhw-yhw/D2HC-RMVSNet}{https://github.com/yhw-yhw/D2HC-RMVSNet}.

研究动机与目标

  • 解决基于深度学习的MVS方法因下采样和固定融合策略导致的内存效率低下与精度损失问题。
  • 实现在不牺牲重建质量的前提下,高分辨率、全尺寸深度图的预测。
  • 通过用动态、视图自适应方法替代启发式、固定参数的一致性检查,提升深度图融合的鲁棒性。
  • 在保持或提升重建精度与完整性的同时,降低内存消耗。
  • 实现从高分辨率图像出发的可扩展、实用的密集3D重建,包括大规模场景。

提出的方法

  • 提出一种轻量级DRENet(Dense Reception Expanded)模块,用于在原始图像分辨率下提取密集的多尺度特征图。
  • 引入HU-LSTM(Hybrid U-LSTM)模块,结合U-Net跳跃连接与LSTM门控机制,高效地将3D代价体积正则化为深度图。
  • 采用差分单应性变换构建多视角图像的3D代价体积,支持端到端训练。
  • 设计一种动态一致性检查算法,自适应聚合所有视角的几何匹配误差,以过滤不可靠的深度值。
  • 采用非学习的后处理融合策略,基于动态误差聚合而非固定阈值或启发式方法。
  • 通过避免使用重型3D-CNN并结合轻量级高分辨率特征学习,优化推理效率,降低内存占用。

实验结果

研究问题

  • RQ1轻量级高分辨率特征提取器是否能在不增加内存成本的前提下提升密集MVS重建性能?
  • RQ2与3D-CNN或GRUs相比,混合LSTM-U-Net架构是否能有效正则化3D代价体积并降低内存消耗?
  • RQ3能根据场景复杂度自适应调整的动态一致性检查是否在深度图质量与完整性方面优于固定参数的融合策略?
  • RQ4所提方法是否能在Tanks and Temples等复杂户外基准上实现最先进性能,同时保持低内存使用?
  • RQ5该方法在高分辨率图像与大规模3D重建任务中的可扩展性如何?

主要发现

  • 所提出的D² HC-RMVSNet在具有挑战性的Tanks and Temples基准上排名第一,优于所有先前方法。
  • 在DTU数据集上,该方法在内存消耗仅为R-MVSNet的19.4%的前提下,实现了与最先进方法相当的性能。
  • DRENet模块在全分辨率下实现了更准确的特征提取,相比标准2D CNN主干网络,内存与推理时间更低。
  • HU-LSTM模块通过序列化处理有效聚合多尺度上下文信息,显著提升了深度图质量,优于基于3D-CNN与GRU的替代方案。
  • 动态一致性检查使Tanks and Temples上的f-score从57.55提升至59.20,表明其在多样化场景中具有强大的泛化能力与鲁棒性。
  • 该方法仅使用6.6GB内存即可实现全分辨率深度图预测(如1600×1200),支持在高分辨率输入下的实际部署。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。