[论文解读] Learning Inverse Depth Regression for Multi-View Stereo with Correlation Cost Volume
本文提出CIDER,一种新颖的多视角立体视觉方法,采用基于平均分组相关性的轻量化相关代价体积,以减少内存和计算开销,同时将深度估计建模为逆深度回归,以实现亚像素精度和可扩展性。该方法在DTU和Tanks and Temples基准测试中达到最先进性能,且在大规模场景和模糊区域中表现出更强的鲁棒性。
Deep learning has shown to be effective for depth inference in multi-view stereo (MVS). However, the scalability and accuracy still remain an open problem in this domain. This can be attributed to the memory-consuming cost volume representation and inappropriate depth inference. Inspired by the group-wise correlation in stereo matching, we propose an average group-wise correlation similarity measure to construct a lightweight cost volume. This can not only reduce the memory consumption but also reduce the computational burden in the cost volume filtering. Based on our effective cost volume representation, we propose a cascade 3D U-Net module to regularize the cost volume to further boost the performance. Unlike the previous methods that treat multi-view depth inference as a depth regression problem or an inverse depth classification problem, we recast multi-view depth inference as an inverse depth regression task. This allows our network to achieve sub-pixel estimation and be applicable to large-scale scenes. Through extensive experiments on DTU dataset and Tanks and Temples dataset, we show that our proposed network with Correlation cost volume and Inverse DEpth Regression (CIDER), achieves state-of-the-art results, demonstrating its superior performance on scalability and accuracy.
研究动机与目标
- 解决传统多视角立体视觉(MVS)中3D代价体积表示带来的高内存和计算开销问题。
- 提升在纹理缺失区域和反光表面等挑战性区域的深度估计精度。
- 实现在大规模3D重建场景中稳健的亚像素深度估计。
- 通过改进网络内深度回归策略,减少对后处理优化(如变分优化或CRF)的依赖。
- 开发一种可扩展的轻量化代价体积,支持任意数量的源图像。
提出的方法
- 提出一种平均分组相关性相似度度量方法,用于在参考图像与源图像之间计算紧凑、轻量化的代价体积特征。
- 使用可微分的特征投影模块,跨视图投影特征,并利用分组相关性计算相似度得分。
- 通过在所有源图像上对相似度得分取平均,构建统一的代价体积,实现多视角上下文信息的高效聚合。
- 引入级联3D U-Net架构,逐步规范化代价体积,并在模糊区域抑制噪声。
- 将深度推理重新表述为逆深度回归:在逆深度空间中均匀采样深度假设,网络回归出亚像素级别的序数值以实现精确的深度预测。
- 将预测的序数值转换回最终深度,实现亚像素精度,并在大规模场景中实现更好的泛化能力。
实验结果
研究问题
- RQ1基于分组相关性的轻量化代价体积是否能在保持MVS精度的同时降低内存和计算开销?
- RQ2与均匀深度回归或逆深度分类相比,逆深度回归在亚像素精度和泛化能力方面是否更具优势?
- RQ3与标准3D U-Net或循环正则化相比,级联3D U-Net是否能显著提升模糊区域和边缘区域的深度估计性能?
- RQ4该方法在不产生过高内存消耗的前提下,能否在高分辨率和大规模场景中实现良好扩展?
- RQ5该方法在多大程度上减少了对后处理优化(如变分优化或CRF)的依赖?
主要发现
- 在DTU数据集上,CIDER的平均完整度得分为0.437,综合得分为0.427,优于MVSNet和R-MVSNet(无后处理优化)。
- 在Tanks and Temples Intermediate数据集上,CIDER的F1得分为46.76%,较MVSNet高出3.28%,在大规模场景中表现强劲。
- 在Tanks and Temples Advanced数据集上,CIDER的F1得分为23.12%,优于无后处理优化的R-MVSNet,表明其在复杂、大规模环境中的鲁棒性。
- 与AGC-IDR相比,级联3D U-Net过滤显著降低了模糊区域的噪声,提升了重建质量,且内存增长不明显。
- 在使用256个深度采样点时,CIDER保持了可接受的内存占用,同时将Tanks and Temples训练集的F1得分从48.66%提升至49.60%。
- 所提出的相关代价体积支持任意数量的源图像,且相比标准3D代价体积显著降低了内存消耗。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。