[论文解读] Self-supervised Learning of Depth Inference for Multi-view Stereo
该论文提出了一种用于多视角立体(depth estimation)的自监督学习框架,通过迭代优化生成高质量的伪深度标签,在DTU数据集上实现了与监督方法相当的性能。该方法利用图像重建的无监督深度估计,通过高分辨率推理和多视角融合来优化伪标签,并在无真实深度监督的情况下迭代提升网络性能。
Recent supervised multi-view depth estimation networks have achieved promising results. Similar to all supervised approaches, these networks require ground-truth data during training. However, collecting a large amount of multi-view depth data is very challenging. Here, we propose a self-supervised learning framework for multi-view stereo that exploit pseudo labels from the input data. We start by learning to estimate depth maps as initial pseudo labels under an unsupervised learning framework relying on image reconstruction loss as supervision. We then refine the initial pseudo labels using a carefully designed pipeline leveraging depth information inferred from higher resolution images and neighboring views. We use these high-quality pseudo labels as the supervision signal to train the network and improve, iteratively, its performance by self-training. Extensive experiments on the DTU dataset show that our proposed self-supervised learning framework outperforms existing unsupervised multi-view stereo networks by a large margin and performs on par compared to the supervised counterpart. Code is available at https://github.com/JiayuYANG/Self-supervised-CVP-MVSNet.
研究动机与目标
- 为解决训练MVS网络所需大规模多视角深度数据的获取挑战。
- 开发一种消除对真实深度标签依赖的自监督学习框架。
- 提升从无监督图像重建生成的伪深度标签质量,以实现更优的监督效果。
- 仅使用多视角图像实现与监督MVS网络相当的性能。
- 通过多阶段处理迭代优化伪标签,以增强网络泛化能力。
提出的方法
- 通过使用图像重建损失进行无监督训练,生成初始深度图,以在不同视角间强制保持光度一致性。
- 利用高分辨率图像对可信像素进行推理,以获得更精确的深度估计,从而提升初始伪标签质量。
- 通过利用相邻视角之间的深度一致性对伪标签进行过滤,以减少误差。
- 应用多视角深度融合与网格生成,以补全不完整的伪标签并提升空间一致性。
- 将优化后的伪标签用于网络的迭代自训练循环中,随时间推移逐步提升性能。
- 该框架整合了CVP-MVSNet的组件,并采用渐进式自监督机制,持续增强深度估计性能。
实验结果
研究问题
- RQ1自监督学习框架是否能在完全无真实深度监督的情况下生成高质量的伪深度标签?
- RQ2通过高分辨率推理和多视角融合对初始无监督伪标签进行优化,能在多大程度上提升深度估计的准确性?
- RQ3使用优化后的伪标签进行迭代自训练,能在多大程度上缩小无监督与监督MVS网络之间的性能差距?
- RQ4该方法在无纹理区域存在哪些局限性,如何加以解决?
- RQ5所提出的优化流水线是否能在训练迭代过程中带来稳定且一致的性能提升?
主要发现
- 所提出的自监督框架在DTU数据集上显著优于现有无监督MVS网络。
- 经过三次迭代的自训练,该方法的f-score达到88.42%,仅比监督方法(88.61%)低0.12%。
- 模型性能在第三次迭代后趋于稳定,表明持续自监督未导致性能退化。
- 高分辨率伪标签优化与多视角融合的使用显著提升了重建质量,整体误差从0.567降低至0.363。
- 该方法在无监督MVS网络中达到最先进性能,证明了仅依赖多视角图像即可实现强大泛化能力。
- 一个关键局限性仍存在于无纹理区域:由于缺乏光度一致性,初始无监督阶段无法生成任何深度标签。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。