[论文解读] Towards Domain-agnostic Depth Completion
本文提出了一种与领域无关的深度补全方法,利用单目深度预测网络作为数据驱动先验,以鲁棒地完成来自多种传感器(包括手机飞行时间传感器和激光雷达、多视角重建)的稀疏、噪声大且分辨率低的深度图。通过在多样化的合成稀疏模式上进行训练,并结合噪声鲁棒优化,该方法在新设计的稀疏性和噪声鲁棒性基准上实现了卓越的跨领域泛化能力,优于当前最先进方法。
Existing depth completion methods are often targeted at a specific sparse depth type and generalize poorly across task domains. We present a method to complete sparse/semi-dense, noisy, and potentially low-resolution depth maps obtained by various range sensors, including those in modern mobile phones, or by multi-view reconstruction algorithms. Our method leverages a data-driven prior in the form of a single image depth prediction network trained on large-scale datasets, the output of which is used as an input to our model. We propose an effective training scheme where we simulate various sparsity patterns in typical task domains. In addition, we design two new benchmarks to evaluate the generalizability and the robustness of depth completion methods. Our simple method shows superior cross-domain generalization ability against state-of-the-art depth completion methods, introducing a practical solution to high-quality depth capture on a mobile device. The code is available at: https://github.com/YvanYin/FillDepth.
研究动机与目标
- 解决现有深度补全方法在跨领域泛化能力差的问题,这些方法通常针对特定稀疏模式(如NYU或KITTI)进行调优。
- 提升对移动设备和SLAM/SfM流程中常见传感器噪声和异常值的鲁棒性。
- 设计新基准以评估在标准NYU和Matterport3D数据集之外的多样化稀疏模式和噪声水平下的泛化能力。
- 实现单一模型在无需微调的情况下泛化于多种传感器类型(如iPhone、Pixel、华为手机)。
- 为仅使用RGB和稀疏深度输入的低成本移动设备提供实用且高质量的深度补全解决方案。
提出的方法
- 利用预训练的单目深度预测网络(如Yin et al. [49])生成相对深度先验,并将其作为完成网络中的引导图。
- 通过模拟基于真实传感器行为的多样化稀疏模式(如Unpaired FOV、Sparse ToF和Short Range)进行数据增强,以提升领域泛化能力。
- 引入一种训练方案,结合多种深度源(如NYU、ScanNet、DIODE)以增强对场景和传感器多样性的鲁棒性。
- 通过在基于COLMAP生成的合成噪声深度图上进行训练,实现噪声鲁棒性,模拟真实世界SLAM/SfM误差。
- 采用迭代细化策略,将一次网络前向传播的输出作为下一次的引导图,以提升细节恢复能力。
- 采用轻量化、高效的架构(ESANet-R34-NBt1D)以实现在移动平台上的实时推理。
实验结果
研究问题
- RQ1在一种领域上训练的深度补全模型能否有效泛化到不同传感器(如手机飞行时间传感器与激光雷达)的未见稀疏模式?
- RQ2引入学习到的单目深度先验在多大程度上提升了对稀疏深度输入中噪声和异常值的鲁棒性?
- RQ3现有基准在多大程度上无法有效评估真实世界的鲁棒性?新基准如何更好地模拟实际挑战?
- RQ4通过领域随机化和多源数据训练的单一模型能否在多种传感器类型和噪声水平下实现最先进性能?
- RQ5使用数据驱动先验是否显著提升了完成深度图中的细节恢复能力和结构一致性?
主要发现
- 与NLSPN和Senushkin et al.等最先进方法相比,所提方法在未见稀疏模式(如Unpaired FOV、Sparse ToF、Short Range)上实现了更优的跨领域泛化能力。
- 在NoisySparsity基准上,该方法在COLMAP生成的噪声深度图下,对全部16个NYU场景均持续优于基线方法,展现出强大的噪声鲁棒性。
- 定性结果表明,与NLSPN和Senushkin et al.相比,该方法在iPhone、Pixel和华为手机深度输入上能更好地恢复更精细的几何细节和纹理结构。
- 该方法在无需微调的情况下,对真实世界移动深度传感器具有良好的泛化能力,且在所有测试的手机型号上均持续优于最先进方法。
- 消融实验表明,数据驱动先验与多样化数据增强的结合显著提升了性能和鲁棒性。
- 新基准(GeneralSparsity和NoisySparsity)有效暴露了现有方法的局限性,并验证了所提方法在鲁棒性和泛化能力方面的优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。