Skip to main content
QUICK REVIEW

[论文解读] Towards Fast and Accurate Real-World Depth Super-Resolution: Benchmark Dataset and Baseline

Lingzhi He, Hongguang Zhu|arXiv (Cornell University)|Apr 13, 2021
Advanced Vision and Imaging参考文献 40被引用 7
一句话总结

本论文提出了RGB-D-D基准数据集,这是首个大规模真实世界配对低分辨率与高分辨率深度图数据集,捕捉了智能手机和Lucid Helios传感器的真实传感器对应关系。论文提出了一种快速深度超分辨率(FDSR)基线模型,利用来自RGB图像的高频引导多尺度空洞特征,以提高重建精度与效率,在公共数据集和真实世界深度图超分任务中均达到最先进性能,展现出优异的边界保持能力与更低的深度误差。

ABSTRACT

Depth maps obtained by commercial depth sensors are always in low-resolution, making it difficult to be used in various computer vision tasks. Thus, depth map super-resolution (SR) is a practical and valuable task, which upscales the depth map into high-resolution (HR) space. However, limited by the lack of real-world paired low-resolution (LR) and HR depth maps, most existing methods use downsampling to obtain paired training samples. To this end, we first construct a large-scale dataset named "RGB-D-D", which can greatly promote the study of depth map SR and even more depth-related real-world tasks. The "D-D" in our dataset represents the paired LR and HR depth maps captured from mobile phone and Lucid Helios respectively ranging from indoor scenes to challenging outdoor scenes. Besides, we provide a fast depth map super-resolution (FDSR) baseline, in which the high-frequency component adaptively decomposed from RGB image to guide the depth map SR. Extensive experiments on existing public datasets demonstrate the effectiveness and efficiency of our network compared with the state-of-the-art methods. Moreover, for the real-world LR depth maps, our algorithm can produce more accurate HR depth maps with clearer boundaries and to some extent correct the depth value errors.

研究动机与目标

  • 为解决由于缺乏真实配对训练数据而导致的真实世界深度图超分辨率(SR)研究中的空白。
  • 开发一种快速且准确的深度SR模型,以在真实场景中保持精细细节与边界信息。
  • 提供一个反映真实传感器特性的基准数据集与基线模型,以提升模型在真实数据上的泛化能力,超越传统基于下采样生成的合成数据。
  • 证明在真实配对数据上进行训练,可显著提升模型在真实低分辨率深度图上的性能,优于传统基于下采样方法。

提出的方法

  • 构建了RGB-D-D数据集,包含来自智能手机和Lucid Helios传感器的4,811对真实世界低分辨率与高分辨率深度图,覆盖室内外场景。
  • 设计了FDSR基线模型,引入高频层(HFL),从RGB图像中提取并引导高频分量,以增强深度图重建效果。
  • 采用多尺度空洞卷积结构,以在不同感受野范围内捕捉上下文信息,同时抑制低频分量以减少参数量。
  • 采用两阶段训练策略:首先在下采样数据上进行模型初始化,随后在真实配对的LR/HR深度图上微调,以建模真实传感器噪声与伪影。
  • 在测试前对原始低分辨率深度图中的缺失孔洞进行色彩填充,以模拟真实世界输入条件。
  • 采用结合L1损失与感知损失的损失函数,以平衡像素级精度与结构保真度。

实验结果

研究问题

  • RQ1与基于合成下采样数据相比,使用真实世界基准数据集是否能显著提升深度图超分辨率模型在真实低分辨率深度图上的性能?
  • RQ2来自RGB图像的高频引导对深度图超分辨率的质量与效率有何影响?
  • RQ3在真实配对的低分辨率与高分辨率深度图上进行训练,是否能带来比在下采样数据上训练更好的泛化能力与精度?
  • RQ4所提出的FDSR模型在具有挑战性的现实场景中,能在多大程度上保持清晰边界并减少深度值误差?
  • RQ5所提方法是否能同时实现高精度与适用于移动设备与嵌入式平台的快速推理速度?

主要发现

  • 在RGB-D-D数据集上,FDSR模型在×4缩放下RMSE达到1.11,优于现有方法;在×8时仍为1.11,在×16时为3.01。
  • 在真实世界低分辨率深度图(含孔洞与噪声)上,FDSR将RMSE降低至1.15(×4),显著优于基线方法,后者无法准确恢复深度值。
  • 消融实验证实,高频层(HFL)与高频引导模块(HFGB)均至关重要:与消融版本相比,仅使用HFL可使RMSE降低0.07,仅使用HFGB可降低0.03。
  • 在真实配对数据(RGB-D-D)上训练相比在下采样数据上训练,RMSE降低了12.47%,证明了真实数据对真实世界性能的关键作用。
  • 视觉结果表明,FDSR生成了更清晰的边界与更准确的深度值,尤其在光照条件复杂及存在缺失孔洞的场景中表现更优。
  • FDSR模型在标准GPU上实现每张图像0.10秒的推理速度,适用于移动与嵌入式设备的实时应用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。