[论文解读] Channel Attention based Iterative Residual Learning for Depth Map Super-Resolution
本文提出了一种基于通道注意力的迭代残差学习框架,用于深度图超分辨率(DSR),以解决来自不同深度传感器的真实世界退化问题。通过分别建模带有噪声的非线性下采样和间隔下采样,该方法结合了迭代残差学习、深度监督、通道注意力、多阶段融合以及基于总变分(TGV)的优化,实现了在合成数据和真实世界深度图上的最先进性能,尤其在具有挑战性的间隔下采样和噪声条件下表现优异。
Despite the remarkable progresses made in deep-learning based depth map super-resolution (DSR), how to tackle real-world degradation in low-resolution (LR) depth maps remains a major challenge. Existing DSR model is generally trained and tested on synthetic dataset, which is very different from what would get from a real depth sensor. In this paper, we argue that DSR models trained under this setting are restrictive and not effective in dealing with real-world DSR tasks. We make two contributions in tackling real-world degradation of different depth sensors. First, we propose to classify the generation of LR depth maps into two types: non-linear downsampling with noise and interval downsampling, for which DSR models are learned correspondingly. Second, we propose a new framework for real-world DSR, which consists of four modules : 1) An iterative residual learning module with deep supervision to learn effective high-frequency components of depth maps in a coarse-to-fine manner; 2) A channel attention strategy to enhance channels with abundant high-frequency components; 3) A multi-stage fusion module to effectively re-exploit the results in the coarse-to-fine process; and 4) A depth refinement module to improve the depth map by TGV regularization and input loss. Extensive experiments on benchmarking datasets demonstrate the superiority of our method over current state-of-the-art DSR methods.
研究动机与目标
- 解决现有DSR方法在合成数据上进行训练但对真实世界深度传感器退化表现不佳的问题。
- 对两种不同类型的真实世界深度图退化进行建模:带有深度相关噪声的非线性下采样,以及从三维点云中产生的间隔下采样。
- 开发一种轻量化、可泛化的DSR框架,适用于多种深度传感器和真实世界场景。
- 提升超分辨率深度图中高频分量的恢复效果与边界准确性。
提出的方法
- 提出一种两阶段退化建模方法:针对类似Lidar的深度图,分别建模带有深度依赖噪声的非线性下采样和间隔下采样。
- 采用带有深度监督的迭代残差学习模块,以粗到细的方式逐步优化高分辨率深度图。
- 引入通道注意力机制,动态增强富含高频细节的特征通道。
- 使用多阶段融合模块,重新组合各阶段的特征,提升结构一致性和细节恢复能力。
- 应用基于总变分(TGV)正则化的深度图优化模块,并结合输入重建损失,以保持边缘锐利并减少伪影。
- 在子网络之间采用权重重用(最终融合层除外),使参数量减少60%的同时保持性能。
实验结果
研究问题
- RQ1在合成数据上训练的DSR模型能否有效泛化到具有不同退化模式的真实世界深度图?
- RQ2在结构和频率特性方面,Lidar传感器中常见的间隔下采样与双三次下采样有何不同?
- RQ3结合通道注意力的迭代残差学习能否提升低分辨率深度图中高频分量的恢复效果?
- RQ4多阶段特征融合与基于TGV的优化是否能增强超分辨率深度图的结构保真度与边界准确性?
- RQ5权重重用对模型效率与性能的影响如何,是否在不损失准确性的前提下实现优化?
主要发现
- 所提方法在真实Lidar数据中经间隔下采样处理的深度图上实现了最低的RMSE,显著优于当前最先进方法。
- 在添加了深度依赖噪声的双三次退化深度图上,该方法取得了最佳RMSE,表现出强大的抗噪能力。
- 定性结果表明,与当前最先进基线相比,其生成的深度图边界更清晰、更准确,尤其在复杂纹理和锐利边缘区域表现更优。
- 该模型在无需微调的情况下,可在多种数据集(SUN RGB-D、Apolloscape、ICL、Laserscan)上良好泛化,证明了其强大的域泛化能力。
- 权重重用版本使参数量减少60%,同时性能接近非权重重用版本,具备高效且可部署的潜力。
- 消融实验验证了通道注意力与多阶段融合在提升特征表示与重建质量方面具有显著作用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。