[论文解读] A Deep Primal-Dual Network for Guided Depth Super-Resolution
该论文提出了一种深度原始对偶网络,通过将全卷积网络与非局部变分方法融合,利用高分辨率强度图像作为引导,实现引导式深度超分辨率。通过将一阶原始对偶优化算法展开为可学习的神经网络,该方法联合优化卷积滤波器、变分模型参数以及算法超参数,在使用物理渲染训练数据的合成与真实世界基准上实现了最先进性能。
In this paper we present a novel method to increase the spatial resolution of depth images. We combine a deep fully convolutional network with a non-local variational method in a deep primal-dual network. The joint network computes a noise-free, high-resolution estimate from a noisy, low-resolution input depth map. Additionally, a high-resolution intensity image is used to guide the reconstruction in the network. By unrolling the optimization steps of a first-order primal-dual algorithm and formulating it as a network, we can train our joint method end-to-end. This not only enables us to learn the weights of the fully convolutional network, but also to optimize all parameters of the variational method and its optimization procedure. The training of such a deep network requires a large dataset for supervision. Therefore, we generate high-quality depth maps and corresponding color images with a physically based renderer. In an exhaustive evaluation we show that our method outperforms the state-of-the-art on multiple benchmarks.
研究动机与目标
- 解决消费级深度传感器(如ToF和结构光相机)产生的深度图中存在的空间分辨率低和噪声高的挑战。
- 通过利用高分辨率强度图像作为空间引导,利用强度-深度相关性,提升深度超分辨率性能。
- 克服深度超分辨率领域中大规模、高质量训练数据的缺乏问题。
- 通过展开原始对偶优化,将非局部变分模型整合到深度学习框架中,实现端到端联合训练。
- 使用基于物理的渲染器生成逼真、高质量的训练数据,以实现有效模型训练。
提出的方法
- 全卷积网络(FCN)处理低分辨率、噪声较大的深度图和高分辨率强度图像,生成初始的高分辨率深度估计和加权系数。
- FCN的输出被输入到原始对偶网络中,该网络将一阶原始对偶算法的迭代步骤展开,用于非局部总变差最小化。
- 原始对偶算法中的每个优化步骤均以可学习层实现,从而支持通过整个网络进行端到端反向传播。
- 该方法联合学习FCN中的卷积滤波器、变分代价函数中的正则化参数,以及原始对偶算法的步长和参数。
- 使用Mitsuba渲染器生成高质量的训练数据,模拟具有深度相关噪声的真实感深度图和对应的强度图像。
- 训练过程采用基于预测与真实高分辨率深度图之间L2误差的损失函数。
实验结果
研究问题
- RQ1能否通过展开变分优化算法的深度原始对偶网络,在深度超分辨率上优于传统方法?
- RQ2对联合网络进行端到端训练,联合学习变分参数和卷积滤波器,是否能提升深度超分辨率性能?
- RQ3基于物理的合成数据能否有效替代真实世界数据用于深度超分辨率模型的训练?
- RQ4在高倍数上采样因子下,引入高分辨率强度图像作为引导对性能有何影响?
- RQ5非局部正则化在超分辨率深度图中对边缘保持和细节恢复的提升程度如何?
主要发现
- 在ToFMark基准上,所提方法实现了23.74毫米的均方根误差(RMSE),优于Ferstl等人(2013)的第二名方法(24.00毫米)。
- 在×8和×16的上采样因子下,引入引导图像显著提升了性能,完整模型(FCN-PDN)优于仅使用FCN的基线模型。
- 在合成基准上,当使用深度图和引导输入进行训练时,该方法实现了28.81毫米的RMSE,优于双线性插值方法的30.46毫米。
- 定性对比显示,该方法显著减少了伪影,并更好地保持了深度不连续性,优于经典变分方法和插值方法。
- 消融研究证实,FCN与原始对偶网络的联合训练相比仅训练FCN或使用NLH-ℓ2后处理,能获得更优结果。
- 使用物理渲染的训练数据使模型能够很好地泛化到真实世界ToF数据,证明了该领域中合成数据的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。