[论文解读] Unsupervised Enhancement of Real-World Depth Images Using Tri-Cycle GAN
该论文提出了一种三循环生成对抗网络(Tri-Cycle GAN)框架,用于无监督地增强来自低成本传感器(如Intel RealSense R200)的现实世界深度图像,利用来自高质量Kinect 2的未配对数据。通过引入更大的生成器、针对深度的掩码损失,以及一种新颖的三循环损失,该方法在非对称域中强制信息保留,显著提升了标准Cycle-GAN在处理严重噪声、缺失像素和结构化伪影方面的视觉与定量性能。
Low quality depth poses a considerable challenge to computer vision algorithms. In this work we aim to enhance highly degraded, real-world depth images acquired by a low-cost sensor, for which an analytical noise model is unavailable. In the absence of clean ground-truth, we approach the task as an unsupervised domain-translation between the low-quality sensor domain and a high-quality sensor domain, represented using two unpaired training sets. We employ the highly-successful Cycle-GAN to this task, but find it to perform poorly in this case. Identifying the sources of the failure, we introduce several modifications to the framework, including a larger generator architecture, depth-specific losses that take into account missing pixels, and a novel Tri-Cycle loss which promotes information-preservation while addressing the asymmetry between the domains. We show that the resulting framework dramatically improves over the original Cycle-GAN both visually and quantitatively, extending its applicability to more challenging and asymmetric translation tasks.
研究动机与目标
- 为解决来自低成本传感器(如Intel RealSense R200)的严重退化现实世界深度图像的增强问题,这些图像缺乏干净的真值标签和分析性噪声模型。
- 将深度增强建模为低质量与高质量深度域之间的无监督域迁移任务,无需配对训练数据。
- 通过引入网络架构和损失函数的改进,克服标准Cycle-GAN在此类非对称、复杂退化设置下的失效问题。
- 开发一种方法,在严重噪声、缺失像素和非高斯退化模式下仍能保留结构细节并最小化伪影。
提出的方法
- 采用改进的Cycle-GAN框架,用更大、更深的网络结构替代标准生成器,以更好地捕捉复杂的深度结构和退化模式。
- 引入针对深度的掩码相似性损失,以处理缺失像素和非均匀数据,提升训练过程的鲁棒性。
- 提出一种新颖的三循环损失,作为Moore-Penrose逆的非线性推广,实现在非对称域中信息保留,其中循环一致性失效。
- 框架使用来自RealSense R200(低质量)和Kinect 2(高质量)的未配对真实世界深度图像进行无监督训练。
- 三循环损失强制将真实图像翻译到目标域再返回时,仍能保留关键结构信息,即使在域之间不对称的情况下。
- 该方法通过对抗损失、循环一致性损失和新型三循环损失进行端到端训练,无需成对监督。
实验结果
研究问题
- RQ1当缺乏干净真值标签或噪声模型时,无监督域迁移框架能否有效增强现实世界深度图像?
- RQ2为何标准Cycle-GAN在处理具有严重、非高斯且非对称退化模式的深度图像时会失效?
- RQ3在反向映射病态或不存在的非对称域迁移任务中,如何强制实现信息保留?
- RQ4架构扩展和领域特定损失在多大程度上能提升基于GAN的深度增强性能,超越标准Cycle-GAN?
- RQ5所提出的三循环损失在保留结构细节和减少高度退化深度图像中的伪影方面,是否优于标准循环一致性?
主要发现
- 所提出的三循环GAN在视觉质量与定量指标上均显著优于基线Cycle-GAN,生成的边缘更清晰,伪影更少。
- 在DROT数据集上,该方法取得了0.633的PNCC分数,优于稀疏深度感知方法(0.611),并远超基线Cycle-GAN(0.213)。
- 引入三循环损失后,缺失像素明显减少,几何精度得到提升,尤其在严重损坏区域表现更优。
- 由于采用了针对深度的掩码损失,该方法能成功保留细粒度细节和物体边界,即使在强噪声和数据缺失区域亦然。
- 该模型在真实世界场景中泛化良好,生成的深度图逼真且细节丰富,与高质量Kinect 2输出高度接近。
- 尽管表现优异,该模型偶尔仍会重现典型的Kinect 2伪影(如缺失像素),表明真实感与保真度之间存在权衡。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。