Skip to main content
QUICK REVIEW

[论文解读] T2Net: Synthetic-to-Realistic Translation for Solving Single-Image Depth Estimation Tasks

Chuanxia Zheng, Tat‐Jen Cham|arXiv (Cornell University)|Aug 4, 2018
Advanced Vision and Imaging参考文献 32被引用 10
一句话总结

T2Net 提出了一种端到端可训练的单图像深度估计框架,该框架利用合成图像-深度配对数据和未配对的真实图像,通过在合成输入上使用对抗性损失的合成到真实感转换网络,以及在真实输入上使用重建损失,实现了无需真实图像-深度配对数据或立体数据的最先进性能。

ABSTRACT

Current methods for single-image depth estimation use training datasets with real image-depth pairs or stereo pairs, which are not easy to acquire. We propose a framework, trained on synthetic image-depth pairs and unpaired real images, that comprises an image translation network for enhancing realism of input images, followed by a depth prediction network. A key idea is having the first network act as a wide-spectrum input translator, taking in either synthetic or real images, and ideally producing minimally modified realistic images. This is done via a reconstruction loss when the training input is real, and GAN loss when synthetic, removing the need for heuristic self-regularization. The second network is trained on a task loss for synthetic image-depth pairs, with extra GAN loss to unify real and synthetic feature distributions. Importantly, the framework can be trained end-to-end, leading to good results, even surpassing early deep-learning methods that use real paired data.

研究动机与目标

  • 解决获取大规模真实图像-深度配对数据集的挑战,因为此类数据集需要专业深度传感设备,收集成本高且耗时长。
  • 通过在无需真实配对数据的情况下实现有效的域自适应,克服单图像深度估计中合成图像与真实图像之间的域偏移问题。
  • 开发一个统一框架,将合成图像和真实图像均作为共享转换与预测流水线的输入,确保跨域的鲁棒性。
  • 通过引入基于原理的重建损失处理真实图像,以及对抗性损失处理合成图像,消除对启发式正则化损失(如自正则化)的依赖。
  • 仅使用合成训练数据和未配对的真实图像,实现具有竞争力的深度估计性能,无需立体图像对或真实深度标注。

提出的方法

  • 在合成图像上使用对抗性损失(GAN损失)训练合成到真实感的图像转换网络,以将合成图像映射到真实图像分布。
  • 在训练过程中对真实图像应用重建损失,以确保转换网络对真实输入保持恒等函数特性,从而保留其内容和几何结构。
  • 将转换网络与深度预测网络结合,后者使用任务损失(如深度图上的L1/L2损失)在合成图像-深度配对数据上进行训练。
  • 在深度预测网络中引入特征级GAN损失,以对齐真实图像与合成图像的特征分布,提升域泛化能力。
  • 端到端训练整个T2Net架构,实现转换与深度预测组件的联合优化。
  • 使用宽谱输入转换器,在最小化对真实图像修改的同时,将合成图像转换为真实感图像,确保输入域之间的一致性。

实验结果

研究问题

  • RQ1仅在合成图像-深度配对数据和未配对真实图像上进行训练的域自适应框架,能否在无需真实配对数据的情况下实现具有竞争力的深度估计性能?
  • RQ2结合合成图像的对抗性损失与真实图像的重建损失,是否能比启发式正则化方法带来更好的域对齐效果?
  • RQ3端到端训练转换网络与深度预测网络是否能优于两阶段或分离训练方法?
  • RQ4在真实图像上引入重建损失,对转换图像的质量和几何保真度以及下游深度预测性能有何影响?
  • RQ5仅在合成数据上训练的模型,在无需任何真实深度监督的情况下,能在KITTI和NYUDv2等真实世界基准上实现多大程度的泛化能力?

主要发现

  • T2Net 仅使用合成数据和未配对的真实图像,在KITTI数据集上实现了0.169的绝对相对误差(Abs Rel)测试误差,优于仅使用合成数据训练的基线模型(0.278 Abs Rel)。
  • 完整T2Net模型在KITTI上的RMSE达到4.717,显著低于仅使用合成数据的基线模型(6.268 RMSE),表明回归精度得到提升。
  • 采用端到端训练的模型优于分离训练转换网络与深度预测网络的方法,表明任务损失能为转换网络提供有效的监督。
  • 若移除真实图像上的重建损失,性能在早期训练阶段(如第3轮)即出现下降,表明该损失对保持图像质量和稳定性至关重要。
  • 采用特征级GAN损失并完成完整训练的模型在KITTI上的δ < 1.25 3得分达到0.965,表明其在深度估计任务中具备强大的泛化能力和高精度。
  • T2Net 超过了早期基于真实图像-深度配对数据或立体数据训练的深度学习方法,证明了所提出的域自适应策略的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。