Skip to main content
QUICK REVIEW

[论文解读] Deep Hybrid Real and Synthetic Training for Intrinsic Decomposition

Sai Bi, Nima Khademi Kalantari|ArXiv.org|Jul 30, 2018
Advanced Vision and Imaging参考文献 25被引用 19
一句话总结

本文提出一种混合深度学习方法,通过在合成图像和真实图像上联合训练卷积神经网络(CNN),实现固有图像分解,利用真实图像对之间的光照不变反射率来弥合从仿真到真实场景的域差距。该方法在真实图像上实现了最先进性能,无论在视觉质量还是WHDR和si-MSE等定量指标上,均优于仅使用合成数据或仅使用真实数据的基线方法。

ABSTRACT

Intrinsic image decomposition is the process of separating the reflectance and shading layers of an image, which is a challenging and underdetermined problem. In this paper, we propose to systematically address this problem using a deep convolutional neural network (CNN). Although deep learning (DL) has been recently used to handle this application, the current DL methods train the network only on synthetic images as obtaining ground truth reflectance and shading for real images is difficult. Therefore, these methods fail to produce reasonable results on real images and often perform worse than the non-DL techniques. We overcome this limitation by proposing a novel hybrid approach to train our network on both synthetic and real images. Specifically, in addition to directly supervising the network using synthetic images, we train the network by enforcing it to produce the same reflectance for a pair of images of the same real-world scene with different illuminations. Furthermore, we improve the results by incorporating a bilateral solver layer into our system during both training and test stages. Experimental results show that our approach produces better results than the state-of-the-art DL and non-DL methods on various synthetic and real datasets both visually and numerically.

研究动机与目标

  • 解决固有图像分解中的域移位问题,即在合成数据上训练的深度学习模型在真实图像上表现不佳,这是由于数据分布差异所致。
  • 克服现有真实数据方法的局限性,这些方法依赖于IIW数据集提供的弱监督信号,而该数据集仅提供相对反射率对比。
  • 通过在神经网络中集成端到端可训练的双边求解器层,提升反射率预测的空间一致性与视觉质量。
  • 证明混合使用合成与真实数据进行训练,可在无需真实图像反射率真值的情况下,实现对真实世界场景的优越泛化能力。

提出的方法

  • 使用带有真实反射率和阴影真值的合成图像对CNN进行训练,作为监督信号。
  • 引入一种新颖的自监督损失函数,利用同一场景在不同光照条件下的真实图像对,强制网络对相同场景输出一致的反射率预测。
  • 在训练和推理过程中,将可微分的双边求解器层作为可学习的后处理步骤集成到网络中,以增强空间一致性。
  • 通过结合合成数据上的监督损失与真实图像对的一致性损失,实现整个网络的端到端优化。
  • 在合成基准上使用尺度不变均方误差(si-MSE)和局部si-MSE作为评估指标,以验证性能表现。
  • 在所有数据集上使用相同的网络架构与超参数设置,不进行逐场景调优,以确保公平比较。

实验结果

研究问题

  • RQ1在合成数据上训练的深度CNN能否有效泛化到真实世界图像的固有图像分解任务中?还是域移位会严重降低其性能?
  • RQ2能否利用不同光照条件下的真实世界图像对作为弱监督信号,以提升泛化能力,而无需显式真值?
  • RQ3集成可微分双边求解器层是否能提升预测反射率图的空间一致性和视觉质量?
  • RQ4结合合成与真实数据的混合训练策略是否优于仅使用合成或真实数据训练的方法?
  • RQ5所提出方法在多样化的现实与合成数据集上,与最先进学习与非学习方法相比,在数值与视觉表现上如何?

主要发现

  • 所提出的混合训练方法在IIW数据集上取得了最低的WHDR分数(0.114),显著优于仅使用合成数据的基线方法,如Narihira等人(0.135)和Shi等人(0.140)。
  • 在Sintel合成数据集上,该方法在反射率上达到2.02 × 10⁻²的si-MSE,在阴影上达到1.84 × 10⁻²,优于Narihira等人(2.01和2.24)及其他所有方法。
  • 在Bonneel合成数据集上,该方法在反射率上达到5.02 × 10⁻²的si-MSE,在阴影上达到6.61 × 10⁻²,优于所有对比方法,包括Narihira等人与Nestmeyer等人。
  • 视觉对比显示,所提方法生成的反射率图更清晰,伪影更少,且在复杂阴影场景中纹理保留更佳,优于对比方法。
  • 双边求解器层显著提升了空间一致性,减少了不连续性并平滑了噪声,同时保留了精细细节。
  • 尽管仅使用自监督的真实数据,该方法在合成与真实基准上均达到最先进性能,展现出强大的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。