Skip to main content
QUICK REVIEW

[论文解读] DARN: a Deep Adversial Residual Network for Intrinsic Image Decomposition

Louis Lettry, Kenneth Vanhoey|arXiv (Cornell University)|Dec 23, 2016
Medical Image Segmentation Techniques被引用 6
一句话总结

本文提出 DARN,一种深度对抗性残差网络,通过端到端训练结合感知动机的 GAN 损失,从单张图像中联合预测反照率和光照。通过强制能量守恒和尺度敏感性,该方法在 MPI Sintel 数据集上实现了最先进性能,相较于以往方法在定性和定量方面均有提升。其采用简化的全卷积架构,结合残差块与对抗判别器,实现了更优的性能。

ABSTRACT

We present a new deep supervised learning method for intrinsic decomposition of a single image into its albedo and shading components. Our contributions are based on a new fully convolutional neural network that estimates absolute albedo and shading jointly. Our solution relies on a single end-to-end deep sequence of residual blocks and a perceptually-motivated metric formed by two adversarially trained discriminators. As opposed to classical intrinsic image decomposition work, it is fully data-driven, hence does not require any physical priors like shading smoothness or albedo sparsity, nor does it rely on geometric information such as depth. Compared to recent deep learning techniques, we simplify the architecture, making it easier to build and train, and constrain it to generate a valid and reversible decomposition. We rediscuss and augment the set of quantitative metrics so as to account for the more challenging recovery of non scale-invariant quantities. We train and demonstrate our architecture on the publicly available MPI Sintel dataset and its intrinsic image decomposition, show attenuated overfitting issues and discuss generalizability to other data. Results show that our work outperforms the state of the art deep algorithms both on the qualitative and quantitative aspect.

研究动机与目标

  • 通过联合学习反照率与光照来解决单图像固有图像分解的病态性问题,避免尺度模糊与能量损失。
  • 消除对物理先验(如光照平滑性或反照率稀疏性)的依赖,实现完全数据驱动的方法。
  • 通过对抗训练结合感知损失,提升泛化能力并减少模糊与色彩渗色等伪影。
  • 引入新的定量指标,以考虑分解中的尺度敏感性与一致性,实现更公平的评估。
  • 通过在混合数据集(如 Sintel 与 MIT)上进行训练,展示模型在不同领域间的鲁棒性与可迁移性。

提出的方法

  • 该方法采用基于残差块的全卷积、端到端深度网络,从单张输入图像中联合预测反照率与光照。
  • 通过预测输入图像的偏差而非从零开始预测,采用残差学习策略,提升训练稳定性与特征学习能力。
  • 引入双判别器 GAN 设置,其中两个对抗训练的判别器分别对反照率与光照预测施加感知真实感。
  • 损失函数结合对抗损失与感知动机度量,以减少伪影并提升视觉保真度。
  • 通过结合 Sintel 与 MIT 数据集进行训练,以提升领域泛化能力,并采用数据混合策略以平衡领域差异。
  • 通过联合预测的设计强制实现能量守恒,确保重建图像 I ≈ A · S。

实验结果

研究问题

  • RQ1完全端到端的深度学习模型是否能在不依赖物理先验的前提下实现能量守恒的固有图像分解?
  • RQ2与单独预测相比,反照率与光照的联合预测在提升一致性与减少伪影方面效果如何?
  • RQ3对抗训练结合感知损失在多大程度上能减少固有图像分解中常见的 GAN 伪影(如模糊与对比度振荡)?
  • RQ4尺度敏感指标如何在传统尺度不变指标之外,改进固有图像分解的评估?
  • RQ5在合成数据上训练的模型是否能泛化到真实世界或多样化领域?其局限性是什么?

主要发现

  • 在 Sintel 场景划分上,DARN 在 si-MSE 上达到 2.41,在 rs-MSE 上达到 2.45,优于以往最先进方法,在尺度不变与尺度敏感指标上均表现更优。
  • 当在 Sintel 与 MIT 混合数据集(50/50 比例)上训练时,DARN 在 MIT 物体划分上的 rs-MSE 降低至 1.07,显著优于此前方法。
  • 在 Sintel 与 MIT 数据集联合训练的模型,其在 Sintel 上的 DSSIM 达到 16.65,在 MIT 上达到 22.90,展现出跨领域的强大泛化能力。
  • 定性结果表明,复杂场景(如图 6 中的门)的分解效果得到改善,但因 Sintel 的合成偏差,仍存在黄色光照等伪影。
  • 与以往深度学习方法相比,该模型表现出更弱的过拟合倾向,并在使用混合训练数据时展现出更好的域内泛化能力。
  • 尽管在合成基准测试中表现优异,该模型在真实世界数据(如 IIW)上的跨域泛化能力有限,凸显了对领域偏移技术或真实世界训练数据的需求。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。