Skip to main content
QUICK REVIEW

[论文解读] End-to-End Conditional GAN-based Architectures for Image Colourisation

Marc Górriz, Marta Mrak|arXiv (Cornell University)|Aug 26, 2019
Image Enhancement Techniques参考文献 27被引用 5
一句话总结

该论文提出了一种基于端到端条件GAN的图像着色架构,通过将实例-批归一化(IBN)、谱归一化(SN)和多尺度判别器整合到U-Net框架中,提升了训练稳定性和色彩丰富度。该方法在ILSVRC 2012数据集上实现了最先进性能,减少了褪色现象,增强了局部色彩细节,同时保持了良好的感知质量。

ABSTRACT

In this work recent advances in conditional adversarial networks are investigated to develop an end-to-end architecture based on Convolutional Neural Networks (CNNs) to directly map realistic colours to an input greyscale image. Observing that existing colourisation methods sometimes exhibit a lack of colourfulness, this paper proposes a method to improve colourisation results. In particular, the method uses Generative Adversarial Neural Networks (GANs) and focuses on improvement of training stability to enable better generalisation in large multi-class image datasets. Additionally, the integration of instance and batch normalisation layers in both generator and discriminator is introduced to the popular U-Net architecture, boosting the network capabilities to generalise the style changes of the content. The method has been tested using the ILSVRC 2012 dataset, achieving improved automatic colourisation results compared to other methods based on GANs.

研究动机与目标

  • 为解决基于GAN的图像着色中长期存在的褪色问题,该问题限制了感知真实感。
  • 通过架构改进与归一化增强,提升条件GAN在端到端着色任务中的训练稳定性。
  • 通过在统一的编码器-解码器架构中整合实例归一化与批归一化,提升在多样化图像类别上的泛化能力。
  • 通过多尺度判别器设计,增强局部色彩细节与整体色彩丰富度。
  • 验证谱归一化与IBN在对抗训练过程中保持色彩丰富度的有效性。

提出的方法

  • 采用基于U-Net的编码器-解码器架构,结合残差跳跃连接,实现端到端的图像到图像翻译。
  • 在生成器和判别器中引入实例-批归一化(IBN),以稳定特征方差并提升风格泛化能力。
  • 在判别器中应用谱归一化(SN),以正则化权重更新,防止模式崩溃。
  • 采用多尺度判别器(MD),以增强局部细节生成能力,并提升小区域图像的色彩保真度。
  • 使用联合损失函数,包含对抗损失、L1回归损失以及基于VGG19特征的感知损失。
  • 使用ILSVRC 2012数据集进行模型训练,感知损失计算为预训练VGG19网络层特征图之间的L1距离。

实验结果

研究问题

  • RQ1如何缓解条件GAN在图像着色任务中的训练不稳定性,以防止出现褪色?
  • RQ2结合实例归一化与批归一化在多大程度上改善了基于GAN的着色任务中的特征表示与色彩泛化能力?
  • RQ3谱归一化是否能增强判别器在着色任务中的稳定性与性能?
  • RQ4多尺度判别机制如何提升局部色彩细节与整体色彩丰富度?
  • RQ5IBN、SN与MD的集成是否在感知与量化着色指标上带来可测量的性能提升?

主要发现

  • IBN+SN+MD配置相比基线模型实现了最低的感知损失(57.77)与更优的L1距离(11.20),表明其具有更好的感知质量与色彩丰富度。
  • 谱归一化显著稳定了对抗损失,防止了早期崩溃并减少了过拟合,从而有效保留了色彩丰富度。
  • IBN+SN组合在第16个周期后出现对抗损失的显著改善,表明其有效提升了训练稳定性与特征泛化能力。
  • 多尺度判别器显著提升了色彩丰富度,尤其在小而细节丰富的区域,经由视觉对比与直方图分析得到验证。
  • 所提方法在感知与色彩丰富度指标上优于基线模型pix2pix(BN),感知损失降低2.5%,且色度分布更优。
  • 色彩直方图分析显示,所提方法生成的ab通道与真实数据分布的交集更小,表明其输出色彩更具多样性与真实性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。