Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Diverse Colorization via Generative Adversarial Networks

Yun Cao, Zhiming Zhou|arXiv (Cornell University)|Feb 22, 2017
Generative Adversarial Networks and Image Synthesis参考文献 22被引用 21
一句话总结

该论文提出了一种基于条件生成对抗网络(cGANs)的无监督多样化着色方法,能够从单张灰度图像生成多种逼真且多样的着色结果。通过采用具有多层噪声注入和多层条件拼接的全卷积生成器,该模型在保持空间细节和真实感的同时增强了着色多样性,在图灵测试中获得了62.6%的可信反馈,与真实图像无显著差异(p = 0.1359)。

ABSTRACT

Colorization of grayscale images has been a hot topic in computer vision. Previous research mainly focuses on producing a colored image to match the original one. However, since many colors share the same gray value, an input grayscale image could be diversely colored while maintaining its reality. In this paper, we design a novel solution for unsupervised diverse colorization. Specifically, we leverage conditional generative adversarial networks to model the distribution of real-world item colors, in which we develop a fully convolutional generator with multi-layer noise to enhance diversity, with multi-layer condition concatenation to maintain reality, and with stride 1 to keep spatial information. With such a novel network architecture, the model yields highly competitive performance on the open LSUN bedroom dataset. The Turing test of 80 humans further indicates our generated color schemes are highly convincible.

研究动机与目标

  • 解决确定性着色模型因灰度到彩色映射的模糊性而产生平均化、棕褐色调结果的局限性。
  • 实现在无需人类标注彩色参考或真实彩色标签的情况下,无监督生成多样且逼真的着色结果。
  • 通过建模合理颜色的完整分布,克服着色模型收敛于单一平均颜色输出的问题。
  • 设计一种新型生成器架构,通过噪声注入和条件监督实现空间保真度与可控多样性。

提出的方法

  • 设计一个使用步长为1的卷积层的全卷积生成器,以保持空间分辨率并避免下采样。
  • 在生成器前半部分的卷积层中注入多层噪声,以提高生成着色结果的多样性。
  • 在生成器的多个层级上拼接条件性灰度输入,以维持真实颜色分布和结构一致性。
  • 使用条件GAN进行训练,使生成器学习生成能欺骗判别器(用于区分真实与生成图像)的彩色图像。
  • 使用仅需真实/虚假二元信号的判别器,实现完全无监督训练,无需人类标注的彩色标签。
  • 优化生成器以建模真实世界颜色的真实数据分布,通过不同噪声种子实现多样化输出。

实验结果

研究问题

  • RQ1条件GAN能否在无监督条件下从单张灰度图像生成多样且逼真的着色结果?
  • RQ2如何设计生成器架构以在保持空间细节的同时实现高着色多样性?
  • RQ3该模型能否在人类感知测试中生成与真实图像难以区分的着色结果?
  • RQ4在多层注入噪声是否能在不牺牲真实感的前提下提升着色多样性?
  • RQ5当原始颜色模糊时,该模型能否为同一输入生成多种合理的着色方案?

主要发现

  • 所提模型能从单张灰度输入生成多样且逼真的着色结果,其中62.6%的生成图像被人类参与者评为可信。
  • 真实图像被70.0%的参与者评为真实,表明模型输出在真实感方面极具竞争力。
  • 两样本t检验显示,人类对真实图像与生成图像的评分无显著差异(p = 0.1359 > 0.05),表明在感知上难以区分。
  • 真实图像的平均可信度排名为5分制中的2.5分,意味着至少37.5%的生成图像被评为比真实图像更真实。
  • 采用多层噪声注入与条件拼接的全卷积非步长生成器成功保持了空间结构,并实现了高质量、多样化的输出。
  • 该模型优于以往的监督式与确定性方法,避免了‘棕褐色调平均颜色’问题,转而建模了合理颜色的完整分布。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。