Skip to main content
QUICK REVIEW

[论文解读] Coloring with Words: Guiding Image Colorization Through Text-based Palette Generation

Hyojin Bahng, Seungjoo Yoo|arXiv (Cornell University)|Apr 11, 2018
Generative Adversarial Networks and Image Synthesis被引用 4
一句话总结

本文提出 Text2Colors,一种条件生成对抗网络(conditional GAN)框架,能够从丰富的文本输入(如短语或句子)生成多个多样化且语义一致的配色方案,并利用这些配色方案指导高质量的图像着色。在人类偏好研究中,该模型的表现优于真实配色方案,56.2% 的用户更倾向于选择生成的配色方案而非真实配色方案,证明了其在语义对齐与多模态着色生成方面的有效性。

ABSTRACT

This paper proposes a novel approach to generate multiple color palettes that reflect the semantics of input text and then colorize a given grayscale image according to the generated color palette. In contrast to existing approaches, our model can understand rich text, whether it is a single word, a phrase, or a sentence, and generate multiple possible palettes from it. For this task, we introduce our manually curated dataset called Palette-and-Text (PAT). Our proposed model called Text2Colors consists of two conditional generative adversarial networks: the text-to-palette generation networks and the palette-based colorization networks. The former captures the semantics of the text input and produce relevant color palettes. The latter colorizes a grayscale image using the generated color palette. Our evaluation results show that people preferred our generated palettes over ground truth palettes and that our model can effectively reflect the given palette when colorizing an image.

研究动机与目标

  • 使机器能够从诸如短语或句子等丰富文本输入中生成多个语义相关的配色方案,突破单字词或固定数据集的限制。
  • 通过从单一文本输入生成多样化配色方案,应对色彩感知的多模态特性,反映人类对语义概念的不同理解。
  • 开发一个统一框架,整合文本到配色方案的生成与配色方案引导的图像着色,确保配色方案到图像的颜色转移忠实可靠。
  • 创建一个新的基准数据集 Palette-and-Text (PAT),包含 10,183 对人工精选的文本-配色方案对,以支持基于文本的着色生成的训练与评估。

提出的方法

  • 该模型使用两个条件 GAN:一个文本到配色方案生成器(TPN),将文本嵌入映射为多个多样化配色方案;一个基于配色方案的着色网络(PCN),利用生成的配色方案对灰度图像进行着色。
  • TPN 采用条件增强技术,从同一文本输入生成多样化配色方案,以捕捉色彩语义的多模态特性。
  • PCN 将生成的配色方案整合到 U-Net 架构的跳跃连接层中,实现精确的颜色传播与着色过程中的语义一致性。
  • 在两个网络中均应用条件对抗损失,以确保生成的配色方案与着色图像与输入文本对齐,并保持感知质量。
  • 模型在人工精选的 Palette-and-Text (PAT) 数据集上进行端到端训练,该数据集包含 10,183 对多词文本与多色彩配色方案的配对样本。
  • 通过人类评估验证配色方案质量与着色性能,用户将生成结果与真实配色方案及基线模型进行比较。

实验结果

研究问题

  • RQ1深度生成模型能否从诸如短语或句子等丰富文本输入中生成多个多样化且语义相关的配色方案,而非仅限于单个词语?
  • RQ2模型在多大程度上能将生成的配色方案与输入文本的语义含义对齐,尤其是在与人工精选的真实配色方案对比时?
  • RQ3基于配色方案的着色网络在最终图像输出中,能在多大程度上忠实反映生成配色方案的颜色与语义?
  • RQ4该模型能否在包括照片与图案在内的多种图像类型上实现泛化,同时保持着色过程中的语义一致性?
  • RQ5当仅使用五个配色方案颜色时,该模型的性能与当前最先进的着色基线相比如何?

主要发现

  • 在用户偏好研究中,文本到配色方案生成器(TPN)的欺骗率(fooling rate)达到 56.2%,表明超过一半的参与者更倾向于选择生成的配色方案而非真实配色方案。
  • 基于配色方案的着色网络(PCN)即使仅使用配色方案中的五个颜色(而非 313 个 ab 色域桶),其生成的着色质量也优于当前最先进的基线模型。
  • 用户研究表明,PCN 有效将配色方案中的多样化颜色应用于图像,在五级李克特量表的所有问题上,配色方案利用率与视觉质量评分均更高。
  • 该模型展现出强大的多模态生成能力,能从同一文本输入生成多个合理的配色方案,反映出人类色彩感知中固有的模糊性。
  • 所提出的 Palette-and-Text (PAT) 数据集包含 10,183 对精选的文本-配色方案对,可支持文本引导着色生成的训练与评估,为未来语义着色推荐研究提供支持。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。