Skip to main content
QUICK REVIEW

[论文解读] Tag2Pix: Line Art Colorization Using Text Tag With SECat and Changing Loss

Hyun‐Su Kim, Ho Young Jhoo|arXiv (Cornell University)|Aug 16, 2019
Generative Adversarial Networks and Image Synthesis参考文献 9被引用 13
一句话总结

Tag2Pix 提出了一种基于 GAN 的线稿着色方法,利用基于文本的颜色标签进行着色,引入 SECat(Squeeze-and-Excitation with Concatenation)以提升多标签分割性能,并采用损失函数动态调整的两阶段训练策略,以增强训练稳定性。该方法在着色质量方面达到当前最优水平,尤其在眼睛等精细细节方面表现优异,在真实世界数据集上取得了 39.21 的 FID 分数。

ABSTRACT

Line art colorization is expensive and challenging to automate. A GAN approach is proposed, called Tag2Pix, of line art colorization which takes as input a grayscale line art and color tag information and produces a quality colored image. First, we present the Tag2Pix line art colorization dataset. A generator network is proposed which consists of convolutional layers to transform the input line art, a pre-trained semantic extraction network, and an encoder for input color information. The discriminator is based on an auxiliary classifier GAN to classify the tag information as well as genuineness. In addition, we propose a novel network structure called SECat, which makes the generator properly colorize even small features such as eyes, and also suggest a novel two-step training method where the generator and discriminator first learn the notion of object and shape and then, based on the learned notion, learn colorization, such as where and how to place which color. We present both quantitative and qualitative evaluations which prove the effectiveness of the proposed method.

研究动机与目标

  • 为解决插画行业中人工线稿着色成本高、难度大的问题。
  • 开发一种低投入、用户友好的线稿着色方法,仅依赖文本颜色标签,避免使用复杂的输入(如彩色涂鸦或参考图像)。
  • 提升对眼睛、头发等小而精细特征的着色准确性,这些特征在现有方法中常被处理不佳。
  • 通过新颖的两阶段训练方案与损失函数自适应机制,增强基于 GAN 的着色训练稳定性与性能。
  • 发布一个新的数据集和预训练模型,以支持可复现性与未来研究。

提出的方法

  • 该方法基于辅助分类器 GAN(ACGAN)的条件 GAN 框架,其中判别器同时对图像真实性与输入颜色标签进行分类。
  • 提出一种新型网络模块 SECat(Squeeze-and-Excitation with Concatenation),通过在空间位置间动态增强相关颜色特征,提升对小尺寸特征的关注能力。
  • 生成器整合了预训练的语义编码器用于线稿,以及专门的 CVT(Color Variant Tag)编码器以处理基于文本的颜色提示。
  • 采用两阶段训练策略:第一阶段,网络通过重建损失学习物体与形状分割;第二阶段,通过联合对抗性损失与感知损失学习着色。
  • 损失函数在训练过程中动态调整,早期阶段优先关注分割,后期阶段侧重着色。
  • 生成器使用跳跃连接与特征拼接以保留空间细节,并在多个解码器阶段通过 SECat 模块注入 CVT 特征。

实验结果

研究问题

  • RQ1基于文本的标签系统能否有效替代复杂的颜色提示(如彩色涂鸦或参考图像)进行线稿着色?
  • RQ2SECat 模块是否显著提升了眼睛、头发等小而精细特征的着色效果?
  • RQ3具有损失函数动态调整的两阶段训练策略能否提升基于 GAN 的线稿着色训练稳定性与最终着色质量?
  • RQ4所提方法在定量与定性层面相较于现有基于 GAN 与非 GAN 的着色方法表现如何?
  • RQ5专用数据集与预训练组件的使用在多大程度上提升了性能与可复现性?

主要发现

  • SECat 模块在测试集上实现了最低的 Fréchet Inception Distance(FID)为 39.21,优于 ResNeXt(52.49)、SE-ResNeXt(45.48)及其他嵌入方法。
  • SECat 在参数量更少(15.81M)的情况下,优于类似方法如 Concat all(17.37M),表明其具有更高的参数效率。
  • 用户研究表明,SECat 在分割(3.51)、自然度(3.60)、准确性(3.60)与整体质量(3.54)方面得分最高,全面超越所有基线方法。
  • 定性结果表明,仅 SECat 能够正确着色眼睛、头发等微小特征,即使在标签模糊或稀疏的情况下亦然。
  • 两阶段训练策略显著加快收敛速度并提升训练稳定性,网络在第二阶段训练 10 个 epoch 后即达到最优 FID。
  • 所提出的 Tag2Pix 数据集包含 4,127 幅真实世界线稿插画及其对应的颜色标签,支持高保真、可复现的训练与评估。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。