Skip to main content
QUICK REVIEW

[论文解读] Disentangling Style and Content in Anime Illustrations

Sitao Xiang, Hao Li|arXiv (Cornell University)|May 26, 2019
Generative Adversarial Networks and Image Synthesis参考文献 25被引用 10
一句话总结

本文提出一种生成对抗性解缠网络,采用两阶段方法对动漫插画中的风格与内容进行解缠:首先将图像编码为与风格无关的内容表征,然后利用双条件生成器独立控制风格与内容。该方法在超过1,000种特定艺术家风格的高保真、多样化风格迁移中取得了最先进性能,同时忠实保留了面部特征与艺术语义。

ABSTRACT

Existing methods for AI-generated artworks still struggle with generating high-quality stylized content, where high-level semantics are preserved, or separating fine-grained styles from various artists. We propose a novel Generative Adversarial Disentanglement Network which can disentangle two complementary factors of variations when only one of them is labelled in general, and fully decompose complex anime illustrations into style and content in particular. Training such model is challenging, since given a style, various content data may exist but not the other way round. Our approach is divided into two stages, one that encodes an input image into a style independent content, and one based on a dual-conditional generator. We demonstrate the ability to generate high-fidelity anime portraits with a fixed content and a large variety of styles from over a thousand artists, and vice versa, using a single end-to-end network and with applications in style transfer. We show this unique capability as well as superior output to the current state-of-the-art.

研究动机与目标

  • 解决在仅标注一个因素(如风格)的情况下,复杂动漫插画中风格与内容解缠的挑战。
  • 通过单一端到端网络,实现固定内容、可变风格的高保真动漫肖像生成。
  • 通过学习共享的解缠表征,克服现有方法依赖纹理统计或需领域特定训练的局限。
  • 通过将方法应用于手写数字,展示其在动漫之外领域的泛化能力,实现书写者身份与数字类别的解缠。

提出的方法

  • 采用两阶段框架:首先,风格无关的内容编码器将输入图像映射为与风格无关的内容码。
  • 其次,双条件生成器接收内容码与风格标签,生成图像,并引入显式的内容重建损失以保持内容保真度。
  • 使用辅助分类器GAN进行对抗性训练,以确保风格生成的真实性与解缠性。
  • 模型通过共享码空间端到端训练,实现对内容与风格的独立控制。
  • 使用多变量正态分布建模内容码空间,以生成未见过的内容码用于评估。
  • 该方法仅使用标注风格与未标注内容,适用于弱监督设置。

实验结果

研究问题

  • RQ1当仅标注风格时,单一生成模型能否在动漫插画中实现风格与内容的解缠?
  • RQ2该模型在保持内容语义的前提下,能在多大程度上生成具有多样化风格的高保真肖像?
  • RQ3与隐式条件控制相比,显式内容条件控制对解缠性能有何影响?
  • RQ4该方法能否在其他领域(如手写数字)中泛化,且仅标注一个因素?
  • RQ5在对抗性评估下,解缠性能的鲁棒性如何,特别是在生成器针对对抗性分类器进行优化时?

主要发现

  • 该模型在动漫肖像中实现了卓越的视觉质量与细节保真度,忠实再现了风格特异性特征,如眼睛、头发、脸颊红晕与高光。
  • 在使用对抗性分类器训练后,生成器在风格分类上的top-1准确率为14.37%,表明生成样本难以被对抗性分类器与真实样本区分。
  • 移除显式内容条件控制后出现部分模式崩溃,内容码失去对面部特征的控制,证明内容损失的必要性。
  • 该方法在NIST手写数字数据集上成功解缠了书写者身份与数字类别,即使仅标注一个因素。
  • 该模型生成了106,814个样本,其内容码为随机生成,且各类别分布与训练集一致,验证了对未见内容的泛化能力。
  • 对抗性分类器在生成样本上的低准确率(14.37%)证实了模型生成真实、多样化输出的能力,使其难以与真实数据区分。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。