[论文解读] Learning from Multi-domain Artistic Images for Arbitrary Style Transfer
本文提出一种基于多领域艺术图像对抗训练的快速前馈神经网络,用于任意风格迁移。通过结合条件生成器、条件判别器和可学习掩码模块,该方法实现了对未见内容-风格配对的高质量、多样化风格化输出,并支持代表性风格化图像的自动排序。
We propose a fast feed-forward network for arbitrary style transfer, which can generate stylized image for previously unseen content and style image pairs. Besides the traditional content and style representation based on deep features and statistics for textures, we use adversarial networks to regularize the generation of stylized images. Our adversarial network learns the intrinsic property of image styles from large-scale multi-domain artistic images. The adversarial training is challenging because both the input and output of our generator are diverse multi-domain images. We use a conditional generator that stylized content by shifting the statistics of deep features, and a conditional discriminator based on the coarse category of styles. Moreover, we propose a mask module to spatially decide the stylization level and stabilize adversarial training by avoiding mode collapse. As a side effect, our trained discriminator can be applied to rank and select representative stylized images. We qualitatively and quantitatively evaluate the proposed method, and compare with recent style transfer methods. We release our code and model at https://github.com/nightldj/behance_release.
研究动机与目标
- 开发一种快速、前馈的神经网络,使其能够泛化至任意未见的内容与风格图像对。
- 通过在多样化艺术图像领域上进行对抗训练,提升风格化质量。
- 解决输入(内容)和输出(风格)均来自多个多样化领域时的多领域对抗训练挑战。
- 利用训练好的判别器实现代表性风格化图像的自动选择。
- 在相同架构下扩展模型能力,实现去风格化和照片级真实感风格迁移。
提出的方法
- 基于自适应实例归一化(AdaIN)的条件生成器,通过将风格图像的深层特征统计量迁移至内容图像,实现风格迁移。
- 采用在粗粒度风格类别上训练的条件判别器,用于区分真实图像与生成图像,从而稳定对抗训练过程。
- 引入可学习掩码模块,对风格化程度进行空间控制,混合内容与风格化特征,减少伪影并避免模式崩溃。
- 使用组合损失函数训练生成器:包括内容与风格重建损失(通过深层特征和格拉姆矩阵)以及来自条件判别器的对抗损失。
- 利用训练好的判别器作为风格分类器,对每类风格的图像进行排序与筛选,选出高质量、具有代表性的风格化图像。
- 在大规模、多样化的艺术图像数据集上进行训练,涵盖多个领域(如漫画、油画、水彩、矢量艺术等)。
实验结果
研究问题
- RQ1对抗训练是否能超越内容与风格重建损失,在任意风格迁移中进一步提升视觉质量和多样性?
- RQ2当输入(内容)和输出(风格)图像均来自多个多样化领域时,如何稳定对抗训练?
- RQ3单个训练好的生成器网络是否能泛化至多个艺术领域中未见的内容与风格图像对?
- RQ4训练好的判别器是否可被重新利用,以对每类风格中最具代表性的风格化图像进行排序与识别?
- RQ5尽管仅在艺术图像上进行训练,该架构是否也能实现去风格化和从照片级真实图像中迁移风格?
主要发现
- 与先前方法相比,所提方法在风格化输出的视觉质量与多样性方面表现更优,尤其在保留背景细节和避免伪影方面优势显著。
- 在多领域艺术图像上训练的判别器成功实现了风格化图像的排序,用户研究表明,该判别器的偏好比例达到 0.5068,优于强基线分类器。
- 该模型在包含纹理丰富风格图像的标准风格迁移基准测试中表现出良好泛化能力,结果与最先进基线相当或更优。
- 相同架构可用于去风格化任务,即使仅在艺术图像上训练,也能生成比基线更逼真的图像。
- 掩码模块有效稳定了对抗训练过程,并实现了对风格化程度的空间控制,减少了模式崩溃,提升了特征融合效果。
- 模型在照片级真实感风格迁移任务中展现出良好的可迁移性,定性结果表明其能成功从真实图像中迁移风格。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。