[论文解读] Language-Driven Image Style Transfer
本文提出了语言驱动的艺术风格迁移(LDAST),这是一种新颖的任务,通过从自然语言描述中学习视觉语义,实现文本引导的图像风格化。所提出的对比语言视觉艺术家(CLVA)模型采用逐块风格判别器和对比推理机制,将语言指令与风格模式对齐,在DTD2和ArtEmis数据集上的自动指标与人工评估中均取得了最先进性能。
Despite having promising results, style transfer, which requires preparing style images in advance, may result in lack of creativity and accessibility. Following human instruction, on the other hand, is the most natural way to perform artistic style transfer that can significantly improve controllability for visual effect applications. We introduce a new task, language-driven artistic style transfer (LDAST), to manipulate the style of a content image, guided by a text. We propose contrastive language visual artist (CLVA) that learns to extract visual semantics from style instructions and accomplish LDAST by the patch-wise style discriminator. The discriminator considers the correlation between language and patches of style images or transferred results to jointly embed style instructions. CLVA further compares contrastive pairs of content images and style instructions to improve the mutual relativeness. The results from the same content image can preserve consistent content structures. Besides, they should present analogous style patterns from style instructions that contain similar visual semantics. The experiments show that our CLVA is effective and achieves superb transferred results on LDAST.
研究动机与目标
- 解决传统风格迁移的局限性,后者需要预定义的风格图像,缺乏灵活性与创造性。
- 通过支持自然语言指令作为输入,提升艺术风格迁移的可控性与可访问性。
- 弥合视觉风格的语言描述与其在图像生成中准确视觉实现之间的差距。
- 开发一种在保留内容结构的同时,能够迁移复杂且语义丰富的文本描述风格的方法。
- 在多样化的风格指令(包括视觉属性和情感效果)上评估模型,以实现更广泛的应用。
提出的方法
- CLVA采用语言视觉艺术家(LVA)模块,以保留内容结构并从风格指令中提取视觉语义。
- 使用逐块风格判别器,联合嵌入语言和图像块,实现细粒度的风格对齐。
- 对比推理(CR)通过比较内容图像与风格指令的配对,强制保持内容结构的一致性,并为语义相关的指令分配相似的风格模式。
- 模型通过对比损失端到端训练,以最大化内容与风格表征之间的相互关联性。
- CLVA利用基于CLIP的视觉-语言对齐机制,提升对未见风格描述的零样本泛化能力。
- 该方法支持显式的视觉属性(例如,'水彩'、'素描')和抽象情感效果(例如,'平静'、'满足')等风格指令。
实验结果
研究问题
- RQ1是否可以有效利用自然语言描述来引导艺术风格迁移,而无需依赖预定义的风格图像?
- RQ2模型在多大程度上能够学习将从视觉属性到情感效果的多样化语言描述,映射为相应的视觉风格模式?
- RQ3对比学习在不同语言输入下,对提升风格迁移的一致性与质量有多大促进作用?
- RQ4在风格保真度与内容保留方面,CLVA与基于检索的基线方法及现有基于GAN的风格迁移方法相比表现如何?
- RQ5模型是否能泛化到训练过程中未见过的风格指令,特别是涉及抽象或多重概念描述的情况?
主要发现
- 在使用视觉属性指令的DTD2数据集上,CLVA的SSIM(36.65)和VLS(24.00)得分最高,优于所有基线模型。
- 在Car和Church数据集上,CLVA的VLS得分为23.68,甚至超过基于检索的基线方法及现有方法(如SANet和LST)。
- 人工评估证实,CLVA生成的结果与风格指令及半监督真实标签的相关性更强,优于基线模型。
- 该模型在相同内容输入的多张图像上均成功保留了内容结构,展示了风格化的一致性。
- 尽管基于检索的方法SSIM更高,CLVA在VLS(24.00 vs. 23.68)上仍优于基于CLIP的检索基线,表明其具有更好的指令对齐能力。
- 该模型在抽象和多概念风格描述(如'平静'或'水彩素描')上泛化良好,生成了连贯且语义相关的风格化结果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。