[论文解读] Learning to Incorporate Texture Saliency Adaptive Attention to Image Cartoonization
本文提出了一种新颖的端到端 GAN 基图像卡通化方法,通过引入专注于纹理显著性感知局部区域的分块级对抗学习分支,增强了卡通风格迁移。利用一种新颖的卡通-纹理-显著性采样器(CTSS)模块,模型能够动态识别并关注高影响力的局部块——如边缘和精细纹理——从而实现更生动、更具表现力的卡通输出,且与最先进方法相比,FID 分数显著提升。
Image cartoonization is recently dominated by generative adversarial networks (GANs) from the perspective of unsupervised image-to-image translation, in which an inherent challenge is to precisely capture and sufficiently transfer characteristic cartoon styles (e.g., clear edges, smooth color shading, abstract fine structures, etc.). Existing advanced models try to enhance cartoonization effect by learning to promote edges adversarially, introducing style transfer loss, or learning to align style from multiple representation space. This paper demonstrates that more distinct and vivid cartoonization effect could be easily achieved with only basic adversarial loss. Observing that cartoon style is more evident in cartoon-texture-salient local image regions, we build a region-level adversarial learning branch in parallel with the normal image-level one, which constrains adversarial learning on cartoon-texture-salient local patches for better perceiving and transferring cartoon texture features. To this end, a novel cartoon-texture-saliency-sampler (CTSS) module is proposed to dynamically sample cartoon-texture-salient patches from training data. With extensive experiments, we demonstrate that texture saliency adaptive attention in adversarial learning, as a missing ingredient of related methods in image cartoonization, is of significant importance in facilitating and enhancing image cartoon stylization, especially for high-resolution input pictures.
研究动机与目标
- 解决现有 GAN 基图像卡通化方法中显著卡通纹理特征(如清晰边缘、抽象图案)传递不足的问题。
- 克服全局对抗损失的局限性,该损失因主导的全局平滑度和色彩模式而往往忽略稀疏的高频卡通特征。
- 开发一种轻量级、端到端的框架,增强风格化效果,而无需边缘平滑等预处理步骤或额外的风格损失项。
- 证明对纹理显著局部区域的自适应注意力对于实现生动、高保真度的卡通效果至关重要,尤其在高分辨率图像中。
提出的方法
- 提出双判别器架构:图像级判别器用于全局风格一致性(平滑阴影、色调),分块级判别器用于局部纹理模式学习。
- 引入卡通-纹理-显著性采样器(CTSS)模块,基于梯度显著性图动态采样具有高卡通纹理显著性的局部图像块。
- 仅在分块级分支中对 CTSS 选定的块应用对抗损失,使学习聚焦于具有显著卡通特征(如锐利边缘、精细纹理)的区域。
- 将分块级和图像级对抗损失结合到统一的训练目标中,以平衡全局一致性与局部风格化。
- 使用标准的感知损失和身份保持损失(如 L1、感知损失)以保持输入与生成图像之间的内容保真度。
- 采用多尺度训练策略,确保在不同输入分辨率下的鲁棒性,尤其有利于高分辨率输入。
实验结果
研究问题
- RQ1聚焦于显著局部区域的分块级对抗学习是否能超越全局对抗损失,提升卡通风格迁移效果?
- RQ2与均匀或随机的分块采样相比,对纹理显著块的自适应采样是否能生成更生动、更具表现力的卡通输出?
- RQ3简单的分块级对抗损失是否能优于复杂风格损失组件(如 Gram 损失、均值-方差损失)以捕捉卡通纹理模式?
- RQ4所提出的 CTSS 模块是否对性能提升至关重要,还是固定分块采样也能达到类似效果?
- RQ5在高分辨率输入上,该方法与最先进卡通化模型相比,在性能和视觉质量方面表现如何?
主要发现
- 完整模型在 CSC 数据集上的 Fréchet Inception Distance (FID) 达到 115.25,显著优于仅使用图像级损失的基线模型(FID: 145.25)。
- 移除分块级对抗分支后,FID 上升 29.98 个点(从 115.25 上升至 145.25),证实其在风格化中的关键作用。
- CTSS 模块至关重要:若移除该模块并采用均匀分块采样,FID 上升至 127.09,相比完整模型下降 11.84 个点。
- 该模型在三个基准数据集(CSC、DB、TWR)上达到最先进性能,FID 分别为 124.66、112.97 和 115.25。
- 定性结果表明,边缘更清晰,色彩渐变更平滑,纹理更具表现力和卡通化特征,尤其在高分辨率图像和复杂场景中表现更优。
- 该方法在无需边缘平滑预处理(与 CartoonGAN 不同)或额外风格损失项(与 AnimeGAN 不同)的情况下实现优异性能,更具优雅性和效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。