[论文解读] Style Intervention: How to Achieve Spatial Disentanglement with Style-based Generators?
本文提出Style Intervention,一种轻量级基于优化的方法,通过在StyleGANv2等基于风格的生成器的特征空间中操作风格码,实现空间解耦的图像编辑。通过针对与视觉概念相关的特定特征图进行操作,该方法可在不训练额外网络或使用标注数据的情况下实现精确的局部编辑,在高分辨率面部属性编辑任务中,其在视觉保真度和空间解耦性方面均优于当前最先进方法。
Generative Adversarial Networks (GANs) with style-based generators (e.g. StyleGAN) successfully enable semantic control over image synthesis, and recent studies have also revealed that interpretable image translations could be obtained by modifying the latent code. However, in terms of the low-level image content, traveling in the latent space would lead to `spatially entangled changes' in corresponding images, which is undesirable in many real-world applications where local editing is required. To solve this problem, we analyze properties of the 'style space' and explore the possibility of controlling the local translation with pre-trained style-based generators. Concretely, we propose 'Style Intervention', a lightweight optimization-based algorithm which could adapt to arbitrary input images and render natural translation effects under flexible objectives. We verify the performance of the proposed framework in facial attribute editing on high-resolution images, where both photo-realism and consistency are required. Extensive qualitative results demonstrate the effectiveness of our method, and quantitative measurements also show that the proposed algorithm outperforms state-of-the-art benchmarks in various aspects.
研究动机与目标
- 解决基于风格的生成对抗网络中因全局潜在空间操作导致的图像翻译空间纠缠问题。
- 在不干扰无关区域的情况下,实现对特定图像内容(如面部属性)的精确局部编辑。
- 开发一种通用框架,适用于任何预训练的基于风格的生成器,无需额外训练或标注数据。
- 改进现有在$\mathcal{Z}$空间或$\mathcal{W}$-空间中进行编辑的方法,这些方法因空间纠缠而产生不理想效果。
- 在实现对单个视觉概念的细粒度控制的同时,保持高保真度和身份一致性。
提出的方法
- 提出一种框架,利用基于梯度的显著性分析,识别生成器中间层中最相关于目标视觉概念(如眼镜)的特征图。
- 通过优化调整所选特征图的风格码,最小化一个自定义目标函数,以平衡目标属性变化与内容保留。
- 采用轻量级优化循环,无需训练新网络或使用属性标注,仅依赖预训练生成器的中间激活。
- 采用多尺度损失,结合感知损失、L2损失和身份保持组件,以确保高保真度生成和与输入图像的一致性。
- 灵活定制目标函数以适应各种转换任务,实现对不同编辑目标的适配。
- 直接在风格空间(即风格向量空间)上操作,而非潜在空间,通过空间选择性地操纵风格码实现局部控制。
实验结果
研究问题
- RQ1是否可以通过仅在预训练的基于风格的生成器特征空间中操作特定风格码,实现空间解耦的图像编辑?
- RQ2针对目标视觉概念相关风格码进行优化,是否相比在$\mathcal{Z}$或$\mathcal{W}$空间中编辑,能带来更精确和局部化的图像转换?
- RQ3轻量级基于优化的方法是否能在无需额外训练或标注数据的情况下实现高质量编辑?
- RQ4在空间解耦性和视觉保真度方面,该方法与当前最先进基于生成对抗网络的面部属性编辑模型相比表现如何?
- RQ5在编辑过程中,该方法在多大程度上保留了非目标图像内容和身份特征?
主要发现
- 所提方法在空间解耦性方面优于最先进基准,用户评估显示98.10%的用户认为其在保留非目标图像内容方面表现更优。
- 用户研究表明,82.85%的参与者更偏好该方法在属性转换质量上优于AttGAN,78.08%更偏好优于StarGAN。
- 定量结果表明,该方法在人脸验证分数(ID)和结构相似性(SSIM)方面均达到最高,表明内容保留能力极强。
- 在用户研究中,该方法在图像质量方面获得100%的偏好评分,甚至优于传统条件生成对抗网络如StarGAN和AttGAN。
- 在高分辨率面部属性编辑任务中,该方法在保持照片级真实感的同时,最小化了对背景和身份的不必要改变,经定性和定量评估均得到验证。
- 与在$\mathcal{W}$-空间中编辑相比,该方法实现了更好的空间解耦性,证明了通过风格码干预精准定位特定特征图的优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。