[论文解读] Diversified Arbitrary Style Transfer via Deep Feature Perturbation
本文提出深度特征扰动(DFP),一种无需训练的方法,通过在保持原始风格的Gram矩阵不变的前提下,对深层特征图施加正交随机噪声,从而在任意风格迁移中提升多样性。将DFP集成到WCT-based方法中,可在不降低质量的情况下显著提升结果多样性,其在可扩展性和泛化能力方面优于基于学习的替代方案。
Image style transfer is an underdetermined problem, where a large number of solutions can satisfy the same constraint (the content and style). Although there have been some efforts to improve the diversity of style transfer by introducing an alternative diversity loss, they have restricted generalization, limited diversity and poor scalability. In this paper, we tackle these limitations and propose a simple yet effective method for diversified arbitrary style transfer. The key idea of our method is an operation called deep feature perturbation (DFP), which uses an orthogonal random noise matrix to perturb the deep image feature maps while keeping the original style information unchanged. Our DFP operation can be easily integrated into many existing WCT (whitening and coloring transform)-based methods, and empower them to generate diverse results for arbitrary styles. Experimental results demonstrate that this learning-free and universal method can greatly increase the diversity while maintaining the quality of stylization.
研究动机与目标
- 解决现有风格迁移方法中多样性不足的问题,这些方法常因优化过程或固定网络行为而收敛到相似输出。
- 克服先前基于学习的多样性方法的局限,包括对新风格泛化能力受限、多样性幅度有限以及可扩展性差。
- 通过一种通用、即插即用的机制,在无需微调或架构修改的情况下,实现任意风格迁移中的高多样性。
- 在生成同一内容与风格输入下感知上明显不同的输出的同时,保持高风格化质量。
提出的方法
- 提出深度特征扰动(DFP),在对内容图像的深层特征图进行白化后,施加正交随机噪声矩阵,同时保持原始风格的Gram矩阵不变。
- 利用WCT框架(白化与色彩变换)分离内容与风格特征,实现在不改变风格表征的前提下,在内容特定的特征空间中进行扰动。
- 确保扰动后的特征与原始特征具有相同的Gram矩阵,从而保证风格化输出保持相同风格,但在纹理、结构或外观上存在差异。
- 将DFP作为即插即用模块集成到现有WCT-based方法(如[19]、[26]、[20])中,实现多样化输出,而无需微调或修改核心网络。
- 使用从标准正态或均匀分布中采样的正交噪声矩阵,实证结果表明,正交性而非采样分布是实现多样性的关键因素。
- 仅在推理阶段应用DFP,使该方法完全无需训练,且与实时、风格无关的风格迁移流水线兼容。
实验结果
研究问题
- RQ1我们能否在不需微调或特定风格学习的情况下,实现在任意风格迁移中的高多样性?
- RQ2在保持Gram矩阵不变的前提下扰动深层特征,是否能产生感知上合理且视觉上显著不同的风格化输出?
- RQ3与基于学习的多样性方法相比,DFP在可扩展性、泛化能力和多样性幅度方面表现如何?
- RQ4DFP能否在无需架构或训练修改的情况下,普遍应用于不同WCT-based风格迁移方法?
- RQ5DFP是否在提升多样性的同时保持风格化质量,特别是在照片级真实感和语义级风格迁移中?
主要发现
- DFP显著提升了风格化输出的多样性,与基线WCT方法相比,平均LPIPS和像素级距离显著上升。
- 采用DFP的方法(如[19]+DFP)的多样性得分远高于基于学习的方法[18]和[30],后者仅产生细微且感知上不显著的差异。
- 多样性提升效果在多种WCT-based方法中保持一致,包括艺术风格、语义级和照片级真实感风格迁移,展现出广泛的适用性。
- 即使在高噪声强度下,DFP仍能保持高质量的风格化效果,避免了随机噪声基线中常见的内容退化或伪影放大问题。
- 实现多样性的关键因素是噪声矩阵的正交性,而非其采样分布——正交噪声可确保特征空间扰动而不引起风格失真。
- 尽管[20]中的平滑步骤会减少细节,DFP仍能增强多样性,尽管效果弱于[19],表明质量与变化之间存在权衡。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。