[论文解读] Controllable Person Image Synthesis with Spatially-Adaptive Warped Normalization
本文提出空间自适应扭曲归一化(SAWN),一种新颖的归一化模块,通过学习的流场对风格调制参数(缩放因子与偏置)进行扭曲,以在人物图像生成中实现姿态特征与风格特征之间的精确空间对齐。此外,本文还引入了自训练部件替换(STPR)策略以优化模型,在DeepFashion数据集上的人像姿态迁移与复杂纹理迁移任务中均取得了当前最优性能,其中上衣区域FID得分低至10.50,头发区域FID得分为11.32。
Controllable person image generation aims to produce realistic human images with desirable attributes such as a given pose, cloth textures, or hairstyles. However, the large spatial misalignment between source and target images makes the standard image-to-image translation architectures unsuitable for this task. Most state-of-the-art methods focus on alignment for global pose-transfer tasks. However, they fail to deal with region-specific texture-transfer tasks, especially for person images with complex textures. To solve this problem, we propose a novel Spatially-Adaptive Warped Normalization (SAWN) which integrates a learned flow-field to warp modulation parameters. It allows us to efficiently align person spatially-adaptive styles with pose features. Moreover, we propose a novel Self-Training Part Replacement (STPR) strategy to refine the model for the texture-transfer task, which improves the quality of the generated clothes and the preservation ability of non-target regions. Our experimental results on the widely used DeepFashion dataset demonstrate a significant improvement of the proposed method over the state-of-the-art methods on pose-transfer and texture-transfer tasks. The code is available at https://github.com/zhangqianhui/Sawn.
研究动机与目标
- 解决人物图像生成中姿态特征与风格特征之间的空间错位问题,尤其针对复杂纹理。
- 在保持非目标区域身份一致性的前提下,提升人物图像合成中的纹理迁移质量。
- 通过自监督部件替换策略优化模型,缩小训练与推理之间的域差距。
- 在姿态引导与区域特定纹理迁移任务中均实现最先进性能。
提出的方法
- 提出空间自适应扭曲归一化(SAWN),通过学习的流场对归一化模块的缩放因子与偏置参数进行空间扭曲,实现风格特征与姿态引导特征在不同空间位置上的对齐。
- 引入M-SAWN,即SAWN的变体,利用部件特定的掩码实现纹理迁移过程中的区域特定空间对齐。
- 采用流场网络预测密集的空间变换,将风格特征与姿态引导的特征图对齐。
- 在解码器的多个尺度上应用SAWN,以在不同感受野下保持细粒度的风格对齐。
- 提出一种自训练部件替换(STPR)策略,通过在不同姿态下替换同一人物的部件实现域内微调,以优化模型。
- 采用生成对抗网络(GAN)框架进行对抗训练,其中生成器使用SAWN与STPR,根据姿态、外观及区域掩码生成逼真的人物图像。
实验结果
研究问题
- RQ1学习的流场能否有效将空间自适应的风格参数与姿态特征对齐,从而提升人物图像生成中的纹理迁移效果?
- RQ2在归一化过程中同时扭曲缩放因子与偏置参数,是否比仅扭曲缩放因子表现更优?
- RQ3自训练部件替换策略能否减少训练与推理之间的差异,从而提升图像真实感与身份一致性?
- RQ4所提方法在处理姿态迁移与纹理迁移中的复杂纹理时,与SOTA方法相比表现如何?
主要发现
- 所提SAWN方法在DeepFashion数据集上取得11.54的FID得分,优于基线方法SAN(14.99)与SAWS(12.04)。
- 结合SAWN与STPR的完整模型在‘上衣’区域取得10.50的FID,在‘头发’区域取得11.32的FID,显著提升了图像真实感与细节传递质量。
- 与无STPR的模型相比,STPR策略在‘上衣’区域降低FID 5.22分,在‘长裤’区域降低1.68分,证明其在质量提升方面的有效性。
- 可视化结果表明,学习到的流场与遮挡掩码可生成合理扭曲效果,与目标人物的形状与外观高度匹配。
- 与ADGAN和PISE相比,本模型生成的纹理更清晰,尤其在红白格纹等复杂图案上表现更优,而基线方法难以有效保留此类细节。
- 消融实验验证,同时扭曲缩放因子与偏置(SAWN)优于仅扭曲缩放因子(SAWS),证实了完整参数扭曲的必要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。