[论文解读] XingGAN for Person Image Generation
本文提出 XingGAN,一种用于行人图像生成的新型生成对抗网络,采用两个级联分支——基于形状引导的外观(SA)和基于外观引导的形状(AS)——通过新颖的 SA 和 AS 模块联合建模并交叉注意外观与形状特征。该方法在 Market-1501 和 DeepFashion 数据集上达到最先进性能,Inception Score 相较于先前方法最高提升 0.233,Mask-SSIM 提升 0.009。
We propose a novel Generative Adversarial Network (XingGAN or CrossingGAN) for person image generation tasks, i.e., translating the pose of a given person to a desired one. The proposed Xing generator consists of two generation branches that model the person's appearance and shape information, respectively. Moreover, we propose two novel blocks to effectively transfer and update the person's shape and appearance embeddings in a crossing way to mutually improve each other, which has not been considered by any other existing GAN-based image generation work. Extensive experiments on two challenging datasets, i.e., Market-1501 and DeepFashion, demonstrate that the proposed XingGAN advances the state-of-the-art performance both in terms of objective quantitative scores and subjective visual realness. The source code and trained models are available at https://github.com/Ha0Tang/XingGAN.
研究动机与目标
- 解决现有基于 GAN 的行人图像生成方法在有效建模外观与形状联合依赖关系方面的局限性。
- 通过外观与形状表征之间的相互增强,提升生成行人图像的视觉保真度与姿态对齐效果。
- 设计一种新型架构,通过级联的、交叉注意的特征优化,逐步合成细节丰富的行人图像。
- 在具有挑战性的基准上验证所提出的协同注意力融合与双分支生成器设计的有效性。
提出的方法
- Xing 生成器采用两条并行分支:SA(基于形状引导的外观)和 AS(基于外观引导的形状),每条分支均使用一系列 Xing 模块,迭代优化外观与形状特征。
- 每个 Xing 模块包含 SA 和 AS 子模块,从外观与形状两种模态中联合生成注意力图,实现跨模态特征交互。
- 协同注意力融合(CAF)模块通过联合计算自两种模态的注意力图,融合最终的外观与形状特征,以提升生成质量。
- 模型采用双判别器设置:外观引导的判别器与形状引导的判别器,均与生成器端到端联合训练。
- 网络以端到端方式训练,使两个分支能从相互监督中获益,逐步提升特征表征能力。
- 在 Market-1501 和 DeepFashion 上使用 Inception Score (IS)、Mask-IS、SSIM 和 Mask-SSIM 等指标对架构进行评估。
实验结果
研究问题
- RQ1外观与形状特征之间的交叉注意力是否能超越单模态注意力,进一步提升行人图像生成质量?
- RQ2级联的双分支生成器设计是否能优于单分支或残差基线模型,在姿态对齐与视觉真实感方面表现更优?
- RQ3所提出的协同注意力融合模块在结合外观与形状表征以实现图像合成方面效果如何?
- RQ4XingGAN 框架是否能在具有大姿态变化与复杂服装形变的挑战性数据集上实现良好泛化?
主要发现
- 在 Market-1501 上,XingGAN 达到新的 SOTA Inception Score 3.708,相较之前最佳方法提升 0.233 分。
- 在 DeepFashion 上,XingGAN 的 Mask-SSIM 达到 0.816,较基线提升 0.009,表明结构对齐能力更优。
- 消融实验表明,协同注意力融合(CAF)模块相较 'SA+AS' 基线,使 Mask-IS 提升 0.065,Mask-SSIM 提升 0.009。
- 使用 9 个 Xing 模块可获得最优性能;进一步增加模块数会导致性能下降,表明仅需少量模块即可实现有效交叉注意力。
- 仅使用 5 个 Xing 模块的生成器在多数指标上优于使用 13 个模块的 ResNet 和 PATN 生成器,证实其样本效率与表征能力更强。
- 可视化结果表明,协同注意力图能学习到输入与生成特征之间互补且有意义的注意力模式,从而增强图像的真实感与一致性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。