[论文解读] MUST-GAN: Multi-level Statistics Transfer for Self-driven Person Image Generation
本文提出MUST-GAN,一种自驱动的人像图像生成模型,无需成对训练数据即可解耦并迁移源图像的多层次外观统计特征。通过利用注意力机制和姿态引导生成,实现灵活的姿态与服装风格迁移,在DeepFashion数据集上达到最先进性能,并在真实场景中展现出鲁棒性结果。
Pose-guided person image generation usually involves using paired source-target images to supervise the training, which significantly increases the data preparation effort and limits the application of the models. To deal with this problem, we propose a novel multi-level statistics transfer model, which disentangles and transfers multi-level appearance features from person images and merges them with pose features to reconstruct the source person images themselves. So that the source images can be used as supervision for self-driven person image generation. Specifically, our model extracts multi-level features from the appearance encoder and learns the optimal appearance representation through attention mechanism and attributes statistics. Then we transfer them to a pose-guided generator for re-fusion of appearance and pose. Our approach allows for flexible manipulation of person appearance and pose properties to perform pose transfer and clothes style transfer tasks. Experimental results on the DeepFashion dataset demonstrate our method's superiority compared with state-of-the-art supervised and unsupervised methods. In addition, our approach also performs well in the wild.
研究动机与目标
- 为解决监督式人像图像生成中依赖成对源-目标图像所带来的高昂数据标注成本问题。
- 通过将源图像作为重建监督信号,实现无需成对数据的自驱动训练。
- 解耦并迁移多层次外观特征(色彩、纹理、风格),同时保持身份与姿态的一致性。
- 支持对外观与姿态属性的灵活、可控操作,适用于姿态迁移与服装风格迁移等任务。
- 评估模型在真实世界(野生)场景下的泛化能力,超越受控数据集的限制。
提出的方法
- 使用带有语义分割的外观编码器,从人像图像中提取多层次特征。
- 采用通道注意力机制,对多层次特征图中的重要通道进行加权。
- 通过全连接网络实现统计匹配,将外观统计特征传递至生成器。
- 引入多层级统计匹配网络,结合AdaIN与可学习跳跃连接,实现姿态引导的图像合成。
- 使用姿态编码器处理姿态图像与姿态连接图,提供空间引导信息。
- 仅使用源图像进行端到端训练,无需成对数据监督。
实验结果
研究问题
- RQ1是否可以在不使用成对源-目标图像的情况下训练人像图像生成模型,同时保持高图像质量?
- RQ2多层次外观统计特征的解耦与迁移在多大程度上能实现逼真的图像合成?
- RQ3该模型在多大程度上能够实现对姿态与外观属性的独立操控?
- RQ4模型在真实世界、非受限(野生)图像上的泛化能力如何?
- RQ5该模型是否能在姿态迁移与服装风格迁移任务中均达到最先进性能?
主要发现
- 在DeepFashion数据集上,所提方法取得3.692的Inception Score、0.742的SSIM、15.902的FID与0.2412的LPIPS,优于现有监督方法。
- 消融实验表明,若移除MUST模块,FID上升至21.928,LPIPS升至0.2840,证实其关键作用。
- 通道注意力机制使SSIM提升0.011,FID降低1.621,证明其在特征加权中的有效性。
- 与无PCM的完整模型相比,姿态连接图(PCM)使FID降低0.965,LPIPS降低0.0102。
- 模型成功实现姿态与服装风格的同步迁移,在保持身份一致的同时准确迁移姿态与服饰风格。
- 在真实场景评估中,即使面对背景复杂的网络图像,模型仍能保持逼真的色彩与纹理保真度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。