[论文解读] Pose-Guided High-Resolution Appearance Transfer via Progressive Training
本文提出一种渐进式、姿态引导的深度编码器-解码器网络,用于在无3D模型的情况下实现高分辨率(1024²)外观迁移,通过局部感知损失和局部判别器来保留细节并重建遮挡区域。该方法在大姿态变化下的逼真人体图像合成任务中达到当前最优性能。
We propose a novel pose-guided appearance transfer network for transferring a given reference appearance to a target pose in unprecedented image resolution (1024 * 1024), given respectively an image of the reference and target person. No 3D model is used. Instead, our network utilizes dense local descriptors including local perceptual loss and local discriminators to refine details, which is trained progressively in a coarse-to-fine manner to produce the high-resolution output to faithfully preserve complex appearance of garment textures and geometry, while hallucinating seamlessly the transferred appearances including those with dis-occlusion. Our progressive encoder-decoder architecture can learn the reference appearance inherent in the input image at multiple scales. Extensive experimental results on the Human3.6M dataset, the DeepFashion dataset, and our dataset collected from YouTube show that our model produces high-quality images, which can be further utilized in useful applications such as garment transfer between people and pose-guided human video generation.
研究动机与目标
- 实现从参考图像到目标姿态的高分辨率(1024²)姿态引导外观迁移,且无需使用3D模型。
- 在大姿态变化和自遮挡条件下,保留复杂的衣物纹理和面部特征。
- 在外观迁移过程中,真实地重建先前被遮挡的身体部位。
- 通过新颖的损失设计,提升生成图像的局部细节保真度与整体一致性。
- 在虚拟试穿和高分辨率人体视频生成等下游应用中,展示方法的泛化能力与实用性。
提出的方法
- 采用渐进式编码器-解码器架构,以粗到精的方式训练,生成1024²分辨率输出。
- 在网络自编码器的瓶颈层注入目标姿态表征(18个关键点热力图),实现姿态引导。
- 在44个局部区域应用局部感知损失,以增强细粒度细节的保留。
- 在最高分辨率(1024²)引入局部判别器,以在局部图像块中强制生成逼真的纹理。
- 在真实图像与生成图像之间施加全局感知损失,以保证整体图像质量。
- 在解码器中使用跳跃连接,以保留跨尺度的空间信息。
实验结果
研究问题
- RQ1基于2D的深度网络是否能在无3D监督的情况下实现高分辨率(1024²)姿态引导外观迁移?
- RQ2局部感知损失与局部判别器在保留细节和重建遮挡区域方面的有效性如何?
- RQ3渐进式训练是否能提升外观迁移中生成图像的质量与分辨率?
- RQ4该方法在具有复杂纹理与姿态变化的多样化数据集上是否具备泛化能力?
- RQ5该方法在虚拟试穿与高分辨率视频生成等下游任务中的适用程度如何?
主要发现
- 在DeepFashion数据集上,该方法取得SSIM 0.806、MS-SSIM 0.814和LPIPS 0.198的指标,优于先前的SOTA方法。
- 在YouTube数据集上,模型成功保留了大姿态变化与自遮挡条件下的复杂衣物纹理与面部特征。
- 消融实验表明,局部描述符与渐进式训练均显著提升生成质量,二者结合效果最佳。
- 模型生成了1024²分辨率的逼真图像,放大视图显示了对细小细节的忠实重建与对非遮挡区域的自然重建。
- 该方法通过先解遮挡目标图像,再利用外观流迁移衣物外观,实现了高质量的虚拟试穿。
- 在姿态引导的人体视频生成中,模型生成了1024²分辨率的帧,保留了面部特征与衣物细节,在分辨率与细节保真度上优于先前方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。