[论文解读] Pose with Style: Detail-Preserving Pose-Guided Image Synthesis with Conditional StyleGAN
该论文提出了一种姿态引导的图像合成方法,通过利用对称性引导的对应场修复网络和条件StyleGAN2生成器中的空间可变调制,从单张源图像中保留精细细节。该方法通过结合3D感知特征迁移与基于风格的生成,在照片级真实感姿态迁移和虚拟试穿任务中取得了最先进性能,显著减少了伪影并提升了细节保留效果。
We present an algorithm for re-rendering a person from a single image under arbitrary poses. Existing methods often have difficulties in hallucinating occluded contents photo-realistically while preserving the identity and fine details in the source image. We first learn to inpaint the correspondence field between the body surface texture and the source image with a human body symmetry prior. The inpainted correspondence field allows us to transfer/warp local features extracted from the source to the target view even under large pose changes. Directly mapping the warped local features to an RGB image using a simple CNN decoder often leads to visible artifacts. Thus, we extend the StyleGAN generator so that it takes pose as input (for controlling poses) and introduces a spatially varying modulation for the latent space using the warped local features (for controlling appearances). We show that our method compares favorably against the state-of-the-art algorithms in both quantitative evaluation and visual comparison.
研究动机与目标
- 为解决在任意姿态下从单张图像中保留细粒度身份与纹理细节的挑战。
- 克服现有方法在幻觉化遮挡区域时表现不佳或无法保持衣物图案与面部特征的局限性。
- 开发一种可控的、逼真的图像合成框架,结合3D感知特征迁移与基于风格的生成。
- 通过将衣物从源图像转移到新姿态的同时保留外观细节,实现高保真虚拟试穿。
- 通过在姿态条件StyleGAN中引入空间可变调制,减少生成图像中的伪影。
提出的方法
- 通过对称性引导的修复网络完成3D人体表面与源图像之间的对应场补全,实现在大姿态变化下仍能稳健地进行特征迁移。
- 利用修复后的对应场将源图像中的局部外观特征映射到目标姿态,从而保留空间细节。
- 在姿态条件StyleGAN2生成器中引入空间可变调制,使映射后的特征在多个层级调制潜在空间,以控制外观。
- 生成器同时以目标姿态和映射后的局部特征为条件,实现对姿态与身份的解耦控制。
- 使用UV空间分割图将来自多张源图像的特征进行融合,实现部分外观的迁移。
- 通过预计算的映射表将UV空间分割图转换至2D目标姿态,实现多源特征融合,用于服装合成。
实验结果
研究问题
- RQ1对称性先验是否能有效补全2D源图像与3D人体表面之间的对应场,从而在大姿态变化下实现精确的特征迁移?
- RQ2与全局调制相比,StyleGAN2生成器中的空间可变调制是否能更好地保留源图像中的细粒度纹理细节?
- RQ3在姿态迁移过程中,该方法与最先进方法相比,在保留身份与衣物图案方面表现如何?
- RQ4该方法在不同体型与复杂服装(如长裙和长发)上的泛化能力如何?
- RQ5该框架能否通过融合多张源图像的特征实现虚拟试穿?
主要发现
- 所提方法在定量指标上表现优异,PSNR达到18.9657,SSIM为0.7919,FID为8.1434,LPIPS为0.124,优于基线方法。
- 与非对称性基线相比,使用对称性进行对应场修复可使PSNR提升0.0847,FID降低0.3806。
- 直接从源图像提取特征比使用不完整或完整的UV图能更好地保留细节,基于图像的源输入LPIPS仅为0.143。
- 空间调制显著提升图像质量,当以源图像为输入时,LPIPS从0.151降低至0.139。
- 与先前工作相比,该方法在手部和松散衣物区域的伪影更少,但长发和深肤色个体仍存在挑战,主要受数据集偏差影响。
- 模型继承了DeepFashion数据集中的偏见,在代表性不足群体(如深肤色个体和卷发人群)上表现更差。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。