Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Pose Flow Learning for Pose Guided Synthesis

Haitian Zheng, Lele Chen|arXiv (Cornell University)|Sep 30, 2019
Generative Adversarial Networks and Image Synthesis参考文献 45被引用 11
一句话总结

本文提出了一种无监督姿态流学习框架,用于姿态引导的图像合成,该框架在无需依赖3D人体模型或真实流数据的情况下,能够学习在复杂非刚性人体姿态形变之间传递外观细节。通过引入纹理保持目标和基于增强的自监督机制,该方法端到端训练流估计器,结合多尺度特征对齐和门控乘法注意力模块,通过GarmentNet和SynthesisNet实现粗到细的图像合成,实现在DeepFashion、MVC和真实世界视频数据集上的最先进性能,对未见姿态和服装风格具有强大的泛化能力。

ABSTRACT

Pose guided synthesis aims to generate a new image in an arbitrary target pose while preserving the appearance details from the source image. Existing approaches rely on either hard-coded spatial transformations or 3D body modeling. They often overlook complex non-rigid pose deformation or unmatched occluded regions, thus fail to effectively preserve appearance information. In this paper, we propose an unsupervised pose flow learning scheme that learns to transfer the appearance details from the source image. Based on such learned pose flow, we proposed GarmentNet and SynthesisNet, both of which use multi-scale feature-domain alignment for coarse-to-fine synthesis. Experiments on the DeepFashion, MVC dataset and additional real-world datasets demonstrate that our approach compares favorably with the state-of-the-art methods and generalizes to unseen poses and clothing styles.

研究动机与目标

  • 为解决现有方法在姿态引导图像合成中难以有效处理复杂非刚性姿态形变和遮挡区域的挑战。
  • 通过提出一种无监督训练方案,消除对昂贵3D人体建模或合成真实流数据的依赖,实现姿态流估计。
  • 通过引入新颖的纹理保持目标和基于增强的自监督机制,提升图像合成过程中的外观保持能力。
  • 通过学习到的姿态流和一种新颖的注意力机制,实现更优对齐与鲁棒性的粗到细图像合成。
  • 通过掩码层保留背景和身份信息,并采用DensePose解析而非基于关键点的姿态表示,提升图像真实感。

提出的方法

  • 采用两阶段框架:第一阶段使用无监督目标训练流估计器,该目标保留纹理细节,并利用数据增强实现自监督。
  • 提出一种新颖的纹理保持目标,以提升所学习姿态流的质量,这对外观传递至关重要。
  • 第二阶段采用GarmentNet和SynthesisNet,基于学习到的流进行多尺度特征域变形,实现粗到细的图像合成。
  • 提出一种门控乘法注意力模块,通过基于源图像和目标图像特征学习到的注意力机制,显式处理特征错位问题。
  • 在两个网络中集成掩码层,以保留目标图像的背景和身份信息,提升合成结果的真实感。
  • 采用DensePose解析作为姿态输入,相比基于关键点的表示,提供更丰富的几何与语义信息。

实验结果

研究问题

  • RQ1无监督姿态流学习方案是否能在无需3D建模或真实流数据的情况下,有效实现复杂非刚性人体姿态形变之间的外观细节传递?
  • RQ2纹理保持目标是否能提升所学习姿态流的质量,从而改善图像合成中的外观传递效果?
  • RQ3结合多尺度特征对齐与基于注意力的错位校正的粗到细合成流程,是否能在未见姿态和服装风格上超越现有方法?
  • RQ4所提出方法在具有挑战性姿态变化与遮挡的真实世界视频及非约束场景中,泛化能力如何?
  • RQ5与基于关键点的姿态表示相比,使用DensePose解析是否能带来更准确、更细致的合成结果?

主要发现

  • 所提方法在DeepFashion数据集上达到最先进性能,Fréchet Inception Distance (FID) 为 3.603 ± 0.300,感知相似度得分为 0.853。
  • 在MVC数据集上,方法实现FID为 3.451 ± 0.426,感知相似度为 0.857,优于先前方法(包括DSCF和Vunet)。
  • 在MVC数据集上进行微调后,性能进一步提升,FID达到 3.365 ± 0.273,感知相似度为 0.859。
  • 该方法在真实世界视频中泛化良好,能够生成时间上一致、保真度高的纹理细节帧,如Amazon Fashion视频数据所示。
  • 在真实世界视频测试中,该方法成功实现不同姿态和服装风格之间的衣物转移,同时保持视觉合理性与身份一致性。
  • 消融实验验证了纹理保持目标和基于增强的自监督机制在提升流质量与合成保真度方面的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。