Skip to main content
QUICK REVIEW

[论文解读] Progressive Pose Attention Transfer for Person Image Generation

Zhen Zhu, Tengteng Huang|arXiv (Cornell University)|Apr 6, 2019
Generative Adversarial Networks and Image Synthesis参考文献 46被引用 42
一句话总结

提出一个渐进的 Pose-Attentional Transfer Network (PATN),包含级联的 PATB,用于姿态转移,获得更好的外观/形状一致性并使 re-ID 数据增广成为可能。

ABSTRACT

This paper proposes a new generative adversarial network for pose transfer, i.e., transferring the pose of a given person to a target pose. The generator of the network comprises a sequence of Pose-Attentional Transfer Blocks that each transfers certain regions it attends to, generating the person image progressively. Compared with those in previous works, our generated person images possess better appearance consistency and shape consistency with the input images, thus significantly more realistic-looking. The efficacy and efficiency of the proposed network are validated both qualitatively and quantitatively on Market-1501 and DeepFashion. Furthermore, the proposed architecture can generate training images for person re-identification, alleviating data insufficiency. Codes and models are available at: https://github.com/tengteng95/Pose-Transfer.git.

研究动机与目标

  • 推动在多姿态与多视角下对非刚性人体图像的鲁棒姿态转移。
  • 开发一个级联、基于注意力的生成器,逐步完成姿态迁移同时保留外观。
  • 在形状和外观的一致性方面优于先前的姿态转移方法。
  • 在 Market-1501 和 DeepFashion 数据集上进行评估,以展示质量和效率。
  • 展示生成图像在扩充人脸识别(re-identification)数据集方面的潜力。

提出的方法

  • 编码器将条件图像和堆叠的条件/目标姿态图转换为潜在编码。
  • 一系列 Pose-Attentional Transfer Blocks (PATBs) 的级联,使用姿态注意掩模逐步更新图像编码和姿态编码。
  • 姿态注意掩模 M_t 指导从条件中采样的位置以及如何为目标姿态放置补丁 (M_t = sigmoid(conv_S(F_{t-1}^S))).
  • 图像编码更新:F_t^P = M_t ⊙ conv_P(F_{t-1}^P) + F_{t-1}^P(残余)。
  • 姿态编码更新:F_t^S = conv_S(F_{t-1}^S) | F_t^P(拼接)。
  • 解码器从最终图像编码 F_T^P 生成最终图像;姿态编码 F_T^S 将被丢弃。
  • 两个判别器(外观 D_A 和形状 D_S)评估外观的一致性和姿态对齐,最终分数 R = R^A R^S。

实验结果

研究问题

  • RQ1通过姿态注意块的渐进姿态转移是否能产生比单步方法更真实且几何一致的人体图像?
  • RQ2PATN 是否在保持计算效率的同时改善外观和形状的一致性?
  • RQ3生成的图像是否能有效扩充用于人重识别(re-ID)任务的数据集?
  • RQ4与先前的姿态转移方法在标准基准(Market-1501、DeepFashion)上的多项指标比较如何?

主要发现

  • 我们的方法在 Market-1501 和 DeepFashion 的形状一致性(PCKh)方面达到最高或具有竞争力,且在外观指标上表现强劲。
  • 在 Market-1501 上,我们的方法记录 SSIM 0.311, IS 3.323, DS 0.74, PCKh 0.94;在 DeepFashion 上,SSIM 0.976, IS 0.96, DS 0.96, PCKh 0.96(表格文字的近似值)。
  • 我们的方法在掩模-SSIM 和掩模-IS 上优于若干前作,表明结构和纹理保真度提升。
  • 模型规模与速度较优:DeepFashion 上参数量 41.36M,速度 60.61 fps,优于若干基线,在效率和质量上均具竞争力。
  • 用户研究显示更高的真实感,在所报告的设置中,G2R 百分比(生成的被评为真实)为 Market-1501 的 63.47% 和 DeepFashion 的 31.78%。
  • 消融研究证实,移除 PATB 组件或判别器增强会降低性能,验证了设计选择的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。