Skip to main content
QUICK REVIEW

[论文解读] Generative Models for Pose Transfer

Patrick Chao, Alexander Li|arXiv (Cornell University)|Jun 24, 2018
Human Pose and Action Recognition参考文献 2被引用 3
一句话总结

本文提出了一种基于k-最近邻(k-NN)和条件生成模型(pix2pix)的姿态迁移流程,用于在视频中将一个人的动作迁移到另一个人身上。pix2pix模型在生成清晰、平滑且无伪影的视频方面优于k-NN,展现出超越训练姿态分布的泛化能力。

ABSTRACT

We investigate nearest neighbor and generative models for transferring pose between persons. We take in a video of one person performing a sequence of actions and attempt to generate a video of another person performing the same actions. Our generative model (pix2pix) outperforms k-NN at both generating corresponding frames and generalizing outside the demonstrated action set. Our most salient contribution is determining a pipeline (pose detection, face detection, k-NN based pairing) that is effective at perform-ing the desired task. We also detail several iterative improvements and failure modes.

研究动机与目标

  • 开发一种稳健的流程,用于将一个人的姿态序列以视频形式迁移到另一个人身上。
  • 评估k-NN与条件生成对抗网络(pix2pix)在生成高质量、时间上一致的视频帧方面的有效性。
  • 识别并缓解诸如噪声姿态估计和对特定身体轮廓过拟合等失败模式。
  • 探索提升泛化能力的方法,特别是针对训练数据中未出现过的姿态。
  • 降低计算延迟,实现实时或近实时的姿态迁移。

提出的方法

  • 使用OpenPose从输入视频帧中提取18个关节点的2D姿态骨架,对被遮挡的关节点采用中位数插补。
  • 在关节点坐标空间中使用L2距离对源个体与目标个体之间的姿态进行k-NN匹配。
  • 采用条件生成对抗网络(pix2pix)直接将姿态骨架映射为逼真的图像帧,避免使用中间表示。
  • 最初引入边缘检测作为监督信号,但因出现过拟合并降低泛化能力而被移除。
  • 使用dlib人脸检测器补充姿态骨架以获取面部轮廓,从而提升面部生成质量。
  • 通过逐帧生成探索时间一致性,未来可考虑使用卡尔曼滤波器或压缩模型。

实验结果

研究问题

  • RQ1基于k-NN的姿态匹配能否有效实现不同体型和着装者之间的动作迁移?
  • RQ2与k-NN相比,条件生成对抗网络(pix2pix)在生成逼真、清晰且无伪影的视频帧方面表现如何?
  • RQ3生成模型在多大程度上能泛化到训练数据中未见的姿态?
  • RQ4噪声姿态估计在多大程度上影响k-NN与基于GAN的姿态迁移性能?
  • RQ5与位置空间相比,使用关节点角度空间是否能提升k-NN在不同身高个体间的匹配鲁棒性?

主要发现

  • pix2pix条件生成对抗网络在生成清晰、平滑且逼真的视频帧方面优于k-NN,且伪影极少。
  • pix2pix模型成功泛化到训练数据中未出现过的姿态,例如将双臂举过头顶的动作。
  • k-NN性能严重受噪声姿态骨架影响,导致帧间跳变明显且帧匹配质量差。
  • 边缘检测虽旨在提升监督效果,但导致过拟合并最终被排除在最终流程之外。
  • 与关节点位置空间相比,使用关节点角度空间可提升k-NN在不同身体特征个体间的鲁棒性。
  • 当前流程每帧生成耗时约1秒,远低于实时(60 FPS),表明仍需进一步优化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。