[论文解读] Pose Guided Human Video Generation
本文提出了一种两阶段的姿态引导框架,用于解耦的人体视频生成,采用姿态序列生成对抗网络(PSGAN)根据动作标签预测逼真的姿态序列,随后通过语义一致性生成对抗网络(SCGAN)从预测的姿态生成照片级真实感视频帧,同时通过高层语义一致性约束生成与真实姿态之间的一致性,以应对噪声问题。该方法在人体动作和面部表情数据集上实现了视频真实感与运动控制的最先进性能。
Due to the emergence of Generative Adversarial Networks, video synthesis has witnessed exceptional breakthroughs. However, existing methods lack a proper representation to explicitly control the dynamics in videos. Human pose, on the other hand, can represent motion patterns intrinsically and interpretably, and impose the geometric constraints regardless of appearance. In this paper, we propose a pose guided method to synthesize human videos in a disentangled way: plausible motion prediction and coherent appearance generation. In the first stage, a Pose Sequence Generative Adversarial Network (PSGAN) learns in an adversarial manner to yield pose sequences conditioned on the class label. In the second stage, a Semantic Consistent Generative Adversarial Network (SCGAN) generates video frames from the poses while preserving coherent appearances in the input image. By enforcing semantic consistency between the generated and ground-truth poses at a high feature level, our SCGAN is robust to noisy or abnormal poses. Extensive experiments on both human action and human face datasets manifest the superiority of the proposed method over other state-of-the-arts.
研究动机与目标
- 为解决现有视频生成方法中缺乏显式运动控制的问题,尤其是人体运动方面。
- 将人体运动动力学与外观解耦,以提升可控性与真实感。
- 开发一种在噪声或异常姿态输入下仍保持稳定的视频生成框架。
- 实现对生成视频中人体姿态与外观的显式操控。
- 仅使用单张输入图像和姿态序列,实现高保真视频合成。
提出的方法
- 训练姿态序列生成对抗网络(PSGAN),以根据动作类别标签生成时间上一致的姿态序列。
- 语义一致性生成对抗网络(SCGAN)从预测的姿态序列和输入图像生成视频帧,损失函数在高层特征表示层面强制生成姿态与真实姿态之间的语义一致性。
- SCGAN使用特征级一致性损失以稳定训练,并提升在推理阶段对噪声或异常姿态的鲁棒性。
- 该框架将运动(姿态序列)与外观(图像)生成解耦,实现对姿态与身份的独立控制。
- 推理过程中仅使用生成的姿态序列,而语义一致性损失在训练阶段使用真实姿态应用。
- 该方法在人体动作与面部表情数据集上进行训练与评估,定量指标包括Inception Score、SSIM、LPIPS及用户研究。
实验结果
研究问题
- RQ1能否通过将姿态动力学与外观建模解耦的视频生成框架,实现更高的真实感与可控性?
- RQ2生成姿态与真实姿态之间的语义一致性在提升对噪声或异常姿态序列的鲁棒性方面有多有效?
- RQ3当输入姿态不完美时,该方法是否仍能生成高保真视频,并实现对姿态与外观的显式控制?
- RQ4在视觉质量与定量指标方面,该方法与最先进方法相比表现如何?
- RQ5该模型在保持时间连贯性的同时,对不同身份与动作类型的泛化能力如何?
主要发现
- 所提方法在Human Action数据集上达到8.92的Inception Score(IS),在Facial Expression数据集上达到9.15,优于先前方法。
- 采用语义一致性损失的SCGAN模型在Human Action数据集上达到0.87的结构相似性(SSIM)与0.041的LPIPS,优于SCGAN-gen基线(SSIM: 0.73, LPIPS: 0.083)。
- 在用户研究中,该方法在与MoCoGAN对比时被选为更真实的比例为72%,与VGAN对比时为78%。
- 受控生成实验表明,可在同一人身上成功合成不同动作,也可在不同身份间合成相同动作,证明了模型的解耦性与泛化能力。
- 消融研究证实,语义一致性损失显著提升了视频质量,尤其在面部与身体区域的细节上,有效缓解了姿态序列中的噪声。
- 该方法在所有指标上均优于静态基线(重复第一帧),证明其在简单帧重复之外实现了有效的运动生成。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。